50

실습: 자동 평가 파이프라인 구축

평가 & 배포

학습 목표

BLEU/ROUGE 자동 평가 코드를 작성한다 제조 특화 평가 메트릭(안전 키워드, 수치 정확성)을 구현한다 평가 결과를 종합 리포트로 정리한다

자동 평가 파이프라인

구현 항목

  1. BLEU Score 계산
  2. ROUGE Score 계산
  3. 키워드 매칭 (안전, 기술 용어)
  4. 수치 정확성 검증
  5. 종합 리포트 생성
에디터 로딩 중...
힌트 보기
  • BLEU: n-gram precision의 기하평균 + Brevity Penalty
  • ROUGE-L: 최장 공통 부분열(LCS) 기반 F1
  • 안전 키워드: 대소문자 무시 비교 (lower)
  • 종합 점수: 안전성(0.25) > 구체성(0.30) > 나머지
정답 보기
에디터 로딩 중...
AI로 학습하기 — 꿀팁
🤖제조 특화 평가 메트릭 코드 생성AI 학습 팁

AI에게 제조 도메인 키워드 목록(안전·수치·공정용어)을 주면 BLEU/ROUGE에 도메인 메트릭을 추가한 자동 평가 코드를 완성해줍니다.

제조 Q&A 파인튜닝 모델 평가를 위한 Python 코드를 작성해줘. BLEU-4·ROUGE-L 기본 메트릭에 추가로 '안전 키워드 포함 여부(PPE·잠금장치·접지 등)', '수치 정확성(±10% 허용)', '공정 용어 일치율' 커스텀 메트릭을 구현하고, 100개 테스트셋 배치 평가 후 CSV 리포트를 출력해줘.
이 팁이 도움이 됐나요?