50분
실습: 자동 평가 파이프라인 구축
평가 & 배포
실습: 자동 평가 파이프라인 구축
QLoRA 파인튜닝 > 평가 & 배포
학습 목표
BLEU/ROUGE 자동 평가 코드를 작성한다 제조 특화 평가 메트릭(안전 키워드, 수치 정확성)을 구현한다 평가 결과를 종합 리포트로 정리한다
자동 평가 파이프라인
구현 항목
- BLEU Score 계산
- ROUGE Score 계산
- 키워드 매칭 (안전, 기술 용어)
- 수치 정확성 검증
- 종합 리포트 생성
에디터 로딩 중...
힌트 보기
- • BLEU: n-gram precision의 기하평균 + Brevity Penalty
- • ROUGE-L: 최장 공통 부분열(LCS) 기반 F1
- • 안전 키워드: 대소문자 무시 비교 (lower)
- • 종합 점수: 안전성(0.25) > 구체성(0.30) > 나머지
정답 보기
에디터 로딩 중...
AI로 학습하기 — 꿀팁
🤖제조 특화 평가 메트릭 코드 생성AI 학습 팁
AI에게 제조 도메인 키워드 목록(안전·수치·공정용어)을 주면 BLEU/ROUGE에 도메인 메트릭을 추가한 자동 평가 코드를 완성해줍니다.
제조 Q&A 파인튜닝 모델 평가를 위한 Python 코드를 작성해줘. BLEU-4·ROUGE-L 기본 메트릭에 추가로 '안전 키워드 포함 여부(PPE·잠금장치·접지 등)', '수치 정확성(±10% 허용)', '공정 용어 일치율' 커스텀 메트릭을 구현하고, 100개 테스트셋 배치 평가 후 CSV 리포트를 출력해줘.
이 팁이 도움이 됐나요?