11분
Phase 3: 모델 평가 & A/B 비교
제조 도메인 sLLM 구축
Phase 3: 모델 평가 & A/B 비교
QLoRA 파인튜닝 > 제조 도메인 sLLM 구축
학습 목표
- Day 4의 평가 코드로 학습된 모델을 평가한다
- 기본 모델 vs 파인튜닝 모델 A/B 비교를 수행한다
- 평가 리포트를 작성한다
Phase 3: 모델 평가
평가 순서
- 테스트 질문 10-20건 준비 (학습 미사용)
- 기본 모델 답변 수집
- 파인튜닝 모델 답변 수집
- 자동 평가 (BLEU, ROUGE, 안전성, 구체성)
- A/B 비교 결과 정리
- 종합 리포트 생성
점수를 읽을 때
BLEU와 ROUGE는 공백으로 자른 n-gram을 세므로 한국어에서는 조사와 어미 차이만으로 크게 떨어진다. 절차와 수치가 정답과 사실상 같은 답변에도 낮은 점수가 나올 수 있다. 두 모델을 같은 지표로 비교하는 데는 쓰되, 점수의 절대값으로 합격을 판정하지 않는다. 제조 답변에서 더 중요한 것은 안전 키워드 포함 여부와 수치 정확도다.
GPU가 없다면
"파인튜닝 모델" 자리에 시스템 프롬프트만 적용한 모델의 답변을 넣는다. 비교 자체는 그대로 성립하고, 보고서에 그 사실을 밝히면 된다.
에디터 로딩 중...
힌트 보기
- • 기본 모델 답변: 파인튜닝 전 체크포인트에서 추론
- • A/B 비교: 동일 질문에 대한 두 모델 답변을 나란히 비교
- • 안전 점수가 0.5 미만인 답변은 반드시 개선 필요
정답 보기
에디터 로딩 중...
AI로 학습하기 — 꿀팁
A/B 비교 결과 통계적 유의성 검증AI 학습 팁
AI에게 기본 모델과 파인튜닝 모델의 평가 점수를 주면 개선폭의 통계적 유의성과 제조 도메인 특화 여부를 검증해줍니다.
제조 Q&A 파인튜닝 모델 A/B 비교 결과야. 기본 모델: ROUGE-L 0.31, 안전키워드 포함률 45%. 파인튜닝 모델: ROUGE-L 0.48, 안전키워드 포함률 78%. 100개 테스트셋 기준으로 이 개선이 통계적으로 유의한지(bootstrap test), 어떤 카테고리에서 가장 크게 향상됐는지 분석해줘.
이 팁이 도움이 됐나요?