25분
RAGAS 평가, 이렇게 하면 망한다
Day 3: RAGAS 평가
RAGAS 평가, 이렇게 하면 망한다
RAG 심화 > Day 3: RAGAS 평가
학습 목표
RAG 평가 시 자주 발생하는 실수를 파악한다 각 실수에 대한 해결책을 설명할 수 있다
RAGAS 평가, 이렇게 하면 망한다
실수 1: 평가 데이터가 너무 적다
"5개 질문으로 테스트했는데 Faithfulness 0.95 나왔어요!"
5개? 그 중 하나만 달라져도 점수가 0.76으로 떨어진다.
통계적으로 의미없는 숫자다.
해결:
- 최소 30개 이상의 평가 질문
- 다양한 유형 포함 (일반, 안전, 규격, 고장 진단)
- 난이도 분포 (쉬움 30%, 보통 50%, 어려움 20%)
실수 2: 평가 기준이 모호하다
"Faithfulness가 0.72인데... 이게 괜찮은 건가 나쁜 건가?"
기준이 없으면 숫자가 의미 없다.
해결: 메트릭별 임계값 사전 정의
[배포 가능 기준]
Faithfulness >= 0.85
Answer Relevancy >= 0.85
Context Precision >= 0.80
Safety Compliance >= 0.95
[경고 기준]
0.70 <= Faithfulness < 0.85 -> 개선 필요
Faithfulness < 0.70 -> 배포 금지
실수 3: Ground Truth의 품질이 낮다
Ground Truth: "베어링을 교체한다"
-> 너무 짧고 모호해서 Context Recall 측정이 부정확
좋은 Ground Truth: "CNC-M500 주축 베어링(7210C, C3 등급)은
5,000시간마다 교체하며, 교체 시 ISO VG 68 윤활유를
사용하고, 사전 예열 30분이 필요하다."
-> 구체적인 수치와 절차 포함
해결:
- Ground Truth는 도메인 전문가가 작성
- 구체적인 수치, 규격, 절차 포함
- 안전 관련 주의사항 반드시 포함
- 정기적으로 업데이트 (매뉴얼 개정 시)
실수 4: 낮은 점수의 원인을 분석하지 않는다
"Faithfulness가 0.72네. 프롬프트 좀 바꿔보자."
왜 낮은지 분석 안 하고 감으로 수정? 효과 없다.
해결: 낮은 점수 샘플 상세 분석
# 낮은 Faithfulness 샘플 추출
low_faith = df[df['faithfulness'] < 0.80]
for _, row in low_faith.iterrows():
print(f"질문: {row['question']}")
print(f"답변: {row['answer']}")
print(f"컨텍스트: {row['contexts']}")
print(f"Faithfulness: {row['faithfulness']}")
print("---")
# 패턴 분석
# - 컨텍스트에 없는 정보를 추가하는 경향?
# - 특정 유형의 질문에서만 낮은가?
# - 숫자/규격에서 오류가 많은가?
실수 5: 학습/평가 데이터 오염
# 잘못된 접근
# RAG의 벡터 DB에 들어간 문서로 평가 질문을 만들면?
# -> 당연히 검색 품질이 높게 나온다!
해결:
- 평가 질문은 별도로 관리
- 이상적으로는 RAG 개발자와 평가 데이터 작성자를 분리
- 정기 평가 시 새로운 질문을 추가
평가 주기 가이드
| 시점 | 평가 범위 | 목적 |
|---|---|---|
| 개발 중 | 매 변경 시 | 회귀 방지 |
| 배포 전 | 전체 데이터셋 | Go/No-Go 판단 |
| 운영 중 | 주 1회 | 품질 모니터링 |
| 문서 업데이트 | 관련 질문 | 영향도 확인 |
체크리스트
- 평가 질문 30개 이상, 다양한 유형
- 메트릭별 임계값 사전 정의
- Ground Truth에 구체적 수치/절차 포함
- 낮은 점수 샘플 상세 분석 프로세스
- 학습/평가 데이터 분리
AI로 학습하기 — 꿀팁
✅RAGAS 평가 실수 점검AI 학습 팁
RAGAS 평가셋 오염, 메트릭 해석 오류, LLM 평가자 편향 등 흔한 실수가 없는지 검증해 보세요.
RAGAS 평가 과정의 흔한 실수에 대한 아래 주장이 맞는지 검증해줘. (1) 'RAGAS 평가에 GPT-4를 판단자로 사용하면 제조 도메인 특화 용어도 정확히 평가할 수 있다.' (2) 'Context Recall 0.9 이상이면 RAG 시스템이 충분히 좋다고 판단할 수 있다.' (3) '학습 데이터와 평가 데이터셋이 같은 문서 소스에서 나와도 무작위 분할이면 평가가 유효하다.' (4) 'RAGAS 메트릭은 언어에 무관하게 동일하게 적용되므로 한국어 제조 Q&A에도 별도 설정 없이 사용 가능하다.' 각 오류를 교정해줘.
이 팁이 도움이 됐나요?