20분
RAGAS 평가 실전: 제조 RAG 벤치마크 설계
Day 3: RAGAS 평가
RAGAS 평가 실전: 제조 RAG 벤치마크 설계
RAG 심화 > Day 3: RAGAS 평가
학습 목표
제조 도메인에 적합한 RAG 평가 데이터셋을 설계할 수 있다 RAGAS 메트릭 해석 기준을 실무에 맞게 설정한다 지속적 평가 파이프라인을 구성하는 방법을 안다
제조 RAG 벤치마크 설계
평가 데이터셋 구성
[권장 구성]
총 질문: 50개 이상
유형별 분포:
일반 조회 (30%): 설비 스펙, 부품 정보
고장 진단 (30%): 에러 코드, 증상 → 원인
안전 규정 (20%): KOSHA, 보호구, 작업 허가
절차/SOP (20%): 교체, 점검, 캘리브레이션
난이도 분포:
쉬움: 30% (단일 문서, 명확한 답)
보통: 50% (복수 문서 참조 필요)
어려움: 20% (추론/종합 필요)
제조 특화 임계값
[배포 가능 기준 — 제조 현장]
Faithfulness >= 0.88 (안전 답변의 정확성)
Answer Relevancy >= 0.85 (질문 적합성)
Context Precision >= 0.82 (불필요한 문서 배제)
Context Recall >= 0.80 (필요 정보 검색률)
[안전 관련 질문만 별도 기준]
Safety Faithfulness >= 0.95 (오차 허용 불가)
CI/CD 평가 파이프라인
# GitHub Actions 또는 Jenkins에서 실행
def regression_check(current_scores, baseline_scores):
"""
현재 점수가 기준보다 떨어지면 배포 차단
"""
tolerance = 0.02 # 2% 허용 범위
for metric, score in current_scores.items():
baseline = baseline_scores[metric]
if score < baseline - tolerance:
raise Exception(
f"회귀 감지! {metric}: "
f"{score:.3f} < {baseline:.3f} - {tolerance}"
)
print("모든 메트릭 기준 통과 → 배포 승인")
평가 결과 대시보드
[일일 평가 리포트 형식]
날짜: 2025-06-15
문서 버전: v2.3.1 (CNC-M500 매뉴얼 업데이트)
| 메트릭 | 오늘 | 전날 | 기준 | 상태 |
|--------|------|------|------|------|
| Faithfulness | 0.91 | 0.89 | >=0.88 | ✅ |
| Answer Relevancy | 0.87 | 0.86 | >=0.85 | ✅ |
| Context Precision | 0.84 | 0.85 | >=0.82 | ✅ |
| Context Recall | 0.79 | 0.80 | >=0.80 | ⚠️ |
주의: Context Recall이 기준 미달 (0.79 < 0.80)
원인 분석 필요: 새 문서 임베딩 품질 확인
핵심: 평가는 배포 시에만 하는 것이 아니라, 문서 업데이트마다 자동 실행되어야 한다.
AI로 학습하기 — 꿀팁
🤖제조 RAG 벤치마크 데이터셋 설계AI 학습 팁
제조 도메인에 맞는 RAGAS 평가 데이터셋(질문·정답·컨텍스트)을 AI가 생성 초안을 만들어 주면 평가 셋업 시간을 크게 줄일 수 있습니다.
제조 설비 유지보수 RAG를 RAGAS로 평가하기 위한 골든 데이터셋 설계를 도와줘. (1) 질문 유형 5가지(고장 진단/PM 절차/부품 사양/안전 규정/약어 정의) 각 4개씩 20개 질문 예시 생성, (2) 각 질문에 필요한 골든 컨텍스트 특성 기술(어떤 섹션, 몇 문장), (3) 합격 기준 설정 — 제조 안전 관련 Faithfulness는 0.95 이상, 일반 정보는 0.85 이상처럼 유형별 기준 제안, (4) 자동 생성(LLM으로 Q&A 생성) vs 전문가 수동 작성 비율 추천. 결과물은 RAGAS Dataset 형식(question/answer/contexts/ground_truths)으로 Python dict 예시로 보여줘.
이 팁이 도움이 됐나요?
실습 — 직접 해보기
🧪멀티모달 검색 (Fusion)
MRR·top1 지표가 모달리티 조합·파인튜닝에 따라 어떻게 변하는지 실험해보세요
핵심 포인트
- • 제조 RAG 평가는 유형별(고장진단/안전/절차) 50개 이상 질문으로 구성한다
- • 안전 관련 Faithfulness 임계값은 일반 메트릭보다 엄격하게 0.95 이상으로 설정
- • 문서 업데이트 시마다 자동 회귀 평가로 품질 저하를 즉시 감지한다