20

RAGAS 평가 실전: 제조 RAG 벤치마크 설계

Day 3: RAGAS 평가

학습 목표

제조 도메인에 적합한 RAG 평가 데이터셋을 설계할 수 있다 RAGAS 메트릭 해석 기준을 실무에 맞게 설정한다 지속적 평가 파이프라인을 구성하는 방법을 안다

제조 RAG 벤치마크 설계

평가 데이터셋 구성

[권장 구성]
총 질문: 50개 이상

유형별 분포:
  일반 조회 (30%): 설비 스펙, 부품 정보
  고장 진단 (30%): 에러 코드, 증상 → 원인
  안전 규정 (20%): KOSHA, 보호구, 작업 허가
  절차/SOP (20%): 교체, 점검, 캘리브레이션

난이도 분포:
  쉬움: 30% (단일 문서, 명확한 답)
  보통: 50% (복수 문서 참조 필요)
  어려움: 20% (추론/종합 필요)

제조 특화 임계값

[배포 가능 기준 — 제조 현장]

Faithfulness    >= 0.88  (안전 답변의 정확성)
Answer Relevancy >= 0.85  (질문 적합성)
Context Precision >= 0.82  (불필요한 문서 배제)
Context Recall  >= 0.80  (필요 정보 검색률)

[안전 관련 질문만 별도 기준]
Safety Faithfulness >= 0.95  (오차 허용 불가)

CI/CD 평가 파이프라인

# GitHub Actions 또는 Jenkins에서 실행
def regression_check(current_scores, baseline_scores):
    """
    현재 점수가 기준보다 떨어지면 배포 차단
    """
    tolerance = 0.02  # 2% 허용 범위

    for metric, score in current_scores.items():
        baseline = baseline_scores[metric]
        if score < baseline - tolerance:
            raise Exception(
                f"회귀 감지! {metric}: "
                f"{score:.3f} < {baseline:.3f} - {tolerance}"
            )

    print("모든 메트릭 기준 통과 → 배포 승인")

평가 결과 대시보드

[일일 평가 리포트 형식]

날짜: 2025-06-15
문서 버전: v2.3.1 (CNC-M500 매뉴얼 업데이트)

| 메트릭 | 오늘 | 전날 | 기준 | 상태 |
|--------|------|------|------|------|
| Faithfulness | 0.91 | 0.89 | >=0.88 | ✅ |
| Answer Relevancy | 0.87 | 0.86 | >=0.85 | ✅ |
| Context Precision | 0.84 | 0.85 | >=0.82 | ✅ |
| Context Recall | 0.79 | 0.80 | >=0.80 | ⚠️ |

주의: Context Recall이 기준 미달 (0.79 < 0.80)
원인 분석 필요: 새 문서 임베딩 품질 확인

핵심: 평가는 배포 시에만 하는 것이 아니라, 문서 업데이트마다 자동 실행되어야 한다.

AI로 학습하기 — 꿀팁
🤖제조 RAG 벤치마크 데이터셋 설계AI 학습 팁

제조 도메인에 맞는 RAGAS 평가 데이터셋(질문·정답·컨텍스트)을 AI가 생성 초안을 만들어 주면 평가 셋업 시간을 크게 줄일 수 있습니다.

제조 설비 유지보수 RAG를 RAGAS로 평가하기 위한 골든 데이터셋 설계를 도와줘. (1) 질문 유형 5가지(고장 진단/PM 절차/부품 사양/안전 규정/약어 정의) 각 4개씩 20개 질문 예시 생성, (2) 각 질문에 필요한 골든 컨텍스트 특성 기술(어떤 섹션, 몇 문장), (3) 합격 기준 설정 — 제조 안전 관련 Faithfulness는 0.95 이상, 일반 정보는 0.85 이상처럼 유형별 기준 제안, (4) 자동 생성(LLM으로 Q&A 생성) vs 전문가 수동 작성 비율 추천. 결과물은 RAGAS Dataset 형식(question/answer/contexts/ground_truths)으로 Python dict 예시로 보여줘.
이 팁이 도움이 됐나요?
실습 — 직접 해보기
🧪멀티모달 검색 (Fusion)
MRR·top1 지표가 모달리티 조합·파인튜닝에 따라 어떻게 변하는지 실험해보세요
핵심 포인트
  • 제조 RAG 평가는 유형별(고장진단/안전/절차) 50개 이상 질문으로 구성한다
  • 안전 관련 Faithfulness 임계값은 일반 메트릭보다 엄격하게 0.95 이상으로 설정
  • 문서 업데이트 시마다 자동 회귀 평가로 품질 저하를 즉시 감지한다