2

RAGAS 평가 실전: 제조 RAG 벤치마크 설계

Day 3: RAGAS 평가

학습 목표
  • 제조 도메인에 적합한 RAG 평가 데이터셋을 설계할 수 있다
  • RAGAS 메트릭 해석 기준을 실무에 맞게 설정한다
  • 순위 지표(MRR·top1)와 점수 격차(margin)가 서로 다른 것을 잰다는 것을 구분한다
  • 지속적 평가 파이프라인을 구성하는 방법을 안다

제조 RAG 벤치마크 설계

평가 데이터셋 구성

[권장 구성]
총 질문: 50개 이상 (최소 30개 - 그 아래는 한 문항이 전체를 흔든다)

유형별 분포:
  일반 조회 (30%): 설비 스펙, 부품 정보
  고장 진단 (30%): 에러 코드, 증상 → 원인
  안전 규정 (20%): KOSHA, 보호구, 작업 허가
  절차/SOP (20%): 교체, 점검, 캘리브레이션

난이도 분포:
  쉬움: 30% (단일 문서, 명확한 답)
  보통: 50% (복수 문서 참조 필요)
  어려움: 20% (추론/종합 필요)

제조 특화 임계값

[배포 가능 기준 — 제조 현장]

Faithfulness     >= 0.85  (답변이 문서에 충실한가)
Answer Relevancy >= 0.85  (질문 적합성)
Context Precision >= 0.80  (불필요한 문서 배제)
Context Recall   >= 0.75  (필요 정보 검색률)

[안전 관련 질문만 별도 기준]
Faithfulness >= 0.95  (오차 허용 불가)
Context Recall >= 0.85  (필요한 근거가 빠지면 그것이 사고다)

이 표는 이 주차 안에서 하나로 통일된 값이다. Day 3 의 메트릭 이론, Day 5 의 배포 게이트와 같은 숫자를 쓴다. 일반 질의는 0.85, 안전 질의는 0.95 다. 두 값이 다른 이유는 하나뿐이다 — 틀렸을 때 무엇을 잃는지가 다르다.


CI/CD 평가 파이프라인

# GitHub Actions 또는 Jenkins에서 실행
def regression_check(current_scores, baseline_scores):
    """
    현재 점수가 기준보다 떨어지면 배포 차단
    """
    tolerance = 0.02  # 2% 허용 범위

    for metric, score in current_scores.items():
        baseline = baseline_scores[metric]
        if score < baseline - tolerance:
            raise Exception(
                f"회귀 감지! {metric}: "
                f"{score:.3f} < {baseline:.3f} - {tolerance}"
            )

    print("모든 메트릭 기준 통과 → 배포 승인")

평가 결과 대시보드

[일일 평가 리포트 형식]

날짜: 2025-06-15
문서 버전: v2.3.1 (CNC-M500 매뉴얼 업데이트)

| 메트릭 | 오늘 | 전날 | 기준 | 상태 |
|--------|------|------|------|------|
| Faithfulness | 0.91 | 0.89 | >=0.85 | 통과 |
| Answer Relevancy | 0.87 | 0.86 | >=0.85 | 통과 |
| Context Precision | 0.84 | 0.85 | >=0.80 | 통과 |
| Context Recall | 0.72 | 0.80 | >=0.75 | 미달 |

주의: Context Recall이 기준 미달 (0.72 < 0.75)
원인 분석 필요: 새 문서 임베딩 품질 확인

핵심: 평가는 배포 시에만 하는 것이 아니라, 문서 업데이트마다 자동 실행되어야 한다.

AI로 학습하기 — 꿀팁
제조 RAG 벤치마크 데이터셋 설계AI 학습 팁

제조 도메인에 맞는 RAGAS 평가 데이터셋(질문·정답·컨텍스트)을 AI가 생성 초안을 만들어 주면 평가 셋업 시간을 크게 줄일 수 있습니다.

제조 설비 유지보수 RAG를 RAGAS로 평가하기 위한 골든 데이터셋 설계를 도와줘. (1) 질문 유형 5가지(고장 진단/PM 절차/부품 사양/안전 규정/약어 정의) 각 4개씩 20개 질문 예시 생성, (2) 각 질문에 필요한 골든 컨텍스트 특성 기술(어떤 섹션, 몇 문장), (3) 합격 기준 설정 — 제조 안전 관련 Faithfulness는 0.95 이상, 일반 정보는 0.85 이상처럼 유형별 기준 제안, (4) 자동 생성(LLM으로 Q&A 생성) vs 전문가 수동 작성 비율 추천. 결과물은 RAGAS Dataset 형식(question/answer/contexts/ground_truths)으로 Python dict 예시로 보여줘.
이 팁이 도움이 됐나요?
실습 — 직접 해보기
멀티모달 검색 (Fusion)
MRR·top1은 모달리티 조합으로 달라집니다. 파인튜닝 토글은 순위를 바꾸지 않고 정답과 오답의 점수 격차만 벌립니다. 두 가지를 구분해서 관찰하세요.
핵심 포인트
  • 제조 RAG 평가는 유형별(고장진단/안전/절차) 50개 이상 질문으로 구성한다
  • 안전 관련 Faithfulness 임계값은 일반 기준(0.85)보다 엄격한 0.95로 설정한다
  • MRR·top1(순위 지표)과 점수 격차(margin)는 다른 것을 잰다. 순위를 보존하는 변환은 랭킹 지표를 못 바꾼다
  • 문서 업데이트 시마다 자동 회귀 평가로 품질 저하를 즉시 감지한다
용어