45

RAGAS 4대 메트릭 완전 정복

Day 3: RAGAS 평가

학습 목표

각 메트릭의 측정 방법론을 수학적으로 이해한다 메트릭 간의 관계와 트레이드오프를 파악한다 제조 도메인에서 각 메트릭의 의미를 설명할 수 있다 목표 점수를 설정하고 해석할 수 있다

RAGAS 4대 메트릭 상세 분석


1. Faithfulness (충실도) - 가장 중요!

정의: 답변의 모든 주장이 제공된 컨텍스트에 의해 뒷받침되는가?

측정 방법:

Step 1: 답변에서 주장(statements) 추출

  답변: "SPN-200 주축 베어링 교체 주기는 5,000시간이며,
         교체 시 C3 등급 베어링을 사용해야 합니다.
         윤활유는 ISO VG 68을 권장합니다."

  추출된 주장:
  1. "SPN-200 주축 베어링 교체 주기는 5,000시간"
  2. "교체 시 C3 등급 베어링 사용"
  3. "윤활유는 ISO VG 68 권장"

Step 2: 각 주장이 컨텍스트에서 지원되는지 검증

  컨텍스트: "SPN-200 주축 베어링은 5,000시간마다 교체...
            C3 등급 이상의 베어링을 사용..."

  검증 결과:
  1. "5,000시간" -> 컨텍스트에 있음 ✅
  2. "C3 등급" -> 컨텍스트에 있음 ✅
  3. "ISO VG 68" -> 컨텍스트에 없음 ❌ (할루시네이션!)

Step 3: 비율 계산

  Faithfulness = 지원되는 주장 / 전체 주장 = 2/3 = 0.67

제조 현장에서의 의미:

Faithfulness = 1.0: 모든 답변이 문서 기반 (이상적)
Faithfulness = 0.8: 대부분 정확하나 일부 추측 포함
Faithfulness = 0.5: 절반이 할루시네이션 (위험!)
Faithfulness < 0.5: 사용 불가 (사고 위험)

제조 현장 최소 기준: 0.85 이상
안전 관련 질문: 0.95 이상

2. Answer Relevancy (답변 관련성)

정의: 답변이 질문과 얼마나 관련있는가?

측정 방법:

Step 1: 답변으로부터 역질문 N개 생성

  답변: "SPN-200 베어링 교체 주기는 5,000시간입니다."

  역질문 1: "SPN-200의 베어링 교체 주기는 얼마인가?"
  역질문 2: "SPN-200 베어링은 몇 시간마다 교체하나?"
  역질문 3: "SPN-200 주축 유지보수 주기는?"

Step 2: 역질문들과 원래 질문의 코사인 유사도 계산

  원래 질문: "SPN-200 주축 베어링 교체 주기는?"

  유사도 1: cosine(원래, 역질문1) = 0.95
  유사도 2: cosine(원래, 역질문2) = 0.92
  유사도 3: cosine(원래, 역질문3) = 0.88

Step 3: 평균

  Answer Relevancy = (0.95 + 0.92 + 0.88) / 3 = 0.917

낮은 점수 예시:

질문: "OEE 계산 방법은?"
답변: "OEE는 Overall Equipment Effectiveness의 약자입니다.
       제조 현장에서 중요한 지표로 사용됩니다."

역질문들: "OEE란 무엇인가?", "OEE의 정의는?", "OEE의 의미는?"
원래 질문: "OEE 계산 방법은?"

유사도: 0.65 -> 정의를 물어봤는데 계산 방법을 안 알려줌!

3. Context Precision (컨텍스트 정밀도)

정의: 검색된 컨텍스트 중 실제로 관련있는 문서의 비율

측정 방법:

검색된 컨텍스트 5개:
1. "SPN-200 주축 베어링 사양서..." -> 관련 ✅
2. "SPN-200 주축 조립 절차..."    -> 관련 ✅
3. "CNC-M500 주축 매뉴얼..."     -> 무관 ❌ (다른 장비!)
4. "SPN-200 전기 회로도..."       -> 무관 ❌
5. "SPN-200 베어링 교체 이력..."  -> 관련 ✅

Context Precision = 관련 문서 수 / 전체 검색 수 = 3/5 = 0.60

개선: 가중 평균 (상위 문서에 더 높은 가중치)
Precision@k = 1/k * Σ(관련여부(i) * 누적관련비율(i))

의미:

  • 0.60 이상이면 검색 품질 양호
  • 0.80 이상이면 우수
  • 0.40 이하면 검색 개선 필요 (청킹, 임베딩 모델 변경)

4. Context Recall (컨텍스트 재현율)

정의: 정답에 필요한 정보가 검색된 컨텍스트에 얼마나 포함되어 있는가?

측정 방법 (Ground Truth 필요):

Ground Truth (정답):
"SPN-200 주축 베어링 교체 주기는 5,000시간이며,
 C3 등급 베어링, ISO VG 68 윤활유를 사용한다."

정답 주장:
1. "교체 주기 5,000시간"
2. "C3 등급 베어링"
3. "ISO VG 68 윤활유"

검색된 컨텍스트에서 확인:
1. "5,000시간" -> 컨텍스트에 있음 ✅
2. "C3 등급" -> 컨텍스트에 있음 ✅
3. "ISO VG 68" -> 컨텍스트에 없음 ❌

Context Recall = 2/3 = 0.67

-> 윤활유 정보가 포함된 문서가 검색 안 됨
-> 청킹 개선 또는 검색 파라미터 조정 필요

메트릭 간 관계

Context Precision (검색 정밀도)
    |
    | "좋은 문서를 검색했는가?"
    v
Context Recall (검색 재현율)
    |
    | "필요한 정보가 모두 검색되었는가?"
    v
Faithfulness (충실도)
    |
    | "검색된 문서에 기반하여 답변했는가?"
    v
Answer Relevancy (답변 관련성)
    |
    | "질문에 맞는 답변인가?"
    v
[최종 답변 품질]

해석: Precision이 높아도 Recall이 낮으면 정보가 불완전하고, Recall이 높아도 Faithfulness가 낮으면 할루시네이션이 섞이고, Faithfulness가 높아도 Relevancy가 낮으면 동문서답이다.

4개 모두 높아야 좋은 RAG다.


제조 현장 목표 점수

메트릭일반 기준제조 기준안전 관련
Faithfulness0.800.850.95
Answer Relevancy0.800.850.85
Context Precision0.700.800.80
Context Recall0.650.750.85
AI로 학습하기 — 꿀팁
RAGAS 4대 메트릭 개념 오류 점검AI 학습 팁

Faithfulness, Answer Relevancy, Context Precision, Context Recall 각각의 측정 방식과 개선 대응 방법에 대한 이해가 정확한지 검증해 보세요.

RAGAS 4대 메트릭에 대한 아래 설명이 맞는지 검증해줘. (1) 'Faithfulness가 낮으면 검색된 컨텍스트가 부정확한 것이므로 청킹 전략을 개선해야 한다.' (2) 'Answer Relevancy는 답변과 질문의 코사인 유사도로 측정된다.' (3) 'Context Precision이 낮으면 불필요한 청크가 검색되는 것이므로 top-k 값을 줄이거나 임베딩 모델을 교체해야 한다.' (4) 'Context Recall은 LLM-as-judge 없이 순수 벡터 유사도로만 측정 가능하다.' 제조 RAG 평가 맥락으로 오류를 교정해줘.
이 팁이 도움이 됐나요?