▶️25

[영상] RAG 성능 평가 지표 완전 정리

Day 5: 기술문서 RAG 시스템 프로젝트

학습 목표

RAGAS의 5대 핵심 지표를 정의할 수 있다 각 지표가 RAG의 어느 단계(검색/생성)를 평가하는지 구분할 수 있다 낮게 나왔을 때의 진단과 개선 방향을 제시할 수 있다 RAGAS 라이브러리 평가 코드 흐름을 설명할 수 있다

영상 핵심 정리 — RAG 성능 평가 지표

RAGAS 5대 지표

지표평가 대상점수 낮으면 의심할 것
Faithfulness생성 단계LLM 환각
Answer Relevancy생성 단계프롬프트 설계 불량
Context Precision검색 단계관련 없는 청크
Context Recall검색 단계정답 근거 누락
Answer Correctness종합위 4개 점검

계산 원리

Faithfulness = 컨텍스트로 설명 가능한 주장 수 / 답변 전체 주장 수

Answer Relevancy = 답변에서 역으로 만든 질문 k개가
                  원본 질문과 얼마나 유사한가 (임베딩 코사인 평균)

Context Recall = 정답 문장이 컨텍스트에서 근거를 찾을 수 있는 비율

평가 코드

from ragas import evaluate
from ragas.metrics import faithfulness, answer_relevancy, context_recall
from datasets import Dataset

data = {
    'question': ['3호기 베어링 교체 주기는?'],
    'answer':   ['3000시간마다 교체합니다'],
    'contexts': [['베어링 교체 주기는 3000시간입니다...']],
    'ground_truth': ['교체 주기는 3000시간']
}
result = evaluate(Dataset.from_dict(data),
    metrics=[faithfulness, answer_relevancy, context_recall])
print(result)

개선 로드맵

Context Recall ↓ → 청크 크기 줄이기 / 오버랩 늘리기
Context Precision ↓ → 하이브리드 검색 + Reranker
Faithfulness ↓ → 시스템 프롬프트 '컨텍스트만 참조' 강제
Answer Relevancy ↓ → 질문 리라이팅 (HyDE)

함정 주의: RAGAS는 LLM(기본 GPT-4)을 판사로 사용 — 평가 비용 발생. 샘플 50~100으로 먼저 실험.

다음 task와의 연결

'주간 프로젝트: 기술문서 RAG'에서 실제 문서로 RAG 파이프라인을 구축하고 RAGAS로 측정한다.

AI로 학습하기 — 꿀팁
RAG 평가 지표 Faithfulness 환각 탐지AI 학습 팁

제조 설비 고장 진단 RAG 시스템에서 Faithfulness·Context Recall·Answer Relevancy 지표를 AI로 계산해보고, 환각이 발생한 답변을 식별하는 방법을 검증하세요.

제조 설비 고장 진단 RAG 시스템에서 생성된 답변 3개의 RAG 평가 지표를 계산해줘. Faithfulness(생성 답변이 검색 컨텍스트에 근거하는 비율)가 낮은 환각 답변 예시, Context Recall이 낮아 필요한 정보가 검색되지 않은 사례, Answer Relevancy가 낮아 질문과 동떨어진 답변 사례를 각각 만들고 개선 방법도 제안해줘.
이 팁이 도움이 됐나요?
핵심 포인트
  • Faithfulness(충실도): 생성 답변이 컨텍스트에 근거하는 비율 — 환각 탐지 핵심
  • Context Recall: 정답에 필요한 정보가 검색 결과에 모두 포함됐는지
  • Answer Relevancy: 질문과 답변의 관련성
  • RAG 실패의 73%는 검색 단계 — Context Precision·Recall 낮으면 임베딩·청킹부터