4

"잘 되는 것 같은데..." 는 평가가 아니다

Day 3: RAGAS 평가

학습 목표
  • RAG 시스템 평가의 필요성을 이해한다
  • 정성적 평가의 한계를 파악한다
  • RAGAS 프레임워크가 해결하는 문제를 설명할 수 있다

수요일 오전, 시연 준비 중

"내일 임원 앞에서 RAG 시스템 데모해. 잘 되지?"

당신이 만든 제조 RAG 시스템을 테스트한다.

Q: "CNC-M500 주축 베어링 교체 주기는?"
A: "CNC-M500 주축 베어링의 교체 주기는 5,000시간입니다."
-> 정답! 매뉴얼에 있는 정보.

Q: "SPN-200 오일 교체 방법은?"
A: "오일 드레인 플러그를 열고 배유 후 새 오일을 주입합니다."
-> 맞는 것 같은데... 실제 SPN-200은 자동 급유 시스템이라 수동 교체가 없다!

Q: "KOSHA 기준 프레스 안전 간격은?"
A: "프레스의 안전 간격은 800mm 이상 확보해야 합니다."
-> 매뉴얼에 "800mm"라는 숫자가 있긴 한데, 그건 다른 장비 이야기...

세 질문 중 정답은 하나뿐이다. 하지만 세 답변 모두 그럴듯해 보인다.


"잘 되는 것 같은데"의 함정

이 시스템을 시연하면 무슨 일이 생길까?

  1. 데모에서 준비한 질문에는 잘 답한다 (선별 편향)
  2. 임원이 즉석 질문을 던진다
  3. 시스템이 자신 있게 틀린 답을 한다 (할루시네이션)
  4. 임원: "이거 쓸 수 있어?"
  5. 신뢰를 잃는다

제조 현장에서 틀린 정보의 결과:

  • 잘못된 공차 -> 불량 발생 -> 수억원 손실
  • 잘못된 안전 정보 -> 사고 발생 -> 인명 피해
  • 잘못된 유지보수 절차 -> 장비 파손

"잘 되는 것 같은데"가 아니라, 숫자로 증명해야 한다.


RAGAS: RAG를 숫자로 평가한다

RAGAS (RAG Assessment)는 RAG 시스템을 자동으로, 정량적으로 평가하는 프레임워크다.

핵심: LLM을 이용해서 RAG의 품질을 측정한다. 사람이 일일이 확인할 필요 없다.

[질문] ──────────────┐
                      v
[RAG 시스템] ──> [답변] ──> RAGAS 평가 ──> 점수
                      ^                    |
[검색된 컨텍스트] ─────┘                    v
                                    Faithfulness: 0.87
                                    Relevancy: 0.92
                                    Precision: 0.80
                                    Recall: 0.75

RAGAS가 바꾼 것:

사람이 직접 채점하던 방식RAGAS
답변을 하나하나 읽고 판정LLM이 심판이 되어 자동 채점
수백 건이면 수백 시간수백 건이 수십 분
검색과 생성을 뭉뚱그려 판정검색 단계와 생성 단계를 나누어 네 지표로

두 가지를 정확히 해 두자.

「RAGAS 는 정답이 없어도 된다」는 절반만 맞다. 네 지표 중 정답(ground truth) 없이 계산되는 것은 Faithfulness 와 Answer Relevancy 둘뿐이다. Context Recall 은 정의상 정답이 있어야 하고, RAGAS 0.1.x 의 기본 context_precision 도 정답을 참조한다 (정답 없이 쓰려면 context_utilization 을 쓴다). 정답 칸을 빈 문자열로 채운 샘플을 섞어 넣으면 그 두 점수는 해석할 수 없는 값이 된다.

「예전에는 지표가 하나였다」도 사실이 아니다. 정보검색 평가는 수십 년간 P@k·MAP·nDCG 같은 여러 지표를 써 왔다. RAGAS 의 실제 기여는 다차원이라는 점이 아니라, 생성 단계까지 LLM 심판으로 자동화해 사람 없이 반복 측정할 수 있게 한 것이다.


RAGAS 4대 메트릭 한눈에 보기

메트릭측정 대상질문제조 중요도
Faithfulness답변 → 컨텍스트"답변이 컨텍스트에 충실한가?"★★★★★
Answer Relevancy답변 → 질문"답변이 질문에 관련있는가?"★★★★☆
Context Precision컨텍스트 → 질문"검색된 문서가 관련있는가?"★★★★☆
Context Recall컨텍스트 → 정답"정답 정보가 검색되었는가?"★★★☆☆ (안전 도메인은 ★★★★★)

일반 조회에서 가장 중요한 것: Faithfulness (충실도)

왜? 답변이 문서에 없는 정보를 지어내면(할루시네이션), 그 정보로 작업하는 현장 엔지니어가 위험해진다.

안전 도메인에서는 Context Recall 이 함께 올라온다. Day 5 의 KOSHA RAG 에서는 답변 누락이 곧 사고 위험이다. 필요한 근거가 검색되지 않는 것이 바로 recall 이므로, 안전 질의에서 recall 을 낮게 두면 「모르는 것을 모른 채로」 답하게 된다. 같은 지표라도 무엇을 잃는지에 따라 순위가 바뀐다.


이번 Day에서 배울 것

오늘이 끝나면:

  • RAGAS 4대 메트릭의 측정 원리를 이해한다
  • 평가 데이터셋을 구축할 수 있다
  • RAGAS로 RAG 시스템을 자동 평가할 수 있다
  • 제조 특화 메트릭(안전 점수, 수치 정확도)을 추가할 수 있다
  • 평가 결과 기반으로 시스템을 개선할 수 있다

시작하자.

AI로 학습하기 — 꿀팁
주관적 RAG 평가의 한계 체감AI 학습 팁

'잘 되는 것 같다'는 느낌 평가가 왜 위험한지, 제조 현장에서 RAG 품질 측정 없이 배포했을 때 발생할 수 있는 구체적 사고를 상상해 보세요.

제조 설비 유지보수 RAG 시스템을 '직접 써보니 괜찮다'는 정성 평가만으로 현장에 배포했을 때 발생할 수 있는 위험 시나리오 3가지를 설명해줘. 각 시나리오: (1) 구체적인 실패 상황(예: 잘못된 토크값 안내로 볼트 손상), (2) 정량 평가가 사전에 발견했을 메트릭 이상 징후, (3) 실제 손실 규모 추정(비용 또는 안전 리스크). 설비 PM, 고장 진단, 안전 절차 시나리오를 각각 하나씩 포함해줘.
이 팁이 도움이 됐나요?
용어