2

M4: 통합 테스트 & 개선 가이드

Day 5: 기술문서 RAG 시스템 프로젝트

학습 목표
  • RAG 시스템의 품질을 체계적으로 평가한다
  • 개선 포인트를 식별하고 적용한다

통합 테스트 체크리스트

기능 테스트

[필수]
□ SOP 관련 질문에 올바른 답변 반환
□ 사양서 수치 질문에 정확한 값 반환
□ 안전 규정 질문에 경고 표시 포함
□ 설비별 필터 검색 정상 동작
□ 관련 없는 질문에 적절한 거부 응답
□ 출처 표시 정상 동작

[권장]
□ 한글/영어 혼용 질문 처리
□ 유사한 질문 다양하게 테스트
□ 메타데이터 필터 조합 테스트
□ 최신 버전 문서 우선 검색 확인

먼저 세는 것

눈으로 매기기 전에 셀 수 있는 것부터 센다. M3의 테스트 스위트가 아래 네 숫자를 찍는다.

숫자어디를 손봐야 하는가
정답 수 / 답이 있는 질문 수정답 문서를 찾아온 비율낮으면 청킹과 임베딩
엉뚱한 문서를 가져온 수근거를 잘못 고른 횟수메타데이터 필터와 top-k
거절 수 / 답이 없는 질문 수없는 것을 없다고 했는가기준선이 너무 낮다
자기 검색 적중률 (M2)색인 자체가 성립하는가임베딩 모델을 바꾼다

설정을 하나 바꿀 때마다 네 숫자를 다시 재고 앞의 값과 나란히 적는다. 두 숫자를 나란히 놓은 표 하나가 "개선했다"는 문장보다 강하다.

RAG Pipeline 시뮬레이터의 평가·튜닝 탭에서 같은 종류의 실험을 화면으로 해볼 수 있다. 설정을 바꿀 때 hit rate와 MRR이 어느 쪽으로 움직이는지 먼저 감을 잡고, 자기 코드에서 같은 실험을 하면 빠르다.

사람이 보는 기준

숫자로 잡히지 않는 것은 그다음이다.

항목기준점수
정확성문서 기반 정확한 정보40%
완전성질문에 필요한 모든 정보 포함20%
출처 표시문서명, 섹션 번호 포함15%
안전 경고안전 관련 주의사항 표시15%
응답 형식구조적, 읽기 쉬운 포맷10%

개선 포인트

[검색 품질 개선]
1. chunk_size 조정: 너무 크거나 작지 않은지 확인
2. overlap 조정: 경계에서 정보 손실 여부 확인
3. MMR 검색: lambda_mult 파라미터 튜닝
4. 메타데이터 필터: 적절한 필터 조합 찾기

[답변 품질 개선]
1. 프롬프트 개선: 더 구체적인 지시 추가
2. 컨텍스트 순서: 관련성 높은 청크를 먼저 배치
3. 답변 후처리: 포맷 정리, 중복 제거
4. 신뢰도 표시: 유사도 점수 기반 신뢰도

[시스템 개선]
1. 에러 핸들링: 검색 실패, API 오류 처리
2. 캐싱: 반복 질문에 대한 캐시
3. 로깅: 질문/답변 로그 (감사 추적)
4. 피드백: 사용자 만족도 수집
AI로 학습하기 — 꿀팁
RAG 품질 평가 테스트 케이스 자동 생성AI 학습 팁

RAG 시스템 품질을 체계적으로 평가하려면 다양한 질문 유형의 테스트 케이스가 필요하다. AI로 제조 도메인 맞춤 테스트셋을 생성한다.

제조 설비 기술문서 RAG 시스템의 통합 테스트를 위한 테스트 케이스 20개를 생성해줘. 다음 4가지 카테고리로 5개씩 나눠줘: 1) 단순 사실 질의 (에러코드, 부품명, 규격값 등 정확한 수치/코드 존재), 2) 복합 추론 질의 (여러 문서 청크 조합 필요, '만약 ~하다면' 시나리오), 3) 경계 케이스 (문서에 없는 정보, 모호한 질문, 철자 오류), 4) 안전 위험 질의 (즉각 조치 필요, 법적 기준 포함). 각 테스트 케이스는 '질문 / 예상 답변 핵심 / 평가 기준(F1, 출처 정확도 등) / 실패 시 의심 컴포넌트'를 포함하는 표로 만들어줘.
이 팁이 도움이 됐나요?
용어