20

M4: 통합 테스트 & 개선 가이드

Day 5: 기술문서 RAG 시스템 프로젝트

학습 목표

RAG 시스템의 품질을 체계적으로 평가한다 개선 포인트를 식별하고 적용한다

통합 테스트 체크리스트

기능 테스트

[필수]
□ SOP 관련 질문에 올바른 답변 반환
□ 사양서 수치 질문에 정확한 값 반환
□ 안전 규정 질문에 경고 표시 포함
□ 설비별 필터 검색 정상 동작
□ 관련 없는 질문에 적절한 거부 응답
□ 출처 표시 정상 동작

[권장]
□ 한글/영어 혼용 질문 처리
□ 유사한 질문 다양하게 테스트
□ 메타데이터 필터 조합 테스트
□ 최신 버전 문서 우선 검색 확인

품질 평가 기준

항목기준점수
정확성문서 기반 정확한 정보40%
완전성질문에 필요한 모든 정보 포함20%
출처 표시문서명, 섹션 번호 포함15%
안전 경고안전 관련 주의사항 표시15%
응답 형식구조적, 읽기 쉬운 포맷10%

개선 포인트

[검색 품질 개선]
1. chunk_size 조정: 너무 크거나 작지 않은지 확인
2. overlap 조정: 경계에서 정보 손실 여부 확인
3. MMR 검색: lambda_mult 파라미터 튜닝
4. 메타데이터 필터: 적절한 필터 조합 찾기

[답변 품질 개선]
1. 프롬프트 개선: 더 구체적인 지시 추가
2. 컨텍스트 순서: 관련성 높은 청크를 먼저 배치
3. 답변 후처리: 포맷 정리, 중복 제거
4. 신뢰도 표시: 유사도 점수 기반 신뢰도

[시스템 개선]
1. 에러 핸들링: 검색 실패, API 오류 처리
2. 캐싱: 반복 질문에 대한 캐시
3. 로깅: 질문/답변 로그 (감사 추적)
4. 피드백: 사용자 만족도 수집
AI로 학습하기 — 꿀팁
🤖RAG 품질 평가 테스트 케이스 자동 생성AI 학습 팁

RAG 시스템 품질을 체계적으로 평가하려면 다양한 질문 유형의 테스트 케이스가 필요하다. AI로 제조 도메인 맞춤 테스트셋을 생성한다.

제조 설비 기술문서 RAG 시스템의 통합 테스트를 위한 테스트 케이스 20개를 생성해줘. 다음 4가지 카테고리로 5개씩 나눠줘: 1) 단순 사실 질의 (에러코드, 부품명, 규격값 등 정확한 수치/코드 존재), 2) 복합 추론 질의 (여러 문서 청크 조합 필요, '만약 ~하다면' 시나리오), 3) 경계 케이스 (문서에 없는 정보, 모호한 질문, 철자 오류), 4) 안전 위험 질의 (즉각 조치 필요, 법적 기준 포함). 각 테스트 케이스는 '질문 / 예상 답변 핵심 / 평가 기준(F1, 출처 정확도 등) / 실패 시 의심 컴포넌트'를 포함하는 표로 만들어줘.
이 팁이 도움이 됐나요?