9분
성적표 네 축
질의 시스템과 발표
성적표 네 축
질의 시스템과 발표 > 질의 시스템과 발표
학습 목표
- 자연어 시스템을 네 축으로 정량 평가한다
- 실패를 단계별로 분류해 처방한다
성적표 4축
코스 4의 평가 체계를 그대로 적용합니다. 시연이 아니라 측정입니다.
| 지표 | 정의 | 기준 |
|---|---|---|
| 실행 정확도 | 결과가 기대와 일치한 비율 | hop별 분리 집계 |
| 강건성 | 변형 질문 간 결과 일치율 | 90%+ |
| 음성 정확도 | 음성 문항에서 지어냄 없이 답한 비율 | 100% (타협 없음) |
| 거부 적절성 | 답변 불가 처리의 정당 비율 | 리뷰 기반 |
기준선과 비교합니다
앞 과제에서 Cypher 직접 실행 성적이 기준선입니다. 자연어 경유가 얼마나 잃는지 보세요 — 그 손실이 이 시스템의 비용입니다.
실패 분석 — 단계별로 사인이 다릅니다
| 어디서 죽었나 | 사인 | 처방 |
|---|---|---|
| ③ 검증 탈락 | 스키마 이해 실패 | 스키마 주입 개선 |
| ④ 결과 오류 | 생성 오류 | few-shot 보강 |
| ⑤ 왜곡 | 조립 일탈 | 제한 강화 |
⚠️ 사인을 가르지 않고 프롬프트만 만지면 아무것도 나아지지 않습니다.
실습
- 채점 하네스에 자연어 입구를 붙이고 GD 전 문항을 돌립니다.
- hop 구간별 정확도를 뽑고 기준선과 대조합니다.
- 음성 문항만 따로 돌립니다. 100%가 아니면 그것이 최우선 과제입니다.
- 실패 문항을 단계별로 분류해 처방을 적고, 하나 이상 실제로 개선해 재측정합니다.
- 추적성 매트릭스 상태를 검증완료로 옮깁니다.
산출물: 성적표 (4축 + hop 구간별) + 실패 분석 + 개선 전후 비교
에디터 로딩 중...