9

성적표 네 축

질의 시스템과 발표

학습 목표
  • 자연어 시스템을 네 축으로 정량 평가한다
  • 실패를 단계별로 분류해 처방한다

성적표 4축

코스 4의 평가 체계를 그대로 적용합니다. 시연이 아니라 측정입니다.

지표정의기준
실행 정확도결과가 기대와 일치한 비율hop별 분리 집계
강건성변형 질문 간 결과 일치율90%+
음성 정확도음성 문항에서 지어냄 없이 답한 비율100% (타협 없음)
거부 적절성답변 불가 처리의 정당 비율리뷰 기반

기준선과 비교합니다

앞 과제에서 Cypher 직접 실행 성적이 기준선입니다. 자연어 경유가 얼마나 잃는지 보세요 — 그 손실이 이 시스템의 비용입니다.

실패 분석 — 단계별로 사인이 다릅니다

어디서 죽었나사인처방
③ 검증 탈락스키마 이해 실패스키마 주입 개선
④ 결과 오류생성 오류few-shot 보강
⑤ 왜곡조립 일탈제한 강화

⚠️ 사인을 가르지 않고 프롬프트만 만지면 아무것도 나아지지 않습니다.

실습

  1. 채점 하네스에 자연어 입구를 붙이고 GD 전 문항을 돌립니다.
  2. hop 구간별 정확도를 뽑고 기준선과 대조합니다.
  3. 음성 문항만 따로 돌립니다. 100%가 아니면 그것이 최우선 과제입니다.
  4. 실패 문항을 단계별로 분류해 처방을 적고, 하나 이상 실제로 개선해 재측정합니다.
  5. 추적성 매트릭스 상태를 검증완료로 옮깁니다.

산출물: 성적표 (4축 + hop 구간별) + 실패 분석 + 개선 전후 비교

에디터 로딩 중...
용어