6

골든 데이터셋 작성

데이터 적재와 검증

학습 목표
  • CQ 를 평가 문항으로 변환한다
  • 음성 문항과 변형 질문을 포함한다

골든 데이터셋 v1

코스 3의 YAML 서식을 그대로 씁니다.

- id: GD-001
  cq: CQ-01
  question: "..."
  question_variants: ["...", "..."]
  gold_cypher: |
    MATCH ...
  expected:
    type: rowset
    key_fields: [imoNumber]
    snapshot_ref: "batch-2026-XX-XX"
  hops: 2
  category: OP

설계 원칙 다섯

  1. 정답은 스냅숏에 고정snapshot_ref 로 기준 적재분 명시
  2. 비교 방식은 유형별로 — rowset은 키 기준 집합 비교, scalar는 허용 오차
  3. hop 분포 유지 — 나중에 구간별 성적표를 뽑기 위한 사전 설계
  4. 음성 문항 15% 이상 — 정답이 빈 결과인 문항
  5. 변형 질문 미리 축적 — 마지막 모듈의 강건성 측정 재료

실습

  1. MVP 8선 각각에 본문항을 만듭니다.
  2. gold_cypher 를 실행하고 결과로 expected 를 채웁니다.
  3. ⚠️ 정답셋 자체를 의심합니다 — 다른 경로로 같은 답이 나오는지 교차 확인하세요. 정답이 틀리면 채점기가 옳은 답을 틀렸다고 판정합니다.
  4. 음성 문항 2개 이상을 넣습니다(없는 개체 / 기간 밖 / 조건 불만족).
  5. 변형 질문을 문항당 2개씩 답니다.
  6. 추적성 매트릭스의 "골든셋 문항" 열을 채웁니다.

산출물: GD v1 (본문항 8 + 음성 2 + 변형 2개씩)

에디터 로딩 중...
용어