🏆60

Day 2 도전과제: 제조 Q&A 데이터셋 500건 구축

학습 데이터 준비

요구사항

카테고리 5개 이상에서 시드 데이터 각 5건 이상 직접 작성 (총 25건+)

GPT-4 증강으로 총 500건 이상 확보 (또는 시뮬레이션)

품질 검증 파이프라인 통과율 80% 이상

HuggingFace Dataset 포맷(JSONL)으로 변환 완료

Train/Val 분할 완료 (90:10)

평가 기준
  • 시드 데이터의 품질 (구체성, 정확성, 형식 일관성)
  • 카테고리 다양성 (편향 없이 균형 분포)
  • 품질 검증 결과 리포트 작성
  • 최종 데이터셋 통계 (토큰 분포, 건수)
보너스
  • ShareGPT 형식 멀티턴 데이터 50건 이상 추가
  • 전문가 검수 시뮬레이션 (직접 10건 이상 수정)
  • HuggingFace Hub에 데이터셋 업로드
AI로 학습하기 — 꿀팁
🤖제조 Q&A 데이터셋 품질 자동 검수AI 학습 팁

500건 데이터셋 구축 후 일관성·다양성·도메인 커버리지를 AI로 자동 검수하면 수동 검토 시간을 크게 줄이고 파인튜닝 품질을 높일 수 있습니다.

내가 구축한 제조 Q&A 데이터셋 샘플 20건:

{데이터 샘플 붙여넣기 (Instruction/Input/Output 형식)}

전체 500건 기준으로 다음을 분석해줘: (1) 샘플에서 발견되는 포맷 불일치·어휘 혼용·답변 길이 편차 패턴, (2) 제조 도메인 커버리지 빈틈(설비 유형·고장 유형·공정 단계 중 누락 가능성이 높은 영역), (3) 파인튜닝 과적합 방지를 위해 추가해야 할 데이터 다양화 전략 3가지.
이 팁이 도움이 됐나요?