🏆60분
Day 2 도전과제: 제조 Q&A 데이터셋 500건 구축
학습 데이터 준비
Day 2 도전과제: 제조 Q&A 데이터셋 500건 구축
QLoRA 파인튜닝 > 학습 데이터 준비
요구사항
카테고리 5개 이상에서 시드 데이터 각 5건 이상 직접 작성 (총 25건+)
GPT-4 증강으로 총 500건 이상 확보 (또는 시뮬레이션)
품질 검증 파이프라인 통과율 80% 이상
HuggingFace Dataset 포맷(JSONL)으로 변환 완료
Train/Val 분할 완료 (90:10)
평가 기준
- • 시드 데이터의 품질 (구체성, 정확성, 형식 일관성)
- • 카테고리 다양성 (편향 없이 균형 분포)
- • 품질 검증 결과 리포트 작성
- • 최종 데이터셋 통계 (토큰 분포, 건수)
보너스
- • ShareGPT 형식 멀티턴 데이터 50건 이상 추가
- • 전문가 검수 시뮬레이션 (직접 10건 이상 수정)
- • HuggingFace Hub에 데이터셋 업로드
AI로 학습하기 — 꿀팁
🤖제조 Q&A 데이터셋 품질 자동 검수AI 학습 팁
500건 데이터셋 구축 후 일관성·다양성·도메인 커버리지를 AI로 자동 검수하면 수동 검토 시간을 크게 줄이고 파인튜닝 품질을 높일 수 있습니다.
내가 구축한 제조 Q&A 데이터셋 샘플 20건:
{데이터 샘플 붙여넣기 (Instruction/Input/Output 형식)}
전체 500건 기준으로 다음을 분석해줘: (1) 샘플에서 발견되는 포맷 불일치·어휘 혼용·답변 길이 편차 패턴, (2) 제조 도메인 커버리지 빈틈(설비 유형·고장 유형·공정 단계 중 누락 가능성이 높은 영역), (3) 파인튜닝 과적합 방지를 위해 추가해야 할 데이터 다양화 전략 3가지.이 팁이 도움이 됐나요?