10분
Day 2 Common Pitfalls: 데이터 준비 시 흔한 실수
학습 데이터 준비
Day 2 Common Pitfalls: 데이터 준비 시 흔한 실수
QLoRA 파인튜닝 > 학습 데이터 준비
학습 목표
학습 데이터 준비 시 흔한 실수를 미리 방지한다 데이터 품질 문제의 징후를 인식한다
Day 2 Common Pitfalls
Pitfall 1: "데이터가 많으면 무조건 좋다"
실험 결과:
200건 고품질 데이터 -> 정확도 78%
2,000건 저품질 데이터 -> 정확도 62%
고품질의 기준:
- 답변 길이 50단어 이상
- 구체적 수치/절차 포함
- 현장 전문가 검수 완료
- 일관된 형식 (증상-원인-조치-주의)
Pitfall 2: "카테고리 편향"
문제: 에러 코드 Q&A가 90%, 안전 규정이 2%
결과: 안전 관련 질문에 부실한 답변!
해결: 카테고리별 균형 분포 유지
장비 알람: 25% | 고장 진단: 20%
SOP: 15% | 품질 검사: 15%
안전: 10% | 사양 정보: 10%
공정 최적화: 5%
Pitfall 3: "GPT-4 증강 데이터를 무검증으로 사용"
GPT-4가 생성한 데이터의 문제:
- 존재하지 않는 에러 코드 생성 (AL-9999)
- 비현실적 수치 (스핀들 온도 200도에서 정상 작업)
- 안전 절차 누락 또는 잘못된 순서
- 제조 용어 오사용
필수: 전문가 샘플 검수 (최소 10% 랜덤 체크)
Pitfall 4: "토큰 길이 무시"
문제: max_length=256으로 설정했는데 답변이 300 토큰
결과: 답변이 중간에 잘림! "조치 절차: 1. 정지 2. 점검 3..."
해결:
1. 토큰 분포 분석 (p95 기준)
2. max_length = p95 + 여유 64 토큰
3. 일반적으로 512~1024 사이 설정
7B 모델 max_length별 메모리:
512: ~6GB | 1024: ~8GB | 2048: ~12GB
Pitfall 5: "Prompt 템플릿 불일치"
문제: 학습 시 "### 지시사항:" 사용, 추론 시 "질문:" 사용
결과: 모델이 학습한 패턴을 인식하지 못해 성능 급락
해결: 학습과 추론에 동일한 템플릿 사용!
- 학습: format_alpaca(data) -> 텍스트
- 추론: format_alpaca({"instruction": query, "input": context, "output": ""})
- EOS 토큰: 학습 시 output 끝에 </s> 추가AI로 학습하기 — 꿀팁
✅데이터 준비 실수 점검AI 학습 팁
학습 데이터에 중복, 불균형, 언어 혼용 등의 품질 문제가 있는지 판단하는 기준이 올바른지 검증해 보세요.
파인튜닝 데이터 준비 관련 아래 체크리스트가 올바른지 각각 검증해줘. (1) '중복 데이터는 전체의 5% 이하면 허용 가능하다.' (2) '데이터 건수가 300건이면 7B 모델 파인튜닝에 충분하다.' (3) '한국어-영어 혼용 Q&A는 학습 전 반드시 한 언어로 통일해야 한다.' (4) '답변 길이가 불균일해도 tokenizer가 자동으로 패딩하므로 문제없다.' 제조 도메인 sLLM 파인튜닝 관점에서 틀리거나 불완전한 항목을 교정해줘.
이 팁이 도움이 됐나요?
핵심 포인트
- • 양보다 질: 200건 고품질 > 2,000건 저품질
- • 카테고리 균형: 특정 유형 편향 방지
- • GPT-4 증강 후 반드시 전문가 검수
- • max_length: p95 + 64 토큰 여유
- • 프롬프트 템플릿: 학습과 추론에 반드시 동일한 템플릿 사용