10

Day 2 Common Pitfalls: 데이터 준비 시 흔한 실수

학습 데이터 준비

학습 목표

학습 데이터 준비 시 흔한 실수를 미리 방지한다 데이터 품질 문제의 징후를 인식한다

Day 2 Common Pitfalls

Pitfall 1: "데이터가 많으면 무조건 좋다"

실험 결과:
  200건 고품질 데이터 -> 정확도 78%
  2,000건 저품질 데이터 -> 정확도 62%

고품질의 기준:
  - 답변 길이 50단어 이상
  - 구체적 수치/절차 포함
  - 현장 전문가 검수 완료
  - 일관된 형식 (증상-원인-조치-주의)

Pitfall 2: "카테고리 편향"

문제: 에러 코드 Q&A가 90%, 안전 규정이 2%
결과: 안전 관련 질문에 부실한 답변!

해결: 카테고리별 균형 분포 유지
  장비 알람: 25% | 고장 진단: 20%
  SOP: 15%      | 품질 검사: 15%
  안전: 10%     | 사양 정보: 10%
  공정 최적화: 5%

Pitfall 3: "GPT-4 증강 데이터를 무검증으로 사용"

GPT-4가 생성한 데이터의 문제:
  - 존재하지 않는 에러 코드 생성 (AL-9999)
  - 비현실적 수치 (스핀들 온도 200도에서 정상 작업)
  - 안전 절차 누락 또는 잘못된 순서
  - 제조 용어 오사용

필수: 전문가 샘플 검수 (최소 10% 랜덤 체크)

Pitfall 4: "토큰 길이 무시"

문제: max_length=256으로 설정했는데 답변이 300 토큰
결과: 답변이 중간에 잘림! "조치 절차: 1. 정지 2. 점검 3..."

해결:
  1. 토큰 분포 분석 (p95 기준)
  2. max_length = p95 + 여유 64 토큰
  3. 일반적으로 512~1024 사이 설정

  7B 모델 max_length별 메모리:
  512: ~6GB | 1024: ~8GB | 2048: ~12GB

Pitfall 5: "Prompt 템플릿 불일치"

문제: 학습 시 "### 지시사항:" 사용, 추론 시 "질문:" 사용
결과: 모델이 학습한 패턴을 인식하지 못해 성능 급락

해결: 학습과 추론에 동일한 템플릿 사용!
  - 학습: format_alpaca(data) -> 텍스트
  - 추론: format_alpaca({"instruction": query, "input": context, "output": ""})
  - EOS 토큰: 학습 시 output 끝에 </s> 추가
AI로 학습하기 — 꿀팁
데이터 준비 실수 점검AI 학습 팁

학습 데이터에 중복, 불균형, 언어 혼용 등의 품질 문제가 있는지 판단하는 기준이 올바른지 검증해 보세요.

파인튜닝 데이터 준비 관련 아래 체크리스트가 올바른지 각각 검증해줘. (1) '중복 데이터는 전체의 5% 이하면 허용 가능하다.' (2) '데이터 건수가 300건이면 7B 모델 파인튜닝에 충분하다.' (3) '한국어-영어 혼용 Q&A는 학습 전 반드시 한 언어로 통일해야 한다.' (4) '답변 길이가 불균일해도 tokenizer가 자동으로 패딩하므로 문제없다.' 제조 도메인 sLLM 파인튜닝 관점에서 틀리거나 불완전한 항목을 교정해줘.
이 팁이 도움이 됐나요?
핵심 포인트
  • 양보다 질: 200건 고품질 > 2,000건 저품질
  • 카테고리 균형: 특정 유형 편향 방지
  • GPT-4 증강 후 반드시 전문가 검수
  • max_length: p95 + 64 토큰 여유
  • 프롬프트 템플릿: 학습과 추론에 반드시 동일한 템플릿 사용