2

Day 2 자주 빠지는 함정: 데이터 준비

학습 데이터 준비

학습 목표
  • 학습 데이터 준비 시 흔한 실수를 미리 방지한다
  • 데이터 품질 문제의 징후를 인식한다

Day 2 자주 빠지는 함정

Pitfall 1: "데이터가 많으면 무조건 좋다"

건수를 늘리는 것보다 한 건의 품질을 올리는 편이 대체로 낫다.
출처 없는 배수를 외우지 말고, 본인 데이터로 Day 4의 평가 지표를 두 번 재서 확인한다.
  - 실험 설계: 같은 시드에서 고품질 소량과 저품질 대량을 각각 학습해 같은 평가셋으로 비교
  - 이때 평가셋은 양쪽 학습에 한 번도 쓰이지 않은 것이어야 한다

고품질의 기준:
  - 답변 길이 50단어 이상
  - 구체적 수치/절차 포함
  - 현장 전문가 검수 완료
  - 일관된 형식 (증상-원인-조치-주의)

Pitfall 2: "카테고리 편향"

문제: 에러 코드 Q&A가 90%, 안전 규정이 2%
결과: 안전 관련 질문에 부실한 답변!

해결: 카테고리별 균형 분포 유지
  장비 알람: 25% | 고장 진단: 20%
  SOP: 15%      | 품질 검사: 15%
  안전: 10%     | 사양 정보: 10%
  공정 최적화: 5%

Pitfall 3: "GPT-4 증강 데이터를 무검증으로 사용"

GPT-4가 생성한 데이터의 문제:
  - 존재하지 않는 에러 코드 생성 (AL-9999)
  - 비현실적 수치 (스핀들 온도 200도에서 정상 작업)
  - 안전 절차 누락 또는 잘못된 순서
  - 제조 용어 오사용

필수: 전문가 샘플 검수 (최소 10% 랜덤 체크)

Pitfall 4: "토큰 길이 무시"

문제: max_length=256으로 설정했는데 답변이 300 토큰
결과: 답변이 중간에 잘림! "조치 절차: 1. 정지 2. 점검 3..."

해결:
  1. 토큰 분포 분석 (p95 기준)
  2. max_length = p95 + 여유 64 토큰
  3. 일반적으로 512~1024 사이 설정
  4. 토큰 수는 어절 수로 추정하지 말고 실제 토크나이저로 센다
     len(tokenizer(text)["input_ids"])
     한국어는 어절이 길어 "어절 x 1.3" 같은 영어 경험식을 쓰면 절반 이하로 나온다.
     그 값을 max_length로 삼으면 바로 이 Pitfall 4를 스스로 만든다.

  시퀀스 길이를 늘리면 활성화 메모리가 함께 늘어난다.
  512에서 2048로 가면 몇 배가 되는지는 배치·모델·gradient checkpointing 여부에 달렸으므로
  표로 외우지 말고 본인 환경에서 torch.cuda.max_memory_allocated()로 잰다.

Pitfall 5: "Prompt 템플릿 불일치"

문제: 학습 시 "### 지시사항:" 사용, 추론 시 "질문:" 사용
결과: 모델이 학습한 패턴을 인식하지 못해 성능 급락

해결: 학습과 추론에 동일한 템플릿 사용!
  - 학습: format_alpaca(data) -> 텍스트
  - 추론: format_alpaca({"instruction": query, "input": context, "output": ""})
  - EOS 토큰: 학습 시 output 끝에 tokenizer.eos_token 추가
    </s> 같은 문자열을 직접 적지 않는다. 토큰은 모델마다 다르고,
    이 주의 Phi-4-mini는 <|endoftext|>이며 </s>는 어휘에 아예 없다.
    없는 문자열을 붙이면 모델이 생성을 멈추는 법을 배우지 못한다.
AI로 학습하기 — 꿀팁
데이터 준비 실수 점검AI 학습 팁

학습 데이터에 중복, 불균형, 언어 혼용 등의 품질 문제가 있는지 판단하는 기준이 올바른지 검증해 보세요.

파인튜닝 데이터 준비 관련 아래 체크리스트가 올바른지 각각 검증해줘. (1) '중복 데이터는 전체의 5% 이하면 허용 가능하다.' (2) '데이터 건수가 300건이면 7B 모델 파인튜닝에 충분하다.' (3) '한국어-영어 혼용 Q&A는 학습 전 반드시 한 언어로 통일해야 한다.' (4) '답변 길이가 불균일해도 tokenizer가 자동으로 패딩하므로 문제없다.' 제조 도메인 sLLM 파인튜닝 관점에서 틀리거나 불완전한 항목을 교정해줘.
이 팁이 도움이 됐나요?
핵심 포인트
  • 양보다 질. 다만 배수는 본인 데이터로 재서 말한다
  • 카테고리 균형: 특정 유형 편향 방지
  • GPT-4 증강 후 반드시 전문가 검수
  • max_length: 실제 토크나이저로 센 p95 + 64 토큰 여유 (어절 수 추정 금지)
  • 프롬프트 템플릿: 학습과 추론에 반드시 동일한 템플릿 사용
용어