2분
Day 2 자주 빠지는 함정: 데이터 준비
학습 데이터 준비
Day 2 자주 빠지는 함정: 데이터 준비
QLoRA 파인튜닝 > 학습 데이터 준비
학습 목표
- 학습 데이터 준비 시 흔한 실수를 미리 방지한다
- 데이터 품질 문제의 징후를 인식한다
Day 2 자주 빠지는 함정
Pitfall 1: "데이터가 많으면 무조건 좋다"
건수를 늘리는 것보다 한 건의 품질을 올리는 편이 대체로 낫다.
출처 없는 배수를 외우지 말고, 본인 데이터로 Day 4의 평가 지표를 두 번 재서 확인한다.
- 실험 설계: 같은 시드에서 고품질 소량과 저품질 대량을 각각 학습해 같은 평가셋으로 비교
- 이때 평가셋은 양쪽 학습에 한 번도 쓰이지 않은 것이어야 한다
고품질의 기준:
- 답변 길이 50단어 이상
- 구체적 수치/절차 포함
- 현장 전문가 검수 완료
- 일관된 형식 (증상-원인-조치-주의)Pitfall 2: "카테고리 편향"
문제: 에러 코드 Q&A가 90%, 안전 규정이 2%
결과: 안전 관련 질문에 부실한 답변!
해결: 카테고리별 균형 분포 유지
장비 알람: 25% | 고장 진단: 20%
SOP: 15% | 품질 검사: 15%
안전: 10% | 사양 정보: 10%
공정 최적화: 5%Pitfall 3: "GPT-4 증강 데이터를 무검증으로 사용"
GPT-4가 생성한 데이터의 문제:
- 존재하지 않는 에러 코드 생성 (AL-9999)
- 비현실적 수치 (스핀들 온도 200도에서 정상 작업)
- 안전 절차 누락 또는 잘못된 순서
- 제조 용어 오사용
필수: 전문가 샘플 검수 (최소 10% 랜덤 체크)Pitfall 4: "토큰 길이 무시"
문제: max_length=256으로 설정했는데 답변이 300 토큰
결과: 답변이 중간에 잘림! "조치 절차: 1. 정지 2. 점검 3..."
해결:
1. 토큰 분포 분석 (p95 기준)
2. max_length = p95 + 여유 64 토큰
3. 일반적으로 512~1024 사이 설정
4. 토큰 수는 어절 수로 추정하지 말고 실제 토크나이저로 센다
len(tokenizer(text)["input_ids"])
한국어는 어절이 길어 "어절 x 1.3" 같은 영어 경험식을 쓰면 절반 이하로 나온다.
그 값을 max_length로 삼으면 바로 이 Pitfall 4를 스스로 만든다.
시퀀스 길이를 늘리면 활성화 메모리가 함께 늘어난다.
512에서 2048로 가면 몇 배가 되는지는 배치·모델·gradient checkpointing 여부에 달렸으므로
표로 외우지 말고 본인 환경에서 torch.cuda.max_memory_allocated()로 잰다.Pitfall 5: "Prompt 템플릿 불일치"
문제: 학습 시 "### 지시사항:" 사용, 추론 시 "질문:" 사용
결과: 모델이 학습한 패턴을 인식하지 못해 성능 급락
해결: 학습과 추론에 동일한 템플릿 사용!
- 학습: format_alpaca(data) -> 텍스트
- 추론: format_alpaca({"instruction": query, "input": context, "output": ""})
- EOS 토큰: 학습 시 output 끝에 tokenizer.eos_token 추가
</s> 같은 문자열을 직접 적지 않는다. 토큰은 모델마다 다르고,
이 주의 Phi-4-mini는 <|endoftext|>이며 </s>는 어휘에 아예 없다.
없는 문자열을 붙이면 모델이 생성을 멈추는 법을 배우지 못한다.AI로 학습하기 — 꿀팁
데이터 준비 실수 점검AI 학습 팁
학습 데이터에 중복, 불균형, 언어 혼용 등의 품질 문제가 있는지 판단하는 기준이 올바른지 검증해 보세요.
파인튜닝 데이터 준비 관련 아래 체크리스트가 올바른지 각각 검증해줘. (1) '중복 데이터는 전체의 5% 이하면 허용 가능하다.' (2) '데이터 건수가 300건이면 7B 모델 파인튜닝에 충분하다.' (3) '한국어-영어 혼용 Q&A는 학습 전 반드시 한 언어로 통일해야 한다.' (4) '답변 길이가 불균일해도 tokenizer가 자동으로 패딩하므로 문제없다.' 제조 도메인 sLLM 파인튜닝 관점에서 틀리거나 불완전한 항목을 교정해줘.
이 팁이 도움이 됐나요?
핵심 포인트
- • 양보다 질. 다만 배수는 본인 데이터로 재서 말한다
- • 카테고리 균형: 특정 유형 편향 방지
- • GPT-4 증강 후 반드시 전문가 검수
- • max_length: 실제 토크나이저로 센 p95 + 64 토큰 여유 (어절 수 추정 금지)
- • 프롬프트 템플릿: 학습과 추론에 반드시 동일한 템플릿 사용