[영상] QLoRA -- 4비트 초경량 파인튜닝 원리
학습 데이터 준비
[영상] QLoRA -- 4비트 초경량 파인튜닝 원리
QLoRA 파인튜닝 > 학습 데이터 준비
Instruction Dataset의 Alpaca 포맷과 ShareGPT 포맷을 비교하고 제조 도메인에 적합한 형식을 선택할 수 있다 QLoRA 4-bit NF4 양자화의 세 가지 핵심 혁신(NF4, Double Quantization, Paged Optimizer)을 설명할 수 있다 제조 설비 매뉴얼·알람 이력을 학습 데이터로 변환하는 과정을 설명할 수 있다 데이터 품질이 모델 성능에 미치는 영향을 구체적인 예시로 설명하고 정제 기준을 제시할 수 있다
영상 핵심 정리 — QLoRA: 4비트 초경량 파인튜닝 원리
이 영상은 QLoRA가 어떻게 대형 모델을 소형 GPU에서 파인튜닝 가능하게 만드는지 기술 원리를 깊이 다룬다. 동시에 학습 데이터 준비의 핵심인 Instruction Dataset 포맷과 제조 데이터를 변환하는 실전 전략을 소개한다.
1. 학습 데이터 포맷 비교
Alpaca 포맷 — 단일 턴, 단순 Q&A에 적합
{
"instruction": "CNC 알람 E204의 원인을 설명하라",
"input": "설비: CNC-07, 진동: 3.2g, 온도: 78°C",
"output": "E204는 주축 베어링 과부하 알람입니다. 진동 3.2g는 정상 한계(2.5g)를 초과했으며..."
}
ShareGPT 포맷 — 다중 턴, 진단 대화에 적합
{
"conversations": [
{"from": "human", "value": "CNC-07에서 E204 알람이 발생했습니다"},
{"from": "gpt", "value": "E204는 주축 베어링 관련 알람입니다. 최근 진동값을 알 수 있을까요?"},
{"from": "human", "value": "진동 3.2g, 온도 78°C입니다"},
{"from": "gpt", "value": "정상 한계(2.5g)를 초과했습니다. 즉시 점검이 필요합니다..."}
]
}
2. NF4 양자화 — 왜 정확도가 높은가
LLM 가중치 분포: 정규분포 N(0, σ)에 가까움
INT4: 균등 간격으로 16개 구간 분할
→ 정규분포 중심부 정보 손실 큼
NF4: 정규분포 확률밀도에 따라 불균등 구간 배치
→ 가중치 밀집 영역(0 근처)을 세밀하게 표현
→ INT4 대비 오차 30% 감소
3. 제조 데이터 변환 파이프라인
[설비 매뉴얼 PDF]
→ OCR + 텍스트 추출
→ 챕터별 분할 (알람코드 단위)
→ GPT-4로 Q&A 쌍 자동 생성
→ 전문가 검수 (오류율 < 5%)
→ Alpaca JSON 변환
→ 중복 제거 + 형식 검증
→ 학습 데이터셋 완성
함정 주의: 자동 생성 데이터에는 '환각(Hallucination)' 문제가 그대로 포함된다. LLM이 잘못된 알람 코드 설명을 그럴듯하게 생성한 경우, 이를 학습하면 파인튜닝 모델도 같은 오류를 자신 있게 반복한다. 설비 제조사 공식 문서와 대조 검수가 필수다.
다음 task와의 연결
다음 reading 'Instruction Dataset 포맷 (Alpaca, ShareGPT) 설계'에서는 실제 제조 도메인 데이터 500개를 기준으로 Alpaca/ShareGPT 포맷 변환 스크립트와 품질 검증 기준(ROUGE 점수, 전문가 검수 체크리스트)을 다룬다.
AI 에이전트에게 제조 현장 고장 Q&A 데이터를 Alpaca 포맷으로 변환하는 코드를 작성하게 하고, NF4의 INT4 대비 오차 우위 원리도 확인하세요.
스마트팩토리 알람 코드·정비 매뉴얼 Q&A 데이터를 QLoRA 파인튜닝용 Alpaca 포맷(instruction+input+output 3필드)으로 변환하는 Python 코드를 작성해줘. 복잡한 다중 턴 진단 대화를 ShareGPT 포맷(human/gpt 교대)으로 변환하는 코드도 작성하고, NF4(Normalized Float 4)가 일반 INT4보다 LLM 가중치 정규분포에 최적화된 이유도 설명해줘.
- • Alpaca 포맷은 instruction+input+output 3필드 구조 — 제조 Q&A 데이터를 빠르게 변환하기 좋다
- • ShareGPT 포맷은 다중 턴 대화(human/gpt 교대) — 복잡한 진단 대화 시뮬레이션에 적합하다
- • NF4(Normalized Float 4)는 정규분포를 따르는 LLM 가중치에 최적화된 4-bit 표현 방식으로, INT4보다 낮은 오차를 달성한다
- • 학습 데이터 1,000개라도 고품질(정확한 용어·일관된 형식)이 저품질 10,000개보다 낫다 — 제조 도메인은 전문가 검수가 필수
