27분
실습: Unsloth로 학습을 돌리고 속도를 직접 재기
QLoRA 학습 실행
실습: Unsloth로 학습을 돌리고 속도를 직접 재기
QLoRA 파인튜닝 > QLoRA 학습 실행
학습 목표
- Unsloth를 사용한 QLoRA 학습 코드를 작성한다
- 표준 방식과 Unsloth의 속도·메모리 차이를 본인 GPU에서 직접 측정한다
- 측정값을 쓸 때 어떤 조건을 함께 적어야 하는지 안다
Unsloth QLoRA 학습
표준 방식과의 차이점
- 모델 로드: FastLanguageModel.from_pretrained()
- LoRA 적용: FastLanguageModel.get_peft_model()
- 나머지는 같다 (SFTConfig + SFTTrainer)
이 실습의 산출물
"몇 배 빠르다"는 문장이 아니라 본인 GPU에서 잰 표다. 표준 경로와 Unsloth 경로를 같은 데이터·같은 설정으로 각각 돌리고 시간과 최대 VRAM을 적는다.
주의
Unsloth는 transformers·trl·peft의 특정 조합을 자기가 끌고 온다. Day 1에서 고정한 버전과 충돌하기 쉬우므로 새 런타임에 따로 설치한다. 설치 명령과 API가 자주 바뀌므로 안 돌면 공식 문서의 최신 노트북을 기준으로 삼는다. 이 실습은 선택이다.
에디터 로딩 중...
힌트 보기
- • Unsloth는 자기 의존성을 끌고 오므로 Day 1에서 고정한 환경과 분리한다 (새 Colab 런타임)
- • lora_dropout=0: Unsloth 내부 최적화와 호환
- • target_modules는 베이스 모델을 따른다. Phi-4-mini는 qkv_proj·o_proj·gate_up_proj·down_proj
- • 속성 이름은 total_memory다. total_mem은 AttributeError가 난다
- • 측정 전에 torch.cuda.reset_peak_memory_stats()를 부른다
정답 보기
에디터 로딩 중...
AI로 학습하기 — 꿀팁
Unsloth vs 표준 학습 속도 비교 검증AI 학습 팁
AI에게 표준 QLoRA와 Unsloth 코드 차이를 설명하면 메모리 절감 원리와 실제 Colab T4 기준 속도·VRAM 예상치를 검증해줍니다.
Unsloth로 작성한 QLoRA 코드를 리뷰해줘. FastLanguageModel 사용 부분이 표준 Hugging Face 대비 왜 2배 빠른지 메모리 최적화 원리를 설명하고, Colab T4(16GB) 기준 Qwen2.5-7B 학습 시 예상 속도(it/s)·VRAM 사용량을 표준 방식과 비교해줘.
이 팁이 도움이 됐나요?