9

Phase 4: 로컬 배포 (GGUF + Ollama)

제조 도메인 sLLM 구축

학습 목표
  • 학습된 모델을 GGUF로 변환한다
  • Ollama에 등록하여 로컬 서비스를 구축한다
  • REST API로 테스트한다

Phase 4: 배포

Day 4의 배포 코드를 적용하여:

  1. LoRA 어댑터 병합
  2. GGUF 변환 (Q4_K_M)
  3. Ollama Modelfile 작성
  4. ollama create & 테스트
에디터 로딩 중...
힌트 보기
  • Ollama가 설치되지 않은 환경에서는 어댑터 저장까지만 수행
  • Modelfile을 담는 파이썬 문자열은 '작은따옴표 세 개'로 연다
  • GGUF 변환은 두 단계다. convert_hf_to_gguf.py로 f16, llama-quantize로 Q4_K_M
  • Modelfile의 SYSTEM 프롬프트가 답변 품질에 큰 영향
  • Ollama는 CPU 추론을 지원하므로 GPU가 없어도 이 Phase는 끝까지 간다
정답 보기
에디터 로딩 중...
AI로 학습하기 — 꿀팁
GGUF 변환 품질 손실 검증AI 학습 팁

AI에게 fp16 원본과 Q4_K_M GGUF의 동일 질문 응답을 비교하면 양자화 품질 저하 수준과 허용 가능 여부를 평가해줍니다.

제조 AI 모델을 Q4_K_M GGUF로 변환 후 품질 저하를 검증해줘. 동일 질문 '설비 과열 알람 시 초동 조치 절차'에 대한 fp16 응답과 GGUF 응답을 비교하고, 안전 절차 누락 여부·수치 정확도·응답 완성도 차이를 분석해서 Q4_K_M이 제조 현장 배포에 적합한지 판단해줘.
이 팁이 도움이 됐나요?
용어