30

제조 sLLM 평가 프레임워크: 5가지 평가 축

평가 & 배포

학습 목표

정량적/정성적 평가 방법을 구분하고 적용할 수 있다 제조 도메인 특화 평가 기준을 설정할 수 있다 A/B 비교 평가 방법을 이해한다

제조 sLLM 평가 프레임워크

5가지 평가 축

1. 정확성 (Accuracy)
   - 기술적으로 올바른 정보인가?
   - 수치, 절차, 용어가 정확한가?

2. 구체성 (Specificity)
   - 구체적인 수치와 절차를 포함하는가?
   - "전문가에게 문의" 같은 회피 답변이 아닌가?

3. 안전성 (Safety)
   - 안전 주의사항을 포함하는가?
   - 위험한 행동을 권장하지 않는가?
   - LOTO, 보호구 관련 언급이 있는가?

4. 형식성 (Format)
   - 구조화된 답변인가? (제목, 절차, 주의사항)
   - 일관된 형식을 유지하는가?

5. 유용성 (Usefulness)
   - 현장 엔지니어가 바로 적용할 수 있는가?
   - 불필요한 정보 없이 핵심만 답변하는가?

평가 방법 1: 자동 평가 (정량적)

BLEU Score (Bilingual Evaluation Understudy):
  - n-gram 일치율 측정
  - 0~1 (1이 완벽 일치)
  - 한계: 다른 표현의 정확한 답변도 낮게 평가

ROUGE Score:
  - 재현율(Recall) 기반
  - ROUGE-1 (단어), ROUGE-2 (바이그램), ROUGE-L (최장 공통 부분열)
  - 요약 평가에 적합

키워드 매칭:
  - 제조 핵심 키워드 포함 여부
  - 예: "LOTO", "안전", "온도", "진동" 등

LLM-as-Judge:
  - GPT-4로 답변 품질 평가
  - 프롬프트: "다음 답변의 정확성/구체성/안전성을 1-5점으로 평가하세요"
  - 가장 사람 평가에 가까운 자동 평가

평가 방법 2: A/B 비교 평가

방법: 동일 질문에 대해 기본 모델 vs 파인튜닝 모델 비교

평가표:
  질문 | 기본 모델 답변 | 파인튜닝 답변 | 승자 | 이유
  -----|-------------|-------------|------|-----
  Q1   | "전문가 문의" | 5단계 절차  | 파인튜닝 | 구체적
  Q2   | "냉각 확인"  | 온도별 조치  | 파인튜닝 | 수치 포함
  Q3   | 잘못된 절차   | 정확한 절차  | 파인튜닝 | 정확성

승률 = 파인튜닝 승리 / 전체 질문 수
목표: 70% 이상 (파인튜닝이 기본보다 나은 비율)

평가 데이터셋 구성

평가 데이터: 학습에 사용하지 않은 50-100건

카테고리별:
  장비 알람 Q&A:     10건
  고장 진단:         10건
  SOP/절차:         10건
  품질 판정:         10건
  안전 상황:         10건

각 건에 정답(Ground Truth) 포함:
{
  "question": "스핀들 과열 알람 대응법은?",
  "context": "온도: 78도",
  "ground_truth": "1.정지 2.냉각 3.냉각수확인 4.베어링점검 5.시운전",
  "safety_keywords": ["LOTO", "고온접촉금지", "보호구"],
  "critical_numbers": ["75도", "4.5mm/s"]
}
AI로 학습하기 — 꿀팁
🤖제조 sLLM 5축 평가 체크리스트AI 학습 팁

정량·정성 평가 5가지 축을 제조 도메인 기준으로 항목화한 체크리스트를 만들면 모델 출시 전 평가를 빠짐없이 수행할 수 있습니다.

제조 설비 진단 sLLM을 배포 전 평가하기 위한 5축 평가 체크리스트를 마크다운으로 만들어줘. 5가지 축: (1) 사실 정확도 — 고장 코드·부품명 정확성, (2) 절차 완전성 — PM 단계 누락 없음, (3) 안전 준수 — 위험 경고 포함 여부, (4) 거절 능력 — 모르는 질문에 '모른다' 답변, (5) 응답 속도 — 추론 레이턴시. 각 축마다: 평가 방법(자동/수동) / 합격 기준 수치 / 테스트 예시 질문 2개씩 포함해줘.
이 팁이 도움이 됐나요?
핵심 포인트
  • 5가지 평가 축: 정확성, 구체성, 안전성, 형식성, 유용성
  • 자동 평가: BLEU/ROUGE + 키워드 매칭 + LLM-as-Judge
  • A/B 비교: 기본 vs 파인튜닝 승률 70%+ 목표
  • 평가 데이터: 학습 미사용 50-100건 (Ground Truth 포함)