▶️25분
[영상] Anomaly Detection 개론 — 확률분포 기반
Day 3: 고장 분류 모델
[영상] Anomaly Detection 개론 — 확률분포 기반
예지보전 — 설비 고장 예측 시스템 > Day 3: 고장 분류 모델
학습 목표
확률 분포 기반 이상 탐지(가우시안 MLE, 마할라노비스)의 원리를 설명할 수 있다 Isolation Forest의 격리 트리와 anomaly score 계산 방식을 이해할 수 있다 AutoEncoder 재구성 오차로 이상을 판별하는 로직을 구현할 수 있다 레이블 없는 제조 데이터에서 비지도 전략을 선택할 수 있다
영상 핵심 정리 — 비지도 이상 탐지 알고리즘
| 알고리즘 | 가정 | 강점 | 제조 적합도 |
|---|---|---|---|
| 가우시안 MLE | 정규 분포 | 해석 쉬움 | ★★☆ |
| Isolation Forest | 비파라메트릭 | 고차원·대용량 | ★★★ |
| AutoEncoder | 없음 | 복잡 패턴 | ★★★ |
| 마할라노비스 | 다변량 정규 | 상관관계 반영 | ★★☆ |
from sklearn.ensemble import IsolationForest
from sklearn.preprocessing import StandardScaler
scaler = StandardScaler()
X_train = scaler.fit_transform(sensor_df[['vib_rms','temp','current']])
model = IsolationForest(
n_estimators=200, contamination=0.02, random_state=42
)
model.fit(X_train)
scores = model.decision_function(X_train)
preds = model.predict(X_train) # -1=이상, 1=정상
print(f'이상 탐지 비율: {(preds == -1).mean()*100:.2f}%')
contamination=0.02는 전체의 2%를 이상으로 간주. 실제 불량률 데이터가 있으면 그 값으로 튜닝.
함정 주의: AutoEncoder 재구성 오차 임계값을 훈련 세트 통계로만 정하면 신규 제품 라인 투입 시 오경보율 폭증. 임계값은 정상 데이터 재구성 오차의 mean + 3×std로 설정하고, 설비 교체 후 재보정.
다음 task와의 연결
다음 reading에서 Isolation Forest와 AutoEncoder를 고장 유형 분류기로 확장한다. anomaly score + 레이블 인코딩으로 다중 클래스 진단 가능.
AI로 학습하기 — 꿀팁
✅이상탐지 알고리즘 적합성 검증AI 학습 팁
Isolation Forest·AutoEncoder·마할라노비스 거리 세 방법을 제조 센서 데이터에 적용할 때 각 알고리즘의 가정과 한계를 AI로 점검하고 잘못 선택했을 때의 결과를 확인하세요.
스마트팩토리 센서 이상탐지에 Isolation Forest, AutoEncoder, 마할라노비스 거리를 각각 잘못 선택한 시나리오를 만들어줘. 마할라노비스 거리를 비선형 이상 패턴에 적용했을 때의 실패 사례, AutoEncoder가 정상 패턴만 학습했는데 학습 데이터에 이상이 섞였을 때의 문제, Isolation Forest가 고밀도 이상값 군집에서 실패하는 경우를 각각 설명하고 올바른 선택 기준을 제시해줘.
이 팁이 도움이 됐나요?
핵심 포인트
- • Isolation Forest: 이상값은 적은 분기 수로 격리 — O(n log n) 고속
- • AutoEncoder: 정상 패턴만 학습 → 이상은 재구성 오차가 큼
- • 마할라노비스: 다변량 정상 분포 가정 — 비선형 이상에 약함
- • 하이브리드(AE + IF): AE 잔차를 IF에 입력하면 탐지율↑
