90분
Autoencoder 로 이상탐지 모델 만들기
진단 4단계 (Diagnostics)
Autoencoder 로 이상탐지 모델 만들기
진단 4단계 (Diagnostics) > 진단 4단계 (Diagnostics)
학습 목표
정상 데이터만으로 이상탐지 모델을 학습시킨다 복원 오차 임계값을 정하고 성능을 평가한다
실습 — Autoencoder 이상탐지
Level 1 이상탐지를 실제로 구현합니다. 정상 데이터만 있으면 학습할 수 있어 제조 현장에 잘 맞습니다.
왜 Autoencoder 인가
입력을 압축했다가 다시 복원하도록 학습시키면, 모델은 정상 패턴을 재현하는 법을 배웁니다. 정상만 학습했으니 이상한 입력이 들어오면 잘 복원하지 못하고, 그 복원 오차가 곧 이상 점수가 됩니다.
입력(정상) → 압축(Encoder) → 잠재표현 → 복원(Decoder) → 출력
복원 오차 작음 → 정상
복원 오차 큼 → 이상
실습 절차
1. 데이터 준비
- 정상 운전 구간만 골라 학습 세트로 씁니다 (이상 구간이 섞이면 이상까지 정상으로 배웁니다)
- 특징으로는 2모듈에서 배운 시간 영역 지표(RMS·첨도·파고율)를 씁니다
- 정규화를 반드시 합니다 — 스케일이 다르면 큰 값 변수가 오차를 지배합니다
2. 모델 구성
- 입력 차원보다 좁은 잠재 차원을 둡니다 (병목이 있어야 압축이 일어납니다)
- 너무 넓게 잡으면 입력을 그대로 통과시켜 이상도 잘 복원해 버립니다
3. 임계값 결정 학습 데이터의 복원 오차 분포를 보고 정합니다.
| 방법 | 기준 | 특징 |
|---|---|---|
| 백분위 | 학습 오차의 99 백분위 | 간단하고 실무에서 흔함 |
| 평균+kσ | 평균 + 3σ | 오차가 정규분포에 가까울 때 |
| 검증 세트 최적화 | 실제 이상 구간으로 F1 최대화 | 이상 라벨이 있어야 가능 |
4. 평가 — 정확도만 보지 않는다 이상은 드물기 때문에 정확도는 의미가 없습니다. 전부 정상이라고 답해도 99%가 나옵니다.
- 정밀도(Precision): 이상이라고 한 것 중 실제 이상 비율 → 낮으면 오경보가 많음
- 재현율(Recall): 실제 이상 중 잡아낸 비율 → 낮으면 놓치고 있음
- 현장에서는 재현율을 먼저 확보하고 정밀도를 올립니다
제출물
- 학습 데이터 구성 방법과 정규화 결과
- 복원 오차 분포 그래프와 선택한 임계값, 그 근거
- 정밀도·재현율 표
- 오경보 사례 1건을 골라 왜 그렇게 판정됐는지 분석
4번이 중요합니다. 오경보의 원인이 운전 조건 변화인지 계측 이상인지 구분할 수 있어야 현장에 배포할 수 있습니다.
에디터 로딩 중...