90

Autoencoder 로 이상탐지 모델 만들기

진단 4단계 (Diagnostics)

학습 목표

정상 데이터만으로 이상탐지 모델을 학습시킨다 복원 오차 임계값을 정하고 성능을 평가한다

실습 — Autoencoder 이상탐지

Level 1 이상탐지를 실제로 구현합니다. 정상 데이터만 있으면 학습할 수 있어 제조 현장에 잘 맞습니다.

왜 Autoencoder 인가

입력을 압축했다가 다시 복원하도록 학습시키면, 모델은 정상 패턴을 재현하는 법을 배웁니다. 정상만 학습했으니 이상한 입력이 들어오면 잘 복원하지 못하고, 그 복원 오차가 곧 이상 점수가 됩니다.

입력(정상) → 압축(Encoder) → 잠재표현 → 복원(Decoder) → 출력
                                            복원 오차 작음 → 정상
                                            복원 오차 큼   → 이상

실습 절차

1. 데이터 준비

  • 정상 운전 구간만 골라 학습 세트로 씁니다 (이상 구간이 섞이면 이상까지 정상으로 배웁니다)
  • 특징으로는 2모듈에서 배운 시간 영역 지표(RMS·첨도·파고율)를 씁니다
  • 정규화를 반드시 합니다 — 스케일이 다르면 큰 값 변수가 오차를 지배합니다

2. 모델 구성

  • 입력 차원보다 좁은 잠재 차원을 둡니다 (병목이 있어야 압축이 일어납니다)
  • 너무 넓게 잡으면 입력을 그대로 통과시켜 이상도 잘 복원해 버립니다

3. 임계값 결정 학습 데이터의 복원 오차 분포를 보고 정합니다.

방법기준특징
백분위학습 오차의 99 백분위간단하고 실무에서 흔함
평균+kσ평균 + 3σ오차가 정규분포에 가까울 때
검증 세트 최적화실제 이상 구간으로 F1 최대화이상 라벨이 있어야 가능

4. 평가 — 정확도만 보지 않는다 이상은 드물기 때문에 정확도는 의미가 없습니다. 전부 정상이라고 답해도 99%가 나옵니다.

  • 정밀도(Precision): 이상이라고 한 것 중 실제 이상 비율 → 낮으면 오경보가 많음
  • 재현율(Recall): 실제 이상 중 잡아낸 비율 → 낮으면 놓치고 있음
  • 현장에서는 재현율을 먼저 확보하고 정밀도를 올립니다

제출물

  1. 학습 데이터 구성 방법과 정규화 결과
  2. 복원 오차 분포 그래프와 선택한 임계값, 그 근거
  3. 정밀도·재현율 표
  4. 오경보 사례 1건을 골라 왜 그렇게 판정됐는지 분석

4번이 중요합니다. 오경보의 원인이 운전 조건 변화인지 계측 이상인지 구분할 수 있어야 현장에 배포할 수 있습니다.

에디터 로딩 중...