60분
엔티티 해소 — 같은 것을 같다고 인식하기
문서에서 그래프로
엔티티 해소 — 같은 것을 같다고 인식하기
문서에서 그래프로 > 문서에서 그래프로
학습 목표
표기 흔들림을 통합하는 방법을 안다 과잉 통합의 위험을 이해한다
같은 설비, 다른 이름
문서마다 표기가 다릅니다. 이걸 통합하지 않으면 그래프가 조각납니다.
"프레스 1호기" "프레스1호기" "프레스 #1" "PRESS01" "1호 프레스"
통합하지 않으면 같은 설비가 5개 노드가 되고, 관계도 흩어집니다.
해소 방법 — 2단계
1단계: 표기 정규화 (lexical)
- 공백·특수문자 제거, 대소문자 통일
- 숫자 표기 통일 (
1호기=#1=01) - 별칭 사전 적용 (설비 마스터가 있으면 여기서 씁니다 — 코스1 3모듈)
2단계: 의미 유사도 (embedding) 표기가 많이 달라도 의미가 같은 경우를 잡습니다.
- "감속기" ↔ "리듀서" ↔ "기어박스"
- 임베딩 유사도가 임계값을 넘으면 후보로 제시
과잉 통합의 위험
합치면 안 되는 것을 합치는 실수가 더 위험합니다.
| 위험한 통합 | 왜 |
|---|---|
| "베어링 6205" ↔ "베어링 6206" | 다른 규격 — 호환되지 않음 |
| "프레스 1호기" ↔ "프레스 2호기" | 다른 설비 — 이력이 섞임 |
| "1차 세척" ↔ "2차 세척" | 다른 공정 |
숫자가 다르면 다른 것일 가능성이 높습니다. 자동 통합에서 숫자 차이는 보수적으로 다뤄야 합니다.
실무 권장
- 자동 통합은 높은 확신도만 (표기 정규화 수준)
- 애매한 후보는 사람에게 제시하고 판단받기
- 통합 이력을 남겨 되돌릴 수 있게 하기
설비 마스터(코스1)가 있으면 이 단계가 훨씬 쉬워집니다. 별칭 목록이 곧 정답지니까요.