60분
LLM 추출 파이프라인
문서에서 그래프로
LLM 추출 파이프라인
문서에서 그래프로 > 문서에서 그래프로
학습 목표
문서→그래프 추출 단계를 안다 추출 품질을 좌우하는 요인을 파악한다
문서에서 그래프를 뽑는 과정
전체 흐름
① 문서 수집 → ② 청킹 → ③ LLM 추출 → ④ 엔티티 해소 → ⑤ 그래프 적재 → ⑥ 검수
① 문서 수집
매뉴얼(PDF), 정비 일지(엑셀), 보고서(워드), 위키. 형식이 제각각이라 텍스트 추출이 먼저입니다.
② 청킹 — 어디서 자를 것인가
LLM은 한 번에 처리할 수 있는 길이가 정해져 있습니다. 문서를 잘라야 합니다.
자를 때 주의
- 문단 중간에서 자르면 관계가 끊깁니다 ("이것의 원인은" 에서 잘리면 원인을 잃음)
- 겹침(overlap)을 두어 경계 정보를 보존합니다
- 표는 통째로 유지하는 편이 낫습니다
③ LLM 추출 — 프로파일이 결정한다
어떤 타입을 뽑을지 미리 지정해야 일관된 결과가 나옵니다.
| 지정 없이 | 타입 지정 후 |
|---|---|
| "감속기", "감속 장치", "리듀서"가 제각각 | 모두 Component 로 통일 |
| 관계 이름이 매번 달라짐 | HAS_COMPONENT 로 고정 |
제조 프로파일을 쓰면 앞서 배운 12개 엔티티·14개 관계 타입으로 추출됩니다.
④ 엔티티 해소
"프레스 1호기", "프레스1", "PRESS01"을 같은 것으로 인식하는 단계. 다음 태스크에서 자세히.
⑤ 적재
노드·관계를 그래프 DB에 넣습니다. 이때 출처(어느 문서 몇 페이지) 를 함께 저장해야 나중에 근거를 제시할 수 있습니다.
⑥ 검수
자동 추출 결과를 사람이 확인합니다. 전수 검수는 불가능하므로:
- 신뢰도가 낮은 항목 우선
- 새로 등장한 타입·관계 우선
- 중요 설비 관련 항목 우선