60

LLM 추출 파이프라인

문서에서 그래프로

학습 목표

문서→그래프 추출 단계를 안다 추출 품질을 좌우하는 요인을 파악한다

문서에서 그래프를 뽑는 과정

전체 흐름

① 문서 수집 → ② 청킹 → ③ LLM 추출 → ④ 엔티티 해소 → ⑤ 그래프 적재 → ⑥ 검수

① 문서 수집

매뉴얼(PDF), 정비 일지(엑셀), 보고서(워드), 위키. 형식이 제각각이라 텍스트 추출이 먼저입니다.

② 청킹 — 어디서 자를 것인가

LLM은 한 번에 처리할 수 있는 길이가 정해져 있습니다. 문서를 잘라야 합니다.

자를 때 주의

  • 문단 중간에서 자르면 관계가 끊깁니다 ("이것의 원인은" 에서 잘리면 원인을 잃음)
  • 겹침(overlap)을 두어 경계 정보를 보존합니다
  • 표는 통째로 유지하는 편이 낫습니다

③ LLM 추출 — 프로파일이 결정한다

어떤 타입을 뽑을지 미리 지정해야 일관된 결과가 나옵니다.

지정 없이타입 지정 후
"감속기", "감속 장치", "리듀서"가 제각각모두 Component 로 통일
관계 이름이 매번 달라짐HAS_COMPONENT 로 고정

제조 프로파일을 쓰면 앞서 배운 12개 엔티티·14개 관계 타입으로 추출됩니다.

④ 엔티티 해소

"프레스 1호기", "프레스1", "PRESS01"을 같은 것으로 인식하는 단계. 다음 태스크에서 자세히.

⑤ 적재

노드·관계를 그래프 DB에 넣습니다. 이때 출처(어느 문서 몇 페이지) 를 함께 저장해야 나중에 근거를 제시할 수 있습니다.

⑥ 검수

자동 추출 결과를 사람이 확인합니다. 전수 검수는 불가능하므로:

  • 신뢰도가 낮은 항목 우선
  • 새로 등장한 타입·관계 우선
  • 중요 설비 관련 항목 우선