[영상] AI 시대, 그래프 DB가 주목받는 이유
설비-공정 Knowledge Graph
[영상] AI 시대, 그래프 DB가 주목받는 이유
온톨로지 & Knowledge Graph > 설비-공정 Knowledge Graph
- LLM 시대 이후 그래프DB 시장이 다시 부상한 3가지 동인 (환각·구조 추론·감사) 을 설명한다
- GraphRAG 가 단순 RAG 보다 유리해지는 질문 유형을 들고, 그 차이를 무엇으로 재는지 지표 이름으로 답한다
- 주간 프로젝트 (Step 1~5) 의 전체 흐름을 한 문장으로 요약한다
- 본인 산업에서 '관계가 답인' 질의 사례 3개를 떠올린다
영상 핵심 정리 — 그래프DB 의 재부상
이 영상은 "왜 2024년 그래프DB 시장이 다시 두 자릿수 성장하는가" 를 LLM/KG 시너지로 설명한다.
1. 그래프DB 부상의 3가지 동인
동인 1: 환각 (Hallucination)
LLM 단독: 그럴듯한 거짓말
LLM + KG: "근거 노드/관계를 인용해" 답변 → 검증 가능
동인 2: 구조 추론 (Reasoning)
Vector RAG: 유사 문서만 검색 → "왜?" 추론 불가
Graph: 인과 사슬(원인→증상→조치) 따라가며 "왜?" 5단 답변
동인 3: 감사 (Auditability)
LLM 답변의 추적: 어떤 문서 어떤 노드를 봤는지 명시
→ 제조/금융/의료 등 규제 산업의 필수 조건위 3가지 동인이 동시에 작동하면 그래프DB 가 '옵션'에서 '필수' 로 바뀐다.
2. 무엇을 재야 차이가 보이는가
세 방식의 우열을 말하려면 아래 세 가지를 자기 데이터로 재야 한다. 숫자를 미리 적어 두지 않는 이유는, 공개된 수치들이 서로 다른 데이터셋과 다른 채점 기준에서 나와 그대로 옮기면 사내 보고서에서 재현되지 않기 때문이다.
| 지표 | 재는 방법 |
|---|---|
| 근거 없는 문장 비율 | 답변 문장마다 KG 노드나 문서 조각으로 뒷받침되는지 사람이 표시 |
| 출처 인용 비율 | 답변에 노드 id 나 문서 id 가 함께 나온 비율 |
| 다중 hop 질의 정답률 | 두 홉 이상 따라가야 답이 되는 질문 20개를 골든셋으로 만들어 채점 |
→ 차이는 다중 hop 질의("왜?"를 여러 번 묻는 질문)에서 크게 벌어진다.
단순 사실 질의에서는 Vector 만으로도 충분한 경우가 많다.
Day 4 의 p8w7-d4-evaluation 이 이 측정을 실제로 하는 절이다.
3. 시장 흐름 한눈에
2020~2022: NoSQL 붐 잔존, MongoDB/Neo4j 후순위
2023 : LLM 폭발, Vector DB (Pinecone 등) 폭발
2024 : RAG 한계 인식 (환각/추론) → GraphRAG 부상
2025~ : Hybrid (Vector + Graph) 가 표준 아키텍처시장 규모나 투자액을 인용하려면 발표 기관과 연도, 집계 기준을 함께 적는다. 조사기관마다 그래프DB 의 범위를 다르게 잡아 같은 해 수치가 몇 배씩 차이 난다.
4. 주간 프로젝트 한 문장 요약
"오늘부터 5일간, 설비-공정-부품-고장의 미니 온톨로지를 그리고, Neo4j 에 데이터를 적재한 뒤, GraphRAG 로 자연어 Q&A 시스템을 한 개 완성한다."
Step 1: 확장 온톨로지 설계 (50분)
→ 영상 + Day 1~3 학습을 종합
Step 2-3: Neo4j 데이터 구축 + 핵심 분석 쿼리 (70분)
→ Day 2 Cypher 실습 응용
Step 4: Q&A 시스템 통합 (60분)
→ Day 4 GraphRAG 패턴 적용
Step 5: 문서화 및 최종 제출 (35분)
→ 코드 + 데모 영상 (선택) + 회고5. "관계가 답인 질의" — 본인 산업에서 3개
오늘 종이에 적어보자:
질문 1: "___ 의 원인은 무엇인가?" (예: 불량률 상승 원인)
질문 2: "___ 에 영향을 미치는 것은?" (예: 신제품 라인 가동 → 어느 라인이 영향?)
질문 3: "___ 과 가장 연결된 것은?" (예: 이 베어링 고장 - 다른 어느 부품 점검?)이 세 질문이 다음 5단계 프로젝트의 요구사항 이 된다.
다음 task 와의 연결
다음 reading 에서 주간 프로젝트의 5단계 전체 개요를 본다. 위 "관계가 답인 질의" 3개를 가지고 다음 페이지로 가자.
LLM에 Knowledge Graph를 결합할 때 환각률이 40%에서 8%로 줄어드는 메커니즘을 AI에게 제조 도메인 예시로 설명받아 KG가 왜 LLM의 사실성을 높이는지 이해하세요.
제조 설비 진단 LLM에 Knowledge Graph를 결합했을 때 환각률이 크게 줄어드는 이유를 설명해줘. KG가 없을 때 LLM이 설비 부품 관계나 고장 원인을 잘못 생성하는 사례, KG 트리플을 컨텍스트로 주입했을 때 사실 기반 답변이 어떻게 달라지는지 비교 예시로 보여줘. '온톨로지 → Neo4j → GraphRAG → Q&A' 전체 흐름도 정리해줘.
- • 2020~2022 NoSQL 붐 이후 잠잠하던 그래프DB 가 2024 LLM 시대에 다시 표준 인프라로 부상
- • LLM + KG 의 이점은 다중 hop 질문에서 크게 벌어진다. 크기는 각자 골든셋으로 재고, 남의 벤치마크 수치를 옮겨 적지 않는다
- • 주간 프로젝트는 '온톨로지 → Neo4j → GraphRAG → Q&A' 5단계를 1주에 완성하는 미니 시스템
- • 관계가 답인 질의: '~의 원인은?', '~에 영향을 미치는 것은?', '~과 가장 연결된 것은?'
