20

설비 매뉴얼 800페이지, 텍스트만으론 부족하다

Day 1: 멀티모달 RAG

학습 목표

제조 문서의 멀티모달 특성을 이해한다 텍스트 전용 RAG의 한계를 파악한다 멀티모달 RAG가 해결하는 문제를 설명할 수 있다

월요일 아침, 긴급 호출

"이 도면 보고 공차 알려줘. 매뉴얼에 있다며?"

현장 엔지니어가 태블릿을 들이밀었다. CAD 도면이다. 치수선, 공차 기호, 표면 거칠기 마크가 빼곡하다.

당신이 만든 RAG 시스템에 물어본다:

질문: "SPN-200 주축 베어링 허용 공차는?"
RAG 답변: "해당 정보를 찾을 수 없습니다."

정보가 없는 게 아니다. 매뉴얼 147페이지에 도면으로 있다. 텍스트가 아니라 이미지라서 RAG가 못 찾은 것이다.


제조 문서는 텍스트만이 아니다

제조 현장의 문서를 열어보자:

문서 유형텍스트이미지다이어그램
장비 매뉴얼OO (부품 사진)O (사양표)O (회로도)
SOP (표준작업절차서)OO (작업 사진)XO (순서도)
품질 기준서OO (검사 사진)O (허용 범위)X
조립 가이드OO (조립 사진)O (부품표/BOM)O (분해도)
도면 (CAD)XO (2D/3D)O (치수표)O (단면도)
검사 성적서OO (불량 사진)O (측정값)O (차트)
MSDSOO (위험 표시)O (물성표)X
KOSHA 안전지침OO (경고 표시)O (기준표)O (안전 절차도)

텍스트만 추출하면 정보의 40~60%를 잃는다.


실제 사례: 텍스트 RAG vs 멀티모달 RAG

사례 1: 도면 기반 질문

질문: "SPN-200 주축 베어링의 허용 공차는?"

[텍스트 RAG]
-> 매뉴얼에서 "주축 베어링" 키워드 검색
-> 텍스트 설명만 반환: "주축 베어링은 정밀 부품으로..."
-> 공차 수치? 없음. 도면에만 있으니까.

[멀티모달 RAG]
-> 매뉴얼 전체 파싱 (텍스트 + 이미지 + 표)
-> 도면 이미지를 GPT-4o (비전 내장)로 분석: "베어링 내경 62mm, 공차 +0.000/-0.013"
-> 사양표에서 추가 정보: "C3 등급, 윤활: ISO VG 68"
-> 정확한 답변 제공

사례 2: 불량 사진 분석

질문: "이 용접 불량 사진과 비슷한 사례의 원인은?"

[텍스트 RAG]
-> "용접 불량" 키워드로 검색
-> 일반적인 용접 불량 원인 나열
-> 사진과 매칭 불가

[멀티모달 RAG]
-> 불량 사진을 CLIP 임베딩으로 변환
-> 유사 불량 사진 검색 (코사인 유사도)
-> 매칭된 과거 사례: "기공(blowhole) - 가스 차폐 불량"
-> 원인과 대책 함께 제공

사례 3: MSDS 위험물 정보

질문: "이 화학물질의 소방 대응 방법은?"

[텍스트 RAG]
-> MSDS 텍스트에서 검색
-> 일부 정보만 반환

[멀티모달 RAG]
-> MSDS의 GHS 경고 표시 이미지 인식
-> 물성표 데이터 정확히 추출
-> 소방 대응표 구조 보존하여 반환

이번 Day에서 배울 것

오늘이 끝나면:

  • PDF에서 텍스트, 이미지, 표를 분리 추출할 수 있다
  • GPT-4o (비전 내장)로 제조 도면/사진을 분석할 수 있다
  • 멀티모달 임베딩으로 통합 검색 시스템을 구축할 수 있다
  • 제조 현장 20개 시나리오에 답할 수 있는 RAG를 만든다

시작하자.

AI로 학습하기 — 꿀팁
🧪설비 매뉴얼 멀티모달 특성 체감AI 학습 팁

800페이지 설비 매뉴얼의 도면·표·경고 박스를 텍스트만으로 RAG에 넣으면 어떤 정보가 손실되는지, 실제 질문 유형으로 체감해 보세요.

제조 설비 유지보수 매뉴얼에서 텍스트만 추출해 RAG를 구성할 때 어떤 정보가 소실되는지 구체적으로 설명해줘. 시나리오: 유압 시스템 분해·조립 매뉴얼(PDF, 배관 계통도 15장, 토크 스펙 표 20개, 안전 경고 박스 40개 포함). 현장 엔지니어가 물을 법한 질문 5가지와 함께, 텍스트 전용 RAG가 왜 각 질문에 제대로 답하지 못하는지 설명해줘. 특히 '3번 포트의 최대 허용 압력은?'처럼 도면 위치 정보가 필요한 케이스를 포함해줘.
이 팁이 도움이 됐나요?