▶️25분
[영상] GPT-4o 멀티모달 RAG 구현하기
Day 2: Hybrid Search
[영상] GPT-4o 멀티모달 RAG 구현하기
RAG 심화 > Day 2: Hybrid Search
학습 목표
GPT-4o Vision의 이미지 이해를 RAG 파이프라인에 통합하는 세 가지 패턴을 설명할 수 있다 이미지·표·텍스트를 각각 요약해 통합 인덱스에 저장하는 멀티모달 청킹 전략을 설계할 수 있다 제조 도면 PDF에서 텍스트와 이미지를 추출·임베딩하는 코드 흐름을 작성할 수 있다 멀티모달 RAG와 텍스트 전용 RAG의 RAGAS 지표 차이를 해석할 수 있다
영상 핵심 정리 — GPT-4o 멀티모달 RAG
멀티모달 RAG 3가지 패턴
| 패턴 | 방식 | 장점 | 단점 |
|---|---|---|---|
| ①텍스트 요약 인덱싱 | 이미지→LLM→요약→임베딩 | 기존 파이프라인 재사용 | 정보 손실 |
| ②별도 이미지 인덱스 | CLIP 임베딩 별도 DB | 원본 이미지 검색 | 복잡도↑ |
| ③멀티벡터 통합 | 텍스트+이미지 동시 임베딩 | 크로스모달 | 모델 제한 |
제조 도면 RAG는 패턴 ①이 실용적.
이미지→텍스트 요약
import base64, openai
def image_to_summary(image_path):
with open(image_path, 'rb') as f:
b64 = base64.b64encode(f.read()).decode()
client = openai.OpenAI()
resp = client.chat.completions.create(
model='gpt-4o',
messages=[{'role': 'user', 'content': [
{'type': 'image_url',
'image_url': {'url': f'data:image/png;base64,{b64}'}},
{'type': 'text',
'text': '이 제조 도면에서 부품 번호, 재질, 허용 공차를 JSON으로 추출하라'}
]}]
)
return resp.choices[0].message.content
PDF 파싱 파이프라인
PDF 입력
└─ unstructured.partition_pdf()
├─ TextElement → 기존 청킹 → 임베딩
├─ TableElement → HTML 표 → LLM 요약 → 임베딩
└─ ImageElement → base64 → GPT-4o Vision → 요약 → 임베딩
모든 요소 → 단일 Vectorstore (메타데이터 type, page 포함)
성능 비교 (RAGAS)
| 지표 | 텍스트 전용 | 멀티모달 |
|---|---|---|
| Context Recall | 0.71 | 0.89 |
| Faithfulness | 0.83 | 0.91 |
| Answer Correctness | 0.68 | 0.84 |
함정 주의: GPT-4o Vision은 토큰 비용 5~10배. 색인 시점 미리 요약 저장, 검색 시 텍스트 임베딩만 사용해 비용 통제.
다음 task와의 연결
'BM25 + Vector + Rerank 3단 파이프라인'에서 멀티모달 인덱스에 하이브리드 검색과 Cross-Encoder Reranker를 결합한다.
AI로 학습하기 — 꿀팁
🤖멀티모달 RAG 이미지 처리 코드 생성AI 학습 팁
AI 에이전트에게 GPT-4o 멀티모달 RAG에서 제조 불량 이미지를 base64 인코딩해 처리하는 코드를 작성하게 하고, unstructured 라이브러리로 PDF 표·이미지를 분리 추출하는 방법을 검토하세요.
제조 불량 검사 보고서(이미지+텍스트 혼합 PDF)를 처리하는 GPT-4o 멀티모달 RAG 파이프라인을 구현해줘. unstructured 라이브러리로 PDF에서 표와 이미지를 자동 분리 추출하고, 불량 이미지를 base64 인코딩해 GPT-4o 메시지에 첨부하는 코드를 작성해줘. 이미지→텍스트 요약 후 인덱싱하는 패턴과 이미지 임베딩을 별도로 저장하는 패턴의 장단점도 비교해줘.
이 팁이 도움이 됐나요?
핵심 포인트
- • 멀티모달 3패턴: ①이미지→텍스트 요약 후 인덱싱, ②이미지 임베딩 별도, ③멀티벡터
- • GPT-4o: 이미지 base64 인코딩 후 메시지에 첨부
- • unstructured 라이브러리: PDF에서 표·이미지 자동 분리 추출
- • 멀티모달 추가 시 Context Recall 평균 15~25% 향상
