▶️25

[영상] GPT-4o 멀티모달 RAG 구현하기

Day 2: Hybrid Search

학습 목표

GPT-4o Vision의 이미지 이해를 RAG 파이프라인에 통합하는 세 가지 패턴을 설명할 수 있다 이미지·표·텍스트를 각각 요약해 통합 인덱스에 저장하는 멀티모달 청킹 전략을 설계할 수 있다 제조 도면 PDF에서 텍스트와 이미지를 추출·임베딩하는 코드 흐름을 작성할 수 있다 멀티모달 RAG와 텍스트 전용 RAG의 RAGAS 지표 차이를 해석할 수 있다

영상 핵심 정리 — GPT-4o 멀티모달 RAG

멀티모달 RAG 3가지 패턴

패턴방식장점단점
①텍스트 요약 인덱싱이미지→LLM→요약→임베딩기존 파이프라인 재사용정보 손실
②별도 이미지 인덱스CLIP 임베딩 별도 DB원본 이미지 검색복잡도↑
③멀티벡터 통합텍스트+이미지 동시 임베딩크로스모달모델 제한

제조 도면 RAG는 패턴 ①이 실용적.

이미지→텍스트 요약

import base64, openai

def image_to_summary(image_path):
    with open(image_path, 'rb') as f:
        b64 = base64.b64encode(f.read()).decode()
    client = openai.OpenAI()
    resp = client.chat.completions.create(
        model='gpt-4o',
        messages=[{'role': 'user', 'content': [
            {'type': 'image_url',
             'image_url': {'url': f'data:image/png;base64,{b64}'}},
            {'type': 'text',
             'text': '이 제조 도면에서 부품 번호, 재질, 허용 공차를 JSON으로 추출하라'}
        ]}]
    )
    return resp.choices[0].message.content

PDF 파싱 파이프라인

PDF 입력
  └─ unstructured.partition_pdf()
       ├─ TextElement  → 기존 청킹 → 임베딩
       ├─ TableElement → HTML 표 → LLM 요약 → 임베딩
       └─ ImageElement → base64 → GPT-4o Vision → 요약 → 임베딩

모든 요소 → 단일 Vectorstore (메타데이터 type, page 포함)

성능 비교 (RAGAS)

지표텍스트 전용멀티모달
Context Recall0.710.89
Faithfulness0.830.91
Answer Correctness0.680.84

함정 주의: GPT-4o Vision은 토큰 비용 5~10배. 색인 시점 미리 요약 저장, 검색 시 텍스트 임베딩만 사용해 비용 통제.

다음 task와의 연결

'BM25 + Vector + Rerank 3단 파이프라인'에서 멀티모달 인덱스에 하이브리드 검색과 Cross-Encoder Reranker를 결합한다.

AI로 학습하기 — 꿀팁
🤖멀티모달 RAG 이미지 처리 코드 생성AI 학습 팁

AI 에이전트에게 GPT-4o 멀티모달 RAG에서 제조 불량 이미지를 base64 인코딩해 처리하는 코드를 작성하게 하고, unstructured 라이브러리로 PDF 표·이미지를 분리 추출하는 방법을 검토하세요.

제조 불량 검사 보고서(이미지+텍스트 혼합 PDF)를 처리하는 GPT-4o 멀티모달 RAG 파이프라인을 구현해줘. unstructured 라이브러리로 PDF에서 표와 이미지를 자동 분리 추출하고, 불량 이미지를 base64 인코딩해 GPT-4o 메시지에 첨부하는 코드를 작성해줘. 이미지→텍스트 요약 후 인덱싱하는 패턴과 이미지 임베딩을 별도로 저장하는 패턴의 장단점도 비교해줘.
이 팁이 도움이 됐나요?
핵심 포인트
  • 멀티모달 3패턴: ①이미지→텍스트 요약 후 인덱싱, ②이미지 임베딩 별도, ③멀티벡터
  • GPT-4o: 이미지 base64 인코딩 후 메시지에 첨부
  • unstructured 라이브러리: PDF에서 표·이미지 자동 분리 추출
  • 멀티모달 추가 시 Context Recall 평균 15~25% 향상