30

RAG 아키텍처 심층 이해

Day 1: RAG 개요 & 제조 문서 이해

학습 목표

RAG 시스템의 전체 아키텍처를 상세히 파악한다 Naive RAG vs Advanced RAG 차이를 이해한다 제조 RAG에 필요한 추가 구성요소를 학습한다

RAG 아키텍처 전체 그림

지금까지 RAG의 기본 개념을 배웠다. 이제 "실제로 어떻게 구성하는지" 아키텍처를 깊이 살펴보자.


Naive RAG vs Advanced RAG

Naive RAG (기본형)

문서 -> 청킹 -> 임베딩 -> Vector DB -> 검색 -> LLM -> 답변

장점: 빠르게 구현 가능 (30분이면 동작)
단점: 검색 정확도 낮음, 환각 여전히 존재

Advanced RAG (발전형)

                      Advanced RAG Pipeline
   ┌─────────────────────────────────────────────────────┐
   │                                                     │
   │  [Pre-Retrieval]                                    │
   │  ┌───────────┐  ┌──────────┐  ┌──────────────────┐ │
   │  │ 쿼리 변환 │  │ 쿼리 분해│  │ HyDE             │ │
   │  │ (Rewrite) │  │ (Decomp) │  │(가설 문서 생성)  │ │
   │  └───────────┘  └──────────┘  └──────────────────┘ │
   │                                                     │
   │  [Retrieval]                                        │
   │  ┌───────────┐  ┌──────────┐  ┌──────────────────┐ │
   │  │ 벡터 검색 │  │ BM25     │  │ 하이브리드       │ │
   │  │ (Dense)   │  │(Sparse)  │  │ (Dense+Sparse)   │ │
   │  └───────────┘  └──────────┘  └──────────────────┘ │
   │                                                     │
   │  [Post-Retrieval]                                   │
   │  ┌───────────┐  ┌──────────┐  ┌──────────────────┐ │
   │  │ Re-Ranking│  │ 압축     │  │ 중복 제거        │ │
   │  │ (Rerank)  │  │(Compress)│  │ (Dedup)          │ │
   │  └───────────┘  └──────────┘  └──────────────────┘ │
   │                                                     │
   │  [Generation]                                       │
   │  ┌───────────┐  ┌──────────┐                       │
   │  │ 프롬프트  │  │ 출처 추적│                       │
   │  │ 엔지니어링│  │ Citation │                       │
   │  └───────────┘  └──────────┘                       │
   └─────────────────────────────────────────────────────┘

제조 RAG에 필요한 추가 구성요소

일반 RAG와 제조 RAG의 차이를 정리하면:

구성요소일반 RAG제조 RAG (추가 필요)
문서 로드PDF, TXT+ 도면(DWG), 이미지(OCR)
청킹고정 크기+ 섹션 기반, SOP 절차 단위
임베딩영어 모델+ 다국어/한국어 모델
메타데이터파일명 정도+ 설비ID, 버전, 승인일
검색유사도+ 메타데이터 필터링
생성일반 답변+ 출처 의무 표시, 주의사항
평가BLEU/ROUGE+ 도메인 정확도, 안전성

이번 주 학습 로드맵

Day 1 (오늘): RAG 개요 + 제조 문서 이해        [현재 위치]
Day 2:         청킹 전략 + 임베딩 모델 비교       --------+
Day 3:         벡터 DB (Chroma, Pinecone) 실습    --------+
Day 4:         RAG 파이프라인 구축 + 프롬프트       --------+
Day 5:         기술문서 RAG 시스템 프로젝트         --------+

오늘 배운 것을 요약하면:

  1. RAG는 "내 문서에서 찾아서 답하는 기술"
  2. 제조 문서는 구조, 용어, 표, 다국어, 버전 관리가 특수
  3. 문서 로더 선택이 RAG 품질의 시작

내일은 문서를 어떻게 "잘 쪼개는지(청킹)" 배운다. 청킹을 잘못하면 아무리 좋은 LLM도 쓸모없다.

AI로 학습하기 — 꿀팁
Advanced RAG 컴포넌트 과장 주장 검증AI 학습 팁

Naive RAG vs Advanced RAG 비교에서 AI가 Advanced RAG의 효과를 과장하거나 잘못된 아키텍처 설명을 제공할 수 있으므로 비판적 검증이 필요하다.

다음 RAG 아키텍처 관련 주장들을 검증해줘: 1) 'Advanced RAG의 HyDE(가설 문서 임베딩)는 항상 Naive RAG보다 검색 정확도가 높다', 2) 'RAG 파이프라인에서 Re-ranking 단계는 항상 지연 시간을 2배 이상 증가시킨다', 3) 'Modular RAG는 Naive RAG와 Advanced RAG의 모든 컴포넌트를 포함한다', 4) 'RAG 시스템에서 LLM은 반드시 검색된 문서 전체를 컨텍스트로 받아야 한다'. 제조 설비 트러블슈팅 시스템을 예시로 각 주장의 맞음/틀림과 실제 현장 적용 시 트레이드오프를 설명해줘.
이 팁이 도움이 됐나요?