20

데모 RAG와 프로덕션 RAG는 다른 세계다

Day 4: 프로덕션 RAG

학습 목표

데모 수준 RAG와 프로덕션 RAG의 차이를 이해한다 Self-RAG, Corrective RAG, Adaptive RAG 패턴의 필요성을 파악한다 프로덕션 환경에서 발생하는 문제를 예측할 수 있다

목요일 오후, 배포 후 1주일

"RAG 시스템 배포했는데, 현장에서 불만이 들어와."

불만 내용을 정리해보니:

불만 1: "OEE가 뭔지 물어봤는데 굳이 검색해서 느려"
-> 상식적인 질문인데 왜 검색을 하는 거야?

불만 2: "주축 공차 물어봤더니 엉뚱한 장비 매뉴얼을 참조함"
-> 검색 결과가 틀렸는데 그걸 바탕으로 답변을 생성함

불만 3: "간단한 질문은 바로 답하고, 어려운 질문만 자세히 해줬으면"
-> 모든 질문을 똑같이 처리하니 비효율적

세 가지 불만의 공통점: 기존 RAG는 모든 질문을 똑같이 처리한다.


Naive RAG의 한계

[기존 Naive RAG]

질문이 뭐든 간에:
1. 벡터 DB에서 검색 (항상)
2. 검색 결과를 컨텍스트로 (항상)
3. LLM으로 답변 생성 (항상)

문제:
- 간단한 질문에도 불필요한 검색 -> 느림, 비용 낭비
- 검색 결과가 관련없어도 그대로 사용 -> 틀린 답변
- 모든 질문에 동일한 깊이로 답변 -> 비효율적

고급 RAG 패턴 3가지

패턴핵심 아이디어해결하는 문제
Self-RAGLLM이 스스로 검색 필요성과 답변 품질을 판단불필요한 검색 방지 + 할루시네이션 감지
Corrective RAG검색 결과를 평가하고, 품질이 낮으면 보정잘못된 검색 결과 사용 방지
Adaptive RAG질문 난이도에 따라 전략을 선택효율성 최적화
[Naive RAG]         질문 -> 검색 -> 답변 (무조건)

[Self-RAG]          질문 -> "검색 필요?" -> Yes/No 분기
                                         -> 답변 -> "충실한가?" -> Yes/재생성

[Corrective RAG]    질문 -> 검색 -> "결과 관련있어?" -> Yes: 사용
                                                      -> No: 웹검색 or 재검색

[Adaptive RAG]      질문 -> "난이도?" -> 쉬움: LLM 직접
                                       -> 보통: 단순 RAG
                                       -> 어려움: 멀티스텝 RAG

실제 효과 비교

질문: "OEE란 무엇인가?"

[Naive RAG]
1. 검색 (300ms) -> OEE 문서 반환
2. 답변 생성 (500ms) -> "OEE는 설비종합효율입니다..."
-> 총 800ms, 검색 불필요했음

[Self-RAG]
1. "검색 필요?" -> No (일반 상식)
2. 답변 직접 생성 (500ms) -> "OEE는 설비종합효율입니다..."
-> 총 500ms, 검색 스킵!
질문: "SPN-200 주축 공차는?"

[Naive RAG]
1. 검색 -> CNC-M500 매뉴얼 반환 (오검색!)
2. 답변 -> CNC-M500 공차 답변 (틀림!)

[Corrective RAG]
1. 검색 -> CNC-M500 매뉴얼 반환
2. "SPN-200과 관련있어?" -> No!
3. 쿼리 수정 -> "SPN-200" 강조하여 재검색
4. SPN-200 매뉴얼 반환 -> 정확한 답변

이번 Day에서 배울 것

오늘이 끝나면:

  • Self-RAG (4가지 판단 토큰)를 이해하고 구현할 수 있다
  • Corrective RAG (검색 보정 패턴)를 구현할 수 있다
  • Adaptive RAG (적응형 전략 라우팅)를 구현할 수 있다
  • 세 패턴을 통합한 프로덕션 RAG 시스템을 만든다

시작하자.

AI로 학습하기 — 꿀팁
🧪데모 RAG와 프로덕션 RAG 차이 체감AI 학습 팁

노트북 데모에서 잘 되던 RAG가 제조 현장에 실제 배포하면 왜 무너지는지, 동시 쿼리·데이터 갱신·할루시네이션 시나리오로 구체적으로 탐색해 보세요.

제조 현장 RAG 시스템이 데모에서 현장 배포로 넘어갈 때 실패하는 3가지 전형적인 시나리오를 설명해줘. (1) 데이터 동기화 실패 — 설비 교체로 매뉴얼이 갱신됐는데 벡터DB가 업데이트되지 않아 구형 절차를 안내하는 경우, (2) 부하 폭발 — 50명 현장 작업자가 동시에 쿼리할 때 레이턴시와 비용이 폭증하는 경우, (3) Self-RAG/CRAG가 필요한 경우 — 검색 결과가 불충분한데 모델이 이를 감지하지 못하고 할루시네이션으로 답하는 경우. 각 실패를 방지하기 위해 Self-RAG 또는 CRAG 패턴이 어떻게 도움이 되는지 설명해줘.
이 팁이 도움이 됐나요?