53분
실습: 제조 문서 RAG 파이프라인 구축
Day 4: RAG 파이프라인 구축
실습: 제조 문서 RAG 파이프라인 구축
RAG 기초 > Day 4: RAG 파이프라인 구축
학습 목표
- LangChain으로 색인 파이프라인을 구축할 수 있다
- 검색 + 생성 파이프라인을 연결할 수 있다
- 제조 도메인 프롬프트를 설계할 수 있다
RAG 파이프라인 구축
Day 1~3에서 배운 것을 하나로 연결한다.
환경 설정
pip install langchain langchain-core langchain-community langchain-text-splitters
pip install langchain-openai langchain-chroma chromadb # MODE="openai"일 때
실습 순서
MODE = "lexical"그대로 실행한다. 색인부터 답변까지 끝까지 돈다.- 경계 점검 출력을 읽는다. 청크가 몇 개인지가 아니라 앞 청크의 끝과 뒤 청크의 시작이 어떻게 이어지는지를 본다.
- A(문서의 낱말을 그대로 쓴 질문)와 B(같은 것을 현장 말투로 물은 질문)의 검색 결과를 견준다. B가 무너지는 자리를 적는다.
- 완성 코드를 실행해 청크 크기를 바꿔 가며 잰다. chunk_size를 600으로 두면 이 문서들은 한 번도 잘리지 않는다는 것을 확인한다.
- 완성 코드의
calibrate_threshold로 거절 기준선을 자기 데이터에서 구한다. 교재가 주는 상수를 그대로 쓰지 않는다. - 키가 있다면
MODE = "openai"로 바꿔 A와 B의 hit rate를 다시 잰다.
오늘 만든 것에 붙일 질문
- 이 파이프라인은 답을 만드는가, 근거를 찾아 오는가?
- 근거가 약할 때 무엇을 하는가?
- 그 판단의 기준선은 어디서 왔는가?
에디터 로딩 중...
힌트 보기
- • ChatPromptTemplate의 {context}에 들어갈 문서 포맷이 중요하다. 출처 정보를 함께 넣어야 LLM이 인용할 수 있다.
- • temperature=0으로 두면 같은 입력에 같은 답이 나와 비교가 쉬워진다.
- • MMR 검색은 비슷한 청크만 모이는 것을 막아 준다. lambda_mult가 1에 가까우면 유사도 우선, 0에 가까우면 다양성 우선이다.
- • 청크 수만 세면 청킹이 일어났는지 알 수 없다. 같은 문서에서 나온 청크가 둘 이상인지, 즉 문서 안에 경계가 생겼는지를 확인한다.
- • 검색 결과가 없을 때와 유사도가 낮을 때를 모두 막아야 한다. 둘 중 하나만 막으면 근거 없는 답이 그대로 나간다.
정답 보기
에디터 로딩 중...
AI로 학습하기 — 꿀팁
LangChain RAG 파이프라인 스캐폴딩AI 학습 팁
AI에게 LangChain으로 제조 문서 색인과 검색+생성 파이프라인을 엔드투엔드로 스캐폴딩하도록 요청하세요. 제조 전용 프롬프트 템플릿과 LangSmith 트레이싱 설정을 포함해 받으세요.
LangChain으로 제조 설비 매뉴얼 RAG 파이프라인을 구현해줘. PDF 로드→청킹→Chroma 색인 파이프라인과 RetrievalQA 체인을 구성하고, 설비명과 오류 코드를 필수 컨텍스트로 받는 제조 전용 PromptTemplate과 LangSmith 트레이싱 초기화 코드를 포함해줘.
이 팁이 도움이 됐나요?
실습 — 직접 해보기
RAG Pipeline
파이프라인 데모 탭에서 검색·증강·생성을 단계별로 따라간 뒤, 평가·튜닝 탭으로 넘어가 hit rate와 MRR을 직접 움직여 본다. 볼 것: 문항 표가 질문을 '직접'과 '우회'로 나눠 놓았다. 설정을 바꿀 때 두 종류가 같이 좋아지는지 한쪽만 좋아지는지 본다. 의심할 것: 화면에 표시되는 검색 지연시간에는 연출된 대기가 섞여 있다. 성능 근거로 쓰지 마라.
제조 AI 어시스턴트
완성된 제조 RAG가 어떻게 답하는지 본다. 볼 것은 답변 문장이 아니라 함께 붙는 출처다. 의심할 것: 출처로 제시된 문단을 눌러 원문을 열고, 답변의 수치가 그 문단 안에 실제로 있는지 하나씩 대조하라.