18분
M2: 청킹 & 색인 파이프라인
Day 5: 기술문서 RAG 시스템 프로젝트
M2: 청킹 & 색인 파이프라인
RAG 기초 > Day 5: 기술문서 RAG 시스템 프로젝트
학습 목표
- 문서 길이에 맞는 chunk_size를 정하고 청킹이 실제로 일어났는지 확인한다
- 임베딩 함수를 명시해 Chroma에 메타데이터와 함께 색인한다
- 색인 품질을 자기 검색 적중률로 검증한다
M2: 청킹 & 색인 파이프라인
M1의 문서 9건을 받아 청킹하고 Chroma에 넣는다.
준비
M1을 m1_data.py로 저장해 둔다. 이 파일은 같은 폴더에 m2_indexing.py로 저장한다.
pip install chromadb langchain-text-splitters langchain-core
pip install sentence-transformers # 다국어 모델을 비교할 때
목표
- 문서 길이를 먼저 재고 chunk_size를 정한다
- 청킹 결과에서 같은 문서 안 경계가 몇 곳 생겼는지 확인한다
- 임베딩 함수를 손으로 지정해 색인한다
- 넣은 청크가 자기 자신을 찾아오는지 검증한다
EMBEDDING_CHOICE를 바꿔 4번의 숫자를 다시 재고 둘을 나란히 적는다
경계가 0곳이면 청킹이 일어나지 않은 것이다. 청크 수가 문서 수와 같은데 "청킹 완료"라고 읽고 넘어가는 일이 흔하다.
에디터 로딩 중...
정답 보기
에디터 로딩 중...
AI로 학습하기 — 꿀팁
청킹 파이프라인 누수 점검AI 학습 팁
AI에게 제조 문서 청킹·색인 파이프라인의 청크 경계 오류와 메타데이터 유실 케이스를 점검받아 Chroma 색인 품질을 검증하세요.
이 제조 문서 청킹 및 Chroma 색인 파이프라인 코드를 점검해줘. 문장 중간에서 청크가 잘려 의미가 끊기는 케이스, 청크에 메타데이터(설비명·문서번호)가 누락되는 케이스, 중복 청크가 색인되는 케이스를 찾고 수정 방법을 제안해줘.
이 팁이 도움이 됐나요?