Document Chunker 로딩 중...
이 도구가 못 하는 것
- 토큰 수는 추정치입니다. 한글 1.5자·그 밖 4자를 1토큰으로 잡은 것이라 실제 토크나이저와 다릅니다.
- 의미 기반 전략은 낱말 겹침 근사이고 임베딩 모델을 쓰지 않습니다. 한국어는 조사와 흔한 어미를 규칙으로 뗀 어간으로 세는데, 형태소 분석기가 아니라 규칙이라 놓치는 낱말이 있습니다.
- 어느 전략이 좋은지는 이 화면이 답하지 않습니다. 검색 성능으로 재야 하고 그것은 RAG 파이프라인에서 합니다.
- PDF·워드 파싱은 문서에 따라 표와 단 구성을 잃습니다.
- 문장·의미 기반 전략은 문장 한복판을 자르지 않습니다. 그래서 문장 하나가 청크 크기보다 길면 그 청크는 설정한 크기를 넘습니다 — 예제 문서에도 842자짜리 문장이 있습니다.
이 시뮬레이터가 무엇을 하는가기능 · 개념 · 연계 주차
다양한 청킹 전략을 비교하고 최적의 방법을 찾아보세요.
01
문서 파싱
PDF, TXT, MD, DOCX 파일을 텍스트로 변환하는 과정을 체험합니다.
02
청킹 전략
고정 크기·문장·재귀·단락·의미 기반 등 5가지 분할 방법을 비교합니다.
03
오버랩 이해
청크 간 중복 영역이 문맥 보존에 어떤 역할을 하는지 시각적으로 확인합니다.
04
통계 분석
청크 수, 평균 크기, 토큰 수 등 다양한 통계를 실시간으로 분석합니다.
청킹(Chunking)이란?
청킹은 긴 문서를 작은 조각으로 나누는 과정으로, RAG 시스템에서 검색 품질을 좌우하는 핵심 전처리 단계입니다. 너무 큰 청크는 관련 없는 정보를 포함해 검색 정확도를 떨어뜨리고, 너무 작은 청크는 문맥을 잃어 의미가 불완전해집니다.
- 고정 크기·문장·재귀·단락·의미 기반 청킹 전략별 결과를 비교 체험
- chunk size·overlap 파라미터를 조정하며 문맥 보존 효과를 실험
- RAG Lab 시리즈의 첫 단계 — 다음은 Embedding Explorer로 청크를 벡터화
써 보신 분만 아는 것이 있습니다
쓰다가 막힌 곳이나 현장과 다른 점을 알려주시면 다음 버전에 반영합니다. 보내주신 분께는 9월 추첨으로 스타벅스 쿠폰을 드립니다.