🏆45

Day 2 챌린지: 청킹 전략 최적화 실험

Day 2: 청킹 & 임베딩

요구사항

SOP 샘플 문서를 4가지 이상 청킹 전략으로 분할한다

각 전략의 청크 수, 평균 크기, 내용 보존도를 비교 분석한다

제조 도메인 쿼리 5개에 대해 각 전략별 검색 정확도를 비교한다

최적 전략을 선택하고 그 이유를 보고서로 작성한다

평가 기준
  • 4가지 이상 청킹 전략을 구현했는가
  • 비교 기준이 명확하고 정량적인가
  • 제조 도메인 특성을 반영한 분석인가
  • 최적 전략 선택의 근거가 논리적인가
보너스
  • 시맨틱 청킹(sentence-transformers 활용)을 구현한 경우
  • 실제 PDF 매뉴얼로 테스트한 경우
  • chunk_size / overlap 파라미터 튜닝 실험 포함
AI로 학습하기 — 꿀팁
🤖청킹 전략 실험 결과 해석 지원AI 학습 팁

제조 문서에 여러 청킹 전략(Fixed/Recursive/Semantic)을 실험한 결과를 AI에게 비교 분석하고 최적 전략 선택 근거를 만들어달라고 요청하세요.

제조 설비 매뉴얼(한국어, 평균 50페이지)에 3가지 청킹 전략을 실험했습니다: Fixed-size(512 tokens), Recursive(문단 기준), Semantic(문장 임베딩 유사도 기반). 다음을 분석해 주세요: 1) '3번 베어링 교체 시 토크 규격' 같은 절차형 쿼리에서 각 방식의 예상 검색 성능 차이, 2) 실험에서 Semantic 청킹이 오히려 낮은 성능을 보였다면 가능한 원인 3가지, 3) 청킹 전략 비교 실험을 위한 최소 평가 쿼리셋 구성 방법 (레이블 없이 가능한 방법 포함), 4) 최종 선택 전략을 상사에게 설명할 때 사용할 1페이지 요약 구조. 데이터에 근거한 의사결정 프레임워크로 답해 주세요.
이 팁이 도움이 됐나요?