▶️25

[영상] 벡터 임베딩과 벡터 스토어 이해하기

Day 2: 청킹 & 임베딩

학습 목표

벡터 임베딩이 텍스트를 수치 공간으로 변환하는 원리를 설명할 수 있다 고정 크기 청킹과 시맨틱 청킹의 차이점 및 장단점을 비교할 수 있다 코사인 유사도를 사용해 두 문서 청크의 관련성을 계산하는 방법을 설명할 수 있다 제조 기술 문서에 적합한 청크 크기를 근거와 함께 제안할 수 있다

영상 핵심 정리 — 벡터 임베딩과 벡터 스토어 이해하기

임베딩이란?

텍스트를 고차원 숫자 배열로 변환하는 과정이다. 핵심은 의미가 비슷하면 벡터가 가깝다는 성질이다.

'베어링 교체 주기'  → [0.23, -0.41, 0.87, ...]  # 768개 숫자
'롤러 교환 간격'   → [0.25, -0.39, 0.85, ...]  # ← 거의 같은 방향!

from numpy import dot
from numpy.linalg import norm
similarity = dot(v1, v2) / (norm(v1) * norm(v2))

5가지 청킹 전략 비교

전략기준장점제조 적합도
고정 크기토큰 수(예: 512)구현 단순★★☆ (표 분리 위험)
문장 단위마침표/개행문장 온전 유지★★★
재귀적단락→문장→단어 순크기 제어 + 구조 존중★★★★
시맨틱임베딩 거리 급변주제 단위 자동 분할★★★★★
구조 기반Markdown/HTML 헤더계층 보존★★★★ (SOP에 최적)

시맨틱 청킹 원리

문장 1~3 임베딩 → 평균 벡터 A
문장 2~4 임베딩 → 평균 벡터 B
코사인 거리(A,B) > 임계값 θ → 여기서 청크 분리!

한국어 제조 권장 설정

  • 임베딩 모델: BGE-M3 (1024차원, 8192 토큰)
  • 청크 크기: 512 토큰, 오버랩 50 토큰
  • 전략: 재귀적 + 구조 기반 혼합

함정 주의: 청크 오버랩을 너무 크게(>30%) 잡으면 중복으로 검색 순위가 왜곡된다. 10~15%가 적절.

다음 task와의 연결

'청킹 전략 5가지 + 임베딩 모델 비교'에서 각 전략의 코드와 벤치마크 수치를 심층 비교한다.

AI로 학습하기 — 꿀팁
🧪시맨틱 청킹 전략 비교 질문AI 학습 팁

5가지 청킹 전략의 장단점을 제조 설비 매뉴얼 문서 특성에 맞춰 AI에게 비교 설명받고, 시맨틱 청킹의 주제 전환 감지 원리를 이해하세요.

제조 설비 매뉴얼의 벡터 임베딩을 위한 청킹 전략 5가지(고정 크기·문장 단위·재귀적·시맨틱·문서 구조 기반)를 비교해줘. '베어링 교체'와 '롤러 베어링 교환'이 높은 코사인 유사도를 갖는 이유, 시맨틱 청킹에서 인접 문장 임베딩 간 거리가 갑자기 커지는 지점을 주제 전환으로 감지하는 원리, 그리고 제조 매뉴얼에 가장 적합한 전략 추천도 포함해줘.
이 팁이 도움이 됐나요?
핵심 포인트
  • 임베딩: 의미가 비슷한 문장은 벡터 공간에서 가깝게 위치 — '베어링 교체'와 '롤러 베어링 교환'은 높은 코사인 유사도
  • 5가지 청킹 전략: 고정 크기, 문장 단위, 재귀적, 시맨틱, 문서 구조 기반
  • 시맨틱 청킹은 인접 문장 임베딩 간 거리가 갑자기 커지는 지점에서 분할 — 주제 전환 감지
  • BGE-M3: 1024차원, 최대 8192 토큰, 다국어 지원 — 한국어 제조 문서에 최적