25

LLM 핵심 개념: 토큰, 파라미터, 컨텍스트 윈도우

Day 1: LLM 개요 & 제조 AI 비전

학습 목표

LLM(Large Language Model)이 무엇인지 정확히 정의할 수 있다 토큰, 파라미터, 컨텍스트 윈도우의 의미를 설명할 수 있다 주요 LLM 모델의 차이점을 비교할 수 있다

최종 검수: 2026-01

LLM이란 무엇인가

한 마디로: 엄청나게 많은 글을 읽고 학습한 AI.


비유로 이해하기

[사람의 언어 학습]
태어남 → 말 듣기 → 단어 배우기 → 문장 구성 → 대화 → 글쓰기
         (수만 시간 노출)         (수년 학습)

[LLM의 언어 학습]
모델 생성 → 인터넷 텍스트 학습 → 패턴 파악 → 텍스트 생성
            (수조 단어)          (수십억 파라미터)

사람이 수십 년 걸려 언어를 배우는 것을, LLM은 수조 개의 문서를 학습해서 달성한다.


핵심 개념 1: 토큰 (Token)

LLM은 글자 단위가 아니라 토큰 단위로 처리한다.

[영어 토큰화 예시]
"Hello world" → ["Hello", " world"]  (2 토큰)

[한글 토큰화 예시]
"안녕하세요" → ["안", "녕", "하", "세요"]  (4 토큰)
"설비 점검" → ["설", "비", " 점", "검"]   (4 토큰)

왜 중요한가?

  • 비용이 토큰 수로 계산된다
  • 한글은 영어보다 토큰을 2~3배 더 쓴다
  • 토큰 = 돈
언어"안녕하세요, 설비 점검 보고서를 작성해주세요"토큰 수
한글 원문위 문장~25 토큰
영어 번역"Hello, please write an equipment inspection report"~10 토큰

한글은 영어보다 2.5배 비싸다. 이걸 모르면 비용 폭탄 맞는다.

토큰 처리 흐름 애니메이션 ▲ LLM이 한글 텍스트를 토큰으로 분리하고 처리하는 과정


핵심 개념 2: 파라미터 (Parameters)

모델이 학습한 "지식"이 저장된 숫자들.

파라미터 수 = 모델의 "뇌 크기"

GPT-3:       1,750억 개  (175B)
GPT-4:       비공개 (추정 1.7조)
Llama 3:     80억 / 700억 (8B / 70B)
Claude 3.5:  비공개

비유:
├── 8B = 대학생 수준 (기본 업무)
├── 70B = 시니어 엔지니어 (전문 업무)
└── 1T+ = 수석 연구원 (최고 수준)

핵심 개념 3: 컨텍스트 윈도우 (Context Window)

LLM이 한 번에 읽고 처리할 수 있는 텍스트의 양.

[컨텍스트 윈도우 비유]

4K 토큰  = 책 3페이지   (짧은 대화)
32K 토큰 = 책 25페이지  (긴 문서)
128K 토큰 = 책 100페이지 (매뉴얼 1권)
200K 토큰 = 책 150페이지 (대형 매뉴얼)
1M 토큰  = 책 750페이지 (매뉴얼 여러 권)

제조에서 왜 중요한가?

  • CNC 매뉴얼: 보통 500~2,000페이지
  • 설비 이력 데이터: 수천 건
  • 컨텍스트 윈도우가 크면 더 많은 정보를 한 번에 처리

주요 LLM 모델 비교 (2026년 기준)

모델회사컨텍스트가격 (1M 토큰)제조 추천 용도
GPT-4oOpenAI128K입력 $2.5 / 출력 $10복잡한 분석, 보고서
GPT-4o-miniOpenAI128K입력 $0.15 / 출력 $0.6일상 Q&A, 챗봇
Claude Sonnet 4Anthropic200K입력 $3 / 출력 $15긴 매뉴얼 분석
Claude Haiku 4.5Anthropic200K입력 $0.80 / 출력 $4빠른 응답, 분류
Gemini 2.5 ProGoogle1M입력 $1.25 / 출력 $10초대형 문서 처리
DeepSeek-V3DeepSeek128K입력 $0.27 / 출력 $1.10비용 효율적 분석
Gemini 2.5 FlashGoogle1M입력 $0.30 / 출력 $2.50고속 처리, 대용량
Llama 4 ScoutMeta128K무료 (자체 서버)보안 중요 환경

제조 현장 추천:

  • 일반 Q&A: GPT-4o-mini (싸고 빠르다)
  • 심층 분석: GPT-4o 또는 Claude Sonnet 4
  • 보안 필수: Llama 4 Scout (자체 서버 운영)

컨텍스트 윈도우 비교 ▲ 모델별 컨텍스트 윈도우 크기 — 제조 매뉴얼 1권(500p) ≈ 200K 토큰


LLM의 동작 원리 (간단히)

[LLM의 핵심 원리: 다음 토큰 예측]

입력: "CNC 가공 시 진동이 발생하면"
      ↓
LLM: "CNC 가공 시 진동이 발생하면" → [_____]
      ↓
예측: "주축" (확률 35%)
      "절삭" (확률 25%)
      "공구" (확률 20%)
      ...
      ↓
선택: "주축"
      ↓
다음: "CNC 가공 시 진동이 발생하면 주축" → [_____]
      ↓
예측: "베어링" (확률 40%)
      ↓
... 반복 ...
      ↓
최종: "CNC 가공 시 진동이 발생하면 주축 베어링 마모를 의심해야 합니다."

핵심: LLM은 "이해"하는 게 아니라 **"다음에 올 확률이 높은 단어를 예측"**한다. 하지만 그 예측이 너무 정교해서 마치 이해하는 것처럼 보인다.

AI로 학습하기 — 꿀팁
토큰·파라미터·컨텍스트 정의 검증AI 학습 팁

토큰, 파라미터, 컨텍스트 윈도우 개념은 자주 혼용되거나 과도하게 단순화됩니다. 내 이해가 정확한지 AI에게 반박을 요청해 점검하세요.

제가 이해한 LLM 개념을 검토해주세요: '토큰은 단어와 동일하고, 파라미터가 많을수록 항상 성능이 좋으며, 컨텍스트 윈도우는 단순히 최대 입력 길이다.' 이 세 가지 정의에서 틀렸거나 지나치게 단순화된 부분을 지적하고, 특히 한국어 제조 문서(설비 이상 리포트 등)를 LLM에 입력할 때 각 개념이 어떻게 실질적으로 영향을 미치는지 교정해주세요.
이 팁이 도움이 됐나요?
핵심 포인트
  • 토큰: LLM의 처리 단위. 한글은 영어보다 2~3배 많은 토큰 사용
  • 파라미터: 모델의 지식 용량. 클수록 똑똑하지만 비용 증가
  • 컨텍스트 윈도우: 한 번에 처리 가능한 텍스트 양
  • LLM은 다음 토큰 예측 원리로 작동