25분
LLM 핵심 개념: 토큰, 파라미터, 컨텍스트 윈도우
Day 1: LLM 개요 & 제조 AI 비전
LLM 핵심 개념: 토큰, 파라미터, 컨텍스트 윈도우
LLM 기초 > Day 1: LLM 개요 & 제조 AI 비전
학습 목표
LLM(Large Language Model)이 무엇인지 정확히 정의할 수 있다 토큰, 파라미터, 컨텍스트 윈도우의 의미를 설명할 수 있다 주요 LLM 모델의 차이점을 비교할 수 있다
최종 검수: 2026-01
LLM이란 무엇인가
한 마디로: 엄청나게 많은 글을 읽고 학습한 AI.
비유로 이해하기
[사람의 언어 학습]
태어남 → 말 듣기 → 단어 배우기 → 문장 구성 → 대화 → 글쓰기
(수만 시간 노출) (수년 학습)
[LLM의 언어 학습]
모델 생성 → 인터넷 텍스트 학습 → 패턴 파악 → 텍스트 생성
(수조 단어) (수십억 파라미터)
사람이 수십 년 걸려 언어를 배우는 것을, LLM은 수조 개의 문서를 학습해서 달성한다.
핵심 개념 1: 토큰 (Token)
LLM은 글자 단위가 아니라 토큰 단위로 처리한다.
[영어 토큰화 예시]
"Hello world" → ["Hello", " world"] (2 토큰)
[한글 토큰화 예시]
"안녕하세요" → ["안", "녕", "하", "세요"] (4 토큰)
"설비 점검" → ["설", "비", " 점", "검"] (4 토큰)
왜 중요한가?
- 비용이 토큰 수로 계산된다
- 한글은 영어보다 토큰을 2~3배 더 쓴다
- 토큰 = 돈
| 언어 | "안녕하세요, 설비 점검 보고서를 작성해주세요" | 토큰 수 |
|---|---|---|
| 한글 원문 | 위 문장 | ~25 토큰 |
| 영어 번역 | "Hello, please write an equipment inspection report" | ~10 토큰 |
한글은 영어보다 2.5배 비싸다. 이걸 모르면 비용 폭탄 맞는다.
▲ LLM이 한글 텍스트를 토큰으로 분리하고 처리하는 과정
핵심 개념 2: 파라미터 (Parameters)
모델이 학습한 "지식"이 저장된 숫자들.
파라미터 수 = 모델의 "뇌 크기"
GPT-3: 1,750억 개 (175B)
GPT-4: 비공개 (추정 1.7조)
Llama 3: 80억 / 700억 (8B / 70B)
Claude 3.5: 비공개
비유:
├── 8B = 대학생 수준 (기본 업무)
├── 70B = 시니어 엔지니어 (전문 업무)
└── 1T+ = 수석 연구원 (최고 수준)
핵심 개념 3: 컨텍스트 윈도우 (Context Window)
LLM이 한 번에 읽고 처리할 수 있는 텍스트의 양.
[컨텍스트 윈도우 비유]
4K 토큰 = 책 3페이지 (짧은 대화)
32K 토큰 = 책 25페이지 (긴 문서)
128K 토큰 = 책 100페이지 (매뉴얼 1권)
200K 토큰 = 책 150페이지 (대형 매뉴얼)
1M 토큰 = 책 750페이지 (매뉴얼 여러 권)
제조에서 왜 중요한가?
- CNC 매뉴얼: 보통 500~2,000페이지
- 설비 이력 데이터: 수천 건
- 컨텍스트 윈도우가 크면 더 많은 정보를 한 번에 처리
주요 LLM 모델 비교 (2026년 기준)
| 모델 | 회사 | 컨텍스트 | 가격 (1M 토큰) | 제조 추천 용도 |
|---|---|---|---|---|
| GPT-4o | OpenAI | 128K | 입력 $2.5 / 출력 $10 | 복잡한 분석, 보고서 |
| GPT-4o-mini | OpenAI | 128K | 입력 $0.15 / 출력 $0.6 | 일상 Q&A, 챗봇 |
| Claude Sonnet 4 | Anthropic | 200K | 입력 $3 / 출력 $15 | 긴 매뉴얼 분석 |
| Claude Haiku 4.5 | Anthropic | 200K | 입력 $0.80 / 출력 $4 | 빠른 응답, 분류 |
| Gemini 2.5 Pro | 1M | 입력 $1.25 / 출력 $10 | 초대형 문서 처리 | |
| DeepSeek-V3 | DeepSeek | 128K | 입력 $0.27 / 출력 $1.10 | 비용 효율적 분석 |
| Gemini 2.5 Flash | 1M | 입력 $0.30 / 출력 $2.50 | 고속 처리, 대용량 | |
| Llama 4 Scout | Meta | 128K | 무료 (자체 서버) | 보안 중요 환경 |
제조 현장 추천:
- 일반 Q&A: GPT-4o-mini (싸고 빠르다)
- 심층 분석: GPT-4o 또는 Claude Sonnet 4
- 보안 필수: Llama 4 Scout (자체 서버 운영)
▲ 모델별 컨텍스트 윈도우 크기 — 제조 매뉴얼 1권(500p) ≈ 200K 토큰
LLM의 동작 원리 (간단히)
[LLM의 핵심 원리: 다음 토큰 예측]
입력: "CNC 가공 시 진동이 발생하면"
↓
LLM: "CNC 가공 시 진동이 발생하면" → [_____]
↓
예측: "주축" (확률 35%)
"절삭" (확률 25%)
"공구" (확률 20%)
...
↓
선택: "주축"
↓
다음: "CNC 가공 시 진동이 발생하면 주축" → [_____]
↓
예측: "베어링" (확률 40%)
↓
... 반복 ...
↓
최종: "CNC 가공 시 진동이 발생하면 주축 베어링 마모를 의심해야 합니다."
핵심: LLM은 "이해"하는 게 아니라 **"다음에 올 확률이 높은 단어를 예측"**한다. 하지만 그 예측이 너무 정교해서 마치 이해하는 것처럼 보인다.
AI로 학습하기 — 꿀팁
✅토큰·파라미터·컨텍스트 정의 검증AI 학습 팁
토큰, 파라미터, 컨텍스트 윈도우 개념은 자주 혼용되거나 과도하게 단순화됩니다. 내 이해가 정확한지 AI에게 반박을 요청해 점검하세요.
제가 이해한 LLM 개념을 검토해주세요: '토큰은 단어와 동일하고, 파라미터가 많을수록 항상 성능이 좋으며, 컨텍스트 윈도우는 단순히 최대 입력 길이다.' 이 세 가지 정의에서 틀렸거나 지나치게 단순화된 부분을 지적하고, 특히 한국어 제조 문서(설비 이상 리포트 등)를 LLM에 입력할 때 각 개념이 어떻게 실질적으로 영향을 미치는지 교정해주세요.
이 팁이 도움이 됐나요?
핵심 포인트
- • 토큰: LLM의 처리 단위. 한글은 영어보다 2~3배 많은 토큰 사용
- • 파라미터: 모델의 지식 용량. 클수록 똑똑하지만 비용 증가
- • 컨텍스트 윈도우: 한 번에 처리 가능한 텍스트 양
- • LLM은 다음 토큰 예측 원리로 작동