LLM 핵심 개념: 토큰, 파라미터, 컨텍스트 윈도우
Day 1: LLM 개요 & 제조 AI 비전
LLM 핵심 개념: 토큰, 파라미터, 컨텍스트 윈도우
LLM 기초 > Day 1: LLM 개요 & 제조 AI 비전
- LLM(Large Language Model)이 무엇인지 정확히 정의할 수 있다
- 토큰, 파라미터, 컨텍스트 윈도우의 의미를 설명할 수 있다
- 주요 LLM 모델의 차이점을 비교할 수 있다
LLM이란 무엇인가
한 마디로: 엄청나게 많은 글을 읽고 학습한 AI.
비유로 이해하기
[사람의 언어 학습]
태어남 → 말 듣기 → 단어 배우기 → 문장 구성 → 대화 → 글쓰기
(수만 시간 노출) (수년 학습)
[LLM의 언어 학습]
모델 생성 → 인터넷 텍스트 학습 → 패턴 파악 → 텍스트 생성
(수조 단어) (수십억 파라미터)사람이 수십 년 걸려 언어를 배우는 것을, LLM은 수조 개의 문서를 학습해서 달성한다.
핵심 개념 1: 토큰 (Token)
LLM은 글자 단위가 아니라 토큰 단위로 처리한다.
아래 값은 이 주차가 쓰는 GPT-4o·GPT-4o-mini의 토크나이저(o200k_base)로 직접 세어 본 것이다.
[영어 토큰화 예시]
"Hello world" → ["Hello", " world"] (2 토큰)
[한글 토큰화 예시]
"안녕하세요" → ["안", "녕하세요"] (2 토큰)
"설비 점검" → ["설", "비", " 점", "검"] (4 토큰)한글이라고 글자마다 한 토큰이 되는 것은 아니다. 자주 쓰이는 덩어리는 통째로 한 토큰이 되고, 드문 조합은 글자마다 쪼개진다. 그래서 세어 보기 전에는 알 수 없고, Day 3에서 직접 센다.
왜 중요한가?
- 비용이 토큰 수로 계산된다
- 같은 뜻을 적어도 한글이 영어보다 토큰을 더 쓴다
- 토큰 = 돈
| 문장 | GPT-4o 계열(o200k_base) | 옛 GPT-3.5·GPT-4(cl100k_base) |
|---|---|---|
| "안녕하세요, 설비 점검 보고서를 작성해주세요" | 11 토큰 | 20 토큰 |
| "Hello, please write an equipment inspection report" | 8 토큰 | 8 토큰 |
| 한글 대 영어 | 1.4배 | 2.5배 |
"한글은 영어보다 2~3배 비싸다"는 말은 옛 토크나이저 기준이다. GPT-4o 계열에서는 문장에 따라 대체로 1.2~1.8배이고, 한글 1토큰은 1.5자 안팎이다. 낡은 배수로 예산을 잡으면 실제보다 두 배 가까이 잡게 된다.
핵심 개념 2: 파라미터 (Parameters)
모델이 학습한 "지식"이 저장된 숫자들.
파라미터 수 = 모델의 "뇌 크기"
GPT-3: 1,750억 개 (175B)
GPT-4: 비공개 (추정 1.7조)
Llama 3: 80억 / 700억 (8B / 70B)
Claude 계열: 비공개
비유:
├── 8B = 대학생 수준 (기본 업무)
├── 70B = 시니어 엔지니어 (전문 업무)
└── 1T+ = 수석 연구원 (최고 수준)핵심 개념 3: 컨텍스트 윈도우 (Context Window)
LLM이 한 번에 읽고 처리할 수 있는 텍스트의 양.
[컨텍스트 윈도우를 글자 수로 잡아 본다]
4K 토큰 ≈ 한글 6,000자 (짧은 대화)
32K 토큰 ≈ 한글 5만 자 (긴 문서)
128K 토큰 ≈ 한글 19만 자 (매뉴얼 한 권 분량)
200K 토큰 ≈ 한글 30만 자 (대형 매뉴얼)
1M 토큰 ≈ 한글 150만 자 (매뉴얼 여러 권)한글 1토큰을 1.5자로 잡은 값이다. 페이지로 환산하지 않은 데는 이유가 있다. 설비 매뉴얼은 그림과 표가 많아 페이지당 글자 수가 서너 배씩 차이 난다. 그림이 많은 매뉴얼이면 200K 토큰에 400~500페이지가 들어가고, 글자로 빽빽한 기술 문서면 150페이지도 다 넣지 못한다. 자기 회사 문서 한 페이지를 실제로 세어 자기 환산율을 갖는 편이 낫다.
제조에서 왜 중요한가?
- CNC 매뉴얼: 보통 500~2,000페이지
- 설비 이력 데이터: 수천 건
- 컨텍스트 윈도우가 크면 더 많은 정보를 한 번에 처리
주요 LLM 모델 비교 (2026년 기준)
| 모델 | 회사 | 컨텍스트 | 가격 (1M 토큰) | 제조 추천 용도 |
|---|---|---|---|---|
| GPT-4o | OpenAI | 128K | 입력 $2.5 / 출력 $10 | 복잡한 분석, 보고서 |
| GPT-4o-mini | OpenAI | 128K | 입력 $0.15 / 출력 $0.6 | 일상 Q&A, 챗봇 |
| Claude Sonnet 4 | Anthropic | 200K | 입력 $3 / 출력 $15 | 긴 매뉴얼 분석 |
| Claude Haiku 4.5 | Anthropic | 200K | 입력 $1 / 출력 $5 | 빠른 응답, 분류 |
| Gemini 2.5 Pro | 1M | 입력 $1.25 / 출력 $10 | 초대형 문서 처리 | |
| DeepSeek-V3 | DeepSeek | 128K | 입력 $0.27 / 출력 $1.10 | 비용 효율적 분석 |
| Gemini 2.5 Flash | 1M | 입력 $0.30 / 출력 $2.50 | 고속 처리, 대용량 | |
| Llama 4 Scout | Meta | 10M | 무료 (자체 서버) | 보안 중요 환경, 초장문 처리 |
제조 현장 추천:
- 일반 Q&A: GPT-4o-mini (싸고 빠르다)
- 심층 분석: GPT-4o 또는 Claude Sonnet 4
- 보안 필수: Llama 4 Scout (자체 서버 운영, 컨텍스트도 가장 크다)
LLM의 동작 원리 (간단히)
[LLM의 핵심 원리: 다음 토큰 예측]
입력: "CNC 가공 시 진동이 발생하면"
↓
LLM: "CNC 가공 시 진동이 발생하면" → [_____]
↓
예측: "주축" (확률 35%)
"절삭" (확률 25%)
"공구" (확률 20%)
...
↓
선택: "주축"
↓
다음: "CNC 가공 시 진동이 발생하면 주축" → [_____]
↓
예측: "베어링" (확률 40%)
↓
... 반복 ...
↓
최종: "CNC 가공 시 진동이 발생하면 주축 베어링 마모를 의심해야 합니다."핵심: LLM은 "이해"하는 게 아니라 **"다음에 올 확률이 높은 단어를 예측"**한다. 하지만 그 예측이 너무 정교해서 마치 이해하는 것처럼 보인다.
토큰, 파라미터, 컨텍스트 윈도우 개념은 자주 혼용되거나 과도하게 단순화됩니다. 내 이해가 정확한지 AI에게 반박을 요청해 점검하세요.
제가 이해한 LLM 개념을 검토해주세요: '토큰은 단어와 동일하고, 파라미터가 많을수록 항상 성능이 좋으며, 컨텍스트 윈도우는 단순히 최대 입력 길이다.' 이 세 가지 정의에서 틀렸거나 지나치게 단순화된 부분을 지적하고, 특히 한국어 제조 문서(설비 이상 리포트 등)를 LLM에 입력할 때 각 개념이 어떻게 실질적으로 영향을 미치는지 교정해주세요.
- • 토큰: LLM의 처리 단위. GPT-4o 계열에서 한글은 영어보다 대략 1.2~1.8배 많은 토큰을 쓴다
- • 파라미터: 모델의 지식 용량. 클수록 똑똑하지만 비용 증가
- • 컨텍스트 윈도우: 한 번에 처리 가능한 텍스트 양
- • LLM은 다음 토큰 예측 원리로 작동