2026년 LLM 지형도: 모델 27종의 컨텍스트·가격·라이선스를 공식 문서로 정리했다
· AI & 바이브코딩
💡 3줄 요약
- 2026년 9월 현재 프런티어 모델의 컨텍스트는 대부분 100만 토큰대로 수렴했고, 차별점은 컨텍스트 길이가 아니라 구간별 요금 급변과 추론 강도 조절 방식으로 옮겨갔습니다.
- 오픈 웨이트 축은 중국계(DeepSeek·Qwen·Kimi·GLM)가 사실상 장악했고, 한국은 LG K-EXAONE 2.0과 SKT A.X K2가 모두 Apache 2.0으로 나왔습니다.
- 아래 수치는 전부 개발사 공식 문서·가격 페이지에서 2026년 8월 31일에 확인한 값입니다. 확인하지 못한 항목은 본문에 그렇게 적었습니다.
■ 1. 벤치마크 순위표부터 보면 안 되는 이유
모델 비교 글은 대개 벤치마크 순위로 시작합니다. 그런데 실무에서 모델을 바꾸는 이유는 순위가 아닙니다. 요금 청구서가 예상보다 세 배 나왔거나, 긴 문서를 넣었더니 단가가 뛰었거나, 라이선스 조건 때문에 배포를 못 하는 경우입니다.
앤트로픽 공식 모델 선택 가이드도 기준을 네 가지로 제시합니다. 능력(Capabilities), 속도(Speed), 비용(Cost), 그리고 추론 강도(Effort)입니다. 특히 이런 문장이 있습니다. "추론 강도를 조정하는 것이 모델을 바꾸는 것보다 나은 지렛대인 경우가 많다."
오픈AI의 공식 가이드는 순서를 제시합니다. "먼저 정확도를 최적화하라 — 목표 정확도에 도달할 때까지." 그다음 "비용과 지연을 최적화하라 — 정확도를 유지하면서 가장 저렴하고 빠른 모델로." 즉 평가셋을 먼저 만들고, 목표를 넘긴 뒤에 내려가는 순서입니다.
■ 2. 상용 API 모델 — 공식 가격 기준
100만 토큰당 단가입니다. 모두 공식 가격 페이지 확인값입니다.
| 모델 | 컨텍스트 | 입력 | 출력 | 비고 |
|---|---|---|---|---|
| GPT-5.6 Sol | 1,050,000 | $4.00 | $20.00 | 프로모션가, 최소 2026-11-21까지 |
| GPT-5.6 Terra | — | $2.00 | $12.00 | |
| GPT-5.6 Luna | — | $0.20 | $1.20 | |
| Claude Fable 5 | 1M | $10 | $50 | |
| Claude Opus 5 | 1M | $5 | $25 | Fast mode는 2배 |
| Claude Sonnet 5 | 1M | $2 | $10 | |
| Claude Haiku 4.5 | 200K | $1 | $5 | |
| Gemini 3.7 Flash | 1,048,576 | $0.75 | $3.75 | 2026-12-31까지, 이후 $1.50/$7.50 |
| Gemini 3.1 Pro Preview | 1,048,576 | $2.00 | $12.00 | 200k 초과 시 $4.00/$18.00 |
| Grok 4.6 | 500,000 | $2.00 | $6.00 | |
| Mistral Medium 3.5 | — | $1.5 | $7.5 | |
| Mistral Small 4 | — | $0.15 | $0.6 | 오픈 웨이트 |
| DeepSeek-V4-Pro | 1M | $1.32 | $3.96 | 캐시 히트 $0.044, 오프피크 절반 |
| DeepSeek-V4-Flash | 1M | $0.44 | $1.32 | |
| Qwen3.8-max | 1,000,000 | $1.65 | $4.951 | 중국 베이징 리전 기준 |
| GLM-5.3 | — | $1.4 | $4.4 | |
| Solar Pro 4 (업스테이지) | 512K | $0.30 | $1.20 | 2026-09-10까지 90% 할인 |
■ 3. 진짜 함정 — 컨텍스트 구간별 요금 급변
표만 보면 저렴해 보이는 모델이 실제로는 비싸지는 지점이 있습니다.
- 오픈AI GPT-5.6 Sol: 입력이 272K 토큰을 넘으면 해당 요청 전체에 입력 2배·출력 1.5배 요금이 붙습니다. 273K를 넣는 순간 272K분까지 소급해 두 배가 됩니다.
- 구글 Gemini 3.1 Pro: 200k 초과 시 입력 $2.00 → $4.00, 출력 $12.00 → $18.00.
- 구글 Gemini 2.5 Pro: 200k 초과 시 $1.25 → $2.50, $10.00 → $15.00.
긴 문서를 통째로 넣는 작업이라면 이 구간을 먼저 확인해야 합니다. 컨텍스트가 100만이라는 말은 "넣을 수 있다"는 뜻이지 "같은 값에 넣을 수 있다"는 뜻이 아닙니다.
처리 티어도 요금 변수입니다. 구글은 Batch·Flex·Priority 3단계, 앤트로픽은 Batch API 50% 할인, 딥시크는 UTC 기준 오프피크 시간대 50% 할인을 공식 가격표에 두고 있습니다.
■ 4. 추론 강도 조절 — 벤더마다 인터페이스가 다르다
같은 "추론 모드"라도 조절 방식이 제각각입니다.
- 오픈AI: none / low / medium(기본) / high / xhigh / max 6단계
- 앤트로픽: effort 파라미터. Fable 5·Opus 5·Sonnet 5는 확장 사고가 Adaptive, Haiku 4.5는 Extended. Opus 계열에는 기본가 2배의 Fast mode
- 딥시크·GLM·Kimi: low / high / max 3단계
- 구글 Gemini 3.7 Flash: 모델 카드 표현으로 "품질·비용·지연의 조합을 제어하는 커스터마이즈 가능한 사고 설정"
- Qwen3.8-2.4T-A95B: 사고 모드를 끌 수 없습니다. 모든 응답이 사고 블록으로 시작합니다
마지막 항목은 실제로 설계를 바꿉니다. 짧은 분류 작업에 이 모델을 쓰면 매번 사고 토큰이 붙습니다.
■ 5. 오픈 웨이트 지형 — 라이선스가 핵심
"오픈 웨이트"라는 말이 곧 자유로운 상업 이용을 뜻하지는 않습니다.
| 모델 | 파라미터 | 라이선스 |
|---|---|---|
| OpenAI gpt-oss-120b / 20b | — | Apache 2.0 |
| Mistral Large 3 / Small 4 / Ministral 3 | — | Apache 2.0 |
| DeepSeek-V4-Pro-0813 | 1.7T | MIT |
| LG K-EXAONE 2.0 | 750B (활성 37B) | Apache 2.0 |
| SKT A.X K2 | 688B (활성 33B) | Apache 2.0 |
| 모티프 Motif-3 | 약 314B (활성 13.2B) | MIT |
| Meta Llama 4 Maverick | 400B (활성 17B) | Llama 4 Community License (커스텀) |
| Qwen3.8-2.4T-A95B | 2.4T (활성 95B) | Qwen3.8-Max License (조건부) |
| Moonshot Kimi K3 | 2.8T (활성 104B) | Kimi K3 License (커스텀) |
| Z.ai GLM-5.3 | 753B | glm-5.3 (커스텀) |
| LG EXAONE 4.5-33B | 33B | EXAONE License 1.2 NC(비상업) |
| Naver HyperCLOVA X SEED Think 32B | 32B | 커스텀 모델 라이선스 |
■ 유의사항: 커스텀 라이선스의 조건
Qwen3.8-Max License는 월간 활성 사용자 1억 명 초과 또는 월 매출 2,000만 달러 초과 시 모델명 표기 의무를 부과하고, MaaS·AI 업무 비서 사업으로 12개월 누적 매출 5,000만 달러를 넘으면 별도 라이선스 취득 의무를 둡니다. LG EXAONE 4.5는 아예 비상업 라이선스입니다. 같은 회사의 K-EXAONE 2.0이 Apache 2.0인 것과 대비됩니다. 모델을 제품에 넣기 전에 라이선스 원문을 반드시 읽으십시오.
■ 6. 한국 개발사 현황
과기정통부 독자 AI 파운데이션 모델 사업은 2026년 8월 18일 2차 단계평가에서 업스테이지·SK텔레콤·LG AI연구원 3개 팀이 다음 단계로 진출하고 모티프테크놀로지스가 탈락했습니다. 1차 평가(2026년 1월)에서는 LG·SKT·업스테이지가 진출했고, 2월 추가 공모로 모티프가 합류해 4개 팀이었습니다.
- LG K-EXAONE 2.0 (2026-07-31 공개): 750B MoE(활성 37B), 컨텍스트 262,144, Apache 2.0, 한국어 포함 10개 언어, 텍스트 전용. `enable_thinking=True`가 기본값입니다.
- SKT A.X K2 (2026-07-29 공개): 688B(활성 33B), 컨텍스트 262,144(128K 학습 후 YaRN으로 확장), Apache 2.0, 텍스트 전용. "Think-Fusion" 하이브리드 추론.
- 업스테이지 Solar Pro 4 (2026-08-11 공개): 512K 컨텍스트, 최대 128K 출력. 기본으로 추론을 수행하고 응답에 reasoning trace가 함께 담깁니다. 파라미터 수와 오픈 웨이트 여부는 공식 문서에 기재돼 있지 않습니다.
- 네이버 HyperCLOVA X: 2025년 12월 29일 옴니모달 발표. SEED 8B Omni는 텍스트·이미지·오디오를 처음부터 함께 학습한 네이티브 옴니모달이며, SEED 32B Think는 컨텍스트 128K에 사고 토큰 예산(기본 500)을 조절할 수 있습니다.
■ 7. 벤치마크는 어떻게 봐야 하나
- arena.ai(구 LMArena)는 Agent·Chat·Code·Image·Video·Vision·Document·Search·WebDev 등 다수 리더보드를 운영합니다. 2026년 8월 27일자 텍스트 리더보드 1~3위는 claude-fable-5(1507), claude-opus-4-6-high(1505), claude-opus-4-7-high(1502)였고, Meta muse-spark-1.2(xHigh)가 4위(1498), Kimi K3가 10위(1489)였습니다.
- ARC Prize 재단은 ARC-AGI-1·2·3을 운영하며, ARC-AGI-3을 "에이전트 지능을 측정하는, 세계에서 유일하게 아직 깨지지 않은 벤치마크"라고 공식 기술합니다. 2026년 상금은 200만 달러입니다.
- SWE-bench는 Verified·Multimodal·Multilingual·Lite·Full·Bash Only 6종 리더보드를 운영하며 지표는 "% Resolved"입니다.
주의할 것은 개발사 자체 주장과 운영기관 발표를 구분하는 일입니다. 예를 들어 xAI는 Grok 4.6이 "Artificial Analysis Intelligence Index에서 GPT-5.6 Sol과 대등하다"고 발표했는데, 이는 개발사의 주장이지 벤치마크 운영기관의 발표가 아닙니다.
■ 8. 고르는 순서
1) 평가셋을 먼저 만듭니다. 실제 업무 입력 30~50개면 충분합니다.
2) 가장 좋은 모델로 목표 정확도를 넘깁니다.
3) 추론 강도를 낮춰 봅니다. 여기서 대부분의 비용이 빠집니다.
4) 그다음에 더 싼 모델로 내려가며 정확도를 확인합니다.
5) 입력 길이 분포를 보고 구간별 요금 급변 지점을 넘는지 확인합니다.
6) 배포 형태가 정해졌다면 라이선스 원문을 읽습니다.
■ 유의사항: 이 글에서 확인하지 못한 것
메타 Muse Spark의 공식 단가·라이선스·컨텍스트(1.2 기준), Kimi K3의 공식 출시일과 API 단가, GLM-5.3의 사양표상 컨텍스트 명시값, 업스테이지 Solar Pro 4의 파라미터 수와 오픈 웨이트 여부는 1차 출처에서 확인하지 못했습니다. 다른 곳에서 이 값을 보시더라도 개발사 공식 문서에서 다시 확인하시기 바랍니다.
■ 9. 정리
2026년의 경쟁은 "누가 더 똑똑한가"에서 "같은 결과를 얼마에 내는가"로 옮겨왔습니다. 컨텍스트는 비슷해졌고, 추론 강도라는 조절 손잡이가 생겼고, 오픈 웨이트가 실제 선택지가 됐습니다. 그래서 모델 선택은 점점 더 회계와 라이선스의 문제가 되고 있습니다.
■ 참고 자료 및 출처
OpenAI 모델·가격: https://developers.openai.com/api/docs/models ·
https://developers.openai.com/api/docs/pricing.md
OpenAI 모델 선택 가이드
https://developers.openai.com/api/docs/guides/model-selection
Anthropic 모델 개요·가격: https://platform.claude.com/docs/en/models/overview ·
https://platform.claude.com/docs/en/about-claude/pricing
Anthropic 모델 선택 가이드
https://platform.claude.com/docs/en/about-claude/models/choosing-a-model
Google Gemini 모델·가격: https://ai.google.dev/gemini-api/docs/models ·
https://ai.google.dev/gemini-api/docs/pricing
xAI Grok 4.6
https://docs.x.ai/docs/models/grok-4.6
Mistral 모델·가격: https://docs.mistral.ai/getting-started/models/models_overview/ ·
https://mistral.ai/pricing/api/
DeepSeek 가격·모델카드: https://api-docs.deepseek.com/quick_start/pricing/ ·
https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
Alibaba Qwen: https://www.alibabacloud.com/help/en/model-studio/qwen3-8-max ·
https://huggingface.co/Qwen
LG K-EXAONE 2.0
https://www.lgresearch.ai/news/view?seq=678
SKT A.X K2: https://news.sktelecom.com/228501 ·
https://huggingface.co/skt/A.X-K2
업스테이지 Solar Pro 4: https://www.upstage.ai/blog/ko/solar-pro-4 ·
https://www.upstage.ai/pricing
네이버 HyperCLOVA X
https://clova.ai/en/hyperclova
과기정통부 독자 AI 사업 브리핑
https://www.korea.kr/news/policyNewsView.do?newsId=148970236
arena.ai 리더보드: https://arena.ai/leaderboard/text · ARC Prize: https://arcprize.org/ · SWE-bench
https://www.swebench.com/
모든 수치는 2026년 8월 31일 확인값입니다. 가격과 모델 라인업은 자주 바뀌므로 도입 전 공식 페이지를 다시 확인하시기 바랍니다.