최종 업데이트: 2026-08-14 · 수록 모델 15종
주요 LLM의 성능·API 가격·컨텍스트 길이를 동일한 기준으로 정리한 표입니다. 모델마다 다른 기준을 섞어 쓰면 비교가 성립하지 않기 때문에, TechBrief는 Artificial Analysis Intelligence Index v4.1를 기준 지표로 고정하고 각 모델의 실행 조건(effort·routing)을 함께 기록합니다.
TechBrief AI 모델 성능-비용 비교 (Artificial Analysis 기준)
업데이트: 2026-08-14
가성비 모델 비교 (작업당 $1 미만)
OpenAIGooglexAIChinese open models
플래그십 모델 비교 (작업당 $1 이상)
AnthropicOpenAI
※ 성능 차이를 쉽게 비교할 수 있도록 Y축 범위를 일부 확대해 표시했습니다. 절대적인 성능 격차를 의미하지 않습니다.
※ 비교 조건: 대부분 max 조건 기준이며 Gemini 3.6 Flash, Gemini 3.5 Flash, Grok 4.6, Gemini 3.7 Flash(high 조건) · Kimi K3(default 조건)만 조건이 다릅니다. 조건이 다른 값은 같은 축에서 직접 비교하는 데 한계가 있습니다.
모델별 성능·가격 비교
| 모델·조건 | AA Index | Task Cost | API $/M (입력/출력) | Context | Max output | 추천 용도 |
|---|---|---|---|---|---|---|
| Claude Opus 4.8 Anthropic · max |
57.3 | $2.03 | $5/$25 | 1,000K | 128K | 복합 추론·에이전트 작업의 기준선 |
| Claude Opus 5 Anthropic · max |
63.1 | $2.34 | $5/$25 | 1,000K | 128K | 프런티어 지식 작업·장기 에이전트 |
| Claude Fable 5 Anthropic · max |
62.1 | $3.14 | $10/$50 | 1,000K | 128K | 최고 품질 우선 지식 작업 |
| Claude Sonnet 5 Anthropic · max |
55.3 | $1.72 | $2/$10 2026-08-10 도입가가 표준가로 확정. 예정됐던 $3/$15 인상은 시행되지 않는다. |
1,000K | 128K | 일반 지식 작업·긴 컨텍스트 |
| GPT-5.6 Sol OpenAI · max |
60.9 | $1.23 | $5/$30 | 1,050K | 128K | 코딩 에이전트·고난도 업무 |
| GPT-5.6 Terra OpenAI · max |
56.6 | $0.51 | $2/$12 | 1,050K | 128K | 균형형 일반 업무 |
| GPT-5.6 Luna OpenAI · max |
52.3 | $0.05 | $1/$6 | 1,050K | 128K | 대량 처리·비용 민감 에이전트 |
| Gemini 3.6 Flash Google · high |
51.6 | $0.56 | $0.75/$3.75 2026-12-31까지 프로모션가. 2027-01-01부터 입력 $1.50 · 출력 $7.50. |
1,048K | 65K | 고속 멀티모달·비용 효율 작업 |
| Kimi K3 Kimi · default |
59.7 | $0.84 | $3/$15 | 1,000K | 미공개 | 복합 추론·지식 작업 |
| Gemini 3.5 Flash Google · high |
52.0 | $0.69 | $1.5/$9 | 1,000K | 65K | 일반 지식 작업 |
| GLM-5.2 Z AI · max |
52.6 | $0.32 | $1.4/$4.4 | 1,000K | 128K | 비용 민감 대량 처리 |
| Grok 4.6 xAI · high |
60.9 | $0.84 | $2/$6 | 500K | 미공개 | 복합 추론·지식 작업 |
| DeepSeek V4 Flash 0731 DeepSeek · max |
51.8 | $0.03 | $0.14/$0.28 | 1,000K | 384K | 비용 민감 대량 처리 |
| Gemini 3.7 Flash Google · high |
56.0 | $0.40 | $0.75/$3.75 2026-12-31까지 프로모션가. 2027-01-01부터 입력 $1.50 · 출력 $7.50. |
1,048K | 65K | 비용 민감 대량 처리 |
| DeepSeek V4 Pro 0813 DeepSeek · max |
53.2 | $0.25 | $1.32/$3.96 | 1,000K | 384K | 비용 민감 대량 처리 |
Task Cost는 Artificial Analysis weighted average Cost per Intelligence Index task (USD) 기준입니다. API 단가는 100만 토큰당 입력/출력 가격입니다.
Max output이 ‘미공개’인 항목은 공식 문서에서 값을 확인하지 못한 경우이며, 0으로 채우지 않습니다.
비교에서 제외한 모델
- Grok 4.5 — 동일 공개 시점의 AA Intelligence Index와 Task Cost, effort 조건을 함께 검증하지 못해 v1 지도에서 제외
- DeepSeek 최신 모델 — 공개 모델·provider별 가격과 AA 실행 조건이 달라 동일 조건 비교 데이터 확정 전 제외
- Qwen 최신 모델 — 공개 모델·provider별 가격과 AA 실행 조건이 달라 동일 조건 비교 데이터 확정 전 제외
동일 조건으로 확인하지 못한 값은 추정하지 않고 제외하며, 조건이 확정되면 표에 추가합니다.
비교 기준
- 기준 지표: Artificial Analysis Intelligence Index v4.1
- 비용 지표: Artificial Analysis weighted average Cost per Intelligence Index task (USD)
- 비교 규칙: Use the newest published reasoning configuration per model. Preserve effort, routing, fallback, provider, and pricing conditions in each record; do not infer a universal ranking across different conditions.
- 출처 우선순위: ① 공식 발표 · ② 공식 API 문서 · ③ Artificial Analysis 순으로 채택하며, 참고 기사는 수치의 근거로 쓰지 않습니다.
- 제조사 자체 발표 수치는 별도 표기하며, 교차 모델 비교에는 사용하지 않습니다.
이 표는 신규 모델 출시·가격 변경 시 갱신되며, 갱신 이력은 데이터셋 변경 기록으로 관리합니다. 수치 오류를 발견하면 문의로 알려주세요.
