최종 업데이트: 2026-09-29 · 수록 모델 33종
주요 LLM의 성능·API 가격·컨텍스트 길이를 동일한 기준으로 정리한 표입니다. 모델마다 다른 기준을 섞어 쓰면 비교가 성립하지 않기 때문에, TechBrief는 Artificial Analysis Intelligence Index v4.1를 기준 지표로 고정하고 각 모델의 실행 조건(effort·routing)을 함께 기록합니다.
TechBrief AI 모델 성능-비용 비교 (Artificial Analysis 기준)
업데이트: 2026-09-29
중국 오픈모델 비교
Chinese open models
가성비 모델 비교 (작업당 $1 미만)
OpenAIGoogleMetaStepFun
플래그십 모델 비교 (작업당 $1 이상)
AnthropicOpenAIGoogleMetaSpaceXAI
※ 성능 차이를 쉽게 비교할 수 있도록 Y축 범위를 일부 확대해 표시했습니다. 절대적인 성능 격차를 의미하지 않습니다.
※ 비교 조건: 대부분 max 조건 기준이며 Grok 4.6, Muse Spark 1.2, Grok 4.7, Qwen3.8 27B(xhigh 조건) · Gemini 3.7 Flash, Gemini 3.8 Flash(high 조건) · Gemini 3.1 Pro, GLM-5.3-Flash, Qwen3.8-Flash-Next, Qwen3.8 Max, Qwen3.8 2.4T A95B, Step 5 Preview(default 조건)만 조건이 다릅니다. 조건이 다른 값은 같은 축에서 직접 비교하는 데 한계가 있습니다.
※ 같은 라인의 구버전 3종은 가독성을 위해 차트에서 뺐습니다. 값은 아래 전체 표에서 확인할 수 있습니다.
모델별 성능·가격 비교
| 모델·조건 | AA Index | Task Cost | API $/M (입력/출력) | Context | Max output | 추천 용도 |
|---|---|---|---|---|---|---|
| Claude Opus 5.5 Anthropic · max |
57.6 | $5.98 | $4/$20 | 1,000K | 미공개 | 복합 추론·지식 작업 |
| Claude Sonnet 5.5 Anthropic · max |
56.0 | $7.60 | $2/$10 | 1,000K | 128K | 복합 추론·지식 작업 |
| Claude Fable 5.1 Anthropic · max |
53.4 | $7.63 | $10/$50 | 1,000K | 128K | 복합 추론·지식 작업 |
| GPT-6 Astra OpenAI · max |
52.7 | $3.26 | $10/$50 | 1,050K | 128K | 복합 추론·에이전트 작업 |
| Claude Opus 5 Anthropic · max |
50.8 | $5.86 | $5/$25 | 1,000K | 128K | 프런티어 지식 작업·장기 에이전트 |
| Claude Fable 5 Anthropic · max |
49.6 | $8.75 | $10/$50 | 1,000K | 128K | 최고 품질 우선 지식 작업 |
| Muse Spark 1.3 Meta · max |
48.1 | $1.60 | $1.25/$4.25 | 512K | 미공개 | 일반 지식 작업 |
| GPT-6 Sol OpenAI · max |
47.5 | $1.06 | $2/$10 | 1,050K | 128K | 복합 추론·코딩·에이전트 작업 |
| GPT-5.6 Sol OpenAI · max |
47.0 | $1.99 | $5/$30 | 1,050K | 128K | 코딩 에이전트·고난도 업무 |
| Grok 4.7 SpaceXAI · xhigh |
46.4 | $3.74 | $2/$6 | 500K | 미공개 | 일반 지식 작업 |
| Qwen3.8 Max Alibaba · default |
45.4 | $5.41 | $2/$6 | 1,000K | 미공개 | 복합 추론·지식 작업 |
| GLM-5.3 Z AI · max |
44.8 | $2.01 | $1.4/$4.4 | 1,000K | 128K | 복합 추론·지식 작업 |
| Grok 4.6 SpaceXAI · xhigh |
44.2 | $2.32 | $2/$6 | 500K | 미공개 | 복합 추론·지식 작업 |
| Step 5 Preview StepFun · default |
43.7 | $0.72 | $1/$2.7 | 1,000K | 64K | 일반 지식 작업 |
| Kimi K3 Kimi · max |
43.6 | $2.00 | $3/$15 | 1,000K | 미공개 | 복합 추론·지식 작업 |
| GPT-5.6 Terra OpenAI · max |
42.1 | $1.40 | $2/$12 | 1,050K | 128K | 균형형 일반 업무 |
| Claude Opus 4.8 Anthropic · max |
41.8 | $4.08 | $5/$25 | 1,000K | 128K | 복합 추론·에이전트 작업의 기준선 |
| GLM-5.3-Flash Z AI · default |
41.8 | $0.25 | $0.15/$0.5 | 1,000K | 131K | 코딩 에이전트 |
| Gemini 3.8 Flash Google · high |
40.9 | $1.24 | $0.75/$3.75 | 1,000K | 64K | 복합 추론·지식 작업 |
| Qwen3.8 2.4T A95B Alibaba · default |
39.9 | $2.16 | $2/$6 | 1,000K | 128K | 일반 지식 작업 |
| Qwen3.8-Flash-Next Alibaba · default |
39.8 | $0.37 | $0.15/$0.47 | 1,000K | 미공개 | 비용 민감 대량 처리 |
| Muse Spark 1.2 Meta · xhigh |
39.6 | $0.97 | $1.25/$4.25 | 1,024K | 미공개 | 비용 민감 대량 처리 |
| Gemini 3.7 Flash Google · high |
39.1 | $0.93 | $0.75/$3.75 2026-12-31까지 프로모션가. 2027-01-01부터 입력 $1.50 · 출력 $7.50. |
1,024K | 64K | 비용 민감 대량 처리 |
| Claude Sonnet 5 Anthropic · max |
38.2 | $5.09 | $2/$10 2026-08-10 도입가가 표준가로 확정. 예정됐던 $3/$15 인상은 시행되지 않는다. |
1,000K | 128K | 일반 지식 작업·긴 컨텍스트 |
| GPT-5.6 Luna OpenAI · max |
37.3 | $0.18 | $1/$6 | 1,050K | 128K | 대량 처리·비용 민감 에이전트 |
| GPT-6 Luna OpenAI · max |
37.3 | $0.07 | $0.1/$0.5 | 1,050K | 128K | 비용 민감 대량 처리 |
| DeepSeek V4 Pro 0813 DeepSeek · max |
36.0 | $0.67 | $1.32/$3.96 | 1,000K | 384K | 비용 민감 대량 처리 |
| DeepSeek V4 Flash 0731 DeepSeek · max |
34.3 | $0.22 | $0.14/$0.28 | 1,000K | 384K | 비용 민감 대량 처리 |
| Gemini 3.6 Flash Google · high |
34.0 | $0.93 | $0.75/$3.75 2026-12-31까지 프로모션가. 2027-01-01부터 입력 $1.50 · 출력 $7.50. |
1,024K | 64K | 고속 멀티모달·비용 효율 작업 |
| GLM-5.2 Z AI · max |
33.7 | $0.96 | $1.4/$4.4 | 1,000K | 128K | 비용 민감 대량 처리 |
| Qwen3.8 27B Alibaba · xhigh |
33.7 | $1.01 | $0.5/$3 | 1,000K | 128K | 일반 지식 작업 |
| Gemini 3.5 Flash Google · high |
32.6 | $1.56 | $1.5/$9 | 1,000K | 64K | 일반 지식 작업 |
| Gemini 3.1 Pro Google · default |
29.7 | $0.67 | $2/$12 | 1,024K | 64K | 코딩 에이전트 |
Task Cost는 Artificial Analysis weighted average Cost per Intelligence Index task (USD) 기준입니다. API 단가는 100만 토큰당 입력/출력 가격입니다.
Max output이 ‘미공개’인 항목은 공식 문서에서 값을 확인하지 못한 경우이며, 0으로 채우지 않습니다.
비교에서 제외한 모델
- Grok 4.5 — 동일 공개 시점의 AA Intelligence Index와 Task Cost, effort 조건을 함께 검증하지 못해 v1 지도에서 제외
- DeepSeek 최신 모델 — 공개 모델·provider별 가격과 AA 실행 조건이 달라 동일 조건 비교 데이터 확정 전 제외
- Qwen 최신 모델 — 공개 모델·provider별 가격과 AA 실행 조건이 달라 동일 조건 비교 데이터 확정 전 제외
동일 조건으로 확인하지 못한 값은 추정하지 않고 제외하며, 조건이 확정되면 표에 추가합니다.
비교 기준
- 기준 지표: Artificial Analysis Intelligence Index v4.1
- 비용 지표: Artificial Analysis weighted average Cost per Intelligence Index task (USD)
- 비교 규칙: Use the newest published reasoning configuration per model. Preserve effort, routing, fallback, provider, and pricing conditions in each record; do not infer a universal ranking across different conditions.
- 출처 우선순위: ① 공식 발표 · ② 공식 API 문서 · ③ Artificial Analysis 순으로 채택하며, 참고 기사는 수치의 근거로 쓰지 않습니다.
- 제조사 자체 발표 수치는 별도 표기하며, 교차 모델 비교에는 사용하지 않습니다.
이 표는 신규 모델 출시·가격 변경 시 갱신되며, 갱신 이력은 데이터셋 변경 기록으로 관리합니다. 수치 오류를 발견하면 문의로 알려주세요.
