Claude Opus 5는 얼마나 좋아졌나: GPT-5.6 Sol·Fable 5 성능과 가격 비교
핵심 요약
- Claude Opus 5는 Opus 4.8과 API 가격(100만 토큰당 입력 5달러·출력 25달러)이 같지만, Anthropic이 공개한 Frontier-Bench v0.1·GDPval-AA v2·OSWorld 2.0·CursorBench 3.2 등 여러 코딩·지식 작업 평가에서 큰 폭의 성능 향상을 보였다.
- ARC-AGI-3·OSWorld 2.0 등 일부 평가에서는 Anthropic이 공개한 자료 기준으로 GPT-5.6 Sol·Fable 5보다 높은 결과를 냈지만, 이는 회사 자체 발표이며 모든 코딩 평가에서 Opus 5가 가장 강하다고 단정할 수는 없다. Artificial Analysis Coding Agent Index처럼 독립 기관이 집계한 코딩 지표에서는 GPT-5.6 Sol이 앞선 결과도 있다.
- Opus 5의 API 가격은 입력 100만 토큰당 5달러·출력 25달러로 Fable 5(10달러·50달러)의 절반이며, GPT-5.6 Sol(5달러·30달러)과 비교하면 입력 가격은 같고 출력 가격은 더 낮다.
- Grok 4.5는 기본 토큰 단가가 가장 낮지만(2달러·6달러, 20만 토큰 미만 구간 기준), 저렴한 가격이 동일한 작업 완료율을 보장하지는 않는다.
Claude Opus 5가 나왔다는 소식 앞에서 독자가 가장 궁금한 질문은 세 가지다. Opus 4.8보다 실제로 얼마나 좋아졌는가, GPT-5.6 Sol·Fable 5와 비교하면 어디서 강한가, 가격 차이는 얼마인가. 위 핵심 요약이 이 세 질문에 대한 직접적인 답이다. 다만 이 답을 그대로 “Opus 5가 모든 면에서 1위”로 읽으면 안 된다. 프런티어 모델은 같은 이름의 평가라도 추론 강도, 도구 사용 여부, 최대 출력 길이, 평가 주체(자사 발표인지 독립 기관인지)에 따라 결과가 달라진다. 이 글은 그 차이를 구분해 가며 실제 공개된 숫자를 비교한다.
이 글이 비교하는 다섯 모델
이 글은 Opus 5와 세대 비교용 Opus 4.8, 그리고 경쟁·상위 모델인 Fable 5, GPT-5.6 Sol, Grok 4.5를 비교한다. Opus 4.8은 “경쟁 모델”이 아니라 Opus 5가 얼마나 개선됐는지 보여주는 기준선이다. Fable 5는 Anthropic의 최고 성능 가격대 모델, GPT-5.6 Sol은 OpenAI가 Luna·Terra·Sol 세 계층 중 최상위로 내놓은 모델, Grok 4.5는 저가·고효율을 앞세운 xAI의 모델이다. “공개 발표”와 “독립 비교”도 구분해야 한다. Anthropic의 Frontier-Bench·ARC-AGI-3 결과는 회사 발표이고, xAI의 토큰 사용량 주장도 회사가 제공한 수치다. Artificial Analysis 같은 독립 기관의 지수는 여러 회사 모델을 같은 방법론으로 채점하려 시도하지만, 그 자체도 하나의 평가 기준일 뿐 절대적 종합 순위는 아니다.
Opus 5는 Opus 4.8보다 무엇이 달라졌나
Anthropic 공식 발표문에서 확인되는 구체적 개선은 다음과 같다. 모두 Anthropic 자체 발표 또는 파트너 평가라는 점을 전제로 읽어야 한다.
- Frontier-Bench v0.1에서 “다른 모든 모델을 앞섰고, Opus 4.8 성능의 두 배 이상을 더 낮은 작업당 비용으로 기록했다”고 밝혔다.
- CursorBench 3.2 최대 effort(max effort) 설정에서 Fable 5 최고 점수의 0.5% 이내로 근접했으며, 비용은 작업당 절반 수준이라고 설명했다. high·xhigh·max 세 effort 단계 모두에서 같은 비용 대비 다른 모델보다 높은 성능을 냈다고 덧붙였다.
- OSWorld 2.0(컴퓨터 사용 평가)에서 Fable 5의 최고 기록을 약 3분의 1 수준의 작업당 비용으로 넘어섰다고 밝혔다.
- ARC-AGI-3(낯선 규칙 추론 평가)에서 “다음으로 높은 모델보다 3배 높은 점수”를 기록했다고 설명했다. 다만 이 발표문에는 절대 점수나 비교 대상 모델명이 명시돼 있지 않다.
- 생명과학 분야 내부 평가에서 유기화학 관련 작업은 Opus 4.8보다 10.2%포인트, 단백질 관련 작업은 7.7%포인트 높았다고 밝혔다.
이 개선들의 공통점은 절대 점수 공개보다 “같은 비용 또는 더 낮은 비용으로 더 높은 성능”이라는 상대적 비교에 초점을 둔다는 것이다. Opus 5와 Opus 4.8의 API 가격이 100만 토큰당 입력 5달러·출력 25달러로 동일하므로, 같은 예산에서 결과물의 재작업이 줄어드는지가 체감 개선의 핵심이 된다. 출처: Anthropic, Claude Opus 5 출시
출시 당일 확인된 성능·가격 데이터
‘확인 불가’ 대신 공개·검증 가능한 절대 수치만 남겼다. Frontier-Bench·BrowseComp은 Anthropic 공개 차트, ARC-AGI-3은 ARC Prize 검증 결과, Intelligence Index·GDPval-AA v2·AA-Briefcase는 Artificial Analysis의 외부 평가다. Artificial Analysis는 Opus 5 출시 전 Anthropic의 지원을 받아 평가했음을 공개했으므로, 완전히 독립된 블라인드 비교로 해석해서는 안 된다. 점수는 서로 다른 평가이므로 단일 종합 순위가 아니다.
| 평가 | Opus 5 | Opus 4.8 | Fable 5 | GPT-5.6 Sol | 출처·조건 |
|---|---|---|---|---|---|
| Frontier-Bench v0.1 | 43.3% | 경쟁 모델 절대값은 차트 판독치만 공개되어 직접 비교에서 제외 | Anthropic 차트. mini-SWE-agent·GKE, 5회 시도 평균; Opus 5·Fable 5는 fallback 포함. 공식 본문은 Opus 5가 Opus 4.8의 2배 이상이며 모든 모델을 앞섰다고만 명시한다. | ||
| GDPval-AA v2 | 1,861 Elo | 1,600.1 Elo | 1,747 Elo | 1,747.8 Elo | Artificial Analysis, Opus 5 max effort. |
| ARC-AGI-3 | 30.16% (High) | 1.5% | 공개 검증 수치 없음 | 7.78% | ARC Prize 검증 결과. Opus 5는 High만 시험. |
| BrowseComp | 90.8% (Anthropic) |
85.9% (OpenAI) |
84.4% (OpenAI) |
90.4% (OpenAI) |
각 회사의 출시 표에서 인용. 모델 설정·도구·평가 시점이 완전히 같지 않아 근소한 차이를 종합 순위로 해석하면 안 된다. |
| AA Intelligence Index | 60.7 (max) | 55.7 | 59.9 | 58.9 | Artificial Analysis 종합 지수. |
| AA-Briefcase | 1,720 Elo (max) | — | 1,574 Elo | — | Artificial Analysis 에이전트형 지식 작업 평가. |
| AA-Briefcase 작업당 비용 | $17.79 (max) | — | $22.30 | — | Opus 5 high: 1,606 Elo·$10.41; xhigh: 1,693 Elo·$14.26. |
핵심. Opus 5는 Frontier-Bench 43.3%, ARC-AGI-3 30.16%, GDPval-AA v2 1,861 Elo, AA-Briefcase 1,720 Elo를 기록했다. BrowseComp은 Sol 90.4%와 Opus 5 90.8%가 근소한 차이여서 이 항목 하나로 일반적 우열을 말할 수 없다.
TechBrief AI 모델 성능-비용 비교 (Artificial Analysis 기준)
업데이트: 2026-08-14
가성비 모델 비교 (작업당 $1 미만)
OpenAIGooglexAIChinese open models
플래그십 모델 비교 (작업당 $1 이상)
AnthropicOpenAI
※ 성능 차이를 쉽게 비교할 수 있도록 Y축 범위를 일부 확대해 표시했습니다. 절대적인 성능 격차를 의미하지 않습니다.
※ 비교 조건: 대부분 max 조건 기준이며 Gemini 3.6 Flash, Gemini 3.5 Flash, Grok 4.6, Gemini 3.7 Flash(high 조건) · Kimi K3(default 조건)만 조건이 다릅니다. 조건이 다른 값은 같은 축에서 직접 비교하는 데 한계가 있습니다.
성능과 비용을 동시에 보면 Opus 5가 어떤 위치에 있는지 한눈에 확인할 수 있습니다. Opus 5는 최상위 지수권에 있으면서 Fable 5보다 낮은 Task Cost를 보이지만, GPT-5.6 Sol·Terra·Luna와 Gemini 3.6 Flash는 각기 다른 가격대에서 강한 성능-비용 선택지를 제공합니다.
비교 조건(max effort, routing, fallback, tool use)은 모델마다 다를 수 있습니다. 따라서 동일 조건이 아닌 결과를 절대적인 순위로 해석해서는 안 됩니다. 최신 데이터·조건·제외 모델은 TechBrief AI Model Index에서 관리합니다.
Opus 5와 GPT-5.6 Sol, 무엇이 더 좋은가
두 모델을 “Opus 5가 Sol을 압도한다” 또는 그 반대로 단정할 수는 없다. 어느 자료를 기준으로 삼느냐에 따라 결론이 갈린다.
- Anthropic이 공개한 ARC-AGI-3, OSWorld 2.0 등 일부 평가에서는 Opus 5가 우세하다고 발표됐다.
- OpenAI가 홍보한 Artificial Analysis Coding Agent Index 등 독립 기관의 일부 코딩 평가에서는 GPT-5.6 Sol이 80.0점으로 Fable 5보다 2.8점 높은 신기록을 세우며 강한 결과를 보였다. 다만 이 지수에는 Opus 5가 아직 포함돼 있지 않다.
- 가격은 Opus 5가 입력 100만 토큰당 5달러로 Sol과 같고, 출력은 25달러로 Sol의 30달러보다 낮다.
- 두 회사 발표 자료의 effort 설정, 도구 구성, 토큰 예산이 서로 달라 절대적인 승패로 일반화할 수 없다.
실무적으로는 복합 지식 작업과 에이전트형 문제 해결이 중요하다면 Opus 5를, OpenAI 생태계 안에서 움직이거나 특정 코딩 워크플로를 쓴다면 GPT-5.6 Sol을 먼저 시험해 보는 편이 합리적이다. 어느 쪽이든 자체 파일럿으로 재현하기 전까지는 발표 자료의 우열을 그대로 구매 결정에 옮기지 않아야 한다. 출처: Anthropic, Claude Opus 5 출시, Artificial Analysis, GPT-5.6 benchmarks across Intelligence, Speed and Cost, OpenAI, GPT-5.6 공식 발표
API 가격표: 다섯 모델, 세 회사
API 비용은 입력·출력 토큰을 따로 청구한다. 입력은 프롬프트·시스템 지시문·이전 대화·도구 결과를 포함하고, 출력은 답변과 에이전트의 계획·도구 호출·중간 산출물까지 포함할 수 있다. 아래는 각 회사의 공식 문서에 실린 100만 토큰당 기본 가격이다. 캐시·장문 컨텍스트·일괄 처리 조건은 각주로 구분했다.
| 모델 | 입력 / 100만 토큰 | 출력 / 100만 토큰 | 계층·권장 용도 | 주석 |
|---|---|---|---|---|
| Grok 4.5 | 2달러 | 6달러 | 저가·고효율 전략 | 캐시입력 0.30달러. 20만 토큰 이상 구간은 입력 4달러·출력 12달러로 인상 |
| GPT-5.6 Luna | 1달러 | 6달러 | 최하위 계층, 대량·경량 작업 | 캐시입력 0.10달러. 장문 컨텍스트 구간 입력 2달러·출력 9달러 |
| GPT-5.6 Terra | 2.50달러 | 15달러 | 중간 계층, 일반 업무 | 캐시입력 0.25달러. 장문 컨텍스트 구간 입력 5달러·출력 22.50달러 |
| Claude Opus 5 | 5달러 | 25달러 | Fable 5급 성능을 절반 가격에 제시 | 컨텍스트 100만 토큰, 최대 출력 12.8만 토큰 |
| Claude Opus 4.8 | 5달러 | 25달러 | 세대 비교 기준 모델 | Opus 5와 가격 동일, 성능 차이로만 비교해야 함 |
| GPT-5.6 Sol | 5달러 | 30달러 | OpenAI 최상위 계층 | 캐시입력 0.50달러. 장문 컨텍스트 구간 입력 10달러·출력 45달러 |
| Claude Fable 5 | 10달러 | 50달러 | Anthropic 최고 성능 가격대 | 컨텍스트 100만 토큰, 최대 출력 12.8만 토큰 |
Terra·Luna는 OpenAI가 Sol 아래에 둔 하위 계층으로, 이 글의 핵심인 Opus 5 vs Sol 성능 비교에는 포함하지 않았다. 가격표에만 넣은 것은 OpenAI의 3계층 제품군 구조를 보여주기 위해서다. 두 모델의 자세한 비교는 별도 글에서 다룰 예정이다. 출처: Anthropic, Claude 모델 개요 및 가격, OpenAI, API 가격, xAI, API 가격
이 표만 보면 Grok 4.5가 정답처럼 보일 수 있지만, 실제 비용은 “작업 완료 비용 = 모델 호출 비용 + 실패·재시도 비용 + 도구·인프라 비용 + 사람 검수·수정 비용”으로 계산해야 한다. 예를 들어 입력 100만·출력 20만 토큰을 쓰는 작업 하나를 가격표대로만 계산하면 Grok 4.5는 약 3.2달러, Opus 5는 약 10달러, GPT-5.6 Sol은 약 11달러, Fable 5는 약 20달러다(입력 1M·출력 0.2M이라는 가정의 산술 예시일 뿐 실제 작업 비율을 뜻하지 않는다). 저가 모델이 두 번 시도해야 하고 고가 모델이 한 번에 통과한다면 이 차이는 줄어들거나 역전될 수 있다.
Grok 4.5는 어디에 쓰나
Grok 4.5는 Opus 5·Fable 5·Sol과 동일 체급에서 직접 경쟁하는 모델이라기보다, 저단가·토큰 효율 전략의 참고 사례로 보는 편이 정확하다. xAI는 특정 SWE-Bench Pro 설정에서 Grok 4.5가 Opus 4.8보다 적은 토큰을 사용했고 초당 처리 속도도 높았다고 알려져 있다. 다만 이 수치는 xAI 공식 발표 페이지(x.ai/news/grok-4-5)에서 직접 확인하지 못했으며, The Decoder 등 2차 보도에 기반한 주장이라는 점을 밝혀 둔다. 이를 전체 코딩 업무나 모든 에이전트 작업에서 더 효율적이라는 근거로 일반화해서는 안 된다. 대량 처리·비용 민감 업무의 후보로 검토하되, 실제 워크로드로 검증이 필요하다. 출처: xAI, Grok 4.5 공식 문서, The Decoder, Grok 4.5 가격 비교(2차 출처)
사용자 유형별로 먼저 시험할 모델
아래는 확정적인 서열이 아니라, 첫 파일럿에서 우선 시험해 볼 후보를 정리한 것이다.
- 복합 추론·긴 지식 작업·에이전트형 코딩: Opus 5를 우선 시험한다.
- 최고 품질이 비용보다 중요한 극고난도 작업: Fable 5와 Opus 5를 직접 파일럿으로 비교한다.
- OpenAI 도구·GPT 생태계 중심의 고난도 업무: GPT-5.6 Sol을 우선 시험한다.
- 대량 반복 처리와 비용 민감 업무: Grok 4.5 또는 GPT-5.6 Luna·Terra를 함께 비교 대상에 넣는다.
- 일상적인 문서 작성·요약: 프런티어 상위 모델을 매번 쓸 필요는 없다.
벤치마크 해석 시 주의할 점
이 글에서 인용한 수치는 성격이 다르다. Frontier-Bench·ARC-AGI-3·OSWorld 2.0·CursorBench 3.2는 Anthropic 자체 발표이고, SWE-Bench Pro 토큰 절감은 xAI가 제공한 수치이며, Coding Agent Index는 독립 기관인 Artificial Analysis의 집계다. 세 가지를 같은 신뢰도로 취급하면 안 되고, 같은 벤치마크 이름이라도 추론 강도(effort)·도구 권한·평가 시점이 다르면 숫자의 의미가 달라진다. 벤치마크는 구매를 대신 결정해 주지 않는다. 실무에서는 벤치마크가 아니라 자신의 업무 유형(문서 요약, 코드 수정, 브라우저 조작 등)에 맞는 파일럿을 설계해 통과율·재시도 횟수·사람 수정 시간·완료 한 건당 총비용을 직접 측정해야 한다. 같은 입력·같은 도구 권한·같은 시간 예산에서 후보 모델을 돌리고, 추론 강도 설정을 결과 옆에 반드시 기록하는 것이 최소 조건이다.
결론: 공개 자료 기준, Opus 5는 ‘가격 유지형 대폭 개선’이다
현재 공개된 공식 자료 기준에서는 Claude Opus 5가 Opus 4.8 대비 큰 폭으로 개선됐으며, 여러 프런티어 평가에서 GPT-5.6 Sol 및 Fable 5와 경쟁하거나 앞서는 결과를 보였다. 다만 Artificial Analysis 수치는 Anthropic 지원 하의 사전 평가이며 fallback 조건을 포함한다. 특히 Frontier-Bench 43.3%, ARC-AGI-3 30.16%, Artificial Analysis Intelligence Index 60.7, GDPval-AA v2 1,861 Elo, AA-Briefcase 1,720 Elo는 출시 당일 확인 가능한 핵심 수치다.
가격도 분명하다. Opus 5는 Opus 4.8과 같은 입력 $5·출력 $25/100만 토큰이며, Artificial Analysis의 지식 작업 평가에서는 Fable 5보다 높은 AA-Briefcase Elo를 $4.51 낮은 작업당 비용으로 냈다. 다만 모든 벤치마크에서 가장 우수한 모델이라고 단정할 수는 없으며, 평가 조건과 실제 업무 환경에 따라 결과는 달라질 수 있다.
구매 또는 도입 판단에서는 같은 프롬프트·도구 권한·시간 예산으로 Claude Code, Cursor, 실제 API 작업을 파일럿해 성공률·재시도·사람 검수 시간·완료 한 건당 총비용을 기록하는 것이 맞다.
이 글은 계속 업데이트됩니다
Artificial Analysis의 Opus 5 데이터는 본문 표와 그래프에 반영했다. 아래는 아직 출시 당일에 충분히 확인되지 않은 항목만 남긴다.
- LMSYS(Chatbot Arena)와 추가 독립 벤치마크 — 새 리더보드 결과를 날짜·조건과 함께 추가한다.
- 장기 실사용 후기 — 안정성·재시도율·사람 검수 부담을 확인한다.
- Claude Code 실제 프로젝트 테스트 — 동일 저장소·동일 이슈 조건에서 해결률과 총 작업 시간을 비교한다.
- Cursor 생산성 비교 — 실제 편집·디버깅 흐름의 생산성을 측정한다.
- API 실제 비용 — 캐시·도구 호출·재시도를 포함한 완료 작업당 청구 비용을 기록한다.
TechBrief 실사용 검증 계획
이 글의 다음 업데이트부터는 공식 자료와 외부 벤치마크에 더해 TechBrief 자체 실사용 데이터를 분리해 누적합니다.
- Claude Code 장시간 코딩 품질
- GPT-5.6 Sol 동일 작업 비교
- Cursor 실사용 생산성
- API 실제 비용
- 장시간 Agent 작업 성공률
- 실제 업무 기준 생산성
참고 출처
- Anthropic, Claude Opus 5 출시 공식 발표
- Anthropic, Claude 모델 개요 및 공식 가격 문서
- OpenAI, GPT-5.6 공식 출시 발표
- OpenAI, 공식 API 가격 문서
- OpenAI, GPT-5.6 시스템 카드
- xAI, Grok 4.5 공식 문서
- xAI, 공식 API 가격 문서
- ARC Prize Foundation, ARC-AGI 공식 리더보드
- Artificial Analysis, Claude Opus 5 출시 당일 독립 평가
- Artificial Analysis, GPT-5.6 benchmarks across Intelligence, Speed and Cost(독립 벤치마크 기관)
- Vellum, Claude Opus 5 Benchmarks Explained(벤치마크 수치 교차 확인용 해설·보조 출처)
- The Decoder, Opus 5 분석(해설·보조 출처)
- Simon Willison, GPT-5.6 제품군 해설(해설·보조 출처)
- The Decoder, Grok 4.5 가격·토큰 효율 보도(2차 출처)
