Claude Sonnet 5 성능과 비용: Opus 4.8·Fable 5와 무엇이 다른가
핵심 요약
- Claude Sonnet 5의 핵심은 “가장 강한 모델”이 아니라 “기본값으로 배포할 수 있을 만큼 충분히 강하고, 비용과 안전성까지 균형 잡힌 모델”이라는 데 있다.
- Anthropic은 Sonnet 5를 일반 업무와 대중적 개발 작업의 기본축으로, Opus 4.8을 복잡한 추론과 고난도 에이전트 작업의 상위축으로, Fable 5를 장기 작업과 고난도 에이전트 흐름을 위한 별도 상위 계층으로 배치하고 있다.
- 공식 발표에서 Sonnet 5는 Opus 4.8에 가까운 성능을 더 낮은 가격으로 제공하는 모델로 설명된다. 이는 단순 가격 인하가 아니라 성능 대비 비용을 중심으로 한 제품 전략이다.
- Fable 5는 더 높은 능력 범주를 겨냥하지만, 비용·접근성·안전장치·운영 리스크를 고려하면 일반 기본 모델이 되기 어렵다.
- 앞으로 실무자가 물어야 할 질문은 “어떤 모델이 제일 좋은가”가 아니라 “이 업무에서 실패 비용, 응답 속도, 추론 깊이, 예산을 고려할 때 어떤 모델이 맞는가”다.
왜 Anthropic은 최고 성능 모델이 아니라 Sonnet을 기본값으로 삼았나
Claude Sonnet 5를 볼 때 가장 먼저 던져야 할 질문은 “성능이 얼마나 좋아졌는가”가 아니다. 더 중요한 질문은 “왜 Anthropic은 Sonnet 계열을 대부분의 사용자가 만나는 기본 모델로 밀어낼 수 있었는가”다. 프런티어 모델 시장에서는 오랫동안 가장 높은 벤치마크 점수, 가장 큰 추론 능력, 가장 어려운 코딩 문제 해결률이 주목을 받았다. 그러나 실제 서비스 운영의 관점에서 기본 모델은 최고 성능 모델과 같은 개념이 아니다.
기본 모델은 매일 가장 많은 요청을 처리해야 한다. 개발자의 코드 리뷰, 문서 요약, 기획서 작성, 검색 기반 질의응답, 간단한 데이터 분석, 고객 지원 초안, 내부 지식 검색, 에이전트 도구 호출 같은 업무가 모두 여기에 들어간다. 이런 요청은 하나하나가 세계 최고 수준의 장기 추론을 요구하지 않는다. 대신 빠르게 응답해야 하고, 비용이 예측 가능해야 하며, 안전장치가 안정적으로 작동해야 하고, 대규모 사용자에게 일관된 품질을 제공해야 한다.
Anthropic이 Sonnet 5를 내세운 이유도 이 지점에서 읽어야 한다. 공식 발표는 Sonnet 5를 Sonnet 계열의 차세대 모델이자 Sonnet 4.6의 대체 업그레이드로 설명하며, 개발자와 기업이 기존 Sonnet 사용처에서 비교적 직접적으로 전환할 수 있는 모델로 제시한다. 플랫폼 문서도 Sonnet 5를 Sonnet 4.6의 드롭인 업그레이드로 설명하면서, 적응형 사고가 기본 활성화되고 수동 확장 사고 방식에는 동작 변화가 있음을 명시한다. 즉, 공식 발표와 플랫폼 문서를 기준으로 보면, Sonnet 5는 “새로운 실험 모델”보다 “대규모 제품 배포에 넣을 수 있는 기본 모델”에 가깝다. 출처: What’s new in Claude Sonnet 5, Introducing Claude Sonnet 5 – Anthropic
이 변화는 단순한 모델 교체가 아니다. Anthropic은 모델을 성능 순서로 한 줄 세우는 대신, 사용 범위와 비용 구조에 따라 계층화하고 있다. Sonnet 5는 넓은 배포와 높은 사용량을 전제로 한 중심 모델이다. Opus 4.8은 더 복잡하고 실패 비용이 큰 작업에서 여전히 의미가 있는 상위 모델이다. Fable 5는 더 긴 시간축과 더 어려운 에이전트 작업을 겨냥하는 별도 상위 계층으로 해석할 수 있다. 이 구조에서 Sonnet 5의 의미는 “Opus를 없애는 모델”이 아니라 “Opus가 필요하지 않은 대다수 업무를 흡수하는 모델”이다.
기본 모델의 조건: 성능만으로는 부족하다
프런티어 모델을 평가할 때 벤치마크는 필요하다. 하지만 기본 모델을 정할 때는 벤치마크만으로 충분하지 않다. 기본 모델에는 최소 네 가지 조건이 필요하다.
첫째, 충분한 범용 성능이다. 개발, 문서, 분석, 검색, 도구 호출, 멀티스텝 작업에서 평균적인 사용자가 체감할 품질이 일정 수준 이상이어야 한다. 둘째, 비용 효율이다. 대규모 사용자가 매일 호출해도 플랫폼과 고객 양쪽 모두 감당 가능한 가격 구조여야 한다. 셋째, 안전성과 예측 가능성이다. 기업 환경에서는 모델이 뛰어난 답을 한 번 내는 것보다 위험한 답을 반복적으로 줄이는 것이 더 중요할 수 있다. 넷째, 배포 가능성이다. 제품 기본값은 연구실의 최고 성능 모델이 아니라 실제 인프라, 지연 시간, 사용량, 지원 정책 위에서 안정적으로 굴러가야 한다.
Sonnet 5는 이 네 조건의 교차점에 놓인다. Anthropic은 공식 발표에서 Sonnet 5가 Opus 4.8에 가까운 성능을 더 낮은 가격으로 제공한다고 설명한다. 여기서 핵심은 “낮은 가격” 그 자체가 아니라 “기본 모델로 삼아도 사용자가 손해를 본다고 느끼지 않을 정도의 성능”과 “대규모 배포가 가능한 비용 구조”가 동시에 맞물렸다는 점이다. (관련: Introducing Claude Sonnet 5 – Anthropic).
이 기준은 특히 기업 도입에서 중요하다. 기업은 모델을 한 번 써보고 감탄하는 방식으로 도입하지 않는다. 월간 토큰 비용, 응답 지연, 보안 검토, 내부 도구 연결, 데이터 처리 정책, 장애 대응, 모델 업데이트 주기까지 본다. 가장 높은 성능의 모델이 모든 업무에 최적인 경우는 드물다. 예를 들어 고객지원 요약, 내부 위키 검색, PR 설명 초안, 회의록 정리 같은 작업에는 Opus급 추론보다 안정적인 비용과 빠른 처리량이 더 중요하다. 반대로 신규 아키텍처 설계, 복잡한 레거시 마이그레이션, 장기 에이전트 실행처럼 실패 비용이 높은 작업은 더 비싼 상위 모델이 정당화될 수 있다.
Sonnet 5가 줄인 격차: Opus 4.8에 가까워진 영역
Anthropic의 Sonnet 5 발표에서 가장 중요한 메시지는 Sonnet 계열이 Opus 계열과의 격차를 줄였다는 점이다. 공식 발표는 Sonnet 5가 코딩, 에이전트 작업, 전문 업무에서 개선되었고 Opus 4.8에 가까운 성능을 낮은 가격으로 제공한다고 설명한다. 특히 Sonnet 계열은 Claude 3.5 Sonnet 이후 개발자 작업, 도구 사용, 에이전트형 코딩에서 강한 인상을 남겼고, Sonnet 5는 그 흐름을 이어가는 모델로 제시된다. 출처: Introducing Claude Sonnet 5 – Anthropic, Claude Sonnet 5 System Card
공식 벤치마크에서 눈여겨볼 축은 SWE-bench Pro, Terminal-Bench, OSWorld, Humanity’s Last Exam, GDPval-AA 같은 평가다. 이들은 단순 지식 질의보다 실무와 가까운 능력을 본다. SWE-bench 계열은 실제 소프트웨어 수정 능력, Terminal-Bench는 터미널 환경에서의 작업 수행, OSWorld는 컴퓨터 사용 능력, Humanity’s Last Exam은 넓고 어려운 지식·추론 문제, GDPval-AA는 경제적으로 의미 있는 지식 노동 작업에 가깝다. Anthropic이 이런 평가를 전면에 둔 것은 모델 경쟁의 초점이 단순 챗봇 응답에서 실제 업무 수행 능력으로 옮겨가고 있음을 보여준다.
이 중 GDPval-AA는 Sonnet 5의 전략적 의미를 잘 드러낸다. Anthropic 공식 발표와 시스템 카드에 따르면 Knowledge Work 성격의 GDPval-AA에서 Sonnet 5는 Opus 4.8과 사실상 비슷하거나 일부 표기에서는 소폭 앞서는 결과로 소개된다. 이 지점은 중요하다. 일반 기업 업무의 상당 부분은 장기 자율 에이전트보다 문서 이해, 요약, 비교, 판단 보조, 보고서 초안, 시장 분석, 정책 검토, 요구사항 정리 같은 지식 노동이다. 이런 업무에서 Sonnet 5가 Opus 4.8과 유사한 효용을 낸다면, 기본 모델로 배포할 수 있는 설득력이 생긴다. (관련: Introducing Claude Sonnet 5 – Anthropic).
다만 여기서 결론을 과장하면 안 된다. Sonnet 5가 Opus 4.8을 완전히 대체했다는 뜻은 아니다. 공식 시스템 카드도 Sonnet 5를 가장 강한 Sonnet 계열 모델로 설명하면서, 더 능력이 높은 Opus 또는 Mythos 계열과 비교해 능력 경계를 더 밀어 올린 모델이라고 표현하지는 않는다. 즉 Sonnet 5는 “상위 모델에 근접한 기본 모델”이지 “상위 모델을 폐기하게 만드는 모델”이 아니다. 출처: Claude Sonnet 5 System Card, Model system cards – Anthropic
Opus 4.8이 여전히 필요한 영역
Opus 4.8의 존재 이유는 Sonnet 5가 약해서가 아니라, 업무 난도가 균일하지 않기 때문이다. 기업과 개발자가 모델을 쓰는 작업에는 간단한 업무와 고위험 업무가 섞여 있다. 간단한 업무에는 비용 효율이 우선이고, 고위험 업무에는 추론 깊이와 오류 회피 능력이 우선이다.
Opus 4.8은 공식 뉴스룸에서 코딩, 에이전트 작업, 전문 업무 전반의 강화를 강조한 Opus 계열 업그레이드로 소개된다. Opus 계열은 일반적으로 더 복잡한 추론, 장시간 문맥 유지, 다단계 문제 해결, 까다로운 코드베이스 분석에 적합한 상위 계층으로 이해하는 편이 실무적으로 안전하다. Sonnet 5가 대부분의 업무에서 충분한 효율을 제공하더라도, 여러 시스템의 상호작용을 분석하거나, 실패 시 비용이 큰 기술 결정을 보조하거나, 장시간에 걸친 에이전트 실행을 맡길 때는 Opus 4.8이 여전히 선택지로 남는다. 출처: Newsroom, Model system cards – Anthropic
예를 들어 Claude Code나 Cursor 같은 개발 환경에서 Sonnet 5는 대부분의 일상 코딩 작업에 적합할 수 있다. 함수 리팩터링, 테스트 작성, 간단한 버그 분석, API 사용 예시 생성, PR 설명 작성 같은 작업은 Sonnet 5의 비용 대비 효율이 좋다. 그러나 수십 개 모듈이 얽힌 장애 원인 분석, 데이터베이스 마이그레이션 전략, 보안 민감 코드의 설계 검토, 대규모 아키텍처 전환 계획처럼 한 번의 잘못된 판단이 큰 비용을 만드는 작업에서는 Opus 4.8 호출 비용이 보험료처럼 작동할 수 있다.
이 차이는 “일반 모델과 고급 모델”이라는 단순 구분보다 “실패 비용 기반 라우팅”으로 보는 편이 낫다. 실무 시스템에서는 모든 요청을 최고 모델로 보내는 대신, 기본 요청은 Sonnet 5로 처리하고 복잡도·불확실성·위험도가 일정 기준을 넘으면 Opus 4.8로 올리는 라우팅이 합리적이다.
Fable 5는 왜 일반 기본 모델이 아닌가
Fable 5를 이해할 때도 같은 원칙이 적용된다. Fable 5는 더 높은 능력 범주를 겨냥하는 모델로 소개되며, 장기 작업과 복잡한 에이전트 흐름에서 의미가 있는 상위 계층으로 볼 수 있다. Anthropic의 Fable 5·Mythos 5 발표는 Fable 5를 Mythos급 능력을 일반 사용에 맞게 안전장치를 적용한 모델로 설명하며, Mythos 5는 별도 프로그램과 협력 맥락에서 제한적으로 배포되는 성격을 갖는다고 설명한다. 출처: Claude Fable 5 and Claude Mythos 5 – Anthropic, Claude Fable – Anthropic
그렇다면 왜 Fable 5가 기본 모델이 되지 않는가. 답은 성능이 부족해서가 아니다. 오히려 반대다. 너무 높은 능력과 더 긴 작업 범위는 비용, 안전성, 접근성, 운영 통제의 문제를 함께 키운다. 장기 에이전트 작업은 단순 질의응답과 다르다. 모델이 여러 단계를 계획하고, 외부 도구를 호출하고, 파일을 읽고 쓰고, 웹이나 코드 실행 환경과 상호작용할수록 실패 양상도 복잡해진다. 비용도 한 번의 답변 단위가 아니라 작업 전체 단위로 커진다.
Fable 5가 기본 모델이 되기 어려운 첫 번째 이유는 비용 구조다. 고성능 장기 추론 모델은 일반적으로 더 많은 계산 자원을 요구한다. 모든 사용자의 기본 요청을 이런 모델로 처리하면 플랫폼 비용과 사용자 비용이 모두 커질 수 있다. 두 번째 이유는 안전성이다. 더 능력 있는 모델일수록 사이버, 생물학, 화학, 자율 에이전트 실행 같은 영역에서 더 정교한 통제가 필요할 수 있다. Sonnet 5 시스템 카드가 사이버 작업 능력과 안전장치 수준을 별도로 설명하는 것도, Anthropic이 모델 능력과 배포 범위를 함께 관리하고 있음을 보여준다. 출처: Claude Sonnet 5 System Card, Claude Fable 5 and Claude Mythos 5 – Anthropic
세 번째 이유는 접근성이다. 기본 모델은 많은 사용자가 예측 가능한 방식으로 접근할 수 있어야 한다. 반면 Fable 5처럼 더 높은 계층은 사용량, 정책, 지역, 플랜, 플랫폼 통합 방식에 따라 접근 조건이 달라질 수 있다. AWS의 Fable 5 발표처럼 특정 클라우드 플랫폼과 결합해 제공되는 사례도 있다. 이는 Fable 5가 “모두의 기본 모델”이라기보다 “특정 고난도 업무에 투입하는 상위 능력 자원”에 가깝다는 해석을 뒷받침한다. 출처: AWS, Anthropic Claude Fable 5 모델 공개
가격은 단순한 숫자가 아니라 제품 전략이다
Sonnet 5와 Opus 4.8의 차이를 볼 때 가격은 핵심 변수다. 공식 발표는 Sonnet 5가 Opus 4.8에 가까운 성능을 더 낮은 가격으로 제공한다고 설명한다. 사용자가 여기서 읽어야 할 메시지는 “Sonnet 5가 싸다”가 아니라 “Anthropic이 성능 대비 비용을 모델 계층 설계의 중심에 놓았다”는 점이다. 출처: Introducing Claude Sonnet 5 – Anthropic, Models overview – Claude Platform Docs
LLM 도입 비용은 모델 단가만으로 결정되지 않는다. 실제 총비용은 입력 토큰, 출력 토큰, 캐시 사용, 재시도율, 도구 호출 횟수, 실패 후 사람 검토 비용, 응답 지연으로 인한 생산성 손실, 품질 문제로 인한 재작업 비용을 모두 포함한다. 예를 들어 더 비싼 모델이 한 번에 정확한 답을 내면 오히려 총비용이 낮아질 수 있다. 반대로 대부분의 단순 요청에 비싼 모델을 쓰면 비용만 올라가고 품질 차이는 체감하기 어렵다.
따라서 실무적 비교는 다음과 같이 해야 한다. 같은 업무 묶음을 Sonnet 5와 Opus 4.8에 각각 보낸다. 성공률, 재시도 횟수, 평균 처리 시간, 사람 수정 시간, 토큰 비용을 함께 측정한다. 단순 벤치마크 점수보다 중요한 것은 “업무 완료 1건당 비용”이다. 내부 개발 도구라면 PR 하나를 완성하는 데 드는 모델 비용과 사람 수정 시간을 계산해야 한다. 고객지원이라면 티켓 하나를 해결하는 데 필요한 검토 시간과 오답 위험을 봐야 한다. 문서 업무라면 초안 품질보다 최종 승인까지 걸리는 시간을 봐야 한다.
이 관점에서 Sonnet 5의 강점은 분명하다. Opus 4.8에 가까운 실무 성능을 더 낮은 가격대로 제공한다면, 기본 요청의 대부분을 Sonnet 5로 처리하고 예외적 고난도 작업만 Opus 4.8이나 Fable 5로 보내는 구조가 가능해진다. 이는 Anthropic 입장에서도 중요하다. 더 많은 사용량을 안정적으로 처리하면서도 상위 모델의 프리미엄 가치를 유지할 수 있기 때문이다.
세 모델의 역할: 하나의 서열이 아니라 업무별 계층
아래 표는 Sonnet 5, Opus 4.8, Fable 5를 “어느 모델이 더 좋다”가 아니라 “어떤 업무에 맞는가”라는 기준으로 정리한 것이다.
Anthropic 공식 발표 기준 Sonnet 5는 출시 프로모션 기간 동안 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러이며, 이후 표준 가격은 입력 3달러, 출력 15달러다. Opus 4.8은 입력 5달러, 출력 25달러, Fable 5는 입력 10달러, 출력 50달러로 제시된다. 이 가격 차이는 Sonnet 5가 기본 모델로 배포될 수 있었던 배경을 설명하는 핵심 요소다.
| 모델 | 실무상 역할 | 적합한 작업 | 주의할 점 |
|---|---|---|---|
| Claude Sonnet 5 | 기본 업무와 대중적 개발 작업의 중심 모델 | 일반 문서 작성, 코드 보조, 검색 기반 분석, 내부 업무 자동화, 일상적 에이전트 작업 | 최고 난도 장기 추론에서는 상위 모델 검토 필요 |
| Claude Opus 4.8 | 복잡한 추론과 고난도 코딩을 위한 상위 모델 | 복잡한 시스템 설계, 대규모 코드베이스 분석, 장시간 추론, 실패 비용이 큰 의사결정 보조 | 모든 요청에 쓰면 비용 대비 효율 저하 가능 |
| Claude Fable 5 | 장기 에이전트 흐름과 고난도 작업을 위한 별도 상위 계층 | 연구 보조, 긴 시간축의 비동기 작업, 복잡한 에이전트 워크플로, 고난도 전문 업무 | 비용·접근성·안전장치·운영 통제 고려 필요 |
이 표의 핵심은 서열이 아니라 배치다. Sonnet 5는 넓은 면적을 담당한다. Opus 4.8은 깊은 문제를 담당한다. Fable 5는 긴 시간축과 복잡한 자율 작업을 담당한다. 이런 포트폴리오는 클라우드 인프라의 인스턴스 타입 선택과 비슷하다. 모든 워크로드를 가장 비싼 GPU 인스턴스에 올리지 않는 것처럼, 모든 언어 모델 요청을 가장 강한 모델로 보내는 것도 좋은 설계가 아니다.
Anthropic의 모델 포트폴리오 전략은 결국 모델 라우팅 전략과 연결된다. 제품을 만드는 팀은 사용자에게 모델 이름을 그대로 노출할 수도 있고, 내부적으로 요청을 분류해 적절한 모델을 고를 수도 있다. 예를 들어 일반 채팅과 초안 작성은 Sonnet 5, 복잡한 분석 버튼을 누르면 Opus 4.8, 장시간 비동기 에이전트 실행은 Fable 5로 라우팅하는 방식이다. 이런 구조가 자리 잡으면 사용자는 “모델을 고르는 부담”을 덜고, 조직은 비용과 품질을 동시에 관리할 수 있다.
안전성과 배포 범위: 성능 경쟁의 숨은 변수
Sonnet 5가 기본 모델이 될 수 있었던 배경에는 안전성과 배포 가능성도 있다. 이 글의 중심은 안전성 논란이 아니지만, 기본 모델 전략을 이해하려면 안전성을 빼놓을 수 없다. 대규모 기본 모델은 가장 많은 사용자의 가장 다양한 요청을 처리한다. 따라서 일부 고위험 영역에서의 거절, 정책 준수, 사이버 작업 통제, 도구 사용 제한, 출력 안정성이 제품 품질의 일부가 된다.
Sonnet 5 시스템 카드는 Sonnet 5가 Sonnet 4.6 대비 여러 업무에서 개선되었지만, 더 높은 능력 범주의 모델과 비교해 모든 능력 경계를 새로 밀어 올리는 모델은 아니라는 취지로 설명한다. 또한 사이버 작업 능력과 관련한 안전장치 수준을 별도로 다룬다. 이 표현은 Anthropic이 모델을 “성능 점수”만으로 보지 않고, 능력 수준과 위험 수준, 배포 범위를 함께 관리한다는 점을 보여준다. 출처: Claude Sonnet 5 System Card, Model system cards – Anthropic
기업 입장에서도 이 점은 현실적이다. 사내에 LLM을 도입할 때 보안팀은 “가장 똑똑한가”보다 “어떤 데이터를 넣어도 되는가”, “위험한 지시를 어떻게 거절하는가”, “외부 도구 호출이 어디까지 허용되는가”, “감사 로그를 남길 수 있는가”를 본다. 기본 모델은 이런 검토를 통과해야 한다. Fable 5처럼 더 강한 능력 계층은 더 정교한 통제와 제한이 필요할 수 있고, 그래서 기본값이 아니라 특정 목적의 상위 선택지로 남는 편이 자연스럽다.
이는 OpenAI와 Google의 최근 모델 운영 방식과도 맞물린다. 두 회사 모두 하나의 단일 모델만 전면에 내세우기보다, 빠르고 저렴한 모델, 고성능 추론 모델, 멀티모달 모델, 에이전트용 모델을 역할별로 나누는 방향으로 움직이고 있다. 시장의 경쟁축은 점점 “가장 높은 점수의 모델 하나”에서 “여러 비용·성능 계층을 어떻게 제품 안에 배치하는가”로 이동하고 있다. Anthropic의 Sonnet 5 전략도 이 흐름 속에서 봐야 한다.
실무자가 봐야 할 기준: 벤치마크보다 업무 실패 비용
모델 선택에서 가장 흔한 실수는 벤치마크 상위 모델을 무조건 표준으로 삼는 것이다. 실무에서는 세 가지 질문이 먼저다.
첫째, 이 작업의 실패 비용은 얼마인가. 틀린 요약을 사람이 쉽게 고칠 수 있는가, 아니면 잘못된 아키텍처 판단이 몇 주의 재작업을 만들 수 있는가. 실패 비용이 낮으면 Sonnet 5가 적합할 가능성이 높다. 실패 비용이 높으면 Opus 4.8 또는 Fable 5를 고려해야 한다.
둘째, 이 작업은 짧은 응답인가, 긴 실행인가. 한 번의 답변으로 끝나는 문서 작성과 수 시간 또는 수일 동안 이어지는 에이전트 작업은 모델 요구사항이 다르다. 전자는 Sonnet 5 중심으로 충분할 수 있다. 후자는 Fable 5 같은 상위 계층이 의미를 가질 수 있다.
셋째, 비용이 사용자 경험에 어떤 영향을 주는가. 고객에게 실시간 기능을 제공하는 제품이라면 비용이 높아질수록 호출 횟수를 제한하게 되고, 결국 사용자 경험이 나빠진다. 내부 도구라도 모든 요청을 Opus급으로 보내면 월말 비용이 도입 확산을 막을 수 있다. 반대로 너무 낮은 모델을 써서 재시도가 늘어나면 총비용은 다시 올라간다.
이 기준을 실제 운영에 적용하려면 모델 선택을 정책으로 만들어야 한다. 예를 들어 “초안 생성과 요약은 Sonnet 5”, “대규모 코드 수정 전 설계 검토는 Opus 4.8”, “8단계 이상 도구 호출이 예상되는 장기 에이전트 작업은 Fable 5 후보”, “보안 민감 파일을 다룰 때는 사람 승인 후 상위 모델 사용” 같은 식이다. 모델 선택을 개인 취향에 맡기면 비용과 품질이 흔들린다. 조직은 업무 유형별 기본값과 예외 규칙을 문서화해야 한다.
사용 목적별 모델 선택 가이드
| 사용 목적 | 추천 모델 | 이유 |
|---|---|---|
| 일반적인 Claude 사용 | Sonnet 5 | 대부분의 문서·요약·분석 업무에 충분한 성능과 높은 비용 대비 효율 |
| Claude Code를 활용한 일상 개발 | Sonnet 5 | 코드 보조, 테스트 작성, 리팩터링, PR 초안에 적합한 기본 성능과 응답 속도 |
| 복잡한 시스템 설계 및 장시간 추론 | Opus 4.8 | 더 정교한 분석과 복잡한 추론이 필요한 작업에서 상위 모델의 가치가 남음 |
| 대규모 코드베이스 분석과 고위험 변경 | Opus 4.8 | 실패 비용이 큰 의사결정에서 더 깊은 추론을 활용할 수 있음 |
| 연구·장기 에이전트 워크플로 | Fable 5 | 긴 시간축의 작업, 복잡한 도구 사용, 고난도 에이전트 흐름에 적합한 상위 계층 |
| 대량 자동화·반복 업무 | Sonnet 5 우선, 예외만 Opus 4.8 | 비용 예측성과 처리량이 중요하므로 기본은 Sonnet 5, 실패·불확실성 높은 건만 승격 |
이 표에서 중요한 것은 “가장 좋은 모델”이 없다는 점이다. Sonnet 5는 많은 업무에서 기본값으로 적합하지만, 모든 작업의 정답은 아니다. Opus 4.8은 여전히 복잡한 추론과 고난도 코딩에서 의미가 있다. Fable 5는 일반 사용자의 일상 업무보다 장기적이고 복잡한 에이전트 작업에 더 어울린다. 모델 선택은 성능 순위가 아니라 업무 목적, 실패 비용, 예산, 응답 시간, 안전 요구사항의 함수다.
개발 조직이라면 다음과 같은 운영 방식을 권한다. 먼저 전체 LLM 요청의 70~90%를 Sonnet 5로 처리하는 기본 정책을 둔다. 그다음 특정 조건에서 Opus 4.8로 승격한다. 예를 들어 변경 파일 수가 많거나, 테스트 실패 원인이 여러 모듈에 걸쳐 있거나, 모델이 자기 답변에 낮은 확신을 보이거나, 사용자가 “설계 검토” 또는 “배포 전 위험 분석”을 요청하는 경우다. Fable 5는 더 엄격하게 제한한다. 장기 실행, 연구형 작업, 다단계 에이전트 플랜, 복잡한 도구 사용처럼 명확한 필요가 있을 때만 쓰는 편이 낫다.
시장 경쟁의 변화: 벤치마크 경쟁에서 포트폴리오 경쟁으로
Sonnet 5의 등장은 Anthropic만의 제품 업데이트가 아니다. AI 시장 전체의 경쟁 방식이 바뀌고 있음을 보여준다. 2023~2024년의 경쟁은 “누가 더 강한 단일 모델을 만들었는가”에 가까웠다. 2025년 이후의 경쟁은 “강한 모델을 어떤 가격과 안전장치, 어떤 제품 경험으로 배포하는가”에 가까워지고 있다.
이 변화는 클라우드 시장의 역사와 닮았다. 초기에는 더 빠른 서버가 주목받았다. 그러나 시장이 성숙하면서 범용 인스턴스, 메모리 최적화, 컴퓨팅 최적화, GPU 인스턴스, 서버리스, 예약 인스턴스처럼 워크로드별 선택지가 중요해졌다. LLM도 같은 길을 가고 있다. 빠른 모델, 저렴한 모델, 추론 특화 모델, 코딩 특화 모델, 장기 에이전트 모델, 멀티모달 모델이 서로 다른 자리를 차지한다.
Anthropic의 모델 포트폴리오 전략은 이 성숙 단계의 신호다. Sonnet 5는 대규모 실사용의 중심에 놓인다. Opus 4.8은 더 높은 신뢰와 추론이 필요한 곳에 놓인다. Fable 5는 더 긴 작업과 더 어려운 에이전트 흐름에 놓인다. 이 구조가 잘 작동하면 Anthropic은 사용자층을 넓히면서도 상위 모델의 차별성을 유지할 수 있다. 반대로 사용자는 비용을 통제하면서도 필요한 순간에 더 강한 모델을 호출할 수 있다.
OpenAI와 Google 역시 비슷한 방향을 보인다. 빠른 응답과 낮은 비용을 위한 모델, 깊은 추론을 위한 모델, 멀티모달 또는 에이전트 중심 모델을 나누고, 제품 안에서 자동 라우팅이나 모델 선택을 제공하는 흐름이 강해지고 있다. 이는 모델 개발의 승부가 연구 성능만이 아니라 제품 설계, 가격표, 안전 정책, 개발자 도구, 클라우드 배포, 기업 계약까지 포함하는 총체적 경쟁으로 이동했음을 뜻한다.
기업 도입 관점: Sonnet 5를 기본으로 두되 예외를 설계하라
기업과 플랫폼 팀에 가장 현실적인 권고는 명확하다. Sonnet 5를 기본 모델 후보로 두고, Opus 4.8과 Fable 5는 예외 조건을 정의해 운영하라. 이 방식은 비용을 통제하면서도 고난도 업무에서 성능을 포기하지 않는 균형점이다.
첫 번째 단계는 업무 분류다. 사내 LLM 사용을 문서 생성, 지식 검색, 개발 보조, 고객 응대, 데이터 분석, 에이전트 자동화로 나눈다. 각 범주에서 실패 비용과 사용량을 추정한다. 사용량이 많고 실패 비용이 낮거나 중간인 업무는 Sonnet 5가 기본이다. 사용량은 적지만 실패 비용이 큰 업무는 Opus 4.8을 고려한다. 작업 시간이 길고 도구 호출이 많으며 중간 상태 관리가 필요한 업무는 Fable 5 후보로 둔다.
두 번째 단계는 측정이다. 모델 선택은 감으로 하면 안 된다. 같은 업무 샘플을 여러 모델에 보내고, 최종 산출물 승인률, 사람 수정 시간, 평균 비용, 재시도 횟수, 응답 지연, 정책 위반 또는 위험 출력 발생률을 기록해야 한다. 벤치마크는 출발점일 뿐이다. 실제 조직의 문서 양식, 코드베이스, 업무 언어, 보안 정책에 들어오면 결과가 달라질 수 있다.
세 번째 단계는 라우팅이다. 초기에는 사용자가 직접 모델을 고르게 할 수 있지만, 장기적으로는 제품이 자동 선택해야 한다. “빠른 초안”은 Sonnet 5, “깊은 검토”는 Opus 4.8, “장기 실행”은 Fable 5처럼 기능 단위로 감추는 방식이 더 낫다. 사용자는 모델명이 아니라 업무 결과를 원한다. 조직은 모델명보다 비용·품질 정책을 관리해야 한다.
네 번째 단계는 거버넌스다. 상위 모델 호출에는 승인, 로그, 예산 한도, 민감 데이터 정책이 필요할 수 있다. 특히 에이전트형 작업은 파일 쓰기, 코드 실행, 외부 API 호출과 결합될 때 위험이 커진다. 모델 능력이 높아질수록 권한 관리는 더 중요해진다. Fable 5 같은 상위 계층을 도입할 때는 모델 선택보다 권한 설계가 먼저다.
결론: Sonnet 5의 의미는 성능보다 배치에 있다
Claude Sonnet 5를 단순히 “좋아진 Sonnet”으로만 보면 중요한 신호를 놓친다. Sonnet 5의 의미는 더 강력한 모델이 하나 더 나왔다는 데 있지 않다. Anthropic이 성능·비용·안전성·접근성을 함께 고려해 모델 포트폴리오를 재편하고 있다는 데 있다.
Sonnet 5는 대부분의 사용자가 매일 쓰는 기본 업무에 충분한 성능과 비용 효율을 제공하는 중심 모델이다. Opus 4.8은 복잡한 추론과 고난도 코딩, 실패 비용이 큰 분석에서 여전히 의미가 있다. Fable 5는 장기 에이전트 작업과 더 어려운 전문 업무를 위한 상위 계층으로 남는다. 이 세 모델은 하나의 직선 서열이 아니라 서로 다른 업무 범위를 담당하는 포트폴리오다.
앞으로 중요한 것은 가장 비싼 모델을 고르는 능력이 아니다. 자신의 업무가 어떤 수준의 추론을 요구하는지, 실패 비용이 얼마인지, 비용과 지연 시간을 어디까지 감당할 수 있는지, 안전성과 권한 통제가 얼마나 중요한지를 판단하는 능력이다. AI 모델 경쟁은 최고 성능 경쟁에서 포트폴리오 경쟁으로 이동하고 있다. 실무자와 조직 리더에게 필요한 역량도 바뀐다. 이제는 “가장 강한 모델은 무엇인가”보다 “이 업무에 맞는 모델은 무엇인가”를 묻는 쪽이 더 중요하다.
참고 출처
- What’s new in Claude Sonnet 5
- Introducing Claude Sonnet 5 – Anthropic
- Claude Sonnet 5 System Card – Anthropic
- Claude Sonnet 5 System Card PDF
- Newsroom – Anthropic
- Claude Sonnet – Anthropic
- Model system cards – Anthropic
- Models overview – Claude Platform Docs
- Model deprecations – Claude Platform Docs
- Claude Fable – Anthropic
- Claude Mythos – Anthropic
- Claude Fable 5 and Claude Mythos 5 – Anthropic
- AWS, Anthropic Claude Fable 5 모델 공개
함께 읽기: 모델 전략·소버린 AI
