GPT-6 Astra·Claude Fable 5.1·Gemini 3.8 Flash 비교: 어떤 AI 모델을 써야 할까
핵심 요약
- 2026년 9월 첫째 주에 Claude Fable 5.1(1일), Gemini 3.8 Flash(2일), GPT-6 Astra(3일)가 연달아 나왔다. 세 모델은 같은 자리를 놓고 겨루기보다 서로 다른 업무를 겨냥한다.
- GPT-6 Astra는 컴퓨터 사용과 브라우징, 코딩을 하나로 잇는 고난도 작업에 초점을 맞췄다. 입력 100만 토큰당 10달러, 출력 50달러이고 추론 강도를
low부터max까지 다섯 단계로 조절한다. - Claude Fable 5.1은 기본 단가가 Astra와 같지만 캐시 읽기가 0.25달러로, 입력 단가의 2.5%다. 같은 컨텍스트를 반복해서 사용하는 에이전트에서는 캐시 가격 인하가 실제 비용 절감으로 이어질 수 있다.
- Gemini 3.8 Flash는 2026년 말까지 입력 0.75달러, 출력 3.75달러다. 다만 2027년 1월 1일부터 입력·출력·캐시 가격이 모두 두 배로 오른다고 공지돼 있다.
- 세 모델 모두 100만 토큰 안팎의 컨텍스트를 제공하지만, 이는 자료를 담을 수 있다는 용량이지 수십 번의 도구 호출 동안 목표를 유지한다는 보증이 아니다.
Claude·Gemini·GPT 새 모델이 사흘 연속 공개됐다
2026년 9월 첫째 주에는 주요 AI 모델이 잇따라 공개됐다. Anthropic이 1일 Claude Fable 5.1을, Google이 2일 Gemini 3.8 Flash를, OpenAI가 3일 GPT-6 Astra를 내놨다.
이름만 보면 같은 세대의 정면 승부처럼 보이지만 맡기려는 일이 다르다. Astra는 브라우저와 전문 소프트웨어를 직접 조작하는 작업까지 겨냥한 OpenAI의 최상위 모델이다. Fable 5.1은 Anthropic 라인업에서 일반 업무의 기본값이 아니라, 계산 비용을 더 치르더라도 긴 에이전트 작업을 끝까지 수행하는 쪽에 맞춰져 있다. 3.8 Flash는 이름에 ‘Flash’가 붙었지만 단순 응답용 소형 모델이 아니다. Google은 저가·고속 모델의 가격을 유지하면서 소프트웨어 엔지니어링과 자율 에이전트를 겨냥한다고 설명한다.
그래서 이 글의 질문은 “누가 1등인가”가 아니다. 어떤 업무에 어떤 모델을 먼저 적용해볼 것인가다.
세 모델의 가격과 사양은 어떻게 다른가
아래는 각 사 공식 문서 기준이다. 가격은 미국 달러, 100만 토큰 기준이며 앱 구독료와 검색·컴퓨터 사용 같은 도구 요금은 빠져 있다.
| 항목 | GPT-6 Astra | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|
| 겨냥하는 일 | 컴퓨터 사용·브라우징까지 포함한 고난도 작업 | 까다로운 추론과 장시간 에이전트 작업 | 저가·고속 모델에서의 코딩·자율 에이전트 |
| 입력 / 출력 | $10 / $50 | $10 / $50 | $0.75 / $3.75 2027년 1월부터 $1.50 / $7.50 |
| 캐시 읽기 | $1 | $0.25 | $0.075 2027년 1월부터 $0.15 |
| 캐시 저장·쓰기 | 쓰기 $12.50 | 쓰기 5분 $12.50 / 1시간 $20 | 저장 시간당 $0.50 2027년 1월부터 $1.00 |
| 컨텍스트 / 최대 출력 | 1,050K / 128K | 1,000K / 128K | 1,000K / 64K |
| 추론 강도 조절 | low·medium·high·xhigh·max |
Adaptive Thinking 상시 작동, 기본 effort high |
Thinking Level low·medium·high, 기본 medium |
출처: GPT-6 Astra 모델 문서, Claude 가격 문서, Gemini API 가격
표에서 가장 크게 갈리는 항목은 컨텍스트가 아니라 캐시 읽기 가격이다. Astra와 Fable 5.1은 기본 단가가 같지만 캐시 읽기가 네 배 차이 난다. 매 호출마다 새로운 자료를 넣는 작업이라면 이 차이는 의미가 없고, 같은 저장소와 규정집을 계속 다시 읽는 작업이라면 총액을 좌우한다.
다만 세 회사의 캐시 구조가 같지는 않다. Anthropic은 캐시를 쓸 때 쓰기 요금을 받고 유지 시간(5분·1시간)에 따라 가격이 다르다. Google은 읽기 단가와 별도로 캐시를 보관하는 시간당 저장료를 받는다. 그래서 “Gemini 캐시가 Claude보다 몇 배 싸다”처럼 읽기 단가만 비교하는 것은 정확하지 않다. 캐시를 얼마나 오래 유지하고 그동안 몇 번 읽는지에 따라 유리한 쪽이 바뀐다.
토큰 개수 자체도 회사마다 다르게 센다. Anthropic은 Claude 4.7 이후 모델이 같은 글에서 이전 토크나이저보다 약 30% 더 많은 토큰을 만든다고 문서에 명시해 두었다. 100만 토큰당 가격을 그대로 곱해 비교하기 전에, 자사 자료를 각 API의 토큰 계산기에 한 번씩 넣어보는 편이 정확하다.
GPT-6 Astra는 무엇이 달라졌나
Astra가 달라진 지점은 한 번의 답변 품질보다 여러 작업 환경을 이어서 처리하는 능력이다. 요구사항을 해석해 코드를 고치고, 브라우저에서 자료를 확인하고, 전문 소프트웨어 화면을 조작하고, 결과 문서를 만드는 흐름이다. OpenAI는 온라인 양식 작성, CRM 고객 기록 갱신, 웹사이트 제작과 프런트엔드 점검 같은 사례를 들었다.
추론 강도는 low부터 max까지 다섯 단계다. 모든 요청을 최고 강도로 돌릴 필요는 없다. 분류나 형식 변환은 낮게, 여러 시스템이 얽힌 장애 분석은 높게 보내는 라우팅이 현실적이다.
장기 작업에서 눈여겨볼 기능은 두 가지다. 비동기 도구 호출은 외부 빌드나 데이터 조회가 끝나기를 기다리는 동안 다른 하위 작업을 진행하게 한다. 중간 지시 변경은 응답이 진행되는 중에 WebSocket으로 추가 지시를 보내 방향을 트는 기능이다. 둘 다 “더 똑똑해졌다”는 말보다 실무에 가깝다. 대기 시간을 줄이고, 요구사항이 바뀔 때마다 처음부터 다시 돌리는 비용을 낮춘다.
주의할 점은 비용이다. 표준 가격은 입력 10달러, 출력 50달러이고 컴퓨터 사용이나 검색 같은 도구에는 별도 요금이 붙는다. 긴 문서 하나를 읽는 것과 40분 동안 브라우저를 조작하는 것은 같은 ‘100만 토큰 모델 사용’이 아니다. 실행 시간 제한, 최대 도구 호출 수, 사람 승인 지점을 애플리케이션 쪽에서 설계해 두어야 한다.
Claude Fable 5.1은 반복해서 읽는 컨텍스트의 비용을 낮췄다
Fable 5.1은 100만 토큰 컨텍스트에 최대 128K 출력, 항상 켜져 있는 Adaptive Thinking을 제공한다. 기본 effort는 high다. 짧은 응답 하나보다 장시간 이어지는 코딩·리서치 작업의 안정성이 중요한 경우에 적합하다.
가장 큰 변화는 캐시 읽기 가격이다. Fable 5에서 1달러였던 것이 0.25달러로 내려갔다. Anthropic 문서는 이를 입력 단가의 2.5%라고 설명한다. 다른 Claude 모델의 캐시 적중이 입력 단가의 10%인 것과 비교하면 이례적으로 낮다.
이 숫자가 왜 중요한지는 코딩 에이전트의 동작을 보면 안다. 에이전트는 매 턴마다 시스템 지침, 저장소 구조, 핵심 파일, 앞선 도구 결과를 다시 문맥에 넣는다. 20만 토큰짜리 공통 앞부분을 스무 턴 동안 재사용한다면, 그 반복 읽기가 전체 비용의 큰 부분을 차지한다. 쓰기 요금은 5분 유지에 12.50달러, 1시간 유지에 20달러로 적지 않지만, 적중한 읽기가 워낙 싸서 반복이 많을수록 유리해진다.
반대로 캐시가 깨지면 이 구조는 살아나지 않는다. 프롬프트 앞부분에 시간값이나 요청 ID, 사용자별 문구가 매번 들어가면 적중률이 무너진다. 변하지 않는 자료를 앞에, 매번 바뀌는 대화와 도구 결과를 뒤에 두는 배치가 전제다.
Gemini 3.8 Flash는 왜 ‘Flash’인데 에이전트를 강조하나
Google의 설명은 명확하다. 3.7 Flash의 속도와 낮은 가격을 유지하면서 소프트웨어 엔지니어링과 에이전트 작업, 다단계 추론을 강화했다는 것이다. 컨텍스트는 100만 토큰, 최대 출력은 64K다.
가격은 유리하지만 기한이 붙어 있다. 입력 0.75달러, 출력 3.75달러는 2026년 12월 31일까지다. 2027년 1월 1일부터 입력 1.50달러, 출력 7.50달러, 캐시 읽기 0.15달러, 캐시 저장 시간당 1달러로 모두 두 배가 된다. 올해의 비용 우위를 영구 가격으로 놓고 사업계획을 세우면 안 된다.
Thinking Level은 low·medium·high 세 단계이고 기본값은 medium이다. minimal은 지원하지 않아 지정하면 오류가 난다. 이 기능은 “생각을 많이 하면 똑똑해진다”는 이야기가 아니다. 작업 난도에 따라 추론 강도와 응답 속도·비용을 조절하는 설정이다. 낮은 단계는 초안 작성이나 실시간 대화처럼 속도가 중요한 흐름에, 높은 단계는 복잡한 디버깅이나 여러 번의 도구 검증이 필요한 작업에 맞는다.
비슷한 조절 장치는 세 모델에 모두 있다. Astra의 reasoning.effort, Fable 5.1의 effort 설정이 같은 역할을 한다. Gemini만 가진 기능은 아니고, 단계 이름과 기본값이 다를 뿐이다.
‘바이브 코딩’은 이 모델의 성능 지표가 아니라 자연어로 앱을 만들고 바로 고치는 사용 방식을 부르는 말이다. 짧은 시연에서의 완성도와 실제 저장소를 수정해 테스트까지 통과하는 능력은 다른 문제다.
100만 토큰 컨텍스트가 곧 장기 작업 능력은 아니다
세 모델 모두 100만 토큰 안팎을 담는다. 큰 저장소의 핵심 파일이나 계약서 묶음을 한 요청에 넣을 수 있다는 뜻이다. 하지만 업무 품질은 그 안에서 필요한 근거를 정확히 찾는지, 오래된 요구사항과 최근 지시가 충돌할 때 어느 쪽을 따르는지, 도구가 실패한 뒤 상태를 복구하는지에 달려 있다.
컨텍스트를 무작정 채우면 오히려 손해다. 관련 없는 자료가 정답률을 떨어뜨리고, 매 턴 읽는 입력이 늘어 비용과 첫 응답 지연이 커지며, 잘못된 도구 결과까지 계속 남아 오류가 쌓인다. 필요한 조각만 검색으로 골라 넣고, 변하지 않는 자료는 캐시하고, 현재 계획과 완료 항목은 따로 정리해 두는 편이 낫다.
벤치마크 점수는 같은 조건에서만 비교해야 한다
OpenAI가 공개한 자체 평가에서 Astra는 Terminal-Bench 4.0 57.9%, OSWorld 2.0 72.6%, GPQA Diamond 96.0%를 기록했다. Google 자체 평가에서 3.8 Flash는 장기 소프트웨어 엔지니어링 평가 DeepSWE v1.1에서 73.7%, HLE-Verified에서 54.9%를 냈다.
이 숫자들을 한 줄에 세워 순위를 매기면 안 된다. 같은 이름의 벤치마크라도 추론 강도, 도구 접근 범위, 시간 제한, 시도 횟수, 에이전트 실행 환경, 문제 집합 버전이 다르면 결과가 달라진다. 출시사가 자기 모델에 맞춰 구성한 환경에서 낸 결과와 제3자의 기본 설정 결과도 성격이 다르다.
평가 항목이 재는 능력도 제각각이다. 수학·논리 평가는 정답이 분명한 문제의 추론력을, SWE 계열은 저장소를 읽고 패치를 만들어 테스트를 통과시키는 능력을, OSWorld는 화면 기반 컴퓨터 사용을 본다. 이들을 평균 내 ‘종합 지능’을 만들면 정작 맡기려던 업무가 사라진다.
자사 평가를 무시할 필요는 없다. 그 회사가 어디에 투자했는지 읽는 자료로는 유용하다. Astra의 컴퓨터 사용·터미널 결과는 작업을 끝까지 수행하는 데 초점을 맞춘 방향과 맞고, Fable 5.1이 장기 코딩을 내세운 것은 캐시 정책과 이어지며, 3.8 Flash의 DeepSWE 개선은 저가 모델이 에이전트 영역으로 넘어오고 있다는 신호다. 다만 최종 판단은 자사 업무 데이터로 내려야 한다.
실제로 사용할 수 있는 모델인지도 확인해야 한다
좋은 모델이라도 지금 쓸 수 없으면 후보가 아니다. OpenAI는 Astra를 출시 당일 제한된 조직에 먼저 열고, 이후 며칠에 걸쳐 ChatGPT Plus·Pro·Business·Enterprise와 OpenAI API, AWS로 확대한다고 밝혔다. 조직 관리자가 모델을 켜야 하거나 계정에 아직 보이지 않을 수 있다.
Fable 5.1은 Claude API와 Amazon Bedrock, Google Cloud, Microsoft Foundry에서 쓸 수 있다. 다만 지역 엔드포인트나 데이터 거주 조건을 지정하면 가격에 할증이 붙는다. 이미 특정 클라우드의 조달·보안 체계를 쓰는 기업이라면 토큰 단가보다 계약과 네트워크 경로가 더 큰 변수일 수 있다.
Gemini 3.8 Flash는 Gemini API와 Google AI Studio, Antigravity, Android Studio 등으로 들어가고, 일반 사용자는 유료 Gemini 앱에서 접한다. 앱에서 체감한 품질과 API 결과는 시스템 프롬프트와 도구, 사용량 제한이 달라 그대로 옮겨 쓸 수 없다.
어떤 일에 어떤 모델을 먼저 검토할까
| 업무 | 우선 검토할 모델 | 이유 |
|---|---|---|
| 여러 시스템을 오가는 고난도 자동화 | GPT-6 Astra | 컴퓨터 사용·브라우징·코딩을 한 흐름으로 연결 |
| 대규모 코드베이스의 장시간 수정 | Claude Fable 5.1 또는 GPT-6 Astra | Fable은 반복 문맥의 캐시 비용, Astra는 터미널 작업이 강점 |
| 규정집·문서를 반복 참조하는 리서치 | Claude Fable 5.1 | 같은 자료를 여러 번 읽을수록 0.25달러 캐시 읽기가 유리 |
| 분류·추출·초안 등 대량 처리 | Gemini 3.8 Flash low |
단가가 낮고 응답이 빠름. 2027년 인상은 감안 |
| 비용에 민감한 코딩·에이전트 | Gemini 3.8 Flash medium |
저가 모델로 장기 코딩과 도구 사용을 지향 |
| 일반 업무와 일상적인 질의 | Gemini 3.8 Flash 또는 각 사 중급 모델 | 최상위 모델의 비용을 치를 이유가 크지 않음 |
| API 기반 서비스 개발 | 세 모델 모두 내부 평가 후 결정 | 단가보다 성공률·지연·캐시 적중률이 총비용을 좌우 |
표의 ‘우선 검토’는 정답이 아니라 시험을 시작할 지점이다. 실제 도입 전에는 자사 업무에서 자주 나오는 30~100개 작업을 골라 성공률, 소요시간, 재시도 횟수, 실제 API 비용을 비교해 보는 것이 좋다. 공개 벤치마크는 후보를 좁히는 데 쓰고, 최종 선택은 내부 업무 데이터로 하는 편이 안전하다.
결국 어떤 모델을 선택해야 할까
세 모델 가운데 하나를 모든 업무의 기본값으로 정할 필요는 없다. 복잡한 장기 작업, 반복 컨텍스트가 많은 코딩, 비용이 중요한 대량 처리는 각각 먼저 살펴볼 모델이 다르다.
선택할 때 볼 항목도 벤치마크 점수 하나가 아니다. 작업의 난도, 실제 성공률, 응답 속도, 긴 작업에서의 안정성, 컨텍스트를 얼마나 잘 쓰는지, 캐시로 비용을 얼마나 줄일 수 있는지, 그리고 지금 자신이 쓸 수 있는 제품과 API 환경인지를 함께 봐야 한다.
결국 골라야 할 것은 가장 높은 점수를 받은 모델이 아니라, 내 업무를 가장 합리적인 비용으로 끝내는 모델이다.
참고 출처
- GPT-6 Astra: A new generation of intelligence | OpenAI
- GPT-6 Astra Model | OpenAI API
- Async tool calling | OpenAI API
- Mid-turn steering | OpenAI API
- Models overview | Claude Docs
- Pricing | Claude Docs
- Introducing Gemini 3.8 Flash and 3.8 Flash Cyber | Google DeepMind
- Gemini API pricing | Google AI for Developers
- Gemini 3.8 Flash | Gemini API
TechBrief Index 성능·비용 비교 (업데이트: 2026-09-29)
| 모델·조건 | AA Index | Task Cost | API $/M (입력/출력) | Context | Max output | 추천 용도 |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 Anthropic · max |
53.4 | $7.63 | $10/$50 | 1,000K | 128K | 복합 추론·지식 작업 |
| Gemini 3.8 Flash Google · high |
40.9 | $1.24 | $0.75/$3.75 | 1,000K | 64K | 복합 추론·지식 작업 |
| GPT-6 Astra OpenAI · max |
52.7 | $3.26 | $10/$50 | 1,050K | 128K | 복합 추론·에이전트 작업 |
AA Index·Task Cost는 Artificial Analysis 공개 데이터, 가격·컨텍스트는 각 사 공식 문서 기준입니다. 전체 비교는 AI Model Index에서 확인할 수 있습니다.
