Gemini 3.7 Flash는 얼마나 좋아졌나: Sonnet 5·GPT-5.6 Terra와 성능·가격 비교
핵심 요약
- Gemini 3.7 Flash는 3.6 Flash 출시 3주 만에 나온 후속 모델이다. Google이 공개한 수치에서 가장 크게 움직인 항목은 범용 지식이 아니라 장기 소프트웨어 엔지니어링과 업무 자동화다. DeepSWE v1.1은 49.0%에서 65.3%, FrontierCode 1.1 Main은 34.4%에서 43.6%, AutomationBench는 17.0%에서 30.4%로 올랐다. 다만 Google이 제시한 평가 조건의 수치이므로 타사 점수와 한 줄 순위로 바꿔 읽으면 안 된다. 출처: Gemini 3.7 Flash 공개
- 가격은 오해하기 쉽다. Google은 3.7 Flash의 도입 가격을 3.6 Flash 가격의 절반이라고 설명했는데, 비교 기준은 3.6 Flash의 최초 가격이다. 2026년 8월 14일 현재 Google은 3.6 Flash에도 같은 프로모션 가격을 적용하고 있어 두 모델의 실제 API 단가는 입력 100만 토큰당 0.75달러, 출력 3.75달러로 동일하다. 두 가격 모두 2026년 12월 31일까지이며 2027년 1월 1일부터 입력 1.50달러·출력 7.50달러가 된다. 출처: Gemini API 가격
- Claude Sonnet 5는 입력 2달러·출력 10달러, GPT-5.6 Terra는 입력 2달러·출력 12달러다. 토큰 단가만 보면 3.7 Flash가 낮지만, 두 모델은 노력 수준·도구·상태 관리에서 별도 강점을 갖고 토크나이저와 장문 문맥 과금 규칙도 달라 단가 비교만으로 실제 비용을 정할 수 없다. 출처: Anthropic 가격, GPT-5.6 Terra 모델 문서
- 결론은 단일 승자가 아니다. 3.6 Flash를 쓰는 조직이라면 같은 가격에 성능이 오른 3.7 Flash를 먼저 검증할 이유가 분명하다. 신규 도입이라면 대량 처리와 비용 제한이 강한 워크로드는 3.7 Flash를, 긴 실행을 끝까지 완수해야 하는 에이전트 작업은 Sonnet 5·Terra를 같은 과제·같은 하네스로 비교해야 한다.
Flash가 겨냥한 자리가 달라졌다
Gemini 3.7 Flash를 이해하는 출발점은 “빠른 모델이 조금 더 똑똑해졌다”가 아니다. Google은 이 모델을 코딩과 에이전트 작업에 최적화한 워크호스 모델로 설명한다. 워크호스는 가장 어려운 한 건만 처리하는 최고급 모델이 아니라, 제품 안에서 반복 호출되며 코드 읽기·수정, 문서 추출, 검색, 도구 호출을 꾸준히 처리해야 하는 모델이다. 그래서 이번 비교의 질문도 절대 지능이 아니라, 저가형 Flash가 실무형 고성능 모델의 후보군 안으로 들어왔는가다. 출처: Gemini 3.7 Flash 공개
이 포지션이 중요한 이유는 에이전트의 비용 구조 때문이다. 챗봇 한 번의 답변은 입력과 출력 토큰으로 거의 설명된다. 그러나 코딩 에이전트는 저장소를 읽고 계획을 세우고 파일을 바꾸고 테스트를 돌린 뒤 오류를 보고 다시 수정한다. 한 단계의 정답률이 조금만 올라도 재시도, 불필요한 도구 호출, 사람이 되돌려야 할 변경이 줄어든다. 반대로 단가가 싼 모델도 첫 시도 실패가 잦으면 도구 사용료와 누적 문맥 때문에 과업당 비용이 더 커진다. 모델 선택자가 봐야 할 값은 “답변 품질”이 아니라 “내 하네스에서 이슈 하나를 테스트 통과 상태로 끝내는 확률과 총비용”이다. 여기서 하네스(harness)는 프롬프트·도구 목록·권한·반복 횟수·테스트 명령·중단 규칙을 묶어 에이전트를 실행하는 장치를 말한다. 같은 모델도 하네스가 다르면 결과가 크게 달라진다.
3.6에서 3.7로: 숫자가 말하는 것과 말하지 않는 것
공개 비교에서 눈에 띄는 항목은 코드 생성보다 코드베이스 안에서 문제를 풀어내는 평가다. FrontierCode 1.1 Main은 34.4%에서 43.6%로, DeepSWE v1.1은 49.0%에서 65.3%로 올랐다. 두 평가는 단순 알고리즘 문제보다 실제 소프트웨어 엔지니어링에 가까운 과제로, 요구사항을 해석하고 저장소 맥락을 읽어 수정안을 만들고 검증하는 역량을 본다. 점수 상승은 긴 작업에서 첫 계획이 맞을 가능성과 원인·증상을 구분할 가능성이 높아졌다는 신호로 읽을 수 있다.
같은 발표에서 WebDev Arena Elo는 1538에서 1588로, 복잡한 문서 처리 평가인 GDP.pdf는 22.0%에서 34.0%로, 업무 자동화 평가인 AutomationBench는 17.0%에서 30.4%로 올랐다. 웹 개발 평가는 시각적 요구와 구현의 일치를, 문서 평가는 긴 자료에서 근거를 잃지 않고 정보를 추출·종합하는 능력을, 자동화 평가는 여러 단계의 결정과 실행을 겨냥한다. 출처: Gemini 3.7 Flash 공개
읽는 방식에는 선이 필요하다. DeepSWE 65.3%는 “현업 버그의 65.3%를 자동으로 고친다”는 뜻이 아니다. 데이터셋의 이슈 난도, 숨은 테스트, 허용한 도구, 과제당 토큰 예산, 실패 후 재시도 규칙이 실제 조직과 다르다. AutomationBench 30.4%도 “도구 호출 정확도 30.4%”가 아니다. 업무 자동화 완료율에는 계획, 화면·문서 이해, 환경 상태, 도구 결과 해석, 실패 복구가 함께 들어간다. 이 수치들의 정확한 용도는 같은 발표 안에서 3.6 Flash 대비 상대 변화를 보는 것이고, 서로 다른 하네스·노력 수준·도구 구성에서 측정된 타사 수치와 승패표를 만드는 근거는 아니다.
실무로 옮기면 이렇다. 이전 모델이 함수 하나만 고치고 테스트 실패 원인을 되풀이 설명했다면, 개선된 모델은 관련 호출부·테스트·타입 정의까지 탐색한 뒤 변경 범위를 좁힐 가능성이 높다. 계약서 수십 건을 처리할 때도 답을 길게 쓰는 능력보다 조항을 빠뜨리지 않고 불확실한 항목을 별도 큐로 보내며 표준 출력 형식을 지키는 능력이 중요하다. 체감 개선은 정답 하나가 아니라 검수자가 “다시 처음부터 지시해야 하는 횟수”에서 나온다.
가격: ‘절반’이라는 표현을 정확히 읽기
Google은 3.7 Flash를 연말까지 입력 100만 토큰당 0.75달러, 출력 3.75달러의 도입 가격으로 제공한다고 밝히며 이를 3.6 Flash 가격의 절반이라고 설명했다. 여기서 절반의 기준은 3.6 Flash의 최초 가격인 입력 1.50달러·출력 7.50달러다. 출처: Gemini 3.7 Flash 공개
다만 2026년 8월 14일 현재 Gemini API 가격 페이지를 보면 Google은 3.6 Flash에도 동일한 프로모션 가격을 적용하고 있다. 두 모델 모두 2026년 12월 31일까지 입력 0.75달러·출력 3.75달러이고, 2027년 1월 1일부터 입력 1.50달러·출력 7.50달러가 된다. 즉 지금 시점에서 3.7 Flash는 3.6 Flash보다 싸지 않다. 같은 값이다. 출처: Gemini API 가격
이 사실은 오히려 비교를 단순하게 만든다. 3.6 Flash를 쓰는 팀이라면 가격 변수를 고정한 채 성능 차이만 보면 되므로, 3.7 Flash를 우선 테스트할 이유가 더 분명해졌다. 물론 가격이 같다는 것이 곧 교체 근거는 아니다. 프롬프트와 출력 형식이 3.6에 맞춰 조정돼 있다면 회귀 위험을 함께 봐야 하고, 2027년부터 두 모델 모두 단가가 두 배가 된다는 점도 예산 계획에 넣어야 한다.
출력 가격에는 사고 토큰이 포함된다. 모델이 더 깊게 생각하도록 설정했을 때 별도의 추론 토큰 단가를 계산하기보다, 실제 청구된 출력량과 작업 완료율을 함께 보는 편이 정확하다. 단가 표 밖의 비용도 있다. Google Search 기반 그라운딩은 요청 하나가 여러 검색 질의를 만들 수 있고 무료 할당 뒤에는 질의 단위 과금이 붙는다. 장기 세션에서는 누적 문맥의 재처리와 캐시·저장 비용, 도구 실행 시간과 실패 복구 비용도 함께 계산해야 한다. 출처: Gemini API 가격, Agent Platform 가격
세 모델의 비교 가능한 사실
아래 표는 각 공급사의 현재 공개 문서에서 확인되는 사양과 가격을 나란히 놓은 것이다. 성능 점수 표가 아니다. 같은 업무를 끝내는 데 드는 실제 비용은 출력 길이, 사고 수준, 캐시 적중, 도구 호출, 재시도에 따라 바뀐다.
| 모델 | 현재 API 가격(USD/1M tokens, 2026.8.14 기준) | 문맥 / 최대 출력 | 공개 문서에서 확인되는 에이전트 관련 요소 | 해석 시 주의점 |
|---|---|---|---|---|
| Gemini 3.7 Flash | $0.75 / $3.75 (2026.12.31까지. 2027.1.1부터 $1.50/$7.50) | 1,048,576 / 65,536 | 동적 사고, `thinking_level`, 내장 도구·Computer Use 계열 | 3.6 Flash도 현재 같은 프로모션 가격이다. 공개 벤치마크는 전작 비교에는 유용하나 타사와 동일 조건 수치가 아니다. |
| Claude Sonnet 5 | $2 / $10 | 1M / 128K | 계획 수립, 브라우저·터미널 도구 사용, 노력 수준 조절 | Claude 4.7 이후 모델의 새 토크나이저는 같은 텍스트에서 약 30% 더 많은 토큰을 만든다. 실제 증가폭은 콘텐츠와 워크로드에 따라 다르다. |
| GPT-5.6 Terra | $2 / $12 | 1.05M / 128K | Function calling, Structured Outputs, Responses API의 웹·파일·컴퓨터 사용 도구, MCP, 노력 수준 | 27.2만 입력 토큰을 넘는 요청은 전체 요청에 입력 2배·출력 1.5배가 적용된다. |
TechBrief AI 모델 성능-비용 비교 (Artificial Analysis 기준)
업데이트: 2026-08-14
가성비 모델 비교 (작업당 $1 미만)
OpenAIGooglexAIChinese open models
플래그십 모델 비교 (작업당 $1 이상)
AnthropicOpenAI
※ 성능 차이를 쉽게 비교할 수 있도록 Y축 범위를 일부 확대해 표시했습니다. 절대적인 성능 격차를 의미하지 않습니다.
※ 비교 조건: 대부분 max 조건 기준이며 Gemini 3.6 Flash, Gemini 3.5 Flash, Grok 4.6, Gemini 3.7 Flash(high 조건) · Kimi K3(default 조건)만 조건이 다릅니다. 조건이 다른 값은 같은 축에서 직접 비교하는 데 한계가 있습니다.
Sonnet 5의 2달러·10달러는 도입가에서 표준 가격으로 확정된 값이다. Anthropic은 2026년 9월 1일로 예정했던 3달러·15달러 인상을 시행하지 않고 현재 가격을 표준으로 유지한다고 밝혔다. Terra의 2달러·12달러는 기본 short-context 가격이며, 장문 요청에는 위 배수가 붙는다. 출처: Anthropic 가격, Claude 모델 개요, GPT-5.6 Terra 모델 문서
표만 보면 3.7 Flash의 입력 가격은 Sonnet 5와 Terra의 37.5%, 출력 가격은 Sonnet 5의 37.5%·Terra의 31.25%다. 이는 같은 입출력량을 가정한 계산이다. Flash가 두 번 실패한 뒤 세 번째에 끝내고 Sonnet 5나 Terra가 한 번에 끝낸다면 총액과 리드타임의 우위는 뒤집힌다. 토크나이저 차이도 단가 비교를 흐린다. 같은 문서를 넣어도 청구되는 입력 토큰 수가 모델마다 다르기 때문에, 0.75달러와 2달러라는 숫자만으로 실제 입력 비용의 배수를 확정할 수 없다.
문맥 길이도 숫자 하나로 우열을 정할 항목이 아니다. 세 모델 모두 100만 토큰대의 문맥을 제공하지만, 긴 문맥은 무조건 많은 자료를 한 번에 넣으라는 뜻이 아니다. 전체 저장소나 정책 문서를 통째로 주입하면 근거가 희석되고 매 호출의 재처리 비용이 커진다. 검색으로 근거 묶음을 줄이고 작업 상태·결정·테스트 결과만 압축해 넘기는 설계가 대체로 더 안정적이며, Terra에서는 이 설계가 27.2만 토큰 과금 경계를 넘지 않게 하는 수단이기도 하다. 출처: Gemini 3 시작하기, GPT-5.6 Terra 모델 문서
어떤 업무에 어떤 모델을 먼저 시험할까
비용 민감형 대량 API 서비스라면 Gemini 3.7 Flash부터 A/B 시험하는 판단이 합리적이다. 분류·정보 추출·요약·지원 티켓 초안·반복적 코드 보조처럼 과제 하나의 실패 비용이 제한적이고 트래픽이 큰 경우다. 단, 낮은 사고 수준과 높은 사고 수준을 함께 시험해야 한다. 가장 싼 설정이 가장 싼 과업을 뜻하지 않을 수 있다. 결과 형식 검증, 금지 동작 차단, 신뢰도 낮은 항목의 사람 검수 큐를 먼저 붙이는 것도 순서다.
코딩 에이전트가 기존 코드베이스를 수정하고 테스트까지 수행하는 환경이라면 세 모델을 동일한 하네스로 비교해야 한다. 3.7 Flash는 DeepSWE·FrontierCode 개선으로 후보 순위가 올라갔지만, 공개 수치만으로 Sonnet 5나 Terra를 대체한다고 결론낼 근거는 없다. 3.6 Flash를 쓰고 있다면 가격이 같은 지금이 교체 실험을 하기 좋은 시점이다. 다만 모델 세대와 무관하게 보호 브랜치, 최소 권한 토큰, 허용 명령 목록, 독립 테스트와 사람 승인 같은 안전장치는 그대로 유지해야 한다. 자동 병합 권한을 넓히는 것은 모델 성능과 별개의 결정이다.
복잡한 다단계 업무나 장기 상태 유지가 핵심이면 Sonnet 5와 Terra를 적극 검토할 이유가 있다. Sonnet 5는 노력 수준에 따른 비용-성능 조절과 계획·브라우저·터미널 도구 사용을 전면에 내세우고, Terra는 Responses API의 도구 생태계, 구조화된 출력, MCP, 지속 추론 문맥을 제공한다. 어느 쪽이 맞는지는 기존 인프라와 업무의 실패 양상에 따라 갈린다. 판별 기준은 “도구를 많이 쓴다”가 아니라 “어떤 도구 결과를 다음 판단에 얼마나 안정적으로 반영하는가”다. 문서·멀티모달 업무라면 여기에 입력 형식과 거버넌스를 별도 축으로 둬야 한다. 민감한 계약·재무·인사 자료는 저장·캐시·검색·보존 정책과 공급사별 데이터 처리 조건을 먼저 검토해야 하며, 모델 벤치마크가 이 책임을 대신하지 않는다. 출처: Claude Sonnet 5 소개, GPT-5.6 모델 가이드
도입 전 확인할 것: 과업당 비용과 종료 품질
코딩 에이전트에서 가장 값비싼 실패는 틀린 코드를 만드는 일이 아니라, 틀린 변경을 완료라고 선언해 사람이 뒤늦게 발견하는 일이다. 그래서 평가도 정답률 하나가 아니라 변경 범위를 제대로 찾는지, 도구를 올바른 순서로 호출하는지, 테스트·린트·빌드 실패를 새 증거로 받아 계획을 수정하는지, 완료 기준을 못 채웠을 때 멈추고 사람에게 넘기는지로 나눠 봐야 한다.
도구 호출 능력은 JSON 형식을 맞추는 일보다 넓다. 최소한 세 가지는 따로 측정할 만하다. 올바른 도구를 고르고 인자를 채우는가, 권한 거부·오류·빈 결과를 해석해 다음 행동을 바꾸는가, “배포하지 말고 계획만 제시하라” 같은 제약을 도구 호출 뒤에도 지키는가다. 모델이 코드를 잘 써도 뒤의 두 항목이 약하면 운영 자동화에는 위험하다.
시험 세트는 대표적인 실제 업무 과제 묶음으로 구성한다. 정상 경로만 넣지 말고 존재하지 않는 고객 ID, 권한 거부, 중복 레코드, 늦게 도착한 데이터, 모호한 지시, 금지된 부작용을 섞는다. 기록할 값은 첫 시도 완료율과 최종 완료율(재시도 성공을 첫 시도 성공과 합치면 운영 부담이 숨는다), 출력·사고 토큰과 캐시·도구 호출·검색 횟수, 오류 유형 분류, 그리고 사람 검수 시간과 되돌린 변경 수다. 비교는 같은 시스템 프롬프트·도구 정의·최대 반복 수로 하되, 공급사별 권장 API 경로 차이는 별도로 남긴다.
실무적으로 비용을 나눠보면 과업당 비용은 토큰 비용, 도구·검색 비용, 재시도 비용, 사람 검수·복구 비용의 합이다. 토큰 비용은 다시 입력, 캐시 입력, 출력, 장문 문맥 배수, 사고 토큰 포함 여부로 쪼개진다. 사람 비용은 달러로 정확히 환산하기 어렵더라도 이슈 하나당 검수 분과 롤백 횟수로 재면 모델 간 비교가 가능하다. 3.7 Flash는 입력이 많고 출력이 짧은 대량 작업에서 유리한 출발점을 갖지만, 길게 생각하고 긴 패치를 출력하며 여러 도구를 실행해야 하는 작업에서는 단가보다 실패 복구 구조가 총비용을 좌우한다.
결론
Gemini 3.7 Flash에서 가장 흥미로운 변화는 단순 가격 인하가 아니다. 현재 3.6 Flash와 같은 가격에 소프트웨어 엔지니어링과 자동화 성능이 크게 개선됐다는 점이다. 발표된 절반 가격은 3.6 Flash의 최초 가격과 비교한 값이고, 지금은 두 모델의 단가가 같다. 가격이 고정된 상태에서 성능만 달라졌으므로 비교 자체는 오히려 쉬워졌다.
그래서 3.6 Flash를 쓰는 조직이라면 3.7 Flash를 우선 검증할 이유가 충분하다. 위험이 낮은 코딩 보조·문서 처리·자동화 큐에서 그림자 실행으로 돌리고 첫 시도 성공률과 검수 시간을 기록한 뒤, 개선이 확인되면 점진적으로 트래픽을 옮기는 순서가 무난하다. 신규 도입 조직이라면 3.7 Flash·Sonnet 5·GPT-5.6 Terra를 같은 작업 묶음, 같은 성공 조건, 같은 안전 제한 아래 놓고 과업당 비용과 완료율을 비교해야 한다.
세 모델은 서로 다른 벤치마크 조건과 토크나이저, 도구 하네스를 갖고 있어 공개 수치만으로 우열을 확정할 수 없다. 지금 확인된 것은 저가형 Flash가 실무 후보군 안으로 들어왔다는 사실이지, 어느 모델이 모든 업무에서 앞선다는 결론이 아니다. 그 판단은 각자의 저장소와 업무 큐에서 나온다.
참고 출처
- Gemini 3.7 Flash 공개(Google)
- Gemini 3.7 Flash 모델 문서
- Gemini 3.6 Flash 모델 문서
- Gemini API 가격
- Gemini 3 시작하기
- Gemini Enterprise Agent Platform 가격
- Claude 모델 개요(Anthropic)
- Anthropic 가격
- Claude Sonnet 5 소개
- GPT-5.6 Terra 모델 문서(OpenAI)
- OpenAI API 가격
- GPT-5.6 모델 가이드
TechBrief Index 실측 비교 (업데이트: 2026-08-14)
| 모델·조건 | AA Index | Task Cost | API $/M (입력/출력) | Context | Max output | 추천 용도 |
|---|---|---|---|---|---|---|
| Claude Sonnet 5 Anthropic · max |
55.3 | $1.72 | $2/$10 2026-08-10 도입가가 표준가로 확정. 예정됐던 $3/$15 인상은 시행되지 않는다. |
1,000K | 128K | 일반 지식 작업·긴 컨텍스트 |
| GPT-5.6 Terra OpenAI · max |
56.6 | $0.51 | $2/$12 | 1,050K | 128K | 균형형 일반 업무 |
| Gemini 3.6 Flash Google · high |
51.6 | $0.56 | $0.75/$3.75 2026-12-31까지 프로모션가. 2027-01-01부터 입력 $1.50 · 출력 $7.50. |
1,048K | 65K | 고속 멀티모달·비용 효율 작업 |
| Gemini 3.7 Flash Google · high |
56.0 | $0.40 | $0.75/$3.75 2026-12-31까지 프로모션가. 2027-01-01부터 입력 $1.50 · 출력 $7.50. |
1,048K | 65K | 비용 민감 대량 처리 |
전체 비교는 AI Model Index에서 항상 최신 값으로 확인할 수 있습니다.
