GPT-6 Sol·Luna·Claude Opus 5.5 비교: GPT-5.6 Terra와 Sonnet 5는 언제 써야 하나
핵심 요약
- GPT-5.6 Sol·Luna를 쓰는 팀은 같은 계열인 GPT-6 Sol·Luna를 먼저 시험할 만하다. 공식 API 단가가 낮아졌고 코딩 평가도 개선됐다.
- GPT-5.6 Terra에는 같은 이름을 잇는 GPT-6 모델이 없다. 검증된 작업은 유지하되, 판단이 어려운 작업은 Sol, 범위가 좁고 반복되는 작업은 Luna와 비교한다.
- Claude Opus 5 사용자는 Opus 5.5를 우선 검토할 만하다. Sonnet 5까지 일괄 교체할 근거는 부족하다.
- 선택 기준은 모델 순위보다 작업 성공률, 재시도 횟수, 응답 시간과 총비용이다.
OpenAI와 Anthropic이 같은 날 코딩 모델을 새로 내놨다
2026년 9월 22일 Anthropic은 Claude Opus 5.5를, OpenAI는 GPT-6 Sol과 Luna를 발표했다. Sol은 코딩과 판단이 필요한 일상 업무, Luna는 범위가 분명한 대량 작업을 겨냥한다. Opus 5.5는 기존 Opus 5보다 복잡한 에이전트 작업을 더 잘 처리하면서 비용을 낮춘 모델로 소개됐다. Claude Code, Codex, Cursor를 쓰는 팀이라면 신모델 이름보다 지금 하던 작업에 어떤 모델을 써야 하는지가 더 중요하다. 출처: GPT-6 Sol·Luna 발표, Claude Opus 5.5 발표
GPT-6 Sol과 Luna는 각각 GPT-5.6 Sol과 Luna를 잇는 비교 대상이다. GPT-5.6 Terra는 성능과 비용의 균형을 맡던 모델인데, 공개된 GPT-6 제품군에 Terra라는 모델은 없다. Anthropic 쪽은 Opus 5.5가 Opus 5를 잇지만 Sonnet 5는 별도 선택지로 남아 있다. 신모델이 나왔다고 기존 모델을 모두 바꿀 필요는 없다.
GPT-5.6 Sol·Luna는 GPT-6로 바로 바꿔도 될까
아래 가격은 100만 토큰당 현재 공개된 API 가격이다. GPT-5.6 비교 가격은 OpenAI가 발표에서 프로모션 가격 기준이라고 밝혔다. 입력·출력 가격을 나눠 보면 긴 코드 생성이나 디버깅 작업의 비용 차이를 가늠하기 쉽다. OpenAI GPT-6 Sol·Luna 발표, OpenAI GPT-5.6 Terra 모델 문서
| 기존 모델 → 검토할 모델 | 입력 요금 | 출력 요금 | 우선 살펴볼 작업 |
|---|---|---|---|
| GPT-5.6 Sol → GPT-6 Sol | $4 → $2 | $20 → $10 | 여러 파일을 건드리는 구현, 코드 검토 |
| GPT-5.6 Luna → GPT-6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 작은 수정, 분류와 반복 작업 |
| GPT-5.6 Terra → Terra 유지 / GPT-6 Sol·Luna 비교 | Terra $2 · Sol $2 · Luna $0.10 | Terra $12 · Sol $10 · Luna $0.50 | 검증된 흐름은 Terra 유지. 복잡한 판단은 Sol, 좁고 반복되는 작업은 Luna와 비교 |
| Claude Opus 5 → Opus 5.5 | $5 → $4 | $25 → $20 | 대규모 저장소 분석, 복잡한 디버깅과 장시간 실행 |
| Claude Sonnet 5 ↔ Opus 5.5 | $2 ↔ $4 | $10 ↔ $20 | 명확하고 반복적인 구현은 Sonnet, 난도 높은 분석은 Opus와 비교 |
GPT 가격은 현재 공개된 API 가격이다. OpenAI는 GPT-6 가격을 GPT-5.6 프로모션 가격과 비교해 발표했다. Terra의 $2/$12 가격과 intelligence·cost 균형을 겨냥한 포지셔닝은 OpenAI 모델 문서를 기준으로 했다. Opus 5.5는 입력 $4·출력 $20, Sonnet 5는 $2·$10으로 기본 단가가 두 배 차이다. 캐시, 추론량, 도구 호출은 별도이므로 이 비율이 실제 작업 총비용까지 그대로 뜻하지는 않는다. 구독료와 코딩 도구별 사용 한도도 표에 포함하지 않았다. 출처: GPT-6 Sol·Luna 발표, Claude Opus 5.5 발표, OpenAI GPT-5.6 Terra 공식 모델 문서
GPT-5.6 Sol에서 GPT-6 Sol로 옮길 때는 가격과 코딩 평가를 함께 볼 수 있다. OpenAI 자체 DeepSWE 1.1 평가에서 GPT-6 Sol은 max 추론 설정으로 68.8%를 기록했다. 같은 평가에서 Claude Fable 5는 xhigh 설정으로 69.9%였고, OpenAI는 Sol의 작업당 비용이 약 80% 낮았다고 밝혔다. 모델과 추론 설정이 다르고, 서로 다른 회사의 평가 결과를 일대일 성능 순위로 읽을 수는 없다. OpenAI는 FrontierCode 1.1에서도 GPT-6 Sol이 GPT-5.6 Sol보다 개선됐다고 설명했다. 우리 저장소에서는 최근 실패하거나 범위가 컸던 과제를 같은 도구와 테스트로 돌려 수정 품질·재시도 횟수·완료 시간을 비교하는 편이 낫다. 출처: GPT-6 Sol·Luna 발표
GPT-6 Luna는 DeepSWE 1.1에서 max 설정 기준 66.6%를 기록했다. OpenAI는 이 점수가 자사 평가에서 Claude Opus 5·Fable 5의 medium 설정과 비슷하며, 작업당 비용은 각각 93%·96% 낮았다고 발표했다. 이는 해당 시험에서의 비교다. 에이전트 구성이나 작업 분포가 바뀌면 비용과 결과도 달라질 수 있으므로, 요구사항이 분명하고 자동 테스트로 결과를 판정할 수 있는 작업부터 비교하는 것이 현실적이다. 출처: GPT-6 Sol·Luna 발표
GPT-5.6 Terra에는 바로 이어지는 모델이 없다
GPT-5.6 Terra와 같은 이름을 잇는 GPT-6 모델은 현재 제품군에 없다. OpenAI는 Terra를 intelligence와 cost의 균형을 위한 모델로 설명하며, 현재 API 가격은 입력 $2·출력 $12다. 입력은 GPT-6 Sol과 같고 출력은 Sol보다 높다. 이미 검증한 Terra 워크플로는 유지하고, 복잡한 판단이 늘어난 작업은 Sol, 작고 반복적인 일은 Luna와 비교하는 편이 맞다. 이는 Terra의 공식 후속 모델을 고르는 문제가 아니라, 지금 맡긴 일에 가장 잘 맞는 선택지를 찾는 과정이다. 출처: GPT-6 Sol·Luna 발표, OpenAI GPT-5.6 Terra 공식 모델 문서
결제 오류 수정이 여러 서비스의 예외 처리와 회귀 테스트를 함께 건드리면 Sol을 비교하고, 로그에서 정해진 오류 코드를 뽑거나 규칙적인 테스트 뼈대를 반복 작성한다면 Luna를 살펴볼 만하다. 두 모델이 기존 Terra보다 재시도나 수정 부담을 늘리면 안정적인 Terra 흐름을 유지한다. 지표는 토큰 단가만이 아니다. 작업 완료까지의 호출 수, 사람이 고친 시간, 테스트 결과를 함께 기록하면 전환 효과가 드러난다.
긴 저장소를 통째로 보내는 팀은 토큰 사용량과 캐시 적중률도 봐야 한다. 파일 검색과 요약으로 필요한 부분만 보내고, 반복되는 지시문과 코드 문맥은 얼마나 재사용되는지 확인한다. OpenAI 발표에 따르면 GPT-6의 캐시된 입력 읽기에는 90% 할인이 적용된다. 실패 후 재시도가 잦다면 할인된 단가만큼이나 호출 횟수가 중요하다. 출처: GPT-6 Sol·Luna 발표
Opus 5는 5.5로 바꾸고, Sonnet 5는 계속 써야 할까
Opus 5에서 5.5로 옮길지는 공식 가격과 자체 평가를 참고하되, 실제 작업으로 비교한 뒤 정하면 된다. Anthropic 발표에 따르면 입력·출력 단가는 각각 100만 토큰당 $5·$25에서 $4·$20으로, 캐시 읽기는 $0.50에서 $0.20으로 내려갔다. Anthropic은 기본 설정의 일반적인 작업 비용이 Opus 5보다 40% 낮다고 추정한다. 토큰 단가 인하율과 작업당 비용 절감률은 다른 수치다. 같은 발표의 자체 Terminal-Bench 4.0 평가에서는 Opus 5.5가 66.4%, Opus 5가 52.3%였다. 평가 환경과 추론 설정이 정해진 결과이므로 팀의 장시간 작업에서도 차이가 같은 폭으로 난다고 가정하지는 않는다. 출처: Claude Opus 5.5 발표
Claude Sonnet 5는 입력 $2·출력 $10, Opus 5.5는 입력 $4·출력 $20으로 기본 토큰 단가가 정확히 두 배다. Opus 5.5가 기존 Opus 5보다 저렴해졌어도 Sonnet 5보다 싼 모델이 된 것은 아니다. Sonnet 5는 명확한 기능 구현, 반복적인 코드 수정, 테스트, 리팩터링과 일반적인 에이전트 실행처럼 비용과 처리량이 중요한 작업에서 선택지로 남는다. 대규모 코드베이스 분석, 복잡한 디버깅, 설계 변경이나 장시간 에이전트 작업은 Opus 5.5를 먼저 비교해 볼 만하다. 이는 절대 성능 경계가 아니다. Anthropic은 Sonnet 5가 높은 추론 단계에서 Opus 4.8과 일부 작업의 능력 수준을 맞출 수 있다고 소개했고, 사용자는 작업별 추론 강도와 비용을 조정할 수 있다고 설명한다. 실제 선택은 같은 저장소와 도구, 제한 시간으로 대표 과제를 실행해 성공률·수정량·완료 비용을 보고 정한다. Anthropic Claude Sonnet 5 공식 발표, Anthropic Claude Opus 5.5 공식 발표
코딩 작업별로 어떤 모델부터 써볼까
아래는 정답표가 아니라 작업별로 먼저 비교할 모델과 선택 기준이다. 테스트가 약하거나 실패 비용이 큰 업무라면 사람 검토를 포함한 결과도 함께 비교한다.
| 작업 | 먼저 시험할 모델 | 선택 기준 |
|---|---|---|
| 작은 버그 수정 | GPT-6 Luna | 원인 파악이 여러 파일로 번지면 GPT-6 Sol |
| 테스트 작성 | GPT-6 Luna 또는 Sonnet 5 | 경계 조건 설계가 어려우면 GPT-6 Sol |
| 반복 리팩터링 | Sonnet 5 또는 GPT-6 Luna | 동작 보존에 실패하면 GPT-6 Sol |
| 대형 코드베이스 분석 | GPT-6 Sol 또는 Opus 5.5 | 여러 파일 분석은 Sol 비교, 반복·범위 제한 작업은 Luna 비교. 검증된 흐름은 Terra 유지 |
| 복잡한 디버깅 | GPT-6 Sol 또는 Opus 5.5 | 원인이 좁혀지면 Luna나 Sonnet 5로 후속 수정 |
| 아키텍처 변경 | Opus 5.5 또는 GPT-6 Sol | 설계가 확정되면 Sonnet 5로 하위 작업 분리 |
| 장시간 자율 실행 | Opus 5.5 또는 GPT-6 Sol | 긴 작업의 완료율·재시도 횟수·총비용을 기록해 선택 |
대규모 저장소 수정 뒤 테스트를 여러 차례 실행하는 작업은 입력·출력 단가만으로 실제 비용을 알기 어렵다. 캐시 적중률, 추론량, 도구 호출과 재시도가 총액에 함께 반영된다. 대표 과제를 같은 저장소와 제한으로 반복해 성공한 작업당 비용, 코드 검토자의 수정 사항, 완료 시간을 비교하면 어떤 작업을 어느 모델에 맡길지 정할 근거가 생긴다. 여러 모델을 함께 쓸 때도 모델별 점수보다 이 기록을 기준으로 업무를 나눈다. TechBrief AI Model Index에서 공개 평가와 가격 조건을 함께 볼 수 있다.
새 모델이 나와도 모든 작업을 한꺼번에 바꿀 이유는 없다. 이미 잘 돌아가는 흐름은 유지하고, 실패 비용이 큰 작업과 반복량이 많은 작업부터 대표 과제로 비교해 바꾸는 편이 안전하다.
참고 출처
- OpenAI, GPT-6 Sol·Luna 공식 발표
- OpenAI, GPT-5.6 Terra 공식 모델 문서
- Anthropic, Claude Opus 5.5 공식 발표
- Anthropic, Claude Sonnet 5 공식 발표
TechBrief Index 성능·비용 비교 (업데이트: 2026-09-29)
| 모델·조건 | AA Index | Task Cost | API $/M (입력/출력) | Context | Max output | 추천 용도 |
|---|---|---|---|---|---|---|
| GPT-5.6 Terra OpenAI · max |
42.1 | $1.40 | $2/$12 | 1,050K | 128K | 균형형 일반 업무 |
AA Index·Task Cost는 Artificial Analysis 공개 데이터, 가격·컨텍스트는 각 사 공식 문서 기준입니다. 전체 비교는 AI Model Index에서 확인할 수 있습니다.
