최종 업데이트: 2026-07-25 · 수록 벤치마크 6종
AI 모델 비교에 자주 인용되는 벤치마크가 무엇을 재고, 무엇을 재지 못하는지 정리했습니다. 점수 순위표가 아니라 지표 자체에 대한 해설입니다. 어떤 점수를 어디까지 믿어야 하는지 판단하는 데 쓰세요.
벤치마크끼리는 순위를 매기지 않습니다. 측정 대상이 서로 달라 우열을 말할 수 없기 때문입니다. 대신 각 지표를 어떤 판단에 쓸 수 있는지를 표시했습니다.
한눈에 보기
| 벤치마크 | 유형 | 버전 | 문항 수 | TechBrief 사용 기준 |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index Artificial Analysis |
복합 지수 | v4.1 | 미공개 | 기준 지표 — 모델 간 교차 비교의 기본 축으로 사용한다. 버전(v4.1)을 반드시 함께 표기한다. |
| ARC-AGI ARC Prize Foundation |
추론 특화 | ARC-AGI-1 / 2 / 3 | 미공개 | 보조 지표 — 추론 능력 관련 서술에만 쓰고, 일반 성능 근거로는 쓰지 않는다. |
| LMArena (Chatbot Arena) Arena (구 LMSYS) |
인간 선호 투표 | 상시 운영 | 미공개 | 보조 지표 — '선호도 기준'임을 반드시 병기한다. 단독으로 성능 우열을 서술하지 않는다. |
| SWE-bench SWE-bench 팀 (프린스턴 등) |
코딩 실무 | Verified · Lite · Multimodal · Multilingual | 500 | 보조 지표 — 반드시 변형명(Verified 등)을 함께 표기한다. |
| Humanity's Last Exam (HLE) Center for AI Safety · Scale AI |
학술 지식 | 공개·비공개 세트 병행 | 2,500 | 보조 지표 — 지식 범위 서술에만 사용한다. |
| Terminal-Bench Stanford · Anthropic 공동 |
에이전트 실행 | v2.1 | 89 | 보조 지표 — AA Index 구성 요소로서 언급할 때는 운영 주체 관계를 함께 표기한다. |
벤치마크별 상세
Artificial Analysis Intelligence Index
Artificial Analysis · 복합 지수 · v4.1 · 문항 수 미공개
재는 것 — 추론·지식·수학·프로그래밍 전반의 언어모델 능력을 9개 평가로 묶어 하나의 점수로 낸다.
재지 못하는 것 — 텍스트·영어 전용이다. 이미지 입력, 음성, 다국어 성능은 이 점수에 들어 있지 않고 별도 평가로 분리돼 있다. 한국어 성능도 마찬가지로 포함되지 않는다.
AgentsCodingGeneralScientific Reasoning
- Agents · GDPval-AA v2 20%
- Agents · τ³-Banking 14%
- Coding · Terminal-Bench v2.1 16%
- Coding · SciCode 8%
- General · AA-Omniscience 12%
- General · AA-LCR 6%
- Scientific Reasoning · Humanity's Last Exam 12%
- Scientific Reasoning · GPQA Diamond 6%
- Scientific Reasoning · CritPt 6%
알고 봐야 할 점
- 전체 지수의 95% 신뢰구간은 ±1% 미만으로 추정되지만, 개별 평가 항목은 그보다 넓을 수 있다. 1~2점 차이를 성능 차이로 읽으면 안 된다.
- 구성 요소 중 Humanity's Last Exam은 문항 큐레이션에 참여한 모델에 유리할 수 있다고 운영 주체가 명시했다.
- 에이전트 비중이 34%로 가장 크다. 에이전트 작업을 하지 않는 용도라면 이 점수의 3분의 1은 무관한 항목이다.
TechBrief 사용 기준: 기준 지표 — 모델 간 교차 비교의 기본 축으로 사용한다. 버전(v4.1)을 반드시 함께 표기한다.
공식 리더보드 · 확인 2026-07-25
ARC-AGI
ARC Prize Foundation · 추론 특화 · ARC-AGI-1 / 2 / 3 · 문항 수 미공개
재는 것 — 처음 보는 과제를 얼마나 효율적으로 익히는가(skill-acquisition efficiency). 축적된 지식이 아니라 새로운 상황에 적응하는 유동지능을 겨냥한다.
재지 못하는 것 — 학습된 지식·언어·문화적 정보는 의도적으로 배제한다. 따라서 이 점수가 높다고 실무 지식 작업을 잘한다는 뜻이 아니고, 낮다고 무능하다는 뜻도 아니다.
알고 봐야 할 점
- 운영 주체가 '특정 과제를 잘하는 것은 지능이 아니다'라고 명시한다. 점수를 일반 성능으로 확대 해석하면 설계 의도와 정반대가 된다.
- 사전 지식이 많은 시스템의 높은 점수는 개발자의 설계 역량을 보여줄 뿐 모델 자체의 지능이 아니라고 밝히고 있다.
- 버전별 문항 수는 공식 개요 문서에서 확인하지 못했다.
TechBrief 사용 기준: 보조 지표 — 추론 능력 관련 서술에만 쓰고, 일반 성능 근거로는 쓰지 않는다.
공식 리더보드 · 확인 2026-07-25
LMArena (Chatbot Arena)
Arena (구 LMSYS) · 인간 선호 투표 · 상시 운영 · 문항 수 미공개
재는 것 — 익명 모델 두 개의 답변을 사용자가 비교해 고른 결과를 Elo·Bradley-Terry 계열 방식으로 집계한다. 실사용자 선호의 대규모 표본이다.
재지 못하는 것 — 정확도가 아니라 선호도다. 사실이 틀려도 읽기 좋은 답변이 이길 수 있다. 운영 주체도 문체가 순위에 영향을 준다는 점을 인정해 Style Control·Sentiment Control 분석을 별도로 공개한다.
알고 봐야 할 점
- 선호도 지표이므로 '성능 1위'라는 표현의 근거로 단독 사용할 수 없다.
- 리더보드를 겨냥한 적대적 조작 가능성에 대한 연구가 운영 주체 자료에 인용돼 있다.
- 투표자 구성이 일반 사용자 분포와 같다는 보장이 없다.
TechBrief 사용 기준: 보조 지표 — '선호도 기준'임을 반드시 병기한다. 단독으로 성능 우열을 서술하지 않는다.
공식 리더보드 · 확인 2026-07-25
SWE-bench
SWE-bench 팀 (프린스턴 등) · 코딩 실무 · Verified · Lite · Multimodal · Multilingual · 500문항
재는 것 — GitHub의 실제 이슈와 저장소를 주고 이를 고치는 패치를 생성하게 한다. 합성 문제가 아니라 실제 오픈소스 작업이라는 점이 핵심이다.
재지 못하는 것 — 이슈가 잘 정의된 상황에서의 수정 능력이다. 요구사항 정의, 설계 판단, 사람과의 협업처럼 실무의 큰 부분은 측정 범위 밖이다.
알고 봐야 할 점
- task_count 500은 Verified 기준이다(엔지니어가 풀 수 있다고 확인한 문항). 변형별로 문항 수가 다르므로 어느 변형인지 밝히지 않은 점수는 비교할 수 없다.
- 공식 개요 문서에는 한계에 대한 명시적 서술이 없어, 이 항목의 한계 설명은 측정 범위에서 도출한 것이다.
- 파이썬 오픈소스 저장소 중심이라 다른 언어·사내 코드베이스로 일반화하기 어렵다.
TechBrief 사용 기준: 보조 지표 — 반드시 변형명(Verified 등)을 함께 표기한다.
공식 리더보드 · 확인 2026-07-25
Humanity's Last Exam (HLE)
Center for AI Safety · Scale AI · 학술 지식 · 공개·비공개 세트 병행 · 2,500문항
재는 것 — 100개 이상 학문 분야의 전문가 수준 문제 2,500문항. 약 50개국 500여 기관의 전문가 1,000명 가까이가 출제에 참여했다.
재지 못하는 것 — 닫힌 형식의 학술 문제만 다룬다. 개방형 연구, 창의적 문제 해결, 자율적 탐구 능력은 측정하지 않는다.
알고 봐야 할 점
- 운영 주체가 '높은 점수는 전문가 수준 지식을 뜻할 뿐 자율 연구 능력이나 AGI를 시사하지 않는다'고 명시했다.
- 출제에 참여한 모델에 유리할 수 있다는 편향을 Artificial Analysis가 별도로 지적했다.
- AA Intelligence Index에서 12% 비중을 차지하므로, HLE의 편향은 종합 지수에도 그만큼 전달된다.
TechBrief 사용 기준: 보조 지표 — 지식 범위 서술에만 사용한다.
공식 리더보드 · 확인 2026-07-25
Terminal-Bench
Stanford · Anthropic 공동 · 에이전트 실행 · v2.1 · 89문항
재는 것 — 터미널 환경에서 에이전트가 실제 작업을 끝내는지 본다. 리눅스 커널 빌드, 웹서버 설정, 모델 학습 등 소프트웨어 공학·보안·데이터 과학 과제를 포함한다.
재지 못하는 것 — 터미널로 완결되는 작업에 한정된다. GUI 작업, 사람의 판단이 필요한 결정, 장기 프로젝트 운영은 범위 밖이다.
알고 봐야 할 점
- 문항 수 89는 2.0 기준이며(초기 버전 80), 현재 주 버전은 2.1이다. 표본이 작아 몇 문항 차이가 순위를 바꿀 수 있다.
- 운영 주체에 Anthropic이 참여한다. AA Intelligence Index에서 16% 비중을 차지하므로, Anthropic 모델을 이 지수로 평가할 때는 이 관계를 알고 보는 편이 낫다. 부정을 시사하는 것이 아니라 공개된 사실을 밝히는 것이다.
- Terminal-Bench Science는 개발 중이라 아직 비교에 쓸 수 없다.
TechBrief 사용 기준: 보조 지표 — AA Index 구성 요소로서 언급할 때는 운영 주체 관계를 함께 표기한다.
공식 리더보드 · 확인 2026-07-25
점수를 읽을 때 지켜야 할 것
- 벤치마크 점수는 '어떤 조건에서 잰 값인가'와 분리할 수 없다. 같은 모델도 effort·routing 설정에 따라 점수가 달라지므로, 조건이 표기되지 않은 점수는 비교에 쓸 수 없다.
- 제조사가 자사 모델을 측정해 발표한 점수는 그 사실을 함께 표기하며, 교차 모델 비교에는 사용하지 않는다.
- 1~2점 차이는 대부분 신뢰구간 안이다. 순위가 바뀌었다는 사실보다 차이의 크기가 유의미한지를 먼저 본다.
- 벤치마크가 포화되면(상위 모델이 모두 만점에 근접) 그 지표는 변별력을 잃는다. 점수가 높은 것과 지표가 유효한 것은 다른 문제다.
정리 기준
- 범위: AI 모델 비교에 자주 인용되는 벤치마크가 무엇을 재고 무엇을 재지 못하는지 정리한다. 점수 순위표가 아니라 지표 자체의 해설이다.
- 비교 규칙: 벤치마크끼리 순위를 매기지 않는다. 측정 대상이 서로 달라 우열을 말할 수 없으며, 어떤 판단에 어떤 지표가 맞는지만 표시한다.
- 출처 규칙: 각 벤치마크의 운영 주체가 공개한 문서(등급 ①)만 근거로 삼는다. 확인하지 못한 항목은 추정하지 않고 '미공개'로 둔다.
벤치마크는 버전이 올라가면 측정 대상이 달라집니다. 버전이 바뀐 것을 발견하면 문의로 알려주세요. · AI Model Index · TechBrief Index 전체
