每隔一段时间,AI 行业就会来一次“模型大升级”,发布会上照例甩出一张密密麻麻的表格:
GPQA 91.2% ・ AIME 96.7% ・ SWE-bench 82.3% ・ Humanity’s Last Exam 48.1% ・ Arena Elo 1450
然后配一句“这是目前最强的模型”。问题在于,这些数字到底是什么意思。GPQA 是什么,AIME 又是什么,SWE-bench 的 80% 和 Arena 的 1400 分能不能放在一起比?为什么同一个模型在不同排行榜上的名次可能差很远?
本文把 2026 年 AI 模型发布里比较常见的测试平台和 Benchmark 梳理一遍,每一项都讲清楚三件事:它在测什么、分数意味着什么、以及这个分数不能说明什么。
Benchmark 和测试平台不是一回事
最容易混淆的就是这两个概念。Benchmark 是一套标准化的测试题或测试任务,比如 GPQA 测高难度科学问题、AIME 测数学竞赛题、SWE-bench 测 AI 修真实代码、MMMU 测多模态理解。测试平台则是把各种 Benchmark、真人评价、价格、速度等数据组织起来做横向比较的网站或系统,比如 LMArena、Artificial Analysis、LiveBench。
一句话:Benchmark 是“考试”,测试平台是“成绩单和排行榜”。
为什么现在还要看 Benchmark
完全不看 Benchmark,会损失一部分判断力;每天盯着排行榜,又容易掉进另一个坑。
早些年 Benchmark 的意义很直接——模型 A 的 MMLU 是 85%,模型 B 是 78%,大家自然认为 A 更强。但随着模型能力见顶,这种比较越来越不可靠。今天一个 Benchmark 分数会受一大堆因素影响:测试题本身、测试版本、Prompt、是否允许联网、是否允许调用工具、是否开启 reasoning、推理预算多少、用什么 Agent scaffold、跑几次、judge 怎么判,以及数据有没有被模型训练过。
所以现在更合理的理解是:Benchmark 是衡量模型某一类能力的信号,而不是模型能力的完整答案。
最值得关注的几个测试平台
如果不想研究几十种 Benchmark,可以先记住下面这几个平台。
| 平台 | 主要看什么 | 关注度 |
|---|---|---|
| 🏆 LMArena | 真人盲测偏好 | ⭐⭐⭐⭐⭐ |
| 📊 Artificial Analysis | 综合能力、价格、速度 | ⭐⭐⭐⭐⭐ |
| 🧪 LiveBench | 抗污染的动态综合测试 | ⭐⭐⭐⭐⭐ |
| 💻 SWE-bench / SWE-bench Pro | 编程与软件工程 Agent | ⭐⭐⭐⭐ |
| 🖥️ Terminal-Bench | 终端操作 Agent | ⭐⭐⭐⭐ |
| 🧠 GPQA / HLE | 高难度知识与推理 | ⭐⭐⭐ |
想快速判断一个新模型值不值得关注,我一般先看 LMArena + Artificial Analysis + LiveBench,然后按模型定位再看 Coding、数学、多模态等专项。
LMArena:真人到底更喜欢哪个模型
LMArena 的思路和传统 Benchmark 完全不同。它的前身是 Chatbot Arena,2025 年从 LMSYS / 伯克利独立出来公司化运营,站点是 lmarena.ai。
它不给所有模型发同一套题算正确率,而是让真实用户做匿名对战。用户提一个问题(比如“帮我写一份产品发布公告”),系统让两个模型同时回答,但不告诉用户哪个是哪个;用户看完选“A 更好 / B 更好 / 差不多”。大量投票之后按 Elo 算出排名。所以它测的不是“模型知道多少知识”,而是“真实用户在盲测下更喜欢哪个模型的回答”。
常见指标
- Elo / Rating:源自国际象棋等竞技排名,在 Arena 里可以粗略理解成模型在大量一对一比较中的综合竞争力。注意 1450 不代表“能力值是 1450”,它只是个用于排名的相对分。
- Rank:当前名次。
- Votes:参与比较的投票数,样本越大排名越稳。
- 置信区间(CI):表示排名的不确定性。两个模型分数接近、CI 高度重叠时,不能简单说“A 明显比 B 强”。
价值和局限
Arena 特别适合回答“普通用户实际更喜欢哪个模型”,对写作、对话、综合问答、创意、指令理解、日常体验很有参考价值。
局限也很明显。Arena 第一不等于数学、Coding、科研第一——用户偏好本身就是一个有倾向的指标,已知它会偏向更长、格式更漂亮、语气更讨喜的回答,LMArena 后来加了 style control 选项来部分抵消这种偏差。2025 年还有一篇《The Leaderboard Illusion》指出,头部厂商可以私下测很多变体、只公布最好的一个,这会让排名对大厂更有利。看 Arena 分数时,这些都要放在心里。
Artificial Analysis:不只是测能力
如果说 LMArena 回答的是“大家更喜欢谁”,那 Artificial Analysis 回答的是“这个模型到底多强、多少钱、多快”。它把 Intelligence、价格、延迟、输出速度、上下文窗口、单任务成本放在一起比,是现在观察模型绕不开的工具之一。
Intelligence Index
Artificial Analysis 有一个综合指标 Intelligence Index,可以理解成多个 Benchmark 加权之后的模型能力指数——不是告诉你“这个模型智商多少”,而是把不同类型的能力放进同一个比较框架。
一个值得注意的变化是它的权重结构。2026 年年中更新到 v4 系列之后,这个指数已经明显偏向 Agent 类任务:Agents 约占 34%、Coding 约 24%、科学推理约 24%、通用能力约 18%,纳入的评测也换成了 Terminal-Bench、τ³-Bench、GDPval 这类更接近真实工作的项目。这反映了整个行业的方向:模型正在从“回答问题”变成“完成任务”。
还要看的几个指标
- Cost:模型价格,通常分 input token、output token、cached input 三档,用来估 API 成本。
- TTFT(Time To First Token):从发请求到吐出第一个 token 的等待时间,主要影响聊天场景的体感。
- Output Tokens / Second:每秒生成多少 token,越高一般输出越快。
- Cost per Task:完成一次完整任务的成本。这个指标很关键,因为 token 便宜不等于完成任务便宜——一个模型每百万 token 很便宜,但为了做完一个复杂 Agent 任务要反复推理、调工具、生成大量 token,实际成本未必低。它比单纯比 token 单价更接近真实使用。
LiveBench:专门对付“Benchmark 做熟了”
传统 Benchmark 有个越来越严重的问题:模型可能已经见过测试题,也就是 Benchmark 污染(contamination)。如果测试题在训练数据里出现过,模型答对就不一定代表它真的具备对应的推理能力。
LiveBench 的做法是持续更新测试数据——大致每次更新替换约六分之一的题目,约半年整体轮换一遍,新题还会先压一个月再公开,尽量降低“提前见过答案”的可能。它覆盖推理、编程、Agent 编程、数学、数据分析、语言、指令遵循等多个类别,是一个综合测试体系而不是单项考试,到 2026 年仍在维护。
它值得关注,是因为体现了一个趋势:Benchmark 本身也要不断升级。以前大家问“模型有没有拿到高分”,现在还得问“这个分数可信吗”,抗污染、动态更新、真实任务因此越来越重要。
SWE-bench:AI 编程到底有多强
关注 Claude Code、Codex、Gemini CLI 这类 AI Coding Agent,SWE-bench 基本绕不开。SWE 是 Software Engineering。
它不让模型写一个简单函数,而是给一个真实软件项目里的 Issue 让它改代码:给 AI 一个真实 GitHub 项目的 bug,让它自己定位问题、改代码、跑测试。这比“写一个快速排序函数”接近真实开发得多。
核心指标是 Resolved %,即成功解决的任务比例,比如 70% 可以粗略理解成测试任务里大约七成最终被解决。但 SWE-bench 不是一个固定数字,看到分数还要追问:用哪个版本、哪个数据集、是否允许工具、是否用 Agent、什么 scaffold、有没有人工干预、测试环境是什么。同一个模型换个 scaffold,分数摆动十几个百分点很常见。
SWE-bench Verified 与 Pro:先问“是哪一个”
随着 AI Coding Agent 发展,老 SWE-bench 的区分度和可靠性受到质疑。SWE-bench Verified 是 OpenAI 2024 年从原数据集里人工筛出的 500 题子集,曾经是 AI Coding 模型很重要的成绩单,但现在也不能简单当成“AI 编程能力总分”——后续审查发现其中一部分任务本身有缺陷,比如测试用例过严、或与 Issue 描述对不上。
于是又出现了更强调真实工程复杂度的 SWE-bench Pro(Scale AI,2025 年):1800 多个任务、40 多个专业仓库,专门针对数据污染和任务过于简单的问题,用私有和商用仓库来防止训练集泄漏。
所以以后看到“某模型 SWE-bench 80%”,第一反应不该是比数字,而是先问一句:是哪一个 SWE-bench? 这是理解 Benchmark 最重要的习惯之一。
Terminal-Bench:从“写代码”走向“操作电脑”
如果 SWE-bench 像“修一个真实软件项目”,那 Terminal-Bench 更像“给 AI 一个终端,让它自己做完一项复杂任务”,涉及 shell、文件操作、Git、装软件、配环境、debug、多步命令。它很适合测 Claude Code、Codex、Gemini CLI 这类 Agent,目前已经更新到第二代,收窄成约 90 项高难度任务。
这也说明一个趋势:AI Coding Benchmark 正在从“代码生成”转向“软件工程 Agent”。
GPQA:专家级科学问题
GPQA 全称 Graduate-Level Google-Proof Q&A,可以理解成“研究生级、难以靠简单搜索解决的问答”,主要覆盖物理、化学、生物,发布材料里常引用的是更难的 GPQA Diamond 子集。它测的不是事实记忆,而是高难度科学推理。
GPQA 分数高,通常说明模型在高难度科学知识和推理上表现不错,但不能进一步推成“GPQA 第一 = 综合能力第一”,它毕竟是专项测试。
HLE:Humanity’s Last Exam
HLE 全称 Humanity’s Last Exam,“人类最后的考试”。名字本身就说明定位:尽量测当前 AI 很难答对的知识与推理,覆盖大量专业领域,题目难度很高,常用来观察前沿模型(frontier model)在极高难度任务上的能力。
比较 HLE 成绩时要特别注意测试条件。它刚出时(2025 年初)顶级模型只有个位数正确率,之后开放工具调用和 reasoning,分数迅速涨到几十个百分点,所以一定要看清楚是否允许联网和工具。另外,A 45%、B 40% 也不能直接说成“A 强 12.5%”,Benchmark 分数通常不能这么线性解读。
AIME:数学推理
AIME 全称 American Invitational Mathematics Examination(美国数学邀请赛),是经典的数学竞赛,常用来测 AI 的数学推理。Reasoning Model 普及后,发布材料里经常出现 “AIME 2025:XX%”“AIME 2026:XX%”。
它对判断“数学推理有没有明显进步”很有价值,但要注意 AIME 正在饱和——不少顶级推理模型在 AIME 2025 上已经接近满分,区分度主要来自最新一届考题、或“不许用工具和代码”的严格条件。如果你关心的是 Coding、写作或 Agent,AIME 不是核心指标。
MATH:大规模数学推理
MATH 通常指 Mathematics Aptitude Test of Heuristics(Hendrycks 等人的数据集),包含大量不同难度的数学题,常见的还有它的子集 MATH-500。看到 “MATH 95%” 先理解成“模型数学解题能力很强”,而不是“综合能力 95 分”。需要说明的是,MATH 对当代前沿模型基本已经做满,新发布里它的信息量不大,更多是作为基线出现。
MMLU:综合知识考试
MMLU 全称 Massive Multitask Language Understanding(大规模多任务语言理解),覆盖数学、物理、历史、法律、医学、经济、计算机等大量学科,像一场 AI 的综合知识考试,所以早期模型发布特别爱引用它。
问题是它已经饱和:顶级模型普遍在 88% 以上,最强的到 92% 左右,90% 和 92% 之间已经没多少信息量。所以现在更常见的是更难、更强调推理的 MMLU-Pro,两个都给的话优先看 MMLU-Pro。
IFEval:模型到底听不听话
IFEval 全称 Instruction Following Evaluation(指令遵循评测),测的不是“答案知识上对不对”,而是“有没有严格按用户要求执行”。比如写 5 个句子、每句必须含某个词、不许出现某个词、用指定格式——模型知道答案,但没遵守格式要求一样失分。这类指标对 AI Agent 和自动化工作流尤其重要。
MMMU:多模态能力
MMMU 全称 Massive Multi-discipline Multimodal Understanding(大规模跨学科多模态理解),让模型处理图片、图表、数学图形、医学影像、工程图、专业材料以及图文混合内容再回答问题,也有更难的 MMMU-Pro。某模型 MMMU 提升,通常意味着它在视觉理解、专业知识、推理的结合上有进步,对越来越多的多模态模型是重要指标。
想看开源模型排名怎么办
以前这一栏的标准答案是 Hugging Face Open LLM Leaderboard:用统一的测试条件(IFEval、BBH、MATH、GPQA、MuSR、MMLU-Pro)跑开放权重模型,回答“这个开源模型在统一条件下表现如何”。
但它已经在 2025 年 3 月正式关停,累计测过一万三千多个模型。官方给的理由是 Benchmark 饱和、持续评测的算力成本太高,以及整个领域转向人类偏好和 Agent 评测。原榜单被冻结存档,不再收新模型。
现在看开源模型,更实际的做法是直接用综合平台的筛选功能:LMArena、Artificial Analysis、LiveBench 都同时收录开放权重和闭源模型,可以按“是否开源”过滤对比;Hugging Face 上也还有很多社区维护的细分领域榜单。开源和闭源已经不再是两张分开的成绩单。
这些指标到底怎么读
假设看到 Model A:GPQA 90% / AIME 95% / SWE-bench 80% / Arena 1450。这些数字不能直接放一起比,因为它们根本不是同一种东西。
| 指标 | 本质 |
|---|---|
| Accuracy | 正确率 |
| Win Rate | 胜率 |
| Elo / Rating | 对战排名分数 |
| Resolved % | 成功解决任务比例 |
| Pass@1 | 一次尝试成功概率 |
| Pass@k | k 次尝试中至少成功一次 |
| TTFT | 首 Token 等待时间 |
| Tokens/sec | 输出速度 |
| Cost / Task | 完成任务成本 |
逐个说:
- Accuracy(正确率):答对题数 ÷ 总题数,最直观。100 道对 90 道就是 90%。
- Win Rate(胜率):主要用于对战,A 和 B 大量比较后 A 赢 60%,理解成“这些比较里 A 更受偏好”,具体算法因平台而异。
- Elo / Rating:用于 Arena 类对战系统,不是百分制。A 1450、B 1400 不能说成“A 的能力是 B 的 1.036 倍”,它只表示相对竞争力。
- Pass@1:常用于代码生成,只给一次机会的成功概率。Pass@1 = 70% 就是一次生成成功的比例约七成。
- Pass@k:给 k 次机会,只要有一次成功就算成功,所以 Pass@10 通常明显高于 Pass@1;比较模型时必须确认是同一个 k。
- Resolved %:用于 SWE-bench 这类真实工程任务,看任务最后有没有真的解决(跑通测试),比判断代码“看起来对不对”严格得多。
- TTFT(Time To First Token):从请求发出到吐第一个 token 的等待时间,对聊天产品尤其重要。
- Tokens / Second:每秒输出多少 token,越高生成越快——但速度和智能是两个指标。
最常见的误读:把“单项第一”当成“综合第一”
这是理解 Benchmark 最关键的一关。
“某模型 GPQA 全球第一”,正确理解是它在 GPQA 这套高难度科学测试里表现很好,而不是“全球最强 AI”。“某模型 SWE-bench 全球第一”,正确理解是它在特定软件工程任务测试里很强,而不是写作、数学、对话、多模态全部第一。“某模型 Arena 第一”,正确理解是真人盲测中它拿到了很高的人类偏好,而不是所有专业能力都第一。
为什么 Benchmark 排名越来越不能等同于实际能力
先澄清:不是 Benchmark 没用了,而是排名越来越不能直接等同于模型的实际能力。原因主要有五个。
- 模型可能见过测试题。 测试题进了训练数据,结果就会被高估,这就是 contamination。
- Prompt 会影响结果。 同一个模型,普通 Prompt 和精心设计的 Prompt + reasoning,成绩可能差很多。
- Agent scaffold 会影响结果。 模型自己做任务,和“模型 + Search + Python + Terminal + Agent 框架”一起做任务,已经不是同一个测试条件。所以现在越来越应该看 Model + Tools + Scaffold 的整体,而不是只看 Model。
- Reasoning 预算会影响结果。 Reasoning Model 不是“一次回答”,它可能花更多 token 思考,给多少推理预算本身就影响成绩。
- Benchmark 会饱和。 如果顶级模型都到了 90%+,从 91% 到 92% 未必对应体验上的明显变化,这就是天花板效应(ceiling effect)。
那现在应该怎么看一个模型
我更推荐一个简单的顺序。
- 先看真实体验。 它到底能不能把事做好——能不能完成真实 Coding 任务、能不能处理复杂 PDF、能不能看懂图片、能不能连续跑 Agent 任务、会不会自己纠错、是否经常要人接管。
- 再看 Arena(LMArena)。 真人实际更喜欢它吗。
- 然后看综合测试(Artificial Analysis / LiveBench)。 它是不是在多个能力方向都变强。
- 最后按用途看专项。 关心 Coding 看 SWE-bench / Terminal-Bench,关心数学看 AIME / MATH,关心科学推理看 GPQA / HLE,关心多模态看 MMMU,关心指令遵循看 IFEval。
附:Benchmark 速查表
以后看到模型新闻,可以直接查这张表。
| 看到的指标 | 英文全称 | 它主要测什么 |
|---|---|---|
| GPQA | Graduate-Level Google-Proof Q&A | 专家级科学推理 |
| HLE | Humanity’s Last Exam | 极高难度综合知识与推理 |
| AIME | American Invitational Mathematics Examination | 数学竞赛推理 |
| MATH | Mathematics Aptitude Test of Heuristics | 数学推理 |
| MMLU | Massive Multitask Language Understanding | 综合知识 |
| MMLU-Pro | Massive Multitask Language Understanding – Professional | 更高难度综合知识与推理 |
| IFEval | Instruction Following Evaluation | 指令遵循 |
| MMMU | Massive Multi-discipline Multimodal Understanding | 多模态理解 |
| SWE-bench | Software Engineering Benchmark | 软件工程 / Coding Agent |
| SWE-bench Pro | Software Engineering Benchmark Pro | 更复杂的软件工程任务 |
| Terminal-Bench | Terminal Benchmark | 终端操作与 Agent |
| LiveBench | Live Benchmark | 动态更新的综合能力测试 |
| Arena | —— | 真人盲测偏好 |
| Elo / Rating | —— | 模型相对竞争力 |
| Accuracy | —— | 正确率 |
| Win Rate | —— | 胜率 / 偏好率 |
| Pass@1 | —— | 一次尝试成功率 |
| Pass@k | —— | k 次尝试至少成功一次 |
| TTFT | Time To First Token | 首 Token 延迟 |
| Tokens/sec | Tokens per Second | 输出速度 |
| Cost / Task | Cost per Task | 完成任务的实际成本 |
最后
如果不想记这么多,可以浓缩成一句:Arena 看“人喜欢谁”,Artificial Analysis 看“谁强、谁快、谁便宜”,LiveBench 看“综合能力经不经得起新题”,SWE-bench / Terminal-Bench 看“Coding Agent 能不能真正干活”,GPQA / HLE 看“高难度推理”,AIME / MATH 看“数学”,MMMU 看“多模态”。
看到任何一个 Benchmark 分数,先问“它测的是什么”,再问“这个测试条件和我的真实场景像不像”,最后才看“谁第一”。
Benchmark 没有失去价值,只是从过去的“成绩单”,逐渐变成了今天的“仪表盘”。
关于
关注我获取更多资讯