跳到主要内容
AI 能力图谱

评测基准

Benchmark · 基础概念

入门基础概念数据更新于 2026 年 9 月 29 日

它是什么

用一套固定题目和标准判分给模型打分,榜单上的名次和各家的宣传口径都是由它算出来的。

为什么重要

新品发布、选购决策、课程里的能力介绍都靠它传话。不懂基准,就会把「某一项第一」直接当成「什么场景都最强」,这是被营销话术带偏最常见的方式。

打个比方

像体检报告里的单项化验:某项指标排在前面,说明这一项状况好,但不能据此判断整个人健康。

举个例子

看到某个模型在某张榜单上领先,先去查这套题考的是什么、题目有多少、能不能公开复现,再对照手上的活儿属于哪一类:如果只是改写班级通知,代码榜的名次和你没什么关系。

常见误解

  • 误解:榜单第一就是全面最强。 事实:基准只覆盖有限的题型和领域,长文本、多模态或中文场景的表现常与总分排名不一致。

  • 误解:分数高就一定能照搬到自己的活儿上。 事实:测试题和你的实际材料往往差得很远,换一类任务表现可能明显变化。

  • 误解:小数点后一位的领先也有意义。 事实:不同基准的样本量、判分方式和更新频率都不同,差距很小时通常说明不了问题。

  • 误解:只看官方公布的那个数字就够了。 事实:还要看有没有第三方复现、题目是否公开、评测方与厂商之间有没有利益关系。

延伸阅读(相关概念)

本页内容更新于 2026 年 9 月 29 日。概念条目会随模型能力变化而修订。