产业与竞争信任与治理

谁在改尺子:AI 榜单的两重张力

平时搭应用或者调 API 选模型的时候,很多开发者都会参考公开的评测榜单。这些榜单把各种代码、数学和问答测试浓缩成一个综合分数,排出一份先后名次。我之前做技术选型也是这样:看谁排在第一,就优先把谁选进架构方案。找一把现成的尺子照着挑,省时省力,大家也自然觉得分数最高的模型就是最强的。

但最近发生的一件事,打破了这种省心的习惯。OpenAI 发布了新一代旗舰模型 GPT-6 Astra,一家做榜单的机构随即公布了评分。在新模型发布后的一周内,这家机构把自己的评分规则改了两次,让 Astra 的分数从落后一路变成并列第一,而模型本身没有任何变化。如果你平时也拿榜单做技术选型,就得知道这些排名究竟是怎么来的。排名会变,未必是模型变了,也可能只是量模型的那把尺子动了。

一周两改:Astra 发布后,尺子比模型动得还快

2026 年 9 月 3 日,OpenAI 正式发布 GPT-6 Astra。在发布会结尾,公司总裁 Greg Brockman 宣称这标志着 AGI 时代的开始,并提出探讨 Astra 是否已构成通用人工智能(Trending Topics)。各方普遍期待这款旗舰模型在公开基准上拉开身位。发布当天,商业评测机构 Artificial Analysis 运营的综合指数 Intelligence Index 处于 v4.1.1 版本,公布的成绩随即引发关注:Astra 仅获 61 分。这个成绩不仅与上一代 GPT-5.6 Sol 持平,还明显落后于 Anthropic 旗下的 Claude Fable 5.1(66 分),甚至低于 Meta 的 Muse Spark 1.3(max)(TechTimes)。

发布次日,即 2026 年 9 月 4 日,Artificial Analysis 随即上线 Intelligence Index v4.2。这版更新新增了聚焦智能体知识工作的 AA-Briefcase,以及来自数据服务商 Surge、由 4,592 页长文本构成的文档推理基准 GDP.pdf;并直接剔除了前沿模型普遍接近满分的 GPQA Diamond。更核心的变化在于权重重构:不向厂商公开的私有保留测试集权重从 20% 提升到 40%。新规则让原本领先 5 分的 Claude Fable 5.1 降至 57 分,Astra 分数变为 55 分,双方分差收窄到 2 分(AA v4.2 更新公告)。

改动未在此止步。三天后的 2026 年 9 月 7 日,Artificial Analysis 再次发布 v4.3。在这版修订中,终端编程测试 Terminal-Bench 从 v2.1 升级到 v4.0;原有的银行客服测试 τ³-Banking 替换为与流程自动化服务商 Zapier 合作构建的 AutomationBench-AA,测试涵盖财务、人力、营销、运营、销售和技术支持等场景的 657 个任务,全量采用私有隐藏数据;私有保留测试集的综合权重进一步提高到 45%。计分随之刷新:Astra(max)与 Claude Fable 5.1(max with fallback)双双定格在 53 分,并列全球榜首。

四天内,两款模型的分数经历 66:61、57:55,最终定格在 53:53。这七天里,两家实验室都没有发布新的模型版本。面对质疑,Artificial Analysis 官方给出了三项依据:提前上线原定 v5 规划的评测要素、前沿模型演进过快导致无法等待原定周期,以及引入更高比例私有试题以遏制刷榜。

这些理由在逻辑上各有依据,但在实际效果上,尺度调整的速度明显快于受测模型本身的演进。一周内两次改则,让处于劣势的新模型在零更新下抹平分差并列第一。对于依赖榜单选型的团队,综合分数的波动往往先于模型能力的实际变化。

同一款模型在一周内经历两次评分规则调整,分差从 66:61 收窄到 53:53,变化全部发生在尺子上

榜单是一门生意:谁测量、谁付钱、谁评判

理解尺度的剧烈晃动,需要正视评测背后的商业驱动。公开 AI 榜单具备清晰的现金流、客户关系与增长诉求,本身是一门商业生意。生态中包含三方核心角色:作为受测对象的模型厂商、充当测量者的独立评测机构,以及由技术决策者与工程师构成的受众群体。

这种商业模式对所谓的绝对中立构成了制度性约束。以 Artificial Analysis 为例,其面向专业用户的 Pro 订阅每月每席位定价 417 美元;面向大型企业则销售包含专用 API、全量数据导出、定制报告与咨询服务的 Enterprise 方案(Artificial Analysis 定价页面)。在机构的对外展示中,亚马逊、谷歌、Meta 与微软的背书和公开引用,作为核心商业资产陈列在官网首页。

这种机制在金融领域早有先例。2008 年次贷危机后,学者与监管机构复盘穆迪和标准普尔时指出,债券发行方付费模式存在先天缺陷:收益若依赖受评对象,客观尺度就会承受客户流失的压力。大模型评测同样存在这种张力。评测机构销售高额席位需要大厂背书与引用,大厂展示记分卡也需要榜单影响力。若名次长期偏离大厂预期、把新旗舰排入二流,厂商就会转向对手。受测厂商的采纳程度,直接决定了评测方的生存空间。

双方在 v4.3 并列 53 分的结果,清晰折射出这种平衡。表面上 Astra 与 Fable 5.1 共享榜首,细分数据却指向截然不同的工程取向。Fable 5.1 在知识工作基准 AA-Briefcase 与科学编程测试 SciCode 保持优势;Astra 则在终端环境 Terminal-Bench v4.0 跑出 59.1% 对 52.0% 的领先,并在与 Zapier 合作的企业流程自动化测试 AutomationBench-AA 拿下 68.5% 的全场最高分。

工程落地的经济成本差异更为悬殊。跑完同套基准,Astra 平均单任务成本约 3.26 美元,累计消耗约 6,000 万输出 token;Fable 5.1 平均单任务成本达 7.63 美元,整套评测累计消耗约 1.9 亿输出 token,调用开销与 token 消耗都在两倍以上。商业综合指数把这些决定场景选型的关键维度,直接折叠进并列的 53 分。加权复合分记录的是平衡各方诉求的结果,无法单凭一个数字反映真实的工程特质。

张力一:它必须像体感,又不能只是体感

外部商业利益只是诱因之一,评测产品内部更难调和的冲突深植于测量逻辑本身。榜单的核心价值,本就在于提供偏离大众日常经验的测量残差;可是榜单自身的公信力,又完全依赖这套日常经验来背书。

开发者对模型的日常使用直觉即体感。若排行榜排名与日常体感完全一致,榜单就只是昂贵的共识复述,毫无增量。评测的价值正在于违背直觉的有效残差:通过系统化测试,揭示零散试用无法察觉的隐蔽短板或极限能力。

评价者悖论由此产生:大众衡量尺子是否客观的唯一锚点,偏偏又是主观体感。一旦残差超出心理承受底线(如将公认旗舰排在老旧模型之后),人们本能地会断定尺子失真。区分有效残差与测量噪声的标准,在于时间维度的预测力:优质残差在未来数月的工程实践中会获得证实并沉淀为新共识;低劣残差在落地中只会暴露出测量本身的缺陷。

围绕 Artificial Analysis 指数方法论的公开讨论,暴露了测量噪声的具体来源。在 v4.1.1 的权重设计中,智能体能力占 34%(GDPval-AA v2 占 20%、τ³-Banking 占 14%),代码能力占 24%(Terminal-Bench v2.1 占 16%、SciCode 占 8%),剩余份额分摊给 AA-LCR、AA-Omniscience、Humanity’s Last Exam、GPQA Diamond 和 CritPt(Artificial Analysis 方法论)。评测方声称整体指数具备严密的统计精度,95% 置信区间小于 ±1%(Artificial Analysis 评测说明)。

知乎答主某科学的仙人仉分析指出,该榜单约 76% 权重存在测量缺陷(知乎讨论)。占 20% 权重的 GDPval-AA v2 所基于的原版基准采用行业专家盲评,AA 改为大模型成对裁决与 Elo 积分,引入了打分漂移;占 16% 权重的 Terminal-Bench v2.1 版本过旧,直到后续 4.0 才修复验证器并删除故障题;占 14% 权重的 τ³-Banking 依赖轻量模型 GPT-5.4-mini 兼任用户和裁判,据该答主转述,官方报告称仅修正脚本误判便能让同轨迹得分上涨约 9 个百分点;占 12% 权重的 AA-Omniscience 存在漏洞,模型面对生僻难题全量拒答即可利用不扣分规则刷出无幻觉满分;占 8% 权重的 SciCode 中约 54% 计分子问题受到会压低正确模型得分的缺陷影响;占 6% 权重的 AA-LCR 标准答案畸形,且自动裁判未完整读取 10 万 token 源文档。

知乎答主 imnoob142536 也列举了具体的排名倒挂:Claude 4.6 Sonnet 分数超过同代旗舰 Opus,Meta 的 Muse Spark 1.3 顶配版排在 Astra 之上。此外,高难度测试 Humanity’s Last Exam 约半数题目的参考答案存在争议,却占据 12% 的权重;整套指数约 50% 的分值与智能体工具执行直接绑定,容易因偶发的环境交互失误放大整体波动。

针对拒答拿分的质疑,Hacker News 用户 jascha_eng 在社区讨论中表达了不同看法:按其使用体感,AA-Omniscience 与真实环境中的有用性高度相关,计分规则旨在奖励正确回答并重罚虚构幻觉,因而对拒绝作答免予惩罚(Hacker News 讨论)。这项鼓励审慎回答的机制在落地时演变为刷分途径,模型依靠消极拒答就能规避失分。

除评分外,驱动模型的运行底座同样左右着得分。运行底座指代接收输入、调度工具、维持状态并解析输出的执行环境。在抽象推理基准 ARC-AGI-3 中,官方中立底座下 Astra 取得 62.7% 通过率,消耗 26,098 美元;在 OpenAI 专属适配器底座下,因允许跨请求保留不透明推理状态,相同 Astra 权重面对同批考题,成绩跃升至 99.9%,成本降至 18,817 美元(OrbilontechFinance Biggo)。

与此同时,非营利机构 Epoch AI 在汇总 50 多个基准、覆盖 267 个模型的评估中,把 Astra 列为全球第一,综合得分 169 分(The DecoderEpoch AI 方法论)。同一款模型在不同底座跑出 62.7% 与 99.9%,在不同机构排位迥异。这种落差清楚表明,榜单偏离直觉时,可能反映深入测试的洞察,也可能只反映了执行底座与验证脚本的偏差。

张力二:它必须成为攻关目标,又不能被刷透

测量体系除了受制于内部复杂性,还要迎接外部受测对象的定向应试。第二重张力由此显现:榜单必须具备行业声量以吸引顶级厂商调优适配,可厂商一旦把研发重心转向针对性刷榜,整套指标就会迅速失去度量效能。这种衰减符合古德哈特定律:一项指标一旦变成攻坚目标,就不再是一项优良指标。

在大模型研发中,指标失效呈现三级递进。起初是语料污染,公开试题渗入预训练库,模型答对仅是复现记忆,缺乏泛化推理能力;随后是定向应试,团队针对榜单框架、模板与裁判偏好做强化学习对齐,模型在特定题型刷出高分,通用能力并未提升;最终是指标饱和,前沿模型逼近题库上限,头部在满分附近重叠,评测失去区分方差。Artificial Analysis 在 v4.2 剔除博士级问答 GPQA Diamond,正是因为前沿梯队普遍接近满分,题库失去了测量分辨率(AA v4.2 更新公告)。

2026 年 7 月 31 日发布的 deepseek-v4-flash 成为定向冲榜的典型案例。硬件与架构上,该模型完全保留 284B 混合专家总参数量、13B 激活参数量的原始设计,团队仅重新执行了后训练(Kie.ai)。官方技术图表称,重新对齐后的 V4 Flash 在 9 个主流智能体基准上全面超过更大参数的旗舰 V4-Pro-Preview,覆盖 DeepSWE、Terminal Bench、Cybergym、Toolathlon 及 DSBench 等指标。官方模型卡给出的对比更直观:同一套架构只重跑后训练之后,V4 Flash 在 DeepSWE 上从预览版的 7.3 分升到 54.4 分,在 Terminal Bench 2.1 上从 61.8 分升到 82.7 分,两项都反超了参数更大的 V4-Pro-Preview。

不过在独立评测机构 Artificial Analysis 的模型页上,V4 Flash 0731(max)的综合指数为 52 分,与体量小得多的 Qwen3.8 27B(xhigh)、以及 GPT-5.6 Luna(max)同分(发布时 AA 给出的还是 50 分)。发布时相比上一代 Flash,这是约 10 分的提升,但离真正的旗舰仍有距离。而这些涨幅无法被外界复现:外部技术分析深入官方披露的数据后发现,在其重点展示的九项基准中,有两项属于未开源的私有题库;所有测试依赖的执行底座均未开放源码;官方汇报表中仅附有一列缺乏细节的配置说明(Medium 专栏分析)。

这种纸面成绩与日常工程体验形成了鲜明对比:该模型在常规写代码与长指令遵循中,表现并未与旧版拉开实质差距。针对评测指标的定向调优能让纸面分数在短期内走高,但在针对性的后训练攻防下,固定的静态题库往往在发布数月后便退化为缺乏参考价值的展示数据。

公开题库在厂商定向应试下走向指标饱和,分数上涨的同时度量能力衰减

一把好尺子该怎么造

看清了榜单里的商业妥协和刷分套路,如果让我来设计一套给同行用的评测体系,整套逻辑就得从前面那些具体的坑里推出来。最先要解决的,就是题库被厂商背透的问题。GPQA Diamond 这类高难度题库被前沿模型普遍刷满后只能直接删除,说明任何公开考题只要挂在网上,迟早会被抓去作为训练语料。杜绝这种应试记忆,题库就必须采用厂商看不到、无法提前准备的私有保留测试集。Artificial Analysis 在 v4.2 把私有集权重提到 40%,并在 v4.3 进一步提高到 45%,正是为了堵住这个漏洞。光保密还不够,考题只要在实际测试中被反复调用,答案终究会慢慢外泄。一旦某组考题在各个模型的输出里突然整齐划一地收敛,就得果断作废,按固定节奏持续补入全新的原创试题。

光有隐蔽的考题,如果只对比最终输出了哪行文字,依然挡不住定向猜测和输出格式微调。更麻烦的是执行底座带来的巨大偏差:ARC-AGI-3 换上 OpenAI 的专属底座,成绩能从中立底座的 62.7% 飙升到 99.9%,足足差了 37.2 个百分点;DeepSeek 也曾用外界无法复现的专有底座跑出虚高跑分。如果评测所用的脚本和环境不公开,分数的高低就根本分不清是模型更聪明还是底座在帮忙。因此,评测必须把模型放进完全开源、透明的交互环境,测试完整的多步操作轨迹。评测重点必须放在模型调用工具的先后顺序、给出的参数是否准确、执行报错后能不能自己纠正,以及最终是否在系统里真正达成了目标。AutomationBench-AA 与 Zapier 合作构建的 657 个跨部门任务流就是这种思路,它不纠结模型吐出了什么漂亮的短句,只在沙盒里验证它能不能把真实的财务报销或客服工单处理到底。

即便测出了丰富的数据,许多榜单为了迎合大众排名和商业订阅,习惯把所有维度的表现强行揉成一个总分。这种做法抹平了模型最关键的工程特质。在 Intelligence Index v4.3 里双双拿到 53 分并列第一的 Astra 与 Claude Fable 5.1,在实际业务中的特长完全相反。Astra 擅长终端操作与流程执行,在 Terminal-Bench v4.0 跑出 59.1% 对 52.0% 的领先,在自动化基准 AutomationBench-AA 更是拿到 68.5% 的全场最高分;更关键的是跑完测试平均单任务只要 3.26 美元,整套评测消耗约 6,000 万输出 token。Fable 5.1 的优势则集中在长时程知识工作 AA-Briefcase 和科学编程 SciCode 上,但平均单任务花费高达 7.63 美元,整套评测消耗约 1.9 亿输出 token,成本与资源开销都在两倍以上。做系统设计的工程师需要根据场景挑选合适工具,评测就必须老老实实输出包含各项细分能力与成本开销的多维画像,放弃那个把所有特质强行揉成单一总分的复合标量。

除了打分方式,规则什么时候改同样决定了尺子的公信力。Artificial Analysis 在 Astra 发布后短短一周内连续改了两次规则,让原本落后的新旗舰在没有任何更新的情况下变成并列榜首。这种因厂商发版而随时调整的做法,不可避免地让人怀疑背后的商业动机。好尺子的规则必须走方案预注册路线:把测试集的入选门槛、各分项的打分规则以及版本更新的时间表提前定死、公开发布,然后严格按照固定的时间节律更新。不管厂商今天发布了多么重量级的新模型、哪怕新旗舰在现有考卷上意外爆冷,评测方也不该临时调高某些子项的权重,更不能中途突击换题。让规则的更新周期与大厂的发布会彻底解绑,才能切断外界对利益倾斜的合理疑虑。

要做到这一点,评测机构自身的资金来源必须足够独立,同时在统计处理上实事求是。如果一家商业评测的主要收入依赖高额企业订阅,官网首页摆满大厂的背书与引用,它在面对客户流失的压力时就很难守住中立。非营利研究机构 Epoch AI 展现了另一种可能。他们的资金主要来自赠款和捐赠,不靠向受测厂商收费;在统计方法上引入了项目反应理论:根据不同基准的难度和模型在基准上的表现来建立数学模型,把横跨多年、难度各异的 50 多个基准统一折算到同一把能力标尺上,并且给每个得分都标出带误差范围的置信区间条(Epoch AI 方法论)。这明确告诉读者,哪怕两个模型在榜单上有两分的分差,也不能仅凭误差条是否重合判断差异是否具有统计显著性,不该简单断定谁超越了谁。

即便个别机构做得足够规范,整个行业也不该只依赖单一度量源头。商业闭源的基准、学术开源的测试集以及开发团队自建的业务评测,需要共同构成多元制衡的生态。Astra 在商业机构给出的综合榜单里初评只有 61 分,在 Epoch AI 的学术评估中却拿到 169 分位列第一,正说明单一评测机构总有自己的视角局限甚至盲区。只有多家资金独立、题库隔离的评测实体并行存在,各家的长处与短板才能在交叉对比中暴露出来,互相校准,让任何单一厂商都没法通过公关运作或单点刷题通吃整个市场。

最后,评测机构在给模型打分之余,必须给自己也立一份元记分卡。正如社区分析指出的那样,榜单里经常暗藏大量测量缺陷:有的测试集超过半数子题目受到评分缺陷影响,有的测试只要修复验证脚本误判就能让得分白白上涨 9 个百分点,还有的题目能靠全量拒答白捡满分。一套合格的尺子,必须定期向公众披露自身的质量审计报告,老老实实公布考卷破损的比例、验证脚本的误判率,以及担任裁判的模型自身打分尺度的漂移方差,也就是裁判手松手紧带来的打分波动。如果一家评测机构不敢公开这些自我体检数据,只顾着在大厂发布新品后动态修补综合名次,工程师若将其视为绝对真理去敲定生产技术路线,最终换来的只能是线上业务在真实流量下的频频崩溃,以及整个团队耗费数月推倒重来、重构系统的高昂代价。

作为 builder,怎么用一把刷分严重的尺子

看清了榜单背后的商业博弈和应试套路,我自己做选型,第一步依然会打开排行榜,只是用法和过去不同。市场上每个月冒出几十个新模型,没人有精力逐一测试,公开榜单最大的用途就是作为粗筛漏斗,帮团队在几分钟内剔除明显掉队的选项,把上百个候选缩小到两三个目标。但粗筛之后,综合总分对敲定架构没有实际参考意义。那个总分是给市场做宣传用的,把各家完全不同的特长强行捏在了一起;工程落地只看解决具体业务痛点的单一特征。如果业务要做自动化运维脚本,直接去看 Terminal-Bench v4.0 的细分子项排位;要做长篇合同阅读或者合规审计,重点核对 GDP.pdf 这类长上下文基准下的错误率;要搭企业内部的跨工具智能体,就去评估类似 AutomationBench-AA 的流程完成度。脱离实际业务场景去争论两三分的综合差距,对写代码没有任何帮助。

在细分子项里挑出候选之后,下一步就是翻看官方文档里的评测底座与运行配置。评测底座就是跑测试给模型配的整套执行环境和调用脚本。底座不同,测出来的成绩天差地别。在逻辑推理测试 ARC-AGI-3 里,Astra 在官方中立底座下得分是 62.7%,换上 OpenAI 自己保留私有状态的专属底座,分数直接跳到了 99.9%。如果团队的生产系统给不了那种定制提示词、多轮反思重试或者专有状态接口,榜单上的高分搬进自己的代码里就会落空。核对这些细分测试,更该看重的是那些考察多轮动态交互的过程指标。让模型在沙盒里连续调用工具、处理系统报错、一步步调整参数完成任务,这种动态执行考验的是综合交互能力,厂商很难靠简单的微调刷分。相反,那种单轮的选择题、标准问答或者短文本输出,往往经过几轮定向数据训练就能快速抬高分数,参考价值有限。

评估进入候选池的模型,比起某个固定切片上的绝对分数,更应该关注模型在版本演进中的变化速度。数学上把这种提升斜率称为一阶变化率,放在实际选型里,看的就是模型面对新任务能不能持续快步往上走。一个更新节奏紧凑、每次迭代都有扎实进展的模型架构,即便眼下在某个旧考卷上落后两分,其演进潜力也往往胜过那些靠着针对老题库反复微调来维持分数的成熟模型。

选定候选之后,真正的防线其实在自己的工程架构里。业务系统避免直接绑定任何一家厂商的私有接口,可以在业务代码和底层模型之间架起一层统一的适配代码,也就是通常所说的抽象层。把提示词拼接、上下文管理和工具调度的逻辑全部留在自己的系统内部,对底层模型只保留最通用的调用契约。这种让业务逻辑和具体模型相互独立的设计叫作解耦,把模型降级为可以随时插拔替换的算力组件。架构解耦之后,线上验证就轻松了,团队可以在生产集群里切出 2% 的真实流量导入新模型,也就是先做小范围的灰度测试。在真实业务流量下跑上几个小时,转化率、响应延迟和花费账单都有现成的数据记录;一旦指标不及预期,后台修改一行配置就能立刻切回原方案。

大学排名对应一次性、不可逆、难验证的决策,模型选型对应高频、可测、可替换的工程选择,后者应当自建评测

大学排名的类比很能说明这种认知差异。调一个模型接口,跟选一所读四年的大学完全不同。学生填报志愿要交高额学费、搬进宿舍读上几年,中途退学换校的代价极大,而且入学前很难亲自验证真实的教学质量,大家只能依赖外界排名寻求确定感。高校管理层也摸透了这种心理,专门针对国际生比例或者论文引用量做指标优化。

工程里的模型选型则具备完全相反的特征。每次接口调用都伴随着毫秒级的响应延迟、细化到微元的计费账单以及清楚的报错调用栈。工程师手里握着完整的测量工具,完全可以拿着业务历史数据跑一遍离线测试,或者在集群里切 2% 流量观察真实表现。要是新模型响应超时、格式出错或者成本超标,改一行配置文件几秒钟就能切回旧版本。

把针对不可逆、高代价选择所形成的大学排名心理,照搬到随时可测、随时可换的软件系统里,就忽略了工程本身自带的灵活性。在本地环境里建立贴合业务的测试用例,让模型保持随用随换的算力消耗品定位,外部榜单哪怕几天换一次计分规则,也不会打乱线上业务的研发节奏。

鸭哥每日手记

日更的深度AI新闻和分析