AI Agent科研与技术前沿

AI 研究代理挑中了最好的实验配置,却猜不准剩下的每一种

目前对自主AI研究代理的评测,大多集中在最终得分或能否选中最优配置上。2026年9月23日,卡耐基梅隆大学和清华大学的团队在预印本论文WhatWorkedBench中提出了一种不同的思路。它不仅观察代理最终选择了哪些配置,更想知道代理是否理解它没有进行实验的那些实验会带来什么样的结果。在这个实验中,系统会给出十几种甚至几十种可能的实验组合,但代理只能选择其中有限的几种进行实验。在进行了这些实验后,代理需要预测出其他每种未做实验的组合会得多少分。令人意外的是,代理所展现出的实验直觉竟然不如六十年前的一个经典统计方法。选择最优配置和理解什么是有效的其实是两个不同的问题。代理失分的地方在于将数据和规则转化为判断的最后一公里。

一场只许做几个实验、却要求预测全部结果的考试

他们先搭了一个标准的考试场景。一段用NumPy、SciPy和scikit-learn写成的典型机器学习流水线,输入数据和随机种子都预先固定。代码里藏了4个或6个二元开关(论文中叫factor),每个开关是一个具体工程决策,比如要不要把词频二值化、要不要过滤停用词。4个开关就有16种运行组合,6个开关就是64种。流水线每次运行,会输出一个归一化到[0, 1]的分数。环境固定且无测量噪声,同一配置重复跑得到的结果一模一样。

考试规则大致是:代理一开始拿到两个免费锚点,一个是全关,一个是全开。然后给一笔预算,相当于还可以额外实测几次。4 开关的任务通常是 8 次,加上之前免费的 2 次,整个组合空间里一共只有 10 个配置有真实观测。在做决策的过程中,代理可以查看源码,也可以调用 Python 计算(30 CPU 秒,每任务限 20 次)。预算花完,需要提交一张完整的预测表,16 或 64 种组合里的每一种都要给出预测分数,包括它没测过的配置。

WhatWorkedBench 考试设计传导链:在固定代码与数据的基础设施上,研究代理仅用极小预算探索少量配置,随后提交覆盖全部未知格子的完整预测表,直接比对穷举预计算的真实表现。

难就难在开关的作用不是一成不变的。同一个开关在不同的组合里可能增加分数,也可能减少分数。比如在真实的科学文献检索任务 SciFact(5183 篇文档,64 个查询)里,当高频词压缩关闭时,打开词频二值化这个开关可以提升检索分数 0.160;但是在高频词压缩开启的情况下,打开同样的词频二值化开关,反而会降低检索分数 0.084。同一个开关带来正负两种截然不同的效果,交互量为 −0.245 论文 §1。这背后的机制在代码里是,二值计数会让压缩变换失效,导致两个分支排出来的顺序没有差别。

SciFact 检索任务中的开关效应反转:同一二值词频开关在未启用高频压缩时带来 +0.160 的指标增益,而在高频压缩开启后转为 −0.084 的净损失,交互量达到 −0.245。

这种开关效应反转不是罕见现象。整个基准的 36 个任务条件中,有 35 个出现了随背景反转的符号,其中 24 个的反转幅度超过任务总分差的 5% 论文附录 L.4。为了给推断提供客观真值,WhatWorkedBench 涵盖了 30 个数据源、8 类工作流(分类、回归、聚类、时序预测、图像修复、检索、心跳检测与图链路预测),一共 1248 个配置。作者预先穷举跑完了全部配置,单线程重放只需 128 秒(127.87 秒)论文 §4。

评测用效应还原度指标,衡量预测效应和真实效应的差距相对于真实效应本身的量级。推断越准得分越接近 1,如果平均误差超过了真实效应本身的幅度,得分直接归零。指标公式写成 R=max⁡(0,1−E/A)R = \max(0, 1 - E/A)。其中 EE 为全部条件效应(4 开关 32 条、6 开关 192 条)的平均绝对误差,AA 为真实效应平均幅度。打分时,代理测过的格子直接填入权威真值,纯粹考验未测推断的质量。相比只评端到端产出的 MLE-bench,评消融计划写得像不像专家的 AblationBench,以及效应靠统计模型估计的 CAFE,WhatWorkedBench 凭穷举真值,为实验理解力的评测提供了客观的标准答案。

这就是把 graduate student descent 拆开了

在算法工程界,我们经常会笑 graduate student descent,调侃调参对人类研究者的依赖。但这其实不是笑话。有经验的人类工程师,在面对一个全新问题时,往往不需要傻乎乎地跑几百组参数。他瞄一眼流水线代码,挑几个消融实验跑一下,瞥一眼终端输出,就对没跑过的组合有个大概的印象,然后凭实验直觉决定下一步怎么试。

WhatWorkedBench 把这种直觉拆解成三个可以分别评分的成分:选实验、做推断、读代码,三者彼此独立 论文 §1:

  1. 选实验:在预算有限时,代理是否能选出信息量最大的配置,用最少的测量拿到最多的系统知识?
  2. 做推断:拿到少量观测后,代理能否对没测的组合给出可靠数值预测?
  3. 读代码:给定可读的流水线源码,代理能否看出逻辑依赖和失效路径(比如某参数在某开关关闭时不起作用),并且把这个当硬约束用到预测里?
研究直觉的三成分成绩单:WhatWorkedBench 把直觉拆成选实验、做推断与读代码三项能力,发现代理的核心短板不在实验采样覆盖,而在推断逻辑与代码规则的落地。

以前端到端评测的最大问题是分不清责任:代理最终搞砸了,没法判断是实验挑错还是推断想偏。WhatWorkedBench 方法上最核心的贡献是同观测换估计器的对照协议。代理跑完探索后,评测框架把它实际买到的观测原样给三种标准估计器(主效应岭回归、交互岭回归、高斯过程)重拟合。此时估计器自己的采样策略关闭,输入和代理拿到的分毫不差。这就排除了前期探索的差异,剩下的是纯粹的推断比拼:大模型自己的实验直觉,比不比得过成熟的传统统计方法?

三个意外

选中最好的配置和说清每个开关的作用,是两个独立的能力。成对岭回归是一套按教科书流程办事的老派统计方法:自己按固定套路挑哪些组合去试,再把试到的结果拟成一个数学公式来推算没试过的组合。在 22 道题里,它挑中了 15 次全场最优(15/22)。但如果换成另一门考试,要求它整张预测表(对每一种组合的打分预测)都过关,合格的只有 3 次(3/22)论文 §6.1。预测表离标准答案的接近程度有个名字,叫还原分,满分 1 分,越高越准。好比指出哪道菜最好吃容易,说清每种做法的味道难。选型正确,不等于看懂了系统。这样的分离,带来了三个意外。

意外一:大模型的实验直觉,输给六十年前的高斯过程。 直觉上,一个聪明的大模型在看过实验数据之后,应该能凭借推理做很多事。但事实上,模型自己对同一批实验数据的预测表的还原分只有 0.632。而高斯过程(Gaussian process)是一个六十年前的统计方法,擅长给定几个观察点以后,推测所有其他点。同样的数据交给高斯过程,得分变成了 0.698 论文 §6.2。代理手里摆着现成的统计工具,交出的答卷反而更差。证据是好的,判断砸了。

意外二:看完代码,推断不仅没涨分,有时反而更差。 通常预期,让代理阅读完整源码能加深理解。实际测试显示,看不看代码,成绩几乎一样,看代码的那组有时分数反而更低。但代码里明明写着免费的等价结构线索:某个开关关掉后,挂在其下方的参数怎么调节都无效,两组看似不同的配置在实际运行中效果别无二致。把这条线索作为规则交给统计方法,推断还原分从 0.248 提高到 0.462 论文 §6.3,中途没有多跑实验。代理不会把读到的代码变成可用的知识。

意外三:背得出规则,却交不出一张合规的表。 通常预期,既然代理能准确理解代码里的规则,那交卷时也应该遵守这些规则。研究者先让八个代理复述代码里的约束规则,它们在文字上全答对了。但翻看它们交上来的预测表,却全都违反了自己刚说过的话。就像学生背得出定理,考场上做题却不会用。研究者事后做一次批量修复,把预测表里矛盾的格子强行改成相等数值。没有新增任何实验,平均还原分就从 0.338 涨到 0.507 论文附录 K.3。规则在语言层能复述,落到预测数据上却没有用起来。

为什么重要:给下一个瓶颈提前装仪表

我认为这个实验之所以有必要,是因为 AI 变得越来越厉害,我们给它的任务越来越困难。

以往交给机器的计算,大多可追溯。每一步都有清晰规则,出错能按步骤核验。现在交给研究代理的任务,大多不可追溯。它在巨大的组合空间里做探索,没有固定的路线。我们无法像查账一样逐步验证它的推理,只能看它拿出的方案好不好。这种在未知中权衡取舍的直觉,就是判断力。而判断力是不能逐步验证的,所以我们才需要一项考试来单独测量——这就是这门考试的价值所在:把判断力这个说不清的感觉变成有标准答案的分数。执行层的差距在缩小,判断层的差距在拉开,下一个瓶颈在这里。

收尾:把判断力放回清单

选出最好的配置,不等于懂了实验。现在的AI研究代理,关键短板仍在推断和规则落地的最后一公里。

看待这一结论需要留意现实边界:这项研究是未经同行评审的预印本,评测集中在单一模型族,因 API 路由变更按日期分层记录;代码已开源在GitHub(EthanNing/WhatWorkedBench,Apache-2.0协议)。

忽略这些阶段状态,这个研究留下了两笔可用的资产。

对 Agent 开发者与研究者:不必苛求大语言模型在上下文里徒手推算高维数据。更扎实的路径是为代理接入统计工具,同时引入代码静态分析,把代码里现成的结构规则转化成预测约束。大模型掌舵宏观构思,统计工具与代码规则守住微观推断。论文自己的修复实验验证过这条路:把代理违反的规则事后补回预测表,分数从 0.338 涨到 0.507,一次实验都没多跑。

对系统评测与基准设计者:固定代理看到的实际输入、换用不同打分方法重放的协议,可跨领域复用。评测代理系统时,把探索采样和后期判断拆开,能定位失误来源。

鸭哥每日手记

日更的深度AI新闻和分析