AI Agent信任与治理科研与技术前沿

模型在 AGI 基准 ARC-AGI-3 上拿到满分,出题人却说这不算数

把大语言模型放进完全陌生的二维小游戏里,既不给任何玩法规则,也不给通关目标。模型能做的,只有通过方向键移动和点击网格去摸索环境反馈,再自己推断出游戏背后的运行机制和获胜逻辑。这是交互式推理基准 ARC-AGI-3 设下的考场。在这套公认很有挑战性的测试里,前沿大模型此前通常只能拿到四成左右的分数。但麻省理工学院团队做了一套外围支撑系统 VISTA,直接在全部公开测试关卡里拿下了满分。论文把这个突破归结为视觉能力的释放,认为模型原本就有很强的推理能力,过去得分不高,主要是纯文本的数字网格限制了它。但这套基准的主导设计者却给出了完全不同的判断,明确表示通过在题目外围手工搭建系统拿到的满分,并不能证明模型本身具备了通用智能。

分数从四成直接跳到满分,在技术圈内引来了不少关于模型推理能力的讨论,也让基准测试的检验价值再次成为关注的焦点。要看清楚这个 100% 到底是怎么跑出来的,得把几层事实梳理清楚:测试本身到底是怎么定义动作和计分的、外围支撑系统究竟做了哪些具体的改动,以及出题人最初划定评测红线时,到底立下了什么样的原则。

VISTA 拿了满分,理由是模型被蒙住了眼

大语言模型本质上是一个接收上下文并预测后续词元的计算引擎,它本身看不到屏幕,也点不动鼠标。要让模型能够参与这类交互式游戏,工程师得在模型周围搭一套辅助软件,也就是大家常说的 harness。这套外围支架负责接收游戏环境传出的状态信号,整理成模型能读懂的格式,再把模型输出的决策文本翻译成游戏里具体的移动或者点击操作。模型其实碰不到游戏本身,所有的输入和输出,全靠外围这套收发系统在中间转接。

在 MIT 团队发布的 VISTA 论文中,他们完全没有对模型内部的权重进行更改或添加额外的微调训练,所有的改动都在外围 harness 这一层。他们给模型做了三个改变,分别对应看、记、查。

VISTA 让模型自己去看的三个环节:把文本渲染成图像、把每一帧原样存档、允许模型自己回看并放大细节

依靠这套外围工具的辅助,顶尖模型在全部公开包含的 25 个游戏环境里全部通关,交出了一份满分 成绩单。测试不仅实现了全数过关,其完成通关所消耗的环境交互动作总数,甚至比人类玩家首次通关少了一半左右。论文据此提出了一套解释,认为前沿模型本身早就具备了空间理解与长程推理能力,此前之所以在基准测试中表现平平,完全是因为粗糙有损的文本表示和频繁截断的历史信息束缚了模型的手脚。按照作者的表述,VISTA 所做的工作不过是替模型排除了视觉感知上的障碍,把模型原本具备的能力释放了出来。

但是,论文在正文中详细分析了每个改进对分数的影响,通过每次只引入一个改动来观察分数的变化。这些分析反而削弱了摘要中将所有功劳归于视觉贡献的观点,原因有二。

第一个原因是他们用生成的彩色图片代替了原来的那串数字,分数明显高很多。论文自己推测,这一步涨分主要来自省空间,因为一张图只有几百个 token,而一个棋盘写成数字要几千个 token,数字一多容易把上下文占满,能用来推理的空间就更小。换句话说,这一步的功劳是信息压得更紧凑,和让模型看见画面本身关系不大。

第二条更关键。在把无损记忆和回看工具都装好以后,他们又把图片换回了纯文本数字网格,分数几乎没掉,只是多花了一些动作。如果失败的原因真是模型看不见,文字版就不该跟图像版表现相当。真正撑起满分的是记忆和工具这套外围工程,视觉只是其中一种更省空间的表示方式。论文在局限性一节里也留了一句:这 25 个公开游戏很早就挂在网上,他们没办法排除题目已经进了模型的训练数据。

这项实验真正说明的问题,和摘要给外界留下的直观印象存在微妙的偏差。系统之所以能够拿到满分,核心推力并没有单纯落在让模型看懂图像这一单点上,更庞大的动力其实来自工程师团队为交互环境搭建的无损存档机制与检查工具链。这个由外围脚手架层层推高的满分,很快引出了另一个更深层的问题:在考题外围附加的人工支撑越多,最终得到的这个高分,究竟在测量谁的能力。

造 ARC-AGI 的人,怎么看这个满分

要理解出题人为什么对这个满分持保留态度,得回到这项测试最初的设计意图。主持设计这项基准测试的 François Chollet,长期致力于构建能够真正度量通用智能的技术标尺。在官方方法学的构想中,测试关注的核心在于检验人工智能在毫无准备的前提下,进入一个完全陌生的新环境时展现出的即时推理与自适应效率。它刻意避开对既有知识记忆的考察,将测试焦点完全锁定在即时探索与归纳规律的能力上。

排名的分数叫相对人类动作效率(RHAE),算法很简单。对一个游戏,先记录多位首次游玩者每关通关所用的动作数,按动作数取上中位数作为各关的人类基线。再数模型各关走了几步。模型走得更少,分数就高,更多就更低,没通关这一关就是零分。每个游戏内,各关按关卡序号加权平均;总分再取各游戏分的平均,满分一百。

但要注意,这里统计的只是真正改变游戏状态的动作,比如按方向键让人物走一格,或者点击某个格子触发机关。模型在后台做多少思考、调用多少次工具、读取像素、在草稿纸上试错,只要没改变游戏本身,都不算。这个设计的初衷是给出不同算力的模型一个公平的对比基准,因为它只看最终落子的效率。但它也留下了一个口子:外围系统可以在后台做很多搜索、推理和局部排查,只在游戏面板上精准地落下关键的一步,动作数就可以压得很低。

为了保证题目长期有效,官方把题目分成了两部分,公开测试集和私有测试集。前者源代码开源,大家可以随意下载、看源代码、跑程序;后者由官方保管,用于官方的模型盲测和竞赛。官方发布的 评测政策 里说,公开测试集的分数永远不进官方正式排行榜。官方技术报告 甚至明确提到,公开题目和私有题目的分数差异可以作为过拟合的重要指标。在官方看来,用公开环境特有的知识手搓代理,或者针对这个基准的特殊交互定制 harness,都是广义的题目过拟合。

这是 Chollet 一贯的立场。早在 2026 年 3 月,他就在社交平台上 写过:如果允许人类工程师在旁边看着具体的考题,针对性地编写一套专门程序去通关,那么解决全部公开任务在工程上显得相当平淡;测试团队自身就曾发布过通过回放人类操作拿下满分的 harness。然而官方排行榜所要衡量的核心指标,始终是模型面对陌生且毫无准备的情境时的自适应水平,人类工程师在特定题型上的外围调优能力并不属于测试考察的目标。在转述完这层逻辑之后,他总结道:如果是通用人工智能,就不该每一道新题目都要人类在旁边手工定制一套系统(“If it’s AGI it shouldn’t need a human in the loop handcrafting a system for every new task.”)。

这段评述直击了在公开基准上开展工程攻坚的软肋。给交互式基准刷到满分,真正接受检验的其实是坐在屏幕后方的那群软件工程师:是他们摸清了题型规则,对记忆结构完成了精巧编排,对交互接口进行了反复适配;至于封装在系统核心位置的那个基础模型,更像是一个听从外围脚手架调遣的计算单元。这层逻辑其实不用外人来挑明,出题人在制定考场规则的第一天,就已经把界限划得清清楚楚了。

出题人用一条线把系统分成两类:为这道题准备过的系统落在一边,基准真正想测的没准备过的 AI 落在另一边,而 VISTA 和 AVO 两套拿满分的系统都落在准备过的那一侧

最能说明问题的,是另一套完全不用视觉的系统

如果说 VISTA 团队的实验结果还让人觉得多模态视觉是攻克测试的关键,那么另一项工业界成果则把这种解释推向了一个相互矛盾的境地。英伟达公司在其官方技术博客中公布了自家的通用长程智能体架构 AVO。这套系统出自英伟达的 AVO 架构研究,初衷是探索底层芯片运算核心代码的高维搜索空间,并在高难度的系统工程优化中取得了出色的提速成果。

英伟达团队将这套原本用于代码编译与工程搜索的系统,直接迁移到了同一个交互式游戏基准的考场上。AVO 在系统设计上与 VISTA 形成了极具张力的对照。英伟达在其技术博客中陈述,团队放弃了构建显式程序化世界模型的方案,直接采纳了 VISTA 所阐述的直接交互设计原则,并独立重新实现了任务交互接口;然而在具体的感知模态选择上,模型则完全运行在纯文本模态之中,每一次环境观察都固定以 64×64 纯文本字符网格的形式提供,全程没有任何一张图像,也没有向模型输入任何一个视觉 token。两套系统在任务接口设计上思路一致,但在输入给模型的模态上却走向了截然相反的两个极端。

正是这样一套完全没有视觉输入的纯文本系统,在同一个基准测试的全部 25 个公开游戏环境中,同样达成了全数通关的满分战绩。不仅如此,AVO 在通关过程中累计消耗的环境交互动作总数,甚至比依靠高精细度视觉渲染与像素级检查工具的 VISTA 还要少大约 12%。同一个满分终点,一条路走向了高精细度的视觉渲染与局部像素缩放,另一条路则退回到了看似原始的纯文本矩阵排版。两套在信息感知路径上截然相反的系统,最终却在同一个基准上交出了几乎一致的答卷。

面对这个对比结果,英伟达的研究团队在博客中专门给出了免责说明,提醒读者不能把这项对比当作严格受控的单一变量消融实验。因为两套系统在底层调用的智能体后端、环境状态的文本表示格式、历史长记忆检索机制以及上下文工程细节上均存在显著差异。此外,与 VISTA 一样,AVO 汇报的战绩同样仅仅发生在那 25 个开放源码的公开测试题目中,并未经过官方私有测试集的封闭检验,本质上属于各自团队的自报成绩。这两份满分到现在都没有任何第三方独立复现过。

在这场模态分歧的背后,还隐藏着一条格外生动的人际脉络。英伟达 AVO 技术博客的署名作者之一 Yeyin Zhu,也是麻省理工学院那篇先驱论文 ARC Is a Vision Problem! 的共同作者;那篇论文研究的是 ARC-1 的静态网格任务,主张把它当成视觉问题来做。同一个人,先前论证视觉路线,随后在 NVIDIA 主导 ARC-AGI-3 项目时,却凭借彻底摒弃图像输入的纯文本工程系统,在同一个考场上打出了动作效率更高的满分。

这个事实清楚地表明,系统能否在这类交互任务中拿下高分,并不取决于模型到底是用肉眼看图还是用字符读表。真正发挥决定性作用的,始终是外围系统对搜索路径的工程组织、对长程任务执行步调的约束,以及对试错过程的系统化管理。只要外围工程脚手架搭得足够稳固、结构足够完整,不同的感知模态更像是插在同一套机械骨骼上的不同零件,都能把流程顺畅跑通。

VISTA 用渲染图像、AVO 用纯文本网格,两条完全相反的感知路径,最终汇到同一个满分

下次看到这类标题,该看什么

在今天的人工智能新闻里,模型攻克某个高难基准、打破人类记录或者在通用智能评估中拿下历史新高的标题屡见不鲜。这类宣传往往会让人觉得模型自身的通用思维能力又完成了一次质的飞跃。然而通过剖析这类外围系统在公开考题上的满分历程,面对这类消息时,就可以建立起一套更为冷静、更为平实的审视习惯。

下次再看到类似的高分报道时,不妨先向自己提出三个更接近技术本质的反射问题: 第一个问题关乎能力的归属:这项分数究竟在多大程度上反映了基础模型自身的自适应推理,又有多少成分源自外围工程师针对题型特征手工定制的状态机、规划树与工具链? 第二个问题关乎考场的性质:测试报告中拿出来的数字,是在源码开放、规则已知的公开调试题库中反复迭代跑出来的自报分数,还是属于出题方严密封闭考场中的认证盲测? 第三个问题关乎隐性的代价:在排行榜明面统计的操作动作之外,外围支撑系统在幕后到底消耗了多少轮次的自我纠错、调用了多少次辅助工具,又允许模型在不计入成绩的暗处进行了多少次重试?

通用智能的核心要求,是模型面对未曾遇见的陌生情境时,能够在有限的资源约束下展现即时的泛化理解与问题求解能力。一道原本用来考察通用适应性的考题,如果工程师用精密的流程在外部梳理得一清二楚,模型顺着通道拿到满分,展示的其实是现代软件工程在系统集成与任务分解上的能力。正如基准出题人反复表达过的那样,这份满分记录的是人为了让模型走到这一步所做的事。模型有没有真的理解这个世界,成绩单没有回答。

鸭哥每日手记

日更的深度AI新闻和分析