在2025年7月,AI在国际数学奥林匹克竞赛中取得了相当于金牌水平的成绩。许多人将其视为数理推理能力的一个重大突破,但事实上,早在三年前,早就有人为这件事写下了明确的日期。
2022 年 6 到 10 月,一个预测研究机构 FRI(Forecasting Research Institute)进行了一项长达数月的预测实验。他们找来两批人——一批是顶尖的机器学习专家,另一批是长期进行概率预测、胜率稳定的超级预测者——来对一些技术节点给出定量的年份和概率判断。其中一道题目就是:人工智能系统在哪一年能拿到国际数学奥林匹克竞赛的金牌?
专家组的年份预测中位数落在 2030 年,超级预测者更保守一点,预测的年份在 2035 年。实际上金牌在 2025 年 7 月到手了。这些预测在当年的实验中被白纸黑字记录下来,现在可以逐条核对。
除了猜测年份,出题人也测了隐含概率,也就是预测者事前给最终真实发生的结果分配多少概率,相当于给现实打出的平均分。对金牌实际达成的结果,专家事前给出的隐含概率是 8.6%,超级预测者更低,只有 2.3%。在那场实验涵盖的四个基准测试里,专家对实际结果的平均隐含概率是 24.6%,超级预测者是 9.7%。这些原始数据完整公开在FRI的分析报告里。
专家低估 AI 的说法由此而来,过去一年随处可听。拿到这组对照,很多人的第一反应也是专家把技术进展看慢了,认定整个专家群体在判断上过于保守。
不过,如果你继续往后看会发现,事情并不仅仅如此。
从国际数学奥林匹克这道题出发,类似的偏差在其他地方也一再出现。
同样测数理推理的前沿基准,FRI的专家预测项目LEAP在第1轮调查(2025-06~08预测)里让大家推测FrontierMath(Tiers1-3)到2025年底的解决率。专家给的中位数是31%,超级预测者给的是30%。到了2026-01-01,按Epoch FrontierMath报告 的初始结算记录(v1口径),前沿模型的实际解决率跑到了40.7%。到了2026-06-12,Epoch修正了42%的题目中存在的错误,题目修复之后得分整体往上走,低估的差距拉得更开。
商业收入的迟滞轨迹也一样。FRI 做过的经济学预测研究(2025-07~08 预测)问的是,单家领先的 AI 公司到 2026 年底年化经常性收入(ARR)能有多少。AI 专家的预测中位数 $20B,经济学家给 $16B,超级预测者给 $25B。结果到了 2026-09-22,按 Axios 的报道口径,跑在最前面的单家企业年化收入已经到了约 $100B。
在 LEAP 项目第 11 轮调查里(2026-07 调查),出题人问 OpenAI 和 Anthropic 两家到 2026 年底的合计年化收入。专家给的中位数是 $70B,超级预测者给出 $90B,公众组给出 $41B。但根据 LEAP 第 11 轮报告,调查结束才过了大约两个月,两家公司的合计年化收入按报道口径就已经到了 $105B(其中 OpenAI 是 $40B,Anthropic 是 $65B)。三组人给 2026 年底设下的预测中位数,两个月内全穿透了。
如果我们把时间拉得更长,会发现专家对核心技术节点的时间线预测也在持续前移,而且非常稳定。
AI Impacts 主导的全球机器学习专家调查 ESPAI,在最近的新一轮大样本调查(ESPAI 2024 在 2024-12 调查,报告在 2026-09 发布,n=1,580)中系统地回顾了人们对高级机器智能(HLMI)实现时间的判断变化。从均值聚合的角度来看,高级机器智能有 50% 的可能性实现的年份,在 2016 年预测是 2061 年,2022 年预测是 2059 年,2023 年变成了 2047 年,到 2024 年则提前到了 2042 年。如果综合四轮调查的均值聚合结果,可以观察到,现实每过去一年,离专家预计的实现时间就减少了大约 3.4 年(参见 ESPAI 2024 完整报告)。
在具体的单个任务上,这种迟到甚至远在大语言模型爆发前就已经是常态。
比如我们看一下 ESPAI 2023 轮调查里面列举的任务时间表,其中对于人工智能在即时战略游戏星际争霸二里面打败人类职业选手的50%中位年份,专家预测是在2027年。但实际上DeepMind的AlphaStar已经在2019年做到了,整整早了8年。
而在世界扑克大赛(WSOP 无限注德州扑克)上,专家给出的预测中位年份是 2026 年,Pluribus 算法在 2019 年就赢了人类顶尖选手,同样早了 7 年。
从不同的年份、不同的任务、不同的机构,这些对比都指向同一个结论:低估不是个别情况,而是各种独立的定量测试中反复出现的现象。
如果我们就止步于此,那很容易得出一个非常自然的结论:人类专家的想象力总是有限的,算法的进步总是快过大家的预期。
但就在同一个时间窗口里,同一批机构里的人,对另一批考题的预测跑到了完全相反的方向。
这种掉头最先在软件工程的真实生产环境里露了头。
2025年7月,非营利安全评测机构METR做了一个针对软件开发者的随机对照实验,记录在arXiv论文里。
这个实验的基本做法是,在做实验前,大家要先给出一些定量的预期。参与实验的软件开发者自己预测,有了 AI 编程工具的帮助,可以把自己的任务完成时间缩短 24%。受邀参加预测的经济学家的预测时间缩短幅度的中位数是 39%,机器学习学者的预测中位数是 38%。
无论是动手写代码的工程师,还是做宏观研究的学者,在实验前都以为这种工具能大幅减少耗时繁琐的步骤。
但实测结果刚好反了过来:给工程师配上 AI 工具之后,完成任务的时间不仅没有减少,反而增加了19%。论文中写道,开放AI工具实际上让完成时间变长了。
专家在办公室里算出来的提速收益,进到真实工程环境,全让排错、对齐边界、修补细微缺陷和理清上下文的摩擦力给吃掉了。
类似的过度乐观,接下来又在生物安全领域出现了一次。
在FRI支持的Active Site的生物风险随机对照实验中(2025年中预测),组织者测试了大语言模型是否可以协助本科生完成危险的生物任务。
在预测阶段,生物安全专家认为有了模型辅助,实验成功率会提升 22.5%,专业病毒学家预测提升 40%,超级预测者给出的预测中位数也有 16.2%。
然而,在进行了对照实验后,FRI的分析页面上记录的实际数据表明,模型的辅助仅使成功率提高了 5.2%。专家凭直觉猜出的危险增益,比真实环境下的动手能力高出好几倍。
哪怕只看代码跑分,高估也甩不掉。
Epoch 和 AI Digest 在 2025 年技术进展的年度回顾中提到,针对软件工程 benchmark SWE-bench Verified,预测者们在 2024-11 到 2025-01 这段时间里认为 2025 年年底的解决率中位数会是 88%。然而,到了年底公布实测结果时,前沿模型的解决率是 80.9%,远低于此前的群体预期(参见 Epoch 的总结报告)。
一边是反复突破预期的数学基准和商业营收,另一边是实际表现明显落后于预期的工程提效、生物实验和代码跑分。
同一批预测者在同一段时间内为什么会在这两个方面都踩空?
观察专家对AI发展的判断,就像在看两条截然不同的赛道。
一条赛道是计时器,比如数学竞赛、编程测试、公司业务收入。做成了,时间就定格在那儿,大家都看得见。另一条赛道上装的是测量现实阻力的仪器,比如把模型放进真实开发环境帮程序员提速,里面混着协同摩擦和工具链的磨合。还有一条赛道,那里连仪表都没有,比如机器人做家务,或者 AI 对宏观经济的实际拉动,做成与否压根没有客观定量的标尺。
在装着秒表的赛道上,专家的判断几乎每次都来迟了,竞赛金牌提前到手,业务收入成倍翻番,现实总比预测跑得更远。
但在测量现实阻力的赛道上,专家的判断又普遍嫌太乐观,原先以为能大幅提速的工作,真刀真枪跑下来反而因为排错和上下文切换变慢了。
专家判断失误的方向,并不取决于模型擅长什么,而取决于我们眼前有没有仪表、以及这台仪表在量什么。秒表测的是纯粹的能力跑多快,专家在这类题目上显得悲观;仪器测的是落地时的现实阻力有多大,专家在这类测试里显得过于乐观。
至于没有仪表的赛道,情况更微妙。无论专家预测突破在下个季度还是遥远的未来,现场都无法判卷。大家没有偷懒,问题在于缺乏清晰的验收标准,连专家到底对还是错都界定不了。面对这些连标尺都还没有造出来的领域,唯一诚实的回答就是没人知道。
FRI作为一个组织大型预测的平台,也在自己的中期报告中指出这种不对称性。根据他们的统计规则,如果实际的预测结果高于预测的中位数,低估就会立即发生并记入账簿,但如果想证明一个预测过高,则需要等到截止日期过去才能验证。因此,仅选择提前完成的预测进行分析,会自然产生更多的低估案例,详见FRI分析页面。
更麻烦的是,我们的尺子有时候也会变。在 FRI 的工时辅助预测题里面,预报员用的官方历史基线从 2% 改到了 3.35%,而 2025 年的真实记录最终落在 5.7%。如果用旧的尺子算,预报员严重低估;但如果把尺子的改动过程也考虑进去,整个胜负关系就会完全反转。
说到底,判断 AI 进展的偏差始终跟着测量仪器走:在装有秒表的地方专家总是迟到,在装有阻力表的地方专家显得过于乐观,而在那些连仪表都还没造出来的地方,没人知道真正的答案。
连着经历了四年的现实碰撞与数据结算,这批身处前沿的专家和预测者,现在的想法停在哪里?
答案是:他们确实更新了预期,但只更新了一半。
在那些能列出排行榜、有测试集、能用算力驱动的软件领域,大家都在大幅提前时间表。
根据 LEAP 项目的第 8 轮调查(2026-04~05 调查,详见 LEAP Wave 8 报告),关于通用人工智能(AGI,调查里明确定义为商业 AI 系统在绝大多数非体力任务上超过 90 分位的人类全职员工)的哪一年实现,专家的中位数预估已经提早到了 2050 年,超级预测者更是提早到了 2047 年。
问到2100年之前实现AGI的概率,整个受访群体的中位判断是80%。
而在衡量变革深度的技术革命尺度(TRS)上,有 35% 的专家和 34% 的超级预测者认为 AI 属于第 8 级,相当于工业革命级别的世纪技术。而有 24% 的专家和 23% 的超级预测者认为 AI 属于第 9 级,是千年一遇的技术变革。
与第一轮调查相比,对同一批人的前后态度进行追踪,发现专家的评分平均值上升了0.20,超级预测者的评分平均值上升了0.39。在遇到持续兑现的技术突破时,超级预测者的判断调整幅度甚至超过专家自身。
在这些数字背后,预测工具的生态也在发生改变。
2026-07-16,FRI发布了ForecastBench的评测结果,前沿大语言模型在一整套综合预测题集上的表现,已经逼近顶尖人类超级预测者的水平。
在官方的解释中,FRI 还特别提到,目前的数据仅显示和超级预测者打平,而没有明显超越,且评测中人类超级预测者的基准停留在 2024 年 7 月(参见 FRI 的评测通告)。
这就形成了一个有趣的局面:曾经衡量我们人类预测水平的计分板,现在正在被技术快速抹平。
但只要把目光从排行榜移向现实世界,就会发现大家的另一半认知依然牢牢钉在过去的经验基线上。
当涉及到宏观经济的产出增长、全要素生产率的提高,以及复杂物理系统的实际应用时,大多数的专家和经济学家的长期预测几乎没有任何变化。虽然他们承认屏幕上的模型可以迅速通过许多考试,但是当他们思考如何将这些能力应用到现实经济中时,他们仍然倾向于坚持之前的缓慢传导的假设。
他们不是全面倒向激进,而是把激进留给有跑分的地方,把保守留给没有仪器的现实。
上一节我们理解了误判为何有方向。在工程决策上,规则很简单:面对任何判断,先问它在哪条赛道。
在装着秒表的赛道上,指标有明确的计分板,别迷信专家直觉中位数,直接看趋势外推。专家的年份预估常带群体心理防卫,顺着测量数据做出的外推线,给出的读数可靠得多。
METR 长期观察模型独自处理长任务的能力,发现它在稳定的成功概率下能处理的任务长度有一个稳定的指数增长模式:有效时间大约每 7 个月翻一番,50% 的成功率对应 212 天,80% 对应 213 天。沿这个模式外推,能独立实现人类工程师一个月的工时(167 小时)的系统,窗口在 2028 年底至 2031 年初之间,见 METR 官方博客 和 arXiv 论文。专家的直觉猜测 2047 年或者 2050 年,与这条连续读数的外推不在一个信息量级别。
在测量现实阻力的赛道上,盯紧第一批仪器的修正信号,别听场外辩论。争论AI能不能帮程序员省时间、会不会扩散生化风险,都不如等仪器读数。METR 开发者对照实验与Active Site 生化对照实验,都是仪器刚立起来就给出阻力读数的例子,用对照组测出了效率折扣与专家差距的信号。
第一代仪器也有工程噪声。FrontierMath 在 2026-06-12 修复了 42% 的题目中存在的错误,之后得分普遍上移,详见 FrontierMath 评测报告。但读数有噪声好过没有读数。现实阻力有多大,仪器跑上一遍,数字就摆在那里。
在没有仪器的赛道上,乐观和悲观都只是微弱先验。如果一个领域没有明确的胜负线、可重复的实验或反馈机制,无论它说要等五十年才出结果,还是宣称下个季度将改变一切,都不该作为决策依据。在缺乏仪器的迷雾中,很多看似确凿的断言只是未校准的情绪。
回头看看,2022 年关于数学奥赛金牌的预测。四年前坐在屋子里的那批超级预测者,一步概率乘法都没算错,推理过程也挑不出逻辑漏洞。他们只犯了一个错:把人类几千年在数学上的先验放得太重了。
可现实往前走,从来不会迁就谁的先验。
工程师敲着代码,在把一块块新的计分板竖起来。新的测量仪器扎进现实,指针开始跳动,下一步的走向交给仪表盘上的数字,不再交给权威的背影。
| 预测事项 | 预测主体与时间 | 预测数值 | 最新进展与对照 | 偏差性质与说明 | 来源链接 |
|---|---|---|---|---|---|
| 训练成本实验规模 | FRI XPT(2022 年) | 到 2030 底最大训练实验:专家 $180M、超测者 $100M | Grok 4 官方中位 $490M(Epoch 2025-09-12 评估) | 提前约 5 年、低估 2.6-5 倍 | Epoch 数据洞察 |
| 语音转录人类水平 | ESPAI 2023 轮调查 | 任务达成 50% 年份中位 2026-27 | 微软 2017-08 在 Switchboard 达成 5.1% WER 人类等同水平 | 任务定义含噪声与口音差异,属类任务,实际早于预测 | 微软研究报告 与 ESPAI 论文 |
| 日期类预测方向检验 | Rethink Priorities | 分析 41 个 AI 日期题 | 已 resolve 的 7 题中 6 题早于社区预测、5 题在预测 25 分位之前 | 日期类预测实际进展系统性早于预测 | Rethink Priorities 分析 |
| 国际数学奥林匹克金牌达成 | Metaculus 社区 | 据历史截图转述,社区中位 2022-07 为 2029 | 金牌水平成绩 2025-07 达成;Q6728 正式结算仍有争议 | 预测偏晚,但比 XPT 专家组更接近实际 | Metaculus Q6728 页面 |
| 高级机器智能导致灭绝风险 | ESPAI 2024 专家调查 | 灭绝风险概率中位 10%、均值 18% | 属于主观信念评估,三问法合并口径 | 专家风险感知缓慢上移,中位首次达到两位数 | ESPAI 2024 完整报告 |
| 网约车自动驾驶渗透率 | FRI LEAP 调查(2025-06~08) | 2027 底网约车 AV 占比:专家 7.3%、超测者 2% | 按当前趋势外推的投影为 2.5%(未 resolve) | 属于模型外推投影,非已结算事实;专家在物理渗透上偏乐观 | FRI 分析报告 |
| 灭绝风险提问方式效应 | FRI 2023 XPT 实验 | 百分比表述中位 5% | 1-in-X 表述中位 1/15,000,000 | 同一风险议题在不同表述下偏差巨大,反映主观概率受提问框架影响 | EA Forum 讨论档案 |
| 通用人工智能实现年份 | Metaculus 社区 | 当前社区中位 2031-03 | 80% 区间 2028-05~2037-09 | 社区预测时间线相较 2022 年前大幅收缩 | Metaculus Q5121 页面 |
| 网络安全评测 Cybench | Epoch×AI Digest 2025 复盘 | 2025 底解决率预测中位 62% | 实际达到 82% | 预测偏低 20 个百分点 | Epoch 复盘报告 |
| 头部机构合计收入 | Epoch×AI Digest 2025 复盘 | 预测 2025 底三家收入中位 $16B | 实际达到 $30.4B(almost double) | 商业营收规模超出预测者预估近一倍 | Epoch 复盘报告 |