如果让大语言模型参与前沿科学,很多人期待它直接提出革命性的新假说,或者在实验室里发现奇迹药物。现实中更有把握的一条路,其实接地气得多:先去帮科学家把他们天天运行、却又慢又耗资源的计算软件重新修整一遍。Anthropic 在 9 月 17 日发布的技术报告与开源代码,记录的就是这样一次尝试。
这项工作的分工很有意思。两位熟悉生物建模、但缺乏推理加速与底层内核开发经验的技术人员,带着 Claude 在不到四周的时间内改造了 36 个软件包,覆盖 30 多个开源生物分子模型。所有改动直接运行在原有模型权重之上,团队没有重新训练新模型,36 个软件包与 30 多个模型的数量差异主要来自部分模型的多套独立实现与参数版本。技术报告正文和数据分析同样由 Claude 在人类监督下起草完成。
把通用大模型放进科研一线,暂时不必急于替科学家做核心科学裁决,先挽起袖子,把研究人员日常依赖的计算软件做一次扎实的技术装修。从实际效果看,这种务实的工程路线绕开了科学幻觉的直接风险,也让现有的科研计算工具实实在在地跑得更快、更省资源。
在计算生物学的日常研发管线里,研究人员的算力开销主要压在两类基础任务上。一类是蛋白质结构预测,程序接收氨基酸或核苷酸序列,推算三维空间里的原子坐标并评估局部置信度。另一类是蛋白质设计,算法以疾病靶标表面为起点,生成能够紧密贴合的全新序列,常见形态为 50 到 120 个残基组成的小蛋白结合体,再通过重折叠预测检验结合构型。这两类任务不仅耗时长,而且动辄挤爆高端计算卡的运行显存。
主流模型为什么跑得这么慢?我们可以把一个蛋白质分子想象成一串折叠在三维空间里的珠子。为了弄清楚这串珠子最终会叠成什么形状,以 AlphaFold3、OpenFold3 和 Boltz-2 为代表的主流架构,必须反复推算每一对珠子之间的空间相对位置。仅作示意,假设一条链上有 1,000 颗珠子,不计方向与自身配对,两两配对就有大约五十万个组合。模型会给每一对珠子写下一张关系卡,记录它们之间的距离和朝向。
麻烦出在这些关系卡的校验过程。算法要核对珠子 1 和珠子 2 的关系卡写得对不对,不能只孤立观察这两颗珠子,还必须把分子链上的珠子 3、珠子 4 直到最后一颗珠子逐一拉进来,检查三颗珠子构成的几何三角形是否符合物理和几何规律。更新每一对珠子的关系卡,都要拉上整个体系的所有其他珠子核对一轮。分子链条每增加一颗珠子,两两配对的关系卡多出一整圈,每张卡需要拉来交叉校对的其他珠子也多出一个。
这种成倍互相牵扯的几何三角形校验,在计算生物学文献里称为三角注意力和三角乘法。这些成对计算的计算量随着分子体系的尺寸呈三次方上升。体系内的残基规模翻上一倍,消耗的计算时间与显存开销会飙升到约 8 倍;体系规模扩大到三倍,资源开销会暴涨到约 27 倍。现代结构预测模型的大部分运行时间与显存开销,正是耗费在这些关系卡的交叉推演上。
以往解决这类工程瓶颈,往往需要经验丰富的底层系统工程师花费数周时间对单个模型手工调优,写出的底层代码还难以直接迁移到其他模型。虽然芯片厂商推出过专用算子库 cuEquivariance 和 BioNeMo 推理运行时,但学术界散落着几十个各自迭代的开源模型仓库,专家的手工定制很难覆盖整个工具生态,许多优秀的科研软件因此长期停留在未经优化的原生状态。
面对三十多个结构各异的模型代码库,改造策略分成了底层硬件算子和上层模型工程两个层面。底层 GPU 内核本质上是把许多细碎小运算合并成少数高吞吐大操作的底层程序。以往的代码习惯把复杂的三角几何运算拆分成几十道零散的数学指令,导致中间数据在显存与计算核心之间来回搬运,浪费了大量带宽。团队让 Claude 编写了一套名为 FlashPairformer 的定制 GPU 内核,把这些零散步骤整合成吞吐饱满的连续流式操作,压低显存读写延迟。在单独测试里三角注意力相对 cuEquivariance 的几何平均提速为 2.7 至 2.9 倍,这种微基准虽然不等于完整模型的提速,但为上层优化清空了底层路障。
更繁重的工程量落在 36 个软件包的代码重构上。注意,它改动的是代码的执行路径与显存调度,没有改动工具推导科学结论的计算公式。Claude 做的事情是系统性清理软件运行中的机械内耗。最典型的动作包括两项:一项是缓存此前重复计算的中间结果,避免程序做无用功;另一项是借助 CUDA 图技术把重复的 GPU 操作录制下来批量重放,消除了 Python 解释器在每个小步骤上的调度开销。代码还顺带折叠了恒定死分支,让高频张量长驻显存减少主机与设备间的数据拷贝,并引入异步管道加载数据。面对超大复合物,程序会对庞大的中间张量做分块处理,或者在单台多卡环境下把成对表征按行切分到不同显卡协同计算。
在传统的性能优化里,底层工程师经常替用户牺牲少许精度来换取速度。这次的工作把精度与资源的决定权交还给了科研人员,设计出四档运行模式。使用者可以根据任务场景切换档位:off 模式直接关闭优化,保持原始状态;exact 模式保证输出数值与原始模型逐位一致;fast 模式允许输出落在原模型自身的随机波动区间内,换取更显著的推理速度;big 模式则专门开启内存分块与多卡切分,避免处理大分子时显存溢出报错。
这套工程体系还引入了一项明确的拒绝契约。如果运行环境、硬件配置或模型架构无法满足某个档位要求,程序会直接打印 NOT ACTIVE 提示并以状态码 3 退出,不会静默回退到未加速的慢速代码。全部改造代码已经整理在开源代码仓库中,原始上游代码保留在 stock 目录,优化包放在 opt 目录,底层共享统一的 opt_core 运行时。整套项目作为静态参考实现发布,Anthropic 自有代码采用 Apache-2.0 协议,上游 stock 代码保留各自许可,团队明确声明后续不接收社区代码提交也不做持续维护。
要客观评价这次代码改造的提速效果,首先需要弄清楚参照基准。速度与显存基准测试统一在英伟达 H100 80GB 计算卡上完成。评测团队选取的 default 基线并非出厂默认设置,而是懂行用户在同款显卡上调优出来的最快正确配置,提前开启了可选融合算子并吃满批处理吞吐。提速倍数直接与熟练工程师调优后的高效基准对比,排除了未调优出厂配置带来的虚高水分。
在这套严格的基准线上,结构预测子集的三种优化模式拉出了清晰的提速阶梯,以下均为几何平均。保持输出逐位一致的 exact 模式平均提速 1.6 倍;允许微小误差换取速度的 fast 模式平均提速 4.1 倍,各模型的加速幅度分布在 2.3 倍至 6.4 倍之间,这种微小数值漂移落在原模型自身的随机波动范围之内;最省显存的 big 模式即使背负着数据分块的开销,依然取得了平均 3.4 倍的加速。官方公告提到的接近 2 倍输出一致提速,对应的是涵盖三十多个模型的全局平均表现,在计算繁重的结构预测子集上,严格逐位一致的提速实际就是 1.6 倍。
追求极速需要付出显存代价。exact 模式与 fast 模式为了争夺峰值计算吞吐,显存占用最多会飙升到原有基准的 3 倍多。如果手头计算卡的硬件显存吃紧,使用者就需要切换到最省内存的 big 模式,依靠分块计算来规避显存溢出风险。
计算跑得更快,输出质量有没有受损?科研人员通过及格线指标来检验预测构型的精度。在蛋白质结构预测领域,学者们常用 DockQ 分数衡量预测模型与实验测定结构的贴合程度,并将 0.23 当作预测合格的及格线。评测数据显示,预测结果跟实验解析的结构比对,可接受比例在优化前后都停在 54% 到 55% 这个水平。几种优化模式相比基线的置信区间都包含零,说明大盘整体精度保持平稳,没有发生系统性滑坡。
当然,报告附录里还有逐模型的评测细节,少数模型在个别档位下仍有微小的局部精度波动。此外,报告没有对比同期 ColabFold 新加的社区加速内核。
任何软件工程优化都有其能力边界。这份技术报告保持了相当清醒的学术分寸,用两组对照实验划清了计算工程的可达性与科学预测的有效性之间的界限。
第一道界限出现在超大分子复合物的结构预测中。生物物理计算使用生物 token 统计物理实体规模:氨基酸残基算一个,核苷酸算一个,小分子配体和离子按非氢原子逐一计数。这一单位反映分子体系的实际几何单元,与大语言模型切分文本词元的 token 没有数学换算关系。在单台 8 卡服务器上,big 模式成功预测了包含超过 10,000 个生物 token 的超大复合体,最大的测试样本达到 10,761 个 token,结构相似度 TM 分数在 0.92 到 0.997 之间。作为对照,AlphaFold3 论文发表时展示的核糖体案例规模为 7,663 个 token,而模型在训练阶段采样的尺寸上限仅为 768 个 token。
算力跑得通并不代表科学推断成立。面对包含约 31,000 到 70,320 残基的完整病毒衣壳与超大蛋白质区室,单台服务器的 7 次极限推理虽然顺利跑完,但输出的三维结构全都塌缩成致密小球,直径只有真实构型的四分之一左右,已打分的三个体系 TM 分数跌落到 0.08 到 0.14。
读者难免产生疑问:这种塌缩是否来自加速优化,甚至是有损压缩引入的数值误差?现有证据都指向相反的方向。面对上万 token 的复合体系,同一个 big 模式预测出的构型高度精准,TM 分数最高达到 0.997;尺度推向数万残基,才出现跌落到 0.08 到 0.14 的塌缩结果。唯一的变量是输入规模离训练分布有多远,而不是换没换优化模式。当然,报告没有跑未优化模型在同尺寸的对照,这个归因停留在合理推断的级别。技术报告在讨论中写道:big 模式扩展了程序能够计算的体系规模,但没有扩展模型学到的知识。
真正的分水岭在模型自身的认知边界。AlphaFold3 在训练阶段切分的最大采样片段只有 768 个 token,而发生塌缩的衣壳体系,按残基数计达到了训练片段的约 40 到 90 倍。优化代码直接运行在原有权重之上,模型学到的空间几何规律只在见过的尺度内成立。脱离了这个范围,面对海量原子的相对约束,模型输出的构型在局部或许自洽,在全局物理上却走向了错误的折叠。报告作者推测,这反映了模型在超大体系上的泛化失败,也说明训练片段的尺寸是模型学到的边界,跟优化代码没有关系。
换成保证逐位一致的 exact 模式,塌缩是否就会消失?在常规分布内,允许细微数值差异的 fast 模式与原始模型在大盘精度上统计一致,优化带来的折损微乎其微。而在超大体系面前,报告也给了一条反证:极限测试里有一部分样本省略了循环步骤,报告承认这可能影响结果,但其中一个样本开启完整循环并引入实验模板,结构照样塌缩。流程简化可能推了一把,但显然撑不住全部解释。
更实际的制约在于硬件显存。保证逐位一致的 exact 模式更加耗费显存,峰值占用有时会达到原有基准的 3 倍多。面对数万残基的结构,现有单机只有依赖 big 模式的分块与多卡切分才能装入显存,exact 模式在这一尺度下无法启动。认为换回 exact 模式就能避开塌缩,既没有经过实测验证,目前在单节点上也无法验证。技术报告同样没有针对未优化的原始模型做同等尺寸的跨节点对照。关于塌缩的归因,目前依然停留在合理推论上。
第二道界限出现在蛋白质生成设计任务中。Anthropic 此前在 8 月蛋白设计报告 中曾组织过单靶点算力上限达约 2,500 H100 GPU 小时的多智能体战役。在新一轮对照实验里,流程得到了大幅简化,单个 Claude 实例通过命令行直接驱动优化后的模型,在单张 H200 显卡上连续运行 24 小时。新旧方案在算力预算上相差约 100 倍,两轮战役的实际墙钟运行时间都是 24 小时。在新方案支持下,三款模型的候选分子中位得分经跨靶点平均后分别达到 0.785(Opus 5)、0.781(Mythos 5.1)和 0.739(Mythos 5),对照旧方案的 0.749 水平,其中 Mythos 5 的 0.739 略微低于旧战役的中位数;最高分经跨靶点平均后分别达到 0.833、0.825 和 0.813,前两者优于旧战役的 0.817,Mythos 5 的 0.813 则略低于旧战役。
这里用来评估结合界面的打分指标名为 ipSAE,它是一个介于 0 到 1 之间的计算置信度评分,仅代表算法模型对空间结合构型的把握程度,并不等于生化试管里的湿实验成功率。新流程设计出来的所有全新蛋白质分子,目前均未经过真实的物理实验检验。报告正文对此保持了清醒的归因纪律,写明设计结果未分离优化模型与简化协议的贡献;并且针对有无加速工具的对比组补充强调,有无可加速对照的性能差异不可仅归因于加速模型本身。
从整个项目的推进逻辑来看,它给技术社区提供了一个高确定性、低风险的人工智能落地范式。在我看来,这项探索真正有启发性的地方,在于清晰划定了工程重构与科学发现的权责分界,胜过单纯去罗列几个惊艳的提速数字。
在真实的自然科学前沿,验证全新假说的物理代价相当高昂。一个缺乏实证依据的分子构想,往往需要实验室耗费数月时间采购试剂、培养细胞并开展繁琐的生化检测,算法一旦产生科学层面的幻觉,就会造成巨大的科研资源浪费。优化科学软件则遵循不同的风险逻辑。这项工作改动的是代码的执行路径与显存调度,并没有改动工具推导科学结论的计算公式。
软件工程拥有测试套件与数值基准作为安全兜底。代码改动完成之后,团队通过单元测试核验逻辑正确性,通过逐位比对排查数值漂移,再通过上千个模型与靶点配对的大规模测试校对整体精度分布。一旦模型产生代码幻觉或改动破坏了数值约束,自动化断言会当场报错拦截,多数技术差错在开发阶段就能得到暴露与修正。
这套实践同时也重塑了科研软件的维护成本结构。学术界沉淀了大量构想精巧的开源计算模型,但受限于人力资源,论文发表后往往缺乏长期的底层工程维护。如果单纯依靠高薪的底层硬件专家逐个手工调优,整个科研生态很难承受高昂的时间与资金成本。两位生物建模从业者带着通用模型在四周内翻修 30 多个工具,证明大语言模型能够胜任高素质的代码重构助手,把原本属于少数专家的昂贵优化工作,转变成低边际成本的规模化工程。
计算工具的提速固然降低了研发开销,但计算通畅始终无法直接等同于科学突破。为了进一步检验这些计算分子的实际生物活性,Anthropic 已经联合生物技术机构发起了一场蛋白设计比赛,针对五个前沿生物学难题,计划对社区提交的超过 5,000 个计算设计分子进行湿实验合成与物理活性检测。在真实的生化反应数据出炉之前,保持审慎客观依然是严谨的同行态度。把通用模型放进由严密测试套件把关的工程跑道,让它专注于分担繁复的软件翻新事务,这或许正是现阶段让人工智能服务科学探索最稳妥、也最扎实的一条路径。