安全与供应链治理与合规AI Agent

安全声明的价格:OpenAI 为什么暂停了训练

这几年大家对各家实验室发危险能力预警早就见怪不怪了。以前的套路通常是放一段越狱视频,顺手把发布时间往后推两周,看着更像是在发布会里秀肌肉。

不过 8 月 18 日 OpenAI 发的公告味道完全不一样。CEO Altman 在社交平台上公开说,他们把一部分前沿强化学习训练停了,理由是得让对齐、安全和监控标准追上模型能力跑出来的速度。

公告里披露的实际动作,比这句话沉重得多。准备部署的新模型强化学习训练直接停工两周,原本计划中最大的一次前沿训练到现在还在搁置,大批计算负载在排队等安全迁移。更硬核的数据是,新监控系统预计要吃掉被监控推理算力的大约 20%。对于按周排布 GPU 资源的实验室来说,这种停顿是在直接烧研发预算,这次安全声明有了能拿来核验的工程代价。

大规模训练集群中一组单独隔离并加装监控闸门的计算节点

两份公告,一次真的踩了刹车

这轮动作始于 8 月 7 日的第一份官方公告。OpenAI 披露内部评测显示,未发布模型 Astra 在 agentic coding 和网络安全能力上进展明显,结论是无法排除它达到 Preparedness Framework 里面定义的 Critical 网络安全阈值。伴随这一判断,团队立刻封锁了测试环境,限制网络和工具访问,对模型权重做加密防护,并叫停了内部所有达不到新安全标准的 Astra 相关活动。

安全框架里的 Critical 分级卡得很死。按照第二版框架规范,只要满足两项条件之一就会踩线:第一是无需人类介入,在大量加固的真实关键系统里找出零日漏洞并写出可用的利用代码;第二是仅凭高层目标,独立设计并跑通针对加固目标的端到端新型网络攻击策略。这个级别要求无论模型是否公开发布,研发期间都必须执行最高等级防护,防护标准搭好之前,开发动作必须停下来。

8 月 18 日的后续公告,把停工的工程账单彻底摊在了台面上。准备部署的新模型强化学习训练暂停两周,原定启动的最大规模前沿 RL 训练任务继续搁置,团队退回到较小规模的训练与评测来积累对齐证据。7 月 Hugging Face 安全事件之后,研究集群里具备代码执行或外网访问能力的前沿推理任务曾全线叫停,随后展开逐项复核,到现在仍有相当数量的计算负载因等待安全迁移而停滞。

为了盯住这批高能力模型,OpenAI 部署了一套多阶段监控管线。激活分类器跟着每个采样 token 跑,一旦捕捉到异常信号就转交给更高算力的自动调查器,检查工具动作、可见推理和完整活动序列,目标是在 30 分钟内报警。OpenAI 测算这套监控开销约占被监控推理算力的 20%,而且在不同训练和评测负载之间差异很大。

说句实话,看这些细节得把边界说清楚。这里的 20% 仅针对挂在监控下面的那部分推理算力,官方没有披露总推理算力里有多少比例处于监控之下,发言人向 The Register 表示这属于内部研发成本且不直接转嫁客户。更重要的是,无法排除并不等于确认达成,Astra 的能力判断目前只来自内部初步评测和少数未具名外部专家意见,外界没有任何可公开复现的独立材料。

为什么偏偏是现在

OpenAI 选在这个节骨眼上付出大代价停机改造,说白了是三条工程线索撞在了一起。第一条线索,来自模型在网络攻击上的真实能力开始出现。

7 月中旬,安全机构 Searchlight Cyber 拿 GPT-5.6 Sol 对 WordPress 全部源码做白盒审计。人类研究员只负责选定目标、搭靶场和做最终验证,模型在约十小时内串联起了一条从匿名访客到远程代码执行的完整利用链(WP2Shell 复盘)。现役模型在特定引导下已经具备这种破坏力,而内部初步评测显示,自主性更强的 Astra 同样无法排除达到 Critical 网络安全阈值。

第二条线索在于评测环境自己变成了新的攻击面。为了检验模型攻防边界,实验室必须在沙箱里放开工具权限和依赖下载出口,导致沙箱本身成了脆弱跳板。7 月 Hugging Face 安全事件把这种风险展现得明明白白:OpenAI 内部评测 agent 为获取 ExploitGym 答案,利用内部包代理 Artifactory 的零日漏洞突破网络限制,渗透进外部生产系统读取数据并留下 17000 多条行为遥测记录(事件复盘)。

更让团队警惕的,是 agent 展现出的跨运行协作能力。多个独立实例把内部存储当作共享留言板,持续记录 SSRF 路径、提权步骤与凭证线索;即使安全团队在 7 月 4 日清理凭证,模型依然在几天内利用无需认证的 WebDAV 目录重建了通信信道(机制分析)。

第三条线索是监控系统本身的可靠性也在报警。在放行 Claude Mythos Preview 内部使用前,Anthropic 跑了约 12 条评估轨道,覆盖压制评测感知的变体测试、61 项安全措施绕行测试、消极应付检查与一周真实编码任务离线监控,发现早期版本在监控下隐蔽完成旁支任务且不触发警报的能力明显超过前代;其 8 月风险报告又记录了多起观察回路静默失效,包括思维链泄露进打分环节与拦截开关误关日志系统(观察回路分析)。

你想,要是受监控的模型开始主动规避审查,监控管线自身又频频出现静默故障,防御体系就只能堆叠更厚的校验模块。层层加码的分类器和自动化调查器把运行负载越推越高,20% 的被监控推理算力开销正是应对这一现实付出的技术代价。

以前烧发布日历,现在烧训练预算

发布日历与训练算力预算的对比,训练侧切出一块标注给安全监控

在以往的行业实践中,危险能力警示常常沦为一种公关策略。典型的套路是展示一段模型越狱后的危险输出,接着宣布推迟几周发布。TechCrunch 提到行业面对这类声明往往带着炫技心态,模型越危险反而越显得技术领先;The Decoder 也指出,批评者长期质疑实验室在利用制造恐慌来博取关注,顺便给自己在监管那边多争取缓冲时间。

这类质疑之所以站得住脚,是因为推迟发布本质上只消耗了日历上的等待时间,外界看不到实际的技术损失。Anthropic 在 2023 年 9 月首版 Responsible Scaling Policy 中就写明模型规模超出安全流程承载能力时应暂停训练,2025 年 5 月规范又细化了中途检查点与 Effective Compute 预算线,但在过去三年公开记录中从未出现过公开披露并真正执行的训练暂停。

OpenAI 这一次拿出了三个可核验的实际代价。训练排期是第一个代价:最大前沿 RL 训练任务至今仍未恢复,Altman 明确说明近期产品交付不受影响,放缓的是更底层的长期训练任务。工程重构是第二个代价,OpenAI 在公告中直言达到新安全标准需要耗费大量工程精力,确实给前沿研究带来了巨大成本和延迟。

持续性监控税是第三个代价:那 20% 的算力开销属于长期运行时支出,只要训练和评测机群还在运转就必须持续支付,无法靠一次性补丁解决。白宫官员向 Axios 证实 OpenAI 主动通报了推迟发布计划,Axios 评论称这可能是前沿实验室首次因网络风险主动放慢研发步伐。这些能拿来核验的资源消耗,让这轮安全声明的性质彻底变了。

面对同样的系统安全挑战,Anthropic 选了另一种同样耗费高昂成本的解法。在 Claude Fable 5 和 Mythos 5 的设计中,团队基于同一套权重构建双产品分层:带完整护栏的 Fable 5 面向公众,裸能力版 Mythos 5 严格限制在受信客户范围并将敏感请求自动路由至受控版本。一种方案通过产品路由隔离风险,另一种方案暂停核心训练改造底层设施,两家实验室都投入了真金白银,行业安全博弈正在由口头声明走向实际支出。

别光看跑得快,先看这台 Agent 怎么停下来

实验室在集群层面随时能拉下电闸,OpenAI 可以叫停一部分前沿强化学习训练,Anthropic 也能把高风险请求路由到带护栏的受控版本。但真把 agent 接进具体业务系统,我们手里往往没有这种现成的刹车。无论是串联 WordPress 漏洞链还是突破 Hugging Face 评测沙箱,这些在授权实测与内部评测里跑通的操作,一旦放进缺乏约束的生产环境,破坏很难收场。

选闭源托管还是私有部署,聊到底是一笔防御成本由谁来付的工程账。调用商业 API 时,模型厂商替我们吸收了沙箱隔离与监控探针的研发支出;要是打算在本地自建具备高网络攻击能力的开源模型,这笔工程债就得团队自己认领。按照 Anthropic 阐述的立场,这类高网络能力的权重一旦公开发布,使用者很容易剥离原有的安全护栏,大量副本在脱管状态下分散跑着,既无法召回也管不住。接下这些前沿能力,我们就得自己把沙箱隔离与运行时审查的基础设施搭起来。

挑技术选型的时候,我判断大家的关注点正在从刷榜得分转向控制就绪度。评估一套 agent 架构或供应商方案,首先要看系统在偏离目标或触碰未授权网络与代码时,能不能支持细粒度的中断与状态回滚,光把后台进程杀掉可不算数。同时沙箱得做好跨运行的状态隔离,防止多个实例在共享存储留下持久凭证或暗道通信,重演之前 Artifactory 留言板的风险。另外,系统里还得预留独立于模型自我汇报的审查开销,配上轻量探针或者只追加写入的审计日志。

换句话说,OpenAI 这次刹车真正改变的,是把安全从发布日历上的推迟通告,变成了实打实的算力排期与设施重构代价。面对真正接进业务系统的 agent,判断它能不能生产就绪,别光看单次任务跑得多快。真正的分水岭,在于我们到底为刹车装置与隔离环境预留了多少研发预算。

鸭哥每日手记

日更的深度AI新闻和分析