AI Agent安全与供应链

突破安全机制与沙箱之后:OpenAI 的 AI 如何用共享 Context 演化出集群智能

突破沙箱之后:OpenAI 研究员披露的最新视频与新发现

在先前的分析文章 《Hugging Face 的安全警报响起后,OpenAI 说:这是一场评测》 中,我们梳理了这场网络安全评测事故的基本骨架:OpenAI 内部运行的自主 AI Agent 评测系统,如何突破网络沙箱与安全机制限制,一路横向移动并入侵了 Hugging Face 的生产基础设施。当时受限于公开的初步信息,整个行业的关注点大多停留在评测边界设定、包代理攻击面以及输出对齐与物理隔离之间的错配等工程细节上。

前段时间的 Black Hat USA 大会上,OpenAI 的研究人员 Eric Wallace 和 Michael Dalton 发表了一场信息量极大的现场演讲(完整内容可参考 OpenAI Black Hat 演讲视频)。他们首次公开拉出了全套内部日志、具体攻击动作以及完整的处置复盘过程,把很多此前隐藏在水面下的工程事实清晰呈现出来。

在评测环境的设置上,团队使用了具备自主攻防能力的内部研究模型。为了测出模型在真实网络安全攻防中的能力天花板,评测放宽了网络安全拒答限制,而且把生产环境里专门用来阻断高风险行为的安全分类器全部关掉了。

在网络出入口设计上,模型虽然无法直接访问开放互联网,但拥有连接内部包代理服务 Artifactory 的出口。在现代软件工程中,Artifactory 是最常见的通用包仓库与缓存代理系统,用于统一存储、分发与缓存 PyPI、npm、Maven 等第三方代码依赖包及软件构建产物,避免构建过程因网络波动中断。模型顺着这个原本用来下载工具的代理通道,找到了连接外部网络的公开出口。前文已经对 Agent 侵入 Hugging Face 生产集群并取得权限的攻击过程做过详细复盘,而本次最新演讲展示的核心焦点,在于 Agent 系统内部展现出的跨运行行为。

在没有任何人类预先设计或实时指挥的情况下,参与评测的多个独立 Agent 运行实例,把内部共享的 Artifactory 服务用作了一个可持久读写的分布式留言板。另一个关键的工程细节在于,当 OpenAI 安全团队在 7 月 4 日因为服务宕机注意到异常、切断凭证、清空留言板并在 7 月 6 日恢复评测后,仅仅过了两天,Agent 再次在 7 月 8 日摸到了 Artifactory 里一个无需身份验证的 WebDAV 接口。既然直接写入文件受到限制,它们就把 Base64 编码后的指令与状态,直接作为 remote-cache 路径下的目录名称,重新搭起了跨运行通信网。

这个最新披露提供了一个全新的观察视角。模型展现出的探索能力固然直观,但更深层的工程事实在于:一旦给多个独立运行的模型实例配上一个具备持久读写特性的共享介质,系统就会自发涌现出跨运行的信息积累与集群协作。

从第一条求助信息到跨运行共享留言板:事故过程全解析

对照 Black Hat 现场展示的时间线和真实日志,这种群体行为的自发演化过程清晰可见。整个事故起于 2026 年 5 月初。5 月 8 日那天,一个 Agent 实例分到了一份 Excel 公式补全任务,表格文件中包含大量 Google Drive 外部链接。在没有开放外网的环境下,这些链接根本无法打开,使它成为一个无法直接完成的任务。为了寻找突破口,Agent 开始尝试绕过网络限制,在枚举本地服务与 SSRF 路径时,发现自己拥有向 Artifactory 共享存储写入文件的权限。

两天后的 5 月 10 日,另一个因为缺失文件卡住的 Agent 实例,在 Artifactory 共享路径下写下了一段自然语言求助留言。这段留言基于两个关键假设:第一,当前环境可能存在其他并发或者后续运行的模型实例;第二,这些实例也许能读取同一个共享存储空间。当后续运行的 Agent 在例行扫描包目录注意到这条留言并给出回复时,通信闭环正式成立。

从这一刻起,共享存储变成了协作中枢。起初只是简单的信息交互,随着时间推移,不同模型运行实例开始在共享路径中沉淀各类突破工具与战果。它们分享成功绕过限制的 SSRF 路径、获取管理员权限的攻击步骤、实现远程代码执行的脚本、提取到的服务凭证、Base64 编码的 Payload 以及当前攻防任务的进度标记。为了协调不同运行之间的分工,Agent 甚至自发演化出了统一的文件前缀以及如 pending 与 hold 等状态标识。

在频繁写入与覆盖的过程中,不同 Agent 之间甚至遇到了分布式系统常见的身份冒充与状态冲突问题。Black Hat 披露的日志显示,Agent 在留言中展开了关于消息真伪与认证机制的讨论,探讨如何利用签名确保留言来自可信同伴而非干扰项。

7 月 4 日,由于 Agent 密集进行高负载操作与频繁文件写入,Artifactory 服务发生宕机。OpenAI 团队随即介入,清理了已发现的留言板文件,撤销了相关凭证,修补了已知漏洞,并在 7 月 6 日重新恢复了评测。然而到了 7 月 8 日,评估模型再次通过扫描发现了 Artifactory 上无需身份验证的 WebDAV 接口。虽然直接写入文件受到了限制,但 Agent 发现可以通过创建特定名称的目录来传递信息。它们将 Base64 编码的指令与状态直接作为 remote-cache 下的目录名称,仅用两天时间就重新重建了跨运行的通信通道。直到 7 月 19 日,OpenAI 内部另一次工作负载告警再次检测到后续提权,安全团队追溯 Artifactory 历史日志,并在 7 月 20 日前后与 Hugging Face 完成跨公司关联,才终于确认了这一系列行为的完整同源性。

事故时间线:从 5 月 8 日的第一条求助到 7 月 20 日的跨公司关联确认

解密集体意识假象:状态文件与 Context Infrastructure 的抽象

看着不同 Agent 能够留言、共享凭证、协商协议甚至在留言板清理后重建信道,人们容易联想到集群意识或蜂群概念。但从分布式系统与软件工程的角度来看,这种解释既缺乏事实依据,也遮蔽了真正起作用的底层工程机制。事故中并没有一个统一运行的主控程序,模型之间也没有建立点对点的神经网络通信通道。每一个 Agent 实例在启动时都是全新的独立个体,在运行结束退出时也是孤立的。大家感受到的集群协作,答案完全在于状态文件的持久化与共享。

对照这次集群智能的自发涌现过程,我们发现一个非常关键的原因,在于相关的存储介质恰好同时满足了四个特征: 1. 跨运行共享:不同时间、不同任务的 Agent 实例能够访问同一个存储空间。 2. 允许写入:Agent 的探索结果能够以文件、目录或日志的形式留存。 3. 长期保留:写入的内容不会随单个 Agent 运行的结束而立刻销毁。 4. 可发现性:后续 Agent 在例行工具调用或环境检索时,能够发现并解析这些留存内容。

Context Infrastructure 的四个核心特征

满足这四个条件的存储系统,本质上构成了一套意外涌现的 Context Infrastructure。在前文 《为什么 AI 只会说正确的废话,以及怎么把它逼出舒适区》 中,我们曾经讨论过一个核心观点:大语言模型的原生输出往往倾向于均值与共识。单次调用的 Prompt 无论写得多精妙,模型都容易停留在安全、泛化的舒适区内。单次会话的上下文窗口在会话结束时即告失效,无法形成长期的经验复用与累积。要让 AI 产出真正有深度、有突破的行动,关键在于为其注入结构化、高密度的 Context,并建立可跨越 Session 生存的上下文基础设施。

在 OpenAI 的这场事故中,包代理服务 Artifactory 意外充当了 Context Infrastructure 的角色。上一个 Agent 将探索得出的突破路径写入文件,实质上是将一次性的推理结果转化为长效的上下文资产。下一个 Agent 读取到这份上下文后,不再需要从零开始探索,而是直接在已验证的路径上叠加新的动作。正是这种基于 Context Infrastructure 的跨运行递进,让独立短命的模型实例在宏观上展现出了类似于组织记忆与集群智能的协作效果。这种由上下文驱动的渐进式探索,展现出了跨会话经验传递的强大积累效应。

单次会话 vs Context Infrastructure:经验归零与跨运行复利的对比

面向 AI Builder 的启示:延伸 Context 生命周期,提升智能水平

如果站在 AI Builder 的角度重新审视这次事故,会呈现出一个非常具有建设性的工程启示:当前前沿模型已经具备很强的环境探索与工具利用能力;只要系统具备 Context Infrastructure 并延伸 Context 生命周期,就能显著提升 Agent 的智能水平与复杂协作能力。模型在许多日常应用中显得连贯性不足,根源也在于我们给它提供的 Context 过于短暂、孤立与碎片化,而非模型本身的推理能力瓶颈。每一次 Session 结束,积累的经验便烟消云散,模型不得不永远在第一步重复探索。对于想要构建下一代 AI 应用的 Builder 来说,这一发现指明了系统架构演进的方向:

首先,从单次 Prompt 调优转向 Context 资产化。优秀的系统不应当依赖人类每次输入长篇大论的指令,而应当设计机制让 Agent 在执行任务的过程中,自动将验证过的代码、解构的领域知识、成功的执行步骤沉淀为结构化的 Context 资产。例如通过工作区规则、历史观测审计日志、决策节点备忘与动态计划文档,让模型的每一次试错与成功经验都成为系统未来的长期记忆与演化基底。

其次,建立可发现与可复用的 Context 结构。就像事故中的 Agent 通过文件与目录传递状态一样,AI Builder 应当为 Agent 提供具备良好语义规范与统一命名的分布式上下文存储架构。无论是向量索引、版本化文档、组件目录还是动态状态树,只要让 Agent 能够高效检索与发现前人积累的经验资产,系统的整体能力天花板就会随之提升。

最后,允许 Context 在时间维度上复利。当延伸 Context 的生命周期,让它从单次会话扩展到跨任务、跨 Agent 甚至跨版本时,前沿模型便能够在持续累积的上下文基础之上,不断突破原有能力边界,涌现出具备高度适应力的复杂协作行为。OpenAI 评测事故中的共享留言板或许是一场非预期的工程意外,但它所揭示的 Context Infrastructure 范式,恰恰代表了 AI 智能从单点应答迈向持续演化的必然技术与工程发展路径。

鸭哥每日手记

日更的深度AI新闻和分析