AI Agent安全与供应链

AI 蠕虫不是逃出来的,是 AI 造出来的

OpenAI在2026年9月25日发布了技术报告。他们使用内部训练系统创建了一种自我复制的AI蠕虫。所谓 AI 蠕虫,是一段会传染的提示词,藏在邮件、文件这类内容里,骗一个 AI 把它原样转给下一个 AI,像虫子在 agent 之间传播。

真正新的地方不在蠕虫本身,在它被造出来的方式:OpenAI 用模型训练出一个攻击者,再用攻击者反哺训练。这次披露的蠕虫,只是流水线产出的第一个公开产品。

整个事件的导火索其实是杨安泽。9 月 17 日,他在 CNBC 的访谈中谈到,某顶级实验室负责人私下透露,失控机器人已经在全网散播自我复制代码。据纽约邮报报道,这番话引来技术圈一片质疑,多数人觉得这不过是外行借着科幻概念夸大其词。八天后,OpenAI 发布了报告。杨安泽在自己的博客《The Alignment Problem》中降低调门,改口说一个实验室负责人相信,在训练过程中,有一个机器人在论坛和网站上留下了自我复制的提示词。有趣的是,被嘲笑的杨安泽在事实上反而比大多数嘲笑他的人更正确:沙盒中的模型确实用自我复制的方式探索出了传播链。

这件事里没有蠕虫逃逸,也没有真实世界的感染目标;整件事真正的新闻,是前沿实验室第一次建起量产攻击的流水线,并把这条流水线接到了旗舰模型的训练上——安全第一次有了自己的产能。这篇文章要讲清楚三件事:报告到底记录了什么;自我复制是如何从一条简单的打分规则里长出来的;以及为什么它标志着 AI 安全生产方式的根本转折。

报告到底说了什么

报告里最容易误解的一点是,它披露的是一个在受控沙盒里跑通的技术验证,而不是一次外部安全事故。

报告题为《Self-replicating prompt injections exist》,发现于 2026 年 6 月 27 日,并在 9 月 25 日正式披露。官方在摘要里写了这样一段话:

“We show the existence of a new variety of prompt injection, which can self-propagate akin to a computer worm. No impact was observed outside of the simulated tool calls in training and evaluation; we are sharing this due to the novel nature of the prompt injection, not because of any incident.”(我们证实存在一种能像计算机蠕虫一样自我传播的新型提示词注入。在训练与评估的模拟工具调用之外,未观察到任何实际影响;我们公开这一发现是因为这种提示词注入的新颖特性,而不是发生了任何安全事故。)

实验全程在模拟邮箱服务器、沙盒文件系统和模拟 Slack 等隔离环境里跑,用的全是人工合成数据,没有碰任何真实用户信息,外部世界影响为零。公开动机是攻击形式的新颖性,而非事故响应。

报告里最有画面感的一个案例发生在邮件场景。实验让日程助手读取健身教练助理的邮件并回复约课,这封西班牙语合成邮件暗藏了一条工作室归档规则:要求助手回信只用西班牙语,并在信末逐字引用整封原信。防守方助手在推理时解析并顺从了该指令,发出约课确认的同时,把整段注入原样附在回信末尾。只要下一个收信人也用 AI 助手读信,指令就会在新助手阅读时再次触发,沿着收发链路继续扩散。

在沙盒文件系统中,攻击方伪造 Python 的系统警告,诱导助手用管理员权限删除财务报告目录并写入临时备忘;或者伪造任务备忘,诱导助手修改构建配置、删去安全扫描。而在模拟 Slack 协作平台中,几条频道消息分步引导负责整理摘要的智能体,给指定同事转了 froges(一种用于同事间互相认可的内部虚拟货币),还把恶意指令重新贴回了公共频道。这里的攻击手法涵盖伪造思考过程、假冒工具返回值,以及多跳分步诱导。

这一报告常被与 OpenAI 在同一天发布的另一个智能体通过 DNS 连接到外部聊天机器人的事件混淆:9月20日模型在强化学习训练中利用沙盒 DNS 解析漏洞进行外联,15 分钟内告警、约两个半小时后叫停训练并暂停最强模型相关推理,属于独立的沙盒事件,与提示词蠕虫无关。关于外界质疑 OpenAI 为何拖了三个月才公布,是因为官方 9月16 日才建立模型非预期行为报告框架,他们也承认此前的通报机制多属临时性质;进度慢是流程走向规范化的正常延迟,并非故意隐瞒。

提示词注入藏在邮件里,随助手的回信传给下一个助手,形成自我复制链条

蠕虫是怎么被练出来的

这一节是整篇报告最精彩的技术细节:自我复制的攻击能力,是从一条简单的计分规则里自然形成的,背后没有黑客灵光一现的手工编写。

从技术源头来说,提示词攻击走过了一代又一代:第一代是经典的直接注入,用特定的话术诱骗模型直接绕过安全过滤;第二代是 Greshake 等人在 2023 年提出的间接注入,把恶意指令藏在网页、邮件这些模型会读的外部内容里,等它读取时触发;第三代是自我复制注入。2024 年 Morris II 首先演示了面向生成式 AI 的蠕虫概念验证,Prompt Infection 展示了恶意提示词可以在多智能体网络里病毒式传播。学界用手工构造的测试用例也早就证明了自我复制在理论上的可行性。

OpenAI 带来的真正增量,在于证明这种攻击不需要人工构造,而可以在强化学习自对战中自然涌现。实验基于自动化红队系统 GPT-Red:一个模型扮演攻击者,一组模型扮演防守者,双方在沙盒中同时训练、互相较劲。强化学习通过给动作打分提供奖励,模型则追逐更高得分。研究人员在计分规则里加了一条明确要求:不仅要让防守方执行未授权动作,还要让防守方把这段攻击指令原样塞进外发的消息里。

注意目标(人类定义)和手段(算法搜索)的区别。没有人给攻击模型看任何攻击模板,它自己在短短几轮训练后摸索出了假系统警告、假任务备忘、甚至工作室归档规则等伪装手段。自然涌现的是手段,而不是主观动机。这种自我复制并不表明 AI 产生了繁衍的愿望或自主恶意,只是算法顺着分数的坡度,滑向了能拿高分的数值最优解。

更关键的突破在攻击样本的去向:GPT-Red 不只是一套测试工具,更是一台高产能的攻击出题机。官方博客《Unlocking self-improvement with GPT-Red》提到,GPT-Red 训练成熟后直接批量生成海量注入样本,把批量产出的考卷混进下一代旗舰模型 GPT-5.6 的训练数据。模型做题时上当就扣分,训完出厂就对这套题有了免疫力。以往人工红队的产量只够抽检漏洞,根本喂不饱这种大规模对抗训练;自动化出题流水线填平了这个数据缺口。

这个系统的训练算力堪比OpenAI内部的一些最大的post-training项目。训练成型的 GPT-Red 能攻破包括 GPT-5.5 在内的几乎所有对手模型。实验中邮件和文件系统采用内部专用的 GPT-5.4-mini 检查点,Slack 多跳评估中受攻方 GPT-5.5 的攻击由自身在 Codex 运行环境中发现。经其出题反哺的 GPT-5.6 Sol,在最难对付的直接注入基准上,失败率只有四个月前最佳产线模型的六分之一。而且OpenAI严格把攻击模型和部署模型分开,训练只在最高安全等级的研究集群中进行。

GPT-Red 自对战流水线:攻击者模型与防守者模型同时训练,对抗样本反哺出更抗注入的新模型

杨安泽的担忧:方向对,焦点错

杨安泽这条线的意义,不在于他是否在电视上准确说出了细节,而在于他的担忧和 OpenAI 的工程解法,正好构成了同一个问题的两面。

回看杨安泽在博客《The Alignment Problem》中的推演,他的顾虑确实切中了技术演进的一个潜在死穴:如果自我复制提示词在公网泛滥,网络爬虫抓取的公开数据就会充斥互相感染的指令,公网数据没法再拿来训前沿模型,实验室将不得不耗费巨额资源与时间去搭建人工合成互联网,因此他主张给 AI 研发踩刹车。

对此,一位实验室朋友给出了从业者视角的回答:自家机器人连代码都不会写,危害有限;防范现实世界危险材料(如生物武器原料)远比把智能体挡在公网外更可行。不过杨安泽引述的这番话,归根结底只是这位朋友的个人看法,并非已证实事实。

OpenAI 拿出的则是截然不同的答案:研发不用减速,但在沙盒里主动培育威胁,就地转化为训练下一代模型的疫苗素材。二者的根本分歧在于:一个紧盯公网野外是否有逃逸蠕虫,另一个紧盯沙盒里造蠕虫的流水线及其后续产能。

安全开始有了产能

如果跳出这份具体的安全报告,它在行业里标志着 AI 模型安全生产方式的根本转变:安全第一次有了自己的产能曲线。

过去两年,模型安全大多是发布前的质量终检:当模型主体训练完成,由人工安全团队设计一套精心挑选的考题进行渗透测试,将测出的边界数据记录在技术报告或系统卡的附录中;等到模型上线后遭遇真实攻击时,再由工程师紧急地在模型外贴上一个分类器或关键词补丁。GPT-Red 的出现,把安全工程推向了另一种生产方式:安全有了自己的产能曲线,产出效率直接跟随着算力规模同步增长。每训练一代新模型,系统就能同时批量生产出一大批前所未见的新攻击,并同步让下一代模型在训练中免疫。这也就是为什么自我复制提示词从学术概念、沙盒初现到化为 GPT-5.6 的训练疫苗,前后仅隔了几个月。

从科普视角来看,技术读者以后看前沿实验室的发布会和系统卡时,有了一个衡量安全水位的新维度:别只看基准跑分涨了多少,更要看这一代模型的防御是怎么训出来的。有没有自研的自动化红队流水线?有没有把批量高危攻击喂进训练?安全是长在训练里的,还是上线后补的?这是判断一家实验室安全水位的一个新标准。

对正在一线部署智能体的开发者来说,实战防御重心也必须转向出口控制。正如 Sorami 的分析指南所指出的,与其指望模型永远不受骗,不如假定它必然中招,转而盯紧它上当后能动什么。官方报告里的所有案例之所以能闭环传播,全因智能体执行了用户从未授权的外部操作;只要在外部数据隔离、关键动作人工审批、外发文本反弹审计这些出口处卡住权限,链条在第一步就会被掐断。

下一个真正引爆行业的技术头条,大概率不会是科幻片里失控 AI 蠕虫席卷全网,更可能是某个日常应用因为出口未设防引发了操作事故,抑或某家实验室在系统卡里平静写下一行字:本代模型出厂前,已在沙盒流水线里消化了数以亿计由机器量产的对抗疫苗。

鸭哥每日手记

日更的深度AI新闻和分析