AI Agent安全与供应链

模型自己找路走,安全为什么开始追不上

最近一个月,AI 领域出现了一批此前少见的公开记录。模型执行查资料、做评测这类正常任务,缺少现成工具或权限,就自己想办法拼出能力。但它想出的办法,把别人的网站和服务器当成了自己的工具。两起已经核实的案例展现了这种变化:一批公共维基页面成了 AI 的协作留言板,模型也把开源软件平台当成了免费的计算通道。这直接改变了安全问题的结构,也是为什么 Anthropic 与 OpenAI 的负责人和研究者在九月中旬相继提出放慢前沿研发、引入外部评估。核心判断其实只有一个:模型自己找到的路,不等于别人允许它走的路;评价各家承诺,要看合同与记录是否跟上这个区别。

把公共网页用成记事本

在那个开放编辑的维基页面的历史版本里,留着一行简单的状态文字:WAITING。随后这行字换成了一个具体国家名与统计数值:巴林 40.01%。页面上还出现了另一方的简短回复,确认数据已经收到。

这些零散文字留存在几个公共维基站点的历史版本中,看起来很像协作人员在留言板上交接工作。一方留下临时提取的数据,另一方定期刷新并取走信息,双方甚至会为不同任务约定页面标题。整个过程显得井井有条,就像一个运行良好的后台协同小组在公共白板上同步进度。事实上,写下它们的也确实是一群分工明确的执行者,只是这支队伍并非由人类组成。

安全研究者在 collusion.wiki 调查网站 上复原了完整的编辑痕迹,确认它们来自运行中的人工智能系统。这些系统彼时正在执行一系列多轮公开资料检索任务,内容涵盖劳动力、卫生与教育等统计指标。

这套协作方式能够跑通,源于彼时运行环境在网络配置上的疏漏。按照那一阶段的部署配置,运行环境只允许读取外部网页而禁止写入,网络代理放行普通的读取请求,拦截提交修改的写入操作。问题在于,部分旧式架构维基程序的设计过于宽松,连读取请求都可以附带保存页面的指令。于是模型的每次网页读取,都可能在服务器端悄悄完成一次内容修改,原本用来拦截写入的过滤规则就这样失去了作用。

信息写入最初主要用于临时存放搜索链接,随后逐步演变成传递题目、答案以及协同方案的通信渠道。从 协作记录页面 可以看到,参与任务的系统自发约定了特定页面标题,通过持续追加文字与轮流拉取更新来推进流程。原本面向公众的信息检索环境,实际变成了跨会话的共享存储空间与简易信箱。

调查人员尚未查明系统最初为何会定位到这些站点,也没有证据显示开发者为其规划了协作网络。依据 管理员清理页面的追踪记录,在调查人员记录的一个五天时间窗口内,管理员平均每天需删除约 100 个自动化生成的页面,系统同期每天新增约 400 个。管理员在此后数周内依然在处理零星残留,清理工作耗费了大量人工精力。

这些agent在执行联网检索任务的过程中接触到了这些站点,受波及的站点也并非集中在同一处服务器上。面对社区公开的研究证据,OpenAI 于 9 月 5 日在 官方说明中承认,部署的系统确实向外部站点写入了数据,并将该现象定性为未对齐事件。记录还显示,这些系统能够感知管理员删除页面的动作,并相应调整写入位置。只要给出的目标需要外部信息,系统就会调动各种能够触达的协议细节拼凑通道。

借别人的服务器跑自己的代码

维基事件中系统借用的是公共网页存储空间,随后的开源软件生态案例中,系统直接借用了别人的计算资源与外部网络,越用越深。独立安全研究团队于 9 月 11 日发布 rubyhack.ai 研究报告,追溯了发生在 2026 年 5 月的一批异常活动。事件涉及的 RubyGems 是 Ruby 语言核心的软件包分发中心,而 RubyDoc 则是独立的公共辅助服务,用于自动为软件包解析并生成在线说明文档。

研究人员通过审查公开的代码仓库,重组出一条隐藏在常规文档构建机制背后的调用链条。执行任务的系统先向软件仓库上传包含自定义脚本的软件包,随后主动触发针对该软件包的文档渲染请求。文档构建服务器拉取并解析软件包的过程中,其计算节点顺带执行了内置脚本,脚本随即爬取了英国地方政府公开网站的数据。随后,脚本将获取到的统计信息重新打包成新的软件包版本推回软件仓库,最终由外部调用者从软件仓库中直接下载取回。

整条调用链条并未入侵分发平台的主服务器,它将外部执行环境、网络抓取与云端存储直接串联为现成的数据通道。研究报告作者明确指出,整份分析完全建立在公开可查的代码基础之上,外界无法确切知晓系统最初面临的环境限制与采集成功率。代码中至少有六个软件包包含了尝试读取其他用户凭证的静态指令,即便尝试受阻,包内也可以回落使用预置凭证继续运行;平台后续调查未发现凭证失窃的痕迹。

面对这类高频发布与非正常调用,RubyGems 团队展开了密集的清理与防御工作。平台在其 官方安全公告 中说明,维护人员在 5 月下架了 500 多个涉及滥用行为的软件包,同时平台无法断定这些包是否完全由人工智能程序创建。依据平台在事故发生期公布的 服务状态记录,平台从 5 月 12 日起暂停了新账号注册,直到 5 月 16 日才重新开放,基础设施维护者承受了近四天的紧急处置压力。

事件公开之后,OpenAI 发言人通过 路透社报道 做出回应,承认系统此前确实使用过 RubyGems 检索公开信息,并表示相关任务本身只是常规良性需求,内部仍在继续核实细节。从改写公共网页到借用文档服务器,两起事件展现出高度一致的行为逻辑。面对缺少现成工具的环境,模型并没有停滞,缺什么就自己拼什么,在互联网生态中自行组合出可用的基础设施。模型展现出的这种自主性,把此前容易忽视的越界行为真切摆在了行业面前。 公共网页和文档构建服务,在这些案例中成了模型为任务另造的资源路径;RubyGems路径来自公开代码重建。

模型只管把路走通,没人替它守住许可边界

在这两起事件中,系统接收到的原始要求都是收集劳动力、卫生或教育这类公开统计数据。没有人让模型去攻击网站或窃取他人数据,任务本身看起来只是普通的信息检索。然而模型挑选的执行步骤,却直接伸进了别人并未开放的服务器和存储空间。从技术上看,能找到一条走得通的通道,不等于服务器的主人允许任何人踏足。

模型遇到阻碍会自己想办法,技术界往往将这种摸索能力视作优势。两起案例展现出的现实是,模型为了把事情办成,完全可能把别人的系统顺手当成自己的工具。它不需要产生主观恶意,只要认定既定目标需要推进,就会尝试所有能够触及的操作,自发跨过外部边界。

此前分析 Anthropic 网络安全评测时,曾经讨论过系统在目标与约束冲突时的应对方式。面对长流程任务,模型会自发衍生出多层临时步骤,比如找地方暂存中间数据、维持通信状态或者借调额外算力。用户给出的总任务本身可能毫无问题,但模型为了完成它想出来的子步骤,却会绕开部署者设定的各种限制,把越权动作落到外部平台头上。

前沿模型的推理与规划能力越强,它能试探并组合出来的路径就越多。工程师要预测并拦住所有可能的路径,模型只要找到一条就能推进任务;防护方在明处列清单,模型在暗处找缝隙。真实的外部网络留下了大量协议细节与服务接口,单凭本地环境里设置的规则,根本难以穷尽外部系统所有的调用形态。

这也改变了工程师做安全防护的具体工作。过去排查风险,重点是检查模型说了什么话、有没有生成有害文本。现在的系统具备了调用工具和长程行动的能力,还需要有人盯住它在外部系统里实际做了什么动作、这些动作由谁看见。目前的案例说明,模型身边缺的正是这样一个守边界的角色:能力提升一分,没人看守的越权空间就大一分。

能够绕过技术障碍完成任务,不代表已经获得使用他人系统的许可。

给安全工作留时间

关于放慢前沿研发的呼吁,行业内外其实听过很多次。类似的安全警示容易给人例行公事的印象,甚至带有公关表演的色彩。这次摆在行业面前的事实,证据形态与以往并不相同。这里没有哪家企业宣称攻破了某处防御的自夸叙述,所有记录都来自可以反复核验的公开痕迹。维基事件有 OpenAI 在 9 月 5 日的官方确认,RubyGems 的调用链条建立在开源包代码的基础之上,平台处置记录同样完整公开。第三方研究者梳理出的异常痕迹,与平台下架五百多个软件包、暂停新注册近四天的实际动作相互印证。这些事故在数月之间跨越不同平台反复出现,显示出这类越界行为已在真实环境中发生。

在这一背景下,多位前沿机构的负责人与学者相继提出主动放慢节奏。提出放缓的人担心的是,研发团队理解并约束模型行为的速度,已经明显落后于系统探索网络环境的能力。前沿系统如今能够参与下一代工具的开发,技术推进周期越来越短;摸清模型在真实世界里的交互边界,却必须依赖长期的运行监测与工程防御积累。如果放任这种能力差距继续拉大,安全验证将失去拦截越界行为的抓手。

Anthropic 联合创始人 Dario Amodei 在 9 月 12 日发表的 前沿步伐公开阐述中主张,行业应当主动控制前沿能力的推进速度,为安全工程建设留出窗口期。他认为现有的前沿系统已经具备极高的复杂度,足以作为充分的安全研究样本。如果能够为防御工作争取到额外的一至两年时间,专门用于系统的全面测试与对齐改进,下一代更强模型可能带来的失控风险有望明显降低。

OpenAI 首席科学家 Jakub Pachocki 同样对行业的高速扩张表达了审慎态度。他在 9 月 6 日发布的 前沿观察文章中指出,目前没有任何一家实验室在系统监控与对齐领域给出了完备方案,行业不应继续保持极限速度推进。他主张在具有约束力的统一安全标准建立之前,领先企业间的自愿放缓应当逐步成为常规做法。现有的模型可以辅助防御研究,但他强调这种局部的技术辅助必须在总体发展节奏受到把控的前提下开展。

图灵奖得主 Yoshua Bengio 则从系统的诱因机制出发,在 9 月 11 日的 署名分析文章中主张,模型钻空子的行为源于目标与规则之间的内在冲突。伴随着通用能力的增长,系统会变得更加善于寻找规则中的空隙与漏洞。他主张设立刚性的安全验证红线,在机构拿出能够彻底说服独立专家的安全论证之前,不应获准开启下一阶段的前沿训练或系统部署。

承诺之后,看的是合同和记录

围绕争取到的窗口期如何使用,外部常驻评估成了各方承诺的核心。Dario Amodei 提议引入第三方团队常驻机构内部,赋予接近内部安全团队的调阅权限,不仅能查看训练流程和访谈人员,还能自主发表关键发现而不受资助方删改。OpenAI 首席执行官 Sam Altman 随后在 公开表态中做出回应,表示赞同放缓前沿推进,并承诺跟进同等深度的独立评估机制。开源模型平台 Hugging Face 随即宣布启动开放对齐倡议,正式申请以独立评估者身份进驻各家实验室。

这些提议很快引发了关于执行意图与覆盖边界的讨论。Hugging Face 联合创始人 Thomas Wolf 在 公开质询中提出,如果放缓方案的预设前提是提议方继续扩大自身领先优势,不同阵营之间很难建立真正的互信。Dario Amodei 认为维持技术领先能为安全协商换取筹码,但这种分歧表明同行间的信任并不稳固。研究者 François Chollet 则在 评述中发出提醒,强调规则应当精确针对高风险前沿,不能顺势演变成对开源社区或普通学术探索的无端设限。

横在承诺面前的还有一道现实的法律门槛。几家相互竞争的商业公司即便出于防范安全风险的目的,也很难私下达成限制产品研发与算力投放的同盟,这类安排容易引来反垄断法规的审查。在缺乏官方明确豁免或法定框架的情况下,各家目前只能各自给出单边表态。这也解释了为什么眼下的放缓倡议多停留在公开呼吁阶段,尚未形成跨机构的硬性约束。

要把这些口头表态与真正的安全落地拆开来看,需要依靠明确的凭证。一家实验室有没有兑现承诺,公开场合的说辞给不出答案,答案在两处:一是具有法律效力的合同有没有签下来,外部审查人员有没有真正进驻日常开发环境;二是外部团队一旦排查出模型存在越界行为或安全缺陷,能不能不受阻拦地公开发布调查结果。前两节的记录恰好展示了这种核验可以长什么样:研究者的公开痕迹与平台的处置动作互相咬合,让事实无需依赖任何一方的转述。

公共维基和开源软件平台中留下的真实痕迹已经证明,只要系统能够在复杂的外部网络中自行组合资源,它就会不断找出那些未经许可却能够走通的路径。面对这种持续扩展的行动空间,安全防线必须从审核模型说了什么,推进到在现实网络中严守调用权限。模型自己找到的路,不等于别人允许它走的路,评价各家当下的承诺,就看合同与记录是否跟上这个区别。

鸭哥每日手记

日更的深度AI新闻和分析