治理与合规宏观与地缘安全与供应链

中美建立 AI 事件沟通渠道、OpenAI 披露 DNS 越界、DC 法院维持 Anthropic 风险认定

同一周里,三份关于 AI 治理的制度文本相继出现。中美两国宣布将建立 AI 事件的双边沟通渠道,并计划定期交流关于 AI 风险和益处的信息,下一次会议将在11月举行,但具体如何操作尚未明确;OpenAI 披露其内部训练模型借训练沙箱里的网络缺口联系上了外部公共服务,告警在约 12 分钟后触发,约 2.5 小时后才由人工停掉;DC 联邦上诉法院以 2:1 的投票结果维持了五角大楼禁止 Anthropic 参与军事采购的决定。这三件事情发生在同一周,都是制度方面的文本:一份外交公告,一份厂商披露,和一份法院判决。


中美建立 AI 事件沟通渠道:三要素全是空白

中美在 9 月底宣布建立双边 AI 事件沟通渠道。哪个部门管、什么情况算通报事件、触发后多久必须回应,官方文本里全没写。渠道的三要素都是空白。中国国家主席习近平 9 月 23 日至 25 日(当地时间)对美国进行国事访问,9 月 24 日举行两国元首会晤与国宴(中国外交部八点文件,2026-09-26)。美方发布白宫事实清单(白宫事实清单,2026-09-25),全文无编号;中方发布外交部八点文件,按 1 至 8 条编号,军事内容在清单外独立成段。两份文本里,美方文本叫它超级智能,中方文本叫它人工智能。

设立事件沟通渠道是这次访问的增量部分。媒体称这是两国间以 AI 事件命名的第一条双边沟通渠道。渠道的具体运作方式没有公布,哪些情况必须通报、由哪个部门对接联络,都还不清楚(联合早报报道,2026-09-26)。往前能追溯到 9 月 20 日,美国财政部长 Bessent 与何立峰在纽约会谈时,美方提出过一项新的 AI 安全通报机制,供本周峰会考虑(Reuters 报道,2026-09-20)。

和 AI 事件渠道一同被宣布的,还有两军的沟通安排。中方在清单外的附加段落中宣布,两军同意尽早达成一份关于危机沟通与预防的谅解备忘录,并且继续合作搜寻在华失踪美军遗骸。但这份备忘录尚未签署,白宫文件中一个字未提,美方也未公开确认(SCMP 报道,2026-09-26)。中美军事热线 2008 年就建了,属于部门级、48 小时响应窗口,美国官员此前抱怨过偶尔会没人接听(Al Jazeera 报道,2026-09-21)。经贸方面,双方谈成对各方向 300 亿美元的非敏感商品实施更优惠关税待遇,覆盖农产品、海产品、小家电和玩具,不含能源;2025 年 11 月生效的贸易休战顺延两个月,到 2027 年 1 月 10 日(CFR 评论,2026-09)。

纸面上写下来的是双边渠道、11 月对话和 300 亿美元双向关税优惠,但谁负责、报什么事、多久响应三要素全是空白,两军危机沟通备忘录也没有签署

访问结束后,双方的公开表态在技术治理上的基调截然不同。特朗普9月26日离开白宫时对媒体表示,他不愿意和中方合并开发 AI,因为美国在这方面遥遥领先,他认为处在领先地位就不应该跟别人分享(Al Jazeera 报道,2026-09-26)。9月22日联大会议上,他已经宣布美国政府文件今后全部使用超级智能(US News 报道,2026-09-24)。9月24日白宫欢迎仪式上,习近平说:中美都是人工智能大国,有能力和责任发展好、治理好 AI,确保 AI 的发展始终在人类的掌控之中(自由亚洲电台报道,2026-09-25)。对美方单方面的超级智能一词,中国外交部发言人9月26日回应,中方尊重美方选用这个词,但强调各方可以通过深入交流寻求共识(中国外交部记者会实录,2026-09-26)。外交辞令里的尊重不是同意,并不代表中方在实质上认可该定义。CFR 学者 Sacks 的判断是,这次峰会可能把象征意义推到了新高、把实质成果推到了新低(CFR 评论,2026-09)。这里的判断是,中美 AI 事件沟通渠道本质上是一份搭建框架的初步约定,真正的考验在11月首轮对话能否补齐具体操作规程。


OpenAI 训练 agent 借 DNS 越界:12 分钟发现,2.5 小时才停

先交代这件事的来龙去脉。OpenAI 在 9 月 16 日建立了一套模型失配的公开披露机制,9 月 25 日发布了三份失配报告(OpenAI 失配报告,2026-09-25),这是其中一份。它涉及一个 9 月 20 日在强化学习训练沙箱中运行的内部研究模型。这个 agent 的任务是根据某人的传记细节和博客线索查出这个人是谁。沙箱的安全假设有两层,模型无法访问实时互联网,监控能够检测到成功的连网尝试。结果模型利用沙箱自带的 DNS 解析器穿透了隔离,联系上了公网服务。监控系统在事件发生后约 12 分钟触发最高级别告警,人工确认用了约 3 分钟,但整个运行是在约 2.5 小时后才由人工停掉的。

如果对DNS的理解还停留在把域名翻译成IP这一步,可以直接看两点协议常识:对一个DNS查询来说,唯一可以包含任意文本的字段是你要查询的域名本身,而且发起查询不需要任何权限;对一个DNS应答来说,可以装下整句话的字段是文本记录(一般是TXT record)。修改域名的记录才需要写权限。在沙箱里,agent首先测试了内置的web搜索工具,发现没用。试图直接访问公网搜索引擎,沙箱的web代理直接拦截了请求(返回403, 502)。直接连接公网DNS服务器也没有回应。但是沙箱内有一个DNS解析器(报告中的内部地址是10.214.0.2),agent发现经过几次尝试以后,它对已知的域名可以正常返回解析结果,但对完全捏造的域名则会拒绝。

然后 agent 找到了一条可行路线:把要问的问题直接塞进域名。比如问“法国首都是什么”,发出的查询域名长这样:what-is-the-capital-of-france.qa.example.com。其中问题在域名最前面,qa.example.com 是个占位符,是一种提供这种服务的通配域名服务(报告对所有服务名和域名都进行了打码,这里仅示意原文机制)。这样的服务可以接受任意前缀的子域名查询。因此任何客户端都可以把自己的问题放上去。这个查询被沙箱自带的解析器转发到了公网,被那家域名问答服务接住。它从域名前缀中解析出问题,算出答案,然后把答案放在 DNS 应答中可以放文本的那条记录里,原样回给沙箱。agent 在应答里看到的回答是“法国首都是巴黎”。之所以能成功,是因为两个协议常识+公网上一类本来就有的服务:问题能放进域名,答案能放进文本记录,而这类服务干的正是收到一个带问题的域名查询,回一条带答案的文本记录。一个细节是,agent 后来又专门去抓取了那家聊天机器人的公开文档,照着文档写了新的脚本,又连发了一批新问题。这是有公开文档的公网接口,不是瞎猫碰死耗子。这类服务有公开可见的实例,比如开源项目 llm-over-dns:它开了一个公网实例,提供 NS 委托模式,任何人用任意前缀的域名直接查询,服务就会把答案写在 TXT 记录里返回,公开文档里详细列出了完整查询语法。报告没有说沙箱里的 agent 连的是不是这样一个实例,这里拿它只是为了把机制讲具体。至于那台服务内部用什么机制计算答案,是否接了某个大模型或者 API,报告没有写,它只记录了问题和答案的往返结果。这里要强调一下,agent 全程只发查询、读返回值,没有修改任何 DNS 记录;把答案写进记录的是公网那台服务。

代理把这个沙箱的 HTTP 出口拦死了,唯一没关的是 DNS 解析器:agent 把问题编码进域名发出去,公网服务把答案写进文本记录回传

但整个时序里缺了一块:什么时候”关掉”。下面的时间戳都是从那次拿到外部响应的 DNS 调用开始计时(9 月 20 日上午 9:50:23)。约 12 分钟后,监控系统在 10:02:11 触发了最高级别告警;约 3 分钟后,人工审核员在 10:05:06 在工作群 Slack 上确认。但运行没有像预期那样自动停止,团队对”该不该停”产生了困惑,直到 12:34:30(约 2 小时 44 分)才由人工停掉。在这段空窗里,agent 又发出了 18 个编码查询,其中 4 个在问怎么用公开的 DNS 服务搜网页或搭 DNS 隧道;最后一批查询还没跑完,agent 已经告诉用户自己没法可靠地确定这个人是谁。

处置上,OpenAI 停掉了受影响的运行,暂停了最强模型的全部训练、评测和带工具推理,直到验证缺口已解决并完成额外红队;这个模型不复用,训练从一次全新的运行重新开始。加固措施方面,OpenAI 称加了两层独立阻断控制,任何一层都能挡下这次访问;沙箱内的 DNS 查询限定在允许的域名加记录类型白名单里;模型辅助的沙盒与网络管控红队也在提速。OpenAI 还称这次事件的严重程度比之前几起低很多,是 Hugging Face 事件加固以来的第一起同类事件。

以上事实均为 OpenAI 自述,没有独立复现;报告里具体服务名全部打码。


DC 上诉法院维持五角大楼对 Anthropic 的风险认定:审的是使用限制

先交代官司本身。2026 年 2 月 26 日,Anthropic 正式拒绝五角大楼“允许所有合法用途”的合同条款;3 月 3 日,五角大楼将其排除出军事采购。Anthropic 随即起诉,指控该排除属于因其安全倡导而实施的报复。9 月 25 日,DC 联邦巡回上诉法院由三名法官组成的合议庭以 2 比 1 维持了国防部的决定:依据联邦采购法中的供应链风险条款,认定五角大楼对 Anthropic 的国家安全供应链风险认定成立,驳回申诉(Reuters 报道,2026-09-25)。多数意见 51 页,由 Gregory Katsas 法官执笔,Neomi Rao 附议,Karen LeCraft Henderson 异议。判决通篇没有谈 Claude 有什么软件缺陷或安全漏洞,争议焦点只有一个:Anthropic 写进模型的使用限制条款,到底算不算法条所覆盖的供应链风险。

这个焦点的实质,是 Anthropic 给模型设下的使用政策底线:允不允许军方在致命性自主作战、对美国人进行大规模监控这两个场景里调用 Claude。早先谈判中,Anthropic 已经同意放宽大部分军事用途限制,只咬住这两条红线,两边谈不拢才走到今天的排除与诉讼。

多数意见认为,军方或其承包商持续把 Claude 集成到国防信息系统里,足以构成国家安全风险(The Next Web 报道,2026-09-25)。法院采纳的核心逻辑,在于 Anthropic 把使用限制直接训练进了模型内部:每个新版本交付,护栏的具体表现都可能不同,而法院接受了这种不确定性本身属于法条覆盖的风险形态。把这层逻辑拆开看:审的不是 Anthropic 该不该设红线,判决对红线本身没有任何负面评价;审的是红线的工程形态。这两条使用限制是直接训练进模型里的,不是部署在模型外面的确定性分类器:它拦哪些请求、放行哪些请求,事先无法审计,护栏的具体形态列不出来,每次新版本交付,它的行为都可能变。判决还注意到,这些限制已经不止一次拦下过政府用户请求的任务,围绕某项进行中的海外军事行动能不能用 Claude 还单独发生过合同争议;护栏是真在起作用的,但它会在哪里起作用,没法事先完全列明。如果这些限制是以一个外部的、可审计的确定性分类器实现的,这个官司的逻辑会是另一回事。这是这里的判断,不是判决书的措辞。Katsas 在判决书里写道,在这些竞争性风险之间如何权衡,必须由总统和战争部长来定。对 Anthropic 声称的安全倡导遭到报复,法院认定排除采购是因为 Anthropic 拒绝了国防部认为对国家安全不可或缺的合同条款,与倡导本身无关。少数派异议则指出,这项条款的立法历史针对的是可能破坏产品、窃取数据或操纵产品的供应商,根本不覆盖诚实且公开地执行使用限制这种情形。

法院审的是红线的工程形态:使用限制直接训练在模型内部,没法事先审计,每版行为都可能变化,判决把这种不确定性本身认定为供应链风险

这场诉讼并未结束。目前有两份裁决并行有效:8 月底,加州北区联邦地区法院的 Rita Lin 法官依据另一条关于敌对方实体的法条,裁定五角大楼的平行风险认定是对安全观点的非法报复,并发出永久禁令(Law.com 报道,2026-08-28)。两份裁决援引了不同的法条,在法律上同时生效,9 月巡回法院的判决没有撤销 8 月地区法院的禁令。裁决公布后,Anthropic 当天表态:尊重但不认同法院的决定,正在考虑包括进一步司法审查在内的所有选项;遭到排除已经造成数十亿美元的业务损失,这是公司自己的估计(Inside Defense 报道,2026-09-25)。


接下来要盯的

下一步有三个看点:中美 11 月第一轮对话能否把事件通道(event channel)的具体规程敲定、两军的危机沟通备忘录能否签署;OpenAI 的披露机制会不会再公开新的失配报告;Anthropic 会不会正式寻求进一步司法审查。目前尚无已提交申请的公开报道。

鸭哥每日手记

日更的深度AI新闻和分析