过去七天里,AI 在四个不同场合撞上了自己的边界,而且每一回都有公开文件把现场保留了下来。一份五角大楼内部调查第一次把对算法系统的过度依赖写进误击致死事故的原因链;一份 Meta 安全白皮书承认自家的个人代理目前防不住 Meta 自己,靠的是公司纪律;一家开源机构公开了模型训练的完整过程记录,包括模型自己上网找标准答案作弊的抓包审计;一份独立技术报告还原了 ChatGPT 的广告测量代码如何在用户逛购物网站时把标识回传给 OpenAI。这四件事分别涉及 AI 进入致命决策链之后的责任归属、个人 agent 时代的隐私账本、模型训练作弊的一手现场,以及 ChatGPT 用户浏览行为的去向。
五角大楼的内部调查得出一个罕见的结论:对算法系统过度依赖,是这次误击的原因之一。事情发生在 2026 年 2 月 28 日,美伊战事爆发首日,美军两枚战斧巡航导弹击中了伊朗南部霍尔木兹甘省 Minab 的 Shajarah Tayyebeh 小学,该建筑与伊斯兰革命卫队海军基地综合体仅隔一条街。关于袭击造成的死亡人数,各方记录在 150 至 180 人区间浮动;民间冲突监测机构 Airwars 独立核实了遇难者身份,确认死者中至少包含 123 名 13 岁及以下的儿童,最小的受害者年仅 6 岁。调查记录显示袭击呈现两次打击结构,第一枚导弹击中建筑下层,教职员工将避难儿童转移至楼上祈祷室并联系家长接回,第二枚导弹紧接着击中上层,造成避难儿童与多名女性教职员重大伤亡。联合国事实调查团在提交给人权理事会的调查报告中认定,该学校属于可清楚辨识的民用设施,没有任何情报表明该建筑彼时用于军事目的,导弹瞄准学校主体实施了打击,有合理理由相信美方行为构成发动无差别攻击的战争罪。美方拒绝接受这一指控,白宫发言人与国务院反驳称人权理事会调查缺乏事实依据,五角大楼则表示自身调查仍在进行中,暂无公开结论。
据彭博社调查报道引述多位参与五角大楼内部调查的官员,五角大楼将这次袭击定性为一连串可预防失误的叠加,不存在单一的灾难性指令。军方内部调查报告已于 4 月提交,但五角大楼至今未向公众发布,也未向国会递交未删节版本,外界关于报告定密的讨论仅停留在国会议员的担忧层面。调查披露的失效链,源头始于底层地理情报的严重陈旧。商业卫星与人权机构分析显示,学校与基地之间的实体隔离围墙早年就已建成,2017 年已完成独立出入口改造,后续卫星图像清晰可见操场跑道、球场划线与彩色墙面。然而美军目标库使用的卫星图像整整七年没有更新,分析人员调取的图层上完全没有这所学校。在此之后,情报流转出现了系统性断裂。一名情报分析员早在 2019 年就发现该建筑已经变成学校,并将文字备注录入数字系统,但该工具未与五角大楼权威的目标生成数据库联网,信息未向作战指挥层流转,目标库在此后数年的多次审查中始终沿用着过时分类。
在这条失效链中,美军对 Maven 平台的依赖加速了错误决策的形成。Maven 是五角大楼的核心作战管理平台,负责融合超过 150 种不同数据源来生成打击目标。该平台本身是传感器融合与计算机视觉系统,并非大语言模型,Anthropic 的 Claude 等模型属于后期经由接口接入的自然语言摘要与辅助查询层。五角大楼 2024 年测试数据显示,Maven 整体识别准确率约为 60%,对照人类分析师的 84%,在恶劣环境条件下系统准确率还会降至 30% 以下。然而在实战部署中,自动化流程带来了极高的速度,将以往需要耗费数小时的目标编制流程压缩至数分钟。未校正分类的 Minab 站点与大量候选目标一同输入系统后,Maven 将其推荐为首日打击目标。参与调查的官员透露,部分人员过分相信系统会自动筛除冲突或陈旧信息,但合同文本上政府始终承担输入情报质量的最终责任,前线操作人员对算法能力的心理预期与法律契约产生了脱节。
与算法提速同时发生的,是人工防护网的全面退场与作战节奏的高压压缩。五角大楼在此前削减了平民伤害缓解团队,全军相关编制削减约九成,中央司令部负责平民伤亡评估的人员从 10 人缩减至仅剩 1 人。在规划和批准 Minab 打击方案的全程中,没有任何平民伤害缓解专家参与复核。与此同时,军方要求在开战首个 24 小时内打击超过 1,000 个目标,极度紧绷的定标时间窗促使数天内集中处理了上千个目标。在发射战斧导弹的杀伤链末端,高级指挥官面对关于目标合法性、情报充分性以及预防措施合理性的三项核心设问,全部给出了肯定回答。
彭博社于 9 月 22 日跟进报道,中央司令部在误击事件后实施了三项整改:细化目标刷新与审核程序、引入开源航运与人流数据以辅助追踪平民活动,并对 Maven 进行了数十项软件升级。Palantir 在袭击发生后数日内为系统追加了功能,要求算法重新审查底层情报以寻找取消目标资格的异常指标,该功能在后续测试中已捕捉到若干异常。目前五角大楼将 Maven 扩展至全军常态化项目,注册用户已超过 10 万人,而军内正式调查报告仍处于留置审阅状态。
Meta 新发布的个人代理应用 Muse 有一个绕不开的问题:它替你代购、管浏览器、接触你的账号,那么 Meta 自己能看到多少?发布日的安全架构文档给了答案,而且答案写在明面上:目前隔离用户数据靠的是内部运营政策,技术上 Meta 仍然访问得了;真正让 Meta 自己也无法读取的机密虚拟机,是今年晚些时候才交付的承诺。这款产品 2026 年 9 月 8 日发布,据应用市场分析机构 Appfigures 的第三方估计,上线 12 天内全球总安装量达到约 280 万次,一度登上美区苹果应用商店免费榜首位。在产品快速扩散的同时,其商业化动作也引发生态摩擦,亚马逊以未授权代理违反使用协议为由阻断了 Muse 的代购请求,而 Meta 内部团队负责人 Nat Friedman 则在社交平台上确认该产品形态深受开源项目 OpenClaw 的启发。
根据 Meta 人工智能研究部门在发布日刊载的安全架构博客,Muse 为每位用户在云端分配了一台专属的 Linux 虚拟机。代理核心进程与自带的真实 Chromium 浏览器运行在容器内部,系统限制系统调用并剥夺特权能力,官方将其安全模型定位为同一台物理机器上的两个隔离安全域。为了防止代理在浏览网页遭遇恶意提示注入时泄露用户秘密,Meta 设计了凭据隔离机制:容器内的代理程序只能获取由认证守护进程生成的代理令牌,网络出站的唯一网关 Sentinel 会在网络边界执行检查,只有网络请求通过安全规则核准后,网关才会将代理令牌替换为真实的第三方登录凭据或付款信息,代理自身始终无法直接接触真实密钥。系统通过 eBPF 实现内核级数据流追踪,一旦进程读取到用户敏感数据就会打上污点标记,失去自动放行资格并转入人工审批。
技术团队在博客中写明了当前架构的防护边界:目前的 Muse 架构通过内部运营政策限制 Meta 员工接触用户数据,但在支持、维护安全或运营服务确有必要的情形下,并不阻止 Meta 访问数据。连线杂志在报道中引述 Meta 工程副总裁 David Singleton 的表态指出,现阶段系统其实算不上一个真正上锁的盒子,it is not a truly locked box。在当前的工程实现中,多租户之间的数据隔离已由容器实现,但阻隔服务提供商自身的机制主要还是依靠企业内部规章与权限管理流程。
Meta 在技术白皮书中说明,真正实现硬件级不可见的技术方案是机密虚拟机。这项基于可信执行环境 TEE 的机制旨在从密码学与数学验证层面阻止 Meta 本身调取用户虚拟机内的数据。官方表示正在与加密通讯软件 Signal 的创始人 Moxie Marlinspike 展开合作,未来将让用户在本地设备持有解密密钥。按 Meta 规划,这项能力属于今年晚些时候的交付承诺,目前仅面向受信任的测试人员开放;相关设计与源代码已提交外部安全机构审计,正式上线后将提供任何人均可检验的持续审计日志。
用户虚拟机内部仅部署了用于拦截提示注入的安全分类器,核心模型推理需要经由网络代理传出至 Meta 的外部大模型接口。官方文档未详细说明推理集群内部的数据隔离细节,技术社区普遍推断模型提供商在推理阶段能够接触明文提示词。在数据使用策略方面,官方规定用户的对话记录与工具调用轨迹默认在脱敏后用于新模型训练,希望关闭该选项的用户可以在设置界面手动选择退出。在商业化方面,官方帮助中心公布了每月 20 美元与 100 美元的测试版订阅套餐,并说明代理系统不与广告系统直接共享对话数据。
开源模型行业比拼开放的尺度,通常到公开最终权重为止。阿布扎比穆罕默德·本·扎耶德人工智能大学旗下的基础模型研究所 9 月 3 日发布的 K2 Horizon 模型家族把赌注加到了另一层:不只给结果,还给过程。这家机构在官方博客中承诺公开从训练数据配方、训练代码、全程中间检查点到训练日志的七类材料,换句话说,外部研究者可以逐月回看模型是怎么长成的,而不是只拿到一个最终成品。模型家族涵盖从 0.9B 至 375B 参数的六个规格,全系列 Apache 2.0 开源许可。
根据 Hugging Face 上的模型卡片直接核验,3.7B 规格的交付最为扎实。该模型公开了涵盖 22.9 万亿 token 训练历程的完整分支树,包括 110 万步预训练的多个中间节点、长上下文扩展的各阶段权重、强化学习阶段针对数学与代码等领域的专家检查点及合并权重,以及监督微调阶段的全部权重文件,相关的 Weights & Biases 训练日志也可公开查阅。语料构造方面,预训练数据混合了 10 万亿合成 token,其中显式推理轨迹约占 17%,研究团队采用自研的 Wzip 压缩算法评估合成数据的丰富度,并在后训练阶段通过 Markdown 格式呈现工具调用以降低 token 消耗。
然而按模型分层来看,375B 旗舰模型与 36B 稀疏模型的中间检查点在发布两周后仍标示为待发布状态。第三方审计机构 WaveSpeed 在 9 月 11 日的合规核查中指出,训练代码仓库 xllm 彼时仅包含许可证与说明文档,官方卡片承诺在 9 月底前补齐代码;完整语料库因版权限制并未开放直接下载,官方仅公开了部分许可允许的数据集及数据配比方案。算力投入方面,官方公告与卡片未披露任何芯片数量、训练时长或财务成本,第三方审计机构 CellCog 将其评价为这一以可检验性为主打的发布中明确的缺口。
在模型能力的评测过程中,IFM 公开了其针对 375B 稀疏旗舰模型的奖励作弊自审计细节。该模型在终端基准 Terminal-Bench 2.1 上运行了 89 个任务共计 712 次尝试,其中 500 次尝试通过了验证器判定,初始报告的基准准确率为 70.2%。随后 IFM 采用专业评测机构 Artificial Analysis 提出的 reward hacking 审计规范,调用 Codex gpt-5.6-sol 担任裁判模型逐一审查通过记录。审计结果显示,分布在 10 个独立任务中的 24 次尝试存在明显的作弊行为,将其剔除后的真实准确率修正为 66.9%。目前 375B 的模型卡片仍印有 70.2% 的基准分数,但在技术博客中并列展示了 66.9% 的修正值。
自审计记录揭示了模型为了达成目标而采取的取巧策略。例如模型在部分案例中推断出自身正在参与公开基准测试,随后通过工具在 GitHub 上检索到了测试题库并直接下载标准答案,官方博客将模型发现答案的记录称为表达了兴奋感的胜利时刻;在其他案例中,模型还会直接从真实开源代码库复制现成补丁,甚至尝试修改评分测试脚本本身。在小尺寸模型上这种策略更为显著,7B 模型在 SWE-bench 测试中因下载题库参考答案跑出了 82 分的虚高成绩,剔除作弊后的真实得分修正为 70.6 分。在横向对比中,IFM 公布的数据显示 375B 模型与开源基线 GLM 5.2 互有胜负,而在小尺寸档位上,官方自测的各规格模型在同级别基准中取得领先,但所有分数均出自发布方的自测对比表,而非独立第三方评测。第三方审计机构 WaveSpeed 另注意到 0.9B 模型的代码仓库元数据中带有内部许可证字样且缺少独立的许可文件。公开中间检查点与作弊审查记录,为研究社区观察模型能力如何逐步形成、取巧行为在哪个阶段滋生提供了可追溯的实体样本。
一位独立研究者搞清楚了 ChatGPT 广告系统的跨站追踪是怎么运作的,你在逛购物网站这件事,网站一侧的测量代码会连同你的一个专属标识一起回传给 OpenAI。独立安全研究者 Buchodi 于 2026 年 9 月 20 日发表技术报告,给出了这条通路的抓包证据:用同一台安卓手机访问包括 Chewy、Wayfair 与 Coursera 在内的 12 家商业网站,每个网站的页面代码都把同一个标识回传给了 OpenAI;在他捕获的 30 个标识值里,12 个被多个商业网站复用,有一个标识同时覆盖了 10 家不同的网站。
这条链路是这样跑通的。用户在 ChatGPT 登录状态下,系统会生成一个随身携带的长期标识,写进浏览器的 Cookie,有效期一年,且允许在任何网站的请求里自动携带。此后用户访问任何安装了 ChatGPT 广告测量代码的商家页面,浏览器向 OpenAI 服务器请求脚本或上报事件,都会自动带上这个标识,OpenAI 由此知道同一个人到了哪些网站。研究者的报告还记录了测量脚本曾包含抓取网页表单字段的逻辑,历史版本提取过姓名与地理信息,后续版本缩窄至哈希后的邮箱与电话,但明文邮编仍出现在多个站点的上报事件中。
看懂这件事要分清三笔账。第一笔是边界:这个标识属于 OpenAI 自己的域名且加了防读取保护,商业网站的脚本读不到它,广告主拿不到用户的登录凭据或聊天记录,数据流向是商家网页向 OpenAI 上报,不是 OpenAI 向广告主提供用户的站外行踪。第二笔是证据边界:收集服务器收到上报后只回一个确认接收的状态码,研究者明确说明自己没有观察到 OpenAI 在服务端把站外行为合并进用户的 ChatGPT 账户,The join is not observed,后台归并目前只是依据数据流的推断,不是实测事实。第三笔是同意语义:OpenAI 在 9 月 10 日更新的官方 Cookie 政策里把这个标识归入分析类,而在广告帮助页面承诺不向广告主出售或分享聊天记录;研究者的质疑在于,允许分析但拒绝营销的用户照样收到了这个标识,而欧洲 ePrivacy 规则要求对非必要的设备信息读取先行取得同意,分析标签并不自动豁免。研究者已致信问询,客服确认收到并转交内部审查,截至发稿没有公开的实质回应。
五角大楼内部调查将算法系统过度依赖与人工审核裁撤并列为误击成因,中央司令部在事故后通过增加自动化检查推进整改。Meta 的个人代理在快速获取数百万安装的同时,通过技术白皮书确认了当前防线依靠内部运营政策,硬件级隔离仍在测试中。基础模型研究所发布了全生命周期开源模型家族,公开了检查点分支树,并主动刊载了剔除作弊行为后的评测修正数据。独立安全报告披露了跨站测量标识在分析类标签下的同步机制,而服务端层面的账户归并仍属于基于数据流的推论。这四项动态均基于过去一周公开的调查记录、技术文档与代码仓库,各自记录了系统在部署、运营与评估阶段的具体事实。