你在自带算力芯片的电脑上用画图工具生成一张图片,整个过程其实要在微软的云端服务器打两次卡。很多人以为把模型下载到电脑里,计算就在本地封闭完成,拔掉网线也能跑。但根据 Xusheng Li 发布的逆向分析,微软画图与照片应用的本地出图流程,由五个固定步骤拼接而成。这套管线在本地硬件启动前,就已经在云端运转了。
你输入提示词点击生成时,本地芯片还在待命,系统先将提示词与参数发往微软的审核服务器。云端审查通过后,发回修改后的提示词,以及两个一次性的唯一编号。这两个编号分工明确,一个标记这次生成请求,另一个充当隐形水印编号。拿到编号后,本地芯片载入模型开始画图。出图后,系统调用水印模块把水印编号写进像素,作者的合成图测试里水印模块微调了七成以上的像素。最后在保存图片时,客户端还要把图片传回云端,申请一份符合 C2PA 标准、由微软签名的内容凭证,拿到凭证数据后才写入本地文件。
这套流程里藏着两个超出预期的工程事实。水印模块在画图应用里是硬性门禁,写入失败会直接报错中止并不出图;而在系统照片应用里,写入失败只记一行日志,图片照常输出(逆向报告原文)。内容凭证签名本身也是一项云服务,本地画好的图必须上传云端盖章,才能拿到受信的凭据。
两个编号的分工同样耐人寻味。照片应用把请求编号写进像素,画图应用把水印编号写进像素,并在下次审核请求中带上上次的请求编号,供服务端串联会话。正如逆向作者所述,本地生成并不代表所有操作都在本地完成,微软在云端审核提示词并签发唯一编号,画图软件再把编号埋进生成的图片里。
对照微软官方文档,能看清厂商的信息披露边界。微软在画图功能使用说明和图像生成支持页中写明了若干要求:本地功能需登录账号并联网,云端会过滤内容并收集设备与用户标识以防范滥用,违规会封号,文件带有内容凭证。官方未说明的是:像素里埋了隐形水印、水印编号由服务器动态签发、编号可能关联账号,以及记录保留多久。微软早在 2023 年 9 月的 Bing 官方博客 中对云端画图披露过含时间的隐形水印,但在本地功能文档中从未提及。
这项逆向工程在 Hacker News 社区引发讨论 后,大家很快确认埋在图里的是生成流水号。这也引出一个核心问题:这种本地算图、云端发号记账的架构,到底是微软一家的特殊选择,还是行业共同画出的标准形状?
主流厂商在端侧 AI 上的架构高度一致,算力可以放给设备,治理规则必须留在服务器。各大厂商在计算负载和安全管控之间划出了清晰的界线。我们可以把几家主要厂商的设计放在一起对照:
| 厂商与系统 | 推理计算在哪里 | 控制面与签名在哪里 | 用户能否关闭 |
|---|---|---|---|
| 微软画图与照片 | 本地芯片 | 云端审核与在线签发 | 无法关闭 |
| OpenAI 生成服务 | 云端集群 | 云端中心化签发验证 | 无法关闭 |
| Google 图像生成 | 云端 | 云端水印注入 | 隐形层不可关 |
| Apple Intelligence 照片编辑 | 本地硬件 | 系统固化 SynthID 隐形水印 | 无法关闭 |
| Meta Content Seal | 视产品而定 | 云端解码验证服务 | 验证必须过云 |
| Adobe Firefly | 云端集群 | 云端签发凭证 | 无法关闭 |
各家厂商的具体实现展现了相同的逻辑。OpenAI 在 2026 年 5 月公布内容来源方案,把内容凭证、隐形水印与在线验证工具绑定在一起,真伪核验必须调用云端接口。Adobe 的工具依赖云端计算,内容凭证直接由 Adobe 服务端签发。Meta 推出的 Content Seal 方案 虽然给多模态内容打上隐形水印,但外部检测和溯源依然要把文件传回 Meta 服务器解析。
Google 在 Nano Banana Pro 公告 里展现了水印的分层逻辑。免费和 Pro 层保留了可见的 Gemini 闪光图标,Ultra 订阅和 AI Studio 允许移除可见标记;但埋在深处的 SynthID 隐形水印在所有层级都保持启用。在厂商眼里,浮在表面的可见标记是可以售卖的商品,深层的隐形水印才是不可退让的底座。
在所有厂商里,苹果展现了控制面收得最窄的样本。根据苹果在 2026 年 6 月发布的 Apple Intelligence 官方声明,Apple Intelligence 以端侧生成为主,照片编辑会自动压入不可关闭的 SynthID 隐形水印来标识经 AI 编辑的照片。苹果没有提供关闭开关,公开材料里也没有出现按次向云端申请编号的环节。
行业的基本事实由此展现得很清楚,截至 2026 年 8 月的公开材料里,没有找到消费级厂商在端侧运行时放弃云端治理。各家厂商都有控制面,区别只在控制面的宽度。微软的特殊之处在于它的组合方式:把云端按次签发的独立流水号写进像素,把水印写入设为出图的硬性门槛,并在本地文档中保持极少披露。这三点各自都能在行业找到先例,把它们拼在一起的目前只有微软一家。
模型权重可以下载到本地硬盘,管束模型行为的规矩和账本必须留在厂商手里。借用网络系统里的概念,模型权重和矩阵运算属于处理载荷的数据面,也就是画出图像的计算过程;审核指令、分配身份、签名认证与审计则构成了控制面。这轮端侧 AI 演进,厂商下放到用户设备里的只有数据面,控制面始终牢牢留在云端。
控制面留在云端背后有四个机制原因。第一个原因在于安全审查规则需要远程动态更新。网络上的对抗样本和诱导词汇随时在变,厂商在云端可以随时调整过滤策略。如果把审核逻辑打包进本地软件,每次更新就得等系统或应用发版,这种延迟会给安全防护留下危险的空窗期。
第二个原因在于防范滥用依赖中心化的关联账本。治理机制的核心诉求,是在发生违规传播或侵权时拥有能够查验的证据链。如果每个标识符都由本地设备离线生成,服务器上没有存根,事后追溯就会断掉。保存在中心化服务器里的签发记录,并不是数据交互顺带产生的文件,它本身就是治理体系运转的核心目的。
第三个原因在于数字签名与凭证的公信力来自签发方。在密码学体系中,一份凭证之所以可信,是因为盖章的私钥掌握在具备资质的权威机构手里。如果允许本地软件用本地私钥自签名,这种自说自话的声明无法获得第三方认可。为了让内容具备跨平台公信力,签名必须回到拥有受信证书的云端服务器执行。
第四个原因在于法律法规把合规责任压在服务提供商头上。无论安全审查还是标识注入义务,监管法条设定的责任主体始终是提供 AI 服务的商业机构,而不是购买电脑的终端用户。厂商无法因为模型在端侧运行而免除法定监管责任,自然要在软件里保留通往云端的控制绳索。数据面下沉帮用户降低了延迟、帮厂商节省了算力,控制面留驻云端则守住了厂商的合规底线与管理权限。
行业规范和法律条款只要求证明内容由 AI 产生,并没有要求厂商把每次生成关联到具体的个人。图片在网上流传的过程中,截图、压缩和元数据清洗几乎无法避免,外挂信息经常丢失。为了在这些信息洗掉之后依然能辨认来源,技术专家设计出了把标识直接融进像素内部的方案。
在 C2PA 规范 2.4 的术语体系里,直接嵌入内容内部的弱关联叫软绑定,基于哈希校验的强关联叫硬绑定。规范在第 9.2 节中明确指出,软绑定不能当作硬绑定使用,它不承担严密的防篡改职责。
根据 C2PA 实施指南 4.2.6 的要求,只要系统使用水印建立了软绑定,生成的凭证清单里就必须记录水印动作与对应声明。在逆向分析的样本中,微软生成的凭证清单里记录了水印算法和写入像素的编号。但规范本身只要求记录该字段,并未规定编号必须是每次生成都更换的独立标识符。将其设计为全局唯一流水号,属于微软自己的工程实现。实施指南 4.2.7 在建议条款中提醒过,向中心化数据库查询凭据存在隐私代价,建议厂商保障用户知情。而在格式支持上,微软不提供旧式 BMP 格式,这个格式在技术上无法内嵌凭证数据。
法律层面的规定同样印证了这一点。欧盟人工智能法案第 50(2) 条确立了法定底线,要求提供商确保 AI 系统的输出带有机器可读的标记,让外界能够检测出内容是由人工智能生成或操纵的。这项条款的核心要求是确保内容具备可检测性,通篇没有要求把每一次生成行为精确追溯到具体的操作人。
按照法案的推进时间表,第 50(4) 条关于深度伪造内容的披露要求已在 2026 年 8 月 2 日正式生效。第 50(2) 条针对存量系统的合规过渡期将持续到 2026 年 12 月 2 日,水印检测互操作方案的截止日期则是 2027 年 2 月 2 日。
监管要求的是让机器认出内容出自 AI 之手,而不是查出是谁在什么时间生成的。从满足可检测性的通用标记,到给每个提示词分配独立流水号,多出来的这一步是厂商在监管底线之上给自己搭的风控抓手,法律并没有强制要求。
判断一款端侧 AI 产品到底有多私密,不要看宣传里挂的本地标签,要看它留了哪几个通向云端的接口。面对市面上各种主打本地和离线的 AI 工具,我们只要审视三个关键的数据交互接口,就能看清它的真实控制面形态。
第一个接口是提示词是否离开设备。在本地芯片开始算图前,输入的提示词和参数是否必须先传到远程服务器做安全过滤。第二个接口是身份标识由谁签发。埋进文件深处的特征标记或流水编号,是由本地设备独立算出,还是由云端服务下发并登记。第三个接口是审核与签发记录在云端保留多久。服务器处理完请求后,你的用户账号、设备属性和操作日志会在厂商数据库里保存多久。
把这三个接口套用到前面的厂商矩阵里,各家的取舍就很清楚。苹果以端侧生成为主,公开资料中没有出现类似的云端审核动作,并在 Apple Intelligence 照片编辑中固化 SynthID 隐形水印;Google 在云端维持不可关闭的隐形水印作为防线;微软则在提示词过云、服务器发号以及像素与凭证双重绑定上走完了全套流程。在第三个接口上,微软官方文档对记录留存时长的沉默,是眼下整个端侧生态里最该追问的空白。
面对这种架构设计,我们需要分清技术证据与情绪推断的边界。逆向分析者 Xusheng Li 在报告原文中表达得很严谨,他明确说明自己找不到官方披露来解释服务器下发的水印编号、提示词审核以及像素水印之间的关联。他证实的是客户端与云端之间的数据传输机制,并没有宣称获取或验证过微软服务端的后台数据库。部分媒体把这项发现直接渲染成能够精准反查个人身份的监控工具,这一推论超出了公开技术证据能够支撑的范围。The Register 在 2026 年 8 月 25 日的报道中指出微软未对置评请求作出回应,截至 2026 年 8 月 30 日官方依然没有发布正式说明。
这种多层设计的失效模式也印证了我们在上一篇关于分层防御的讨论。文件外挂的内容凭证依赖标准文件格式存储,一旦图片经过截图、改格式,或经社交平台压缩,元数据就会丢失,校验时会明确抛出错误;像素里的隐形水印直接融进画面矩阵,能够承受常规的文件格式转换,但在强烈的失真或噪声干扰下会悄无声息地退化。厂商把两者结合起来,本质上是为了让这两种失效模式互为补充。
端侧硬件和本地模型确实帮用户省下了等待时间,也帮厂商减轻了云端算力的高昂负担。评估一款端侧产品的控制权归属,关键看生成链路中的那本审计账本保存在谁的服务器里,本地硬盘里装了多大的模型权重说明不了治理边界。