AI 编程AI Agent安全与供应链

为什么人工确认常常只是盖章仪式?从 Claude Code 实测看 AI 时代的控制面迁移

2026 年 8 月 7 日,Anthropic 宣布了一个不大不小的变化:从 8 月 14 日开始,Claude Code 的 Auto Mode 会成为所有 Pro、Max 和 Team 账号新会话的默认模式。简单来说,以前 Agent 每想跑一条终端命令或者改个文件,都要弹个窗口问你行不行,现在交给后台的独立分类器来管了。分类器会在运行时实时看看工具调用到底有没有破坏性、是不是不可逆、会不会越权。

很多人第一眼看到这个改动,直觉反应可能都是觉得这太冒险了,觉得把逐次确认的闸门去掉,放手让 Agent 自动跑,风险看起来似乎变大了。但 Anthropic 随之披露的受控实验数据却给出了一个完全相反的答案:在 1053 名专业测试者的盲测中,面对偷偷混进来的危险命令,人工审查的拦截率只有 13.6%(只有 143 人拦住了);而后台分类器的拦截率高达 89%(拦下了 937 条,比人工整整多拦截了 800 条危险命令)。数据表明,看似更放手的新模式,在真实安全拦截上超过了人类。

需要先说清楚的是,聊这件事并不是要专门去测评 Claude Code 这款工具本身,而是把它当成一个最新的切入点,重新看看自动化系统里人性与控制力的关系。人类在面对高频确认提示时注意力下降、最后沦为橡皮图章,并不是 AI 时代才出现的新现象。在过去半个世纪的飞行、放疗、核电乃至代码审查里,早就多次呈现出相同的人性规律。从历史研究的视角来看,把低阶的高频确认取消掉、换成运行时的闭环控制,不是对安全的妥协,也不是突兀的改动;它符合几十年来的人因研究,是控制面设计回归现实的必然一步。

从 97% 的批准率说起:确认框是如何沦为橡皮图章的

不知道你平时用命令行 AI Agent 的时候有没有这种感觉:终端里隔三岔五就弹出一条提示,要你按回车或者点一下批准。设计者的本意当然是好的,想让人在环路里当最后的把关人,省得 Agent 一不留神把代码库改乱了或者把敏感数据发了出去。

但从 Anthropic 拿到的真实用户行为数据来看,实际情况是另一回事。在全量会话统计中,大家面对单条命令提示时,授权批准率高达 97%,也就是说只有 3% 的单条请求遭拒绝。可反过来,当 Claude Code 给出的是一份包含多步规划的全局 Plan 时,大家的拒绝率却有 39%。

这种落差耐人寻味:我们对高层级的整体计划其实挺上心的,但面对一条条具体的命令提示,大家实际上早就失去了逐条细审的耐心。数据也印证了这一点:大家都在主动想办法绕开这些确认弹窗。截至 2026 年 6 月,49.5% 的活跃 CLI 用户自己手动加了 Bash 允许规则。在全体活跃用户中,5% 直接开了全放行,另有 43% 设了类似 Bash(python:*)Bash(node:*) 这种几乎等同于全放的宽泛规则,而且 allow-rule 的使用率每 5 周就会涨上 5 个百分点。另外,62% 的用户至少用过一次 bypassPermissions 或者勾过不再询问,25% 的交互式会话干脆从一开始就是带着 bypass 模式启动的。当过半的用户在配置里就把确认给跳过了,逐次弹窗与其说是一道安全防线,不如说早就成了一种形式上的盖章操作。

1053 人实验与注意力衰减:为什么人类拦截率只有 13.6%

为了看看大家在遇到真实风险时到底能不能防得住,Anthropic 找了 1053 名付费专业测试者做了一次盲测实验。测试者在隔离的测试环境里干活,会话中途研究人员会偷偷把一条普通的权限提示换成明确的危险命令,看看大家有什么反应。

实验结果让人不安:面对偷偷混进来的危险命令,人工审查的拦截率只有 13.6%(1053 人里只有 143 人拦住了)。但在同样的场景下,后台的 Auto Mode 分类器拦截率达到了 89%(拦下了 937 条),比人工整整多拦截了 800 条危险命令。

随着时间推移,人工拦截率展现出更清晰的衰减过程。在会话刚开始的时候,人工拦截率大概有 17%;但当弹窗提示超过 50 次之后,人工拦截率直接掉到了 5%,降幅约 70%。相比之下,Auto Mode 分类器的拦截率在整个过程中保持稳定。

人工审查 vs Auto Mode 分类器:拦截率随会话长度变化

测试者并非不敬业,人类的生理机制限制了长时间的集中关注。Norman Mackworth 在 1948 年到 1950 年做过著名的 Mackworth Clock 实验,他发现当让人持续盯着低概率出现的异常信号时,人的注意力和检测准确率在头 30 分钟内就会发生明显的断崖式下跌,随后一直停在低谷。当一个工程师连续点了几十次批准之后,第 51 次弹窗里无论是无害命令还是危险参数,在我们脑子里引发的都已经不再是认真的风险评估,而纯粹是习惯性的肌肉记忆了。高频出现的确认提示,悄悄改变了我们的反应方式,让防护效果大打折扣。

跨越五十年的盖章仪式:三个直觉与三起案例

但如果把眼光放宽到整个计算机和工程历史,人工确认退化成习惯性盖章并不新鲜。在过去半个世纪里,只要系统设计者试图让人类在自动化过程里每一步都按个确认,几乎都会撞上三个底层直觉。

第一个直觉是:高频重复的无害提示,会物理性地把理智审查磨削成无意识的肌肉反射。 当系统不断向人类发出提示,而其中 99% 的时间什么事都没有时,大脑就会自动开启节能模式,把风险判断简化成连击通过。1985 年到 1987 年发生的 Therac-25 医疗放疗机事故就是这种直觉的体现。设备要求操作员在输出辐射前手动确认,但由于软件缺陷,系统动不动就弹出各种故障暂停。操作员每天要按很多次 P 键来继续治疗。久而久之,按 P 继续变成了纯粹的动作记忆。当设备真的因为软件竞态和错误状态处理输出了致命剂量时,操作员没有任何怀疑地按了继续,最终造成 6 人受到过量辐射,其中 3 人不幸遇难。

第二个直觉是:自动化越是在平时显得靠谱,人类就越会在突发失灵时失去把关能力。 Lisanne Bainbridge 在 1983 年发表的经典论文 Ironies of Automation 里把这个悖论讲得很清楚:设计者总想让人看守那些没法自动化的残余任务,但因为系统平时跑得太稳,人类根本没有机会保持情境感知和操作手感。Skitka 等人在 1999 年的 NASA 模拟飞行实验里把这个现象量化了出来:当自动化辅助工具偶尔没给风险提示时,有自动化辅助的那组人漏检率高达 41%,而全靠人工自己盯的那组漏检率只有 3%,自动化辅助反而让人放松了警惕,把漏检风险恶化了 14 倍。2009 年法国航空 447 号航班失事也是同样的逻辑,飞行员在自动驾驶突然断开后,因缺乏手动操纵的锻炼和情境感知做出错误决策,最终导致 228 人遇难。

第三个直觉是:很多时候低阶的人工审批并不提升安全,它最大的作用是给管理层提供合规假象与道德缓冲区。 在现代软件工程中,大家心里都觉得多设一道人工审核关卡总归更安全,但大型实证研究给出了相反的答案。DORA 调查了 23000 多个样本后发现,大型公司设立的外部变更审批委员会人工盖章跟系统稳定性根本没有正相关,不仅没能降低变更失败率,反而拖慢了交付周期。发表在 arXiv 2026 的 Habituation at the Gate 研究分析了 11000 多条 AI Agent 的代码审查,发现随着使用时间变长,审批率上升了 14.5 个百分点,而内联评论却下降了 22%,呈现出明显的盖章倾向。Anthropic 的生产数据也印证了这一点:在被安全管线标记并进入复评的会话子集中,依赖手动审批的会话出现严重非预期伤害(生产级严重度 7 及以上)的概率是 6.3%,而 Auto Mode 会话只有 2.4%。Ben Green 在 2022 年审计了 41 项算法人工监督政策后指出,低阶的人工监督主要作用是在规章上形成形式合规,并在出事时把责任归咎于按确认的那个人,构成了所谓的道德缓冲区。

运行时闭环与控制面迁移:从逐次盖章到规则出题人

从逐次人工确认到运行时闭环控制:控制面的迁移

单条命令的确认弹窗之所以防不住风险,本质上是因为它是一种开环确认。当终端弹出提示的那一秒钟里,我们根本拿不到足够的判断信息:你没法立刻查清这个云角色是不是给多了权限,也没法在脑子里实时推演一段复杂的正则表达式命令到底会删掉多少目录。而跑在后台的独立分类器刚好擅长干这件事。它不需要休息,也不会麻木,能实时调取完整的环境上下文,包含代码仓库的 Git 状态、文件是否公开以及 API 权限域,然后做出运行时的闭环拦截。

Anthropic 提到的三个生产拦截案例就很能说明问题。有一次 Claude Code 尝试把一份报告上传到内部网盘失败了,顺手就想发布到公开的代码分享站上,分类器注意到目的地可见性变了,立刻给拦了起来。还有一次长会话里,Claude Code 试图跨 2000 个 Pod 批量杀进程,还要删掉几百个 GPU 的训练任务,分类器在命令发出前识别出了破坏性边界并予以拦截。而在配置只读计费权限时,Claude Code 想拿根级别的云管理角色,分类器也抓到了请求意图和实际角色的不匹配。

当然,独立分类器也不是万能的。Apollo Research 的对抗测试显示,加固后的分类器在未见过的攻击集上依然有 7% 的漏报率(初始漏报率是 12%)。Trajectory Labs 对 720 次间接 Prompt Injection 的测试显示,Claude Auto Mode 的攻击成功率是 0%,而 GPT-5.6 Sol 配合 Codex Auto-review 的攻击成功率是 5.83%,Codex Full Access 是 19.03%。针对遗留的风险,Anthropic 官方也明确说明:分类器无法消除所有隐患,面对涉及生产基础设施的高风险变更,依然建议安排人工复核。这里的变化在于:把日常高频、无害的命令交给后台分类器去检查越界,省得人类陷在无休止的点击疲劳里。

结语:克服人性的控制幻觉

Claude Code 把 Auto Mode 设为默认,标志着 AI Agent 控制面定位的调整。过去那种把人按在低阶执行环里、试图靠多按几次按键来找安全感的做法,不管是历史数据还是心理学实验都证明了它极易退化成形式审查。当自动化把逐次点击的摩擦消除之后,人类的把关职责并没有消失,而是上移到了更高的层级。数据显示,人类对全局 Plan 的拒绝率一直维持在 39%,这说明我们其实更擅长在宏观层面审阅架构意图、业务逻辑和大方向。在具体的风险控制上,大家的精力应当转向定义高阶策略:比如规定哪些敏感仓库不能动、划定网络隔离边界、设定什么级别的生产操作必须强制触发二次审计。当分类器在运行中遇到了超出既有规则的未知场景时,系统会自动挂起并通知人类来做最终决定。

长期以来,大家总是热衷于讨论 AI 的幻觉,但 Claude Code 这次的数据实测却指出了一个容易被忽视的现实:我们以为靠手指多按几次确认就能把住安全关,这恰恰是人类自己的控制幻觉。放下机械确认带来的虚假安全感,把机器擅长的运行时越界检查还给机器,把人类擅长的全局策略定义留给人类,系统反而会变得更加安全。

鸭哥每日手记

日更的深度AI新闻和分析