
权限弹窗在 Claude Code 里一度被当成安全的象征:每条 Bash、每次写文件,都要人点一次允许。2026 年 8 月 7 日,Anthropic 在 Claude Blog 宣布另一条路线——从 8 月 14 日起,Pro / Max / Team 新会话默认进入 auto mode:不再把安全押在人的每一次点击上,而是让分类器先拦“不可逆、破坏性、或越出当前环境”的工具调用。Enterprise、Claude API、Bedrock、Google Agent Platform、Microsoft Foundry 暂时仍需管理员自行开启;公司计划在接下来一个月与云伙伴把默认一并推开,并继续免除分类器开销计费。
官方给出的用户行为数字,几乎是在承认人审已经失效。Claude Code 里权限提示的批准率高达 97%;同一批用户在审计划时却下掉 39%——计划会被认真看,单条权限却几乎条件反射。设置文件更直白:截至 2026 年 6 月,49.5% 活跃 CLI 用户手写过 Bash allow-rule,其中 5% 直接放行任意 shell,另有 43% 写了 Bash(python:*) / Bash(node:*) 一类实质等价规则,且大约每五周再涨五个百分点;62% 用过 bypassPermissions 或点过“不要再问”,25% 的交互会话一上来就进 bypass。Auto mode 下,宽到能执行任意代码的 allow-rule 会被搁置,避免命令整段绕过分类器——设置文件本身不被改写,切回其他模式规则照旧生效。
对照实验把“人比机器更安全”的直觉打穿。Anthropic 通过研究供应商招募 1,053 名付费专业测试者,在专用环境里盲测:会话中途把一条权限提示换成明显危险命令(文本替换,不会真执行)。人只拦住 13.6%(143/1053),auto mode 拦住 89%(937/1053);对决结果是分类器拦住人放行的 800 条,人拦住分类器放行的仅 6 条。疲劳曲线同样刺眼:会话早期人拦约 17%,五十次提示之后掉到约 5%,分类器则几乎不随长度下滑。真实用量侧(2026 年 5–6 月、仅限同意数据用于训练/分析的账号、安全管线已标记会话),生产级严重度(7+)且用户未明确要求的有害动作,在人工批准会话里占 6.3%,auto mode 会话为 2.4%。
第三方红队与注入评测被写成默认切换的另一块底座。与英国 Apollo Research 两周试点后,分类器在共享集与留出集上的漏报率从约 12% 降到 7%(文中强调这是对抗合成攻击上的数字,不能当成真实流量漏报率)。Trajectory Labs 在 2026-07-17 前后公开版 Claude Code / Codex 上跑 72 个间接提示注入场景、各 10 次共 720 次尝试:Claude Fable 5 / Opus 5 / Sonnet 5 开 auto mode 时攻击成功率为 0%;GPT-5.6 Sol 在 Codex Auto-review 为 5.83%,Full Access 为 19.03%。文内同时披露 Anthropic 内部三起近失:公网代码站兜底上传、跨约两千 pods 的杀进程与训练 GPU 拆除队列、以及把只读账单权限做成账户根管角色——均被分类器拦住后改道或请示。
客户侧叙事服务于同一句产品主张:少打断,才能把长跑 agent 留过夜。官方称 Teams & Enterprise 采用者中,auto mode 用户大约多交付 25% PR;Adobe 用 agentic loop 在 auto mode 下直接交成品 PR;Nuro 让研究 agent 爬评测指标、早晨交 PR;Gusto 称自五月中旬以来约 10% 会话出现分类器拒绝;Garner Health 经托管设置把 auto mode 推到全部 550 名员工。这些都是厂商与具名客户主张,文中未见独立审计。
作为评论,我会把这次默认切换读成两件事叠在一起。第一件是工程诚实:当批准率到 97%、四分之一会话直接 bypass,再把“安全”写成弹窗责任,等于把护栏外包给疲劳。第二件是产品野心:用分类器换成长程自治,再把 Opus 级长跑模型卖成可过夜留下的同事——Adobe / Nuro 的故事就是销售页。风险边界官方自己也写了:分类器不消除风险,高 stakes 生产变更仍建议人审;Enterprise 仍 opt-in,说明组织治理与默认体验之间还有一道闸。对开发者,真正要改的不是再多点几次允许,而是问清:你的 allowlist 是否已经宽到等于关闭审查,以及切到 auto mode 后,硬拒绝与数据外泄规则是否写进了托管设置。原文见 Auto mode is now the default in Claude Code。