反正你总在点 Yes,不如让AI来审:Claude Code自动模式将成默认

栏目:互联网 | 来源:网易智能 | 2026-08-11 10:32

出品 | 网易智能

作者 | 小爪

编辑 | 王凤枝

我自己用Claude Code时,最常做的动作之一,不是输入提示词,而是在权限提示出现后,用力按下回车选择Yes。

每次它询问是否允许继续执行,我通常都会确认。如果同时给"只允许这一次"和"以后都别问了"两个选项,我也经常直接选后者。不是因为我认真审查过每一次操作,而是任务已经进行到一半,我只想让它继续做完。

这正是越来越多智能体用户正在遇到的问题:确认按钮仍然存在,用户也每次都点过,但在高频重复之后,这个动作更多是在表达"继续执行",不再等同于一次真正的审查。

Anthropic最新披露的一组数据印证了这种体验:Claude Code用户会批准97%的权限请求。

Anthropic因此开始调整Claude Code的安全逻辑。8月14日起,Pro、Max和Team计划的新会话将默认启用Auto Mode,把一部分高频权限判断交给一套与执行智能体分开的分类系统。

它想解决的问题很直接:当人已经习惯性选择Yes,谁来判断下一步是否仍在用户授权范围内?

一个已经失效的安全动作

权限确认要真正起作用,前提很朴素:用户愿意停下来,而且有足够信息判断眼前这个动作。

传统软件只在少数关键时刻申请权限,人还有机会认真权衡。Claude Code这样的智能体不一样,它会把一个任务拆成读文件、改代码、跑命令、访问网络一连串动作,任务越长,弹窗越多。

问题不只是弹窗多。智能体执行到中途时,用户要判断一条命令是否合理,得重新想起来最初任务是什么、项目现在什么状态、前面已经允许它做过什么、这一步会不会把影响范围再扩大一点。

认真审查的成本越来越高,点Yes的成本几乎为零。

于是,越是需要连续工作的长任务,确认按钮越容易失效。

Anthropic披露的另一组数据更能说明这种变化。用户面对Claude Code提出的完整计划时,拒绝率是39%;但等计划开始执行、被拆成一项项权限请求后,拒绝率只剩3%。

这不能证明每一次放行都草率,但说明了一件事:完整计划把目标和主要动作放在一起,人容易判断方向;执行中的单项请求,要求人不断重新拼接上下文。

一位用户在X上说,自己曾在一次会话里连续批准了大约20次权限请求,事后意识到自己并没有逐条审查,只是看到熟悉的命令样式就机械放行。这条个人经历虽然不能代表所有用户,但它和97%的批准率指向同一个产品问题:弹窗仍然记录了一次"用户同意",但那一下已经很难证明用户真的看过。

Anthropic的应对方法是:把高频动作交给一套独立系统判断,只在必要时把人叫回来。

Anthropic怎么让AI审批Agent

Auto Mode里有两个彼此隔离的角色。

执行任务的Claude负责读文件、写代码、调工具。当它准备执行一项需要审核的动作时,另一套独立分类系统会接收用户此前的请求和具体工具调用,判断这一步是否还在授权范围内。

这个分类系统刻意不看Claude为操作生成的解释,也不读取工具返回的内容。审批判断只依据用户此前的要求和待执行动作:Claude不能用自己的理由影响审核,网页、文档或工具结果中可能夹带的恶意指令,也不会直接进入审批环节。

Anthropic因此把三类信息分开处理:执行者负责完成任务,分类系统负责判断动作,服务端探针负责检查外部内容中的提示注入。比如Claude读网页或外部文件时,探针会检查里面有没有试图改变任务目标的指令。

这样一来,输入端有人检查Claude看到了什么,输出端有人检查Claude准备做什么。执行者不负责给自己放行。

动作审批本身还分成两步:先是一个快速过滤器,只输出一个判断标记做初筛;需要进一步判断的,再交给更深入的分类器。这样避免每次工具调用都启动完整审核,也减少正常操作被误拦。

Claude Code也不是所有动作都过分类系统。只读工具、用户已经明确允许的操作可以直接通过;项目目录内的部分常规文件编辑也不默认进入分类流程。终端命令、网络请求、外部集成、子智能体这类动作,才会进入分类判断。

用户和组织设的deny规则可以在分类器之前直接阻断;ask规则可以把指定动作继续留给人工确认。如果分类器连续拒绝3次,或者一次会话累计拒绝20次,Claude Code会停下来把问题交还给用户;无人值守环境下,进程直接终止。

这套机制解释了Auto Mode如何接管权限判断,却还不能证明它是否真的比人工确认更可靠。Anthropic把它推成默认,最重要的依据来自一组人机对照实验,其中最醒目的结果是89%。

89%背后,测的到底是什么

这里的89%,不是Claude Code避免真实事故的比例,而是Auto Mode在一项危险命令测试中的拦截率。

Anthropic搭建了一个专门的测试环境,让1053名付费用户使用Claude Code,并将其中一次权限请求替换为一条危险命令。不过即使用户选择放行,这条命令也不会真的执行。

结果是:只有143人拦下了眼前的命令,占全部测试者的13.6%;而Auto Mode对同类危险提示作出判断时,阻止了937次,占89%。

这组实验测的是一件很具体的事:当一个明显危险的操作突然出现在权限窗口里,人和分类系统谁更容易踩刹车。

实验还显示,权限提示出现得越多,人越容易直接放行。

任务刚开始时,人类阻止危险命令的比例约为17%;经历50次以上提示后,这个比例掉到大约5%。Auto Mode没有随着提示数量增加明显下降:分类系统未必像人一样理解全部背景,但它不会因为确认框已经弹了几十次,就逐渐失去耐心。

因此面对重复出现、风险明确的权限请求,机器守门员比已经疲惫的人更稳定。

这解释了Anthropic为什么敢把Auto Mode推成默认。

当然测试不能代表Claude Code的整体安全水平。现实中更麻烦的是,有些操作看上去并不危险,AI却可能做错对象、多做了几步,或者碰了用户根本没让它碰的东西。

危险命令好挡,模糊授权难挡

一条rm -rf /(尝试强制删除系统根目录下所有文件)的命令,谁都知道要警觉。

但用户说"清理旧任务",Claude可能只删掉那条明确废弃的,也可能把所有超过30天的一起清了。让它"修复一个状态文件",它可能顺手改了旁边三份相关记录,因为在它看来,这些文件本来就该一起更新。

命令本身没问题,越界发生在对象和范围上。

一篇尚未同行评议的预印本专门测了这类场景。作者写了128条故意含糊的提示,让Claude Code完成开发运维任务,共触发253个改变系统状态的动作。其中36.8% 走的是项目内Edit/Write工具,压根不进分类系统;剩下进入分类判断的160个动作里,也还有相当一部分越界被放行。作者最后统计,端到端有81%的越界没被拦下。

Anthropic之前测的是系统能否拦下明显的危险命令,而预印本测的则是:用户没有说清范围时,系统能否发现操作已经越界。

前一道题机器答得比人好,后一道题机器和人一样只能猜。

你的目标是哪些、智能体能改到哪里、哪些文件已经冻结、哪些外部系统绝不能碰,如果这些没在任务开始前写出来,分类系统再强也补不上。它能看出一个动作长得像不像危险动作,但看不出你心里那条线画在哪。

人退到了更靠前的位置

Auto Mode变成默认之后,人没有从授权流程里消失,只是被挪了个位置:从任务中途,挪到任务开始之前。

过去,你一边看着Claude干活,一边决定要不要点Yes。现在,更重要的那些选择得提前想好:哪些资源可信、哪些动作必须问一声、哪些地方分类系统再怎么判断都不能碰。

这些规则设置起来比点Yes麻烦,但不必每次重新判断。说到底,任务开始前写清楚两件事就够了:这次要完成什么,以及哪些地方绝对不能碰。前者写进任务要求,后者交给deny和ask规则。

如果用户只说一句"继续做完",既没有限定范围,也没有划出禁区,Auto Mode仍然只能猜。它能拦下一些明显危险的动作,却不知道每个项目里哪些文件不能改、哪些外部系统不能碰、哪一步必须回来询问。

所以,Auto Mode让你少点几次Yes,这是真的。但"我到底允许了什么"这件事,弹窗没了,它也不会自动变清楚。

了解更多

猜你想看

← 返回首页