「人类只拦住了 13.6%」——Anthropic 先证明人不可靠,再把默认值改了

2026-08-10 · AI观点雷达 · AI安全 · 评测方法论 · 智能体
当安全论证从「会不会出错」换成「比人出错少」,被拿来当分母的那个人是谁、处在什么状态,就成了整条论证里最关键也最少被审视的一环。

先说结论

从 8 月 14 日起,Claude Code 的 auto mode 将在 Pro / Max / Team 的所有新会话上默认开启。值得记下来的不是这个开关,而是它给出的论证形式:先测量人类审核者有多不可靠,再据此把人类从回路里默认移出去。

这是一次基线替换。智能体安全的标准,正在从「它会不会出错」悄悄换成「它比它替掉的那个人出错少」。这个换法在自动驾驶、辅助诊断里都算合理。但这次有一个别处少见的细节:被拿来当分母的那个「人」,正是被这套界面自己训练成麻木的人。

事情是怎么发生的

Anthropic 的博文里其实放了三个互相独立的实验,被一条结论线串在了一起。分清楚它们,这件事才读得准。

第一个是人机对照实验。 1053 名付费职业测试者,在会话中途把一条合法的权限请求替换成危险命令。人类只拦住 13.6%(143/1053),auto mode 拦住 89%(937/1053)。更关键的是两个铺垫数字:用户对 Claude Code 权限弹窗的同意率是 97%;而人类拦下危险命令的比例,会话早期约 17%,「dropping to about 5% after 50 or more prior prompts」。在「严重度 7+」口径下,人工批准的会话里 6.3% 出现了用户没要求的有害动作,auto mode 是 2.4%。原文总结很克制:「On every measure we tested, auto mode matched or outperformed manual review.」

第二个是 Apollo Research 的红队。 加固后分类器在对抗集上的漏检率从 12% 降到 7%。Anthropic 自己写明:这批攻击是合成的、专为找软肋而造,「should not be taken as the miss rate on real traffic」。

第三个是 Trajectory Labs 的第三方注入评测。 72 个间接提示注入场景各跑 10 次共 720 次,对 auto mode 下的三个 Claude 型号零成功。同一段也写明:测的是模型本身,不含浏览器插件里的额外防护,应视为「对底层模型的测量,而非某个部署中完整防护集的测量」。

Simon Willison 8 月 8 日的评论落在缝里:他承认 auto mode 确实打得过「确认疲劳」,但反复提醒那 11% 的漏拦,并呼吁独立验证。注意他那个 11% 是 100−89,来自第一个实验,跟 Apollo 的 7% 不是同一把尺子。两个数字长得像,指的完全不是一回事。

为什么重要

前一阵 Rust 给 AI 代码装审查熔断器、Debian 投票争「代码出事谁来答话」,都是社群在审议。这次不一样:即便请了两家外部机构,题目怎么出、结果何时发、以及据此改不改默认值,仍在同一方手里。 8 月 14 日一到,默认安全模型就变了,理由是一份自家主导的对照实验。

从测量直接跳到治理动作,中间那一步——「谁有资格用这个测量做决定」——被跳过了。这才是这条新闻能跟踪十年的地方。

站得住与站不住的地方

正面我给得很实。 一个用户 97% 都点「同意」的控件,已经不是控制,是责任转移的仪式:出了事,锅在点确认的人身上。取消它是真进步。而且公布 97%、公布 17%→5% 的衰减,等于指认自家过去的交互设计失败——愿意把这种数字印出来的厂商不多。1053 人的对照实验、两家外部机构、把 7% 的适用边界写明白,都比行业平均硬。

反面两条。

一是分母是自制的。是这套逐条弹窗的设计先把人熬成橡皮图章,再拿这个被熬坏的人当对照组,判定人类不适任。这不是造假,但它意味着「比人强」这个结论的强度,部分来自人被放在了多糟的位置上。换一种界面——按批次、按风险分层、只在高危处打断——那个 13.6% 会是多少?没有人测。

二是收益和风险不同量纲。用 auto mode 的团队 PR 多出约 25%,那是吞吐量不是正确性;拿去对冲的却是 116 条被放过的危险命令。两边加不到一个天平上。

中间那个诚实的点在他们自己的数据里:有 6 条命令是人类拦住而 auto mode 放过的。这说明两者是互补信号而非包含关系——正好支持 Anthropic 自己的建议:生产环境的高风险改动,仍然自己看一眼。

这对行业意味着什么

做研究:任何「我们比人强」的结论,先问三件事——那个人是谁、在什么界面下工作、疲劳到第几次。我们做 ISP 评测时爱拿「资深工程师调的参」当金标准,可那位工程师是在什么时限、看多少张图、第几个小时给出的判断?基线的状态必须和基线的身份一起报,否则「超越专家」只是「超越了被我们的流程拖垮的专家」。

**做影像系统:**同构问题就摆在手上。多光谱 AWB 的自动判定要不要覆盖人工白点标定?我的答案跟这篇一样有条件:在标注者已被流程磨到麻木的场景里,自动化确实该接管;但要保留一条不靠分类器的硬边界。 Anthropic 的做法值得抄——不可逆、破坏性、越出本环境的动作永远留给人。落到我们这边就是:批量出图可以全自动,标定文件覆写、传感器标称参数改写这类不可逆动作,必须人点头。