你选了 Opus 5.5,回答你的却可能是 4.8——模型正在变成一套动态系统

2026-09-23 · AI安全 · 模型发布 · 模型路由 · 产品治理
按风险动态切换模型能减少高危能力暴露,但也使能力、安全和责任的评估对象从单一模型变成了整套路由系统。

先说结论

9 月 22 日,Anthropic 发布 Claude Opus 5.5。最值得盯的不是又一轮榜单,而是一条产品规则:用户明明选择了 Opus 5.5,系统仍可能根据请求内容,把任务交给 Opus 5 或 Opus 4.8。模型名称开始不再等于真正执行任务的模型。

这不是简单的“降级”。它意味着前沿模型的安全边界,正在从“这个模型能不能回答”,改成“哪一个模型可以处理哪一段上下文”。未来要审计的也不再只是模型,而是分类器、路由器、备用模型和会话状态组成的整套系统。

事情是怎么发生的

Anthropic 在发布页写明,Opus 5.5 是首个配备这类网络安全、生物和模型蒸馏防护的 Opus。被分类器判为较高风险的渗透测试、漏洞利用等网络安全请求会转给 Opus 4.8;部分病毒学、毒理学和分子设计请求会转给 Opus 5;少量涉及前沿大模型开发的请求,例如特定加速器的内核开发,也会转给 Opus 5。提取内部推理之类的蒸馏请求则直接拦截,不再转交。

官方帮助页把机制说得更具体:分类器检查每一次请求,而且不只看用户刚输入的话,还会看记忆、连接器内容、网页搜索结果和文件。消费端默认开启自动切换;一旦触发,较弱模型会在同一会话里重新执行请求,并继续接管后续对话。API 端则默认不自动切换,需要开发者自行配置。

为什么重要

过去谈模型安全,常把“模型”当作一个稳定对象:同一套权重,做能力评测、红队测试,再决定是否发布。动态路由打破了这个假设。同一个产品名下,不同请求可能由不同能力层级处理;同一个请求也可能因为历史对话或外部文件不同,走上另一条路径。

这有一个很实用的优点:系统不必在“最强模型全部开放”和“一律拒绝”之间二选一。对普通编程、学习和日常分析保留能力,对高风险环节缩小暴露面,确实比粗暴封禁精细。

站得住与站不住的地方

站得住的是,Anthropic 没把切换藏起来:界面会提示由哪个模型作答,也允许关闭自动切换。风险控制被做成运行时策略,而不是只写在发布前的系统卡里,这更接近真实产品环境。

但“换成较弱模型”并不自动等于“整个任务更安全”。较弱模型也许更难完成攻击,却也可能更难识别复杂指令、发现代码缺陷或保持长链条的一致性。分类器还会读取整个上下文,这意味着一份文件里的敏感片段,就可能改变后续所有回答。官方承认仍会误判,也没有公布各类切换的真实触发率和任务损失。

更关键的是,透明标签只能告诉用户“换了谁”,不能证明这次切换降低了多少风险,或者牺牲了多少正确性。发布页对 Opus 5.5 的能力数字,不能直接代表被路由后的实际体验。

接下来该盯什么

第一,看实验室会不会开始发布“端到端系统评测”,同时报告主模型、分类器和备用模型,而不是只报旗舰权重的成绩。第二,看企业合同和安全审计是否要求记录每一步实际调用的模型、触发原因与能力变化。第三,看动态路由会不会从安全措施扩展成成本和延迟调度,让同一个模型名进一步变成一张服务标签。

当模型会在对话中途换人,真正的产品不再是一颗大脑,而是一套交通系统。今后的能力承诺、安全责任和事故归因,都得按这套系统来算。