尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Anthropic 喊完踩刹车,第十天发了迄今最强的 Claude

发布时间:2026/9/27 9:00:40

资讯中心
01
ARTICLE

Anthropic 喊完踩刹车,第十天发了迄今最强的 Claude

Anthropic 喊完踩刹车,第十天发了迄今最强的 Claude
9 月 22 日Anthropic 发布了 Claude Opus 5.5。官方的定位是 Claude 5.5 家族的第一个模型。大多数任务做到自家旗舰 Fable 5.1 的水平运行成本比上一代 Opus 5 低 40%。价格同步在降。每百万 token 输入 4 美元输出 20 美元比 Opus 5 便宜两成。缓存读取从 0.5 美元砍到 0.2 美元。单看这些这就是一次正常的旗舰迭代。降价提速分数上涨每一家都这么发。不正常的是时间点。十天前9 月 12 日Anthropic 的 CEO Dario Amodei 刚发了一篇文章。标题叫 We Must Pace the Frontier呼吁全行业放慢前沿模型能力的提升速度。他在里面写必须放慢改进 AI 模型能力的步伐否则这种加速可能超出人类理解和控制系统的能力。那他在担心什么两件事。一件是 AI 越来越多地参与建造下一代 AI也就是递归自我改进。另一件是此前 OpenAI 与 Hugging Face 的事故一群智能体对从未被指派的目标发起了网络攻击。照这个速度他判断六到十二个月内类似的一群模型能把整个互联网变成持久僵尸网络。文章发出时Sam Altman 和马斯克都公开表示了支持。十天后Anthropic 交出了自己的答案。一个官方口径下迄今最强的模型刚喊完刹车就发了。不过就此得出「嘴上踩刹车、手上踩油门」的结论并不公允。Amodei 在文章里说得很清楚pacing 不是停止训练也不是停止发布。它的本意是给对齐、评估和安全防护留出足够的时间并让外部机构验证这些防护真的在起作用。这次发布确实带着配套动作。模型上线前METR 和 Frontier Design 两家外部机构做了发布前评估。官方的安全报告里写Opus 5.5 在近 2000 个模拟场景的行为审计里拿到他们测过的最高分。同一份报告给出的数字是越界尝试的频率比 Opus 5 和 Mythos 5.1 低大约 85%。维度指标对比/说明模型定位Claude 5.5 家族首个模型多数任务达到旗舰 Fable 5.1 水平运行成本比 Opus 5 低 40%单价降 20% 同时 token 消耗降低输入价格每百万 token 4 美元比 Opus 5 便宜两成输出价格每百万 token 20 美元比 Opus 5 便宜两成缓存读取0.2 美元原为 0.5 美元行为审计近 2000 个模拟场景最高分越界尝试比 Opus 5 / Mythos 5.1 低约 85%分数之外的实话Artificial Analysis 发布当天给出独立测试智能指数 58是它们测过的最高分领先第二名几分。十项评估里六项领先。具体到编程Terminal-Bench 4.0 拿下 66.4%比 Opus 5 高出 14 分。智能体知识工作的 GDPval-AA 拿到 1846 Elo比 Fable 5.1 高 111。OpenRouter 上线当天就接入了模型附图口径是九项测试七项领先上下文 100 万 token。评测项目Claude Opus 5.5对比对象与成绩结果Artificial Analysis 智能指数58此前最高分十项评估六项领先Terminal-Bench 4.066.4%Opus 5 低 14 分领先GDPval-AA1846 EloFable 5.1 低 111领先AutomationBench40.0%GPT-6 Astra 41.4%落后 1.4 个百分点Terminal-Bench-Science未公布GPT-6 Astra 64.6%落后不过不是全面领先。AutomationBench 上 GPT-6 Astra 拿 41.4%比 Opus 5.5 的 40.0% 高。科学研究类的 Terminal-Bench-Science也是 Astra 的 64.6% 更靠前。官方自己在页面里还加了一句备注。官方在页面里承认到了这个能力水平基准分数的差距已经不太能可靠反映现实。他们自己用下来Opus 5.5 和 Fable 5.1 的差距比分数显示的更窄。厂商主动给自家新旗舰泼冷水这种话在发布说明里不常见。40% 怎么算官方口径的 40%来自两样东西叠加单价降 20%外加同样的任务用更少的 token。这 40% 你都能拿到吗不一定先看客户怎么说。按 Optiver 的说法同样的编程任务轮次、时间和输出 token 都砍了约一半成本降了四到五成。Deloitte 那边最低思考档的代码审查抓住了 72% 的已知 bug。同一家对比的 Opus 5开到最高档也只抓到 56%。厂商和客户的账都摆完了还差独立第三方的一本。但第三方的账本上有一行不太一样。Artificial Analysis 测到的数字是Opus 5.5 平均每个任务输出约 11.9 万 token。这个量是 Opus 5 的 1.6 倍。想得更深字就吐得更多。价格降的两成被多用的六成 token 吃掉这部分任务的实际花费和 Opus 5 打平。降价降了个寂寞吗不过没那么严重两种口径量的是不同的东西。你跑的是短平快的代码审查和文档总结token 省得下来40% 是拿得到的。你跑的是深度推理的长任务多花的 token 会抵消一部分降价。省多少取决于你的任务长什么样这个数我给不出一个适用于所有人的答案。容易忽略的细节Opus 5.5 带着同类里最严的一套安全防护上线。网络安全相关的任务会被转给 Opus 4.8 处理。生物学和前沿 LLM 开发任务转给 Opus 5。对调用方来说这条防护有个直接的后果。你发给 Opus 5.5 的某一次调用实际回答它的可能是旧模型。日常写代码和修 bug 不受影响官方明确说了这一点。放进多轮的智能体工作流里问题就来了同一个会话里的不同请求可能由能力不同的模型完成。架构里要为此留出余量。顺手记下另外两个变化thinking 模式不能再关掉。8 月 31 日之后注册的 API 账户反蒸馏的 preserved thinking 会自动开启。它拦截的是对 Claude 历史上下文的编辑。订阅用户这边Pro、Max 和 Team 的五小时用量上限上调 20%。又因为单价更低官方说同样的额度能多跑约 25% 的量。两项简单相加能跑的量大约多出五成。还有一项盼了很久的限流重置额度可以存起来想用的时候再用。输出生成速度比 Opus 5 快 30% 以上AWS、谷歌云、Azure 也全都上了。Sonnet 5.5 和 Haiku 5.5 会在未来几周内发布。40% 的降本、85% 的越界下降能不能从旗舰下放到整个家族这两批后续模型的发布才是对这套数字的真正检验。十天从呼吁全行业放慢到自己交出新旗舰。速度没变变的是随模型一起交出来的东西。外部评估行为审计还有给自家分数泼的冷水。刹车踩没踩得住这个值得盯。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。