58分登顶、任务成本大降40%:Claude Opus 5.5上线,拉开5.5系列序幕
北京时间9月23日凌晨,Anthropic正式发布Claude Opus 5.5,这是Claude 5.5系列的首款模型。新模型在多数任务上的表现与旗舰Claude Fable 5.1相当,默认设置下的典型任务成本却比上一代Opus 5降低了40%,输出速度提升超过30%。在第三方评测平台Artificial Analysis的智能指数榜单上,Opus 5.5以58分位列第一,领先Fable 5.1和GPT-6 Astra的53分。
9项测试拿下7项第一,编程三连冠
Anthropic公布了Opus 5.5与Fable 5.1、Opus 5、GPT-6 Astra、GPT-5.6 Sol四款模型的9项对比测试成绩,Opus 5.5有7项得分最高。智能体编程方面,它在Terminal-Bench 4.0、FrontierCode v1.1、CursorBench 4.0上分别拿到66.4%、54.4%和57.8%,三项均为对比模型中最高。不过在业务流程测试AutomationBench和科研Agent测试中,它的成绩仍落后于GPT-6 Astra。
知识工作方面,Opus 5.5在覆盖44种职业任务的GDPval-AA v2.1评测中拿下1846分,高于Fable 5.1的1735分和Opus 5的1708分。在一项要求逐一核对数字和引语的财报研究测试中,Opus 5.5生成的18份报告有16份达标,而Fable 5.1和Opus 5均无一份通过。
长任务效率是升级重点
Anthropic重点展示了代码迁移、代码审查和性能优化等长时间任务。一名早期测试者使用Opus 5.5在不到一天内完成了涉及68万行代码的迁移;另一名测试者对一个20万行代码库进行审查和修复,Opus 5.5用时不到3小时,而Opus 5完成同样任务超过20小时,消耗的Token是前者的2.5倍。

内部测试中,Anthropic要求Opus 5.5和Fable 5.1将负载均衡软件HAProxy从C语言改写为Rust。Opus 5.5用时9.5小时,Fable 5.1用时12小时,前者成本低51%。另一项网页性能优化测试中,Opus 5.5在40次测试里成功39次,而Opus 5优化幅度较小且改变了应用原有行为。
价格下调20%,缓存读取降价60%
定价与效率是这次发布的核心。Opus 5.5每百万输入、输出Token分别收费4美元和20美元,较Opus 5的5美元和25美元下调20%;缓存读取价格降至每百万Token 0.20美元,降幅达60%,这对智能体和编码工作负载的成本结构影响显著。Claude Code和Claude Platform还提供最高2.5倍速度的快速模式,定价为每百万输入8美元、输出40美元。
值得注意的是,Opus 5.5开至max档后非常烧Token。据Artificial Analysis实测,max effort下Opus 5.5平均每项任务生成约11.9万Token,Astra仅约2.7万。因此即便Token单价只有Astra的四成,max档单任务成本仍达5.98美元,高于Astra的3.26美元。但回到默认medium档,情况就友好很多:Opus 5.5拿51分、每任务1.34美元,Astra为50分、1.54美元。
安全机制升级,高风险任务转交旧模型
Opus 5.5发布前接受了METR、Frontier Design等外部机构评估。在覆盖近2000个模拟场景的自动化行为审计中,它在几乎所有受测的不对齐行为指标上优于近期Claude模型。一项测试模型是否试图突破隔离边界的评估显示,Opus 5.5尝试绕过边界的频率较Opus 5或Mythos 5.1降低约85%,且相关尝试均为低严重程度并自行报告。

新模型还引入了模型间安全路由机制:系统识别出网络安全相关请求存在较高风险时,会将其转交给能力较弱的Opus 4.8处理;涉及生物学领域且触发防护的请求则转交Opus 5。这种分流机制在保留新模型核心能力的同时,对可能被滥用的高风险能力加以限制。
同日OpenAI放低价模型,竞争转向性价比
Opus 5.5发布不到两小时,OpenAI也推出了GPT-6 Sol和Luna。Sol每百万Token输入2美元、输出10美元,Luna更低至0.10美元和0.50美元,价格战一触即发。两家公司不约而同把战略重心从单纯追求性能突破,转向以更低价格提供强劲性能。
从价格梯度看,市场已经形成密集分层:Luna守住0.10/0.50美元档,小米MiMo等继续压低低端价格,Sol站在2/10美元,Opus 5.5则是4/20美元。Anthropic用四成价格把Opus硬生生塞进了Astra和Fable所在的最高能力区间。这场竞争的下半场,比的或许不再是”谁的模型更强”,而是”完成同样的工作要花多少钱”。
Opus 5.5已上线Claude及亚马逊云科技、谷歌云、微软Azure等平台,开发者可通过模型标识claude-opus-5-5调用。订阅用户还获得了五小时使用额度提升和一次使用限额重置机会。Claude Sonnet 5.5和Haiku 5.5计划在未来几周推出,5.5系列的完整版图才刚刚展开。




