Claude Opus 5.5 发布:标准单价下降,独立评估保留限制
Claude Opus 5.5
Opus 5.5 发布,标准 API 输入/输出为每百万token 4/20美元,比Opus 5低20%。
一分钟读懂
- Opus 5.5 发布,标准 API 输入/输出为每百万token 4/20美元,比Opus 5低20%。
- METR公布预部署评估:10个工作日访问、5类任务;量化结果较Fable 5.1渐进改善,仍有长任务弱点。
- 标准输入价
- 4美元 / 百万token
- 标准输出价
- 20美元 / 百万token
- 单价变化
- 较Opus 5下降20%
发生了什么
Anthropic 于9月22日发布 Claude Opus 5.5。标准 API 每百万输入和输出 token 分别为4美元、20美元,较 Opus 5 的5美元、25美元下降20%;缓存读取单独计价。模型能力、价格和准入条件要分别看。
官方所称“典型任务成本降低40%”,还包含模型在任务中的用量变化,不能当作单价统一下降40%。速度、写作及编程表现的提升也主要来自 Anthropic 的测试。
METR 同日公布预部署评估,在10个工作日内用5类任务收集证据。它观察到相对 Fable 5.1 的渐进提升,也指出长任务判断等弱点。评估只回答有限问题,部分资料不公开;Anthropic 对摘要有审阅机会,METR 确认了最终文本。
为什么值得关注
旗舰模型价格下降会影响持续使用成本,但“更便宜”仍取决于任务需要多少次尝试。独立评估提供了补充证据,也明确了它尚未验证的部分。
我的观察
价格变化已明确,能力判断应把厂商评测与范围有限的第三方结果分开。
可能带来的影响
重新比较任务成本与准入条件
升级时要同时核对缓存、用量和任务成功率;网络安全、生物等任务的保护措施与回退机制也可能影响实际体验。
还不知道什么
METR范围有限,原始资料部分保密;Anthropic参与文字审核,METR确认最终文本;未证明全面自动化AI研发。
网络安全、生物等任务存在保护措施及回退,不同准入级别的能力不同。
典型任务总成本降低40%、输出加速与多数能力成绩来自Anthropic测试;不能把40%当作标准单价降幅。
时间线
原始发布
Opus 5.5 发布,标准 API 输入/输出为每百万token 4/20美元,比Opus 5低20%。
原始来源与查证用途 2 篇
Anthropic · 原始材料 · 2026-09-22Claude Opus 5.5核对本文的发布、交付范围与限制;性能主张单列。METR · 原始材料 · 2026-09-22Summary of METR's predeployment evaluation of Claude Opus 5.5核对本文的发布、交付范围与限制;性能主张单列。原始资料仅标注日期,不推定日内时刻。
收录:2026年9月27日 21:25 · 核验:2026年9月27日 21:46(UTC+8)
