Anthropic 发布 Claude Opus 5.5

发布时间 2026-09-23 8 天前
来源 Hacker News
字数 3,606 字
查看原文

AI智能总结

Anthropic 正式发布 Claude 5.5 系列的首款模型 Opus 5.5。该模型在大多数任务上已达到 Claude Fable 5.1 的水平,而运行成本相比 Opus 5 降低 40%,输入与输出令牌价格分别为每百万 4 美元和 20 美元,缓存读取价格为每百万 0.20 美元,输出速度提升 30% 以上。

我们正式推出 Claude Opus 5.5,这是全新 Claude 5.5 系列的首款模型。它在大多数任务上的表现已达到 Claude Fable 5.1 的水平,而运行成本相比 Opus 5 降低了 40%。

Claude Opus 5.5 是我们在呼吁「放缓前沿模型发展节奏」之后发布的首个模型。发布前,它已通过外部评估机构的测试,其中包括 Frontier Design 和 METR。在我们最全面的对齐测试——自动化行为审计中,Opus 5.5 是迄今为止表现最强的模型。它同样配备了我们为最强模型所开发的安全防护措施。

以下是 Opus 5.5 带来的一些主要改进:

性能。 Opus 5.5 相比 Opus 5 实现了大幅跃升,是新的领先模型。早期测试者在最复杂的工作中看到了大幅度的性能提升:一位测试者在不到一天的时间内完成了一项 68 万行代码的迁移——而这类工作原本需要一个工程团队耗费数周。它擅长发现并修复软件中的低效问题:当我们让它缩短一个 Web 应用所有页面的加载时间时,Opus 5.5 在 40 次尝试中成功了 39 次,而 Opus 5 虽然也做出了一些改进,但同时改变了应用的行为。另一位测试者让多个 Claude 模型根据同一条提示构建一个游戏,Opus 5.5 在画面质量与精细度上的得分高于其他所有模型。

安全性。 Opus 5.5 在我们自动化行为审计(这一对齐测试套件会在数千个模拟场景中对 Claude 进行测试)中取得了迄今为止所有模型中的最高分。相比近期的模型,它更不容易采取难以逆转的行动或越权操作,并且相比 Opus 5 对提示注入攻击更具抵抗力。我们也扩展了对齐测试的范围,涵盖更长时长的任务、不可能完成的任务以及基于真实事件建模的场景,尽管它仍然存在局限。完整评估细节请参见 Opus 5.5 系统卡。

由于 Opus 5.5 在生物学和网络安全方面的能力与 Claude Mythos 5.1 相当,我们为其部署了与 Claude Fable 5.1 相似的安全防护措施。已通过审核的组织可于今日申请加入我们的生命科学验证计划,将 Opus 5.5 用于生物学研究。未来几周内,我们还将扩大网络安全验证计划的准入范围,已通过验证的网络安全从业者将能够把 Opus 5.5 用于他们的工作。

成本与速度。 Opus 5.5 的服务部署所需的算力少于 Opus 5,定价也相应降低。我们的测试显示,在默认设置下,它在典型工作负载上的成本相比 Opus 5 低 40%。输入与输出令牌的价格分别为每百万 4 美元和 20 美元,比 Opus 5 低 20%。缓存读取(占智能体和编程工作成本的大部分)为每百万令牌 0.20 美元,比 Opus 5 低 60%。Opus 5.5 的输出生成速度也比 Opus 5 快 30% 以上。

除价格下降外,我们还提升了 Pro、Max、Team 以及按席位计费的 Enterprise 套餐的五小时用量上限。同时为订阅用户提供了一次速率限制重置额度,可自行保存并在任意时间使用。

沟通表达。 Opus 5.5 的沟通相比此前的模型更加自然。早期测试者反馈它的文字表达更清晰、更易理解,这也回应了我们此前收到的关于 Opus 5 的常见反馈。它会把最重要的信息放在前面,其风格也使它在长时间协作中成为更好的工作伙伴。正如一位早期测试者所说:「它的写法和我一样。」在我们自己的使用中,这让我们更容易跟进和核对 Opus 5.5 的工作——这既是安全性上的好处,也是实用性上的优势。

Claude Sonnet 5.5 与 Claude Haiku 5.5 将于未来数周内陆续推出,同样会在性能、效率和安全性方面带来许多改进。

性能与成本效益

在我们的基准测试中,Claude Opus 5.5 在智能体编程、计算机使用与知识工作方面均处于领先位置。需要说明的是,在这种能力水平下,我们发现基准分数的差距已不再是衡量真实世界差异的可靠指标。在我们自己的使用中,Opus 5.5 与 Claude Fable 5.1 之间的实际差距比这些分数所显示的更小。

Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra GPT-5.6 Sol
智能体编程 Terminal-Bench 4.0¹ 66.4% 55.8% 52.3% 57.9% 37.3%
智能体编程 FrontierCode v1.1(主版本) 54.4% 50.3% 48.0% 53.3% 47.5%
智能体编程 CursorBench 4.0 57.8% 51.8% 46.6% — 41.7%
知识工作 GDPval-AA v2.1 1846 1735 1708 1542 1588
业务流程 AutomationBench² 40.0% 31.4% 26.9% 41.4% 28.8%
多学科推理 Humanity's Last Exam 67.7%(含工具) 65.6%(含工具) 63.6%(含工具) 57.2%(含工具) —
智能体科学研究 Terminal-Bench-Science 0.1³ 58.7% 52.6% 29.0% 64.6% 22.4%
计算机使用 OSWorld 2.0 81.8%(部分) 80.7%(部分) 74.0%(部分) — —
视觉图表识别 Chartography 89.0%(含工具) 88.4%(含工具) 83.4%(含工具) — —

Opus 5.5 优势最为明显的领域是效率。它的单令牌成本低于 Opus 5,且每个任务消耗的令牌也更少,综合下来总成本下降了 40%。

定价

每百万令牌价格 Claude Opus 5.5 Claude Opus 5
缓存读取 0.20 美元 0.50 美元
输入令牌 4 美元 5 美元
输出令牌 20 美元 25 美元
缓存写入 5 美元 6.25 美元

Opus 5.5 的快速模式(Fast mode)也可在 Claude Code 与 Claude Platform 中使用,速度最高可达 2.5 倍。其价格为每百万输入令牌 8 美元、每百万输出令牌 40 美元。

编程

Opus 5.5 尤其擅长代码库级迁移与审计等大型且跨度广的任务。一位早期测试者使用它在三小时内审计并修复了一个 20 万行的代码库,而 Opus 5 用了超过 20 小时,且消耗的令牌数是它的 2.5 倍。在一项内部测试中,我们让 Opus 5.5 与 Fable 5.1 将广泛用于跨服务器负载均衡的开源软件 HAProxy 从 C 语言翻译为 Rust。两次重写几乎都通过了 HAProxy 自身的全部回归测试,但 Opus 5.5 用 9.5 小时完成,而 Fable 5.1 用了 12 小时,成本也低了 51%。

Opus 5.5 以更低的成本实现了智能体编程的前沿水平。在 FrontierCode 的默认投入度下,它以约 20% 的单任务成本击败了 GPT-6 Astra。在 Terminal Bench 4.0 上,它以约 40% 的成本达到了与 Astra 相当的表现;在 CursorBench 上,它以约三分之一的成本领先 GPT-5.6 Sol 整整 11 分。

Terminal-Bench 4.0 用于衡量模型在命令行界面中完成复杂、多步骤专业任务的能力。Opus 5.5 在默认投入度下以约五分之一的成本击败了 Opus 5 在最高投入度下的表现,并以约 40% 的成本追平了 GPT-6 Astra。

FrontierCode 用于评估智能体所提交的代码改动是否会被合入。在默认(中等)投入度下,Opus 5.5 得分为 54.6%,高于所有其他模型,并以约五分之一的单任务成本超过了 GPT-6 Astra 的最高分(53.3%)。

CursorBench 基于来自真实 Cursor 会话中的模糊、多文件任务来评估编程智能体。在默认(中等)投入度下,Opus 5.5 得分为 52.5%,相比之下 Fable 5.1(最高投入度)为 51.8%,Opus 5(最高投入度)为 46.6%。它以约三分之一的单任务成本领先 GPT-5.6 Sol 的最高分(41.7%)11 分。

我们的早期测试者也报告了类似的效率与智能提升:

「开发者希望智能体能够接手真实软件工作并把它完成。在我们对 GitHub Copilot CLI 与 VS Code 的测试中,Claude Opus 5.5 是我们测得的使用令牌数和步骤数最少的模型之一。在 VS Code 中,它以不到 Opus 5 一半的步骤数完成了更多终端任务。更重要的是,它让开发者的更大规模项目变得真正可达成。」

—— GitHub,产品负责人 Mario Rodriguez

「我把一项跨六个代码库的大型工程任务交给 Claude Opus 5.5,让它整夜无人值守地运行。它持续工作了 18 个多小时,定义我们各个服务之间的通信方式,并厘清每个服务应如何应用这些约定。相比 Opus 5,它能更快达成里程碑,且几乎不需要返工。它的代码注释简短有用,而非又长又啰嗦。我很难找到什么负面的评价。」

—— Clio,资深软件工程师 Sean Heintz

「对 Lovable 的构建者来说,Opus 5.5 意味着在保持同样质量的同时构建更快,无论是从零开始还是在已有应用上继续开发。它只需收集一次上下文,就能做出更少且更完整的编辑,并且不会陷入反复重试,步骤数减少了三分之一到一半,过程中消耗的令牌数也显著降低。」

—— Lovable,CTO 兼联合创始人 Fabian Hedin