
Anthropic 发布了其最新旗舰机型,其中最引人注目的数据令人难以忽视:Claude Opus 5.5 的运行成本比其前代产品降低了约40% ,同时在编码和知识基准测试中表现更佳。Anthropic Claude Opus系列一直以来都定位为该公司三款机型中的高端产品,高于 Sonnet 和 Haiku。此次发布表明,该公司正试图在不牺牲性能优势的前提下,降低这一高端产品的运行成本,而正是这种性能优势才使得其价格更高。
要点总结
- 据 Anthropic 公司称,与 Opus 5 相比,Claude Opus 5.5 的运营成本降低了约 40%。
- 输入代币价格从每百万个代币 5 美元降至 4 美元,输出代币价格从每百万个代币 25 美元降至 20 美元。
- 输出速度比 Opus 5 快 30% 以上,高速模式下运行速度可达标准速度的 2.5 倍。
- 该模型在 Terminal-Bench 4.0 测试中得分 66.4%,高于 GPT-6 Astra 的 57.9% 和 GPT-5.6 Sol 的 37.3%。
- Opus 5.5 接受了 METR 和 Frontier Design 的外部安全评估,结果显示绕过安全壳控制的尝试次数减少了 85%。
Anthropic推出Claude Opus 5.5,运营成本降低
Anthropic于周二发布了 Opus 5.5,并将其定位为该公司所谓的 Claude 5.5 系列的最新产品。据 Anthropic 称,该型号的性能可与公司最高端的产品相媲美,同时运行成本比 Opus 5 降低了约 40%。这种以更低价格实现更高性能的组合是此次Anthropic Claude Opus更新的核心卖点,而这种权衡对于运行高负载工作负载的企业而言比普通用户更为重要。
降低代币定价成本和提高运营效率
价格调整是实实在在的。Opus 5.5 的输入代币价格从 Opus 5 的每百万 5 美元降至4 美元。输出代币的价格也从每百万 25 美元降至 20 美元。缓存读取成本的降幅更大,从每百万 0.50 美元降至 0.20 美元。Anthropic 表示,该模型在各种任务中都实现了更高的代币效率,再加上价格的大幅下调,使得典型操作的成本总体降低了 40%。值得注意的是,TechCrunch 报道称,该模型所需计算量的下降反映了效率的真正提升,而不仅仅是在底层系统不变的情况下进行价格调整。
推出高速模式,价格另议
Anthropic 还通过 Claude Code 和 Claude Platform 推出了一种高速模式,用户可以付费享受高达标准速度 2.5 倍的处理速度。该模式价格更高——每百万输入令牌8 美元,每百万输出令牌 40 美元——但其目标用户是那些对周转时间比成本更敏感的工作流程。与此同时,包括 Pro、Max、Team 和基于席位的 Enterprise 套餐在内的订阅级别都将获得更长的五小时使用时长上限,以及一个可供会员保存以备后用的速率限制重置功能。
编码和知识任务中的表现提升
除了价格优势外,Anthropic 将 Opus 5.5 定位为一次真正的性能飞跃,尤其是在软件工程和专业知识工作方面。该公司表示,其输出生成速度比 Opus 5 快 30% 以上,这一差异在长时间运行的编码任务中尤为明显。
更快的输出生成和基准测试结果
Anthropic 表示,该模型能够更高效地处理扩展的软件工程工作流程,例如迁移、代码审查和调试。在一项内部测试中,Opus 5.5 据称在不到三个小时内完成了 20 万行代码库的评估,而 Opus 5 则需要 20 多个小时。在 Anthropic 的Terminal-Bench 4.0 基准测试中,Opus 5.5 的得分为 66.4%,高于 GPT-6 Astra 的 57.9% 和 GPT-5.6 Sol 的 37.3%。Anthropic 也承认,基准测试结果会因模型配置和测试方法而异,实际性能差距可能比原始分数显示的要小。TechCrunch 还指出,Anthropic 声称 Opus 5.5 在多项基准测试中超越了其自身规模更大的 Fable 模型,并完成了 Fable 无法完成的非正式任务——考虑到 Fable 是一个资源密集型系统,这一说法尤其引人注目。
在衡量44种职业专业能力的GDPval-AA v2.1基准测试中,Opus 5.5获得了1846 Elo评分,超越了Anthropic之前的版本。这意义重大,因为它表明该公司追求的不仅仅是编码速度,还试图证明该模型同样适用于白领工作中需要处理大量文档的情况。
企业用户反馈和专业任务改进
Anthropic 表示,包括 GitHub、德勤和 Stripe 在内的早期企业用户报告称,他们在软件创建、分析任务和书面沟通方面均有所改进。这些评估数据来自企业自身,而非针对所有部署场景的独立验证结果,但它们仍然指向 Anthropic 预期中最大的商业回报领域:那些依赖 AI 进行代码编写和业务文档编写的团队。TechCrunch 还指出 Opus 5.5 的行为发生了一个更为细微的变化——据报道,该模型减少了术语的使用,并且更倾向于将最重要的信息放在回复的开头,这一转变旨在使输出结果更易于快速浏览。
克劳德·奥普斯 5.5 加强了安全保障措施
安全测试仍然是Anthropic此次发布的核心内容,这并非偶然。此次发布紧随其后,此前不久,首席执行官Dario Amodei曾公开呼吁放缓前沿人工智能能力提升的步伐,以便安全基础设施有时间跟上——他在最近的一篇文章中阐述了这一立场,他写道:“要全面应对风险,需要更加谨慎……不仅要投资于风险预防,还要控制能力提升的速度,以便风险预防有时间跟上。”
外部安全评估和内部评估
Opus 5.5 在正式发布前,经过了包括METR和Frontier Design在内的外部机构的评估。Anthropic 公司报告称,该模型在公司自主研发的自动化行为评估中取得了迄今为止的最佳成绩。TechCrunch 报道称,此次安全培训的结构与之前的版本大致相同,但 Anthropic 表示,更先进的培训和评估系统(包括改进的安全和监控工具)已在为未来的模型准备中。
提高了对规避措施和快速注射的抵抗力
Anthropic公司表示,与Opus 5和Claude Mythos 5.1相比,Opus 5.5在专门测试中规避控制参数的尝试次数减少了约85%。该公司还报告称,该模型对快速注射攻击的抵抗力有所提高。由于该模型在网络安全和生物领域表现出强大的能力,Anthropic公司针对这些领域构建了额外的保护机制——类似于其Fable模型所采用的安全措施,这些措施限制了系统被用于查找已编译程序中的漏洞或协助生物武器开发的方式。Anthropic公司还在扩展验证计划,使经过审查的研究人员和网络安全专业人员能够更广泛地访问已批准的项目。
Claude 5.5 系列的供货情况和即将发布的版本
Opus 5.5现已可通过 Anthropic 直接购买,也可通过 Amazon Web Services、Google Cloud 和 Microsoft Azure 购买——为企业客户提供了多种途径,以便在现有云基础设施中部署该软件。这种多云可用性对于已围绕这些云服务提供商之一构建工作流程的企业至关重要,因为它消除了潜在的采用障碍。
预计 Claude Sonnet 5.5 和 Claude Haiku 5.5 将推出
Anthropic 表示,Claude Sonnet 5.5 和 Claude Haiku 5.5(产品线的中端和入门级产品)预计将在未来几周内发布,性能提升幅度与 Opus 5 类似。Opus 5.5 的发布距离 Opus 5 于 7 月发布仅约两个月,这一速度表明,即使 Anthropic 公开强调在性能提升方面采取更为谨慎的态度,其迭代速度依然很快。Sonnet 和 Haiku 的更新发布后,整个Anthropic Claude Opus Sonnet Haiku 产品线都将体现此次版本带来的成本和速度提升,为开发者提供一套适用于不同价位的均衡配置选择。
常问问题
与前代产品相比,Claude Opus 5.5 在成本方面有哪些改进?
Claude Opus 5.5 将运营成本降低了约 40%,其中输入代币价格从每百万个代币 5 美元降至 4 美元,输出代币价格从每百万个代币 25 美元降至 20 美元。
Claude Opus 5.5 在编码和专业任务中的表现如何?
它提供改进的编码和知识处理,输出生成速度比 Opus 5 快 30% 以上,并且在 Terminal-Bench 4.0 中取得了更高的基准测试分数,例如 66.4%。
Claude Opus 5.5 具备哪些安全增强功能?
Opus 5.5 完成了外部安全评估,在内部自动行为评估中得分最高,并且表现出大约 85% 的规避收容措施的尝试减少,以及对快速注射的抵抗力提高。
哪些企业正在使用 Claude Opus 5.5?
企业用户包括 GitHub、德勤和 Stripe,他们表示软件开发、分析任务和书面沟通方面均有所改进。
本文由人工智能辅助生成,并经编辑团队审核。