
Anthropic 發佈了其最新旗艦機型,其中最引人注目的數據令人難以忽視:Claude Opus 5.5 的運行成本比其前代產品降低了約40% ,同時在編碼和知識基準測試中表現更佳。Anthropic Claude Opus系列一直以來都定位爲該公司三款機型中的高端產品,高於 Sonnet 和 Haiku。此次發佈表明,該公司正試圖在不犧牲性能優勢的前提下,降低這一高端產品的運行成本,而正是這種性能優勢才使得其價格更高。
要點總結
- 據 Anthropic 公司稱,與 Opus 5 相比,Claude Opus 5.5 的運營成本降低了約 40%。
- 輸入代幣價格從每百萬個代幣 5 美元降至 4 美元,輸出代幣價格從每百萬個代幣 25 美元降至 20 美元。
- 輸出速度比 Opus 5 快 30% 以上,高速模式下運行速度可達標準速度的 2.5 倍。
- 該模型在 Terminal-Bench 4.0 測試中得分 66.4%,高於 GPT-6 Astra 的 57.9% 和 GPT-5.6 Sol 的 37.3%。
- Opus 5.5 接受了 METR 和 Frontier Design 的外部安全評估,結果顯示繞過安全殼控制的嘗試次數減少了 85%。
Anthropic推出Claude Opus 5.5,運營成本降低
Anthropic於週二發佈了 Opus 5.5,並將其定位爲該公司所謂的 Claude 5.5 系列的最新產品。據 Anthropic 稱,該型號的性能可與公司最高端的產品相媲美,同時運行成本比 Opus 5 降低了約 40%。這種以更低價格實現更高性能的組合是此次Anthropic Claude Opus更新的核心賣點,而這種權衡對於運行高負載工作負載的企業而言比普通用戶更爲重要。
降低代幣定價成本和提高運營效率
價格調整是實實在在的。Opus 5.5 的輸入代幣價格從 Opus 5 的每百萬 5 美元降至4 美元。輸出代幣的價格也從每百萬 25 美元降至 20 美元。緩存讀取成本的降幅更大,從每百萬 0.50 美元降至 0.20 美元。Anthropic 表示,該模型在各種任務中都實現了更高的代幣效率,再加上價格的大幅下調,使得典型操作的成本總體降低了 40%。值得注意的是,TechCrunch 報道稱,該模型所需計算量的下降反映了效率的真正提升,而不僅僅是在底層系統不變的情況下進行價格調整。
推出高速模式,價格另議
Anthropic 還通過 Claude Code 和 Claude Platform 推出了一種高速模式,用戶可以付費享受高達標準速度 2.5 倍的處理速度。該模式價格更高——每百萬輸入令牌8 美元,每百萬輸出令牌 40 美元——但其目標用戶是那些對週轉時間比成本更敏感的工作流程。與此同時,包括 Pro、Max、Team 和基於席位的 Enterprise 套餐在內的訂閱級別都將獲得更長的五小時使用時長上限,以及一個可供會員保存以備後用的速率限制重置功能。
編碼和知識任務中的表現提升
除了價格優勢外,Anthropic 將 Opus 5.5 定位爲一次真正的性能飛躍,尤其是在軟件工程和專業知識工作方面。該公司表示,其輸出生成速度比 Opus 5 快 30% 以上,這一差異在長時間運行的編碼任務中尤爲明顯。
更快的輸出生成和基準測試結果
Anthropic 表示,該模型能夠更高效地處理擴展的軟件工程工作流程,例如遷移、代碼審查和調試。在一項內部測試中,Opus 5.5 據稱在不到三個小時內完成了 20 萬行代碼庫的評估,而 Opus 5 則需要 20 多個小時。在 Anthropic 的Terminal-Bench 4.0 基準測試中,Opus 5.5 的得分爲 66.4%,高於 GPT-6 Astra 的 57.9% 和 GPT-5.6 Sol 的 37.3%。Anthropic 也承認,基準測試結果會因模型配置和測試方法而異,實際性能差距可能比原始分數顯示的要小。TechCrunch 還指出,Anthropic 聲稱 Opus 5.5 在多項基準測試中超越了其自身規模更大的 Fable 模型,並完成了 Fable 無法完成的非正式任務——考慮到 Fable 是一個資源密集型系統,這一說法尤其引人注目。
在衡量44種職業專業能力的GDPval-AA v2.1基準測試中,Opus 5.5獲得了1846 Elo評分,超越了Anthropic之前的版本。這意義重大,因爲它表明該公司追求的不僅僅是編碼速度,還試圖證明該模型同樣適用於白領工作中需要處理大量文檔的情況。
企業用戶反饋和專業任務改進
Anthropic 表示,包括 GitHub、德勤和 Stripe 在內的早期企業用戶報告稱,他們在軟件創建、分析任務和書面溝通方面均有所改進。這些評估數據來自企業自身,而非針對所有部署場景的獨立驗證結果,但它們仍然指向 Anthropic 預期中最大的商業回報領域:那些依賴 AI 進行代碼編寫和業務文檔編寫的團隊。TechCrunch 還指出 Opus 5.5 的行爲發生了一個更爲細微的變化——據報道,該模型減少了術語的使用,並且更傾向於將最重要的信息放在回覆的開頭,這一轉變旨在使輸出結果更易於快速瀏覽。
克勞德·奧普斯 5.5 加強了安全保障措施
安全測試仍然是Anthropic此次發佈的核心內容,這並非偶然。此次發佈緊隨其後,此前不久,首席執行官Dario Amodei曾公開呼籲放緩前沿人工智能能力提升的步伐,以便安全基礎設施有時間跟上——他在最近的一篇文章中闡述了這一立場,他寫道:“要全面應對風險,需要更加謹慎……不僅要投資於風險預防,還要控制能力提升的速度,以便風險預防有時間跟上。”
外部安全評估和內部評估
Opus 5.5 在正式發佈前,經過了包括METR和Frontier Design在內的外部機構的評估。Anthropic 公司報告稱,該模型在公司自主研發的自動化行爲評估中取得了迄今爲止的最佳成績。TechCrunch 報道稱,此次安全培訓的結構與之前的版本大致相同,但 Anthropic 表示,更先進的培訓和評估系統(包括改進的安全和監控工具)已在爲未來的模型準備中。
提高了對規避措施和快速注射的抵抗力
Anthropic公司表示,與Opus 5和Claude Mythos 5.1相比,Opus 5.5在專門測試中規避控制參數的嘗試次數減少了約85%。該公司還報告稱,該模型對快速注射攻擊的抵抗力有所提高。由於該模型在網絡安全和生物領域表現出強大的能力,Anthropic公司針對這些領域構建了額外的保護機制——類似於其Fable模型所採用的安全措施,這些措施限制了系統被用於查找已編譯程序中的漏洞或協助生物武器開發的方式。Anthropic公司還在擴展驗證計劃,使經過審查的研究人員和網絡安全專業人員能夠更廣泛地訪問已批准的項目。
Claude 5.5 系列的供貨情況和即將發佈的版本
Opus 5.5現已可通過 Anthropic 直接購買,也可通過 Amazon Web Services、Google Cloud 和 Microsoft Azure 購買——爲企業客戶提供了多種途徑,以便在現有云基礎設施中部署該軟件。這種多雲可用性對於已圍繞這些雲服務提供商之一構建工作流程的企業至關重要,因爲它消除了潛在的採用障礙。
預計 Claude Sonnet 5.5 和 Claude Haiku 5.5 將推出
Anthropic 表示,Claude Sonnet 5.5 和 Claude Haiku 5.5(產品線的中端和入門級產品)預計將在未來幾周內發佈,性能提升幅度與 Opus 5 類似。Opus 5.5 的發佈距離 Opus 5 於 7 月發佈僅約兩個月,這一速度表明,即使 Anthropic 公開強調在性能提升方面採取更爲謹慎的態度,其迭代速度依然很快。Sonnet 和 Haiku 的更新發布後,整個Anthropic Claude Opus Sonnet Haiku 產品線都將體現此次版本帶來的成本和速度提升,爲開發者提供一套適用於不同價位的均衡配置選擇。
常問問題
與前代產品相比,Claude Opus 5.5 在成本方面有哪些改進?
Claude Opus 5.5 將運營成本降低了約 40%,其中輸入代幣價格從每百萬個代幣 5 美元降至 4 美元,輸出代幣價格從每百萬個代幣 25 美元降至 20 美元。
Claude Opus 5.5 在編碼和專業任務中的表現如何?
它提供改進的編碼和知識處理,輸出生成速度比 Opus 5 快 30% 以上,並且在 Terminal-Bench 4.0 中取得了更高的基準測試分數,例如 66.4%。
Claude Opus 5.5 具備哪些安全增強功能?
Opus 5.5 完成了外部安全評估,在內部自動行爲評估中得分最高,並且表現出大約 85% 的規避收容措施的嘗試減少,以及對快速注射的抵抗力提高。
哪些企業正在使用 Claude Opus 5.5?
企業用戶包括 GitHub、德勤和 Stripe,他們表示軟件開發、分析任務和書面溝通方面均有所改進。
本文由人工智能輔助生成,並經編輯團隊審覈。