Anthropic 於 7 月 24 日發布 Claude Opus 5,售價為每百萬輸入 tokens 5 美元——比其前代模型 Claude Fable 5 的成本減半——同時在大多數主要基準測試上也超越 Fable 5。Opus 5 在針對代理式(agentic)的程式碼評估 Frontier-Bench v0.1 中取得 43.3%,而 Fable 5 為 33.7%,OpenAI 的 GPT-5.6 Sol 為 34.4%;在新穎的解題基準 ARC-AGI-3 上,Opus 5 得分為 30.2%,而 GPT-5.6 Sol 的得分為 7.8%。該新模型成為 Claude Max 的預設選項,並在 Claude Pro 上成為最強選擇,實質上在今年夏天較早時 Fable 5 因營運中斷而受到影響後,將 Fable 5 替換為多數訂閱者的首選。
Anthropic 的產品線分為四個層級:Haiku 速度快且便宜,Sonnet 屬於中階,Opus 是主要的重度工作馬(heavy workhorse),而 Mythos 類別——於今年春季推出——包含提供給公眾的 Claude Fable 5,以及透過 Project Glasswing 供已審核的資安研究人員與關鍵基礎設施營運商使用的 Claude Mythos 5。
Claude Opus 5 在各大基準上超越 Fable 5
在會測試 AI 程式碼代理能否從頭到尾完成真實軟體工程任務的 Frontier-Bench v0.1 上,Opus 5 的成績為 43.3%。Fable 5 為 33.7%,OpenAI 的 GPT-5.6 Sol 為 34.4%。
最大差距出現在 ARC-AGI-3,這是一項以新穎謎題為核心、用來測模型無法從訓練資料中記憶而得的解題能力的測試。Opus 5 得分 30.2%;GPT-5.6 Sol 得分 7.8%;Fable 5 則完全未被測試。
在 GDPval-AA v2 上,這是一項透過 Elo 評分(用於衡量真實專業任務的相對表現)的知識工作基準,Opus 5 達到 1,861 分,而 Fable 5 為 1,747,GPT-5.6 Sol 為 1,736。
依照 Anthropic 公開的基準測試,Fable 5 僅在法律與健康相關的評估中以小幅優勢超越 Opus 5。
Anthropic 將 Opus 5 定價為每百萬輸入 tokens 5 美元
Opus 5 可透過 API 使用,價格為每百萬輸入 tokens 5 美元、每百萬輸出 tokens 25 美元。可用 Fast 模式(速度約為預設值的 2.5 倍),價格為基礎價格的兩倍——每百萬輸入 tokens 10 美元、每百萬輸出 tokens 50 美元。
定價與 Opus 4.8 相符,且正好是 Fable 5 成本的一半;Anthropic 曾將 Fable 5 定位為付費用戶的日常前沿產品。
Fable 5 因出口管制令而在全球下架
Fable 5 於 6 月 9 日推出,三天後因美國政府發布緊急出口管制令(理由為存在越獄漏洞)而在全球範圍內下架,並於 6 月 30 日回歸。回歸後,它立刻改為僅提供 credits 的模式,不再包含在標準方案中。
Opus 5 現在填補了 Fable 5 原本無法守住的訂閱者旗艦席位。
第三方平台驗證 Opus 5 效能提升
Lovable 是一個擁有數百萬用戶的開發者平台,曾在其內部評估中運行 Opus 5。Anthropic 共享的一句話中,Fabian Hedin 說:「它不只是我們最艱難的代理式(agentic)程式碼任務更好,較 Opus 4.7 提升 22%;而且更穩定,從一次執行到下一次執行的波動小得多。」
Zapier 在 AutomationBench 上測試了 Opus 5。AutomationBench 是一項評估:判斷模型能否在沒有人工協助的情況下,從頭到尾完成完整的商業工作流程。該模型「拿到一份原始的帳戶健康(account-health)活頁簿後,端到端跑完完整的流失預防(churn-prevention)流程:標記有風險的帳戶、通知正確的負責人,並為留存(retention)營運彙整摘要。先前的模型都不通過;Opus 5 達到 100%。」
Ultima Genomics 是一家 DNA 定序公司,表示該模型「行為更像一位審慎的科學家,而不是我們曾跑過的任何其他模型。它會採用正確的統計測試來排除混雜因素,並以獨立方法交叉驗證自身結果,且能在長時間、多步驟的分析中保持在軌道上。」
該次發布落在 Moonshot AI 之後一週。Moonshot AI 是一家位於北京、由阿里巴巴支持的創業公司,先前已揭露 Kimi K3——一個擁有 2.8 兆參數的開放權重(open-weight)模型;Moonshot 將其描述為全球最大的開放式 AI 系統。獨立基準測試始終一致地將 Kimi K3 排在整體第三名,落後於 Fable 5 與 GPT-5.6 Sol,同時在特定領域超越了這兩者。
常見問題(FAQ)
Claude Opus 5 在哪些基準測試上超越了 Fable 5?
Claude Opus 5 在 Frontier-Bench v0.1 得分為 43.3%,而 Fable 5 為 33.7%;在 ARC-AGI-3 上為 30.2%(Fable 5 未被測試);在 GDPval-AA v2 上為 1,861,而 Fable 5 為 1,747。依照結果,Fable 5 僅在法律與健康相關的評估中以小幅優勢超越 Opus 5。
Claude Opus 5 相較於 Fable 5 費用是多少?
透過 API,Claude Opus 5 的價格為每百萬輸入 tokens 5 美元、每百萬輸出 tokens 25 美元——正好是 Fable 5 隱含成本的一半。Fast 模式的價格為每百萬輸入 tokens 10 美元、每百萬輸出 tokens 50 美元。
為什麼 Claude Fable 5 會從全球可用性中被移除?
Fable 5 於 6 月 9 日推出,並在三天後因美國政府發布緊急出口管制令(理由為存在越獄漏洞)而在全球下架。它於 6 月 30 日以僅提供 credits 的模式回歸,且不再包含在標準方案中。