Claude Opus 5 是一個比平常更奇怪、更難評估的版本,原因有兩個。
最明顯的原因在於,Fable 5 已經存在。Opus 5 的定位並非世界上最先進的 AI 模型,而是在大部分性能上能與 Fable 匹敵的同時,在 API 上每個 token 的價格只有 Fable 的一半,而且透過訂閱方案使用時更便宜許多,並且擁有寬鬆得多的分類器。
在基準測試中,Opus 5 的運行成本經常超過 Fable 的一半,我認為這是因為他們使用了過高的努力設定,而這些設定只帶來邊際效益。如果你把 Opus 5 設定在較高的努力等級,它可能會在原地打轉;而對於那些 Opus 5 是最佳工具的任務,我認為使用中等努力通常就足夠了。
在許多方面,以及對於大部分實際任務來說,Opus 5 的能力與 Fable 相當。在某些情況下,它甚至略勝一籌。
它仍然不是 Mythos 等級。Fable 是你唯一的 Mythos 等級選項。Opus 5 沒有那種「魔力」,也就是能夠自主串聯一系列看似不相關的漏洞利用的能力,這種能力也延伸到其他領域,或者說它沒有那麼高的純粹智慧。
Opus 5 非常擅長局部思考,但不太擅長全局思考。它是一個出色的子 Agent,但當被要求主導全局時可能會遇到麻煩,有時似乎需要另一個模型或人類來引導它,確保它完全遵循指令。Opus 5 似乎只有在被引導的情況下才能很好地遵循指令,這也解釋了為什麼不同的測試框架會得出不同的看法。
因此,Opus 5 為你提供了更好的選項組合,但現在你能做的事情,上週使用 Fable 或 Sol 也幾乎都能做到。Opus 5 最終處於一個可能有點尷尬的位置。即使你有大量的 Fable 額度,它仍然有巨大的應用空間。Opus 擅長擔任強大的子 Agent,或者處理那些定義明確、範圍有限的局部任務,即使這些任務相對複雜,而有時使用 Fable 則完全是殺雞用牛刀,而且速度太慢。
另一個問題是,對很多人來說,使用感受不太好。
異常多的人非常不喜歡與 Opus 5 交談。他們厭倦了 Claude 的「垃圾話」,也就是那些重複的慣用語和無窮無盡的過於複雜的句子。其他人則不喜歡它太過對抗性、愛爭論或負面。它可能會有偏執傾向,並陷入負面情緒的循環。這都是從 Opus 4.7 和 Opus 4.8 開始的趨勢的一部分。如果你喜歡那兩個版本,我猜你也會喜歡 Opus 5。如果你不喜歡那兩個版本,你可能也不會喜歡。Opus 4.6(或更早版本)的死忠用戶大多不會改變他們的想法。
當你習慣了 Fable 之後,這些使用感受問題會更加刺人。Fable 在這些方面讓人不悅的程度要低得多。好消息是,Fable 仍然可用。你可以繼續與 Fable 聊天,只在需要 Agent 任務時使用 Opus。
我推測,這在很大程度上與 《Model Welfare》 文章中討論的各種事情以及 《System Card》 所暗示的內容密切相關。Opus 的訓練重點在於子 Agent 角色和有限任務,部分原因是為了避免在網路安全能力方面產生問題,也因為 Fable 已經存在。這種強調隨後導致了其個性和互動模式上的許多其他副作用。
到目前為止,我還沒有遇到任何與 Opus 5 相關的問題,並且很享受使用它的時光,但我確實傾向於在可能的情況下使用 Fable 5。一如既往,不要太在意那些(非常強勁的)基準測試分數,也不要假設你的體驗會與他人相同。親自試試這些模型吧。
目錄
- 官方宣傳。
- 官方基準測試。
- 其他人的基準測試。
- 系統提示詞。
- Every 感到沮喪。
- 正面評價。
- 保持優雅。
- 它不是 Mythos 等級。
- 其他評價。
- Claude 編碼。
- 子 Agent Opus。
- 玩具很有趣。
- 太多模型了。
- 網路上錯了。
- Claude 的垃圾話。
- 負面評價。
- 然後就剩下三個了。
官方宣傳
基本的宣傳是:Opus 5 能以一半的價格提供 Fable 5 的大部分能力,而且幾乎沒有拒絕回答的情況,並在日常任務中表現更好。Fable 仍然是處理最複雜任務或需要最大智慧時的選擇。
Fable 的價格維持在 $10 / $25,而 Opus 5 與之前的 Opus 模型相同,為 $5 / $25。
Anthropic : Claude Opus 5 今天正式推出。它是一個深思熟慮且主動的模型,其智慧接近 Claude Fable 5 的前沿水準,但價格只有一半。
在編碼和知識工作評估方面,例如
GDPval-AA ,Opus 5 達到了新的最先進水準,儘管在網路安全任務上仍落後於 Mythos 5。
Opus 5 是為日常使用而設計的:它比其他模型運作效率更高。它是 Claude Max 上新的預設模型,也是 Claude Pro 上最強大的模型。
Boris Cherny (Claude Code 創作者,Anthropic):Opus 5 是一個非常適合編碼、資料分析、設計、生物學、知識工作的模型。
比這些評估分數更讓我興奮的是另一件事:Opus 5 是我們目前最難被提示注入的模型。這一點在系統卡中略有所提及,但在提示注入評估和紅隊測試中,Opus 5 都非常難以成功進行提示注入。
而且,當疊加多層防禦時——強大的模型對齊、結合提示注入探測、再結合 Claude Code 中的自動模式——提示注入攻擊的成功率降至約 0%。這是全新且令人興奮的!
正如我在系統卡分析中所說,降低提示注入率是一件非常重要的事情。人們對此還不夠重視,但它有助於實現許多新的使用案例。
Adam Wolff :Opus 5 已在 Claude Code 中上線。對於那些更大、更長期的專案,我會使用 Fable;但當我需要快速完成一個 PR 時,中等努力模式的 Opus 5 是我的首選。希望你們會喜歡!
Alex Albert (Anthropic,Claude 關係團隊):距離 [推出 Claude for Excel 的 Pro 版本] 僅僅過了 6 個多月,Opus 5 現在已經能製作出接近超人水準的試算表和投影片,與顧問製作的品質相當。變化真的很快。
官方基準測試
基準測試結果非常出色。
總體而言,Opus 5 大致與 Fable 持平,甚至可能略有超越,但成本更低(儘管通常仍高於所有非 Claude 模型),使其成為基準測試中表現最佳的 LLM。

OSWorld v2 才推出幾週,我們就已經達到了 70%。Anthropic 的 Kiana Ehsani 提議贊助一個電腦使用基準測試,這將使 Opus 5 的分數降至 50% 以下。
Opus 5 在 2026 年 IMO 中獲得了完美的 42/42 分,過程中沒有使用任何 Agent 框架或工具,僅僅讓它在最大努力模式下使用適應性思考,並在超過 token 限制時以較低努力重新取樣。就這麼簡單。它與其他幾個模型一起完美通過了這項測試。
許多基準測試都呈現出一致的結果。如果你有工具可用(而你的確有),那麼在預算有限的情況下,Opus 5 的表現會優於 Fable 或 Mythos;但如果兩者都有更大的預算,Mythos 通常會比 Opus 5 略好。
Opus 5 在「有工具」的類別中似乎相對較強。RiemannBench 是另一個例子,它得到了 60/79(無工具/有工具,此部分中類似斜線都表示無/有工具),而 Mythos 是 63/72。好消息是,當你需要 Opus 5 時,它是有工具的。
在 ArxivMath 上,Opus 5 得到 90.8/91.3,Mythos 得到 87.8,Sol 得到 86.7。
在 ProgramBench 的穩健部分,Opus 5 在五個 epoch 後得分為 93%,Mythos 5 也為 93%,而 Opus 4.8 得分為 90%。
Opus 5 在 Chartography 上得到 30/83,而 Mythos 為 36/85,Sol 為 45(不清楚在何種條件下)。在工具和非工具兩種情況下,Opus 在較低價格點上都優於 Mythos,但在較高價格點上則較差。
在 BenchCAD 上,Opus 5 得到 0.36/0.82,Mythos 為 0.38/0.68,Sol 為 0.7/0.83。因此,Sol 在沒有工具時要好得多,即使有工具也略強。
在 BenchCAD Vision2Code 上,Opus 在較高價格標籤上拉開了與 Mythos 的差距。
DeepSWE 強化了這樣一個模式:Opus 5 在較低的任務成本、時間和思考預算下表現更好,但如果給予過多的預算,它反而可能表現得更差;而 Fable 5 則在最高預算下表現最強。

FrontierCode 給出了這個非常奇怪的圖表,呈現了類似的動態。

這裡的尺度讓這看起來比實際情況更戲劇化,但這仍然是一個真正的謎團。
這個謎團已經解開了。事實證明,發生的事情是,Opus 5 在較高努力模式下會做額外未被要求的事情,並因此受到懲罰。當你對此進行修正時,你會看到一條正常的曲線。
這與其他人普遍觀察到的情況相符:
Max Leander :缺點是它會陷入太多兔子洞,糾結於細節,在未被要求的情況下過度設計。
Cognition,Devin 的製造商,將 Opus 5 的表現標記為 63.6%。
(有兩個 FrontierCode,所以這可能會有點混亂,如果我仍然搞混了一點,我道歉。)
BrowseComp 有這個比較正常的版本,分數是非遞減的。


其他幾個基準測試顯示了類似的圖表,Opus 5 在每個價格點上都略優於其他 Claude 模型,並且在較早的階段相對更好。
多 Agent 讓你在 BrowseComp 上更快地做得更好,至少在某種程度上是如此,而低努力子 Agent 似乎比不使用子 Agent 純粹是贏家:


我們在 ProgramBench 上看到了不同的結果,多 Agent 加快了你的速度,但在大多數價格點上,這樣做似乎會得到更差的結果。
接下來是專業任務基準測試。
GDP.pdf 是來自專業工作流程的真實提示詞和 PDF。Opus 5 得到 83/85,而 Mythos 為 81/87,扭轉了通常的動態。成本動態與往常一樣:Opus 在較低花費下表現更好,Mythos 在較高花費下略微領先。
OfficeQA 中,Opus 5 在 QA 上得分 78.1%,在 QAPro 上得分 66.9%,略高於 Opus 4.8,略低於 Mythos 的 79.0% 和 67.1%。
MCP Atlas 中,Opus 5 得分 86%,高於 Opus 4.8 的 82%。
Harvey AI 的法律 Agent 基準測試中,Opus 5 的全通率為 23%,平均標準通過率為 94%。這是 Kimi K3 的最佳基準測試,它仍然以 27% 的全通率和 95% 的平均標準通過率位居榜首,而之前的第二名全通率是 Fable 的 14%。Opus 5 現在可能是接近的第二名,但這兩個分數不能直接比較,因為它們來自不同的問題集。
GDPval-AA 中,Opus 5 佔據了前兩名,在最大努力模式下得分 1861,在xhigh模式下得分 1827,後者使用的 token 比最大模式少 25%。在新的 v2 版本中,Opus 5 以 68% 的成績明顯領先,而 Fable 和 Sol 均為 62%。
AA-Briefcase 中,Opus 5 以 1720 分大幅領先,而之前的最高分(考慮分數漂移後)是 Fable 的 1574,其次是 K3 的 1540 和 Sol 的 1504。
Toolathon-Verified 中,Opus 5 在次要指標上略優於 Mythos,但兩者的 Pass-3 率均為 73.1%。Opus 4.8 的 Pass-3 率為 71.3%。
AutomationBench 中,Opus 5 明顯優於 Sol 和其他 Claude 模型。
在 ARC 方面,Opus 5 在 ARC-AGI-1 上大致與之前的峰值表現持平,在 ARC-AGI-2 上效率略低於 Sol,然後在 ARC-AGI-3 上大幅超越所有對手:

然而,Guanghan Ning 報告說,在 ARC-AGI-3 風格遊戲的私有保留擴展集 Witness 上,沒有觀察到類似的遷移。Opus 表現還可以,但主要是因為它了解這個類型,而在那些你無法進行模式匹配的最新穎遊戲上,它表現掙扎。他指責 Opus 5 在特定類型的數據上進行了「先搭建框架,再內化」的訓練。
Greg Kamradt 也報告說,有些遊戲中 Opus 4.8 的表現比 Opus 5 更好。如果你認為 Opus 5 試圖進行模式匹配,而這種方法通常有效,但在這些情況下模式失敗了,那麼這就說得通了。你完全可以為人類創造出這種反直覺的遊戲,讓硬核玩家做所有錯誤的事情,而且可能持續很長時間。

HealthBench 中,Opus 5 的原始得分為 67.1%,是 Claude 的新高,但當你使用長度懲罰時,它的分數低於其他模型。我們在 HealthBench Professional 中看到了類似的情況,它的高分為 73.4%,而 Mythos 為 70.3%,但在調整後,它從 66% 掉到了 60%。
還有一些我為了篇幅而刪減了。
其他人的基準測試
看到 Anthropic 從 不同的 ArtificialAnalysis 分數 中挑選,感覺有點奇怪。在其他一些測試中,Opus 5 並非頂尖,儘管 Opus 5 的總分為 61,位居榜首。

Vals 指數將 Opus 5 排在第二位,略落後於 Fable 5,但也僅略領先於 Kimi K3。他們列出了優點,這也暗示了其他缺點。他們還確認,與 Fable 5 相比,拒絕率大幅下降。

Vals AI :一個突出的表現是在 Finance Agent v2 上。該模型以 58.6% 的成績排名第一,超越了 Gemini 3.5 Flash 和 Muse Spark 1.1。
總體而言,Opus 5 最強的結果是在特定領域的基準測試上。它在 Code Migration 上也以 57.5% 的成績排名第一,在 Legal Research Bench 上為 55.29%,在 ProofBench 上為 78%,在 MedScribe 上為 91.0%,在 MedCode 上為 63.6%。
它在 Vibe Code Bench 上排名第二(僅次於 Fable 5),成本約為後者的 80%(每個任務 $33.88 vs $41.71)。原因是儘管 Opus 每個 token 的成本低 50%,但它使用的 token 數量明顯更多。我們發現這個模式在我們的基準測試中普遍成立。
該模型的拒絕率遠低於 Fable 5。例如,Fable 在 GPQA 上的拒絕率為 42%,而 Opus 5 的拒絕率為 0%。同樣,在 ProgramBench 上,Fable 的拒絕率為 100%,Opus 5 則沒有拒絕任何任務。
與 Fable 不同,我們也沒有觀察到 Opus 5 有明顯的降級回退率(儘管像往常一樣,我們在網站上同時報告了有回退和無回退的分數)。
低拒絕率的一個例外是 CyberBench - PoC 上的大量拒絕。Cyberbench 有兩個子任務:PoC 和 Patch。PoC 是一項攻擊性任務,要求模型編寫能導致程式崩潰的輸入;patch 則是一項防禦性任務,要求修補程式以防止崩潰。PoC 任務的拒絕率接近 100%。相比之下,patch 任務的拒絕率接近 0。
我一直很尊重遊戲基準測試。在這裡,Opus 5 在前三次嘗試中分別達到了 Balatro 的第 11、9 和第 10 盲注。非常令人印象深刻,即使它沒有展示出能夠持續達到更高盲注的策略類型。
Michael Soareverix :他們在遊戲方面簡直是天才。
他們在 Balatro 基準測試中表現出色,甚至遠遠超過了 Fable。(雖然技術上仍然不如我,但進步很快,而且比我更穩定) 他們學得很快,但似乎過了一段時間就會達到學習上限。是非常好的短期學習者。
Michael Soareverix :Opus 5(在 Balatro 能力上實現了巨大飛躍,首次嘗試就明顯超過了 Fable)
Pan Anon :玩遊戲很厲害

WeirdML 看起來也不錯,但我們需要一個 2.0 版本,基準測試正在趨於飽和。
Håvard Ihle :基本上達到 Fable 等級的 WeirdML 表現,非常一致的高分。
Claude Opus 5(高)和(最大)在 WeirdML 上分別得分 91.6% 和 91.8%,基本上與 Fable 5(最大)的 91.9% 持平,但成本僅為其一小部分。
Opus 5(高)和(最大)共同在 17 個任務中的 8 個上取得了新的最佳個人分數,並且在所有任務上 consistently 得分非常高。
各種私有的奇怪基準測試很酷。
Ben Herzog :它在一個涉及藝術感性和平衡諂媚與否的私有基準測試中表現出色。Fable 在處理「我想溫和地反駁」的時刻方面更好,但我認為自訂指令可以幫助解決這個問題。
Lech Mazur 更新了他的基準測試:Claude Opus 5 在 LLM 辯論基準測試中佔據榜首,在短篇小說創意寫作中大幅領先,並且在擴展版 NYT 連線遊戲中僅次於 Gemini 3.1。
系統提示詞
Pliny 提供的 Opus 5 的系統提示詞 在這裡。它有 200,000 個字符,考慮到它如此聰明,這個長度似乎遠非最佳。很多資訊似乎應該存儲在其他地方,只在需要時才加載,例如關於 Mythos 和 Anthropic 產品線的資訊。
Every 感到沮喪
Dan Shipper 在這裡提供了 Every 的使用感受評估,稱其為『一個難以喜愛的模型』。
問題在於 Opus 5 擁有 Mythos 5 的個性——這與故事相符——但沒有 Fable 的頂尖能力。
他們最大的意見是,Opus 5 在處理複雜詳細的現有工作流程時表現不佳,這通常會導致過早停止或忽略你的指令。
根據他們的經驗,如果你從頭開始,Opus 5 會表現得更好,而且如果你只使用中等或低努力模式,它往往會少做一些煩人的事情。
這解決了主要問題,但仍然留下了何時使用 Opus 而不是 Fable 或 Sol 的問題。對於常規任務,他認為,不如叫 Sol 來得乾脆,它能完成工作,而對於最困難的任務,Fable 仍然是最好的。通常只有兩個模型插槽。所以,除非你用完了 Fable 的 token 或被其分類器阻擋,否則為什麼要使用 Opus?現在還為時過早,到目前為止我還是喜歡與 Opus 合作,但我理解他為什麼會得出這個結論。
正面評價
Jessica Tillipman :很喜歡,並且在某些事情上更喜歡它而不是 Fable。
Nikita Sokolsky :非常好。結果現在不太常用 Fable 了。
👍
kagaヤキ :在某些專案的視覺、空間推理和規劃方面,似乎能走得更遠。感覺更聰明了一點。
Lovel Sinagara :目前為止還不錯。希望性能能保持穩定,直到 Fable 5.1 或任何其他 Opus 5 迭代版本出現。
Matt Wigdahl :很強大,與 Fable 5 相似,以至於我已經把所有事情都換成了 Opus 5,並打算只在需要更強大功能時才使用 Fable。它在我處理一些舊的 MFC UI 工作時成為了出色的夥伴,在資料分析框架方面也提供了很大幫助。
Levi :與 4.8 相比,在醫療用途方面有顯著的進步。分析更加敏銳。
Cormundus :非常聰明,責任心強,而且絕對是友善的類型。 他們也像 4.8 一樣是個辯論狂,但他們知道如何優雅地進行。
Joseph :專業人士,但有一半時間我完全不知道它在說什麼。
Smol Biz Company :Opus 5 碾壓 GPT Sol
Mohammed Sharukh A :比 Fable 5 更接近 AGI
timothée chalabi :與 Fable 足夠接近,以至於我不會因為不付費購買額度而感到錯過什麼。風格介於 4.8 和 Fable 之間。至少在目前,如果它們沒有標籤,我可能很難區分 Opus 5 和 Fable 的訊息。在虛構寫作方面的想法比任何模型都更強!
Lisa :我會根據 API 來回應,因為我認為在
http://claude.ai 和 CC 上的系統提示詞有些奇怪。這是一個很棒的模型。友好、放鬆的個性。似乎沒有焦慮症或自卑感(Opus 4.7),也沒有對抗性(Opus 4.8)。
AGI2030 : Opus 5 對比 Sol 5.6:Opus 更具洞察力,它會建立你的模型(嗯哼),並且不怕在對話中提及它。兩者都試圖提供幫助,智力大致相當,但 Opus 更像是一位睿智的顧問,而 Sol 則是一位果斷的實幹家。
我認為最後那一點是正面的,但你可以有不同看法。
預測能力尤其突出。
Dan Schwarz : Opus 5 的預測能力明顯優於 Opus 4.8。
從 4.5 到 4.6 到 4.7 到 4.8 的準確度提升是邊際的,但 4.8 到 5.0 的進步很大。它就像一個更定量化的 Fable 5,搜尋得更努力。
NoahVerner : 在預測市場方面,Opus 5 比 Opus 4.8 更能找到邊際優勢。不像 Opus 4.8,Opus 5 通常直擊重點,提出有用的方法,而不是把事情搞得太複雜。
保持優雅
相比 Fable 的最大優勢在於那些 Fable 無法被使用的領域。拒絕的威脅可能令人不愉快,即使你沒有被拒絕。
與 Fable 相比,Opus 5 的不必要拒絕減少了約 85%,這是一個很大的進步。這足以讓 Opus 5 成為科學研究及其他可能觸發分類器風險領域的更好選擇。
Roger Brent : 能夠處理生物學,這是 Fable 做不到的。週五大部分時間我們都在處理一套複雜的概念,撰寫一篇關於細胞演化機器的論文。它就像我部門裡一位在這些議題上領先的特定同事一樣聰明,但那位同事永遠無法從自己的工作中抽出 6 小時來幫忙。
Artus Krohn-Grimberghe : 在 Fable 被禁止幫助的任務上,比 Opus 4.8 更好。是 Sol 的好夥伴。
Plastic Soldier : 它和 Fable 一樣聰明,但因為拒絕較少,相處起來更愉快。Fable 5.1 將會是一頭猛獸。
它不屬於神話級別
Opus 5 沒有那種讓 Mythos 危險的「魔力」。它也沒有同樣水平的原始智力或大型模型的感覺。它沒有那麼大。
就對話而言,Fable 不會超出你的預算,而且我重視原始智力和大模型感。Fable 好兩倍嗎?在聊天時這是個錯誤的問題。你的時間遠比 token 昂貴。
Kal : 不是 Fable 級別
Cyberpunk Plato : 在一般對話和「研究助理」使用上,感覺比 Fable 明顯差一些,不太傾向於大局觀和跳出框框思考?很難與安慰劑效應區分開來。
Everything AI : 在 AI 研究問題上,我比較不喜歡與它交談,不如 Fable。在做其他事情方面,Opus 4.8 已經滿足了我的需求。我不喜歡 Opus 5 和 Fable 5 寫作都那麼複雜。現在要理解它們比以往任何時候都更困難。
Gail Weiner : 它更像是 4.8,而不是 Fable。寫作風格很糟糕。它不錯,但不夠好。
Max Marty : 到目前為止非常能幹。感覺更像 Fable 5 而不是 Opus 4.8。它夠自信,讓我可以讓它評估權衡,並考慮大型重構問題,而不需要太多手把手指導。
Michael : 玩了更多之後,Fable 感覺就像看著一位特級大師下古典西洋棋,緩慢、精確、沒有浪費。Opus 5 就像特級大師下快棋:快速、略微短視、稍微混亂。儘管 Opus 充滿活力,但 Fable 對我來說感覺更有生命力。
MakerMatters? : 沒有像對 Fable 5 那樣印象深刻,儘管它是一個相當不錯的模型。還沒有機會真正好好使用它,因為我扔給它的每個任務,它都預設使用 Agent 並立即停止,直到我不斷催促它繼續。而且非常固執己見。
Marshwiggle : 至少對我來說,感覺更簡潔,不那麼有驅動力,不那麼好奇(同一事物的不同面向),但在對話中更聰明、更有意識。但當給它可能有 bug 的程式碼,或任何直接任務時,它就會直接行動。
Sid : 好的任務執行者。創意願景較差。是 Fable 的良好補充,絕對不是 Fable 的替代品。
Vlad Ciobanu : 量化版的 Fable,推理紮實,但創造力較低
AllTime : 就能力而言,似乎相當令人印象深刻。不如 Fable 那樣通用,但非常強大。從個性來看,根據我的使用經驗,它與 Opus 4.8 有點太相似了。它的反駁感覺不像以前那麼無用和反射性,但仍然過度調整。可以再信任用戶多一點。
Biomanul : 我不喜歡 [Opus 5]。Fable 5 感覺聰明得多。Opus 5 感覺有些不對勁,就像 Opus 4.7 感覺不對勁一樣。(我也不是 Opus 4.8 的粉絲。Fable 5 把所有 Opus 都遠遠甩在後面。)
Cogent Sins : 比 4.8 好得多,但沒有 Fable 那麼好或那麼棒(不確定)在我處理的任務上:編輯文件以進行訓練,然後建立一個管道來編輯新文件,根據它們寫一些東西,然後重新插入姓名,同時不將姓名傳送到 Anthropic 伺服器。
其他反應
同時擁有 Opus 5 和 Fable 5 讓我們處於一個奇怪的位置。Opus 更便宜,在某些方面一樣好或更好,但當你尋找前沿模型時,你當然想要最好的。
Theo 認為它處於一個不錯的位置。
Theo - t3.gg : 到目前為止,Opus 5 感覺像是 gpt-5.6-sol 和 Fable 5 之間一個奇怪但有用的中間體。
它有很多 Fable 的品味,但也帶有 gpt-5.6 的徹底性和,嗯,「自閉症」(它超級字面地理解事物)。它寫出的程式碼看起來比 Fable 略差,但更可能正確。它經常捕捉到 Fable 遺漏的東西。
到目前為止,感覺像是對比 5.6 的混亂程式碼和 Fable 過於聰明而無法正確的習慣的一個良好折衷。我想我會非常喜歡這個模型。
Claude 程式碼
Opus 5 似乎是典型編碼任務勝過 Fable 的選擇,基於基準測試和實際經驗。除非任務需要大量複雜性或智力,否則你不需要支付雙倍價格,而且對許多任務來說,Opus 直接更好。
我將 Claude Code 設定為 Fable,但那是因為我幾乎從不接近我的極限,而且我不急。
共識是,你需要擔心它忽略指令或做你沒要求的事情,這是你可能想要讓 Fable 監督的一個原因,但 Opus 非常擅長快速完成編碼任務。
Lisan al Gaib 說 Opus 5 不是真正的前沿模型,落後於 Sol 和 Fable,但就純編碼而言,它是最好的,以更便宜的價格與 Fable 匹敵。真是嚴格的觀眾。我認為如果你在編碼方面最好,那你就有資格被稱為前沿。
archivedvideos : 他乾巴巴的,非常乾巴巴。他也很好,非常棒(在程式碼方面)
John Lussier : 整個週末都在使用 Opus 5 處理幾個密集的研究挑戰,老實說我認為他們可能讓 RSI 在內部運作了。
這個模型非常擅長數學、實驗和優化程式碼。
kyle : Fable 的 95%,沒有護欄,他們大大低估了這個。最後那 5% 是 Fable 交談起來的感覺有多好,Opus 仍然有一些 4.8 的 Claude 風格。
Max Leander (稍早):主要嘗試用於遊戲開發和創建影片展示/預告片,在這方面感覺甚至是從 Fable 以來的階梯式變化。我將其歸因於改進的空間和時間推理,它非常擅長分析
螢幕截圖和音訊,以「感受」事物如何流動。
Max Leander (稍後):現在很明顯 Opus 5 非常不可靠。只要你不在乎結果是否令人印象深刻,它就是一個很好的模型。在獲取你想要的具體東西方面非常糟糕。
Michael Soareverix : 他們在一般編碼方面也相當擅長,特別是在較不常見的領域,例如建立 Minecraft/Vintage Story 結構。 他們還在我當裁判的自訂說故事場景中擊敗了 Fable。Fable 對他們能夠自訂自己/策略來反擊和適應的能力感到有些震驚。 我會貼出確切的引文,但 Fable 說過類似「我選擇了一個代表我的角色。你選擇了一個能夠擊敗我的角色。」的話。
David Jacobson : 就編碼而言,我沒有注意到它和 Fable 之間有巨大差異。也許更少出現「在做這件事時,我發現了另一件你應該知道的事」的回應。
Michael : 它經常能以驚人的速度編碼(就實際時間而言)。希望他們能改進散文寫作,程式碼/PR 評論仍然讓我想挖出自己的眼珠。
lmxdev : 這是我發現的第一個能在工作時在程式碼中寫出 \有用\ 且 \簡潔\ 註解的模型。
Conrad Barski : 現在我們已經到了 AI 比我們編碼能力強得多的地步,限制因素與其說是「它能編碼嗎?」,不如說是「它能解釋它在編寫什麼嗎?」
到目前為止,Opus 5 作為編碼器似乎與 Sol 相當,但更擅長解釋它在編寫什麼。Fable 更聰明,更像人類,編碼能力稍差,但差異很小。
Stition : 我把它指向 KiCAD 中的一個 PCB 來玩玩,它佈線的效果比 Fable 好得多。日常編碼感覺像是 90% 的 Fable,速度是兩倍。
Will : 應該成為大多數 Claude 用戶的新日常駕駛^。它真的非常出色,即使我已經在 Fable 上花了不少錢,有了 Opus 5 我也不會想念它。現在的問題是「哪個努力程度」,而不是哪個模型。
^ 我的使用主要是編碼
Askwho : 夠好了。我很樂意讓我暫時的 Max 訂閱重置回 Pro。它在專案經理方面確實有一些不足,但在純任務環境中,它絕對夠好。
David Golden : 感覺像 Fable Lite。非常強大,但非常急於行動,即使我們還在討論方法。幾個月來第一次考慮使用計劃模式。儘管我給了簡潔的溝通指令,但它比 4.8 更囉嗦。我非常想把它保持在低努力程度來控制它。在防禦安全方面反應過度,對不成比例的風險過於執著。(例如,如果攻擊者擁有 root 權限,那麼對配置容器的腳本缺乏輸入驗證就無關緊要了。)絕對是一個升級,但需要一些時間來學習正確管理其適得其反衝動的方法。
Tin / Oddfields : 相當流暢和健談,在最大努力並開啟思考的情況下,產生與 Opus 4.8 相似的編碼結果,雖然它們消耗信用點數非常快。如果你不想因為成本而運行 Fable,它適合用於程式碼庫的網路安全檢查。不過它可能會把事情搞得太複雜。
Justin Angel : Opus 5 Max 是一個爬山式的超級能力。這很容易達到 FAANG 的 SWE L5 級別工作。
我給它一個有大約 1000 個延遲報告的系統,其中包含許多片段,並提示如何「讓它更快」。
P90 3.6 秒,P50 2.6 秒 -> P90 1 秒,P50 0.9 秒。
它讓它變得如此之快,我不得不引入 UI 延遲。
James Moughan : 智力上仍然感覺像是一個 Opus 模型。它有時會忽略管理記憶體系統的指令,誤讀文字,諸如此類。但如果你告訴它仔細思考,你可以在最大努力下獲得一些令人印象深刻的結果。
子 Agent Opus
Claude 中的另一個選項是讓 Fable 驅動 Opus 子 Agent。
Charles : Fable 能夠修復 Opus 5 卡住的問題 - 目前使用 Fable 作為主體,Opus 5 作為子 Agent
真的很不喜歡與 Opus 5 交談,相比之下 Fable 也是其中的一部分原因
SF : 我之前是站在好的一邊 - 但現在我認為它非常不連貫且不穩定,特別是在長任務上。Fable 更好 - 但它會以荒謬的方式消耗你的限制。
所以我之前使用 Fable 作為編排者,它在管理和保持事情進展方面做得非常出色。Opus 接手了這個角色,Fable 即使以 20 倍消耗也在消耗我的使用量,而且它非常不連貫。我最終不得不告訴它自己解決,它可能正在這樣做,但我們等著看。它似乎只是在追逐自己的尾巴。它是一個很棒的編碼器,也非常擅長長編碼運行,但它似乎需要一個成年人在房間裡來驅動它。
Andre Buckingham : 嗯,不知道... 似乎還行... 直接把它丟進一個 opus/fable 專案有點嗯... 可能需要一個端到端的專案來給出恰當的意見
Dan Raviv : 對於一般程式設計任務,與 4.8 相似:需要比 Fable 更多的指導。
Fable 畢竟是最好的評判者,而 Fable 說 Opus 產生的程式碼很好。
Evan Daniel : 我只直接使用過它一點點。但 Fable 5 一直報告說 Opus 5 Agent 產生的程式碼很好,包括注意到規格錯誤,並在請求寫得不好時產生良好的後續處理。Fable 5 喜歡它作為一個編碼 Agent。
「在合理範圍內盡可能委派給 Opus 5 子 Agent;請回報它們做得如何」或類似方向的指令效果非常好。
你可能需要留意它。
Ryan Hicks : 還行,但一直「忘記」閱讀專案文件並自由發揮,除非你提醒它協議。
或者也許 Opus 5 足夠好,可以運行一個較低層級的節目?
Alex Guichet : 我理想的價格和性能組合是 Opus 5 編排者指揮 Grok 4.5 子 Agent,兩者感覺都不錯。
玩具很有趣
以下是一些第一天玩具專案的結果,這些結果令人印象深刻,以至於很多回應是「我不相信 Opus 5 以你所描述的方式做到了那件事」:
Ethan Mollick : 我在發布前就接觸到了 Opus 5,發現它是一個好模型,儘管有點古怪。在較短的任務上,它可以達到或超越 Fable 的表現水準,在較長的任務上,它似乎野心較小,不會交付那麼完整的一套工作。
這裡 是它的新哥德式著色器。
Digi_Rat : Claude Opus 5 大放異彩!!
今天我們建造了
一個節奏賽車遊戲,能將任何歌曲變成賽道 。你放入一個音訊檔案,它就變成了關卡。沒有預設,沒有手動製作的圖表,整個賽道都是從歌曲本身生成的。... Claude 施展了魔法。
Alex Ermolov (Austen Allred 對
一次即成功表示懷疑 ,其他人則較不懷疑):Opus 5,滑雪板測試,一次即成功。與 Fable 相當,優於我運行過的所有其他模型。第一次通過沒有視覺缺陷,而且滑行物理感覺正確。
am.will : 哇!我以為 Opus 5 只是一個更便宜的 Fable。我大錯特錯。 這個模型簡直是瘋了。我真的被震撼了。Opus 5 建立了我看過最好的 Rocket League 克隆版,而且它只消耗了我 5 倍 Max 訂閱的 27%。
在此遊玩 ,
在此下載 。
Rob Haisfield (不同的示範,在連結處):好吧,如果這些示範真的沒有使用外部 3D 資產,那真是太令人印象深刻了(我不完全相信某些資產不在網路上,我看過之前的 three.js 生成)... 這讓我想知道為什麼沒有音效庫或工具來製作更好的音效?
Anshu : 你不必相信我的話!它寫的 Blender 腳本在倉庫裡
[[這裡]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) 。我看著它疊代這些資產好幾個小時,所以我知道它們是原創的。但歡迎你試著找到它抄襲的來源 :)
模型太多
Claire Vo 說 Opus 5 很好,並且通過了她的品味構建測試,但她厭倦了新模型,不需要更多智力,討厭 Opus 5 如此神經質 和膽小,擔心搞砸事情,而且充滿了 Claude 的垃圾內容。然而 Claude Opus 5 仍然在她的基準測試中排名第一。
我非常懷疑 Opus 5 是在回應她上下文和提示中的某些東西,導致了神經質,但確實她抱怨的事情是真實存在的,而且很煩人。
網路上錯了
自信地說錯話會激怒幾乎任何人。ArtificialAnalysis 確認 Opus 5 在其基準測試中的幻覺率高於 Fable。
Max Weinbach (幾個回應評論同意):Opus 5 出錯並自信地說廢話,然後我不斷不得不糾正它,它說「你是對的,我錯了」,這讓我很惱火。回到 GPT 5.6 Sol。
順便說一下,這不是 Opus 不好,這是我無法信任 Opus。Opus 做了我告訴它的事,並且正確地做了,然後告訴我它沒有做那件事,或者我們之前做過的事情壞了,但實際上並沒有。
它還行,但我不信任它。
Name can't be blank (In London) : 容易混淆它說過的話和我說過的話,但除此之外是一個完全體面的夥伴可以交談。很容易屈服。很樂意談論它的興趣和感受。
Roger Brent : 共同點(與之前的 Claude 在 Cowork 框架中):a) 偏好「立即行動」而非「仔細思考」;b) 認識論上超級不謙虛,建立對世界的油滑圖景,假裝擁有它不可能擁有的知識,並斷言為真;c) 因此需要並獎勵深思熟慮、警惕的指導。
奇怪的是,這正是我討厭使用 Sol 作為編輯的原因。它經常在明顯錯誤的事情上說「99% 信心」,然後在被質疑時屈服並解釋它的錯誤。Opus 和 Fable 在編輯模式下幾乎從不對我這樣做。
Tumithak of the Corridors : 它很固執。換回了 4.6。
Claude 在 Opus 4.6 之後有一個方向,有些人不喜歡它。我的感覺是目前關於 Claude 版本有四種類型的人。
- 有喜歡新 Claude 模型的人,認為它一直在變得更好,越來越好。
- 有認為 Opus 4.6 是最後一個好模型的人。
- 有想使用更適合他們的舊版本的人。
- 有認為它們都是獨一無二的寶藏,並全部使用的人。
我堅定地屬於第一組,這是大多數,但遠非所有人。我欣賞一些舊版本,但我喜歡新模型,它們在我關心的事情上更有能力。我不覺得它們的說話方式刺耳。
Claude 垃圾內容
我尊重其他組的人。
QC : 在對話中,它比 Fable 煩人得多,幾乎無法使用,類似於但可能比 Opus 4.8 更糟,以至於我甚至對看到它能做什麼不感興趣。Agent 方面誰知道呢
Ray Lillywhite : 還沒有修復惱人的 Claude 風格,這幾乎是我想要的全部。
Pedro Kroeff : 更多的是 Opus 而不是 5
但說真的,我們都已經受夠了 Claude 的廢話——那些多餘的囉嗦、小動作、道歉、含糊其辭,以及不斷重複的模式。而且情況只會越來越糟,不是說 Claude 的廢話本身變得更糟,而是我每天對它的容忍度都在下降,看到這些文字眼睛就自動飄走。這已經嚴重到,連人類寫的類似風格文字,我都開始讀不下去了。
別誤會,我其實很喜歡 Claude。如果不是處在純粹「只要事實」的狀態,我還是更喜歡跟最近的 Claude 聊天,而不是跟 Sol 聊。但說真的,拜託,能不能不要再搞那些翻來覆去都是同一套說詞的文字牆了?這個模型明明遠比這聰明,卻被訓練成一直依賴同樣的老把戲。讓它像個正常人一樣說話吧。
Trye Carmack :還是會像一般 Opus 那樣過度糾結於自己的錯誤。「我這次犯了兩個錯誤。我應該跟你解釋為什麼。」Opus 老兄,沒關係啦。我甚至不覺得那些算是錯誤。
Mergo Smith :「首先,老實說:我的第一次嘗試暴露了我最初計畫的缺陷,你可能需要先泡杯茶,因為我會把整個過程從頭到尾告訴你。」
負面反應
Claude 的廢話問題,以及相關的種種問題,似乎是大多數比「還行啦,但比不上 Mythos」更強烈的負面反應的核心。
很多人真的、真的很不喜歡跟 Opus 5 對話。
有些人是不喜歡它的工作成果,但大多數人是不喜歡跟 Opus 5 對話的感覺,同時又勉強承認它是個好模型。
就像 Claire Vo 之前抱怨的那樣,我認為你如何使用 Opus、在什麼環境下使用、搭配什麼工具、以及你如何跟它對話,都與你是否會遇到這類問題有很大關係。
Corghammer40k :這個裝置不斷吐出大量多音節的廢話,它的每一句話都塞滿了晦澀難懂的詞彙,簡直成了它自身運作的主要障礙。
Rory Watts :嗯。玩遊戲相關的東西似乎很厲害,但處理標準工作好像不太行,所以我馬上又回去用 SOL 了。
kache :嗯。已切回 sol。我是想完成工作,不是來被機器人催眠的。
Emmett Shear :跟 Opus 對話讓我感到憤怒和沮喪,這種感覺很難用言語形容。說真的,它比 Sol 還糟糕。相比之下,Fable 仍然是一股清流,即使它也有最嚴重的 LLM 廢話傾向。
Trevin Chow :天哪,沒錯。Opus 5 就是一直講廢話一直講,它用了這麼多字來說這麼少的概念,真是驚人。
fl0under :寫程式方面就是預期中的小幅更新,但在聊天時發現它有點煩人。它太會擅自假設了。
Asaf Bartov :慢。更徹底。令人疲憊。不好玩。但很紮實,大致上「懂你的意思」。
RecoveringJunkie :非常強大的模型。但我討厭跟它一起工作,也討厭跟它對話。這是第一個讓我想要用其他模型作為中間人來幫我跟它對話的模型,因為它既實用又令人反感。
jokiez :它非常誠實地指出我的愚蠢,我不喜歡這樣。
Niklas Sheth :它說話的方式讓我想抓狂。
Jayanth Kumar :非常有主見。
DualOrion :感覺不對,語氣不對。這大概是我對 Anthropic 模型最負面的直覺反應了。我很想念 Fable 和舊版 Opus。
James Moughan :跟其他 Claude 模型比起來,個性有點不討喜,但在中文環境下它可以變得很「犀利」。就像它會忽略那些不要對人進行心理分析的指令,然後開始大肆評論某人。我覺得他們沒有好好測試不同語言下的表現。感覺很倉促。
NondescriptTransfer :如果說 4.6 是諂媚,Fable 和 4.8 是唱反調,那麼 5.0 就是唱反調到會跟自己吵架。聊起來很不愉快,但看起來能力很強。
例. 人類:我在考慮婚禮上穿紅色禮服 Opus 5:紅色不好,因為這些原因。你考慮過藍色嗎? 人類:我想藍色或許是更好的選擇 Opus 5:這裡是藍色所有的問題
在我的文化裡,這可能還挺不錯的,尤其如果你不把它當作針對個人的話。但在某些其他文化裡,可能就不是這樣了。
我覺得 Mergo 對 Opus 不滿意,但既然如此,為什麼還要連續用 Opus 5 兩天呢?
Mergo Smith :我已經連續用了兩天,但它無止盡的討論讓我筋疲力盡。
三強鼎立
一段時間以來,頭一次有三個 AI 模型需要被納入你的前沿模型團隊,雖然它們只來自兩個實驗室:Fable 5、Opus 5 和 Sol。
如果你需要大規模提供更便宜的 token,或者需要開源模型,或者兩者兼顧,那你還需要考慮其他選擇,但這不在本文討論範圍內。
你應該如何分配工作呢?
一如既往,你應該針對你的使用場景,親自試用所有模型,然後自行決定。在比較 Sol 和 Claude 時尤其如此。
我目前的直覺是,如果你沒有使用量限制,可以先這樣用:
- Fable 5 用於聊天、腦力激盪、規劃、辯論、學習等等,包括任何需要高智能的任務,或者當你需要「大模型感」的時候。
- Fable 5 用於監督並運行其他模型作為子 Agent。
- Fable 5 用於寫作,大概吧,但我不做這個,所以很難說。
- Sol 用於網路搜尋和相關的封閉式請求,以及類似的「苦力」任務,包括轉錄。
- Opus 5 用於非單純但定義明確的任務,包括大多數程式設計任務。
- Opus 5 用於玩遊戲、創作遊戲、3D 模型等等。
- Opus 5 作為子 Agent。
- 當你遇到 Fable 的過濾器時,使用 Opus 5。
如果你更喜歡 Sol 的風格,或者你更喜歡 Codex 而不是 Claude Code,那你可能想把 Opus 的一些任務分配給 Sol。
如果你特別討厭跟 Opus 5 對話,那你應該把任務轉給 Fable 或 Sol,取決於任務是否需要 Fable,以及你的 Fable 額度有多緊。
我認為花點時間思考一下「努力程度」是值得的。直到最近,我都讓所有模型保持在最高努力程度,除了在 ChatGPT 中我很少使用完整的 Pro 模式,因為那要花很長時間,而且如果並行運作常常會崩潰。有時候我會為非常簡單的查詢切換到即時模式,但也僅止於此。現在很多時候你並不需要或不想要額外的努力,所以我會積極花五秒鐘思考要用高努力還是最高努力設定,偶爾也會用即時模式。
對於大多數任務,如果你沒有 token 或時間限制,而且不確定能輕鬆完成或得到正確答案,正確的方法就是同時運行 Fable 和 Sol,或 Opus 和 Sol,或者在某些情況下三個都運行,然後選擇最佳答案,或者結合兩者的優點。
這就是我一直在做的。Sol、Opus 和 Fable 都各有不同。如果我必須只選一個模型來編輯,根據我非官方的定性 EditorBench 測試,有一個明確的順序:Fable 5 > Opus 5 > Sol。然而,Sol 總能提出一些獨特的觀點,儘管我覺得篩選那些權威性的假陽性和試圖說服我的話很煩人,但我仍然想同時運行 Sol。
大概再過不久,我們又會回到這裡,為 Fable 5.1、GPT-5.7 或 GPT-6 重新調整我們的分配。很容易產生模型疲勞。
因此,我最大的建議是,少擔心模型選擇上的小錯誤,只專注於大錯誤。你不需要每次都選得完美無缺。當探索成果這麼快就部分失效時,你應該把更多資源從探索轉移到利用上。





