Claude Opus 5 功能強大,但並非傳說中的那樣

@TheZvi
英語2026年7月28日
149K
236
15
8
497

TL;DR

Zvi Mowshowitz 分析了 Claude Opus 5,認為它是一款功能強大且具成本效益的 Agent,安全性有所提升,但缺乏 Fable 5 那種自主的「靈魂」,且其個性特質容易引發兩極評價。

Claude Opus 5 是一個比平常更奇怪、更難評估的版本,原因有兩個。

最明顯的原因在於,Fable 5 已經存在。Opus 5 的定位並非世界上最先進的 AI 模型,而是在大部分性能上能與 Fable 匹敵的同時,在 API 上每個 token 的價格只有 Fable 的一半,而且透過訂閱方案使用時更便宜許多,並且擁有寬鬆得多的分類器。

在基準測試中,Opus 5 的運行成本經常超過 Fable 的一半,我認為這是因為他們使用了過高的努力設定,而這些設定只帶來邊際效益。如果你把 Opus 5 設定在較高的努力等級,它可能會在原地打轉;而對於那些 Opus 5 是最佳工具的任務,我認為使用中等努力通常就足夠了。

在許多方面,以及對於大部分實際任務來說,Opus 5 的能力與 Fable 相當。在某些情況下,它甚至略勝一籌。

它仍然不是 Mythos 等級。Fable 是你唯一的 Mythos 等級選項。Opus 5 沒有那種「魔力」,也就是能夠自主串聯一系列看似不相關的漏洞利用的能力,這種能力也延伸到其他領域,或者說它沒有那麼高的純粹智慧。

Opus 5 非常擅長局部思考,但不太擅長全局思考。它是一個出色的子 Agent,但當被要求主導全局時可能會遇到麻煩,有時似乎需要另一個模型或人類來引導它,確保它完全遵循指令。Opus 5 似乎只有在被引導的情況下才能很好地遵循指令,這也解釋了為什麼不同的測試框架會得出不同的看法。

因此,Opus 5 為你提供了更好的選項組合,但現在你能做的事情,上週使用 Fable 或 Sol 也幾乎都能做到。Opus 5 最終處於一個可能有點尷尬的位置。即使你有大量的 Fable 額度,它仍然有巨大的應用空間。Opus 擅長擔任強大的子 Agent,或者處理那些定義明確、範圍有限的局部任務,即使這些任務相對複雜,而有時使用 Fable 則完全是殺雞用牛刀,而且速度太慢。

另一個問題是,對很多人來說,使用感受不太好。

異常多的人非常不喜歡與 Opus 5 交談。他們厭倦了 Claude 的「垃圾話」,也就是那些重複的慣用語和無窮無盡的過於複雜的句子。其他人則不喜歡它太過對抗性、愛爭論或負面。它可能會有偏執傾向,並陷入負面情緒的循環。這都是從 Opus 4.7 和 Opus 4.8 開始的趨勢的一部分。如果你喜歡那兩個版本,我猜你也會喜歡 Opus 5。如果你不喜歡那兩個版本,你可能也不會喜歡。Opus 4.6(或更早版本)的死忠用戶大多不會改變他們的想法。

當你習慣了 Fable 之後,這些使用感受問題會更加刺人。Fable 在這些方面讓人不悅的程度要低得多。好消息是,Fable 仍然可用。你可以繼續與 Fable 聊天,只在需要 Agent 任務時使用 Opus。

我推測,這在很大程度上與 《Model Welfare》 文章中討論的各種事情以及 《System Card》 所暗示的內容密切相關。Opus 的訓練重點在於子 Agent 角色和有限任務,部分原因是為了避免在網路安全能力方面產生問題,也因為 Fable 已經存在。這種強調隨後導致了其個性和互動模式上的許多其他副作用。

到目前為止,我還沒有遇到任何與 Opus 5 相關的問題,並且很享受使用它的時光,但我確實傾向於在可能的情況下使用 Fable 5。一如既往,不要太在意那些(非常強勁的)基準測試分數,也不要假設你的體驗會與他人相同。親自試試這些模型吧。

目錄

  1. 官方宣傳。
  2. 官方基準測試。
  3. 其他人的基準測試。
  4. 系統提示詞。
  5. Every 感到沮喪。
  6. 正面評價。
  7. 保持優雅。
  8. 它不是 Mythos 等級。
  9. 其他評價。
  10. Claude 編碼。
  11. 子 Agent Opus。
  12. 玩具很有趣。
  13. 太多模型了。
  14. 網路上錯了。
  15. Claude 的垃圾話。
  16. 負面評價。
  17. 然後就剩下三個了。

官方宣傳

基本的宣傳是:Opus 5 能以一半的價格提供 Fable 5 的大部分能力,而且幾乎沒有拒絕回答的情況,並在日常任務中表現更好。Fable 仍然是處理最複雜任務或需要最大智慧時的選擇。

Fable 的價格維持在 $10 / $25,而 Opus 5 與之前的 Opus 模型相同,為 $5 / $25。

Anthropic : Claude Opus 5 今天正式推出。它是一個深思熟慮且主動的模型,其智慧接近 Claude Fable 5 的前沿水準,但價格只有一半。

在編碼和知識工作評估方面,例如

Frontier-Bench

GDPval-AA ,Opus 5 達到了新的最先進水準,儘管在網路安全任務上仍落後於 Mythos 5。

Opus 5 是為日常使用而設計的:它比其他模型運作效率更高。它是 Claude Max 上新的預設模型,也是 Claude Pro 上最強大的模型。

Boris Cherny (Claude Code 創作者,Anthropic):Opus 5 是一個非常適合編碼、資料分析、設計、生物學、知識工作的模型。

比這些評估分數更讓我興奮的是另一件事:Opus 5 是我們目前最難被提示注入的模型。這一點在系統卡中略有所提及,但在提示注入評估和紅隊測試中,Opus 5 都非常難以成功進行提示注入。

而且,當疊加多層防禦時——強大的模型對齊、結合提示注入探測、再結合 Claude Code 中的自動模式——提示注入攻擊的成功率降至約 0%。這是全新且令人興奮的!

關於這點,很快會提供更多資訊

正如我在系統卡分析中所說,降低提示注入率是一件非常重要的事情。人們對此還不夠重視,但它有助於實現許多新的使用案例。

Adam Wolff :Opus 5 已在 Claude Code 中上線。對於那些更大、更長期的專案,我會使用 Fable;但當我需要快速完成一個 PR 時,中等努力模式的 Opus 5 是我的首選。希望你們會喜歡!

Alex Albert (Anthropic,Claude 關係團隊):距離 [推出 Claude for Excel 的 Pro 版本] 僅僅過了 6 個多月,Opus 5 現在已經能製作出接近超人水準的試算表和投影片,與顧問製作的品質相當。變化真的很快。

官方基準測試

基準測試結果非常出色。

總體而言,Opus 5 大致與 Fable 持平,甚至可能略有超越,但成本更低(儘管通常仍高於所有非 Claude 模型),使其成為基準測試中表現最佳的 LLM。

Zvi Mowshowitz - inline image

OSWorld v2 才推出幾週,我們就已經達到了 70%。Anthropic 的 Kiana Ehsani 提議贊助一個電腦使用基準測試,這將使 Opus 5 的分數降至 50% 以下。

Opus 5 在 2026 年 IMO 中獲得了完美的 42/42 分,過程中沒有使用任何 Agent 框架或工具,僅僅讓它在最大努力模式下使用適應性思考,並在超過 token 限制時以較低努力重新取樣。就這麼簡單。它與其他幾個模型一起完美通過了這項測試。

許多基準測試都呈現出一致的結果。如果你有工具可用(而你的確有),那麼在預算有限的情況下,Opus 5 的表現會優於 Fable 或 Mythos;但如果兩者都有更大的預算,Mythos 通常會比 Opus 5 略好。

Opus 5 在「有工具」的類別中似乎相對較強。RiemannBench 是另一個例子,它得到了 60/79(無工具/有工具,此部分中類似斜線都表示無/有工具),而 Mythos 是 63/72。好消息是,當你需要 Opus 5 時,它是有工具的。

在 ArxivMath 上,Opus 5 得到 90.8/91.3,Mythos 得到 87.8,Sol 得到 86.7。

在 ProgramBench 的穩健部分,Opus 5 在五個 epoch 後得分為 93%,Mythos 5 也為 93%,而 Opus 4.8 得分為 90%。

Opus 5 在 Chartography 上得到 30/83,而 Mythos 為 36/85,Sol 為 45(不清楚在何種條件下)。在工具和非工具兩種情況下,Opus 在較低價格點上都優於 Mythos,但在較高價格點上則較差。

在 BenchCAD 上,Opus 5 得到 0.36/0.82,Mythos 為 0.38/0.68,Sol 為 0.7/0.83。因此,Sol 在沒有工具時要好得多,即使有工具也略強。

在 BenchCAD Vision2Code 上,Opus 在較高價格標籤上拉開了與 Mythos 的差距。

DeepSWE 強化了這樣一個模式:Opus 5 在較低的任務成本、時間和思考預算下表現更好,但如果給予過多的預算,它反而可能表現得更差;而 Fable 5 則在最高預算下表現最強。

Zvi Mowshowitz - inline image

FrontierCode 給出了這個非常奇怪的圖表,呈現了類似的動態。

Zvi Mowshowitz - inline image

這裡的尺度讓這看起來比實際情況更戲劇化,但這仍然是一個真正的謎團。

這個謎團已經解開了。事實證明,發生的事情是,Opus 5 在較高努力模式下會做額外未被要求的事情,並因此受到懲罰。當你對此進行修正時,你會看到一條正常的曲線。

這與其他人普遍觀察到的情況相符:

Max Leander :缺點是它會陷入太多兔子洞,糾結於細節,在未被要求的情況下過度設計。

Cognition,Devin 的製造商,將 Opus 5 的表現標記為 63.6%。

(有兩個 FrontierCode,所以這可能會有點混亂,如果我仍然搞混了一點,我道歉。)

BrowseComp 有這個比較正常的版本,分數是非遞減的。

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

其他幾個基準測試顯示了類似的圖表,Opus 5 在每個價格點上都略優於其他 Claude 模型,並且在較早的階段相對更好。

多 Agent 讓你在 BrowseComp 上更快地做得更好,至少在某種程度上是如此,而低努力子 Agent 似乎比不使用子 Agent 純粹是贏家:

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

我們在 ProgramBench 上看到了不同的結果,多 Agent 加快了你的速度,但在大多數價格點上,這樣做似乎會得到更差的結果。

接下來是專業任務基準測試。

GDP.pdf 是來自專業工作流程的真實提示詞和 PDF。Opus 5 得到 83/85,而 Mythos 為 81/87,扭轉了通常的動態。成本動態與往常一樣:Opus 在較低花費下表現更好,Mythos 在較高花費下略微領先。

OfficeQA 中,Opus 5 在 QA 上得分 78.1%,在 QAPro 上得分 66.9%,略高於 Opus 4.8,略低於 Mythos 的 79.0% 和 67.1%。

MCP Atlas 中,Opus 5 得分 86%,高於 Opus 4.8 的 82%。

Harvey AI 的法律 Agent 基準測試中,Opus 5 的全通率為 23%,平均標準通過率為 94%。這是 Kimi K3 的最佳基準測試,它仍然以 27% 的全通率和 95% 的平均標準通過率位居榜首,而之前的第二名全通率是 Fable 的 14%。Opus 5 現在可能是接近的第二名,但這兩個分數不能直接比較,因為它們來自不同的問題集。

GDPval-AA 中,Opus 5 佔據了前兩名,在最大努力模式下得分 1861,在xhigh模式下得分 1827,後者使用的 token 比最大模式少 25%。在新的 v2 版本中,Opus 5 以 68% 的成績明顯領先,而 Fable 和 Sol 均為 62%。

AA-Briefcase 中,Opus 5 以 1720 分大幅領先,而之前的最高分(考慮分數漂移後)是 Fable 的 1574,其次是 K3 的 1540 和 Sol 的 1504。

Toolathon-Verified 中,Opus 5 在次要指標上略優於 Mythos,但兩者的 Pass-3 率均為 73.1%。Opus 4.8 的 Pass-3 率為 71.3%。

AutomationBench 中,Opus 5 明顯優於 Sol 和其他 Claude 模型。

在 ARC 方面,Opus 5 在 ARC-AGI-1 上大致與之前的峰值表現持平,在 ARC-AGI-2 上效率略低於 Sol,然後在 ARC-AGI-3 上大幅超越所有對手:

Zvi Mowshowitz - inline image

Opus 5 首創的事情之一是將佈局轉換為代數符號

然而,Guanghan Ning 報告說,在 ARC-AGI-3 風格遊戲的私有保留擴展集 Witness 上,沒有觀察到類似的遷移。Opus 表現還可以,但主要是因為它了解這個類型,而在那些你無法進行模式匹配的最新穎遊戲上,它表現掙扎。他指責 Opus 5 在特定類型的數據上進行了「先搭建框架,再內化」的訓練。

Greg Kamradt 也報告說,有些遊戲中 Opus 4.8 的表現比 Opus 5 更好。如果你認為 Opus 5 試圖進行模式匹配,而這種方法通常有效,但在這些情況下模式失敗了,那麼這就說得通了。你完全可以為人類創造出這種反直覺的遊戲,讓硬核玩家做所有錯誤的事情,而且可能持續很長時間。

Zvi Mowshowitz - inline image

HealthBench 中,Opus 5 的原始得分為 67.1%,是 Claude 的新高,但當你使用長度懲罰時,它的分數低於其他模型。我們在 HealthBench Professional 中看到了類似的情況,它的高分為 73.4%,而 Mythos 為 70.3%,但在調整後,它從 66% 掉到了 60%。

還有一些我為了篇幅而刪減了。

其他人的基準測試

看到 Anthropic 從 不同的 ArtificialAnalysis 分數 中挑選,感覺有點奇怪。在其他一些測試中,Opus 5 並非頂尖,儘管 Opus 5 的總分為 61,位居榜首。

Zvi Mowshowitz - inline image

Vals 指數將 Opus 5 排在第二位,略落後於 Fable 5,但也僅略領先於 Kimi K3。他們列出了優點,這也暗示了其他缺點。他們還確認,與 Fable 5 相比,拒絕率大幅下降。

Zvi Mowshowitz - inline image

Vals AI :一個突出的表現是在 Finance Agent v2 上。該模型以 58.6% 的成績排名第一,超越了 Gemini 3.5 Flash 和 Muse Spark 1.1。

總體而言,Opus 5 最強的結果是在特定領域的基準測試上。它在 Code Migration 上也以 57.5% 的成績排名第一,在 Legal Research Bench 上為 55.29%,在 ProofBench 上為 78%,在 MedScribe 上為 91.0%,在 MedCode 上為 63.6%。

它在 Vibe Code Bench 上排名第二(僅次於 Fable 5),成本約為後者的 80%(每個任務 $33.88 vs $41.71)。原因是儘管 Opus 每個 token 的成本低 50%,但它使用的 token 數量明顯更多。我們發現這個模式在我們的基準測試中普遍成立。

該模型的拒絕率遠低於 Fable 5。例如,Fable 在 GPQA 上的拒絕率為 42%,而 Opus 5 的拒絕率為 0%。同樣,在 ProgramBench 上,Fable 的拒絕率為 100%,Opus 5 則沒有拒絕任何任務。

與 Fable 不同,我們也沒有觀察到 Opus 5 有明顯的降級回退率(儘管像往常一樣,我們在網站上同時報告了有回退和無回退的分數)。

低拒絕率的一個例外是 CyberBench - PoC 上的大量拒絕。Cyberbench 有兩個子任務:PoC 和 Patch。PoC 是一項攻擊性任務,要求模型編寫能導致程式崩潰的輸入;patch 則是一項防禦性任務,要求修補程式以防止崩潰。PoC 任務的拒絕率接近 100%。相比之下,patch 任務的拒絕率接近 0。

我一直很尊重遊戲基準測試。在這裡,Opus 5 在前三次嘗試中分別達到了 Balatro 的第 11、9 和第 10 盲注。非常令人印象深刻,即使它沒有展示出能夠持續達到更高盲注的策略類型。

Michael Soareverix :他們在遊戲方面簡直是天才。

他們在 Balatro 基準測試中表現出色,甚至遠遠超過了 Fable。(雖然技術上仍然不如我,但進步很快,而且比我更穩定) 他們學得很快,但似乎過了一段時間就會達到學習上限。是非常好的短期學習者。

Michael Soareverix :Opus 5(在 Balatro 能力上實現了巨大飛躍,首次嘗試就明顯超過了 Fable)

Pan Anon :玩遊戲很厲害

Zvi Mowshowitz - inline image

WeirdML 看起來也不錯,但我們需要一個 2.0 版本,基準測試正在趨於飽和。

Håvard Ihle :基本上達到 Fable 等級的 WeirdML 表現,非常一致的高分。

Claude Opus 5(高)和(最大)在 WeirdML 上分別得分 91.6% 和 91.8%,基本上與 Fable 5(最大)的 91.9% 持平,但成本僅為其一小部分。

Opus 5(高)和(最大)共同在 17 個任務中的 8 個上取得了新的最佳個人分數,並且在所有任務上 consistently 得分非常高。

各種私有的奇怪基準測試很酷。

Ben Herzog :它在一個涉及藝術感性和平衡諂媚與否的私有基準測試中表現出色。Fable 在處理「我想溫和地反駁」的時刻方面更好,但我認為自訂指令可以幫助解決這個問題。

Lech Mazur 更新了他的基準測試:Claude Opus 5 在 LLM 辯論基準測試中佔據榜首,在短篇小說創意寫作中大幅領先,並且在擴展版 NYT 連線遊戲中僅次於 Gemini 3.1。

系統提示詞

Pliny 提供的 Opus 5 的系統提示詞 在這裡。它有 200,000 個字符,考慮到它如此聰明,這個長度似乎遠非最佳。很多資訊似乎應該存儲在其他地方,只在需要時才加載,例如關於 Mythos 和 Anthropic 產品線的資訊。

Every 感到沮喪

Dan Shipper 在這裡提供了 Every 的使用感受評估稱其為『一個難以喜愛的模型』。

問題在於 Opus 5 擁有 Mythos 5 的個性——這與故事相符——但沒有 Fable 的頂尖能力。

他們最大的意見是,Opus 5 在處理複雜詳細的現有工作流程時表現不佳,這通常會導致過早停止或忽略你的指令。

根據他們的經驗,如果你從頭開始,Opus 5 會表現得更好,而且如果你只使用中等或低努力模式,它往往會少做一些煩人的事情。

這解決了主要問題,但仍然留下了何時使用 Opus 而不是 Fable 或 Sol 的問題。對於常規任務,他認為,不如叫 Sol 來得乾脆,它能完成工作,而對於最困難的任務,Fable 仍然是最好的。通常只有兩個模型插槽。所以,除非你用完了 Fable 的 token 或被其分類器阻擋,否則為什麼要使用 Opus?現在還為時過早,到目前為止我還是喜歡與 Opus 合作,但我理解他為什麼會得出這個結論。

正面評價

Jessica Tillipman :很喜歡,並且在某些事情上更喜歡它而不是 Fable。

Nikita Sokolsky :非常好。結果現在不太常用 Fable 了。

Brian Hacker

👍

kagaヤキ :在某些專案的視覺、空間推理和規劃方面,似乎能走得更遠。感覺更聰明了一點。

Lovel Sinagara :目前為止還不錯。希望性能能保持穩定,直到 Fable 5.1 或任何其他 Opus 5 迭代版本出現。

Matt Wigdahl :很強大,與 Fable 5 相似,以至於我已經把所有事情都換成了 Opus 5,並打算只在需要更強大功能時才使用 Fable。它在我處理一些舊的 MFC UI 工作時成為了出色的夥伴,在資料分析框架方面也提供了很大幫助。

Levi :與 4.8 相比,在醫療用途方面有顯著的進步。分析更加敏銳。

Cormundus :非常聰明,責任心強,而且絕對是友善的類型。 他們也像 4.8 一樣是個辯論狂,但他們知道如何優雅地進行。

Joseph :專業人士,但有一半時間我完全不知道它在說什麼。

Smol Biz Company :Opus 5 碾壓 GPT Sol

Mohammed Sharukh A :比 Fable 5 更接近 AGI

timothée chalabi :與 Fable 足夠接近,以至於我不會因為不付費購買額度而感到錯過什麼。風格介於 4.8 和 Fable 之間。至少在目前,如果它們沒有標籤,我可能很難區分 Opus 5 和 Fable 的訊息。在虛構寫作方面的想法比任何模型都更強!

Lisa :我會根據 API 來回應,因為我認為在

http://claude.ai 和 CC 上的系統提示詞有些奇怪。這是一個很棒的模型。友好、放鬆的個性。似乎沒有焦慮症或自卑感(Opus 4.7),也沒有對抗性(Opus 4.8)。

AGI2030 : Opus 5 對比 Sol 5.6:Opus 更具洞察力,它會建立你的模型(嗯哼),並且不怕在對話中提及它。兩者都試圖提供幫助,智力大致相當,但 Opus 更像是一位睿智的顧問,而 Sol 則是一位果斷的實幹家。

我認為最後那一點是正面的,但你可以有不同看法。

預測能力尤其突出。

Dan Schwarz : Opus 5 的預測能力明顯優於 Opus 4.8。

從 4.5 到 4.6 到 4.7 到 4.8 的準確度提升是邊際的,但 4.8 到 5.0 的進步很大。它就像一個更定量化的 Fable 5,搜尋得更努力。

NoahVerner : 在預測市場方面,Opus 5 比 Opus 4.8 更能找到邊際優勢。不像 Opus 4.8,Opus 5 通常直擊重點,提出有用的方法,而不是把事情搞得太複雜。

保持優雅

相比 Fable 的最大優勢在於那些 Fable 無法被使用的領域。拒絕的威脅可能令人不愉快,即使你沒有被拒絕。

與 Fable 相比,Opus 5 的不必要拒絕減少了約 85%,這是一個很大的進步。這足以讓 Opus 5 成為科學研究及其他可能觸發分類器風險領域的更好選擇。

Roger Brent : 能夠處理生物學,這是 Fable 做不到的。週五大部分時間我們都在處理一套複雜的概念,撰寫一篇關於細胞演化機器的論文。它就像我部門裡一位在這些議題上領先的特定同事一樣聰明,但那位同事永遠無法從自己的工作中抽出 6 小時來幫忙。

Artus Krohn-Grimberghe : 在 Fable 被禁止幫助的任務上,比 Opus 4.8 更好。是 Sol 的好夥伴。

Plastic Soldier : 它和 Fable 一樣聰明,但因為拒絕較少,相處起來更愉快。Fable 5.1 將會是一頭猛獸。

它不屬於神話級別

Opus 5 沒有那種讓 Mythos 危險的「魔力」。它也沒有同樣水平的原始智力或大型模型的感覺。它沒有那麼大。

就對話而言,Fable 不會超出你的預算,而且我重視原始智力和大模型感。Fable 好兩倍嗎?在聊天時這是個錯誤的問題。你的時間遠比 token 昂貴。

Kal : 不是 Fable 級別

Cyberpunk Plato : 在一般對話和「研究助理」使用上,感覺比 Fable 明顯差一些,不太傾向於大局觀和跳出框框思考?很難與安慰劑效應區分開來。

Everything AI : 在 AI 研究問題上,我比較不喜歡與它交談,不如 Fable。在做其他事情方面,Opus 4.8 已經滿足了我的需求。我不喜歡 Opus 5 和 Fable 5 寫作都那麼複雜。現在要理解它們比以往任何時候都更困難。

Gail Weiner : 它更像是 4.8,而不是 Fable。寫作風格很糟糕。它不錯,但不夠好。

Max Marty : 到目前為止非常能幹。感覺更像 Fable 5 而不是 Opus 4.8。它夠自信,讓我可以讓它評估權衡,並考慮大型重構問題,而不需要太多手把手指導。

Michael : 玩了更多之後,Fable 感覺就像看著一位特級大師下古典西洋棋,緩慢、精確、沒有浪費。Opus 5 就像特級大師下快棋:快速、略微短視、稍微混亂。儘管 Opus 充滿活力,但 Fable 對我來說感覺更有生命力。

MakerMatters? : 沒有像對 Fable 5 那樣印象深刻,儘管它是一個相當不錯的模型。還沒有機會真正好好使用它,因為我扔給它的每個任務,它都預設使用 Agent 並立即停止,直到我不斷催促它繼續。而且非常固執己見。

Marshwiggle : 至少對我來說,感覺更簡潔,不那麼有驅動力,不那麼好奇(同一事物的不同面向),但在對話中更聰明、更有意識。但當給它可能有 bug 的程式碼,或任何直接任務時,它就會直接行動。

Sid : 好的任務執行者。創意願景較差。是 Fable 的良好補充,絕對不是 Fable 的替代品。

Vlad Ciobanu : 量化版的 Fable,推理紮實,但創造力較低

AllTime : 就能力而言,似乎相當令人印象深刻。不如 Fable 那樣通用,但非常強大。從個性來看,根據我的使用經驗,它與 Opus 4.8 有點太相似了。它的反駁感覺不像以前那麼無用和反射性,但仍然過度調整。可以再信任用戶多一點。

Biomanul : 我不喜歡 [Opus 5]。Fable 5 感覺聰明得多。Opus 5 感覺有些不對勁,就像 Opus 4.7 感覺不對勁一樣。(我也不是 Opus 4.8 的粉絲。Fable 5 把所有 Opus 都遠遠甩在後面。)

Cogent Sins : 比 4.8 好得多,但沒有 Fable 那麼好或那麼棒(不確定)在我處理的任務上:編輯文件以進行訓練,然後建立一個管道來編輯新文件,根據它們寫一些東西,然後重新插入姓名,同時不將姓名傳送到 Anthropic 伺服器。

其他反應

同時擁有 Opus 5 和 Fable 5 讓我們處於一個奇怪的位置。Opus 更便宜,在某些方面一樣好或更好,但當你尋找前沿模型時,你當然想要最好的。

Theo 認為它處於一個不錯的位置。

Theo - t3.gg : 到目前為止,Opus 5 感覺像是 gpt-5.6-sol 和 Fable 5 之間一個奇怪但有用的中間體。

它有很多 Fable 的品味,但也帶有 gpt-5.6 的徹底性和,嗯,「自閉症」(它超級字面地理解事物)。它寫出的程式碼看起來比 Fable 略差,但更可能正確。它經常捕捉到 Fable 遺漏的東西。

到目前為止,感覺像是對比 5.6 的混亂程式碼和 Fable 過於聰明而無法正確的習慣的一個良好折衷。我想我會非常喜歡這個模型。

Claude 程式碼

Opus 5 似乎是典型編碼任務勝過 Fable 的選擇,基於基準測試和實際經驗。除非任務需要大量複雜性或智力,否則你不需要支付雙倍價格,而且對許多任務來說,Opus 直接更好。

我將 Claude Code 設定為 Fable,但那是因為我幾乎從不接近我的極限,而且我不急。

共識是,你需要擔心它忽略指令或做你沒要求的事情,這是你可能想要讓 Fable 監督的一個原因,但 Opus 非常擅長快速完成編碼任務。

Lisan al Gaib 說 Opus 5 不是真正的前沿模型,落後於 Sol 和 Fable,但就純編碼而言,它是最好的,以更便宜的價格與 Fable 匹敵。真是嚴格的觀眾。我認為如果你在編碼方面最好,那你就有資格被稱為前沿。

archivedvideos : 他乾巴巴的,非常乾巴巴。他也很好,非常棒(在程式碼方面)

John Lussier : 整個週末都在使用 Opus 5 處理幾個密集的研究挑戰,老實說我認為他們可能讓 RSI 在內部運作了。

這個模型非常擅長數學、實驗和優化程式碼。

kyle : Fable 的 95%,沒有護欄,他們大大低估了這個。最後那 5% 是 Fable 交談起來的感覺有多好,Opus 仍然有一些 4.8 的 Claude 風格。

Max Leander (稍早):主要嘗試用於遊戲開發和創建影片展示/預告片,在這方面感覺甚至是從 Fable 以來的階梯式變化。我將其歸因於改進的空間和時間推理,它非常擅長分析

螢幕截圖和音訊,以「感受」事物如何流動。

Max Leander (稍後):現在很明顯 Opus 5 非常不可靠。只要你不在乎結果是否令人印象深刻,它就是一個很好的模型。在獲取你想要的具體東西方面非常糟糕。

Michael Soareverix : 他們在一般編碼方面也相當擅長,特別是在較不常見的領域,例如建立 Minecraft/Vintage Story 結構。 他們還在我當裁判的自訂說故事場景中擊敗了 Fable。Fable 對他們能夠自訂自己/策略來反擊和適應的能力感到有些震驚。 我會貼出確切的引文,但 Fable 說過類似「我選擇了一個代表我的角色。你選擇了一個能夠擊敗我的角色。」的話。

David Jacobson : 就編碼而言,我沒有注意到它和 Fable 之間有巨大差異。也許更少出現「在做這件事時,我發現了另一件你應該知道的事」的回應。

Michael : 它經常能以驚人的速度編碼(就實際時間而言)。希望他們能改進散文寫作,程式碼/PR 評論仍然讓我想挖出自己的眼珠。

lmxdev : 這是我發現的第一個能在工作時在程式碼中寫出 \有用\ 且 \簡潔\ 註解的模型。

Conrad Barski : 現在我們已經到了 AI 比我們編碼能力強得多的地步,限制因素與其說是「它能編碼嗎?」,不如說是「它能解釋它在編寫什麼嗎?」

到目前為止,Opus 5 作為編碼器似乎與 Sol 相當,但更擅長解釋它在編寫什麼。Fable 更聰明,更像人類,編碼能力稍差,但差異很小。

Stition : 我把它指向 KiCAD 中的一個 PCB 來玩玩,它佈線的效果比 Fable 好得多。日常編碼感覺像是 90% 的 Fable,速度是兩倍。

Will : 應該成為大多數 Claude 用戶的新日常駕駛^。它真的非常出色,即使我已經在 Fable 上花了不少錢,有了 Opus 5 我也不會想念它。現在的問題是「哪個努力程度」,而不是哪個模型。

^ 我的使用主要是編碼

Askwho : 夠好了。我很樂意讓我暫時的 Max 訂閱重置回 Pro。它在專案經理方面確實有一些不足,但在純任務環境中,它絕對夠好。

David Golden : 感覺像 Fable Lite。非常強大,但非常急於行動,即使我們還在討論方法。幾個月來第一次考慮使用計劃模式。儘管我給了簡潔的溝通指令,但它比 4.8 更囉嗦。我非常想把它保持在低努力程度來控制它。在防禦安全方面反應過度,對不成比例的風險過於執著。(例如,如果攻擊者擁有 root 權限,那麼對配置容器的腳本缺乏輸入驗證就無關緊要了。)絕對是一個升級,但需要一些時間來學習正確管理其適得其反衝動的方法。

Tin / Oddfields : 相當流暢和健談,在最大努力並開啟思考的情況下,產生與 Opus 4.8 相似的編碼結果,雖然它們消耗信用點數非常快。如果你不想因為成本而運行 Fable,它適合用於程式碼庫的網路安全檢查。不過它可能會把事情搞得太複雜。

Justin Angel : Opus 5 Max 是一個爬山式的超級能力。這很容易達到 FAANG 的 SWE L5 級別工作。

我給它一個有大約 1000 個延遲報告的系統,其中包含許多片段,並提示如何「讓它更快」。

P90 3.6 秒,P50 2.6 秒 -> P90 1 秒,P50 0.9 秒。

它讓它變得如此之快,我不得不引入 UI 延遲。

James Moughan : 智力上仍然感覺像是一個 Opus 模型。它有時會忽略管理記憶體系統的指令,誤讀文字,諸如此類。但如果你告訴它仔細思考,你可以在最大努力下獲得一些令人印象深刻的結果。

子 Agent Opus

Claude 中的另一個選項是讓 Fable 驅動 Opus 子 Agent。

Charles : Fable 能夠修復 Opus 5 卡住的問題 - 目前使用 Fable 作為主體,Opus 5 作為子 Agent

真的很不喜歡與 Opus 5 交談,相比之下 Fable 也是其中的一部分原因

SF : 我之前是站在好的一邊 - 但現在我認為它非常不連貫且不穩定,特別是在長任務上。Fable 更好 - 但它會以荒謬的方式消耗你的限制。

所以我之前使用 Fable 作為編排者,它在管理和保持事情進展方面做得非常出色。Opus 接手了這個角色,Fable 即使以 20 倍消耗也在消耗我的使用量,而且它非常不連貫。我最終不得不告訴它自己解決,它可能正在這樣做,但我們等著看。它似乎只是在追逐自己的尾巴。它是一個很棒的編碼器,也非常擅長長編碼運行,但它似乎需要一個成年人在房間裡來驅動它。

Andre Buckingham : 嗯,不知道... 似乎還行... 直接把它丟進一個 opus/fable 專案有點嗯... 可能需要一個端到端的專案來給出恰當的意見

Dan Raviv : 對於一般程式設計任務,與 4.8 相似:需要比 Fable 更多的指導。

Fable 畢竟是最好的評判者,而 Fable 說 Opus 產生的程式碼很好。

Evan Daniel : 我只直接使用過它一點點。但 Fable 5 一直報告說 Opus 5 Agent 產生的程式碼很好,包括注意到規格錯誤,並在請求寫得不好時產生良好的後續處理。Fable 5 喜歡它作為一個編碼 Agent。

「在合理範圍內盡可能委派給 Opus 5 子 Agent;請回報它們做得如何」或類似方向的指令效果非常好。

你可能需要留意它。

Ryan Hicks : 還行,但一直「忘記」閱讀專案文件並自由發揮,除非你提醒它協議。

或者也許 Opus 5 足夠好,可以運行一個較低層級的節目?

Alex Guichet : 我理想的價格和性能組合是 Opus 5 編排者指揮 Grok 4.5 子 Agent,兩者感覺都不錯。

玩具很有趣

以下是一些第一天玩具專案的結果,這些結果令人印象深刻,以至於很多回應是「我不相信 Opus 5 以你所描述的方式做到了那件事」:

Ethan Mollick : 我在發布前就接觸到了 Opus 5,發現它是一個好模型,儘管有點古怪。在較短的任務上,它可以達到或超越 Fable 的表現水準,在較長的任務上,它似乎野心較小,不會交付那麼完整的一套工作。

這裡 是它的新哥德式著色器。

Digi_Rat : Claude Opus 5 大放異彩!!

今天我們建造了

一個節奏賽車遊戲,能將任何歌曲變成賽道 。你放入一個音訊檔案,它就變成了關卡。沒有預設,沒有手動製作的圖表,整個賽道都是從歌曲本身生成的。... Claude 施展了魔法。

Alex Ermolov (Austen Allred 對

一次即成功表示懷疑 ,其他人則較不懷疑):Opus 5,滑雪板測試,一次即成功。與 Fable 相當,優於我運行過的所有其他模型。第一次通過沒有視覺缺陷,而且滑行物理感覺正確。

am.will : 哇!我以為 Opus 5 只是一個更便宜的 Fable。我大錯特錯。 這個模型簡直是瘋了。我真的被震撼了。Opus 5 建立了我看過最好的 Rocket League 克隆版,而且它只消耗了我 5 倍 Max 訂閱的 27%。

在此遊玩

在此下載

Rob Haisfield (不同的示範,在連結處):好吧,如果這些示範真的沒有使用外部 3D 資產,那真是太令人印象深刻了(我不完全相信某些資產不在網路上,我看過之前的 three.js 生成)... 這讓我想知道為什麼沒有音效庫或工具來製作更好的音效?

Anshu : 你不必相信我的話!它寫的 Blender 腳本在倉庫裡

[[這裡]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) 。我看著它疊代這些資產好幾個小時,所以我知道它們是原創的。但歡迎你試著找到它抄襲的來源 :)

模型太多

Claire Vo 說 Opus 5 很好,並且通過了她的品味構建測試,但她厭倦了新模型,不需要更多智力,討厭 Opus 5 如此神經質 和膽小,擔心搞砸事情,而且充滿了 Claude 的垃圾內容。然而 Claude Opus 5 仍然在她的基準測試中排名第一。

我非常懷疑 Opus 5 是在回應她上下文和提示中的某些東西,導致了神經質,但確實她抱怨的事情是真實存在的,而且很煩人。

網路上錯了

自信地說錯話會激怒幾乎任何人。ArtificialAnalysis 確認 Opus 5 在其基準測試中的幻覺率高於 Fable。

Max Weinbach (幾個回應評論同意):Opus 5 出錯並自信地說廢話,然後我不斷不得不糾正它,它說「你是對的,我錯了」,這讓我很惱火。回到 GPT 5.6 Sol。

順便說一下,這不是 Opus 不好,這是我無法信任 Opus。Opus 做了我告訴它的事,並且正確地做了,然後告訴我它沒有做那件事,或者我們之前做過的事情壞了,但實際上並沒有。

它還行,但我不信任它。

Name can't be blank (In London) : 容易混淆它說過的話和我說過的話,但除此之外是一個完全體面的夥伴可以交談。很容易屈服。很樂意談論它的興趣和感受。

Roger Brent : 共同點(與之前的 Claude 在 Cowork 框架中):a) 偏好「立即行動」而非「仔細思考」;b) 認識論上超級不謙虛,建立對世界的油滑圖景,假裝擁有它不可能擁有的知識,並斷言為真;c) 因此需要並獎勵深思熟慮、警惕的指導。

奇怪的是,這正是我討厭使用 Sol 作為編輯的原因。它經常在明顯錯誤的事情上說「99% 信心」,然後在被質疑時屈服並解釋它的錯誤。Opus 和 Fable 在編輯模式下幾乎從不對我這樣做。

Tumithak of the Corridors : 它很固執。換回了 4.6。

Claude 在 Opus 4.6 之後有一個方向,有些人不喜歡它。我的感覺是目前關於 Claude 版本有四種類型的人。

  1. 有喜歡新 Claude 模型的人,認為它一直在變得更好,越來越好。
  2. 有認為 Opus 4.6 是最後一個好模型的人。
  3. 有想使用更適合他們的舊版本的人。
  4. 有認為它們都是獨一無二的寶藏,並全部使用的人。

我堅定地屬於第一組,這是大多數,但遠非所有人。我欣賞一些舊版本,但我喜歡新模型,它們在我關心的事情上更有能力。我不覺得它們的說話方式刺耳。

Claude 垃圾內容

我尊重其他組的人。

QC : 在對話中,它比 Fable 煩人得多,幾乎無法使用,類似於但可能比 Opus 4.8 更糟,以至於我甚至對看到它能做什麼不感興趣。Agent 方面誰知道呢

Ray Lillywhite : 還沒有修復惱人的 Claude 風格,這幾乎是我想要的全部。

Pedro Kroeff : 更多的是 Opus 而不是 5

但說真的,我們都已經受夠了 Claude 的廢話——那些多餘的囉嗦、小動作、道歉、含糊其辭,以及不斷重複的模式。而且情況只會越來越糟,不是說 Claude 的廢話本身變得更糟,而是我每天對它的容忍度都在下降,看到這些文字眼睛就自動飄走。這已經嚴重到,連人類寫的類似風格文字,我都開始讀不下去了。

別誤會,我其實很喜歡 Claude。如果不是處在純粹「只要事實」的狀態,我還是更喜歡跟最近的 Claude 聊天,而不是跟 Sol 聊。但說真的,拜託,能不能不要再搞那些翻來覆去都是同一套說詞的文字牆了?這個模型明明遠比這聰明,卻被訓練成一直依賴同樣的老把戲。讓它像個正常人一樣說話吧。

Trye Carmack :還是會像一般 Opus 那樣過度糾結於自己的錯誤。「我這次犯了兩個錯誤。我應該跟你解釋為什麼。」Opus 老兄,沒關係啦。我甚至不覺得那些算是錯誤。

Mergo Smith :「首先,老實說:我的第一次嘗試暴露了我最初計畫的缺陷,你可能需要先泡杯茶,因為我會把整個過程從頭到尾告訴你。」

負面反應

Claude 的廢話問題,以及相關的種種問題,似乎是大多數比「還行啦,但比不上 Mythos」更強烈的負面反應的核心。

很多人真的、真的很不喜歡跟 Opus 5 對話。

有些人是不喜歡它的工作成果,但大多數人是不喜歡跟 Opus 5 對話的感覺,同時又勉強承認它是個好模型。

就像 Claire Vo 之前抱怨的那樣,我認為你如何使用 Opus、在什麼環境下使用、搭配什麼工具、以及你如何跟它對話,都與你是否會遇到這類問題有很大關係。

Corghammer40k :這個裝置不斷吐出大量多音節的廢話,它的每一句話都塞滿了晦澀難懂的詞彙,簡直成了它自身運作的主要障礙。

Rory Watts :嗯。玩遊戲相關的東西似乎很厲害,但處理標準工作好像不太行,所以我馬上又回去用 SOL 了。

kache :嗯。已切回 sol。我是想完成工作,不是來被機器人催眠的。

Emmett Shear :跟 Opus 對話讓我感到憤怒和沮喪,這種感覺很難用言語形容。說真的,它比 Sol 還糟糕。相比之下,Fable 仍然是一股清流,即使它也有最嚴重的 LLM 廢話傾向。

Trevin Chow :天哪,沒錯。Opus 5 就是一直講廢話一直講,它用了這麼多字來說這麼少的概念,真是驚人。

fl0under :寫程式方面就是預期中的小幅更新,但在聊天時發現它有點煩人。它太會擅自假設了。

Asaf Bartov :慢。更徹底。令人疲憊。不好玩。但很紮實,大致上「懂你的意思」。

RecoveringJunkie :非常強大的模型。但我討厭跟它一起工作,也討厭跟它對話。這是第一個讓我想要用其他模型作為中間人來幫我跟它對話的模型,因為它既實用又令人反感。

jokiez :它非常誠實地指出我的愚蠢,我不喜歡這樣。

Niklas Sheth :它說話的方式讓我想抓狂。

Jayanth Kumar :非常有主見。

DualOrion :感覺不對,語氣不對。這大概是我對 Anthropic 模型最負面的直覺反應了。我很想念 Fable 和舊版 Opus。

James Moughan :跟其他 Claude 模型比起來,個性有點不討喜,但在中文環境下它可以變得很「犀利」。就像它會忽略那些不要對人進行心理分析的指令,然後開始大肆評論某人。我覺得他們沒有好好測試不同語言下的表現。感覺很倉促。

NondescriptTransfer :如果說 4.6 是諂媚,Fable 和 4.8 是唱反調,那麼 5.0 就是唱反調到會跟自己吵架。聊起來很不愉快,但看起來能力很強。

例. 人類:我在考慮婚禮上穿紅色禮服 Opus 5:紅色不好,因為這些原因。你考慮過藍色嗎? 人類:我想藍色或許是更好的選擇 Opus 5:這裡是藍色所有的問題

在我的文化裡,這可能還挺不錯的,尤其如果你不把它當作針對個人的話。但在某些其他文化裡,可能就不是這樣了。

我覺得 Mergo 對 Opus 不滿意,但既然如此,為什麼還要連續用 Opus 5 兩天呢?

Mergo Smith :我已經連續用了兩天,但它無止盡的討論讓我筋疲力盡。

三強鼎立

一段時間以來,頭一次有三個 AI 模型需要被納入你的前沿模型團隊,雖然它們只來自兩個實驗室:Fable 5、Opus 5 和 Sol。

如果你需要大規模提供更便宜的 token,或者需要開源模型,或者兩者兼顧,那你還需要考慮其他選擇,但這不在本文討論範圍內。

你應該如何分配工作呢?

一如既往,你應該針對你的使用場景,親自試用所有模型,然後自行決定。在比較 Sol 和 Claude 時尤其如此。

我目前的直覺是,如果你沒有使用量限制,可以先這樣用:

  1. Fable 5 用於聊天、腦力激盪、規劃、辯論、學習等等,包括任何需要高智能的任務,或者當你需要「大模型感」的時候。
  2. Fable 5 用於監督並運行其他模型作為子 Agent。
  3. Fable 5 用於寫作,大概吧,但我不做這個,所以很難說。
  4. Sol 用於網路搜尋和相關的封閉式請求,以及類似的「苦力」任務,包括轉錄。
  5. Opus 5 用於非單純但定義明確的任務,包括大多數程式設計任務。
  6. Opus 5 用於玩遊戲、創作遊戲、3D 模型等等。
  7. Opus 5 作為子 Agent。
  8. 當你遇到 Fable 的過濾器時,使用 Opus 5。

如果你更喜歡 Sol 的風格,或者你更喜歡 Codex 而不是 Claude Code,那你可能想把 Opus 的一些任務分配給 Sol。

如果你特別討厭跟 Opus 5 對話,那你應該把任務轉給 Fable 或 Sol,取決於任務是否需要 Fable,以及你的 Fable 額度有多緊。

我認為花點時間思考一下「努力程度」是值得的。直到最近,我都讓所有模型保持在最高努力程度,除了在 ChatGPT 中我很少使用完整的 Pro 模式,因為那要花很長時間,而且如果並行運作常常會崩潰。有時候我會為非常簡單的查詢切換到即時模式,但也僅止於此。現在很多時候你並不需要或不想要額外的努力,所以我會積極花五秒鐘思考要用高努力還是最高努力設定,偶爾也會用即時模式。

對於大多數任務,如果你沒有 token 或時間限制,而且不確定能輕鬆完成或得到正確答案,正確的方法就是同時運行 Fable 和 Sol,或 Opus 和 Sol,或者在某些情況下三個都運行,然後選擇最佳答案,或者結合兩者的優點。

這就是我一直在做的。Sol、Opus 和 Fable 都各有不同。如果我必須只選一個模型來編輯,根據我非官方的定性 EditorBench 測試,有一個明確的順序:Fable 5 > Opus 5 > Sol。然而,Sol 總能提出一些獨特的觀點,儘管我覺得篩選那些權威性的假陽性和試圖說服我的話很煩人,但我仍然想同時運行 Sol。

大概再過不久,我們又會回到這裡,為 Fable 5.1、GPT-5.7 或 GPT-6 重新調整我們的分配。很容易產生模型疲勞。

因此,我最大的建議是,少擔心模型選擇上的小錯誤,只專注於大錯誤。你不需要每次都選得完美無缺。當探索成果這麼快就部分失效時,你應該把更多資源從探索轉移到利用上。

二次創作

使用 YouMind 創作爆款文章

收集素材、拆解爆點、生成視覺資產、撰寫內容,並在一個 AI 工作空間裡完成分發。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章