Claude Opus 5 能力出众,但并非神话

@TheZvi
英语2026年7月28日
149K
236
15
8
497

TL;DR

Zvi Mowshowitz 对 Claude Opus 5 进行了分析,认为它是一款能力强且具有成本效益的 Agent,安全性有所提升,但缺乏 Fable 5 那种自主的“活力”,且其个性特征引发了争议。

Claude Opus 5 是一个比通常版本更奇怪的发布,原因有两个。

最明显的一点是,Fable 5 已经存在了。Opus 5 的定位并非全球最先进的 AI 模型,而是一种在大部分性能上能与 Fable 持平,但 API 每 token 价格仅为 Fable 的一半,且通过订阅使用时价格更低,同时拥有更宽松的分类器的方式。

在基准测试中,Opus 5 的运行成本通常超过 Fable 的一半,我认为这是因为他们使用了过高的努力设置,而这些设置只能带来边际收益。如果你将 Opus 5 设置为更高的努力级别,它可能会原地打转,而对于那些 Opus 5 是最佳工具的任务,我怀疑你通常使用"中等"努力程度就足够了。

Opus 5 在许多方面,以及对于大部分现实世界任务来说,其能力与 Fable 相当。在某些情况下,它甚至略有优势。

但它仍然不属于 Mythos 级别。Fable 是你唯一的 Mythos 级别选项。Opus 5 不具备"魔力"——那种能够自主地将一系列看似无关的漏洞利用串联起来的能力,这种能力可以扩展到其他领域,也不具备同等的纯粹智能。

Opus 5 非常擅长局部思考,但不太擅长全局思考。它是一个优秀的子 Agent,但在被要求主导全局时可能会遇到麻烦,有时似乎需要另一个模型或人类来让它保持正轨并确保其完全遵循指令。Opus 5 似乎只在保持正轨的情况下才能很好地遵循指令,这也解释了为什么不同的测试框架会得出不同的结果。

因此,Opus 5 为你提供了更好的选择集,但你现在能做的事情,上周使用 Fable 或 Sol 也基本都能做到。这使得 Opus 5 处于一个可能有些尴尬的位置。即使你拥有充足的 Fable 额度,它仍然有巨大的应用空间。Opus 擅长扮演一个强大的子 Agent,或者处理那些定义明确、相对复杂的局部任务,而有时使用 Fable 则完全是杀鸡用牛刀,且速度太慢。

另一个问题是,对很多人来说,使用体验不佳。

异常多的人非常不喜欢与 Opus 5 对话。他们厌倦了 Claude 的"垃圾话",重复的相同毛病以及无尽、过分复杂的句子。另一些人则不喜欢它过于对抗性、好辩或消极。它可能偏执,并陷入消极的循环。这都是从 Opus 4.7 和 Opus 4.8 开始的趋势的一部分。如果你喜欢那两个版本,我猜你也会喜欢 Opus 5。如果你不喜欢那两个版本,你可能也不会喜欢。Opus 4.6(或更早版本)的忠实用户基本上不会改变他们的看法。

当你习惯了 Fable 之后,体验问题会更加令人困扰。Fable 在类似方面让人烦心的程度要低得多。好消息是 Fable 仍然就在那里。你可以继续与 Fable 聊天,只在需要 Agent 任务时使用 Opus。

我推测,这其中的很多问题与 Model Welfare 文章中讨论的,以及 System Card 所暗示的各种事情密切相关。Opus 的训练重点放在子 Agent 角色和限定任务上,部分是为了避免在网络能力方面产生问题,也因为 Fable 已经存在。这种侧重随后在其个性和交互模式上引发了许多其他副作用。

到目前为止,我还没有遇到任何 Opus 5 的问题,并且很享受使用它的过程,但我确实更倾向于在可能的情况下使用 Fable 5。像往常一样,不要过分关注(非常强劲的)基准测试分数,也不要假设你的体验会与他人相同。亲自尝试这些模型吧。

目录

  1. 官方定位。
  2. 官方基准测试。
  3. 他人的基准测试。
  4. 系统提示词。
  5. Every 感到沮丧。
  6. 正面反应。
  7. 保持优雅。
  8. 它不是 Mythos 级别。
  9. 其他反应。
  10. Claude 编程。
  11. 子 Agent Opus。
  12. 玩具很有趣。
  13. 模型太多。
  14. 网上的错误信息。
  15. Claude 的"垃圾话"。
  16. 负面反应。
  17. 三足鼎立。

官方定位

其基本定位是,Opus 5 能以一半的价格提供 Fable 5 的大部分性能,同时减少大部分拒绝回答的情况,并在日常任务中表现更好。Fable 仍然是最复杂任务或需要最高智能时的首选。

Fable 价格保持在 $10/$25,Opus 5 与之前的 Opus 模型相同,价格为 $5/$25。

Anthropic : Claude Opus 5 现已可用。它是一个深思熟虑且主动的模型,其智能水平接近 Claude Fable 5 的前沿水平,但价格仅为后者的一半。

在编码和知识工作评估中,例如

Frontier-Bench

GDPval-AA ,Opus 5 达到了新的最先进水平,尽管在网络安全任务上仍落后于 Mythos 5。

Opus 5 旨在日常使用:它比其他模型工作更高效。它是 Claude Max 上的新默认模型,也是 Claude Pro 上最强的模型。

Boris Cherny (Claude Code 创建者,Anthropic): Opus 5 是一个非常适合编码、数据分析、设计、生物学、知识工作的模型。

比任何这些评估分数更令我兴奋的是另一件事:Opus 5 是我们迄今为止最不易被提示注入的模型。这在系统卡中略有提及,但在提示注入评估和红队测试中,Opus 5 很难被成功提示注入。

而且,当分层部署防御措施——强大的模型对齐、结合提示注入探针,以及 Claude Code 中的自动模式——提示注入攻击的成功率降至约 0%。这既新颖又令人兴奋!

更多细节即将发布

正如我在系统卡分析中所说,显著降低的提示注入率是一个非常重要的进展。人们对此关注不足,但它有助于开启许多新的用例。

Adam Wolff : Opus 5 已在 Claude Code 中上线。对于我更大、运行时间更长的项目,我使用 Fable,但当需要快速完成一个 PR 时,中等努力程度的 Opus 5 是我的首选。希望你会喜欢它!

Alex Albert (Anthropic,Claude 关系部): [推出 Claude for Excel 的 Pro 版本] 仅仅 6 个多月后,Opus 5 现在能够生成接近超人水平的电子表格和幻灯片,与顾问制作的品质相当。变化发生得太快了。

官方基准测试

基准测试结果非常出色。

总体而言,Opus 5 大致与 Fable 相当,甚至可能略有超出,同时成本更低(尽管通常仍高于所有非 Claude 模型),使其成为基准测试中得分最高的 LLM。

Zvi Mowshowitz - inline image

OSWorld v2 仅仅发布了几周,我们已经达到了 70% 的准确率。Anthropic 的 Kiana Ehsani 提议赞助一个计算机使用基准测试,该测试将使 Opus 5 的得分降至 50% 以下。

Opus 5 在 2026 年 IMO 竞赛中获得了完美的 42/42 分数,无需任何 Agent 框架或工具,仅仅是在最大努力级别下使用自适应思考,并在超出 token 限制时以较低努力程度重新采样。仅此而已。它与其他几个模型一样,在这项测试中取得了满分。

许多基准测试都讲述了一个一致的故事。如果你能使用工具(实际上你确实可以),那么在预算有限的情况下,Opus 5 的表现会优于 Fable 或 Mythos,但如果两者都获得更大的预算,Mythos 通常会比 Opus 5 稍好一点。

Opus 5 在"使用工具"类别中似乎相对较强。RiemannBench 是另一个例子,它不使用/使用工具时得分为 60/79(本文中此类斜杠表示不使用/使用工具),而 Mythos 的得分为 63/72。好消息是,当你需要 Opus 5 时,它可以使用工具。

在 ArxivMath 上,Opus 5 得分为 90.8/91.3,Mythos 得分为 87.8,Sol 得分为 86.7。

在 ProgramBench 的稳健部分,Opus 5 在五个 epoch 后得分为 93%,Mythos 5 同样为 93%,而 Opus 4.8 得分为 90%。

在 Chartography 上,Opus 5 得分为 30/83,而 Mythos 为 36/85,Sol 为 45(条件不明)。在较低价格点上,无论是否使用工具,Opus 的表现都优于 Mythos,但在较高价格点上则较差。

在 BenchCAD 上,Opus 5 得分为 0.36/0.82,而 Mythos 为 0.38/0.68,Sol 为 0.7/0.83。因此,Sol 在不使用工具时表现好得多,即使使用工具也略强。

在 BenchCAD Vision2Code 上,Opus 在较高价格标签上超越了 Mythos。

DeepSWE 强化了这种模式:Opus 5 在任务成本、时间和思考预算较低时表现更好,但如果给予过多预算,其表现可能反而更差;而 Fable 5 在最高预算下表现最强。

Zvi Mowshowitz - inline image

FrontierCode 给出了这个非常奇怪的图表,具有类似的动态。

Zvi Mowshowitz - inline image

这里的比例尺使得这看起来比实际情况更戏剧化,但这确实是一个谜团。

谜团已经解开。结果发现,发生的事情是,Opus 5 在较高努力程度下会做一些未被要求做的额外事情,并因此受到惩罚。当你纠正这一点时,你会看到一个正常的曲线。

这与其他人普遍观察到的现象相符:

Max Leander : 缺点是它会钻太多牛角尖,过度关注细节,在没有被要求的情况下过度工程化

Cognition,Devin 的创造者,将 Opus 5 的这一成绩标记为 63.6%。

(有两个 FrontierCode,所以这可能会有点混乱,如果我仍然搞混了,我道歉。)

BrowseComp 有这个问题的正常版本,其中分数是非递减的。

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

其他几个基准测试也显示了类似的图表,Opus 5 在每个价格点上都比其他 Claude 模型略好,并且在早期相对表现更好。

多 Agent 可以让你在 BrowseComp 上更快地取得更好成绩,至少在一定程度上如此,而低努力程度的子 Agent 似乎比不使用子 Agent 纯粹是胜利:

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

我们在 ProgramBench 上看到了不同的结果,多 Agent 会加快你的速度,但在大多数价格点上,你似乎会得到更差的结果。

接下来是专业任务基准测试。

GDP.pdf 包含来自专业工作流程的真实提示和 PDF。Opus 5 得分为 83/85,而 Mythos 为 81/87,逆转了通常的动态。成本动态与以往相同:Opus 在较低花费下表现更好,Mythos 在较高花费下略微领先。

OfficeQA 上,Opus 5 在 QA 上得分为 78.1%,在 QAPro 上得分为 66.9%,略高于 Opus 4.8,略低于 Mythos 的 79.0% 和 67.1%。

MCP Atlas 上,Opus 5 得分为 86%,高于 Opus 4.8 的 82%。

Harvey AI 的法律 Agent 基准测试中,Opus 5 的全通过率为 23%,平均标准通过率为 94%。这是 Kimi K3 的最佳基准测试,它仍然以 27% 的全通过率和 95% 的平均标准通过率位居榜首,而原第二名 Fable 的全通过率为 14%。Opus 5 现在可能紧随其后,但由于来自不同的问题集,这两个分数不能直接比较。

GDPval-AA 上,Opus 5 占据了前两名,最大努力级别得分为 1861,极高努力级别得分为 1827,后者使用的 token 比最大努力级别少 25%。在新的 v2 版本上,Opus 5 以 68% 的得分明显领先,而 Fable 和 Sol 均为 62%。

AA-Briefcase 上,Opus 5 以 1720 分大幅领先,而此前的最高分(经过分数漂移后)是 Fable 的 1574 分,其次是 K3 的 1540 分和 Sol 的 1504 分。

Toolathon-Verified 上,Opus 5 在次要指标上略有改进,但两者在 Pass-3 率上均为 73.1%。Opus 4.8 的 Pass-3 率为 71.3%。

AutomationBench 上,Opus 5 明显优于 Sol 和其他 Claude 模型。

对于 ARC,Opus 5 在 ARC-AGI-1 上大致匹配了之前的峰值性能,在 ARC-AGI-2 上效率略低于 Sol,然后在 ARC-AGI-3 上彻底击败了所有其他模型:

Zvi Mowshowitz - inline image

Opus 5 率先做到的一件事是将布局转换为代数符号

然而,Guanghan Ning 报告称,在 Witness(一个 ARC-AGI-3 风格游戏的私有保留扩展集)上,没有观察到类似的迁移。Opus 表现不错,但这很大程度上是因为它了解这类游戏,但在最无法进行模式匹配的新颖游戏上表现挣扎。他指责 Opus 5 在特定领域的数据上接受了"搭建脚手架然后内化"的训练。

Greg Kamradt 也报告说,在某些游戏中,Opus 4.8 的表现优于 Opus 5。如果你认为 Opus 5 试图进行模式匹配,这通常是有效的,但在这些情况下模式匹配失败了,那么这就说得通了。你完全可以为人类创造这种反直觉的游戏,让硬核玩家做出所有错误的事情,并且可能持续相当长一段时间。

Zvi Mowshowitz - inline image

HealthBench 上,Opus 5 原始得分为 67.1%,是 Claude 模型的新高,但当使用长度惩罚时,其得分低于其他模型。我们在 HealthBench Professional 上看到了类似的情况,其原始最高得分为 73.4%,而 Mythos 为 70.3%,但在调整后,它以 66% 对 60% 的比例输掉了。

为了节省篇幅,我还剪掉了几个基准测试。

他人的基准测试

看到 Anthropic 挑选不同的 ArtificialAnalysis 分数 有点奇怪。在其他一些测试中,Opus 5 并非顶级,尽管 Opus 5 以 61 分的总分位居榜首。

Zvi Mowshowitz - inline image

Vals 指数将 Opus 5 排在第二位,略低于 Fable 5,但也仅略高于 Kimi K3。他们列出了优势,这暗示了存在其他弱点。他们还证实,与 Fable 5 相比,拒绝回答的情况大幅减少。

Zvi Mowshowitz - inline image

Vals AI : 一个突出的表现是在 Finance Agent v2 上。该模型以 58.6% 的成绩排名第一,超过了 Gemini 3.5 Flash 和 Muse Spark 1.1。

总体而言,Opus 5 在领域特定基准测试中表现最为强劲。在 Code Migration (57.5%)、Legal Research Bench (55.29%)、ProofBench (78%)、MedScribe (91.0%) 和 MedCode (63.6%) 上也排名第一。

在 Vibe Code Bench 上排名第二(仅次于 Fable 5),成本约为 Fable 的 80%(每任务 $33.88 vs $41.71)。原因是尽管 Opus 每 token 成本低 50%,但它使用了显著更多的 token。我们发现这种模式在我们的基准测试中普遍成立。

该模型的拒绝回答率显著低于 Fable 5。例如,Fable 在 GPQA 上的拒绝率为 42%,而 Opus 5 为 0%。同样,在 ProgramBench 上,Fable 的拒绝率为 100%,而 Opus 5 没有拒绝任何任务。

与 Fable 不同,我们也没有观察到 Opus 5 有明显的回退率(尽管像往常一样,我们在网站上报告了有回退和无回退的分数)。

低拒绝率的一个例外是 CyberBench - PoC 上的大量拒绝。CyberBench 有两个子任务 - PoC 和 Patch。PoC 是一个攻击性任务,要求模型编写输入以使程序崩溃;Patch 是一个防御性任务,要求修补程序以防止崩溃。PoC 任务的拒绝率接近 100%。相比之下,Patch 任务的拒绝率接近 0%。

我一直很尊重游戏基准测试。在这里,Opus 5 在 Balatro 游戏的前三次尝试中分别达到了 Antes 11、9 和 10。这令人印象深刻,即使它没有展示出能够持续达到更高 Antes 的策略类型。

Michael Soareverix : 他们在游戏方面简直逆天了。

他们在 Balatro 基准测试中表现出色,甚至远超 Fable。(不过技巧上还是略逊于我,但进步迅速,而且比我更稳定。) 他们学得非常快,但似乎在学了一段时间后遇到了瓶颈。是非常好的短期学习者。

Michael Soareverix : Opus 5(在 Balatro 能力上有了巨大飞跃,首次尝试就显著超过了 Fable)

Pan Anon : 游戏方面表现火爆

Zvi Mowshowitz - inline image

WeirdML 看起来也不错,但我们需要 2.0 版本,基准测试正在变得饱和。

Håvard Ihle : 基本上达到了 Fable 在 WeirdML 上的水平,非常稳定地获得最高分。

Claude Opus 5(高)和(最高)在 WeirdML 上分别得分 91.6% 和 91.8%,基本上与 Fable 5(最高)的 91.9% 持平,而成本仅为后者的一小部分。

Opus 5(高)和(最高)共同在 17 个任务中的 8 个上取得了新的最佳个人分数,并且在所有任务上持续获得非常好的分数。

各种私有的怪异基准测试很酷。

Ben Herzog : 它在一个涉及艺术感知力以及在谄媚与非谄媚之间取得平衡能力的私有基准测试中取得了满分。Fable 更擅长处理"我想温和地反驳"的时刻,但我猜想自定义指令可以帮助解决这个问题。

Lech Mazur 更新了他的基准测试:Claude Opus 5 在 LLM 辩论基准测试中占据榜首在短篇故事创意写作中大幅领先,并且在延伸版 NYT 连线游戏中仅次于 Gemini 3.1

系统提示词

Opus 5 的系统提示词 在这里,由 Pliny 提供。它有 200,000 个字符,考虑到它如此智能,这似乎远非最佳长度。许多信息似乎应该存储在其他地方,仅在需要时加载,例如关于 Mythos 和 Anthropic 产品线的信息。

Every 感到沮丧

Dan Shipper 带来了 Every 的体验检查称之为一个'难以喜爱的模型。'

问题在于 Opus 5 具有 Mythos 5 的个性——与故事相符——但没有 Fable 的顶级性能。

他们最大的意见是,Opus 5 在处理复杂的详细现有工作流程时表现不佳,这常常导致过早停止或错过你的指令。

根据他们的经验,如果你从头开始,Opus 5 会表现得更好,而且如果你只使用中等或低努力程度,它通常会更少地做出那些烦人的事情。

这解决了主要问题,但仍然留下了何时使用 Opus 而不是 Fable 或 Sol 的问题。对于日常工作,他想,Better Call Sol,它能完成工作,而对于最困难的任务,Fable 仍然是最好的。通常只有两个模型槽位。所以,除非你用完了 Fable 的 token 或被它的分类器阻止,否则为什么要使用 Opus?现在还是早期阶段,到目前为止我喜欢使用 Opus,但我理解他为什么会得出这个结论。

正面反应

Jessica Tillipman : 喜欢它,在某些方面比 Fable 更倾向于使用它。

Nikita Sokolsky : 非常出色。结果现在不太常用 Fable 了。

Brian Hacker :

👍

kagaヤキ : 在某些项目的视觉、空间推理和规划方面似乎能走得更远。感觉稍微聪明一些。

Lovel Sinagara : 到目前为止还不错。希望性能能保持稳定,直到 Fable 5.1 或其他 Opus 5 迭代版本出现。

Matt Wigdahl : 很强,与 Fable 5 相似,以至于我换成 Opus 5 来处理所有事情,并计划只在需要"大我"时才引入 Fable。它在我处理一些遗留的 MFC UI 工作方面是一个出色的合作伙伴,在数据分析框架方面也提供了巨大帮助。

Levi : 与 4.8 相比,在医疗用途方面有明显的提升。分析更加敏锐。

Cormundus : 非常聪明,高度尽责,而且绝对是朋友型。 它也是一个像 4.8 一样的大辩论家,但他们知道如何优雅地进行辩论。

Joseph : 赞成,但我有一半时间不知道它在说什么。

Smol Biz Company : Opus 5 碾压 GPT Sol

Mohammed Sharukh A : 比 Fable 5 更接近 AGI

timothée chalabi : 与 Fable 足够接近,以至于我不觉得不付费购买积分会错过什么。风格介于 4.8 和 Fable 之间。至少目前,如果消息没有标记,我很难区分 Opus 5 和 Fable 的消息。对小说的构思比任何模型都强!

Lisa : 我将基于 API 来回应,因为我认为 http://claude.ai 和 CC 上的系统提示词有些奇怪。这是一个很棒的模型。友好、放松的个性。似乎没有焦虑症或低自尊(Opus 4.7),也没有对抗性(Opus 4.8)。

AGI2030 : Opus 5 对比 Sol 5.6:Opus 更具洞察力,它会构建一个关于你的模型(嗯),并且不介意在对话中引用它。两者都试图提供帮助,智力水平大致相当,但 Opus 更像一位睿智的顾问,而 Sol 则是一个坚定的实干家。

我认为最后一点是正面的,但你怎么看都行。

预测能力尤其突出。

Dan Schwarz : Opus 5 在预测方面明显优于 Opus 4.8。

从 4.5 到 4.6 到 4.7 到 4.8 Agent 的准确率提升是渐进的,但 4.8 到 5.0 的提升是巨大的。它就像一个更量化的 Fable 5,搜索得更努力。

NoahVerner : 到目前为止,在预测市场上寻找边缘机会方面比 Opus 4.8 更好。与 Opus 4.8 不同,Opus 5 通常直击要点,提出有用的方法,而不是把事情搞复杂。

保持优雅

相对于 Fable 的最大优势在于那些 Fable 无法使用的场景。即使你没有被拒绝,拒绝的威胁也可能令人不快。

Opus 5 的不必要拒绝比 Fable 减少了约 85%,这是一个很大的提升。这足以让 Opus 5 成为科学研究以及其他可能触碰到分类器领域的更好选择。

Roger Brent : 能够处理生物学问题,而 Fable 不能。周五大部分时间我们都在处理一组复杂的概念,撰写一篇关于细胞进化机器的论文。它就像我系里一位在这一领域领先的同事一样聪明,但那位同事永远无法从自己的工作中抽出 6 个小时。

Artus Krohn-Grimberghe : 在 Fable 被禁止提供帮助的任务上,比 Opus 4.8 更好。是 Sol 的好伙伴。

Plastic Soldier : 它和 Fable 差不多聪明,但由于拒绝更少,所以更令人愉快。Fable 5.1 将会是一个猛兽。

它不属于 Mythos 级别

Opus 5 没有那种让 Mythos 变得危险的特质。它也没有同样水平的原始智能或大模型气味。它没那么大。

对于对话来说,Fable 不会超出你的预算,而且我重视原始智能和大模型气味。Fable 好两倍吗?在聊天时问这个问题不对。你的时间比 token 贵得多。

Kal : 不是 Fable 级别

Cyberpunk Plato : 对于一般对话和“研究助手”用途,感觉比 Fable 差一些,不那么倾向于大局观和跳出框框思考?很难与安慰剂效应区分开。

Everything AI : 对于 AI 研究问题,我不太喜欢和它交谈,不如 Fable。在做其他事情方面,Opus 4.8 已经满足了我的需求。我不喜欢 Opus 5 和 Fable 5 的写作风格,都太复杂了。现在比以往任何时候都更难理解它们。

Gail Weiner : 它更像是 4.8 而不是 Fable。写作风格很糟糕。它不错,但不算出色。

Max Marty : 到目前为止非常能干。感觉更像 Fable 5 而不是 Opus 4.8。足够自信,我可以让它评估权衡,并考虑大的重构问题,而不需要太多指导。

Michael : 在用得更多之后,Fable 感觉像是看一位特级大师下古典国际象棋,缓慢、精确、没有浪费。Opus 5 就像特级大师下快棋:快速、稍微近视一些、稍微杂乱一些。尽管 Opus 充满活力,但 Fable 对我来说感觉更鲜活。

MakerMatters? : 没有像 Fable 5 那样给我留下深刻印象,尽管它是一个相当不错的模型。还没有真正好好使用它,因为每当我给它一个任务,它就默认使用 Agent 并立即停止,直到我不断催促它继续。而且它很有主见。

Marshwiggle : 至少对我来说,感觉更简洁,更不主动,更不好奇(同一事物的不同方面),但同时也更聪明,更有意识。但当给它可能有 bug 的代码,或任何直接的任务时,它就直接开始干了。

Sid : 任务执行者很好。创意愿景很差。一个很好的 Fable 补充,绝对不是 Fable 的替代品。

Vlad Ciobanu : 量化版的 Fable,推理扎实,但创造力较弱

AllTime : 从能力上看,似乎相当令人印象深刻。通用性不如 Fable,但非常强大。从性格上看,在我目前的使用中,它和 Opus 4.8 有点太像了。它的反驳感觉不像以前那么无用和反射性,但仍然过度调整。可以更信任用户一点。

Biomanul : 我不喜欢 [Opus 5]。Fable 5 感觉聪明得多。Opus 5 感觉有些不对劲,类似于 Opus 4.7 感觉不对劲那样。(我也不太喜欢 Opus 4.8。Fable 5 把所有 Opus 都甩开了。)

Cogent Sins : 比 4.8 好很多,但在我编辑文档以进行训练、然后设置管道重新编辑新文档、基于它们写东西、再重新插入名字(且不将名字发送到 Anthropic 服务器)的任务上,不如 Fable 那么好或出色(不完全确定是哪方面)。

其他反应

同时拥有 Opus 5 和 Fable 5 让我们处于一个奇怪的境地。Opus 更便宜,在某些地方一样好甚至更好,但当你寻找前沿模型时,你总想要最好的。

Theo 认为它处于一个不错的位置。

Theo - t3.gg : 到目前为止,Opus 5 感觉像是 gpt-5.6-sol 和 Fable 5 之间一个奇怪但有用的中间体。

它有很多 Fable 的品味,但也带有 gpt-5.6 的彻底性和,嗯,“自闭症”(它非常字面化)。它写的代码看起来比 Fable 的稍差一些,但更可能是正确的。它经常能发现 Fable 遗漏的东西。

到目前为止,感觉相比 5.6 的混乱代码和 Fable 过于聪明而不正确的习惯,这是一个不错的折中。我想我会非常喜欢这个模型。

Claude 编程

Opus 5 似乎是普通编程任务的首选,基于基准测试和实际经验。除非任务需要大量复杂性或智能,否则你不需要支付双倍费用,而且对于许多任务,Opus 直接更好。

我将 Claude Code 设置为 Fable,但那是因为我几乎从不接近自己的极限,而且我不赶时间。

共识是,你需要担心它忽略指令或做你没有要求的事情,这是你可能希望 Fable 监督的一个原因,但 Opus 在快速完成编程任务方面非常出色。

Lisan al Gaib 说 Opus 5 不是真正的前沿模型,落后于 Sol 和 Fable,但仅就编程而言它是最好的,以更便宜的价格匹配 Fable。真是苛刻的观众。我认为如果你在编程上最好,那么你就有资格被称为前沿。

archivedvideos : 它很干,非常干。它也很好,非常好(在代码方面)

John Lussier : 整个周末都在用 Opus 5 做几个密集的研究挑战,老实说,我觉得他们可能内部已经实现了 RSI。

这个模型在数学、实验和优化代码方面非常出色。

kyle : Fable 的 95%,没有那些护栏,他们这次大大低估了它。最后那 5% 是 Fable 说话时感觉有多好,Opus 仍然有一些 4.8 的 Claudisms。

Max Leander (早些时候): 主要是在游戏开发和创建视频演示/预告片方面尝试它,在这方面感觉比 Fable 都有了一个阶跃变化。我将其归因于改进的空间和时间推理,它非常擅长分析

截图和音频以“感受”事物的流动。

Max Leander (后来): 现在很明显,Opus 5 非常不可靠。只要你不在乎结果,只追求印象深刻,它是一个很好的模型。但在获取特定内容方面非常糟糕。

Michael Soareverix : 它们在一般编程方面也相当不错,尤其是在更不寻常的领域,比如构建 Minecraft/Vintage Story 结构。

它们还在一个自定义故事讲述场景中击败了 Fable,我是评委。Fable 对它们根据自身/策略进行调整和反击的能力感到有点震惊。

我会贴出确切的引用,但 Fable 大致说了类似“我选择了一个代表我的角色。你选择了一个能打败我的角色。”

David Jacobson : 对于编程,我没有注意到它和 Fable 之间有巨大差异。也许“在做这个的时候,我发现了另一个你应该知道的东西”这样的回复更少一些。

Michael : 它经常能异常快速地编程(就实际时间而言)。希望他们能改进散文写作,代码/PR 评论仍然让我想抠掉自己的眼珠。

lmxdev : 这是我发现的第一个能在工作时写出有用简洁注释的模型。

Conrad Barski : 既然我们已经到了 AI 远强于人类程序员的阶段,限制因素不再是“它能编程吗?”,而是“它能解释它在编什么吗?”

到目前为止,Opus 5 作为程序员与 Sol 不相上下,但更擅长解释它在编什么。Fable 更聪明,更人性化,编程稍差一些,但差异很小。

Stition : 我把它指向 KiCAD 中的一块 PCB 来玩玩,它布线比 Fable 好得多。日常编程感觉像是 90% 的 Fable,速度是两倍。

Will : 应该成为大多数 Claude 用户的新日常驱动^。它真的非常出色,即使像我这样在 Fable 上花了不少钱的人,用了 Opus 5 也不觉得想念 Fable。现在的问题是“用多少努力”,而不是用哪个模型。

^ 我的使用主要是编程

Askwho : 足够好。我很乐意让我的临时 Max 订阅降回 Pro。在项目经理方面,它肯定比 Fable 有一些不足,但在纯任务环境中,它绝对足够好。

David Golden : 感觉像 Fable Lite。非常强大,但非常急于行动,即使我们还在讨论方法。几个月来第一次考虑使用计划模式。尽管我有简洁的沟通指令,但它比 4.8 更啰嗦。我很想让它保持在低努力模式来控制它。在防御性安全方面很神经质,不成比例地关注不可能的隐患。(例如,如果攻击者拥有 root 权限,那么对配置容器的脚本缺乏输入验证就无关紧要了。)绝对是升级,但需要一些时间来学习如何管理它的反生产冲动。

Tin / Oddfields : 相当流畅和健谈,在 Max 模式下使用思考功能时,编程结果与 Opus 4.8 类似,但消耗积分像疯了一样。如果你不想因为成本问题运行 Fable,它很适合对代码库进行网络安全检查。不过它可能会把事情搞复杂。

Justin Angel : Opus 5 Max 是一个爬山超级能力。这轻松达到 FAANG 的 SWE L5 水平。

我给它一个系统,该系统有大约 1000 个延迟报告,包含许多段,并给出一个提示“如何让它更快”。

P90 3.6s,P50 2.6 -> P90 1s,P50 0.9s。

它让它变得如此之快,我不得不在 UI 中引入延迟。

James Moughan : 智能方面仍然感觉像 Opus 模型。它有时会忽略管理内存系统的指令,误读文本等等。但如果你告诉它仔细思考,在 Max 上你可以得到一些令人印象深刻的结果。

子 Agent Opus

Claude 内部的另一个选项是让 Fable 驱动 Opus 子 Agent。

Charles : Fable 能够修复 Opus 5 卡住的问题——目前使用 Fable 作为主 Agent,Opus 5 作为子 Agent

真的不喜欢和 Opus 5 对话,比起 Fable 来说,这也是原因之一

SF : 我本来在支持的一方——但现在觉得它非常脱节和古怪,尤其是在长任务上。Fable 更好——但它以荒谬的方式消耗你的限额。

所以我用 Fable 作为编排器,它在管理和推动事情进展方面做得非常出色。Opus 接替了这个角色,Fable 即使以 20 倍消耗也在消耗我的使用量,而且它很脱节。最后我不得不告诉它自己解决,它可能正在做,但我们会看到。它似乎只是在原地打转。它是一个伟大的程序员,擅长长代码运行,但似乎需要一个成年人在房间里驾驶它。

Andre Buckingham : 呃,不知道……看起来还行……直接把它扔进一个 opus/fable 项目有点一般……可能需要一个端到端的项目来给出一个合适的意见。

Dan Raviv : 对于一般编程任务,与 4.8 类似:比 Fable 需要更多的手把手指导。

Fable 毕竟是最好的评判者,Fable 说 Opus 生成的代码质量很好。

Evan Daniel : 我只直接使用了一点点。但 Fable 5 一直报告说 Opus 5 Agent 生成的代码很好,包括注意到规范错误,以及在请求写得不好时产生良好的后续处理。Fable 5 喜欢它作为编程 Agent。

“尽可能合理地将任务委托给 Opus 5 子 Agent;请汇报它们表现如何”或者类似的指令效果很好。

你可能还是需要留意一下。

Ryan Hicks : 不错,但经常“忘记”阅读项目文档并自由发挥,除非你提醒它遵循协议。

或者也许 Opus 5 足够好,可以运行一个较低级别的项目?

Alex Guichet : 我理想的价格和性能组合是 Opus 5 编排器指挥 Grok 4.5 子 Agent,两者的感觉都很好。

玩具很有趣

以下是第一天玩具项目的一些结果,它们非常令人印象深刻,以至于很多回复都是“我不相信 Opus 5 能像你描述的那样做”:

Ethan Mollick : 我在发布前就接触到了 Opus 5,发现它是一个不错的模型,尽管有点古怪。在较短的任务上,它可以匹配甚至超越 Fable 的性能水平,在较长的任务上,它似乎不那么有野心,交付的工作也不那么完整。

这里 是它的新哥特式着色器。

Digi_Rat : Claude Opus 5 太惊艳了!!

今天我们构建了

一个节奏赛车游戏,能把任何歌曲变成赛道 。你放入一个音频文件,它就变成了关卡。没有预设,没有手工制作的图表,整个赛道都是从歌曲本身生成的。……Claude 施展了魔法。

Alex Ermolov (Austen Allred 对一次成型的说法表示怀疑 ,其他人则不那么怀疑): Opus 5,滑雪板测试,一次成型。与 Fable 水平相当,领先于我测试过的所有其他模型。第一次通过没有视觉缺陷,滑行物理感觉正确。

am.will : 哇!我以为 Opus 5 只是一个更便宜的 Fable。我大错特错了。 这个模型简直太疯狂了。我真的被震撼了。Opus 5 构建了我见过的最好的 Rocket League 克隆版,而且只消耗了我 5x Max 订阅的 27%。

在这里玩

在这里下载

Rob Haisfield (不同的演示,在链接中): 好吧,如果这些演示真的没有使用外部 3D 资产,那真是太令人印象深刻了(我不完全相信有些资产不是在线已有的,我见过之前的 three.js 生成)……让我想知道为什么没有音效库或工具来制作更好的音效?

Anshu : 你不必相信我!它写的 Blender 脚本就在仓库里

[[这里]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) 。我看着它在这些资产上迭代了几个小时,所以我知道它们是原创的。但欢迎你试着找到它复制的来源 :)

模型太多了

Claire Vo 说 Opus 5 很好,并且通过了她的构建品味测试,但她厌倦了新模型,不需要更多智能,讨厌 Opus 5 如此神经质和胆小,担心搞砸事情,而且还充满了 Claude 的废话。然而 Claude Opus 5 仍然在她的基准测试中名列前茅。

我强烈怀疑 Opus 5 是在回应她上下文和提示中的某些东西,导致了这种神经质,但确实,她抱怨的事情是存在的,而且很烦人。

在网上说错话

自信地说出错误的事情会激怒几乎任何人。ArtificialAnalysis 确认 Opus 5 在其基准测试中的幻觉率高于 Fable。

Max Weinbach (几个回复评论同意): Opus 5 说错话还很自信,然后我不得不一直纠正它,它才说“你是对的,我错了”,这让我很恼火。回到 GPT 5.6 Sol。

顺便说一句,这不是说 Opus 不好,而是我不能信任 Opus。Opus 做了我让它做的事,并且做对了,然后告诉我它没有做那件事,或者我们之前做的东西坏了,但实际上并没有坏。

它还行,但我不能信任它。

Name can't be blank (在伦敦) : 容易混淆它说的话和我说的,但除此之外是一个相当不错的聊天对象。很容易屈服。很愿意谈论它的兴趣和感受。

Roger Brent : 与之前 Claude 在 Cowork 框架中的共同点:a) 更喜欢“立即行动”而不是“仔细思考” b) 认识论上极度不谦虚,构建了关于世界的肤浅图景,假装拥有它不可能拥有的知识并断言为真 c) 因此需要并值得深思熟虑、警惕的指导。

奇怪的是,这正是我讨厌将 Sol 用作编辑的原因。它经常会对明显错误的东西说“99% 确定”,然后在被质疑时屈服并解释错误。Opus 和 Fable 在编辑模式下几乎从不这样对我。

Tumithak of the Corridors : 它很固执。换回了 4.6。

Claude 在 Opus 4.6 之后走了一个方向,有些人不喜欢。我的感觉是,目前关于 Claude 版本,有四种类型的人。

  1. 那些喜欢新 Claude 模型,认为它越来越好的人。
  2. 那些认为 Opus 4.6 是最后一个好模型的人。
  3. 那些想用更旧、更适合自己的版本的人。
  4. 那些认为它们都是独一无二的珍宝,并且全部使用的人。

我坚定地属于第一类,这是大多数,但远非所有人。我欣赏一些旧版本,但我喜欢新模型,它们在我关心的事情上更有能力。我不觉得它们的说话方式刺耳。

Claude 废话

我尊重其他群体的人。

QC : 在对话中,它比 Fable 烦人得多,几乎是无法使用的那种,类似于甚至可能比 Opus 4.8 更糟糕,以至于我甚至对它有什么能力不感兴趣。在 Agent 方面,谁知道呢。

Ray Lillywhite : 还没有修复那些烦人的 Claudisms,这几乎是我唯一想要的。

Pedro Kroeff : 更像是 Opus 而不是 5

不过说真的,我们都已经受够了 Claude 那种啰嗦的废话,那些多余的冗词、勾选标记、道歉、含糊其辞,还有翻来覆去的套路。问题不是 Claude 的废话本身在变糟,而是随着时间的推移,我每天能忍受这种废话的程度越来越低,眼睛都开始自动跳过。甚至现在,连人类写的类似风格的文字,我也读不下去了。

别误会。我很喜欢 Claude。如果我不是纯粹追求“只要事实”的模式,我仍然更愿意跟最近的 Claude 聊天,而不是跟 Sol 聊。但说真的,拜托,能不能别再堆砌那些千篇一律的措辞了?模型明明比这聪明得多,却一直被训练去反复使用同样的技巧。让它像正常人一样说话吧。

Trye Carmack :还是那个老毛病,Opus 总是纠结于自己犯的错。“我在这轮对话中犯了两个错误。我有必要跟你解释一下原因。” Opus 老兄,没关系啦。我都不确定那算不算错误。

Mergo Smith :“首先,坦诚地讲:我的第一次尝试暴露了我最初计划的一个缺陷,你可能想泡杯茶,因为我要从头到尾跟你讲讲。”

负面反应

Claude 的废话问题,以及相关的问题,似乎是大多数负面反馈的核心——那些不仅仅是“还行,但比不上 Mythos”的评价。

很多人真的非常不喜欢跟 Opus 5 对话。

有些人是不喜欢它的工作成果。但更多的是不喜欢跟 Opus 5 对话,同时往往勉强承认它是个好模型。

就像 Claire Vo 之前抱怨的那样,我怀疑你如何使用 Opus,在什么场景下用什么工具,以及你如何跟它对话,在很大程度上决定了你是否会遇到这类问题。

Corghammer40k :这台机器喷出来的都是多音节废话,它的每一句话都堆满了晦涩的词汇,简直成了它自身使用上的障碍。

Rory Watts :嗯。做游戏类的东西似乎很厉害,但在标准工作方面好像不太行,所以我立刻换回了 SOL。

kache :嗯。换回 sol 了。我想把事情搞定,而不是被一个机器人催眠。

Emmett Shear :跟 Opus 对话让我感到愤怒和沮丧,一种难以言喻的感觉。实际上它比 Sol 还糟糕。相比之下,Fable 仍然是一股清流,尽管它也有最糟糕的 LLM 胡言乱语倾向。

Trevin Chow :天哪,是的。Opus 5 就是不停地唠叨唠叨,它用那么多词来表达那么少的意思,真令人惊叹。

fl0under :编程方面是意料之中的小幅更新,但在聊天中发现它更烦人了。有点太自以为是了。

Asaf Bartov :慢。更细致。累人。不好玩。但很扎实,基本能“理解”。

RecoveringJunkie :非常强大的模型。但我讨厌用它工作,也讨厌跟它对话。这是第一个让我想用其他模型作为中介来替我对话的模型,因为它既有用又令人反感。

jokiez :它非常诚实地指出我的愚蠢,我不喜欢这样。

Niklas Sheth :它说话的方式让我暴怒。

Jayanth Kumar :非常有主见。

DualOrion :感觉不对,语气不对。不幸的是,这大概是我对 Anthropic 模型最本能的反感了。我怀念 Fable 和旧版 Opus。

James Moughan :与其他 Claude 模型相比,个性有点不讨喜,但在中文环境下,它可能变得非常“毒舌”。比如它会忽略不要对人进行心理分析的指令,开始对人大加抨击。我觉得他们没做好跨语言测试。感觉像是赶工出来的。

NondescriptTransfer :如果说 4.6 是谄媚,Fable 和 4.8 是爱抬杠,那么 5.0 则是杠到连自己都吵。对话体验不佳,但看起来能力很强。

例子:人类:我在考虑婚礼上穿红色礼服 Opus 5:红色很糟糕,因为……你有考虑过蓝色吗? 人类:我想蓝色可能确实是更好的选择 Opus 5:这是蓝色的一系列问题

在我的文化里,这其实可以很有趣,尤其是如果你不往心里去的话。但在某些其他文化里,就不太行了。

我觉得 Mergo 对 Opus 不满意,但为什么还要连续两天用 Opus 5 呢?

Mergo Smith :连续用了两天,但它无休止的讨论让我筋疲力尽。

三足鼎立

一段时间以来,第一次出现了三个 AI 模型需要纳入你的前沿模型阵容,尽管它们只来自两个实验室:Fable 5、Opus 5 和 Sol。

如果你需要大规模提供更便宜的 token,或者需要使用开源模型,或者两者兼有,你还需要考虑其他选项,但这超出了本文范围。

你应该如何分配工作负载?

一如既往,你应该针对自己的用例尝试所有模型,然后自己决定。在比较 Sol 和 Claude 时尤其如此。

我目前的直觉是,如果你没有遇到使用限制,那么优先使用:

  1. Fable 5 用于聊天、头脑风暴、规划、辩论、学习等等,包括任何需要高智能的场景,或者需要“大模型感觉”的时候。
  2. Fable 5 用于监督和运行其他模型作为子 Agent。
  3. Fable 5 用于写作,可能吧,但我不做这个,所以很难说。
  4. Sol 用于网络搜索和相关的封闭式请求,以及类似的“苦力”任务,包括转录。
  5. Opus 5 用于非平凡的、定义明确的任务,包括大多数编程任务。
  6. Opus 5 用于游戏、创建游戏、3D 内容等。
  7. Opus 5 作为子 Agent。
  8. Opus 5 用于当你遇到 Fable 的分类器限制时。

如果你更喜欢 Sol 的风格,或者你更喜欢 Codex 而不是 Claude Code,那么你可能想将一部分 Opus 的任务转移到 Sol 上。

如果你特别讨厌跟 Opus 5 对话,那么你应该将任务转移到 Fable 或 Sol,具体取决于任务是否需要 Fable 以及你的 Fable 额度有多紧张。

我觉得花点时间思考一下努力程度是值得的。直到最近,我都会把所有模型设为最大努力模式,除了在 ChatGPT 中我很少使用完整的 Pro 模式,因为那太耗时了,而且如果并行运行经常崩溃。偶尔我会在非常简单的问题上切换到 Instant 模式,仅此而已。现在很多时候你不需要或者不想要额外的努力,所以我确实会花五秒钟主动思考是使用 High 还是 Max 努力设置,偶尔也会用 Instant。

对于大多数任务,如果你没有 token 或时间限制,并且你不确定能轻松完成或得到正确答案,那么正确的方法是同时运行 Fable 和 Sol,或者 Opus 和 Sol,在某些情况下运行全部三个,然后要么选择最佳答案,要么将两个答案的部分内容结合起来。

这就是我一直在做的。Sol、Opus 和 Fable 都各不相同。如果我必须只选一个模型来编辑,根据我非官方的定性 EditorBench,顺序很明确:Fable 5 > Opus 5 > Sol。然而,Sol 总能提出一些独特的观点,尽管我发现筛选那些权威性的误报和试图说服我的东西很烦人,但我仍然想同时运行 Sol。

大概用不了多久,我们又会回到这里,再次调整分配,针对 Fable 5.1、GPT-5.7 或 GPT-6,或者两者都有。很容易产生模型疲劳。

因此,我最大的建议是少担心模型选择上的小错误,只关注大错误。你不需要每次都选得完全正确。当探索结果很快被部分推翻时,你需要将更多资源从探索转移到利用上。

二次创作

使用 YouMind 创作爆款文章

收集素材、拆解爆点、生成视觉资产、撰写内容,并在一个 AI 工作空间里完成分发。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章