Anthropic 刚刚发布了有史以来最强的模型,而基准测试的提升几乎是最不值得一提的部分。
Claude Fable 5.1 给人的感觉不像是一个更好的聊天机器人,更像是一种新型的操作者。它可以花数小时专注于一个问题,在计划中断时恢复,协调其他 Agent,检查自己的输出,并且无需每隔十分钟就有人来救场就能持续推进。
数据也支持这一点。在 Anthropic 发布的评估中,Fable 5.1 在 Agent 驱动的科学研究上的表现比 Fable 5 提升了一倍多,在业务自动化方面从 17.1% 跃升至 31.4%,并在 CursorBench 上达到了 73.4%。在 Anthropic 报告的大多数编码、自动化、计算机使用和知识工作测试中,它也领先于 Fable 5、Opus 5 和 GPT-5.6 Sol。
https://x.com/claudeai/status/2094848581425377479
开箱即用,它在困难编码、长周期工作、研究、规划、计算机使用以及生成完整交付物方面表现出色。但更大的机会在于,当你不再把它当作执行每个任务的个人,而是让它负责整个工作系统时,会发生什么。
这正是本课程涵盖的内容:Fable 5.1 真正与众不同之处在哪里,如何让它坐上领导者的位置,如何在其之下构建工作者,如何在不束缚它的前提下进行提示,如何使用目标和循环,以及五种可以将差异转化为实际收益的工作流程。
如果你不关心终端、Agent 文件和编排,只想把一个想法变成一个可用的应用,那我们为此构建了 Shipper。
这个模型真正擅长什么
在介绍方法之前,先认识一下这台机器。以下是让 Fable 5.1 感觉与之前模型不同的五种能力。
它能在超长运行中保持连贯性
交给它一个需要数小时的工作,它中途偏离主题的可能性要小得多。
一位早期测试者报告了一次无人值守的 38 小时机器学习运行,期间 Fable 诊断出一个早期的不良结果,进行了纠正,并行启动了六个实验,并带着发现和后续步骤返回。另一位测试者说,它自己保存记录,在条件变化时重新确定优先级,并从中断的地方恢复。
100 万 token 的上下文窗口 有所帮助,但上下文大小并不是真正的升级。真正的升级在于,模型能够在该上下文中持续做出有用的决策,而不仅仅是记住信息的存在。
它寻找根本原因,而不是最快的补丁
以前的 Agent 经常找到第一个能让错误消失的修复方法。Fable 5.1 更愿意继续深挖,直到理解错误存在的原因。
在 Anthropic 的发布测试中,Millennium 给了它一个大约在百万次运行中才会出现一次的崩溃,这个崩溃在四到五年内都未能解释。Fable 5.1 拆解了一个外部库,将其与核心转储联系起来,并将崩溃追溯到了实际的 bug。他们尝试过的所有其他模型,包括 Fable 5,都未能发现。
这远不止于调试。同样的直觉也体现在研究、策略、财务分析和运营中:当底层系统出错时,不要优化症状。
它能看、能行动、能验证
Fable 5.1 可以检查截图、图表、PDF、界面和文档,然后利用它所看到的内容来指导下一步行动。
这意味着它可以根据参考重建界面,读取隐藏在财务文档中的数字,操作浏览器,将其实现与原始设计进行比较,并在声称工作完成之前捕获视觉问题。
在 Anthropic 的测试中,它的 OSWorld 计算机使用得分超过了 Fable 5 和 Opus 5。更重要的是,该模型越来越能够将视觉作为验证循环的一部分,而不仅仅是描述你给它的图像。
它返回的是工作成果,而不是关于工作的长篇大论
给它一个文件夹的文档,要求一份投资备忘录、一个演示文稿、一个工作原型或一份分析报告,它更有可能直接返回成果本身。
早期测试者报告了 Anthropic 迄今为止最好的 PowerPoint 结果,对财务文档更强的引用召回,更简洁的合同修订,以及更好地完成复杂的多部分请求。一位 MongoDB 工程师描述了一个为期三天的原型运行,其中模型研究了现有服务,设计了系统,以无人值守的方式分阶段实现,并返回了带有每个阶段工作证据的可视化演示。
实际的区别很简单:你花在将答案转换为可用工作上的时间更少了。
它天生就是领导者
Fable 5.1 在决定下一步该做什么时最有价值。
Claude Code 已经可以给它提供子 Agent、后台会话、Agent 团队、动态工作流、目标、循环、浏览器、终端和项目文件。Fable 拥有足够的规划深度和上下文,能够比早期模型更长时间地将这些部分指向同一个终点线。
这就是为什么下面的设置有效,也是为什么本课程从让 Fable 离开工作者席位开始。
驾驶舱:你真正需要的所有控制
在做其他事情之前,先更新 Claude Code。根据当前的模型配置文档,版本 2.1.255 或更高版本会使 fable 别名解析为 Fable 5.1,并且最近的版本包含了下面使用的 goal、loop、background-agent 和 effort 控制。
然后选择模型和努力级别:
/model fable
/effort high
对于实质性工作,High 是合理的默认设置。对于更便宜、更快速的运行,可以降到 medium。只有当问题足够困难,值得更多思考时,才使用 xhigh 或 max。Fable 的适应性思考始终开启,所以 effort 是重要的控制项。
其余的控制很简单:
/plan 或 Shift+Tab:在修改文件前,让它检查并规划
/goal:持续工作,直到满足一个可测试的条件,跨多个回合
/loop:在会话保持活跃期间,按计划重复运行一个提示
/tasks:查看后台工作者在做什么
/context:查看什么在消耗上下文窗口
这就是驾驶舱。
本课程的其余部分是知道何时以及使用哪个控制项。
主菜:让 Fable 成为领导者,而非工作者
最大的单一升级是角色转变。
停止把每个键盘任务都交给 Fable。让它定义工作,将其分解为清晰的任务线,将这些任务线发送给更便宜的 Agent,并判断返回的结果。
设置如下:
Fable 制定计划:
将其置于计划模式,让它在提出更改之前检查项目。如果请求仍然模糊,使用 Matt Pocock 的
技能集合 来审视想法,将对话转化为规范,并将规范拆分为任务项。
Fable 委派独立的工作:
实现工作交给 Opus 或 Sonnet 子 Agent,每个工作者拥有一个边界清晰的任务线。如果你已经在使用 Codex,它也可以作为另一个工作者,但它应遵循相同的文件边界和证据规则。
一个独立的 Agent 进行验证:
工作者不给自己打分。一个全新的验证者阅读计划,检查差异,运行检查,要么通过阶段,要么带着具体的失败原因返回。
你在检查点进行引导:
批准计划,审查重要的权衡,并在最后检查证据。你不需要监视每个命令。
为什么这样有效:昂贵的模型将其 token 用于架构、优先级排序、恢复和判断。更便宜的模型将其 token 用于有边界的执行。
只有当任务线真正独立时,这种经济性才有效。根据 Anthropic 当前的 API 定价,Fable 5.1 每百万输入 token 成本为 10 美元,每百万输出 token 成本为 50 美元,而 Opus 5 是其一半,Sonnet 5 是其五分之一。Fable 5.1 还将缓存读取成本降至每百万 token 0.25 美元,这使得具有稳定项目上下文的长会话更加实用。
不要为了场面而并行化。五个 Agent 编辑相同的文件会产生五张账单和一个合并问题。并行化研究、独立模块、测试、文档以及其他可以独立完成而无需相互等待的任务线。
构建你的工作者
领导者需要一个小的团队,而一个自定义工作者只是一个位于 .claude/agents/ 目录下的 Markdown 文件。
从一个实现工作者开始:
name: implementation-worker
description: 实现已批准计划中的一个独立阶段。仅当该阶段拥有不同的文件时使用。
model: opus
tools: Read, Grep, Glob, Edit, Write, Bash
maxTurns: 25
你只拥有分配给你的阶段。
在编辑之前,确定你任务线中的确切文件和验收标准。
不要更改其他工作者拥有的文件。
实现最小的完整解决方案,然后运行相关测试。
返回:
- 更改的文件
- 运行的检查及其实际输出
- 任何仍不确定的事项
没有本次运行的证据,不要声明成功。
然后创建最重要的工作者,即验证者:
name: verifier
description: 独立验证一个已完成阶段是否符合其计划和验收标准。在每个实现阶段之后使用。
model: opus
tools: Read, Grep, Glob, Bash
maxTurns: 15
将实现摘要视为不可信的声明。
阅读计划并检查实际的差异。亲自运行相关测试。
检查正确性、回归、范围以及每个验收标准。
返回 PASS 或 FAIL。
对于每个失败,包括证据和所需的最小修正。
永远不要修改你正在评分的实现。
新的眼光能发现作者习以为常的问题。立即检查的阶段,比在四个后续阶段依赖它之后才发现缺陷要便宜得多。
四条规则保持团队高效:
一个工作者,一条任务线,具有明确的文件所有权
仅当任务线不相互依赖时才并行工作
Fable 保持在领导者席位,而 Opus 或 Sonnet 处理劳动
每个完成声明都要对照文件、测试或实际结果进行检查
秘诀 1:不要规定路线
大多数提示建议都是为了阻止较弱的模型偏离方向而编写的。
当模型无法规划时,冗长的程序、僵化的步骤列表和庞大的规则块会有所帮助。对于 Fable 5.1,同样的脚手架可能会迫使它走上一条比它自己找到的更差的道路。
诀窍在于对目的地严格,对路线宽松。
给它四样东西:
结果:
工作完成时必须存在什么
约束:
它不能破坏、花费、暴露或改变什么
原因:
这是为谁准备的,结果必须支持什么决策或任务
证据:
什么可观察的证据将被视为完成
最后一点改变了一切。“让结账功能正常工作”会引发一个看似合理的声明。“在沙盒中完成一次测试购买并显示生成的订单行”则给了模型一个它无法用言语绕过的终点线。
不要要求它展示隐藏的思维链。要求它提供计划、重要决策、证据和剩余的不确定性。Fable 的思考始终是开启的。对你来说重要的是结果是否能经得起检查。
并且不要一直提醒它预算正在消失。相反,将边界放入系统中:限制工作者的轮次,定义允许的花费,并告诉它在达到限制时该怎么做。
秘诀 2:保持 CLAUDE.md 精简
CLAUDE.md 在每个 Claude Code 会话开始时加载。这使它很有用,但也意味着每一行不相关的内容都会增加未来每个任务的负担。
Anthropic 现在建议将每个文件保持在 200 行以下。实际上,你的文件通常可以短得多。
三个部分涵盖了大多数项目:
这个项目是什么:
产品、架构和重要的边界
如何验证工作:
用于构建、测试、lint 和本地预览的命令
它反复出错的地方:
项目特定的约定和反复出现的错误
仅在某些时候有用的程序属于技能。仅适用于某些文件的规则属于路径作用域规则。历史记录属于文档,而不是每个会话的提示。
今晚打开你的 CLAUDE.md 并挑战每一行:如果删除它不会导致真正的错误,就删除它。
更精简的文件通常是更强的文件。
秘诀 3:善用目标和循环
这是 Fable 从对话转变为可以在你做其他事情时持续推进的过程的地方。
目标: /goal 为会话提供一个可测试的完成条件。每个回合后,一个独立的小模型会检查条件是否满足。如果不满足,Fable 会开始另一个回合,而不是将控制权交还给你。目标在以下情况下结束:通过、变得不可能、遇到不可恢复的错误,或者你清除它。
技巧在于编写一个它无法伪造的终点线:
要求可观察的证据:“所有认证测试通过且输出已附加”比“修复认证”更强
定义失败路径:如果真正的阻碍使目标无法实现,则报告阻碍和证据,而不是编造进展
限制风险部分:对工作者使用 maxTurns,对付费服务使用支出限制,并围绕部署或生产数据设置明确的边界
在每个简报中保留一条诚实规则:每个进展声明必须指向在此次运行中产生或检查的结果
仅在你愿意让其无人看管的边界内以自动模式运行目标。当简报错误时,更智能的 Agent 具有更大的破坏半径。
循环: /loop 按间隔重复运行一个提示。使用 /loop 15m check the deployment and investigate any failure 来设置固定节奏,或者省略间隔让 Claude 自行决定何时再次检查。
Claude Code 内的循环是会话作用域的,最终会过期。将它们用于构建、拉取请求、迁移和临时监控。对于需要在会话或机器关闭后继续存在的工作,请使用持久例程或桌面计划任务。
在目标和循环之间,你可以让 Fable 工作真正需要的时间,最后等待你的是证据,而不是另一个自信的段落。
如何一次性完成一个真实项目
现在围绕一个构建来组装整个系统。
示例是一个带有有效等待列表的着陆页。替换项目,同样的序列适用。
步骤 1,编写简报
发送一条消息:
我正在为 [受众] 推出 [产品]。他们需要一个能做出一个明确承诺并捕获
[电子邮件] 的着陆页。构建 一个响应式页面,带有一个能存储注册信息的有效表单。约束:没有需要我照看的框架,没有付费依赖,移动端快速,并且在我批准之前不部署。完成意味着页面在本地运行,测试邮件出现在存储中,移动端布局在 390px 下得到验证,并且结果通过测试输出和截图展示。先检查项目并制定计划。仅委派独立阶段。验证每个完成的阶段。
简报给了它一个目的地,而没有替它设计实现方案。
步骤 2,批准计划
在它更改任何内容之前,使用 /plan 或 Shift+Tab 进入计划模式。
如果想法不够具体,使用 /plugin install mattpocock-skills 安装 Matt Pocock 的集合,运行 /setup-matt-pocock-skills 一次,并使用 /grill-with-docs 将结果转化为规范。
阅读计划。删减你不需要的功能。确保每个阶段都有一个可观察的通过条件。然后批准它。
步骤 3,让团队工作
Fable 将第一个独立阶段分配给实现工作者。验证者检查实际的差异和测试输出。一个依赖阶段仅在前一个阶段通过后才开始。
你可以离开终端。当你想要查看仍在运行什么时,使用 /tasks。
步骤 4,设置终点线
使用一个命名状态和证据的目标:
/goal the page runs locally, the form stores a test signup, and the layout works at 390px, proven by the real test output, the stored record, and a current screenshot. If a genuine blocker makes this impossible, stop and report the evidence instead of claiming success.
这个条件仅靠言语更难满足。
步骤 5,审查结果
回来查看差异、测试输出、存储的注册信息和截图。
像用户一样审查产品,而不是像模型的经理。要求你实际能看到的更改,运行最后一次独立的验证,当证据与简报匹配时发布。
第一次运行会感觉复杂。
第二次,你会注意到相同的序列几乎适用于你一直在推迟的每个项目。
五个能真正赚钱的工作流程
现在将设置指向足够有价值的工作,以证明模型的成本是合理的。
以下是 Fable 5.1 可以创造可衡量差异的五个工作流程。
没人想要的代码库工作: 估计需要三周的迁移、罕见的生成故障、分布在八个服务中的性能问题。Fable 映射系统,工作者处理独立的切片,验证者检查每个阶段,进展与测试挂钩而非乐观估计。
决策级研究: 输入一个问题,研究工作者并行从主要来源收集信息,一个持怀疑态度的审查者攻击每个重要声明,领导者将幸存下来的内容转化为备忘录。这可以为收购、发布、市场决策或投资论点提供信息。
业务运营: 给它正确的工具访问权限,让它对账数据、调查异常、准备报告、监控流程或处理运营积压。Fable 5.1 在 Anthropic 的 AutomationBench 上的得分几乎比 Fable 5 翻了一番,这是该版本中最清晰的实际飞跃之一。
参考驱动的产品工作: 给它你想要体验的截图、实际资产和正在运行的应用的访问权限。它可以对照参考实现,打开结果,比较两者,并持续到可见差距消失。你提供品味。它提供眼睛、双手和耐心。
一个复合知识系统: 将公司里所有值得保存的东西指向它,让它将分散的文档转化为一个维护良好、相互关联的真相来源。文案可以从优秀的销售页面构建一个,代理机构可以从其案例研究中构建一个,SaaS 公司可以从客户通话、决策、实验和支持历史中构建一个。每个未来的 Agent 都因为有用的上下文已经存在而变得更聪明。
这些曾经都是“某天”项目。
Fable 5.1 使其中许多成为“本周”项目,前提是你给系统一个真正的终点线和一种证明它已跨越终点线的方法。
整个设置在一个区块中
让 Fable 5.1 作为领导者运行:它规划、委派、审查和决策
对有限劳动使用 Opus 或 Sonnet,每个独立任务线一个工作者
给它结果、约束、原因和证据,然后让它选择路线
保持 CLAUDE.md 简短,并将偶尔使用的程序移到技能中
使用目标进行可验证的完成,使用循环进行计划检查
通过努力级别、更便宜的工作者、缓存的上下文和硬边界来控制成本
将系统指向代码库、研究、运营、产品工作和能够产生复合效应的知识
模型是设置中最显眼的部分,但它不是全部优势。
优势在于给一个如此强大的模型一个清晰的目的地、一个称职的团队、接触现实的能力,以及无法将令人信服的答案与完成的工作混淆的机制。





