Claude Fable 5.1 完全指南:演进、Token 节省与技能构建

@MakeAI_CEO
日语2026年9月01日
253K
312
25
3
701

TL;DR

本指南探讨了 Claude Fable 5.1 在长时 Agent 任务中的优势,详细介绍了其自适应思维(Adaptive Thinking)功能、节省成本的缓存策略,以及如何为复杂内容和代码生产构建强大的技能。

进化、Token 节省、提示词、框架与技能构建

2026 年 9 月 1 日,Anthropic 发布了 "Claude Fable 5.1"。截至我撰写本文的 2026 年 9 月 2 日,发布仅过去一天。因此,与其整理社交媒体上的主观评论,我将基于 Anthropic 的官方文档、API 文档以及最新的 Claude Code 规范来组织信息。

先给你结论:Fable 5.1 不仅仅是一个"回答问题稍微聪明一点的模型"。

它的本质在于,能够处理跨越数小时甚至数天的任务,而不会偏离目标;能够深入挖掘根本原因,而非停留在表面问题;并且能够验证自己的输出,直到最后一步。

然而,它的价格是 Opus 5 的两倍,Sonnet 5 的五倍。此外,内部思考无法关闭。如果你把所有事情都丢给 Fable 5.1,你会在真正发挥其能力之前,就耗尽使用配额和预算。

掌握 Fable 5.1 的关键,不仅仅是写出好的提示词。

而是 设计将哪些具体任务分配给 Fable,加载哪些信息,以及将哪些流程卸载给更便宜的模型或脚本。

第一部分:Claude Fable 5.1 完整解读

1. 什么是 Claude Fable 5.1?

Claude Fable 5.1 被定位为 Anthropic 向公众发布的能力最强的模型。

Fable 5.1 和仅限邀请使用的 Claude Mythos 5.1 本质上是同一个模型。区别主要在于安全措施。公开版本的 Fable 包含了强大的分类器,用于检测网络安全、生命科学和化学等高风险领域。而 Mythos 则供经过审查的组织用于防御性研究等目的。(Anthropic

主要规格如下:

项目

Claude Fable 5.1

发布日期

2026 年 9 月 1 日

API 模型 ID

claude-fable-5-1

上下文窗口

100 万 Token

最大输出

128,000 Token

标准输入价格

每 100 万 Token 10 美元

标准输出价格

每 100 万 Token 50 美元

缓存读取价格

每 100 万 Token 0.25 美元

思考方式

自适应思考,始终开启

标准努力程度

high

知识截止日期

2026 年 6 月

相对速度

比 Opus 5 慢

主要可用性

Claude API、Bedrock、Google Cloud、Microsoft Foundry 等

对于个人 Claude 用户,Pro、Max、Team 和 Enterprise 用户均可使用。在 API 上,无需特殊筛选即可向普通客户提供。(Claude Platform

一个 100 万 Token 的上下文,简单计算一下,可以一次性处理几本到十几本书、庞大的代码库或长时间的对话历史。

然而,"能容纳 100 万 Token" 与 "你应该放入 100 万 Token" 是两回事。

你塞入的不相关文件、旧对话和冗长日志越多,重要信息就越容易被淹没。虽然 Fable 5.1 可以处理海量上下文,但它不会自动为你中和不相关的上下文。

2. Fable 5.1 的进化在于"工作更长时间"

Fable 5.1 最显著的进化并非单次响应的准确性,而是其在 长时间 Agent 任务中保持一致性 的能力。

通用 AI Agent 在任务变长时,往往会导致以下问题:

  • 忘记初始目标。
  • 只进行症状修复,而不调查原因。
  • 重复读取相同的文件或网页。
  • 中途随意缩小工作范围。
  • 宣称"接下来进行测试",然后直接结束。
  • 进行大规模更改,但未能执行最终的操作检查。

Fable 5.1 着重改进了这些在长时间工作中出现的故障。官方描述将跨越数小时到数天的编码、浏览器操作、研究以及文档/电子表格/幻灯片创建列为主要用例。它被设计为能够从失败的步骤中恢复,重新确定优先级,并在维护自身工作日志的同时继续推进。(Anthropic

早期采用的公司报告了以下案例:

在 MongoDB,它据说调查了服务代码和文档以创建新设计,通过数小时的自主执行,在大约三天内完成了一个复杂的原型。在 Ramp,它在一个机器学习问题上连续运行了 38 小时,发现了过去结果中的标注问题,并在修复后并行执行了六个实验。(Anthropic

此外,在 Millennium 的一个案例中,据报道,对于一个百万分之一概率发生的崩溃,该模型反汇编了外部库,与核心转储进行交叉引用,并找到了一个多年来未被发现的根本原因。虽然这些是官方页面上的客户案例,并非由独立机构复现的结果,但它们清晰地表明了 Fable 5.1 的目标方向。(Anthropic

简而言之,Fable 5.1 与其说是一个"能写很多代码的 AI",不如说是一个:

负责任的项目负责人,能够隔离难题,收集必要信息,尝试多种方法,验证证据,并最终整理结果。

3. 基准测试提升了什么?

根据 Anthropic 发布的主要分数,Fable 5.1 在长期 Agent、科学研究和业务自动化方面取得了显著增长。

在衡量科学终端任务的 Terminal-Bench-Science 0.1 中,它从 Fable 5 的 24.7% 上升到 52.6%。在衡量通用 Agent 编码的 Terminal-Bench 4.0 中,它得分为 55.8%,而 Fable 5 为 42.0%。具有不同安全限制的 Mythos 5.1 得分为 60.9%。

在衡量业务自动化的 AutomationBench 中,它从 Fable 5 的 17.1% 上升到 31.4%。在 CursorBench 3.2 中,Fable 5.1 得分为 73.4%,而 Fable 5 为 70.5%,Opus 5 为 70.0%。

此外,在衡量多领域高级推理能力的 Humanity's Last Exam 中,它在无工具情况下得分为 60.9%,有工具情况下得分为 65.0%。(Anthropic

然而,在解读这些数字时需要谨慎。

这些是 Anthropic 发布的评估结果。此外,Fable 启用了生产安全分类器;在分类器介入的问题中,它可能得零分,或者流程可能转移到另一个模型。因此,Fable 和 Mythos 之间的差异可能包括安全设置差异,而不仅仅是纯粹的模型能力差异。(Anthropic

另外,在发布后第二天的阶段,比在基准测试中排名第一更重要的是你实际工作中的"任务完成率"。

例如,在文章制作中,仅凭文本评估是不够的:

  • 它能否根据原始来源核实事实?
  • 它是否遵循了指定的字符数?
  • 它是否删除了冗余和矛盾之处?
  • 它是否区分了引用和总结?
  • 从标题到结论是否一致?

除非你准备好这样的实际评估,否则使用昂贵的 Fable 可能只会让它长时间思考,而不会带来更好的结果。

4. 自适应思考现已始终开启

在 Fable 5.1 中,自适应思考始终开启。

与之前的模型不同,思考无法完全禁用。在 API 中指定 thinking: {type: "disabled"} 将导致错误。人类指定固定思考 Token 数量的方法也不可用;模型本身会根据问题调整思考量。(Claude Platform

用户可以调整的是"努力程度"。

有五个可用级别:

  • low
  • medium
  • high
  • xhigh
  • max

默认值为 high。

官方建议从 high 开始,然后根据实际评估结果降低或提高。对于常规处理,使用 medium 或 low;仅对非常困难的设计、调试、研究或长期 Agent 工作使用 xhigh 或 max。

据说 Fable 5.1 即使在 medium 级别也能产生接近旧版 Fable 5 的性能,而在 low 级别,对于某些工作,其每任务的性价比可能高于以 high 努力程度运行较小的模型。(Claude Platform

这里重要的一点是,内部思考也会作为输出 Token 计费,并消耗 max_tokens。

例如,即使最终显示在屏幕上的稿件是 10,000 个 Token,如果它事先使用了相当于 10,000 个 Token 进行思考,那么总共 20,000 个 Token 将按输出端计费。由于 Fable 的输出单价是每 100 万 Token 50 美元,不必要地使用 max 会迅速增加消耗。(Claude Platform

Fable 5.1 不是一个"努力程度越高,收益越大"的模型。

对文本格式化或摘要使用 max,可能只会增加模型在内部起草草稿,然后在响应字段中再次编写的次数。Anthropic 也建议,对于长篇幅交付物,原则上使用 high,只有在能够衡量质量提升时,才升级到 xhigh 或以上。(Claude Platform

5. 价格高昂,但缓存极其便宜

Fable 5.1 的标准费率是每 100 万输入 Token 10 美元,每 100 万输出 Token 50 美元。

由于 Opus 5 是 5 美元/25 美元,Sonnet 5 是 2 美元/10 美元,就简单的 Token 定价而言,Fable 是 Opus 的两倍,Sonnet 的五倍。(Claude Platform Docs

另一方面,Fable 5.1 的一个重大变化是缓存读取价格。

在 Fable 5 中,它是每 100 万 Token 1 美元,而在 Fable 5.1 中变成了 0.25 美元。这是正常输入价格的 2.5%。Anthropic 估计,在典型处理中,这将比旧版 Fable 降低约 25% 的成本,而对于重复读取缓存的 Agent 处理,成本降低幅度可达约 45%。(Anthropic

例如,如果你每次读取 100,000 个 Token 的固定上下文,按正常输入费率每次花费 0.10 美元,但如果缓存命中,则仅需 0.0025 美元。

换句话说,以稳定形式重复读取相同项目描述、工具定义、代码库前提和对话历史的工作更具优势。

相反,每次重写系统提示词、重新排序工具列表、或删除并重建旧对话的使用方式会破坏缓存。

在 Fable 5.1 中,不破坏缓存的提示词结构 比巧妙的提示词更能直接关联到成本。

6. Fable 5.1 可能会破坏现有的 API 框架

仅将模型名称从 Fable 5 或 Opus 更改时,有三个点需要特别小心:

无法强制调用工具

在 tool_choice 中强制使用 any 或特定工具名称将导致 400 错误。

原因是强制调用工具会导致模型跳过正常的思考过程,并在工具参数内部开始思考,这会降低参数质量。

相反,请使用 tool_choice: auto,并在提示词中明确说明"请为此流程使用 XX 工具"。如果你想保证 JSON 格式,请使用 strict: true 或 Structured Outputs。(Claude Platform

对话历史不得中途重写

Fable 5.1 中的思考块与生成该思考时的系统提示词、工具和过往消息绑定。

如果你中途删除旧消息、重新生成系统提示词或重写过去的工具定义,后续的思考块将变得无效。对于新账户,已应用一种机制,使这种条件违规成为错误。(Claude Platform

基本原则是 不要编辑历史,只追加到末尾。

临时指令应作为回合作用域的系统消息添加,长上下文应使用服务器端压缩或上下文编辑来组织。

回退到更便宜的模型时,无法携带内部思考

Fable 5.1 可以读取由先前模型(如 Opus 5、Fable 5 或 Sonnet)创建的思考块。

然而,反向操作是不可能的。如果你将由 Fable 5.1 创建的思考块传递给 Opus 或 Sonnet,这些模型无法读取它。(Claude Platform Docs

因此,如果你在同一对话中切换模型,以下顺序通常是安全的:

用便宜模型探索 → 升级到 Fable

如果你从 Fable 回退到更便宜的模型,你必须将决策、未解决的问题、必要文件和验证结果作为明确的交接文档留下,而不能依赖思考块。

7. 安全限制与数据保留

在 Fable 5.1 中,某些关于网络安全或生命科学的请求会受到安全分类器的限制。

在标准 Claude 应用中,相应的流程可能会自动路由到 Opus 4.8 或 Opus 5。在 API 中,你需要设置回退设置。切换到其他模型的流程不会按 Fable 费率计费。(Anthropic

此外,Fable 5.1 通常需要 30 天的数据保留。除非你已获得 Anthropic 的明确许可,否则不能在标准的零数据保留环境中使用。

在处理公司机密代码、客户信息或未发表的研究材料时,你应该在确认合同和保留条件后引入它,而不是仅仅因为"性能高"就使用。(Claude Platform

8. 最终,谁需要 Fable 5.1?

Fable 5.1 适用于那些 整个工作的完成率(而非单次模型响应)是价值所在的人。

  • 大规模代码库的调查与修改。
  • 难以复现的 Bug 的根本原因分析。
  • 跨越数十份文档的研究。
  • 从研究到创建电子表格、文档和幻灯片的任务。
  • 长时间的浏览器操作或积压任务处理。
  • 自主规划并执行多个实验的研究。

相反,对于创建电子邮件、简短摘要、简单代码生成、日常文档整理或起草社交媒体帖子,几乎不需要使用 Fable。

Anthropic 本身建议从 Opus 5 开始常规处理,只有在即使以 high 努力程度运行 Opus 质量仍不足时,才升级到 Fable。(Claude Platform Docs

Fable 5.1 不是"每个人都从一开始就使用的标准模型",而是用于突破难点的顶级模型。

第二部分:Token 节省、提示词、框架与技能构建

1. Fable 5.1 的 Token 节省技巧

节省技巧 1:不要让 Fable 从头到尾做所有探索

最有效的节省方法不是写短句子。

而是 减少调用 Fable 本身的次数。

将获取文件列表、过滤日志、分类材料、简单摘要和格式转换留给 Sonnet、Haiku 或常规脚本。

在以下阶段使用 Fable:

  • 决定研究策略
  • 从几个假设中选择最有希望的
  • 整合矛盾信息
  • 识别根本原因
  • 审计最终交付物
  • 重新检查其他模型失败的问题

官方文档也指导使用多模型配置,以廉价模型作为执行者,高端模型作为顾问或监督者。(Claude Platform Docs

节省技巧 2:为每个步骤更改努力程度

你不需要将整个会话设置为 max。

我建议以下分配:

流程

努力程度

文件探索 / 信息组织

low 或 medium

常规实现 / 稿件创作

medium 或 high

设计 / 原因分析 / 整合

high

最终攻克难题

xhigh

失败成本极高的最终验证

max(仅在必要时)

Fable 5.1 还提供了一种在对话期间更改努力程度的机制。与其重写顶层设置,不如将努力程度更改作为系统消息中途添加,这样可以维护提示词缓存。(Claude Platform

正确的方法不是"始终最大能力",而是 "仅在困难步骤使用最大能力。"

节省技巧 3:保持历史仅追加以保护缓存

在 Fable 5.1 中,保持以下内容固定:

  • 系统提示词
  • 工具定义和顺序
  • 项目通用规则
  • 过往消息
  • 思考块

将所有更改追加到末尾。

如果你正在构建自己的 API,维护相同的逐字节前缀比每次重新组装系统提示词更安全。

在 Claude Code 中,缓存处理基本上是自动化的,但你可以在 API 中使用 cache_control。对于多轮对话,使用自动缓存;对于分离长固定材料,使用显式缓存边界。(Claude

节省技巧 4:不要直接传入工具输出

将 10,000 行日志交给 Claude 并要求它"找出错误"是浪费的。

先用脚本或钩子过滤它们。

Claude Code 的官方成本指南也建议使用钩子预处理长日志,只将必要的几百行传递给模型。它还解释说,在可用时使用像 gh、aws 或 gcloud 这样的 CLI,比连接大量 MCP 服务器更容易抑制工具定义的上下文消耗。(Claude

在让 AI 读取之前,先用机器剪掉可以剪掉的内容。

节省技巧 5:分组独立工具调用

当读取五个文件时,如果你将其拆分为每次一个文件的五次轮次,每次都会发送对话历史。

在 Fable 5.1 中包含以下指令是有效的:

"在内部组织必要信息,并在同一轮次内并行执行不依赖彼此结果的读取、搜索和验证。"

Anthropic 也解释说,通过鼓励在单次响应中分组独立工具调用,可以减少往返次数、Token 和等待时间。(Claude Platform

节省技巧 6:不要为小修复重写整个文件

Fable 5.1 可能会为了小改动而重写整个文件。

在你的通用规则中包含这句话:

"如果最终结果不变,不要重写整个文件;仅以最小差异编辑必要部分。"

这对于长 Markdown、JSON、配置文件、LP 和庞大的源代码特别有效。通过防止完全重新生成,可以抑制输出 Token 和差异验证的负担。(Claude Platform

节省技巧 7:不要在同一个会话中继续不相关的工作

在 Claude Code 中,当转向不相关的工作时,使用 /clear

在长对话中,即使添加一个简短的问题,也意味着要再次处理过去的对话、读取过的文件和工具结果。即使缓存有效,也不是免费的。

如果你不想用临时问题污染历史,请使用 /btw;如果你想只保留必要内容,请使用 /compact。将代码库探索卸载给子 Agent,只将摘要返回给主对话。(Claude

2. Fable 5.1 的实用提示词

对于 Fable 5.1,清晰地传递目标、范围、完成条件和验证方法,比指定几十个详细的思考步骤更有效。

以下是一个基本模板,可适用于编码、研究、文章制作和文档创建。

角色

你是负责将此请求执行到底的人。

你不仅负责回答,还负责必要的研究、工作、验证和修正。

目标

[写下要创建的最终产品或要解决的问题]

输入

[写下文件、URL、材料和前提条件]

范围

需要实施:

  • [强制任务]
  • [强制任务]

不需要实施:

  • [范围之外]
  • [你不想被随意更改的内容]

完成条件

当满足以下所有条件时,任务完成:

  1. [功能/内容的条件]
  2. [格式/字符数/质量的条件]
  3. [验证方法]
  4. [显示没有错误的证据]

执行规则

  • 首先,组织必要信息和依赖关系。
  • 并行执行不依赖彼此结果的搜索、读取和验证。
  • 在请求范围内推进可逆工作,无需中途请求许可。
  • 在修复之前确认原因,而不仅仅是问题的症状。
  • 不要执行未请求的功能添加、优化或外围修复;将其作为建议在末尾分离。
  • 尽可能以最小差异编辑文件。
  • 工作完成后,根据初始完成条件进行验证。
  • 如果验证失败,调查原因,修复它,并再次验证。
  • 不要以写下"接下来做什么"结束;执行那项工作。
  • 仅对破坏性操作或重大规格变更在执行前进行确认。

最终报告

最后,按以下顺序简要报告:

  1. 完成了什么
  2. 所做的更改
  3. 验证结果和证据
  4. 剩余问题
  5. 注意到但超出范围的改进候选

Fable 5.1 可以长时间持续工作,但如果完成条件不明确,它会进行超出必要范围的探索。

因此,编写完成和停止条件 比说"深入思考"更重要。

3. 利用 Fable 5.1 的框架设计

框架是围绕模型的工作机制。

你从外部决定传递什么信息、使用什么工具、按什么顺序进行、在哪里验证、以及在失败时重试多少次,而不是仅仅依赖模型的能力。

我推荐以下 6 层结构:

第 1 层:通用规则

在 CLAUDE.md 中,仅放置每次需要的项目事实。

项目

  • 此仓库用于 XX 服务
  • 生产环境是 XX
  • 使用 pnpm 进行包管理

必要检查

  • 更改后运行 pnpm lint
  • 更改后运行 pnpm test
  • API 更改时进行类型检查

约束

  • 不要破坏现有 API 的兼容性
  • 不要将秘密信息输出到日志
  • 不要重构请求范围之外的内容

由于 CLAUDE.md 在每个会话中都会被读取,内容过长会持续消耗上下文。官方文档建议将单个文件控制在 200 行以内,并将长流程移至 Skills 中。(Claude

第二层:路由器

收到请求后,先对工作进行分类,而不是立即启动 Fable。

  • 简单的提取/格式化 → Haiku 或脚本
  • 常规实现/研究 → Sonnet
  • 复杂设计/分析 → Opus
  • 长期工作/难题 → Fable
  • 仅针对失败的难点 → Fable xhigh

创建自动路由器时,应基于"出错时的损失"、"所需的自主时间"和"验证难度"来判断,而非价格。

第三层:探索主导

将代码探索、资料收集和竞品研究分离到子 Agent 中。

每个子 Agent 在独立的上下文中工作,仅将结论和证据返回给主 Agent。这可以防止数十个文件的读取结果膨胀主会话历史。(Claude

第四层:Fable 主管

Fable 利用探索主导返回的结果进行判断。

  • 采纳哪个假设
  • 是否需要额外研究
  • 进行哪些更改
  • 结果中是否存在矛盾
  • 是否满足完成条件

与其让 Fable 负责从原始数据收集开始的所有工作,不如将整理好的证据传递给它,让它专注于判断。

第五层:确定性验证

不要仅依赖提示词进行验证。

  • 对于代码:测试、Lint、类型检查。
  • 对于文章:字符数、重复表达、URL、引用。
  • 对于电子表格:公式错误、缺失值、总计。
  • 对于落地页:链接、布局断裂、截图对比。

使用钩子(hooks),你可以在工具执行前后运行检查。与其指望 LLM 记住要验证,不如在固定条件下自动执行。(Claude Platform Docs

第六层:修复循环

仅在验证失败时返回给 Fable。

创建 → 机械验证 → 成功(完成)/ 失败 → 原因分析 → 最小修复 → 重新验证

重要的是不要无限循环。

例如,决定"同一失败最多重试 2 次"或"总共失败 3 次后带着证据停止"。对于可以长时间工作的模型,如果没有停止条件,成本和工作范围会急剧膨胀。

对于涉及数十到数百个子 Agent 的流程,应使用动态工作流(Dynamic Workflow),而不是让 Claude 顺序管理它们。在工作流中,你可以将中间结果保存在脚本变量中,仅将最终结果返回给主上下文,这使其适用于大规模研究或处理海量文件。(Claude

4. Skills 不是"长提示词仓库"

Skills 是一种保存重复使用的工作流程的机制,保存为 SKILL.md。

与 CLAUDE.md 的区别在于,其主体内容仅在需要时读取。

  • 项目信息和始终遵循的简短规则:CLAUDE.md。
  • 文章制作、部署、研究、审查等流程:Skills。
  • 大量示例或规范:Skills 的参考文件。

这种分离直接关系到 Token 的节省。(Claude Platform Docs

我推荐以下结构:

text
1.claude/
2├── CLAUDE.md
3├── skills/
4│ └── deep-article/
5│ ├── SKILL.md
6│ ├── research-rules.md
7│ ├── writing-rules.md
8│ ├── examples.md
9│ └── scripts/
10│ ├── count_chars.py
11│ └── check_repetition.py
12├── agents/
13│ ├── researcher.md
14│ └── critic.md
15└── settings.json

在 SKILL.md 中,仅放置概述、执行条件、流程和完成条件。

将大量的解释、API 规范和成功案例分离到不同的文件中,让 Claude 仅在必要时读取。官方文档建议将 SKILL.md 保持在 500 行以内,并将详细资料分离到支持文件中。(Claude Platform Docs

5. 实用的 SKILL.md 模板

以下是一个用于创建研究文章的 Skill 示例。


name: deep-article

description: 研究一手信息并创建带有证据的长篇文章。当需要对最新 AI、公司、系统或产品进行深入解释时使用。

argument-hint: "[主题] [目标字符数]"

effort: high


目标

创建一篇关于 $ARGUMENTS 的、经过事实核查的长篇文章。

基本规则

  • 如果最新信息相关,务必搜索
  • 优先使用一手信息
  • 区分事实、公司公告、第三方评价和推测
  • 为数字附上目标时期和定义
  • 不要重复相同的结论或示例
  • 首次提及技术术语时进行解释
  • 最终字符数不得低于指定字符数的 90%
  • 最后,报告字符数和未验证项

工作流程

  1. 将主题分解为 3-7 个研究点
  2. 并行研究独立的研究点
  3. 收集一手信息
  4. 调查反证或不利信息
  5. 创建事实列表
  6. 确定文章结构
  7. 创建初稿
  8. 审核重复、跳跃、引用、日期和数字
  9. 修正
  10. 检查字符数

完成条件

  • 开头结论清晰
  • 读者能据此决定行动
  • 重要事实有来源
  • 事实与推测不混淆
  • 达到指定字符数
  • 无重复段落

仅在必要时阅读的材料

最终检查

执行以下操作:

  • python ${CLAUDE_SKILL_DIR}/scripts/count_chars.py <输出文件>
  • python ${CLAUDE_SKILL_DIR}/scripts/check_repetition.py <输出文件>

Skill 的描述不仅是一个解释,还充当路由器。

与其使用"撰写高质量文章"这样模糊的句子,不如写成"用于调查最新 AI、公司和系统一手信息的长篇请求",这样更容易在需要时被调用。

由于 Claude Code 会将 Skill 描述列表放入上下文中,编写冗长的描述会增加持续成本。将重要用途放在开头,并保持简短。(Claude Platform Docs

6. Skills 的高级用法

禁止自动执行的 Skills

部署、发送、删除、发布和支付等操作不得由 Claude 随意启动。

设置 disable-model-invocation: true,仅在用户明确输入 /deploy 等命令时运行。

不应污染对话的 Skills

对于执行大规模研究或代码探索的 Skill,设置 context: fork

这会使它们在独立的子 Agent 上下文中执行。大量的文件内容和搜索历史不会进入主对话;只有最终结果返回。(Claude Platform Docs

自动注入当前状态的 Skills

在 Skill 内部,你可以预先插入命令结果。

当前状态

!git status --short

!git diff --stat

Claude 接收的是执行结果,而非命令字符串。

然而,每次都注入完整的 git diff 或大量日志会适得其反。先只放入 --stat 或错误行,让它在必要时才读取详细信息。(Claude Platform Docs

为 Skills 设置 effort

将简单的 Skill 设为 medium,设计审查和深度研究设为 high,极其困难的审核设为 xhigh。

如果每个 Skill 都有自己的 effort 设置,用户就不需要每次都手动切换。

7. 始终进行对比评估

仅仅创建一个 Skill 并不能告诉你质量是否提升。

官方文档指导分别评估两件事:

  1. 对于必要的请求,Skill 是否正确启动?
  2. 作为启动的结果,交付物是否真的变得更好?

在新的会话中,分别"使用 Skill"和"不使用 Skill"执行相同的请求。

对于文章 Skill,比较字符数、缺失来源、重复、事实错误和修正次数。对于代码 Skill,比较测试成功率、更改文件数、不必要的更改和返工次数。

在创建 Skill 的对话中继续测试会因对话中的补充信息而掩盖缺陷。务必在新会话中进行评估。Claude Code 也提供了一个官方的 skill-creator 插件来支持这种比较。(Claude Platform Docs

最终结论

Claude Fable 5.1 并非仅仅是加速 Claude 系列的模型。

其最大价值在于:能够长时间持续处理困难工作、从中途失败中恢复、寻找根本原因,并在验证自身结果的同时将工作推进完成。

另一方面,其输入和输出的单价是 Opus 5 的两倍。内部思考无法关闭,与重写旧对话的 harness 不兼容,也无法强制调用工具。

因此,最强使用方式如下:

**用 Sonnet 或脚本缩小信息范围。

用子 Agent 分离探索。

将困难判断和整合分配给 Fable。

用钩子和测试进行机械验证。

仅对失败的难点提高 effort。

将重复流程保存为 Skills。

保持对话历史仅追加以保护缓存。**

如果你将 Fable 5.1 用作"回答一切的高端聊天",那么只会带来高昂的价格。

只有当你将 Fable 5.1 定位为整合廉价模型、Skills、子 Agent、钩子和验证循环的主管时,它与前几代的真正区别才会显现出来。

二次创作

使用 YouMind 创作爆款文章

收集素材、拆解爆点、生成视觉资产、撰写内容,并在一个 AI 工作空间里完成分发。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章