防止 Fable 5.1 浪费 Token

@dr_cintas
英语2026年9月02日
180K
68
6
1
210

TL;DR

Alvaro Cintas 分享了一套优化 Fable 5.1 Token 消耗的工作流,重点介绍了推理努力程度设置、提示词规范化以及专业的压缩工具。

Fable 5.1 是个猛兽,消耗 Token 也像猛兽一样。

下面介绍如何通过四个命令来减少 Token 浪费,以及一些能进一步削减成本的免费开源仓库。

这些操作都不会影响输出质量。它改变的是你为相同结果所支付的费用。

无论你是否在使用 Fable 5.1,这些方法都有效,因为 Token 成本的累积方式与你运行的具体模型无关。

现在,我们开始吧。

第一步:降低你的思考力度。

这是最大的一招,而且是你每次请求都可以控制的设置。

共有五个级别:lowmediumhighxhighmax

思考力度控制着模型在回答之前进行推理的程度。更高的力度意味着在响应前进行更多的思考,无论任务是否真的需要这种思考,都会消耗更多的 Token。

你可以这样理解。思考力度就像你允许别人在回答问题前思考的时间。问任何人 2+2 等于几,他们会说“4”。让他们先认真思考十分钟,那么你就要为十分钟的思考付费,却得到同样的“4”。

嗯……大多数任务都是 2+2 级别的。

Anthropic 对 Fable 5.1 的指导是:从 high 开始,这是默认设置。只有在最需要能力的编码和 Agent 工作中,才升级到 xhigh 或 max。对于常规任务或对延迟敏感的任务,一旦确认较低级别仍能保持质量,就降低到 medium 或 low。

Alvaro Cintas - inline image

数据对比非常惊人。在 CursorBench 上,Fable 5.1 在 low 力度下的得分高于 Fable 5 在 high 力度下的得分,而成本只有后者的三分之一。

在信任它之前先测试一下。选择一个已知正确答案的任务,然后用 low 力度运行。

“以低力度运行此请求,并告诉我响应中发生了什么变化”

使用你的一个真实任务。在假设低力度意味着更差结果之前,直接比较输出。将繁重的任务、多步骤推理、真正的调试,以及任何错误答案会浪费后续时间的任务,保持在 high 或以上级别。

第二步:运行成本优化。

这个功能于 8 月 26 日作为 claude-api 技能的一部分推出。它会检查最近的用量,并针对特定项目排列出最重要的成本杠杆。

bash
1/claude-api cost-optimize

它会按顺序检查缓存、Token 卫生、批处理、思考力度和模型选择。缓存和 Token 卫生通常是最便宜的修复方法,见效也最快,然后才会建议像切换模型这样的结构性改动。

Alvaro Cintas - inline image

每个建议都会逐一被批准或跳过。未经确认,不会有任何更改,因此不存在重写设置的风险。

第三步:运行提示审计。

提示和技能会随着时间的推移积累垃圾信息。

把它想象成一个杂物抽屉。每次编辑都会往里面放东西,而你从未清理过。只不过这个“抽屉”会为每次请求向你收取 Token 费用,直到垃圾被清除为止。

bash
1/claude-api prompt-audit
Alvaro Cintas - inline image

在你拥有的任何技能文件夹上运行它。那些旧的技能,那些你可能反复编辑过的技能,正是它发现最多浪费的地方。每次编辑都添加了一些东西,却没有移除被替换掉的内容。运行这个命令,你会注意到不同。

第四步:迁移旧的 API 配置。

如果某个项目仍在运行为早期模型构建的配置,此命令会处理模型 ID 的切换以及代码库中任何破坏性的参数更改。

bash
1/claude-api migrate this project to claude-fable-5-1

指定实际的目标模型。它会先确认范围——是整个工作目录、一个子目录,还是一个特定的文件列表——然后再进行编辑。然后它会给你一个清单,列出需要手动验证的剩余内容。

四个能进一步削减成本的仓库。

这些并非 Fable 5.1 专属。在任何模型上,同样的 Token 节省方法都适用,所以了解有哪些可用的工具以及它们各自的功能是很有好处的。

Caveman

Alvaro Cintas - inline image

将模型自身的回复压缩成简短、电报式的响应,而不是冗长的回复。

设置:

bash
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash

RTK

Alvaro Cintas - inline image

一个 Rust 代理,在 Shell 命令输出到达模型上下文之前对其进行压缩。

设置:

bash
1brew install rtk
2rtk init -g

Ponytail

Alvaro Cintas - inline image

让 Agent 从一开始就编写更少的代码。一个高级开发者的视角,会选择一行代码而不是五十行。

设置:

bash
1/plugin marketplace add DietrichGebert/ponytail
2/plugin install ponytail@ponytail

CodeGraph

Alvaro Cintas - inline image

这个的工作方式完全不同。它不是压缩文本,而是构建代码库的知识图谱,这样 Agent 可以直接查询符号关系和调用图,而不是使用 grep 和 read 来扫描文件。

设置:

bash
1npx @colbymchenry/codegraph
2cd your-project
3codegraph init -i

从哪里开始。

如果其他什么都不做,那就执行第一步。在下一个常规任务中降低思考力度,并比较输出。这一个设置对你的积分(credits)的影响比任何仓库都大,而且尝试它不需要任何成本。

然后,在你的任何项目上运行 cost-optimizeprompt-audit

Anthropic 自己团队确认的四个设置胜过从任何仓库安装的工具。在那之后,再用我给你的四个仓库去探索更广泛的生态系统。

如果这为你节省了 Token / 金钱,请点赞并与你的朋友分享。

下次见 :)

二次创作

使用 YouMind 创作爆款文章

收集素材、拆解爆点、生成视觉资产、撰写内容,并在一个 AI 工作空间里完成分发。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章