停止讓 Fable 5.1 浪費 Token

@dr_cintas
英語2026年9月02日
180K
68
6
1
210

TL;DR

Alvaro Cintas 分享了一套優化 Fable 5.1 Token 消耗的工作流程,重點在於推理努力程度設定、提示詞優化以及專業的壓縮工具。

Fable 5.1 是一頭猛獸,而且它消耗 Token 的方式也像一頭猛獸。

以下是如何用四個指令來減少 Token 浪費,以及能進一步降低消耗的免費開源儲存庫。

這些方法都不會影響輸出品質。它們改變的是你為相同結果所付出的代價。

而且無論你是否使用 Fable 5.1,這些方法都有效,因為無論你運行哪個模型,Token 成本的累積方式都一樣。

現在我們開始吧。

第一步:降低你的努力程度。

這是最大的一個技巧,而且是你可以在每次請求中控制的設定。

共有五個等級:lowmediumhighxhighmax

努力程度控制模型在回答前的推理程度。更高的努力意味著在回應前需要更多的思考,這會消耗更多的 Token,無論任務本身是否真的需要這些思考。

你可以這樣理解。努力程度就像是你讓一個人在回答前思考多久。問任何人 2+2 等於多少,他們會說「4」。讓他們先努力思考十分鐘,你就要為十分鐘的思考付出代價,卻得到同樣的「4」。

嗯……大多數任務都是 2+2。

Anthropic 對 Fable 5.1 的指導是:從 high 開始,這是預設值。只有在對能力要求最高的編碼和 Agent 工作中,才提升到 xhigh 或 max。對於常規或對延遲敏感的任務,一旦確認較低等級仍能保持品質,就降到 medium 或 low。

Alvaro Cintas - inline image

這些數字很驚人。在 CursorBench 上,Fable 5.1 在 low 努力程度下的得分高於 Fable 5 在 high 努力程度下的得分,而成本只有後者的三分之一。

在相信它之前先測試一下。選擇一個你已經知道正確答案的任務,然後用 low 等級運行它。

「以低努力程度運行這個請求,並告訴我回應中有什麼變化」

使用你的一個真實任務。在假設低努力程度意味著更差的結果之前,直接比較輸出。將那些繁重的任務、多步驟推理、真正的除錯,以及任何錯誤答案會導致後續時間損失的任務,保持在 high 或以上等級。

第二步:執行 cost-optimize。

這個功能於 8 月 26 日作為 claude-api 技能的一部分推出。它會檢查近期使用情況,並針對特定專案,對影響成本的關鍵因素進行排序。

bash
1/claude-api cost-optimize

它會依序檢查快取、Token 衛生、批次處理、努力程度和模型選擇。快取和 Token 衛生通常是最便宜的修復方法,並且回報最快,之後它才會建議像切換模型這樣的結構性變更。

Alvaro Cintas - inline image

每個建議都會逐一被批准或跳過。未經確認不會有任何改變,因此沒有重寫設定的風險。

第三步:執行 prompt-audit。

提示詞和技能會隨著時間累積垃圾。

把它想像成一個雜物抽屜。每次編輯都會往裡面多放一樣東西,而你從來不會清理它。只是這個「抽屜」會為你的每個請求收取 Token 費用,而且永遠持續下去,直到垃圾被清除。

bash
1/claude-api prompt-audit
Alvaro Cintas - inline image

在你擁有的任何技能資料夾上運行它。那些舊的技能,那些你可能已經反覆編輯過的技能,正是它發現最多浪費的地方。每次編輯都添加了一些東西,卻沒有移除被取代的內容。運行這個指令,你會注意到其中的差異。

第四步:遷移舊的 API 配置。

如果一個專案仍在運行為較早模型構建的配置,這個指令會處理模型 ID 的切換,以及程式碼庫中任何破壞性的參數變更。

bash
1/claude-api migrate this project to claude-fable-5-1

指定實際的目標模型。它會先確認範圍——是整個工作目錄、一個子目錄,還是一個特定的檔案列表——然後才進行編輯。接著它會給你一份清單,列出需要手動驗證的剩餘項目。

四個進一步減少浪費的儲存庫。

這些並非 Fable 5.1 專用。在任何模型上,相同的 Token 節省方法都適用,所以了解有哪些工具以及它們各自的實際功能是件好事。

Caveman

Alvaro Cintas - inline image

將模型自身的回覆壓縮成簡短、電報式的回應,而不是冗長的內容。

設定方式:

bash
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash

RTK

Alvaro Cintas - inline image

一個 Rust 代理,在 shell 命令輸出到達模型上下文之前對其進行壓縮。

設定方式:

bash
1brew install rtk
2rtk init -g

Ponytail

Alvaro Cintas - inline image

讓 Agent 從一開始就寫更少的程式碼。一個資深開發者的視角,會選擇一行而不是五十行。

設定方式:

bash
1/plugin marketplace add DietrichGebert/ponytail
2/plugin install ponytail@ponytail

CodeGraph

Alvaro Cintas - inline image

這個的運作方式完全不同。它不是壓縮文字,而是建立程式碼庫的知識圖譜,讓 Agent 可以直接查詢符號關係和呼叫圖,而不是用 grep 和 read 掃描檔案。

設定方式:

bash
1npx @colbymchenry/codegraph
2cd your-project
3codegraph init -i

從哪裡開始。

如果其他什麼都不做,至少執行第一步。在下一個常規任務中降低努力程度,並比較輸出結果。這一個設定對你的額度(Credits)的影響比任何儲存庫都大,而且嘗試它不需要任何成本。

然後在你任何一個專案上運行 cost-optimizeprompt-audit

Anthropic 自家團隊確認的四個設定,勝過任何從儲存庫安裝的工具。之後再用我給你的四個儲存庫去探索更廣闊的生態系統。

如果這篇文章幫你省下了 Token 或金錢,請記得按讚並分享給你的朋友。

我們下一篇見 :)

二次創作

使用 YouMind 創作爆款文章

收集素材、拆解爆點、生成視覺資產、撰寫內容,並在一個 AI 工作空間裡完成分發。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章