Fable 5.1 是一頭猛獸,而且它消耗 Token 的方式也像一頭猛獸。
以下是如何用四個指令來減少 Token 浪費,以及能進一步降低消耗的免費開源儲存庫。
這些方法都不會影響輸出品質。它們改變的是你為相同結果所付出的代價。
而且無論你是否使用 Fable 5.1,這些方法都有效,因為無論你運行哪個模型,Token 成本的累積方式都一樣。
現在我們開始吧。
第一步:降低你的努力程度。
這是最大的一個技巧,而且是你可以在每次請求中控制的設定。
共有五個等級:low、medium、high、xhigh 和 max。
努力程度控制模型在回答前的推理程度。更高的努力意味著在回應前需要更多的思考,這會消耗更多的 Token,無論任務本身是否真的需要這些思考。
你可以這樣理解。努力程度就像是你讓一個人在回答前思考多久。問任何人 2+2 等於多少,他們會說「4」。讓他們先努力思考十分鐘,你就要為十分鐘的思考付出代價,卻得到同樣的「4」。
嗯……大多數任務都是 2+2。
Anthropic 對 Fable 5.1 的指導是:從 high 開始,這是預設值。只有在對能力要求最高的編碼和 Agent 工作中,才提升到 xhigh 或 max。對於常規或對延遲敏感的任務,一旦確認較低等級仍能保持品質,就降到 medium 或 low。

這些數字很驚人。在 CursorBench 上,Fable 5.1 在 low 努力程度下的得分高於 Fable 5 在 high 努力程度下的得分,而成本只有後者的三分之一。
在相信它之前先測試一下。選擇一個你已經知道正確答案的任務,然後用 low 等級運行它。
「以低努力程度運行這個請求,並告訴我回應中有什麼變化」
使用你的一個真實任務。在假設低努力程度意味著更差的結果之前,直接比較輸出。將那些繁重的任務、多步驟推理、真正的除錯,以及任何錯誤答案會導致後續時間損失的任務,保持在 high 或以上等級。
第二步:執行 cost-optimize。
這個功能於 8 月 26 日作為 claude-api 技能的一部分推出。它會檢查近期使用情況,並針對特定專案,對影響成本的關鍵因素進行排序。
1/claude-api cost-optimize
它會依序檢查快取、Token 衛生、批次處理、努力程度和模型選擇。快取和 Token 衛生通常是最便宜的修復方法,並且回報最快,之後它才會建議像切換模型這樣的結構性變更。

每個建議都會逐一被批准或跳過。未經確認不會有任何改變,因此沒有重寫設定的風險。
第三步:執行 prompt-audit。
提示詞和技能會隨著時間累積垃圾。
把它想像成一個雜物抽屜。每次編輯都會往裡面多放一樣東西,而你從來不會清理它。只是這個「抽屜」會為你的每個請求收取 Token 費用,而且永遠持續下去,直到垃圾被清除。
1/claude-api prompt-audit

在你擁有的任何技能資料夾上運行它。那些舊的技能,那些你可能已經反覆編輯過的技能,正是它發現最多浪費的地方。每次編輯都添加了一些東西,卻沒有移除被取代的內容。運行這個指令,你會注意到其中的差異。
第四步:遷移舊的 API 配置。
如果一個專案仍在運行為較早模型構建的配置,這個指令會處理模型 ID 的切換,以及程式碼庫中任何破壞性的參數變更。
1/claude-api migrate this project to claude-fable-5-1
指定實際的目標模型。它會先確認範圍——是整個工作目錄、一個子目錄,還是一個特定的檔案列表——然後才進行編輯。接著它會給你一份清單,列出需要手動驗證的剩餘項目。
四個進一步減少浪費的儲存庫。
這些並非 Fable 5.1 專用。在任何模型上,相同的 Token 節省方法都適用,所以了解有哪些工具以及它們各自的實際功能是件好事。
Caveman

將模型自身的回覆壓縮成簡短、電報式的回應,而不是冗長的內容。
設定方式:
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
RTK

一個 Rust 代理,在 shell 命令輸出到達模型上下文之前對其進行壓縮。
設定方式:
1brew install rtk2rtk init -g
Ponytail

讓 Agent 從一開始就寫更少的程式碼。一個資深開發者的視角,會選擇一行而不是五十行。
設定方式:
1/plugin marketplace add DietrichGebert/ponytail2/plugin install ponytail@ponytail
CodeGraph

這個的運作方式完全不同。它不是壓縮文字,而是建立程式碼庫的知識圖譜,讓 Agent 可以直接查詢符號關係和呼叫圖,而不是用 grep 和 read 掃描檔案。
設定方式:
1npx @colbymchenry/codegraph2cd your-project3codegraph init -i
從哪裡開始。
如果其他什麼都不做,至少執行第一步。在下一個常規任務中降低努力程度,並比較輸出結果。這一個設定對你的額度(Credits)的影響比任何儲存庫都大,而且嘗試它不需要任何成本。
然後在你任何一個專案上運行 cost-optimize 和 prompt-audit。
Anthropic 自家團隊確認的四個設定,勝過任何從儲存庫安裝的工具。之後再用我給你的四個儲存庫去探索更廣闊的生態系統。
如果這篇文章幫你省下了 Token 或金錢,請記得按讚並分享給你的朋友。
我們下一篇見 :)





