Fable 5.1 è un mostro. E brucia token come tale.
Ecco come ridurre gli sprechi di token con quattro comandi e repository open-source gratuiti che li tagliano ancora di più.
Niente di tutto ciò tocca la qualità dell'output. Cambia solo ciò per cui paghi, a parità di risultato.
E funziona tutto, sia che tu stia usando Fable 5.1 o meno, perché il costo dei token si accumula allo stesso modo indipendentemente dal modello che esegui.
Ora iniziamo.
Passo 1: Abbassa il tuo livello di sforzo.
Questo è il trucco più grande in assoluto, ed è un'impostazione che puoi controllare su ogni richiesta.
Ci sono cinque livelli: low, medium, high, xhigh e max.
Lo sforzo controlla quanto il modello ragiona prima di rispondere. Uno sforzo maggiore significa più pensiero prima di una risposta, il che costa più token, indipendentemente dal fatto che l'attività necessitasse effettivamente di quel ragionamento.
Ecco come vederla. Il livello di sforzo è quanto tempo lasci pensare qualcuno prima che risponda. Chiedi a chiunque quanto fa 2+2 e ti dirà "4." Chiedigli di pensarci intensamente per dieci minuti prima, e pagherai dieci minuti di pensiero per ottenere lo stesso "4."
Beh...la maggior parte dei compiti sono come 2+2.
La guida di Anthropic per Fable 5.1 è: inizia con high, che è l'impostazione predefinita. Passa a xhigh o max solo per i lavori di coding e agentici più sensibili alle capacità. Scendi a medium o low per attività di routine o sensibili alla latenza, una volta confermato che il livello inferiore mantiene comunque la qualità.

I numeri sono pazzeschi. Su CursorBench, Fable 5.1 a sforzo basso ha ottenuto un punteggio più alto di Fable 5 a sforzo alto, a un terzo del costo.
Testalo prima di fidarti. Scegli un'attività di cui conosci già la risposta corretta, poi eseguila a basso sforzo.
"Esegui questa richiesta a basso sforzo e dimmi cosa è cambiato nella risposta"
Usa uno dei tuoi compiti reali. Confronta direttamente l'output prima di presumere che un basso sforzo significhi risultati peggiori. Tieni le cose pesanti, il ragionamento multi-step, il debug vero, tutto ciò in cui una risposta sbagliata ti costa tempo dopo, a sforzo alto o superiore.
Passo 2: Esegui cost-optimize.
Questa funzione è stata lanciata il 26 agosto come parte della skill claude-api. Analizza l'utilizzo recente e classifica le leve di costo che contano per un progetto specifico.
1/claude-api cost-optimize
Controlla la cache, l'igiene dei token, l'elaborazione batch, il livello di sforzo e la scelta del modello, in quest'ordine. La cache e l'igiene dei token sono di solito le soluzioni più economiche e ripagano più velocemente, prima ancora di suggerire qualcosa di strutturale come cambiare modello.

Ogni suggerimento viene approvato o saltato uno alla volta. Niente cambia senza conferma, quindi non c'è il rischio che riscriva una configurazione.
Passo 3: Esegui prompt-audit.
I prompt e le skill accumulano "spazzatura" nel tempo.
Pensala come a un cassetto dei "ciaspe". Ogni modifica aggiunge qualcosa, e non lo pulisci mai. Solo che questo "cassetto" ti addebita token per ogni richiesta, per sempre, finché la spazzatura non viene rimossa.
1/claude-api prompt-audit

Eseguilo su qualsiasi cartella di Skill che hai. Le skill vecchie, quelle che probabilmente hai modificato più e più volte, sono esattamente dove trova più sprechi. Ogni modifica ha aggiunto qualcosa senza rimuovere ciò che ha sostituito. Eseguilo e noterai la differenza.
Passo 4: Migra le vecchie configurazioni API.
Se un progetto sta ancora eseguendo una configurazione creata per un modello precedente, questo comando gestisce lo scambio dell'ID del modello più eventuali modifiche ai parametri che causano errori in tutto il codebase.
1/claude-api migra questo progetto a claude-fable-5-1
Nomina il modello di destinazione effettivo. Conferma prima l'ambito (l'intera directory di lavoro, una sottodirectory o un elenco specifico di file) prima di modificare qualsiasi cosa. Poi ti restituisce una checklist di ciò che resta da verificare manualmente.
Quattro repository per ridurre ulteriormente gli sprechi.
Questi non sono specifici per Fable 5.1. Su qualsiasi modello, si applica lo stesso risparmio di token, quindi è bene sapere cosa c'è in giro e cosa fa effettivamente ciascuno.
Caveman

Comprime le risposte del modello in risposte brevi e telegrafiche invece che verbose.
Configurazione:
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
RTK

Un proxy in Rust che comprime l'output dei comandi shell prima che raggiunga il contesto del modello.
Configurazione:
1brew install rtk2rtk init -g
Ponytail

Fa sì che l'agente scriva meno codice fin dall'inizio. Una lente da sviluppatore senior che sceglie una riga invece di cinquanta.
Configurazione:
1/plugin marketplace add DietrichGebert/ponytail2/plugin install ponytail@ponytail
CodeGraph

Questo funziona in modo completamente diverso. Invece di comprimere il testo, costruisce un grafo della conoscenza del codebase, così l'agente può interrogare direttamente le relazioni tra simboli e i grafi di chiamata, invece di scansionare i file con grep e read.
Configurazione:
1npx @colbymchenry/codegraph2cd your-project3codegraph init -i
Da dove iniziare.
Se non si fa nient'altro, fai il Passo 1. Abbassa il livello di sforzo sul prossimo compito di routine e confronta l'output. Quella singola impostazione fa più per i tuoi crediti di qualsiasi repository, e non costa nulla provarla.
Poi esegui cost-optimize e prompt-audit su uno qualsiasi dei tuoi progetti.
Le quattro impostazioni confermate dal team di Anthropic battono qualsiasi cosa installata da un repository. Dopodiché, esplora l'ecosistema più ampio con i quattro repository che ti ho dato.
Se questo ti ha fatto risparmiare token/soldi, assicurati di mettere mi piace e condividerlo con la tua rete.
Ci vediamo al prossimo articolo :)





