O Fable 5.1 é um monstro. E ele queima tokens como um.
Aqui está como cortar o desperdício de tokens com quatro comandos e repositórios open-source gratuitos que reduzem ainda mais.
Nada disso afeta a qualidade da saída. Isso muda o que você paga pelo mesmo resultado.
E tudo funciona independentemente de você estar usando o Fable 5.1 ou não, porque o custo dos tokens se acumula da mesma forma, não importa qual modelo você execute.
Agora vamos começar.
Passo 1: Reduza seu nível de esforço.
Este é o maior truque de todos, e é uma configuração que você pode controlar em cada solicitação.
Existem cinco níveis: low, medium, high, xhigh e max.
O esforço controla o quanto o modelo raciocina antes de responder. Um esforço maior significa mais pensamento antes de uma resposta, o que custa mais tokens, independentemente de a tarefa realmente precisar desse raciocínio.
Aqui está a melhor forma de pensar sobre isso. O nível de esforço é quanto tempo você deixa alguém pensar antes de responder. Pergunte a qualquer um quanto é 2+2 e eles dizem "4." Peça para eles pensarem muito por dez minutos primeiro, e você paga por dez minutos de pensamento para obter o mesmo "4."
Bem... a maioria das tarefas é 2+2.
A orientação da Anthropic para o Fable 5.1 é: comece em high, que é o padrão. Aumente para xhigh ou max apenas para trabalhos de codificação e agentes mais sensíveis à capacidade. Reduza para medium ou low para tarefas rotineiras ou sensíveis à latência, uma vez confirmado que o nível inferior ainda mantém a qualidade.

Os números são impressionantes. No CursorBench, o Fable 5.1 com esforço baixo obteve uma pontuação maior que o Fable 5 com esforço alto, por um terço do custo.
Teste antes de confiar. Escolha uma tarefa cuja resposta correta você já conhece e execute-a em low.
"Execute esta solicitação com esforço baixo e me diga o que mudou na resposta"
Use uma de suas tarefas reais. Compare a saída diretamente antes de assumir que esforço baixo significa resultados piores. Mantenha as tarefas pesadas, raciocínio de múltiplas etapas, depuração real, qualquer coisa onde uma resposta errada custe tempo depois, em high ou acima.
Passo 2: Execute cost-optimize.
Este foi lançado em 26 de agosto como parte da habilidade claude-api. Ele analisa o uso recente e classifica as alavancas de custo que importam para um projeto específico.
1/claude-api cost-optimize
Ele verifica cache, higiene de tokens, processamento em lote, nível de esforço e escolha do modelo, nessa ordem. Cache e higiene de tokens geralmente são as correções mais baratas e se pagam mais rápido, antes mesmo de sugerir algo estrutural como trocar de modelo.

Cada sugestão é aprovada ou ignorada uma de cada vez. Nada muda sem confirmação, então não há risco de reescrever uma configuração.
Passo 3: Execute prompt-audit.
Prompts e habilidades acumulam sujeira com o tempo.
Pense nisso como uma gaveta de bagunça. Cada edição coloca mais uma coisa dentro, e você nunca a limpa. Só que essa "gaveta" cobra tokens por cada solicitação, para sempre, até que a sujeira seja removida.
1/claude-api prompt-audit

Execute em qualquer pasta de Skills que você tiver. As habilidades antigas, aquelas que você provavelmente editou várias vezes, são exatamente onde ele encontra mais desperdício. Cada edição adicionou algo sem remover o que foi substituído. Execute isso e você notará a diferença.
Passo 4: Migre configurações antigas da API.
Se um projeto ainda estiver executando uma configuração criada para um modelo anterior, isso lida com a troca do ID do modelo, além de quaisquer alterações de parâmetros que quebrem a compatibilidade em toda a base de código.
1/claude-api migrate this project to claude-fable-5-1
Nomeie o modelo de destino real. Ele confirma o escopo primeiro, todo o diretório de trabalho, um subdiretório ou uma lista específica de arquivos, antes de editar qualquer coisa. Em seguida, ele fornece uma lista de verificação do que resta para verificar manualmente.
Quatro repositórios para reduzir ainda mais o desperdício.
Eles não são específicos para o Fable 5.1. Em qualquer modelo, a mesma economia de tokens se aplica, então é bom saber o que existe por aí e o que cada um realmente faz.
Caveman

Comprime as próprias respostas do modelo em respostas curtas e telegráficas, em vez de prolixas.
Configuração:
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
RTK

Um proxy em Rust que comprime a saída de comandos do shell antes que ela chegue ao contexto do modelo.
Configuração:
1brew install rtk2rtk init -g
Ponytail

Faz com que o agente escreva menos código em primeiro lugar. Uma lente de desenvolvedor sênior que escolhe uma linha em vez de cinquenta.
Configuração:
1/plugin marketplace add DietrichGebert/ponytail2/plugin install ponytail@ponytail
CodeGraph

Este funciona de forma completamente diferente. Em vez de comprimir texto, ele constrói um grafo de conhecimento da base de código, para que o agente possa consultar relacionamentos de símbolos e grafos de chamada diretamente, em vez de escanear arquivos com grep e read.
Configuração:
1npx @colbymchenry/codegraph2cd your-project3codegraph init -i
Por onde começar.
Se nada mais for feito, faça o Passo 1. Reduza o nível de esforço na próxima tarefa rotineira e compare a saída. Essa única configuração faz mais pelos seus créditos do que qualquer repositório, e não custa nada tentar.
Em seguida, execute cost-optimize e prompt-audit em qualquer um dos seus projetos.
As quatro configurações confirmadas pela própria equipe da Anthropic superam qualquer coisa instalada de um repositório. Vá explorar o ecossistema mais amplo depois disso com os quatro repositórios que eu te dei.
Se isso economizou tokens/dinheiro para você, não deixe de curtir e compartilhar com sua rede.
Até a próxima :)





