Fable 5.1 es una bestia. Y quema tokens como tal.
Aquí te explico cómo reducir el desperdicio de tokens con cuatro comandos y repositorios open-source gratuitos que lo reducen aún más.
Nada de esto afecta la calidad del resultado. Cambia por lo que pagas por el mismo resultado.
Y funciona tanto si usas Fable 5.1 como si no, porque el costo de los tokens se acumula de la misma manera sin importar el modelo que ejecutes.
Ahora empecemos.
Paso 1: Reduce tu nivel de esfuerzo.
Este es el truco más importante, y es una configuración que puedes controlar en cada solicitud.
Hay cinco niveles: bajo, medio, alto, muy alto y máximo.
El esfuerzo controla cuánto razona el modelo antes de responder. Un mayor esfuerzo significa más pensamiento antes de una respuesta, lo que cuesta más tokens, independientemente de si la tarea realmente necesitaba ese razonamiento.
Así es como debes pensar en ello. El nivel de esfuerzo es cuánto tiempo dejas que alguien piense antes de responder. Pregúntale a cualquiera cuánto es 2+2 y dirá "4". Pídele que piense mucho durante diez minutos primero, y pagas por diez minutos de pensamiento para obtener el mismo "4".
Bueno... la mayoría de las tareas son 2+2.
La guía de Anthropic para Fable 5.1 es: comienza en alto, que es el valor predeterminado. Sube a muy alto o máximo solo para el trabajo de codificación y agente más sensible a la capacidad. Baja a medio o bajo para tareas rutinarias o sensibles a la latencia, una vez que se confirme que el nivel inferior aún mantiene la calidad.

Los números son increíbles. En CursorBench, Fable 5.1 con esfuerzo bajo obtuvo una puntuación más alta que Fable 5 con esfuerzo alto, a un tercio del costo.
Pruébalo antes de confiar en ello. Elige una tarea donde ya se sepa la respuesta correcta, luego ejecútala con esfuerzo bajo.
"Ejecuta esta solicitud con esfuerzo bajo y dime qué cambió en la respuesta"
Usa una de tus tareas reales. Compara la salida directamente antes de asumir que un esfuerzo bajo significa peores resultados. Mantén las tareas pesadas, el razonamiento de múltiples pasos, la depuración real, cualquier cosa donde una respuesta incorrecta cueste tiempo después, en alto o superior.
Paso 2: Ejecuta cost-optimize.
Este se lanzó el 26 de agosto como parte de la habilidad claude-api. Analiza el uso reciente y clasifica las palancas de costo que importan para un proyecto específico.
1/claude-api cost-optimize
Verifica el almacenamiento en caché, la higiene de tokens, el procesamiento por lotes, el nivel de esfuerzo y la elección del modelo, en ese orden. El almacenamiento en caché y la higiene de tokens suelen ser las soluciones más económicas y se amortizan más rápido, antes de que sugiera algo estructural como cambiar de modelo.

Cada sugerencia se aprueba o se omite de una en una. Nada cambia sin confirmación, por lo que no hay riesgo de que reescriba una configuración.
Paso 3: Ejecuta prompt-audit.
Los prompts y las habilidades acumulan basura con el tiempo.
Piénsalo como un cajón de trastos. Cada edición agrega una cosa más, y nunca lo limpias. Excepto que este "cajón" te cobra tokens por cada solicitud, para siempre, hasta que se elimine la basura.
1/claude-api prompt-audit

Ejecútalo en cualquier carpeta de Skills que tengas. Las habilidades antiguas, esas que probablemente has editado una y otra vez, son exactamente donde encuentra más desperdicio. Cada edición agregó algo sin eliminar lo que reemplazó. Ejecuta esto y notarás la diferencia.
Paso 4: Migra configuraciones antiguas de la API.
Si un proyecto aún ejecuta una configuración creada para un modelo anterior, esto maneja el cambio de ID del modelo junto con cualquier cambio de parámetros que rompa la compatibilidad en toda la base de código.
1/claude-api migrate this project to claude-fable-5-1
Nombra el modelo de destino real. Primero confirma el alcance, todo el directorio de trabajo, un subdirectorio o una lista específica de archivos, antes de editar algo. Luego te devuelve una lista de verificación de lo que queda por verificar manualmente.
Cuatro repositorios para reducir aún más el desperdicio.
Estos no son específicos de Fable 5.1. En cualquier modelo, se aplica el mismo ahorro de tokens, por lo que es bueno saber qué hay disponible y qué hace realmente cada uno.
Caveman

Comprime las propias respuestas del modelo en respuestas cortas y telegráficas en lugar de verbosas.
Configuración:
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
RTK

Un proxy en Rust que comprime la salida de los comandos del shell antes de que llegue al contexto del modelo.
Configuración:
1brew install rtk2rtk init -g
Ponytail

Hace que el agente escriba menos código en primer lugar. Una lente de desarrollador senior que elige una línea sobre cincuenta.
Configuración:
1/plugin marketplace add DietrichGebert/ponytail2/plugin install ponytail@ponytail
CodeGraph

Este funciona de manera completamente diferente. En lugar de comprimir texto, construye un grafo de conocimiento de la base de código, para que el agente pueda consultar las relaciones de símbolos y los grafos de llamadas directamente, en lugar de escanear archivos con grep y read.
Configuración:
1npx @colbymchenry/codegraph2cd tu-proyecto3codegraph init -i
Por dónde empezar.
Si no se hace nada más, haz el Paso 1. Reduce el nivel de esfuerzo en la próxima tarea rutinaria y compara el resultado. Esa única configuración hace más por tus créditos que cualquier repositorio, y no cuesta nada probarlo.
Luego ejecuta cost-optimize y prompt-audit en cualquiera de tus proyectos.
Las cuatro configuraciones confirmadas por el propio equipo de Anthropic superan cualquier cosa instalada desde un repositorio. Después de eso, explora el ecosistema más amplio con los cuatro repositorios que te di.
Si esto te ahorró tokens/dinero, asegúrate de darle like y compartirlo con tu red.
¡Nos vemos en la próxima! :)





