Fable 5.1 es una bestia. Y quema tokens como tal.
Aquí te explico cómo reducir el desperdicio de tokens con cuatro comandos y repositorios open-source gratuitos que lo reducen aún más.
Nada de esto afecta la calidad del resultado. Cambia lo que pagas por el mismo resultado.
Y funciona tanto si usas Fable 5.1 como si no, porque el costo de los tokens se acumula de la misma manera independientemente del modelo que ejecutes.
Ahora empecemos.
Paso 1: Reduce tu nivel de esfuerzo.
Este es el truco más importante, y es una configuración que puedes controlar en cada solicitud.
Hay cinco niveles: low, medium, high, xhigh y max.
El esfuerzo controla cuánto razona el modelo antes de responder. Un mayor esfuerzo significa más pensamiento antes de una respuesta, lo que cuesta más tokens, independientemente de si la tarea realmente necesitaba ese razonamiento.
Así es como debes pensar en ello. El nivel de esfuerzo es cuánto tiempo dejas que alguien piense antes de responder. Pregúntale a cualquiera cuánto es 2+2 y te dirá "4". Pídele que piense mucho durante diez minutos primero, y pagas por diez minutos de pensamiento para obtener el mismo "4".
Bueno... la mayoría de las tareas son 2+2.
La guía de Anthropic para Fable 5.1 es: empieza en high, que es el valor predeterminado. Sube a xhigh o max solo para los trabajos de codificación y agente más sensibles a la capacidad. Baja a medium o low para tareas rutinarias o sensibles a la latencia, una vez que confirmes que el nivel inferior sigue manteniendo la calidad.

Las cifras son increíbles. En CursorBench, Fable 5.1 con esfuerzo low obtuvo una puntuación más alta que Fable 5 con esfuerzo high, a un tercio del costo.
Pruébalo antes de confiar en ello. Elige una tarea cuya respuesta correcta ya conozcas y luego ejecútala en low.
"Ejecuta esta solicitud con esfuerzo low y dime qué cambió en la respuesta"
Usa una de tus tareas reales. Compara el resultado directamente antes de asumir que un esfuerzo low significa peores resultados. Mantén las tareas pesadas, el razonamiento de varios pasos, la depuración real, cualquier cosa donde una respuesta incorrecta te cueste tiempo después, en high o superior.
Paso 2: Ejecuta cost-optimize.
Esto se lanzó el 26 de agosto como parte de la habilidad claude-api. Analiza el uso reciente y clasifica las palancas de costo que importan para un proyecto específico.
1/claude-api cost-optimize
Verifica el almacenamiento en caché, la higiene de tokens, el procesamiento por lotes, el nivel de esfuerzo y la elección del modelo, en ese orden. El almacenamiento en caché y la higiene de tokens suelen ser las soluciones más económicas y se amortizan más rápido, antes de que sugiera algo estructural como cambiar de modelo.

Cada sugerencia se aprueba o se omite de una en una. Nada cambia sin confirmación, por lo que no hay riesgo de que reescriba una configuración.
Paso 3: Ejecuta prompt-audit.
Los prompts y las habilidades acumulan basura con el tiempo.
Piénsalo como un cajón de trastos. Cada edición añade una cosa más, y nunca lo limpias. Excepto que este "cajón" te cobra tokens por cada solicitud, para siempre, hasta que se elimine la basura.
1/claude-api prompt-audit

Ejecútalo en cualquier carpeta de Skills que tengas. Las habilidades antiguas, esas que probablemente has editado una y otra vez, son exactamente donde encuentra más desperdicio. Cada edición añadió algo sin eliminar lo que reemplazó. Ejecuta esto y notarás la diferencia.
Paso 4: Migra las configuraciones antiguas de la API.
Si un proyecto todavía está ejecutando una configuración creada para un modelo anterior, esto maneja el intercambio de ID del modelo junto con cualquier cambio de parámetros que rompa la compatibilidad en toda la base de código.
1/claude-api migra este proyecto a claude-fable-5-1
Nombra el modelo de destino real. Primero confirma el alcance (todo el directorio de trabajo, un subdirectorio o una lista específica de archivos) antes de editar cualquier cosa. Luego te devuelve una lista de verificación de lo que queda por verificar manualmente.
Cuatro repositorios para reducir aún más el desperdicio.
Estos no son específicos de Fable 5.1. En cualquier modelo, se aplica el mismo ahorro de tokens, por lo que es bueno saber qué hay disponible y qué hace cada uno.
Caveman

Comprime las respuestas del propio modelo en respuestas cortas y telegráficas en lugar de verbosas.
Configuración:
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
RTK

Un proxy en Rust que comprime la salida de los comandos del shell antes de que llegue al contexto del modelo.
Configuración:
1brew install rtk2rtk init -g
Ponytail

Hace que el agente escriba menos código desde el principio. Una perspectiva de desarrollador senior que elige una línea en lugar de cincuenta.
Configuración:
1/plugin marketplace add DietrichGebert/ponytail2/plugin install ponytail@ponytail
CodeGraph

Este funciona de manera completamente diferente. En lugar de comprimir texto, construye un grafo de conocimiento de la base de código, para que el agente pueda consultar las relaciones de símbolos y los grafos de llamadas directamente, en lugar de escanear archivos con grep y read.
Configuración:
1npx @colbymchenry/codegraph2cd tu-proyecto3codegraph init -i
Por dónde empezar.
Si no haces nada más, haz el Paso 1. Reduce el nivel de esfuerzo en la próxima tarea rutinaria y compara el resultado. Esa única configuración hace más por tus créditos que cualquier repositorio, y no cuesta nada probarlo.
Luego ejecuta cost-optimize y prompt-audit en cualquiera de tus proyectos.
Las cuatro configuraciones confirmadas por el propio equipo de Anthropic superan cualquier cosa instalada desde un repositorio. Después de eso, explora el ecosistema más amplio con los cuatro repositorios que te he dado.
Si esto te ha ahorrado tokens/dinero, asegúrate de darle "me gusta" y compartirlo con tu red.
¡Nos vemos en la próxima :)





