Evita que Fable 5.1 desperdicie tokens

@dr_cintas
INGLÉS02 sept 2026
180K
68
6
1
210

TL;DR

Alvaro Cintas comparte un flujo de trabajo para optimizar el consumo de tokens en Fable 5.1, centrándose en los niveles de esfuerzo de razonamiento, la higiene de los prompts y herramientas de compresión especializadas.

Fable 5.1 es una bestia. Y quema tokens como tal.

Aquí te explico cómo reducir el desperdicio de tokens con cuatro comandos y repositorios open-source gratuitos que lo reducen aún más.

Nada de esto afecta la calidad del resultado. Cambia lo que pagas por el mismo resultado.

Y funciona tanto si usas Fable 5.1 como si no, porque el costo de los tokens se acumula de la misma manera independientemente del modelo que ejecutes.

Ahora empecemos.

Paso 1: Reduce tu nivel de esfuerzo.

Este es el truco más importante, y es una configuración que puedes controlar en cada solicitud.

Hay cinco niveles: low, medium, high, xhigh y max.

El esfuerzo controla cuánto razona el modelo antes de responder. Un mayor esfuerzo significa más pensamiento antes de una respuesta, lo que cuesta más tokens, independientemente de si la tarea realmente necesitaba ese razonamiento.

Así es como debes pensar en ello. El nivel de esfuerzo es cuánto tiempo dejas que alguien piense antes de responder. Pregúntale a cualquiera cuánto es 2+2 y te dirá "4". Pídele que piense mucho durante diez minutos primero, y pagas por diez minutos de pensamiento para obtener el mismo "4".

Bueno... la mayoría de las tareas son 2+2.

La guía de Anthropic para Fable 5.1 es: empieza en high, que es el valor predeterminado. Sube a xhigh o max solo para los trabajos de codificación y agente más sensibles a la capacidad. Baja a medium o low para tareas rutinarias o sensibles a la latencia, una vez que confirmes que el nivel inferior sigue manteniendo la calidad.

Alvaro Cintas - inline image

Las cifras son increíbles. En CursorBench, Fable 5.1 con esfuerzo low obtuvo una puntuación más alta que Fable 5 con esfuerzo high, a un tercio del costo.

Pruébalo antes de confiar en ello. Elige una tarea cuya respuesta correcta ya conozcas y luego ejecútala en low.

"Ejecuta esta solicitud con esfuerzo low y dime qué cambió en la respuesta"

Usa una de tus tareas reales. Compara el resultado directamente antes de asumir que un esfuerzo low significa peores resultados. Mantén las tareas pesadas, el razonamiento de varios pasos, la depuración real, cualquier cosa donde una respuesta incorrecta te cueste tiempo después, en high o superior.

Paso 2: Ejecuta cost-optimize.

Esto se lanzó el 26 de agosto como parte de la habilidad claude-api. Analiza el uso reciente y clasifica las palancas de costo que importan para un proyecto específico.

bash
1/claude-api cost-optimize

Verifica el almacenamiento en caché, la higiene de tokens, el procesamiento por lotes, el nivel de esfuerzo y la elección del modelo, en ese orden. El almacenamiento en caché y la higiene de tokens suelen ser las soluciones más económicas y se amortizan más rápido, antes de que sugiera algo estructural como cambiar de modelo.

Alvaro Cintas - inline image

Cada sugerencia se aprueba o se omite de una en una. Nada cambia sin confirmación, por lo que no hay riesgo de que reescriba una configuración.

Paso 3: Ejecuta prompt-audit.

Los prompts y las habilidades acumulan basura con el tiempo.

Piénsalo como un cajón de trastos. Cada edición añade una cosa más, y nunca lo limpias. Excepto que este "cajón" te cobra tokens por cada solicitud, para siempre, hasta que se elimine la basura.

bash
1/claude-api prompt-audit
Alvaro Cintas - inline image

Ejecútalo en cualquier carpeta de Skills que tengas. Las habilidades antiguas, esas que probablemente has editado una y otra vez, son exactamente donde encuentra más desperdicio. Cada edición añadió algo sin eliminar lo que reemplazó. Ejecuta esto y notarás la diferencia.

Paso 4: Migra las configuraciones antiguas de la API.

Si un proyecto todavía está ejecutando una configuración creada para un modelo anterior, esto maneja el intercambio de ID del modelo junto con cualquier cambio de parámetros que rompa la compatibilidad en toda la base de código.

bash
1/claude-api migra este proyecto a claude-fable-5-1

Nombra el modelo de destino real. Primero confirma el alcance (todo el directorio de trabajo, un subdirectorio o una lista específica de archivos) antes de editar cualquier cosa. Luego te devuelve una lista de verificación de lo que queda por verificar manualmente.

Cuatro repositorios para reducir aún más el desperdicio.

Estos no son específicos de Fable 5.1. En cualquier modelo, se aplica el mismo ahorro de tokens, por lo que es bueno saber qué hay disponible y qué hace cada uno.

Caveman

Alvaro Cintas - inline image

Comprime las respuestas del propio modelo en respuestas cortas y telegráficas en lugar de verbosas.

Configuración:

bash
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash

RTK

Alvaro Cintas - inline image

Un proxy en Rust que comprime la salida de los comandos del shell antes de que llegue al contexto del modelo.

Configuración:

bash
1brew install rtk
2rtk init -g

Ponytail

Alvaro Cintas - inline image

Hace que el agente escriba menos código desde el principio. Una perspectiva de desarrollador senior que elige una línea en lugar de cincuenta.

Configuración:

bash
1/plugin marketplace add DietrichGebert/ponytail
2/plugin install ponytail@ponytail

CodeGraph

Alvaro Cintas - inline image

Este funciona de manera completamente diferente. En lugar de comprimir texto, construye un grafo de conocimiento de la base de código, para que el agente pueda consultar las relaciones de símbolos y los grafos de llamadas directamente, en lugar de escanear archivos con grep y read.

Configuración:

bash
1npx @colbymchenry/codegraph
2cd tu-proyecto
3codegraph init -i

Por dónde empezar.

Si no haces nada más, haz el Paso 1. Reduce el nivel de esfuerzo en la próxima tarea rutinaria y compara el resultado. Esa única configuración hace más por tus créditos que cualquier repositorio, y no cuesta nada probarlo.

Luego ejecuta cost-optimize y prompt-audit en cualquiera de tus proyectos.

Las cuatro configuraciones confirmadas por el propio equipo de Anthropic superan cualquier cosa instalada desde un repositorio. Después de eso, explora el ecosistema más amplio con los cuatro repositorios que te he dado.

Si esto te ha ahorrado tokens/dinero, asegúrate de darle "me gusta" y compartirlo con tu red.

¡Nos vemos en la próxima :)

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales