Evita que Fable 5.1 desperdicie tokens

@dr_cintas
INGLÉS02 sept 2026
180K
68
6
1
210

TL;DR

Alvaro Cintas comparte un flujo de trabajo para optimizar el consumo de tokens en Fable 5.1, centrándose en los niveles de esfuerzo de razonamiento, la higiene de los prompts y herramientas de compresión especializadas.

Fable 5.1 es una bestia. Y quema tokens como tal.

Aquí te explico cómo reducir el desperdicio de tokens con cuatro comandos y repositorios open-source gratuitos que lo reducen aún más.

Nada de esto afecta la calidad del resultado. Cambia por lo que pagas por el mismo resultado.

Y funciona tanto si usas Fable 5.1 como si no, porque el costo de los tokens se acumula de la misma manera sin importar el modelo que ejecutes.

Ahora empecemos.

Paso 1: Reduce tu nivel de esfuerzo.

Este es el truco más importante, y es una configuración que puedes controlar en cada solicitud.

Hay cinco niveles: bajo, medio, alto, muy alto y máximo.

El esfuerzo controla cuánto razona el modelo antes de responder. Un mayor esfuerzo significa más pensamiento antes de una respuesta, lo que cuesta más tokens, independientemente de si la tarea realmente necesitaba ese razonamiento.

Así es como debes pensar en ello. El nivel de esfuerzo es cuánto tiempo dejas que alguien piense antes de responder. Pregúntale a cualquiera cuánto es 2+2 y dirá "4". Pídele que piense mucho durante diez minutos primero, y pagas por diez minutos de pensamiento para obtener el mismo "4".

Bueno... la mayoría de las tareas son 2+2.

La guía de Anthropic para Fable 5.1 es: comienza en alto, que es el valor predeterminado. Sube a muy alto o máximo solo para el trabajo de codificación y agente más sensible a la capacidad. Baja a medio o bajo para tareas rutinarias o sensibles a la latencia, una vez que se confirme que el nivel inferior aún mantiene la calidad.

Alvaro Cintas - inline image

Los números son increíbles. En CursorBench, Fable 5.1 con esfuerzo bajo obtuvo una puntuación más alta que Fable 5 con esfuerzo alto, a un tercio del costo.

Pruébalo antes de confiar en ello. Elige una tarea donde ya se sepa la respuesta correcta, luego ejecútala con esfuerzo bajo.

"Ejecuta esta solicitud con esfuerzo bajo y dime qué cambió en la respuesta"

Usa una de tus tareas reales. Compara la salida directamente antes de asumir que un esfuerzo bajo significa peores resultados. Mantén las tareas pesadas, el razonamiento de múltiples pasos, la depuración real, cualquier cosa donde una respuesta incorrecta cueste tiempo después, en alto o superior.

Paso 2: Ejecuta cost-optimize.

Este se lanzó el 26 de agosto como parte de la habilidad claude-api. Analiza el uso reciente y clasifica las palancas de costo que importan para un proyecto específico.

bash
1/claude-api cost-optimize

Verifica el almacenamiento en caché, la higiene de tokens, el procesamiento por lotes, el nivel de esfuerzo y la elección del modelo, en ese orden. El almacenamiento en caché y la higiene de tokens suelen ser las soluciones más económicas y se amortizan más rápido, antes de que sugiera algo estructural como cambiar de modelo.

Alvaro Cintas - inline image

Cada sugerencia se aprueba o se omite de una en una. Nada cambia sin confirmación, por lo que no hay riesgo de que reescriba una configuración.

Paso 3: Ejecuta prompt-audit.

Los prompts y las habilidades acumulan basura con el tiempo.

Piénsalo como un cajón de trastos. Cada edición agrega una cosa más, y nunca lo limpias. Excepto que este "cajón" te cobra tokens por cada solicitud, para siempre, hasta que se elimine la basura.

bash
1/claude-api prompt-audit
Alvaro Cintas - inline image

Ejecútalo en cualquier carpeta de Skills que tengas. Las habilidades antiguas, esas que probablemente has editado una y otra vez, son exactamente donde encuentra más desperdicio. Cada edición agregó algo sin eliminar lo que reemplazó. Ejecuta esto y notarás la diferencia.

Paso 4: Migra configuraciones antiguas de la API.

Si un proyecto aún ejecuta una configuración creada para un modelo anterior, esto maneja el cambio de ID del modelo junto con cualquier cambio de parámetros que rompa la compatibilidad en toda la base de código.

bash
1/claude-api migrate this project to claude-fable-5-1

Nombra el modelo de destino real. Primero confirma el alcance, todo el directorio de trabajo, un subdirectorio o una lista específica de archivos, antes de editar algo. Luego te devuelve una lista de verificación de lo que queda por verificar manualmente.

Cuatro repositorios para reducir aún más el desperdicio.

Estos no son específicos de Fable 5.1. En cualquier modelo, se aplica el mismo ahorro de tokens, por lo que es bueno saber qué hay disponible y qué hace realmente cada uno.

Caveman

Alvaro Cintas - inline image

Comprime las propias respuestas del modelo en respuestas cortas y telegráficas en lugar de verbosas.

Configuración:

bash
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash

RTK

Alvaro Cintas - inline image

Un proxy en Rust que comprime la salida de los comandos del shell antes de que llegue al contexto del modelo.

Configuración:

bash
1brew install rtk
2rtk init -g

Ponytail

Alvaro Cintas - inline image

Hace que el agente escriba menos código en primer lugar. Una lente de desarrollador senior que elige una línea sobre cincuenta.

Configuración:

bash
1/plugin marketplace add DietrichGebert/ponytail
2/plugin install ponytail@ponytail

CodeGraph

Alvaro Cintas - inline image

Este funciona de manera completamente diferente. En lugar de comprimir texto, construye un grafo de conocimiento de la base de código, para que el agente pueda consultar las relaciones de símbolos y los grafos de llamadas directamente, en lugar de escanear archivos con grep y read.

Configuración:

bash
1npx @colbymchenry/codegraph
2cd tu-proyecto
3codegraph init -i

Por dónde empezar.

Si no se hace nada más, haz el Paso 1. Reduce el nivel de esfuerzo en la próxima tarea rutinaria y compara el resultado. Esa única configuración hace más por tus créditos que cualquier repositorio, y no cuesta nada probarlo.

Luego ejecuta cost-optimize y prompt-audit en cualquiera de tus proyectos.

Las cuatro configuraciones confirmadas por el propio equipo de Anthropic superan cualquier cosa instalada desde un repositorio. Después de eso, explora el ecosistema más amplio con los cuatro repositorios que te di.

Si esto te ahorró tokens/dinero, asegúrate de darle like y compartirlo con tu red.

¡Nos vemos en la próxima! :)

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales