Integra Claude Fable 5.1 y Gemini 3.8 Flash en el mismo equipo

@GoogleCloudTech
INGLÉS14 sept 2026
129K
822
70
44
765

TL;DR

Esta guía demuestra cómo optimizar los costos y el rendimiento de los agentes de IA combinando Claude Fable 5.1 para la planificación profunda y Gemini 3.8 Flash para la ejecución rápida dentro de Google Cloud's Gemini Enterprise Agent Platform.

Un colega me hizo una pregunta trivial en el trabajo y usé un agente para que investigara mis chats y documentos recientes. Encontró la respuesta correcta, pero ¡me costó 38 USD!!!. Fue un mal retorno de inversión (ROI). Es cierto que mi tiempo es valioso, pero no habría invertido ese tiempo real y esta tarea no necesitaba realmente capacidades de planificación avanzadas y costosas.

Podemos hacerlo mejor.

La plataforma Gemini Enterprise Agent Platform de Google Cloud ofrece Model Garden, con acceso API conveniente a muchos modelos principales, incluidos los de Google, Anthropic e incluso xAI. De hecho, todos los modelos de Huggingface están disponibles para desplegarlos por tu cuenta, pero en este artículo nos centraremos en el nuevo Claude Fable 5.1 de Anthropic y el nuevo Gemini 3.8 Flash de Google. Los desarrolladores ahora tienen dos modelos frontera de arquitecturas distintas detrás de la misma interfaz API empresarial.

Fable 5.1 trae planificación autónoma de clase Mythos, una ventana de contexto de 1 millón de tokens y una diligencia profunda en múltiples pasos. Gemini 3.8 Flash ofrece razonamiento casi fronterizo y una velocidad de tokens increíble con la economía de Flash ($0.75 por millón de tokens de entrada, $3.75 por millón de tokens de salida) junto con controles de pensamiento ajustables.

Puede parecer fácil elegir uno y enrutar todo a través de él. Eso es un error.

Si haces pasar el trabajo rutinario de desarrollo por un planificador profundo, estás pagando tarifas de tokens frontera solo para analizar diffs de git. Si obligas a un modelo rápido a abordar una migración de base de datos irreversible sin un plan formal, avanzará a toda velocidad y romperá el estado antes de que termines tu café.

Podemos mejorar enormemente la “tokenómica” de forma muy sencilla, usando 2 modelos y enrutando tareas.

Google Cloud Tech - inline image

Por Alan Blount (@zeroasterisk

Aquí tienes la guía completa para lograrlo:

  1. Configura ambos modelos detrás de un único plano de gobernanza unificado.
  2. Realiza pruebas de referencia (benchmarks) de tareas rutinarias antes de elegir un valor predeterminado.
  3. Usa el modelo rápido como coordinador de primera línea y usa el planificador profundo siempre que sepas que necesitas más potencia o cuando el modelo rápido necesite escalar.
  4. Crea un modelo mental sobre el ROI de las tareas y el valor (no solo el costo) de tus tokens.

1. Configura ambos modelos detrás de un único plano de gobernanza unificado

Elegir tu plataforma de inferencia LLM requiere considerar muchas decisiones de diseño. Costo, capacidad, seguridad, elección de modelo, funciones de servicio, fricción para el desarrollador, más seguridad aún (las claves API son arriesgadas). Gemini Enterprise Agent Platform (anteriormente Vertex AI) es una opción integral con capacidades únicas, y dado que expone tanto los modelos de Gemini como los de Anthropic como APIs gestionadas, una sola autenticación segura cubre ambas cargas de trabajo.

Pero seamos honestos, algunos procesos tienen más fricción de la que me gustaría. Me gusta bromear diciendo que “las cosas imposibles son fáciles, pero las cosas fáciles son difíciles”. Esa es parte de la razón por la que escribo esta publicación.

Antes de tratar con los modelos, inicia sesión en gcloud y lee la documentación para ver variaciones.

bash
1gcloud auth application-default login

Para acceder a Claude Fable 5.1, necesitas habilitar la API y luego habilitar Claude Fable 5.1 y completar un formulario muy rápido sobre tu caso de uso. Pero aún no has terminado.

Ahora, Fable está sujeto al Anexo de Seguridad de IA Avanzada de Google Cloud. Antes de poder enviar un solo prompt a aiplatform.googleapis.com, debes configurar explícitamente el intercambio de respuestas de prompts y aceptar los términos del editor a nivel de proyecto.

Aquí están las instrucciones exactas que funcionan para el endpoint global; lee la documentación para ver variaciones.

Primero configuremos algunas variables que nos ayudarán. Ten en cuenta que el nombre del modelo en la ruta URL es claude-fable-5-1 con guiones, no puntos, y asegúrate de ingresar tu ID de proyecto y ubicación, y posiblemente cambia tu endpoint según tu región:

bash
1export PROJECT_ID="YOUR_PROJECT_ID"
2export LOCATION="global"
3export MODEL="claude-fable-5-1"
4
5# Global endpoint: aiplatform.googleapis.com (recommended)
6# Multi-Regional endpoints: aiplatform.eu.rep.googleapis.com# Regional endpoints: us-central1-aiplatform.googleapis.com
7export ENDPOINT="https://aiplatform.googleapis.com"

Llama a la API setPublisherModelConfig estableciendo dataSharingEnabledProvider en ANTHROPIC - ten en cuenta que esto está en mayúsculas:

bash
1curl -X POST \
2 -H "Authorization: Bearer $(gcloud auth print-access-token)" \
3 -H "Content-Type: application/json; charset=utf-8" \
4 -d '{ "publisherModelConfig": { "dataSharingEnabledProvider": "ANTHROPIC" } }' \
5"${ENDPOINT}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/anthropic/models/${MODEL}:setPublisherModelConfig"

La llamada inicial devuelve un objeto de operación completada confirmando que el intercambio de datos está activo:

json
1{
2 "name": "projects/YOUR_PROJECT_NUMBER/locations/global/operations/1234567",
3 "metadata": {
4 "@type": "type.googleapis.com/google.cloud.aiplatform.v1beta1.SetPublisherModelConfigOperationMetadata",
5 "genericMetadata": {
6 "createTime": "...",
7 "updateTime": "..."
8 }
9 },
10 "done": true,
11 "response": {
12 "@type": "type.googleapis.com/google.cloud.aiplatform.v1beta1.PublisherModelConfig",
13 "loggingConfig": {},
14 "dataSharingEnabledProvider": "ANTHROPIC"
15 }
16}

Si ya has hecho esto, obtendrás un error HTTP 409 indicando que esta configuración ya existe:

text
1409 ALREADY_EXISTS: The same PublisherModelConfig already exists.

Este error 409 no es un problema en absoluto.

Prueba tu acceso al modelo y deberías obtener una respuesta:

bash
1curl -X POST \
2 -H "Authorization: Bearer $(gcloud auth print-access-token)" \
3 -H "Content-Type: application/json; charset=utf-8" \
4 -d '{"anthropic_version": "vertex-2023-10-16","messages": [{"role": "user", "content": "Hello world."}], "max_tokens": 1024, "stream": true}' \
5"${ENDPOINT}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/anthropic/models/${MODEL}:streamRawPredict"

Si no lo hiciste correctamente, obtendrás un error HTTP 403 que se ve así:

text
1403 PERMISSION_DENIED: Access to this model requires data sharing to be enabled for publisher 'anthropic'. Please set `PublisherModelConfig.data_sharing_enabled_provider`
2to 'anthropic' via the setPublisherModelConfig API to use this model.

Para acceder a Gemini 3.8 Flash, asegúrate de verlo como modelo habilitado en la tarjeta del modelo y debería funcionar directamente:

bash
1curl -X POST \
2 -H "Authorization: Bearer $(gcloud auth print-access-token)" \
3 -H "Content-Type: application/json; charset=utf-8" \
4 -d '{"contents": [{"role": "user", "parts": [{"text": "Hello world"}]}],"generationConfig": {"thinkingConfig": {"thinkingLevel": "LOW"}}}' \
5"${ENDPOINT}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/google/models/gemini-3.8-flash:streamGenerateContent"

…uf. Lo logramos 🎉!

¿Necesitas más cuota? Puedes gestionar cuotas para cualquier modelo y pagar por rendimiento aprovisionado para algunos modelos.

2. No confíes en los benchmarks, ejecuta los tuyos propios

Si le preguntas a cinco ingenieros qué modelo usar para una configuración de agentes, obtendrás más de cinco opiniones contradictorias basadas en las vibras de Twitter y tablas de clasificación sintéticas.

Los benchmarks públicos proporcionan un recurso fantástico, pero prueban prompts aislados o cada vez más tareas en el vacío. Los casos de uso de producción, o tus agentes locales de SDLC agéntico, nunca coinciden perfectamente con los benchmarks públicos. Tu trabajo tiene una forma diferente a cualquier benchmark hoy en día.

Así que podrías construir tus propios benchmarks (¡Agent Ops y Evals FTW!) y automatizar esto a escala, o simplemente puedes hacer tus propias tareas simples lado a lado. Siempre que no cambies los archivos en tu tarea, deberías estar bien y con casi ningún esfuerzo obtendrás una sensación para las tareas.

Aquí hay un ejemplo usando promptfoo para impulsar opencode a realizar las mismas 2 tareas con cada modelo. Querrás cambiar la descripción de la tarea y configurar tu entorno para que esto funcione, pero no debería ser demasiado difícil.

Google Cloud Tech - inline image

GIF

json
1# opencode.json
2{
3 "$schema": "https://opencode.ai/config.json",
4 "provider": {
5 "google-vertex": {
6 "options": { "project": "alanblount-demo", "location": "global" },
7 "models": {
8 "gemini-3.8-flash": { "id": "gemini-3.8-flash", "name": "Gemini 3.8 Flash" }
9 }
10 },
11 "google-vertex-anthropic": {
12 "options": { "project": "alanblount-demo", "location": "global" },
13 "models": {
14 "claude-fable-5-1": { "id": "claude-fable-5-1", "name": "Claude Fable 5.1" }
15 }
16 }
17 },
18...

Configura Promptfoo para comparar ejecuciones de tareas agénticas de opencode, no solo prompts individuales y modelos.

text
1# promptfooconfig.yaml
2description: "Benchmarking OpenCode Agent Harness: Gemini 3.8 Flash vs. Claude Fable 5.1"
3
4prompts:
5 - "Summarize git branch status in one sentence."
6 - "Design a zero-downtime database migration strategy from Postgres to Spanner."
7
8providers:
9 - id: "exec:opencode run --auto -m google-vertex/gemini-3.8-flash"
10 label: "Gemini 3.8 Flash (OpenCode Agent)"
11 - id: "exec:opencode run --auto -m google-vertex-anthropic/claude-fable-5-1"
12 label: "Claude Fable 5.1 (OpenCode Agent)"
13
14defaultTest:
15 options:
16 timeoutMs: 60000

Ejecuta tu propia comparación lado a lado usando Promptfoo:

promptfoo eval -c promptfooconfig.yaml --no-cache

Aquí están mis resultados al ejecutar esta evaluación en un contenedor de desarrollo limpio:

Google Cloud Tech - inline image

Al revisar una rama de PR, Claude Fable 5.1 realizó múltiples turnos de meta-reflexión, re-inspeccionando hashes de árbol que no habían cambiado. Tomó casi 6 segundos y costó 23 veces más. Gemini 3.8 Flash reconoció la intención instantáneamente, disparó las herramientas de git y respondió en 1.1 segundos por menos de una décima parte de centavo.

En la compleja migración de base de datos, la situación se invirtió. Gemini 3.8 Flash produjo una secuencia lineal sólida y limpia en 3 segundos. Pero Fable 5.1 gastó 12 segundos generando un grafo acíclico dirigido (DAG) completo y formal. Identificó riesgos de desajuste de reloj en escrituras duales, generó requisitos de claves de idempotencia y definió una puerta de reversión reversible.

Esto es solo un ejemplo ilustrativo, debes comparar con tus propias tareas.

3. Uso práctico en el día a día y en producción

Ya sea que uses herramientas de codificación estándar o construyas servicios de agentes personalizados, el patrón ganador es la coordinación asimétrica: velocidad barata para la ejecución de primera línea, combinada con profundidad deliberada para puntos de control arquitectónicos. Gasta tokens caros en problemas complicados o trabajo de planificación, pero usa tokens más baratos por defecto para tareas más simples.

Arneses de Agentes de Codificación (OpenCode, Aider, etc.)

No fuerces a un modelo a ser tu valor predeterminado universal. Configura subagentes especializados mapeados a distintos modelos. Usar el mismo proveedor unificado viene con beneficios de seguridad y costos. Usar diferentes familias de modelos puede beneficiarse de que se revisen entre sí.

Usa el agente pensador profundo para identificar la causa raíz y planificar una solución para este problema, y luego usa el agente trabajador para manejar cada una de las tareas e informar el estado. El planificador profundo revisa su trabajo y confirma el éxito o reasigna.

text
1# opencode.json
2{
3 "$schema": "https://opencode.ai/config.json",
4 "model": "google-vertex/gemini-flash-latest",
5 "agent": {
6 "plan": {
7 "model": "google-vertex/gemini-flash-latest"
8 },
9 "build": {
10 "model": "google-vertex/gemini-flash-latest"
11 },
12 "worker": {
13 "model": "google-vertex/gemini-3.8-flash",
14 "mode": "primary",
15 "description": "General worker agent using gemini-3.8-flash"
16 },
17 "deep-thinker": {
18 "model": "google-vertex-anthropic/claude-fable-5-1@default",
19 "mode": "primary",
20 "description": "Deep thinking agent using Claude Fable 5.1"
21 }
22 },
23...

Agentes Personalizados "como Servicio" (Google ADK, LangGraph, código personalizado, etc.)

Cuando construyes tus propios arneses de agentes y tus propios servicios de agentes, tienes libertad arquitectónica completa.

  • Rediseña el arnés para el modelo: Dale a Gemini 3.8 Flash de 3 a 5 herramientas enfocadas (read_file, write_file, run_tests) con esquemas JSON estrictos. Los modelos rápidos sobresalen en la ejecución enfocada, pero un catálogo de 50 herramientas causa confusión de parámetros y desperdicio de contexto. Dale a Claude Fable 5.1 documentos de arquitectura, esquemas y pautas, pero elimina los permisos directos de escritura de archivos.
  • Fundamenta en Evals: No adivines qué modelo se ajusta a qué nodo. Ejecuta suites de evaluación automatizadas con comprobaciones de aserción deterministas en las tareas de tu repositorio para encontrar dónde un modelo más pequeño entrega un 95% de calidad al 10% del costo. Esto es fácil de decir pero difícil de hacer, difícil saber qué escenarios quieres evaluar. Consulta nuestros cursos de Kaggle de 5 días (agentes, vibecoding) para más información.
  • Usa el Patrón de Escalado "Pedir Ayuda": Comienza cada solicitud entrante en el trabajador rápido. Dale al trabajador una herramienta explícita: ask_for_help(reason, failed_attempts, context). El trabajador maneja del 85% al 90% de las solicitudes directamente. Solo escala ante ambigüedad, acciones irreversibles o dos fallos consecutivos de herramientas.

La Prueba de Realidad sobre los Enrutadores de Modelos "Inteligentes" Automatizados

Los enrutadores inteligentes tienen una larga historia en ML predictivo (tecnología publicitaria, detección de fraude). Los bandidos multi-brazo y los enrutadores de costo-calidad son maduros porque las características son tabulares, las entradas están limitadas y la retroalimentación (clics, contracargos) es tanto inmediata como medible en un horizonte temporal largo.

En la IA generativa, los agentes de múltiples turnos son otra historia. Los enrutadores dinámicos pueden tener dificultades con tres realidades de producción:

  • El contexto de un solo turno puede no contener suficiente señal sobre la tarea para elegir.
  • Las métricas de éxito no se extrapolan claramente a las características, por lo que el enrutador no puede "aprender" rápidamente.
  • Las elecciones falsas se vuelven a ejecutar en la otra ruta, comiéndose cualquier ahorro potencial y añadiendo latencia.

El Veredicto: Mantén las cosas aburridas. Compón tus agentes explícitamente y enruta por límite de tarea. Define roles claros y deja que las aserciones de código concretas o la intención humana controlen los traspasos.

4. La Ecuación del ROI de Tokens: ¿Qué Estás Pagando Realmente?

Las hojas de precios brutos ($/1M tokens) no son un buen mapa del valor de producción. Calcular costos es solo parte de la ecuación. Es imposible darte un cálculo que siempre funcione, a través de la codificación, el producto, la fabricación y cualquier otro trabajo por hacer.

Un punto de partida podría ser pensar en el valor comercial que estás obteniendo.

  • El costo del tiempo humano ahorrado, empleados completando más trabajo y pasando menos tiempo en tareas tediosas y automatizadas.
  • El valor de lanzar funciones a producción más rápido, mientras mejoras la satisfacción y retención del cliente gracias a esas funciones.
  • Los errores mitigados y las interrupciones de producción evitadas debido a mejores salvaguardias y prácticas de ingeniería.

Resta el costo de tokens y el costo de capacitar a tu equipo para construir y gestionar sus agentes, y tendrás un cálculo aproximado de ROI.

Google Cloud Tech - inline image

Puedes influir en estos cálculos usando menos y más baratos tokens, pero probablemente los influirás más haciendo más trabajo, más rápido. Elige tareas de alto apalancamiento. Elige tareas que resulten en ahorros de gastos generales o aumento de ingresos, que puedan verificarse y que merezcan ser automatizadas. Y mientras descompones esas tareas, quizás quieras pensar profundamente y planificar y estés dispuesto a pagar más y esperar, o quizás quieras ejecutar rápido y de manera fiable. Necesitarás ambas cosas.

La tokenómica es un tema candente ahora mismo, y hay muchas más opciones para reducir costos y maximizar el valor. El punto principal de este artículo es que es realmente sencillo configurar unos pocos agentes diferentes en 2 modelos con perfiles distintos y enrutarte tú mismo las tareas. Ese es el lugar más fácil para empezar.

Si encontraste útil este desglose, consulta nuestra pieza anterior sobre 5 cosas que cada ingeniero de IA debe saber sobre los sandboxes de agentes. Sigue a @GoogleCloudTech y @zeroasterisk para más análisis profundos desde las trincheras de los creadores.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales