Faites équipe avec Claude Fable 5.1 et Gemini 3.8 Flash

129K
822
70
44
765

TL;DR

Ce guide démontre comment optimiser les coûts et les performances des agents IA en combinant Claude Fable 5.1 pour la planification approfondie et Gemini 3.8 Flash pour l'exécution rapide au sein de la plateforme Google Cloud's Gemini Enterprise Agent Platform.

Un collègue m’a posé une question anodine au travail et j’ai lancé un agent pour qu’il fouille dans mes discussions récentes et mes documents. Il a trouvé la bonne réponse, mais ça m’a coûté 38 $ !!!. Le retour sur investissement était nul. Certes, mon temps a de la valeur, mais je n’aurais jamais consacré ce temps-là à cette tâche, qui ne nécessitait pas vraiment des capacités de planification coûteuses.

On peut faire mieux.

La plateforme d’agents Gemini Enterprise de Google Cloud propose Model Garden, avec un accès API pratique à de nombreux modèles de pointe, y compris ceux de Google, d’Anthropic et même de xAI. En fait, tous les modèles présents sur Huggingface sont disponibles pour un déploiement autonome, mais pour cet article, nous nous concentrerons sur le nouveau Claude Fable 5.1 d’Anthropic et le nouveau Gemini 3.8 Flash de Google. Les développeurs disposent désormais de deux modèles de pointe aux architectures différentes, accessibles via la même interface API entreprise.

Fable 5.1 offre une planification autonome de classe Mythos, une fenêtre de contexte d’un million de jetons et une analyse approfondie en plusieurs étapes. Gemini 3.8 Flash apporte un raisonnement quasi équivalent aux modèles de pointe et une vitesse de traitement des jetons impressionnante à des coûts optimisés (0,75 $ par million de jetons d’entrée, 3,75 $ par million de jetons de sortie), avec des contrôles de réflexion ajustables.

Il pourrait être tentant de choisir l’un des deux et de tout router vers lui. C’est une erreur.

Si vous faites passer des tâches courantes de développement par un planificateur profond, vous payez le prix fort en jetons juste pour analyser des diffs Git. Si vous forcez un modèle rapide à gérer une migration de base de données irréversible sans plan formel, il foncera tête baissée et cassera l’état du système avant que vous ayez fini votre café.

Nous pouvons améliorer considérablement notre « tokenomics » très simplement, en utilisant deux modèles et en routant les tâches intelligemment.

Google Cloud Tech - inline image

Par Alan Blount (@zeroasterisk

Voici le guide complet pour y arriver :

  1. Configurez les deux modèles derrière un seul plan de gouvernance unifié.
  2. Effectuez des benchmarks sur les tâches courantes avant de choisir un modèle par défaut.
  3. Utilisez le modèle rapide comme coordinateur de première ligne et le planificateur profond chaque fois que vous savez avoir besoin de plus de puissance ou lorsque le modèle rapide doit escalader la demande.
  4. Développez une intuition sur le ROI des tâches et la valeur (pas seulement le coût) de vos jetons.

1. Configurez les deux modèles derrière un seul plan de gouvernance unifié

Le choix de votre plateforme d’inférence LLM nécessite de prendre en compte de nombreuses décisions de conception. Coût, capacité, sécurité, choix du modèle, fonctionnalités de service, friction pour les développeurs, encore plus de sécurité (les clés API sont risquées). La plateforme d’agents Gemini Enterprise (anciennement Vertex AI) est une option complète dotée de capacités uniques, et comme elle expose à la fois les modèles Gemini et Anthropic sous forme d’APIs gérées, une seule authentification sécurisée couvre les deux charges de travail.

Mais soyons honnêtes, certains parcours comportent plus de frictions que je ne le souhaiterais. J’aime dire que « les choses impossibles sont faciles, mais les choses faciles sont difficiles ». C’est en partie pourquoi j’écris cet article.

Avant de travailler avec les modèles, connectez-vous à gcloud, lisez la documentation pour connaître les variantes.

bash
1gcloud auth application-default login

Pour accéder à Claude Fable 5.1, vous devez activer l’API, puis activer Claude Fable 5.1 et remplir un formulaire très rapide concernant votre cas d’utilisation. Mais vous n’avez pas encore terminé.

Désormais, Fable relève de l’Addendum de Sécurité Avancée pour l’IA de Google Cloud. Avant de pouvoir envoyer la moindre invite à aiplatform.googleapis.com, vous devez explicitement configurer le partage des invites-réponses et accepter les conditions de l’éditeur au niveau du projet.

Voici les instructions exactes qui fonctionnent pour le point de terminaison global, lisez la documentation pour connaître les variantes.

Commençons par définir quelques variables qui nous seront utiles. Notez que le nom du modèle dans le chemin de l’URL est claude-fable-5-1 avec des tirets, pas des points, et assurez-vous de saisir votre ID de projet et votre emplacement, puis éventuellement de modifier votre point de terminaison selon votre région :

bash
1export PROJECT_ID="YOUR_PROJECT_ID"
2export LOCATION="global"
3export MODEL="claude-fable-5-1"
4
5# Global endpoint: aiplatform.googleapis.com (recommended)
6# Multi-Regional endpoints: aiplatform.eu.rep.googleapis.com# Regional endpoints: us-central1-aiplatform.googleapis.com
7export ENDPOINT="https://aiplatform.googleapis.com"

Appelez ensuite l’API setPublisherModelConfig en définissant dataSharingEnabledProvider sur ANTHROPIC - notez que cela est écrit en majuscules :

bash
1curl -X POST \
2 -H "Authorization: Bearer $(gcloud auth print-access-token)" \
3 -H "Content-Type: application/json; charset=utf-8" \
4 -d '{ "publisherModelConfig": { "dataSharingEnabledProvider": "ANTHROPIC" } }' \
5"${ENDPOINT}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/anthropic/models/${MODEL}:setPublisherModelConfig"

L’appel initial renvoie un objet d’opération achevée confirmant que le partage de données est actif :

json
1{
2 "name": "projects/YOUR_PROJECT_NUMBER/locations/global/operations/1234567",
3 "metadata": {
4 "@type": "type.googleapis.com/google.cloud.aiplatform.v1beta1.SetPublisherModelConfigOperationMetadata",
5 "genericMetadata": {
6 "createTime": "...",
7 "updateTime": "..."
8 }
9 },
10 "done": true,
11 "response": {
12 "@type": "type.googleapis.com/google.cloud.aiplatform.v1beta1.PublisherModelConfig",
13 "loggingConfig": {},
14 "dataSharingEnabledProvider": "ANTHROPIC"
15 }
16}

Si vous avez déjà effectué cette opération, vous recevrez une erreur HTTP 409 indiquant que ce paramètre existe déjà :

text
1409 ALREADY_EXISTS: The same PublisherModelConfig already exists.

Cette erreur 409 n’est absolument pas un problème.

Testez votre accès au modèle, et vous devriez recevoir une réponse :

bash
1curl -X POST \
2 -H "Authorization: Bearer $(gcloud auth print-access-token)" \
3 -H "Content-Type: application/json; charset=utf-8" \
4 -d '{"anthropic_version": "vertex-2023-10-16","messages": [{"role": "user", "content": "Hello world."}], "max_tokens": 1024, "stream": true}' \
5"${ENDPOINT}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/anthropic/models/${MODEL}:streamRawPredict"

Si vous n’avez pas correctement configuré cela, vous obtiendrez une erreur HTTP 403 qui ressemble à ceci :

text
1403 PERMISSION_DENIED: Access to this model requires data sharing to be enabled for publisher 'anthropic'. Please set `PublisherModelConfig.data_sharing_enabled_provider`
2to 'anthropic' via the setPublisherModelConfig API to use this model.

Pour accéder à Gemini 3.8 Flash, assurez-vous de voir la carte du modèle comme activée et cela devrait fonctionner directement :

bash
1curl -X POST \
2 -H "Authorization: Bearer $(gcloud auth print-access-token)" \
3 -H "Content-Type: application/json; charset=utf-8" \
4 -d '{"contents": [{"role": "user", "parts": [{"text": "Hello world"}]}],"generationConfig": {"thinkingConfig": {"thinkingLevel": "LOW"}}}' \
5"${ENDPOINT}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/google/models/gemini-3.8-flash:streamGenerateContent"

… Ouf. Nous avons réussi 🎉 !

Besoin de plus de quota ? Vous pouvez gérer les quotas pour n’importe quel modèle et payer pour le débit provisionné pour certains modèles.

2. Ne faites pas confiance aux benchmarks, lancez les vôtres

Si vous demandez à cinq ingénieurs quel modèle utiliser pour une configuration d’agent, vous obtiendrez plus de cinq avis contradictoires basés sur les tendances Twitter et les classements synthétiques.

Les benchmarks publics constituent une ressource fantastique, mais ils testent des invites isolées ou des tâches de plus en plus déconnectées de la réalité. Les cas d’utilisation en production, ou vos agents SDLC agentic locaux, ne correspondent jamais parfaitement aux benchmarks publics. Votre travail a une forme différente de celle de n’importe quel benchmark, aujourd’hui.

Vous pourriez donc construire vos propres benchmarks (Agent Ops et Evals FTW !) et automatiser cela à grande échelle, ou vous pouvez simplement effectuer vos propres tâches simples côte à côte. Tant que vous ne modifiez pas les fichiers dans votre tâche, tout ira bien et, avec presque aucun effort, vous aurez une idée précise des performances.

Voici un exemple utilisant promptfoo pour piloter opencode afin d’effectuer les mêmes 2 tâches avec chaque modèle. Vous voudrez changer la description de la tâche et configurer votre environnement pour que cela fonctionne, mais cela ne devrait pas être trop difficile.

Google Cloud Tech - inline image

GIF

json
1# opencode.json
2{
3 "$schema": "https://opencode.ai/config.json",
4 "provider": {
5 "google-vertex": {
6 "options": { "project": "alanblount-demo", "location": "global" },
7 "models": {
8 "gemini-3.8-flash": { "id": "gemini-3.8-flash", "name": "Gemini 3.8 Flash" }
9 }
10 },
11 "google-vertex-anthropic": {
12 "options": { "project": "alanblount-demo", "location": "global" },
13 "models": {
14 "claude-fable-5-1": { "id": "claude-fable-5-1", "name": "Claude Fable 5.1" }
15 }
16 }
17 },
18...

Configurez Promptfoo pour comparer les exécutions de tâches agentiques d’opencode, et non pas seulement des invites simples et des modèles.

text
1# promptfooconfig.yaml
2description: "Benchmarking OpenCode Agent Harness: Gemini 3.8 Flash vs. Claude Fable 5.1"
3
4prompts:
5 - "Summarize git branch status in one sentence."
6 - "Design a zero-downtime database migration strategy from Postgres to Spanner."
7
8providers:
9 - id: "exec:opencode run --auto -m google-vertex/gemini-3.8-flash"
10 label: "Gemini 3.8 Flash (OpenCode Agent)"
11 - id: "exec:opencode run --auto -m google-vertex-anthropic/claude-fable-5-1"
12 label: "Claude Fable 5.1 (OpenCode Agent)"
13
14defaultTest:
15 options:
16 timeoutMs: 60000

Lancez votre propre comparaison côte à côte en utilisant Promptfoo :

promptfoo eval -c promptfooconfig.yaml --no-cache

Voici mes résultats après avoir exécuté cette évaluation dans un conteneur de développement cleanroom :

Google Cloud Tech - inline image

Lors de la vérification d’une branche PR, Claude Fable 5.1 a mené plusieurs tours de méta-réflexion, réexaminant des hachages d’arborescence qui n’avaient pas changé. Cela a pris près de 6 secondes et coûté 23 fois plus cher. Gemini 3.8 Flash a reconnu l’intention instantanément, déclenché les outils git et répondu en 1,1 seconde pour moins d’un dixième de centime.

Sur la migration complexe de base de données, la situation s’est inversée. Gemini 3.8 Flash a produit une séquence linéaire solide et propre en 3 secondes. Mais Fable 5.1 a passé 12 secondes à générer un graphe acyclique dirigé (DAG) complet et formel. Il a identifié les risques de désynchronisation d’horloge lors des doubles écritures, généré des exigences de clés d’idempotence et défini une porte de rollback réversible.

Ceci n’est qu’un exemple illustratif, vous devriez comparer avec vos propres tâches.

3. Utilisation pratique au quotidien et en production

Que vous utilisiez des outils de codage prêts à l’emploi ou construisiez des services d’agents personnalisés, le schéma gagnant est la coordination asymétrique : rapidité bon marché pour l’exécution de première ligne, associée à une profondeur délibérée pour les points de contrôle architecturaux. Dépensez des jetons coûteux sur des problèmes complexes ou des travaux de planification, mais optez par défaut pour des jetons moins chers pour les tâches plus simples.

Harnais d’Agents de Codage (OpenCode, Aider, etc.)

Ne forcez pas un seul modèle à être votre défaut universel. Configurez des sous-agents spécialisés mappés sur des modèles distincts. L’utilisation du même fournisseur unifié présente des avantages en matière de sécurité et de coûts. L’utilisation de familles de modèles différentes permet de bénéficier d’une vérification croisée.

Utilisez l’agent penseur profond pour identifier la cause racine et planifier une solution à ce problème, puis utilisez l’agent worker pour traiter chacune des tâches et signaler le statut. Le planificateur profond vérifie leur travail et confirme soit le succès, soit réassigne.

text
1# opencode.json
2{
3 "$schema": "https://opencode.ai/config.json",
4 "model": "google-vertex/gemini-flash-latest",
5 "agent": {
6 "plan": {
7 "model": "google-vertex/gemini-flash-latest"
8 },
9 "build": {
10 "model": "google-vertex/gemini-flash-latest"
11 },
12 "worker": {
13 "model": "google-vertex/gemini-3.8-flash",
14 "mode": "primary",
15 "description": "General worker agent using gemini-3.8-flash"
16 },
17 "deep-thinker": {
18 "model": "google-vertex-anthropic/claude-fable-5-1@default",
19 "mode": "primary",
20 "description": "Deep thinking agent using Claude Fable 5.1"
21 }
22 },
23...

Agents Personnalisés « as a Service » (Google ADK, LangGraph, code personnalisé, etc.)

Lorsque vous construisez vos propres harnais d’agents et vos propres services d’agents, vous disposez d’une liberté architecturale totale.

  • Adaptez le harnais au modèle : Donnez à Gemini 3.8 Flash 3 à 5 outils ciblés (read_file, write_file, run_tests) avec des schémas JSON stricts. Les modèles rapides excellent dans l’exécution ciblée, mais un catalogue de 50 outils provoque une confusion des paramètres et un gaspillage de contexte. Donnez à Claude Fable 5.1 des documents d’architecture, des schémas et des directives, mais retirez les permissions directes d’écriture de fichiers.
  • Basez-vous sur les Evals : Ne devinez pas quel modèle convient à quel nœud. Exécutez des suites d’évaluation automatisées avec des vérifications d’assertions déterministes sur les tâches de votre repo pour trouver où un modèle plus petit offre 95 % de qualité pour 10 % du coût. C’est facile à dire mais difficile à faire, car il est dur de savoir quels scénarios évaluer. Consultez nos cours Kaggle de 5 jours (agents, vibecoding) pour en savoir plus.
  • Utilisez le schéma d’escalade « Demander de l’aide » : Commencez chaque demande entrante sur le worker rapide. Donnez au worker un outil explicite : ask_for_help(reason, failed_attempts, context). Le worker traite directement 85 % à 90 % des demandes. Il n’escalade qu’en cas d’ambiguïté, d’actions irréversibles ou de deux échecs consécutifs d’outil.

Le Reality Check sur les routeurs de modèles « intelligents » automatisés

Les routeurs intelligents ont une longue histoire dans le ML prédictif (ad tech, détection de fraude). Les bandits multi-bras et les routeurs coût-qualité sont matures car les caractéristiques sont tabulaires, les entrées sont bornées, et le feedback (clics, rétrofacturations) est à la fois immédiat et mesurable sur un long horizon.

Dans l’IA générative, les agents multi-tours sont une autre histoire. Les routeurs dynamiques peuvent peiner face à trois réalités de production :

  • Le contexte d’un tour unique peut ne pas contenir assez de signal sur la tâche pour choisir.
  • Les métriques de succès ne sont pas clairement extrapolées aux caractéristiques, donc le routeur ne peut pas « apprendre » rapidement.
  • Les mauvais choix sont relancés sur l’autre chemin, mangeant les économies potentielles et ajoutant de la latence.

Le Verdict : Restez simple. Composez vos agents explicitement et routez par frontière de tâche. Définissez des rôles clairs, et laissez des assertions de code concrètes ou l’intention humaine contrôler les transferts.

4. L’Équation du ROI des Jetons : Pour quoi payez-vous réellement ?

Les feuilles de prix brutes ($/1M jetons) ne sont pas une bonne carte de la valeur en production. Calculer les coûts ne fait que partie de l’équation. Il est impossible de vous donner un calcul qui fonctionnera toujours, que ce soit pour le codage, le produit, la fabrication et tous les autres jobs-to-be-done existants.

Un point de départ pourrait être de réfléchir à la valeur commerciale que vous obtenez.

  • Le coût du temps humain économisé, les employés accomplissant plus de travail et passant moins de temps sur les tâches ingrates et automatisées.
  • La valeur de livrer des fonctionnalités en production plus rapidement, tout en améliorant la satisfaction client et la rétention grâce à ces fonctionnalités.
  • Les erreurs atténuées et les pannes de production évitées grâce à des garde-fous et des pratiques d’ingénierie améliorés.

Soustrayez le coût des jetons, et le coût de la montée en compétences de votre équipe pour construire et gérer leurs agents, et vous avez un calcul approximatif du ROI.

Google Cloud Tech - inline image

Vous pouvez influencer ces calculs en utilisant moins de jetons et des jetons moins chers, mais vous les influencerez probablement le plus en accomplissant plus de travail, plus vite. Choisissez des tâches à fort levier. Choisissez des tâches qui entraînent des économies de frais généraux ou une augmentation des revenus, qui peuvent être vérifiées, et qui valent la peine d’être automatisées. Et lorsque vous décomposez ces tâches, vous voudrez peut-être réfléchir très profondément, planifier et êtes prêt à payer plus et attendre, ou peut-être voulez-vous exécuter rapidement et de manière fiable. Vous aurez besoin des deux.

Le Tokenomics est un sujet brûlant actuellement, et il existe de nombreuses autres options pour réduire les coûts et maximiser la valeur. Le message principal de cet article est qu’il est vraiment simple de configurer quelques agents différents sur 2 modèles avec des profils distincts et de router les tâches vous-même. C’est l’endroit le plus facile pour commencer.

Si vous avez trouvé cette analyse utile, consultez notre article précédent sur 5 choses que chaque ingénieur IA devrait savoir sur les sandbox d’agents. Suivez @GoogleCloudTech et @zeroasterisk pour plus d’analyses approfondies depuis les tranchées du développement.

Enregistrer en un clic

Lire les articles viraux en profondeur avec l’IA de YouMind

Enregistrez la source, posez des questions ciblées, résumez l’argument et transformez un article viral en notes réutilisables dans un seul espace de travail IA.

Découvrir YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux