Ein Kollege stellte mir bei der Arbeit eine völlig unwichtige Frage, und ich ließ einen Agenten meine letzten Chats und Dokumente durchsuchen. Er fand zwar die richtige Antwort, aber es kostete mich 38 $!!!. Das war ein schlechtes ROI. Klar, meine Zeit ist wertvoll, aber diese Zeit hätte ich nicht tatsächlich investiert, und diese Aufgabe erforderte keine teuren Planungsfunktionen.
Das geht besser.
Die Google Cloud Gemini Enterprise Agent Platform bietet Model Garden mit bequemem API-Zugriff auf viele Top-Modelle, darunter von Google, Anthropic und sogar xAI. Tatsächlich kann jedes Modell auf Huggingface selbst bereitgestellt werden, aber in diesem Artikel konzentrieren wir uns auf das neue Claude Fable 5.1 von Anthropic und das neue Gemini 3.8 Flash von Google. Entwickler haben nun zwei unterschiedlich geformte Frontier-Modelle hinter exakt derselben Enterprise-API-Oberfläche.
Fable 5.1 bringt autonomes Planen der Mythos-Klasse, ein Kontextfenster von einer Million Token und tiefgehende mehrstufige Sorgfalt. Gemini 3.8 Flash liefert nahezu frontierfähiges Reasoning und unglaubliche Token-Geschwindigkeit zu Flash-Bedingungen (0,75 $ pro Million Eingabe-Token, 3,75 $ pro Million Ausgabe-Token) mit einstellbaren Denksteuerungen.
Es könnte leicht sein, sich für eines zu entscheiden und alles darüber zu routen. Das wäre ein Fehler.
Wenn du routinemäßige Entwicklerarbeit durch einen tiefen Planner schickst, zahlst du Frontier-Token-Raten, um Git-Diffs zu parsen. Wenn du ein schnelles Modell zwingst, eine irreversible Datenbankmigration ohne formellen Plan anzugehen, wird es blind vorpreschen und den Status zerstören, bevor dein Kaffee fertig ist.
Wir können die „Tokenomics“ erheblich verbessern, indem wir einfach zwei Modelle verwenden und Aufgaben routen.

Von Alan Blount (@zeroasterisk
Hier ist die vollständige Anleitung, um dorthin zu gelangen:
- Konfigurieren Sie beide Modelle hinter einer einzigen einheitlichen Governance-Ebene.
- Benchmarken Sie Routineaufgaben, bevor Sie einen Standard wählen.
- Verwenden Sie das schnelle Modell als Frontline-Koordinator und das tiefe Planungsmodell immer dann, wenn Sie wissen, dass Sie mehr Leistung benötigen, oder wenn das schnelle Modell eskalieren muss.
- Entwickeln Sie ein mentales Modell für das Task-ROI und den Wert (nicht nur die Kosten) Ihrer Token.
1. Konfigurieren Sie beide Modelle hinter einer einzigen einheitlichen Governance-Ebene
Die Wahl Ihrer LLM-Inferenzplattform erfordert Überlegungen zu vielen Designentscheidungen. Kosten, Kapazität, Sicherheit, Modellwahl, Serving-Funktionen, Entwickler-Reibung, noch mehr Sicherheit (API-Schlüssel sind riskant). Die Gemini Enterprise Agent Platform (ehemals Vertex AI) ist eine umfassende Option mit einzigartigen Fähigkeiten, und da sie sowohl Gemini- als auch Anthropic-Modelle als verwaltete APIs bereitstellt, deckt eine einzige sichere Authentifizierung beide Workloads ab.
Aber seien wir ehrlich: Einige Wege haben mehr Reibung, als mir lieb ist. Ich scherze gerne, dass „unmögliche Dinge leicht sind, aber einfache Dinge schwer“. Das ist ein Grund, warum ich diesen Beitrag schreibe.
Bevor Sie sich mit den Modellen befassen, melden Sie sich bei gcloud an und lesen Sie die Dokumentation für Variationen.
1gcloud auth application-default login
Um Zugriff auf Claude Fable 5.1 zu erhalten, müssen Sie die API aktivieren und dann Claude Fable 5.1 aktivieren sowie ein sehr kurzes Formular zu Ihrem Anwendungsfall ausfüllen. Aber damit sind Sie noch nicht fertig.
Nun fällt Fable unter den Advanced AI Safety Addendum von Google Cloud. Bevor Sie auch nur einen einzigen Prompt an aiplatform.googleapis.com senden können, müssen Sie explizit das Teilen von Prompt-Antworten konfigurieren und die Publisher-Bedingungen auf Projektebene akzeptieren.
Hier sind die genauen funktionierenden Anweisungen für den globalen Endpunkt; lesen Sie die Dokumentation für Variationen.
Zuerst richten wir einige Variablen ein, die uns helfen werden. Beachten Sie, dass der Modellname im URL-Pfad claude-fable-5-1 mit Bindestrichen lautet, nicht mit Punkten, und stellen Sie sicher, dass Sie Ihre Projekt-ID und Ihren Standort eingeben, wobei Sie möglicherweise Ihren Endpunkt je nach Region ändern müssen:
1export PROJECT_ID="YOUR_PROJECT_ID"2export LOCATION="global"3export MODEL="claude-fable-5-1"45# Global endpoint: aiplatform.googleapis.com (recommended)6# Multi-Regional endpoints: aiplatform.eu.rep.googleapis.com# Regional endpoints: us-central1-aiplatform.googleapis.com7export ENDPOINT="https://aiplatform.googleapis.com"
Rufen Sie als Nächstes die setPublisherModelConfig-API auf und setzen Sie dataSharingEnabledProvider auf ANTHROPIC – beachten Sie, dass dies in Großbuchstaben erfolgt:
1curl -X POST \2 -H "Authorization: Bearer $(gcloud auth print-access-token)" \3 -H "Content-Type: application/json; charset=utf-8" \4 -d '{ "publisherModelConfig": { "dataSharingEnabledProvider": "ANTHROPIC" } }' \5"${ENDPOINT}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/anthropic/models/${MODEL}:setPublisherModelConfig"
Der erste Aufruf gibt ein abgeschlossenes Operationsobjekt zurück, das bestätigt, dass das Datenteilen aktiv ist:
1{2 "name": "projects/YOUR_PROJECT_NUMBER/locations/global/operations/1234567",3 "metadata": {4 "@type": "type.googleapis.com/google.cloud.aiplatform.v1beta1.SetPublisherModelConfigOperationMetadata",5 "genericMetadata": {6 "createTime": "...",7 "updateTime": "..."8 }9 },10 "done": true,11 "response": {12 "@type": "type.googleapis.com/google.cloud.aiplatform.v1beta1.PublisherModelConfig",13 "loggingConfig": {},14 "dataSharingEnabledProvider": "ANTHROPIC"15 }16}
Wenn Sie dies bereits getan haben, erhalten Sie einen HTTP-409-Fehler, dass diese Einstellung bereits existiert:
1409 ALREADY_EXISTS: The same PublisherModelConfig already exists.
Dieser 409-Fehler ist überhaupt kein Problem.
Testen Sie Ihren Zugriff auf das Modell, und Sie sollten eine Antwort erhalten:
1curl -X POST \2 -H "Authorization: Bearer $(gcloud auth print-access-token)" \3 -H "Content-Type: application/json; charset=utf-8" \4 -d '{"anthropic_version": "vertex-2023-10-16","messages": [{"role": "user", "content": "Hello world."}], "max_tokens": 1024, "stream": true}' \5"${ENDPOINT}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/anthropic/models/${MODEL}:streamRawPredict"
Wenn Sie dies nicht korrekt durchgeführt haben, erhalten Sie einen HTTP-403-Fehler, der wie folgt aussieht:
1403 PERMISSION_DENIED: Access to this model requires data sharing to be enabled for publisher 'anthropic'. Please set `PublisherModelConfig.data_sharing_enabled_provider`2to 'anthropic' via the setPublisherModelConfig API to use this model.
Um Zugriff auf Gemini 3.8 Flash zu erhalten, stellen Sie sicher, dass Sie es als aktiviertes Modellkarten-Element sehen, und es sollte einfach funktionieren:
1curl -X POST \2 -H "Authorization: Bearer $(gcloud auth print-access-token)" \3 -H "Content-Type: application/json; charset=utf-8" \4 -d '{"contents": [{"role": "user", "parts": [{"text": "Hello world"}]}],"generationConfig": {"thinkingConfig": {"thinkingLevel": "LOW"}}}' \5"${ENDPOINT}/v1beta1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/google/models/gemini-3.8-flash:streamGenerateContent"
… puh. Wir haben es geschafft 🎉!
Sie benötigen mehr Quota? Sie können Quotas verwalten für jedes Modell und für bestimmte Modelle provisionierten Durchsatz bezahlen.
2. Vertrauen Sie keinen Benchmarks, führen Sie Ihre eigenen durch
Wenn Sie fünf Ingenieure fragen, welches Modell für ein Agent-Setup verwendet werden soll, erhalten Sie mehr als fünf widersprüchliche Meinungen basierend auf Twitter-Stimmungen und synthetischen Leaderboards.
Öffentliche Benchmarks bieten eine fantastische Ressource, aber sie testen isolierte Prompts oder zunehmend Aufgaben im Vakuum. Produktionsanwendungsfälle oder Ihre lokalen agentic SDLC-Agenten passen nie perfekt zu öffentlichen Benchmarks. Ihre Arbeit ist heute anders geformt als jeder Benchmark.
Sie könnten also Ihre eigenen Benchmarks erstellen (Agent Ops und Evals FTW!) und dies im großen Maßstab automatisieren, oder Sie können einfach Ihre eigenen einfachen Aufgaben nebeneinander durchführen. Solange Sie die Dateien in Ihrer Aufgabe nicht ändern, sollten Sie gut dran sein, und mit fast keinem Aufwand bekommen Sie ein Gefühl für die Aufgaben.
Hier ist ein Beispiel mit promptfoo, um opencode dazu zu bringen, dieselben 2 Aufgaben mit jedem Modell auszuführen. Sie müssten die Aufgabenbeschreibung ändern und Ihre Umgebung so einrichten, dass dies funktioniert, aber es sollte nicht zu schwierig sein.

GIF
1# opencode.json2{3 "$schema": "https://opencode.ai/config.json",4 "provider": {5 "google-vertex": {6 "options": { "project": "alanblount-demo", "location": "global" },7 "models": {8 "gemini-3.8-flash": { "id": "gemini-3.8-flash", "name": "Gemini 3.8 Flash" }9 }10 },11 "google-vertex-anthropic": {12 "options": { "project": "alanblount-demo", "location": "global" },13 "models": {14 "claude-fable-5-1": { "id": "claude-fable-5-1", "name": "Claude Fable 5.1" }15 }16 }17 },18...
Konfigurieren Sie Promptfoo so, dass es OpenCode-agentic Task-Ausführungen vergleicht, nicht nur einzelne Prompts und Modelle.
1# promptfooconfig.yaml2description: "Benchmarking OpenCode Agent Harness: Gemini 3.8 Flash vs. Claude Fable 5.1"34prompts:5 - "Summarize git branch status in one sentence."6 - "Design a zero-downtime database migration strategy from Postgres to Spanner."78providers:9 - id: "exec:opencode run --auto -m google-vertex/gemini-3.8-flash"10 label: "Gemini 3.8 Flash (OpenCode Agent)"11 - id: "exec:opencode run --auto -m google-vertex-anthropic/claude-fable-5-1"12 label: "Claude Fable 5.1 (OpenCode Agent)"1314defaultTest:15 options:16 timeoutMs: 60000
Führen Sie Ihren eigenen Side-by-Side-Vergleich mit Promptfoo durch:
promptfoo eval -c promptfooconfig.yaml --no-cache
Hier sind meine Ergebnisse aus der Durchführung dieser Bewertung in einem Cleanroom-Dev-Container:

Bei der Überprüfung eines PR-Zweigs führte Claude Fable 5.1 mehrere Runden der Meta-Reflexion durch und inspizierte erneut Baum-Hashes, die sich nicht geändert hatten. Es dauerte fast 6 Sekunden und kostete 23-mal mehr. Gemini 3.8 Flash erkannte die Absicht sofort, löste die Git-Tools aus und antwortete in 1,1 Sekunden für weniger als einen Zehntel Cent.
Bei der komplexen Datenbankmigration drehte sich das Bild. Gemini 3.8 Flash produzierte in 3 Sekunden eine solide, saubere lineare Sequenz. Aber Fable 5.1 verbrachte 12 Sekunden damit, einen vollständigen, formellen gerichteten azyklischen Graphen (DAG) zu generieren. Es identifizierte Clock-Skew-Risiken bei Dual-Writes, erstellte Anforderungen für Idempotency Keys und definierte ein reversibles Rollback-Gate.
Dies ist nur ein illustratives Beispiel; Sie sollten mit Ihren eigenen Aufgaben vergleichen.
3. Praktische Nutzung im Alltag und in der Produktion
Ob Sie fertige Coding-Tools verwenden oder eigene Agent-Services bauen, das winning Pattern ist asymmetrische Koordination: billige Geschwindigkeit für die Frontline-Ausführung, gepaart mit bewusster Tiefe für architektonische Checkpoints. Geben Sie teure Token für knifflige Probleme oder Planungsarbeiten aus, aber standardisieren Sie auf günstigere Token für einfachere Aufgaben.
Coding Agent Harnesses (OpenCode, Aider usw.)
Erzwingen Sie nicht, dass ein Modell Ihr universeller Standard ist. Konfigurieren Sie spezialisierte Subagents, die verschiedenen Modellen zugeordnet sind. Die Verwendung desselben einheitlichen Providers bringt Sicherheits- und Kostenvorteile. Die Verwendung verschiedener Modellfamilien kann davon profitieren, dass sie sich gegenseitig überprüfen.
Verwenden Sie den Deep-Thinker-Agenten, um die Ursache des Problems zu identifizieren und eine Lösung zu planen, und verwenden Sie dann den Worker-Agenten, um jede der Aufgaben zu bearbeiten und den Status zu berichten. Der Deep Planner überprüft ihre Arbeit und bestätigt entweder den Erfolg oder weist sie neu zu.
1# opencode.json2{3 "$schema": "https://opencode.ai/config.json",4 "model": "google-vertex/gemini-flash-latest",5 "agent": {6 "plan": {7 "model": "google-vertex/gemini-flash-latest"8 },9 "build": {10 "model": "google-vertex/gemini-flash-latest"11 },12 "worker": {13 "model": "google-vertex/gemini-3.8-flash",14 "mode": "primary",15 "description": "General worker agent using gemini-3.8-flash"16 },17 "deep-thinker": {18 "model": "google-vertex-anthropic/claude-fable-5-1@default",19 "mode": "primary",20 "description": "Deep thinking agent using Claude Fable 5.1"21 }22 },23...
Custom Agents „as a Service“ (Google ADK, LangGraph, eigener Code usw.)
Wenn Sie Ihre eigenen Agent-Harnesses und Ihre eigenen Agent-Services bauen, haben Sie vollständige architektonische Freiheit
- Passen Sie den Harness an das Modell an: Geben Sie Gemini 3.8 Flash 3 bis 5 fokussierte Tools (read_file, write_file, run_tests) mit strengen JSON-Schemas. Schnelle Modelle glänzen bei fokussierter Ausführung, aber ein Katalog mit 50 Tools führt zu Parameterverwirrung und Kontextverschwendung. Geben Sie Claude Fable 5.1 Architektur-Dokumente, Schemas und Richtlinien, aber entfernen Sie direkte Schreibrechte für Dateien.
- Grundlage in Evals: Erraten Sie nicht, welches Modell zu welchem Node passt. Führen Sie automatisierte Evaluations-Suiten mit deterministischen Assertion-Checks auf Ihren Repo-Aufgaben durch, um herauszufinden, wo ein kleineres Modell 95 % Qualität bei 10 % Kosten liefert. Das ist leicht gesagt, aber schwer zu tun, weil man wissen muss, welche Szenarien man evaluieren möchte. Schauen Sie sich unsere Kaggle-5-Tage-Kurse (Agents, Vibecoding) für mehr an.
- Verwenden Sie das „Ask for Help“-Eskalationsmuster: Starten Sie jede eingehende Anfrage beim schnellen Worker. Geben Sie dem Worker ein explizites Tool: ask_for_help(reason, failed_attempts, context). Der Worker bearbeitet 85 % bis 90 % der Anfragen direkt. Er eskaliert nur bei Mehrdeutigkeit, irreversiblen Aktionen oder zwei aufeinanderfolgenden Tool-Fehlern.
Der Realitätscheck bei automatisierten „Smart“ Model Routern
Smarte Router haben eine lange Geschichte im prädiktiven ML (Ad Tech, Betrugserkennung). Multi-Armed Bandits und Cost-Quality-Router sind reif, weil Features tabellarisch sind, Eingaben begrenzt sind und Feedback (Klicks, Chargebacks) sowohl unmittelbar ist als auch über einen langen Zeithorizont gemessen werden kann.
In generativer KI sind Multi-Turn-Agenten eine andere Geschichte. Dynamische Router können mit drei Produktionsrealitäten kämpfen:
- Einzelturn-Kontext enthält möglicherweise nicht genug Signal über die Aufgabe, um zu wählen
- Erfolgs-Metriken lassen sich nicht klar auf Features extrapolieren, sodass der Router nicht schnell „lernen“ kann
- Falsche Entscheidungen werden auf dem anderen Pfad erneut ausgeführt, was potenzielle Einsparungen auffrisst und Latenz hinzufügt
Das Urteil: Halten Sie es simpel. Komponieren Sie Ihre Agenten explizit und routen Sie nach Task-Grenzen. Definieren Sie klare Rollen und lassen Sie konkrete Code-Assertions oder menschliche Intentionen Übergaben steuern.
4. Die Token-ROI-Gleichung: Wofür zahlen Sie eigentlich?
Rohe Preislisten ($/1M Token) sind keine gute Karte für den Produktionswert. Die Berechnung der Kosten ist nur ein Teil der Gleichung. Es ist unmöglich, Ihnen eine Berechnung zu geben, die immer funktioniert, über Coding, Produkt und Fertigung und jeden anderen Job-to-be-done hinweg.
Ein Ausgangspunkt könnte sein, über den Geschäftswert nachzudenken, den Sie erzielen.
- Die Kosten der eingesparten menschlichen Zeit, Mitarbeiter, die mehr Arbeit erledigen, und weniger Zeit, die für Mühsal und automatisierte Aufgaben aufgewendet wird.
- Der Wert, Funktionen schneller in Produktion zu bringen, während die Kundenzufriedenheit und -bindung aufgrund dieser Funktionen verbessert wird.
- Die gemilderten Fehler und die vermiedenen Produktionsausfälle aufgrund verbesserter Schutzmaßnahmen und Engineering-Praktiken.
Subtrahieren Sie die Token-Kosten und die Kosten für die Qualifizierung Ihres Teams zur Erstellung und Verwaltung ihrer Agenten, und Sie haben eine grobe ROI-Berechnung.

Sie können diese Berechnungen beeinflussen, indem Sie weniger und günstigere Token verwenden, aber Sie werden sie wahrscheinlich am meisten dadurch beeinflussen, dass Sie mehr Arbeit schneller erledigen. Wählen Sie High-Leverage-Aufgaben. Wählen Sie Aufgaben, die zu eingespartem Overhead oder erhöhtem Umsatz führen, die verifizierbar sind und die sich lohnen, automatisiert zu werden. Und wenn Sie diese Aufgaben zerlegen, möchten Sie vielleicht super tief denken und planen und sind bereit, mehr zu zahlen und zu warten, oder vielleicht möchten Sie schnell und zuverlässig ausführen. Sie brauchen beides.
Tokenomics ist gerade ein heißes Thema, und es gibt viele weitere Optionen, um Kosten zu senken und den Wert zu maximieren. Der Hauptpunkt dieses Artikels ist, dass es wirklich einfach ist, ein paar verschiedene Agenten auf 2 Modellen mit unterschiedlichen Profilen einzurichten und Aufgaben selbst zu routen. Das ist der einfachste Ort zum Starten.
Wenn Sie diese Aufschlüsselung nützlich fanden, schauen Sie sich unseren vorherigen Beitrag über 5 Dinge, die jeder KI-Ingenieur über Agent-Sandboxes wissen sollte an. Folgen Sie @GoogleCloudTech und @zeroasterisk für mehr Deep Dives aus den Gräben der Builder.





