YouMind
Anmelden

Von Token-Maximierung zu Token-Management

@fukkyy
JAPANISCH01. Juni 2026
293K
606
108
0
726

TL;DR

Da die Ära der unbegrenzten KI-Nutzung endet, müssen Unternehmen von der Token-Maximierung zum Token-Management übergehen, um den ROI zu sichern. Dieser Artikel untersucht, wie KI-Kosten zu einem kritischen Managementthema werden, das mit Personal- und Marketingausgaben vergleichbar ist.

Heute besprechen wir, wie die Phase des "Token Maxing"—die Maximierung der KI-Token-Nutzung—einen Kreislauf durchlaufen hat und sich der Trend hin zum "Token Management" verschiebt, das den ROI von KI hinterfragt. Token Management ist heute eine ebenso kritische Managementaufgabe wie die Personalplanung oder Investitionsentscheidungen im Marketing.

Im englischsprachigen Raum wird dieses Konzept des "Token Management" oft technischer als "Token Optimization" diskutiert. Der Klarheit halber verwende ich hier den Begriff Token Management, bitte betrachten Sie ihn jedoch als Synonym für Token Optimization.

Token Maxing und seine Gegenbewegung

福島良典 | LayerX - inline image

Im vergangenen Jahr befand sich die Nutzung generativer KI in einer Phase, die man als "Token Maxing" bezeichnen könnte. Es ging darum, Aufgaben mit Tokens zu überschütten, die stärksten Modelle wiederholt einzusetzen und Kontext bis zur absoluten Grenze einzuspeisen. Auch KI-Anbieter setzten auf Nutzungssteigerung als Erfolgsmetrik und subventionierten dies effektiv durch Flatrate-Abonnements. Auf der Nutzerseite wurde die Verwendung des stärksten Modells ohne Kostenbedenken als Wettbewerbsvorteil gepriesen.

Mit Eintritt in das Jahr 2026 zeichnet sich jedoch eine deutliche Gegenbewegung zu dieser Struktur ab.

Uber ist ein symbolträchtiges Beispiel. Das Unternehmen führte intern ein Claude-Code-Ranking ein, um Ingenieure zur Nutzung zu animieren. In der Folge erschöpften sie ihr KI-Budget für das Jahr 2026 bereits nach vier Monaten. Uber-COO Andrew Macdonald äußerte sich in einem Podcast dazu:

"Von nun an müssen wir den Token-Verbrauch und die damit verbundenen Kosten genauso diskutieren wie die Arbeitskosten. Wenn wir keine gerade Linie ziehen können, die zeigt, dass die Funktionen, die bei den Kunden ankommen, im gleichen Maße steigen wie unsere Ausgaben, ist dieser Trade-off schwer zu rechtfertigen."

https://www.youtube.com/watch?v=y_mQ6xLcKyc&t=1776s

Ähnliche Bedenken werden von denen geäußert, die KI verkaufen. Microsofts Satya Nadella erklärte auf der Morgan Stanley TMT-Konferenz im März 2026:

"Warum verbrauchen wir so viele Tokens? In vielen Fällen tun wir das Schlimmste in Bezug auf die Token-Effizienz. Woran alle im nächsten Jahr arbeiten werden, ist die Werkzeugnutzung und Software, um KI effizient zu machen."

https://www.investing.com/news/transcripts/microsoft-at-morgan-stanley-conference-ais-transformative-role-93CH-4542000

Tatsächlich hat Microsoft die direkten Claude-Code-Lizenzen, die es intern eingeführt hatte, deutlich zurückgefahren.

Ab jetzt wird KI nicht mehr ein Werkzeug sein, bei dem man einfach "so viel nutzen kann, wie man will", sondern ein Bereich, dessen ROI hinterfragt wird, ähnlich wie Arbeits- oder Marketingkosten. Der Fokus des Managements wird sich davon verschieben, wie viele Tokens verwendet wurden, hin zu der Frage, was diese Tokens hervorgebracht haben und wo sie als nächstes eingesetzt werden sollen.

Großflächige Token-Nutzung ist eine Voraussetzung für den Wettbewerb

So negativ sich das anhört, die Prämisse ist, dass die Entwicklung der KI extrem leistungsstark ist. Im Entwicklungsbereich gibt es keine Option, keine Coding-Agenten einzusetzen. Unternehmen, die sich ein bestimmtes Niveau an Token-Kosten nicht leisten können, ziehen sich im Wesentlichen aus dem Wettbewerb zurück. Zudem ist die Hürde für dieses "bestimmte Niveau" an Token-Kosten recht hoch. Wir müssen der harten Realität ins Auge sehen, dass man ohne Investitionsfähigkeit nicht beschleunigen kann.

Tatsächlich ist es nicht ungewöhnlich, dass die von Ingenieuren verbrauchten Token-Kosten mehrere zehn Prozent oder sogar die Hälfte ihres Gehalts erreichen. Es wird zunehmend notwendig, die "Kosten für die Einstellung eines Ingenieurs" nicht nur als "Gehalt" zu betrachten, sondern als ein Paket aus "Gehalt plus KI-Token-Kosten". Für das Management bedeutet dies das Aufkommen einer völlig neuen Kostenkategorie.

Token Maxing war keine bedeutungslose Bewegung; durch den Vollgas-Einsatz von KI hat das Lernen, wo man Gas geben und wo man mehr kontrollieren sollte, meiner Meinung nach schnell Fortschritte gemacht. In Zukunft werden Unternehmen hervorstechen, die Token Management betreiben können – dort Gas geben, wo es nötig ist, und dort kontrollieren, wo es nötig ist.

Token Management ist selbst zu einer Managementaufgabe geworden. Token Maxing war ein wichtiger erster Schritt für den strukturellen Wandel von Unternehmen.

In unserem Unternehmen ist die Phase des bloßen Token-Verbrauchs um des Verbrauchs willen beendet; wir befinden uns in einer Phase, in der es darum geht, Ergebnisse zu erzielen. Innerhalb von LayerXs "Compass" (Leitprinzipien) gibt es Direktiven wie "Mache KI zu einem Wachstumstreiber" und "Baue keine Dinge, die nicht genutzt werden. Tappe nicht in die KI-Bau-Falle."

福島良典 | LayerX - inline image

Aus https://speakerdeck.com/layerx/compass_202209?slide=34

福島良典 | LayerX - inline image

Aus https://speakerdeck.com/layerx/compass_202209?slide=36

Als Ergebnis dieser Richtlinien haben wir Tokens intern optimiert. Wir haben sie dort eingesetzt, wo sie eingesetzt werden sollten, und dort optimiert, wo optimiert werden sollte, und dennoch hat sich die Anzahl der verwendeten Tokens im Vergleich zu unserer Token-Maxing-Phase bei LayerX nicht wesentlich verändert. Ich habe das Gefühl, dass eine großflächige Token-Nutzung oberhalb eines bestimmten Niveaus zur Voraussetzung für den Wettbewerb geworden ist.

Coding-Agenten sind lediglich ein "Präzedenzfall"

Wichtig hierbei ist, dass dieser explosive Token-Verbrauch nicht auf den spezialisierten Bereich des Codings beschränkt ist.

Derzeit werden alle Arten von Geschäftsabläufen neben dem Coding auf die gleiche Weise wie Coding-Agenten gelöst. Signal-Sammlung und Angebotserstellung für den Vertrieb, Kundenbetreuungsanfragen, automatische Spesenabrechnung und -genehmigung, rechtliche Vertragsprüfungen, Marketing-Anzeigenbetrieb, HR-Rekrutierungs-Screening – all dies wird nach und nach als autonome Ausführungsagenten neu gestaltet.

Autonome Agenten verbrauchen Tokens in Mengen, die mit der bisherigen "eine Frage, eine Antwort"-Nutzung durch Menschen nicht vergleichbar sind. Je mehr Arbeit Agenten übernehmen, desto mehr wird die gesamte KI-Nutzung in dasselbe Muster übergehen, das wir jetzt bei Coding-Agenten sehen. Coding-Agenten waren nur zufällig der erste Präzedenzfall, der dieses Muster erreicht hat.

福島良典 | LayerX - inline image

Die Herausforderung des KI-Token-Kostenmanagements, die derzeit wie ein "reines Ingenieurproblem" aussieht, wird sich bald zu einem unternehmensweiten Managementproblem entwickeln. Dies liegt daran, dass jeder Geschäftsbereich innerhalb eines Unternehmens innerhalb der nächsten Jahre ein ähnliches Token-Verbrauchsprofil aufweisen wird.

Token-Kosten sind eine Zeitbombe

福島良典 | LayerX - inline image

Es gibt eine weitere Tatsache, die wir hier erkennen müssen. Die KI-Abonnementgebühren, die wir derzeit zahlen, sind deutlich niedriger als die tatsächlichen Kosten.

Derzeit ist es üblich, dass Anbieter von Foundation-Modellen KI-Abonnements mit Verlust anbieten, und es klafft eine riesige Lücke zwischen den von uns gezahlten Pauschalgebühren und den tatsächlich anfallenden Kosten. Berechnet man die gleiche Nutzung mit API-Pay-as-you-go-Preisen, steigen die Kosten um Größenordnungen. Das Abonnementformat macht die tatsächlichen Kosten für den Nutzer unsichtbar.

Das Problem ist, dass Unternehmen mit Foundation-Modellen diesen Unterschied in den tatsächlichen Kosten jederzeit offenlegen könnten. In dem Moment, in dem der subventionierte Anteil in Form einer Umstellung von Flatrate auf tokenbasierte Abrechnung, einer Lenkung zu höheren Tarifen oder Preiserhöhungen an die Kunden weitergegeben wird, könnte das Gefühl von "Zehntausenden Yen pro ID und Monat, was ein Unternehmen mit 100 Mitarbeitern jährlich zig Millionen Yen kostet" in kurzer Zeit auf die Größenordnung von "Hunderten Millionen oder Milliarden Yen jährlich für das gesamte Unternehmen" ansteigen. Die in den Abonnements versteckte Differenz zu den tatsächlichen Kosten wird zur Sprengkraft der Zeitbombe.

Das Erste, was nötig ist, ist, das Geschehen im Unternehmen sichtbar zu machen, bevor die Explosion an die Oberfläche tritt.

(Dieser Artikel ist hilfreich für Details: https://www.thestateofbrand.com/news/ai-subscription-time-bombhttps://www.thestateofbrand.com/news/ai-subscription-time-bomb))

Zuerst: Visualisierung

Das Erste, was für dieses Problem nötig ist, ist etwas extrem Einfaches: sichtbar zu machen, "wer welches Modell und wie viele Tokens verwendet". Das ist alles.

Für Menschen haben wir bereits umfangreiche Managementgrundlagen wie Personalbeurteilungen, Zielmanagement, Gehaltssysteme und Organisationsdesign. Für Marketingausgaben ist es selbstverständlich, unter Messung von CAC und Amortisationszeit zu optimieren. Die Beschaffung hat spezialisierte Teams und Workflows.

Für KI jedoch fehlt selbst diese grundlegendste Visualisierung noch. Für CEOs und IT-Abteilungen ist die Tatsache, dass sie nicht sehen können, "wer gerade wie viel für KI ausgibt", bereits ein großer Stressfaktor. Allein dadurch, dass man Zahlen auf ein Dashboard bringt, wird bereits Wert geschaffen.

Der "AI Token Advisor", den wir derzeit anbieten, ist ein Produkt, das genau diese Lücke schließen soll. Es ist ein einfaches Tool, um zu visualisieren, wer welches Modell für welche Aufgabe und wie viele Tokens verwendet hat. (Bakuraku-Nutzer erhalten eine ID kostenlos!)

福島良典 | LayerX - inline image

Aus https://bakuraku.jp/resources/product/pre-registration-ai-token-advisor/

Doch die Visualisierung ist nur der Einstieg. Was wirklich zählt, ist die Frage, die sich darüber hinaus unweigerlich stellt.

"Hätte für diese Aufgabe wirklich dieses Modell verwendet werden sollen?"

Mit fortschreitender Visualisierung stellt sich immer die nächste Frage: "Hätte für diese Aufgabe wirklich dieses Modell verwendet werden sollen?"

Zum Beispiel ist die Verwendung eines erstklassigen Reasoning-Modells (wie Claude Opus 4.8 oder GPT-5.5; die neuesten Modelle Stand Mai 2026) für eine Frage wie "Wie ist das Wetter heute?" eindeutig übertrieben. Das leichteste Modell reicht aus, und es müsste nicht einmal ein Reasoning-Modell sein. Ähnlich gibt es in Unternehmen massenhaft Fälle, in denen teure Modelle weiterhin für ausgereifte Aufgaben wie die routinemäßige E-Mail-Erstellung verwendet werden.

Die Trends variieren auch von Person zu Person. Menschen, die es nicht gewohnt sind, KI zu nutzen, greifen tendenziell einfach zum stärksten Modell. Umgekehrt wechseln diejenigen, die KI intensiv nutzen, die Modelle je nach Art der Aufgabe. Dieser Unterschied wird, sowohl in Bezug auf Kosten als auch Qualität, zu groß, als dass eine Organisation ihn ignorieren könnte.

Wichtig hierbei ist die Tatsache, dass alle Eingaben in die KI letztendlich in die Form eines "Prompts" umgewandelt werden. Chat-Fragen und Kontext, die an Agenten übergeben werden, werden alle intern als Prompts in das Modell eingegeben. Mit anderen Worten: Wenn man sich den Prompt ansieht, kann man ziemlich genau sagen, was diese Person die KI tun lässt.

Ausgehend von diesem Prompt können wir Diskrepanzen zwischen Aufgaben und Modellen erkennen und Anleitungen geben wie: "Für diese Aufgabe reicht ein leichteres Modell aus." Noch einen Schritt weiter: Anstatt dass Menschen jedes Mal das Modell auswählen, wird das System automatisch das optimale Modell zuweisen. Wir bewegen uns auf eine solche Welt zu.

福島良典 | LayerX - inline image

Im Zeitalter der Agenten wird dies noch wichtiger. Da Agenten autonom ausführen, gibt es keinen Raum für einen Menschen, jedes Mal zu überlegen: "Ist es jetzt Luxus, Opus zu verwenden?" Von Anfang an wird es keine andere Wahl geben, als die optimale Modellauswahl basierend auf der Art der Aufgabe dem System zu überlassen.

Die Dienstleistungen, die wir bei Bakuraku anbieten, werden als Managed Services angeboten, einschließlich der Backend-Implementierung, die das optimale Modell auswählt, ohne dass der Nutzer sich dessen bewusst sein muss. Der AI Token Advisor ist lediglich der Einstieg.

Zusammenfassung

KI-Token-Kosten überschreiten bereits die Größenordnung, die mit einem "Werf einfach Geld drauf"-Ansatz bewältigt werden kann. Für einige Unternehmen werden sie zu Ausgaben, die mit Arbeits- und Marketingkosten vergleichbar sind.

Marketingkosten werden streng nach CAC gemanagt, und niemand operiert nach dem Motto: "Schaltet einfach Anzeigen, egal wie hoch der CAC ist." Gleiches gilt für Arbeitskosten; Gehälter, Einstellungen und Platzierungen werden alle gemanagt. Man stellt nicht einfach Leute zu jedem Gehalt ein.

Auf dieser gleichen Ebene werden KI-Kosten in den Zuständigkeitsbereich des Managements fallen. Das Erste, was dann nötig ist, ist zu visualisieren, "wie viel ausgegeben wird". Und als nächstes zu überprüfen, "ob das angemessene Modell für die Aufgabe und die Person ausgewählt wurde".

Das mag unscheinbar wirken, aber die Beherrschung dieser beiden Punkte wird in den kommenden Jahren zu einer kritischen Managementaufgabe werden.

Für diejenigen, die eine solche Zukunft gemeinsam umsetzen möchten, stellt LayerX aktiv KI-Builder ein!

福島良典 | LayerX - inline image

Wir stellen aktiv ein! https://jobs.layerx.co.jp/

Mit einem Klick speichern

Virale Artikel mit YouMind per KI tief lesen

Speichere die Quelle, stelle gezielte Fragen, fasse die Argumentation zusammen und verwandle einen viralen Artikel in wiederverwendbare Notizen in einem einzigen KI-Arbeitsbereich.

YouMind entdecken
Für Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mühsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum Entschlüsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken