Aujourd'hui, nous discutons de la façon dont la phase de « Token Maxing » — qui consiste à maximiser l'utilisation des tokens d'IA — a bouclé la boucle, et dont la tendance évolue vers la « Token Management », qui remet en question le ROI de l'IA. La gestion des tokens est désormais un enjeu de gestion aussi crucial que la planification des effectifs ou les décisions d'investissement marketing.
À l'étranger, ce concept de « Token Management » est souvent abordé de manière plus technique sous le nom de « Token Optimization ». Pour plus de clarté, j'utiliserai ici le terme Token Management, mais veuillez le considérer comme synonyme de Token Optimization.
Token Maxing et son contrecoup

Au cours de l'année écoulée, l'utilisation de l'IA générative est restée dans une phase que l'on pourrait appeler le « Token Maxing ». Il s'agissait d'inonder les tâches de tokens, de solliciter les modèles les plus puissants à plusieurs reprises et de nourrir le contexte jusqu'à la limite absolue. Les fournisseurs d'IA ont également fait de l'expansion de l'utilisation une mesure de succès, en subventionnant de fait leurs offres par le biais d'abonnements forfaitaires. Côté utilisateur, utiliser le modèle le plus puissant sans se soucier du coût était présenté comme un avantage concurrentiel.
Cependant, à l'entrée de 2026, un net contrecoup à cette structure commence à se manifester.
Uber en est un exemple emblématique. L'entreprise a mis en place en interne un classement Claude Code pour encourager les ingénieurs à rivaliser d'utilisation, ce qui a conduit à épuiser son budget IA 2026 pour le codage en seulement quatre mois. Andrew Macdonald, COO d'Uber, a déclaré dans un podcast :
« Désormais, nous devons discuter de la consommation de tokens et de ses coûts associés au même titre que les coûts de main-d'œuvre. Si nous ne pouvons pas tracer une ligne directe montrant que les fonctionnalités atteignant les clients augmentent autant que ce que nous dépensons, cet arbitrage est difficile à justifier. »
Des préoccupations similaires sont exprimées par ceux qui vendent de l'IA. Satya Nadella, de Microsoft, a déclaré lors de la conférence TMT de Morgan Stanley en mars 2026 :
« Pourquoi utilisons-nous autant de tokens ? Dans de nombreux cas, nous faisons le pire en termes d'efficacité des tokens. Ce sur quoi tout le monde va travailler dans l'année à venir, c'est l'utilisation d'outils et de logiciels pour rendre l'IA efficace. »
En effet, Microsoft a considérablement réduit les licences directes Claude Code qu'il venait d'introduire en interne.
À partir de là, l'IA ne sera plus un outil où l'on peut simplement « utiliser autant que l'on veut », mais un sujet dont le ROI est remis en question, tout comme les coûts de main-d'œuvre ou de marketing. Le point crucial pour la direction passera du nombre de tokens utilisés à ce que ces tokens ont produit et où les allouer ensuite.
L'utilisation massive de tokens est un prérequis pour la compétition
Bien que cela puisse sembler négatif, le postulat de départ est que l'évolution de l'IA est extrêmement puissante. Dans le domaine du développement, il n'y a pas d'autre option que d'utiliser des agents de codage. Les entreprises qui ne peuvent pas supporter un certain niveau de coûts de tokens se retirent essentiellement de la compétition. De plus, le seuil de ce « certain niveau » de coût de tokens est assez élevé. Nous devons faire face à la dure réalité : on ne peut pas accélérer sans capacité d'investissement.
En fait, il n'est pas rare que les coûts de tokens consommés par les ingénieurs atteignent des dizaines de pourcents, voire la moitié de leur salaire. Il devient nécessaire de considérer le « coût d'embauche d'un ingénieur » non seulement comme un « salaire », mais comme un ensemble comprenant « salaire plus coûts des tokens IA ». Pour la direction, c'est l'émergence d'une toute nouvelle catégorie de coûts.
Le Token Maxing n'était pas un mouvement dénué de sens ; en utilisant l'IA à plein régime, je pense que l'apprentissage a progressé rapidement quant aux endroits où appuyer sur l'accélérateur et où exercer davantage de contrôle. À l'avenir, les entreprises capables de pratiquer le Token Management — appuyer là où il le faut et contrôler là où il le faut — se démarqueront.
Le Token Management est devenu un enjeu de gestion en soi. Le Token Maxing a été une première étape importante pour la transformation structurelle des entreprises.
Dans notre entreprise, la phase consistant à simplement utiliser des tokens pour le plaisir est terminée, et nous sommes dans une phase de production de résultats. Au sein du « Compass » (principes directeurs) de LayerX, on trouve des directives telles que « Faire de l'IA un moteur de croissance » et « Ne pas construire des choses qui ne seront pas utilisées. Ne pas tomber dans le piège de la construction IA. »

Extrait de https://speakerdeck.com/layerx/compass_202209?slide=34

Extrait de https://speakerdeck.com/layerx/compass_202209?slide=36
Grâce à ces lignes directrices, nous avons optimisé les tokens en interne. Nous les avons utilisés là où il fallait et optimisés là où il fallait, pourtant le nombre de tokens utilisés n'a pas changé de manière significative par rapport à l'époque du Token Maxing chez LayerX. Je ressens que l'utilisation massive de tokens au-delà d'un certain seuil est devenue un prérequis pour la compétition.
Les agents de codage ne sont qu'un « précédent »
Ce qui est important ici, c'est que cette consommation explosive de tokens ne se limite pas au domaine spécialisé du codage.
Actuellement, toutes sortes d'opérations métier autres que le codage sont résolues de la même manière que les agents de codage. La collecte de signaux et la création de propositions pour les ventes, les requêtes du support client, la déclaration et l'approbation automatiques des dépenses, les revues de contrats juridiques, les opérations publicitaires marketing, le tri des CV en RH — tout cela est repensé les uns après les autres comme des agents d'exécution autonomes.
Les agents autonomes consomment des tokens en quantités incomparables avec la façon précédente « une question, une réponse » que les humains utilisaient. À mesure que les agents effectuent plus de travail, toute l'utilisation de l'IA convergera vers le même schéma que celui que nous observons maintenant avec les agents de codage. Les agents de codage sont simplement le premier précédent à avoir atteint ce schéma.

Le défi de la gestion des coûts des tokens IA, qui ressemble actuellement à un « problème réservé aux ingénieurs », deviendra bientôt un enjeu de gestion à l'échelle de l'entreprise. En effet, chaque domaine métier au sein d'une entreprise aura le même profil de consommation de tokens dans les prochaines années.
Les coûts des tokens sont une bombe à retardement

Il y a un autre fait que nous devons reconnaître ici. Les frais d'abonnement IA que nous payons actuellement sont nettement inférieurs aux coûts réels.
Actuellement, il est courant que les fournisseurs de modèles fondateurs proposent des abonnements IA à perte, et il y a un énorme écart entre les frais forfaitaires que nous payons et les coûts réels encourus. Si vous recalculez la même utilisation avec la tarification à l'usage via API, le coût explose de plusieurs ordres de grandeur. Le format d'abonnement rend le coût réel invisible pour l'utilisateur.
Le problème est que les entreprises de modèles fondateurs peuvent rendre cette différence de coût réel apparente à tout moment. Dès que la part subventionnée commence à être répercutée sur les clients sous la forme d'un passage du forfait à la facturation basée sur les tokens, d'une orientation vers des forfaits supérieurs ou de hausses de prix, le sentiment de « quelques dizaines de milliers de yens par identifiant et par mois, soit des dizaines de millions de yens par an pour une entreprise de 100 employés » pourrait passer à l'ordre de « centaines de millions ou milliards de yens par an pour toute l'entreprise » en peu de temps. La différence de coût réel cachée par les abonnements devient la puissance de la bombe à retardement.
La première chose à faire est de rendre visible ce qui se passe à l'intérieur de l'entreprise avant que l'explosion ne se produise.
(Cet article est utile pour plus de détails : https://www.thestateofbrand.com/news/ai-subscription-time-bombhttps://www.thestateofbrand.com/news/ai-subscription-time-bomb))
D'abord, la visualisation
La première chose nécessaire pour ce problème est quelque chose d'extrêmement basique : rendre visible « qui utilise quel modèle et combien de tokens ». C'est tout.
Pour les personnes, nous avons déjà des bases de gestion vastes comme les évaluations du personnel, la gestion des objectifs, les systèmes de rémunération et la conception organisationnelle. Pour les dépenses marketing, il est naturel d'optimiser tout en mesurant le CAC et le payback. Les achats disposent d'équipes et de workflows spécialisés.
Cependant, pour l'IA, même cette visualisation la plus basique n'est pas encore en place. Pour les PDG et les services informatiques, le fait de ne pas pouvoir voir « qui dépense combien en IA en ce moment » est déjà un facteur de stress majeur. De la valeur est créée rien qu'en mettant des chiffres sur un tableau de bord.
Le « AI Token Advisor » que nous proposons actuellement est un produit exactement conçu pour combler cette lacune. Il s'agit d'un outil simple pour visualiser qui a utilisé quel modèle pour quelle tâche et combien de tokens. (Les utilisateurs de Bakuraku peuvent utiliser un identifiant gratuitement !)

Extrait de https://bakuraku.jp/resources/product/pre-registration-ai-token-advisor/
Cependant, la visualisation n'est que l'entrée. Ce qui est vraiment important, c'est la question qui se pose inévitablement au-delà.
« Cette tâche aurait-elle vraiment dû utiliser ce modèle ? »
À mesure que la visualisation progresse, la question suivante qui se pose toujours est : « Cette tâche aurait-elle vraiment dû utiliser ce modèle ? »
Par exemple, utiliser un modèle de raisonnement de premier ordre (comme Claude Opus 4.8 ou GPT-5.5 ; les modèles les plus récents en mai 2026) pour une question comme « Quel temps fait-il aujourd'hui ? » est clairement excessif. Le modèle le plus léger suffit, et il n'est peut-être même pas nécessaire que ce soit un modèle de raisonnement. De même, il existe d'innombrables cas au sein des entreprises où des modèles coûteux continuent d'être utilisés pour des tâches matures comme la création de courriels de routine.
Les tendances varient également selon les personnes. Les personnes qui ne sont pas habituées à utiliser l'IA ont tendance à choisir le modèle le plus puissant pour l'instant. À l'inverse, ceux qui utilisent l'IA de manière approfondie changent de modèle en fonction de la nature de la tâche. Cette différence, tant en termes de coût que de qualité, devient trop importante pour qu'une organisation l'ignore.
Ce qui est important ici, c'est le fait que toutes les entrées dans l'IA sont finalement converties sous la forme d'un « prompt ». Les questions de chat et le contexte transmis aux agents sont tous saisis en interne dans le modèle sous forme de prompts. En d'autres termes, si vous regardez le prompt, vous pouvez à peu près dire ce que cette personne fait faire à l'IA.
À partir de ce prompt, nous pouvons détecter les inadéquations entre les tâches et les modèles et fournir des conseils comme « Pour cette tâche, un modèle plus léger suffit ». Allant plus loin, au lieu que les gens choisissent le modèle à chaque fois, le système allouera automatiquement le modèle optimal. Nous nous dirigeons vers un tel monde.

À l'ère des agents, cela devient encore plus important. Comme les agents exécutent de manière autonome, il n'y a pas de place pour qu'un humain se demande à chaque fois : « Est-ce un luxe d'utiliser Opus maintenant ? » Dès le départ, il n'y aura pas d'autre choix que de laisser au système la sélection du modèle optimal en fonction de la nature de la tâche.
Les services que nous fournissons chez Bakuraku seront proposés en tant que services gérés, incluant l'implémentation backend qui sélectionne le modèle optimal sans que l'utilisateur ait à en être conscient. AI Token Advisor n'est que l'entrée.
Résumé
Les coûts des tokens IA dépassent déjà l'échelle à laquelle on peut les traiter avec une approche du type « on jette de l'argent ». Pour certaines entreprises, ils deviennent des dépenses comparables aux coûts de main-d'œuvre et de marketing.
Les coûts marketing sont strictement gérés par le CAC, et personne n'opère en disant « Faites de la pub sans vous soucier du CAC ». Il en va de même pour les coûts de main-d'œuvre ; les salaires, l'embauche et le placement sont tous gérés. On n'embauche pas des gens à n'importe quel salaire.
À ce même niveau, les coûts IA entreront dans le champ de la gestion. La première chose nécessaire sera alors de visualiser « combien est dépensé ». Et ensuite, de vérifier « si le modèle approprié est choisi pour la tâche et la personne ».
Cela peut sembler peu glamour, mais maîtriser ces deux points deviendra un enjeu de gestion crucial dans les années à venir.
Pour ceux qui souhaitent mettre en œuvre un tel avenir avec nous, LayerX recrute activement des AI Builders !

Nous recrutons activement ! https://jobs.layerx.co.jp/





