J'avais l'intention d'écrire sur ce sujet depuis longtemps, mais j'y ai été brutalement contraint en voyant l'e-mail de renouvellement mensuel de mon abonnement Claude Max. Dans ma modeste existence sur Internet (~15 ans), je n'avais jamais payé plus de 10 $ par mois pour un logiciel avant que Claude/ChatGPT n'entre dans ma vie.

Je n'aime pas non plus les « essais à thèse », mais j'ai été obligé d'écrire celui-ci parce que je ne pense pas que quiconque mesure l'ampleur du problème qui se profile ; certainement pas au sommet de notre gouvernement, qui a probablement d'autres chats à fouetter (et pas dans l'huile de cuisson).
Lors de son discours à la nation cette semaine, le Premier ministre a souligné notre déficit croissant du compte courant (CAD), ce qui l'a incité à conseiller à nos concitoyens de « voyager moins à l'étranger », « réduire les déplacements professionnels » et « ne pas acheter d'or », etc. Quel est le rapport avec l'inférence, me demanderez-vous ?
Depuis que j'ai commencé à m'intéresser aux services IT, en particulier à la façon dont l'IA allait radicalement bouleverser la structure de marge de ces entreprises, il m'est difficile de ne pas penser à l'essai de Daniel Gross sur les trades AGI de 2024, où il assimile les exportations IT de l'Inde (alors 250 milliards de dollars) aux tokens GPT-4 (qui, à l'époque, ne raisonnaient même pas). Les tokens GPT-5.5 d'aujourd'hui sont devenus bien plus précieux…

Le pétrodollar est la combinaison monétaire de facto depuis un certain temps. Les importations de pétrole et d'or ont historiquement creusé notre déficit du compte courant, et continuent de le faire. Elles affaiblissent la roupie lorsque les prix grimpent. Le pétrole rend les macroéconomistes, les ministres des Finances et les banquiers centraux nerveux pour une bonne raison. (La guerre en cours a exposé les faiblesses structurelles de notre économie, aggravant les choses.)
Mais l'économie de l'IA crée une nouvelle forme de dépendance aux importations qui ressemble de plus en plus au nouveau pétrodollar : le token-dollar.
Si l'économie de services de l'Inde commence à dépendre des tokens de modèles étrangers pour fournir des logiciels, de l'analyse, du conseil, de la BPM, du support client, de la conformité, des opérations financières et du codage, alors nous créons un nouvel intrant libellé en dollars pour le moteur d'exportation le plus important de l'Inde.
L'Inde n'a pas besoin d'un acteur national d'inférence de classe mondiale parce que cela sonne patriotique ou que « souverain » fait cool, mais parce que la roupie ne peut pas se permettre un avenir où chaque unité de travail activée par l'IA est louée en dollars.
Le coussin macroéconomique de l'Inde, ce sont les services (pour l'instant…)
Le compte extérieur de l'Inde a un problème structurel simple. Nous importons beaucoup de biens essentiels à notre économie : pétrole, or, électronique, machines, semi-conducteurs, équipements de défense, intrants industriels. Ces importations créent une demande constante de dollars.
Ce qui nous sauve, ce sont toujours les services, et plus précisément les ITeS.
L'Inde a clôturé l'exercice 2026 avec des exportations de services à 418,3 milliards de dollars, contre des importations de services qui ont généré un excédent net de la balance des services de 213,9 milliards de dollars. Cet excédent est la seule raison pour laquelle la roupie ne s'est pas effondrée bien plus tôt. Il paie notre pétrole, notre or, notre électronique, nos machines. La propre revue d'avril du ministère des Finances admet que l'excédent des services compense 64,2 % du déficit commercial des marchandises. L'ensemble du compte extérieur repose sur les exportations de services, et les exportations de services reposent sur les développeurs, analystes, personnels de support et ingénieurs indiens qui vendent leur temps à des clients étrangers avec une marge.
Ce compromis macroéconomique avec lequel l'Inde vit depuis des années est en train d'être radicalement perturbé, à l'heure où nous parlons.
Le futur paresseux de l'IA pour l'Inde transforme les exportations de services en importations de tokens
Aujourd'hui, une entreprise IT indienne gagne des dollars auprès d'un client mondial et paie la majeure partie de sa base de coûts en roupies.
Demain, la même entreprise pourrait gagner des dollars auprès d'un client mondial, mais payer une entreprise de modèles étrangère pour de l'inférence chaque fois qu'un agent IA raisonne, code, rédige, vérifie, cherche, résume, classifie ou répond. L'arbitrage de l'ère précédente ne tiendra plus dans un monde de plus en plus tokenomique.
Le risque n'est pas que les entreprises indiennes utilisent des outils d'IA étrangers. Elles le font déjà et augmenteront leurs dépenses, comme le montrent les récents protocoles d'accord signés avec OpenAI et Anthropic. Le risque est que l'intrant rare dans la prestation de services passe du travail indien à l'inférence étrangère.
Une fois que cela se produit, l'IT indienne devient un revendeur de l'intelligence de quelqu'un d'autre.
Les tokens se comportent comme des biens intermédiaires importés
Un token est facile à ignorer parce qu'il semble abstrait, contrairement aux barils de pétrole brut qui se déchargent à Jamnagar.
Mais dans le compte extérieur, l'abstraction n'a pas d'importance : un paiement récurrent en dollars représente toujours une sortie de roupies.
Maintenant, appliquez cela à l'industrie des services en Inde. Une facture annuelle de tokens de 42 milliards de dollars, à 10 % des dépenses d'inférence étrangère, ne ressemblerait pas à du pétrole dans la balance commerciale. Mais elle se comporterait comme une fuite majeure du compte extérieur.
La boucle de rétroaction de la roupie
Cela devient encore plus laid quand on ajoute la dépréciation de la monnaie.
L'inférence étrangère est facturée en dollars. Les entreprises indiennes gagnent, dépensent ou déclarent souvent en roupies. Si la roupie s'affaiblit, chaque token libellé en dollars devient plus cher en monnaie locale.
Cela crée une boucle vicieuse :
Une adoption accrue de l'IA augmente la demande d'inférence étrangère. La demande d'inférence étrangère augmente les sorties de dollars. Les sorties de dollars exercent une pression sur le compte extérieur. Une roupie plus faible rend l'inférence étrangère plus chère. Un coût d'inférence plus élevé comprime les marges indiennes.
C'est pourquoi l'inférence nationale n'est pas qu'un projet de vanité souveraine : elle agit presque comme une couverture de change (FX hedge) pour chaque entreprise technologique et startup en Inde.

Les centres de données GPU sont les raffineries de pétrole du futur
Stratégiquement, les GPU sont ce que l'économie de l'IA a de plus proche d'actifs énergétiques productifs, car ils transforment l'électricité, les puces, les modèles et les logiciels en cognition/intelligence sous forme de tokens. Et aujourd'hui, les tokens bruts produisent et effectuent également le travail.
Un pays qui manque de capacité de calcul louera de l'intelligence aux pays et entreprises qui en possèdent. Au moins pour le pétrole, il fallait avoir la bénédiction divine pour trouver du pétrole sur son territoire, mais pour produire des tokens, vous n'avez besoin que de la bénédiction de Jensen et d'un bon de commande (avec un peu de chance, Lisa Su suivra aussi…).
Nous nous dirigeons rapidement vers un avenir très réel où l'Inde sera contrainte d'importer tous ses tokens parce qu'elle n'a pas réussi à construire un marché d'inférence national fiable qui ne soit pas libellé en dollars.
Les seuls achats ne résoudront pas ce problème
Le gouvernement a pris des mesures dans la bonne direction. Dans le cadre de la mission IndiaAI, plus de 38 000 GPU ont été intégrés dans une installation de calcul commune, accessible aux startups, au monde académique et aux institutions publiques. Les GPU de la mission ont également été décrits comme disponibles à 65 roupies de l'heure.
Mais un cloud GPU sans une couche d'inférence solide devient un autre portail gouvernemental. Utile pour les pilotes et les gros titres, faible pour les cas d'usage en production, invisible pour les développeurs, sans intérêt pour les entreprises.
À quoi ressemblerait une plateforme d'inférence publique indienne ? Elle devrait avoir :
- Une tarification en roupies.
- Des modèles open-weight de pointe servis de la manière la plus efficace possible en termes de tokens (vLLM, SGLang, TensorRT, etc.).
- Des benchmarks publics de latence et de débit mis à jour en temps réel.
- Des options de déploiement privé.
- Des cycles de rafraîchissement rapides des modèles.
- Des performances en langues indiennes.
- Un coût par workflow résolu, pas seulement un coût par token.
Le critère de référence devrait être simple : un développeur indien peut-il passer d'une API étrangère à un point de terminaison national sans réécrire l'application, sacrifier la fiabilité ou attendre trois à six mois que le catalogue de modèles rattrape son retard ?
Si la réponse est non, nous n'avons PAS encore de plateforme ou de stratégie d'inférence.
Nous avons peut-être raté le jeu du pré-entraînement des LLM de pointe cette fois-ci
L'Inde doit être honnête sur sa position.
Entraîner un modèle de pointe contre OpenAI, Google, Anthropic, Meta et les laboratoires les plus puissants de Chine nécessite de la puissance de calcul, des talents, des données, des infrastructures, une profondeur d'évaluation, une distribution et des milliards de dollars de capital-risque.
Mais la bataille macroéconomique immédiate, c'est l'inférence, car la plupart des workflows d'entreprise n'ont pas besoin du modèle le plus intelligent du monde. Ils ont besoin du modèle le moins cher qui résout la tâche de manière fiable.
Et l'inférence est véritablement une machine à cash, tant que les GPU ne sont pas dans votre bilan. Étant donné que l'inférence de pointe est une co-conception matériel-logiciel, être au plus près du métal aide et construit des fossés structurels pour votre entreprise.

Un workflow de traitement des sinistres en back-office n'a pas toujours besoin du dernier Opus/5.5. Un agent de conformité n'a pas toujours besoin du raisonnement de pointe maximal. Un résumeur de support client n'a pas toujours besoin du modèle le plus cher disponible.
Un modèle open-weight solide, routé, mis en cache et affiné pour des workflows personnalisés, avec des évaluations réelles et servi localement à moindre coût, peut conquérir une grande part des charges de travail des entreprises indiennes.
C'est là que l'Inde a encore une fenêtre d'opportunité. La Chine l'a compris il y a environ 2 ans avec les LLM et il y a 15 ans avec l'infrastructure de cloud computing.

Les géants technologiques chinois ont réalisé qu'ils ne pouvaient pas rester silencieux et céder le contrôle à l'Occident en matière d'entraînement de modèles – les récents achats de H200 et leur focalisation sur les NPU maison de Huawei montrent à quel point ils prennent au sérieux cette taxe à l'importation imminente. Nos dirigeants, eux, sont occupés à pontifier sur la façon dont nous devrions arrêter le pré-entraînement et apprendre à aimer les cas d'usage, sans aucune capacité d'inférence réelle à montrer.
Les États-Unis comprennent déjà profondément la couche d'inférence et deviennent des laboratoires de recherche en inférence…
Together (Tri Dao, leur scientifique en chef, est le cerveau derrière Flash Attention), Fireworks (post-entraînement RL avec Cursor comme client pilier), Baseten, DeepInfra, Modal et maintenant vLLM (Inferact) et SGLang (Radixark) – tous ayant levé des centaines de millions de dollars – construisent des couches d'inférence haute performance autour de modèles open-weight, devenant de facto des néo-laboratoires d'inférence.
Ils mettent à jour rapidement leurs catalogues de modèles. Ils sont en compétition sur la latence, le coût et l'expérience développeur. NVIDIA elle-même a mis en avant des entreprises comme Baseten, DeepInfra, Fireworks et Together pour avoir réduit les coûts des tokens grâce à une inférence optimisée sur les systèmes Blackwell.

Aucune entreprise indienne n'opère à cette échelle, même si le monde a traditionnellement reconnu notre capacité à fournir des services IT.
En conséquence, nous manquons toujours de la plateforme d'inférence nationale par défaut à laquelle un développeur sérieux, une banque, une entreprise SaaS, un fournisseur IT ou un département gouvernemental pourrait faire confiance comme premier recours.
Bien que nous ayons des acteurs comme Simplismart, Neysa et Yotta, un simple coup d'œil à leurs plateformes montre à quel point nous sommes en retard sur tous les paramètres.


Le problème des acteurs établis en Inde
Les grands acteurs indiens du GPU et du cloud ne peuvent pas continuer à traiter l'inférence comme une page de catalogue. Si le monde passe de Llama à Qwen à DeepSeek à Kimi à ce qui sortira le mois prochain (Xiaomi a maintenant un modèle open-weight de pointe !), les fournisseurs d'inférence indiens ne peuvent pas mettre à jour leurs catalogues de modèles à la vitesse des achats publics.
L'inférence nationale doit être tenue aux mêmes normes que l'inférence étrangère.
- Meilleure, là où les charges de travail spécifiques à l'Inde comptent.
- Moins chère, là où l'économie en roupies compte.
- Privée, là où la réglementation compte.
- À jour, là où la performance des modèles compte.
C'est un problème de politique publique et une opportunité pour les startups
La bonne nouvelle, c'est que c'est réalisable et que nous n'avons pas besoin de « faire bouillir l'océan ».
Nous savons déjà qu'Anthropic, Google et OpenAI considèrent tous l'Inde comme leur deuxième plus grand marché pour les dépenses en IA – l'appétit est clairement là. ElevenLabs est en passe de réaliser 100 millions de dollars de revenus annuels en Inde rien qu'en vendant de l'inférence vocale.
Bien que la mission IndiaAI ait démarré sur la bonne voie, quelque part, le caoutchouc n'a pas rencontré la route – parce que nous avons pensé qu'acquérir des GPU suffisait.
La puissance de calcul subventionnée devrait récompenser l'utilisation réelle en production, pas la collection de logos.

La question est de savoir qui capte la marge au final (à part Jensen). Si les entreprises de modèles étrangères captent la marge des tokens, les clouds étrangers captent la marge d'infrastructure, et les entreprises indiennes gardent la marge d'intégration, alors l'IA mange le seul avantage que nous ayons (l'arbitrage de main-d'œuvre), aggravant notre dépendance extérieure.
Si l'Inde construit une inférence nationale, l'histoire change : tous les GPU importés deviennent une infrastructure nationale, une partie des dépenses en tokens en dollars devient une dépense en roupies, et une partie de la marge reste chez les entreprises d'infrastructure indiennes.
Une partie de la capacité IA devient accessible aux startups et entreprises indiennes sans exposition constante au taux de change. Une partie des exportations de services devient plus défendable.
Conclusion
La prochaine facture de type importation de pétrole pour l'Inde ne viendra peut-être pas seulement des pétroliers accostant à Jamnagar.
Elle viendra SÛREMENT de millions d'appels API effectués par les entreprises de services et startups indiennes qui se disent natives de l'IA tout en louant de l'intelligence en dollars.
Pendant des décennies, l'Inde a importé de l'énergie et exporté des logiciels.
Mais cela peut être évité. Il faut que l'Inde cesse de confondre l'acquisition de GPU avec la capacité d'inférence, cesse de confondre un branding patriotique souverain qui n'est PAS une infrastructure de qualité production, et cesse de faire semblant que la facture de l'IA est le problème de quelqu'un d'autre. La facture arrive déjà. La mienne était de 138 $ le mois dernier, et elle était fortement subventionnée. La vôtre ne le sera bientôt plus.
L'inférence nationale est désormais une infrastructure macroéconomique. Nous devons augmenter la capacité sur le pied de guerre, comme si la roupie en dépendait.





