मैं इस लेख के बारे में लंबे समय से लिखना चाहता था, लेकिन जब मैंने अपना मासिक Claude Max सब्सक्रिप्शन रिन्यूअल ईमेल देखा तो मुझे ऐसा करने के लिए मजबूर होना पड़ा। इंटरनेट पर अपने सीमित अस्तित्व (~15 वर्ष) में, मैंने Claude/ChatGPT के मेरे जीवन में आने तक किसी भी सॉफ्टवेयर के लिए प्रति माह $10 से अधिक का भुगतान नहीं किया था।

मुझे "थीसिस" निबंध भी वास्तव में पसंद नहीं हैं, लेकिन मुझे इस एक के बारे में लिखने के लिए मजबूर होना पड़ा क्योंकि मुझे नहीं लगता कि कोई और सोच रहा है कि यह कितनी बड़ी समस्या बनने वाली है; निश्चित रूप से हमारी सरकार के शीर्ष स्तरों में नहीं, जिनके पास शायद बड़ी मछलियाँ तलने (खाना पकाने के तेल में नहीं) जैसे बड़े मुद्दे हैं।
इस सप्ताह राष्ट्र के नाम अपने संबोधन में, प्रधानमंत्री ने हमारे बढ़ते CAD (चालू खाता घाटा) पर प्रकाश डाला, जिसने उन्हें हमारे साथी नागरिकों को 'विदेश यात्रा करने', 'कार्यालय यात्रा कम करने' और 'सोना न खरीदने' आदि की सलाह देने के लिए प्रेरित किया। आप पूछ सकते हैं कि इसका इन्फ्रेंस से क्या संबंध है?
जब से मैंने IT सेवाओं पर समय बिताना शुरू किया, खासकर इस बारे में कि AI इन कंपनियों की मार्जिन संरचना को कैसे मौलिक रूप से बाधित करने वाला है, तब से डैनियल ग्रॉस के 2024 AGI ट्रेड्स निबंध के बारे में न सोचना मुश्किल रहा है, जहाँ उन्होंने भारत के तत्कालीन $250B IT निर्यात को GPT-4 टोकन (जो उस समय तर्क भी नहीं करते थे) के बराबर बताया था। आज के GPT 5.5 टोकन कहीं अधिक मूल्यवान हो गए हैं...

पेट्रोडॉलर कुछ समय से डी-फैक्टो मुद्रा संयोजन रहा है। तेल और सोने का आयात ऐतिहासिक रूप से हमारे चालू खाता घाटे को बढ़ाता रहा है और जारी रखता है। जब कीमतें बढ़ती हैं तो यह रुपये को कमजोर करता है। तेल मैक्रोइकोनॉमिस्टों, वित्त मंत्रियों और केंद्रीय बैंकरों को एक कारण से परेशान करता है। (चल रहे युद्ध ने हमारी अर्थव्यवस्था में संरचनात्मक कमजोरी को उजागर कर दिया है, जिससे मामले और बदतर हो गए हैं)
लेकिन AI अर्थव्यवस्था एक नई तरह की आयात निर्भरता पैदा कर रही है जो तेजी से नए पेट्रोडॉलर - टोकन-डॉलर की तरह दिख रही है।
यदि भारत की सेवा अर्थव्यवस्था सॉफ्टवेयर, एनालिटिक्स, कंसल्टिंग, BPM, कस्टमर सपोर्ट, कंप्लायंस, फाइनेंस ऑप्स और कोडिंग कार्य देने के लिए विदेशी मॉडल टोकन पर निर्भर होने लगती है, तो हम भारत के सबसे महत्वपूर्ण निर्यात इंजन के लिए एक नया डॉलर-मूल्यवर्गित इनपुट बना रहे हैं।
भारत को विश्व स्तरीय घरेलू इन्फ्रेंस प्लेयर की आवश्यकता इसलिए नहीं है क्योंकि यह देशभक्तिपूर्ण लगता है या संप्रभुता अच्छी लगती है, बल्कि इसलिए कि रुपया ऐसा भविष्य वहन नहीं कर सकता जहाँ AI-सक्षम कार्य की हर इकाई डॉलर में किराए पर ली जाए।
भारत का मैक्रो कुशन सेवाएं रही हैं (अभी के लिए..)
भारत के बाहरी खाते में एक सरल संरचनात्मक समस्या है। हम अपनी अर्थव्यवस्था के लिए आवश्यक बहुत सारे महत्वपूर्ण सामानों का आयात करते हैं। तेल, सोना, इलेक्ट्रॉनिक्स, मशीनरी, सेमीकंडक्टर, रक्षा उपकरण, औद्योगिक इनपुट। ये आयात निरंतर डॉलर की मांग पैदा करते हैं।
जो चीज हमें बचाती है वह हमेशा सेवाएं रही हैं; विशेष रूप से ITeS।
भारत ने वित्त वर्ष 2026 को सेवा निर्यात $418.3B के साथ बंद किया, जबकि सेवा आयात ने $213.9B का शुद्ध सेवा व्यापार अधिशेष उत्पन्न किया। वह अधिशेष ही एकमात्र कारण है कि रुपया इससे पहले नहीं टूटा। यह हमारे तेल, हमारे सोने, हमारे इलेक्ट्रॉनिक्स, हमारी मशीनरी के लिए भुगतान करता है। वित्त मंत्रालय की अपनी अप्रैल समीक्षा स्वीकार करती है कि सेवा अधिशेष व्यापारिक वस्तु व्यापार घाटे के 64.2% की भरपाई करता है। पूरा बाहरी खाता सेवा निर्यात की पीठ पर संतुलित होता है, और सेवा निर्यात भारतीय डेवलपर्स, विश्लेषकों, सहायता कर्मचारियों और इंजीनियरों की पीठ पर संतुलित होता है जो विदेशी ग्राहकों को मार्जिन पर समय बेचते हैं।
यह मैक्रो सौदा जिसके साथ भारत वर्षों से जी रहा है, अभी मौलिक रूप से बाधित हो रहा है..
भारत के लिए आलसी AI भविष्य सेवा निर्यात को टोकन आयात में बदल देता है
आज, एक भारतीय IT कंपनी एक वैश्विक ग्राहक से डॉलर कमाती है और अपनी अधिकांश लागत का आधार रुपये में चुकाती है।
कल, वही कंपनी एक वैश्विक ग्राहक से डॉलर कमा सकती है, लेकिन हर बार जब कोई AI एजेंट तर्क करता है, कोड करता है, ड्राफ्ट करता है, जाँच करता है, खोज करता है, सारांशित करता है, वर्गीकृत करता है या प्रतिक्रिया देता है, तो एक विदेशी मॉडल कंपनी को इन्फ्रेंस के लिए भुगतान कर सकती है। पिछले युग की आर्बिट्रेज एक बढ़ती हुई टोकनोमिक दुनिया में अब नहीं टिकेगी..
जोखिम यह नहीं है कि भारतीय कंपनियां विदेशी AI टूल का उपयोग करेंगी। वे पहले से ही कर रही हैं और OpenAI और Anthropic के साथ हाल ही में हस्ताक्षरित MoU को देखते हुए खर्च बढ़ाएंगी। जोखिम यह है कि सेवा वितरण में दुर्लभ इनपुट भारतीय श्रम से विदेशी इन्फ्रेंस में स्थानांतरित हो जाता है।
एक बार ऐसा होने पर, भारतीय IT किसी और की बुद्धिमत्ता का पुनर्विक्रेता बन जाता है।
टोकन आयातित मध्यवर्ती वस्तुओं की तरह व्यवहार करते हैं
एक टोकन को खारिज करना आसान है क्योंकि यह अमूर्त लगता है, कच्चे तेल के बैरल के विपरीत जो जामनगर में उतरते हैं।
लेकिन बाहरी खाते में, अमूर्तता मायने नहीं रखती क्योंकि एक आवर्ती डॉलर भुगतान अभी भी रुपये का बहिर्वाह है।
अब इसे भारत के सेवा उद्योग पर मैप करें। विदेशी इन्फ्रेंस खर्च के 10% पर $42B का वार्षिक टोकन बिल व्यापार लेजर पर तेल की तरह नहीं दिखेगा। लेकिन यह एक प्रमुख बाहरी-खाता रिसाव की तरह व्यवहार करेगा।
रुपया फीडबैक लूप
जब आप मुद्रा अवमूल्यन जोड़ते हैं तो यह और बदसूरत हो जाता है।
विदेशी इन्फ्रेंस की कीमत डॉलर में होती है। भारतीय कंपनियां अक्सर रुपये में कमाती हैं, खर्च करती हैं या रिपोर्ट करती हैं। यदि रुपया कमजोर होता है, तो हर डॉलर-मूल्यवर्गित टोकन स्थानीय मुद्रा शर्तों में अधिक महंगा हो जाता है।
यह एक दुष्चक्र बनाता है:
अधिक AI अपनाने से विदेशी इन्फ्रेंस की मांग बढ़ती है। विदेशी इन्फ्रेंस की मांग से डॉलर का बहिर्वाह बढ़ता है। डॉलर का बहिर्वाह बाहरी खाते पर दबाव डालता है। कमजोर रुपया विदेशी इन्फ्रेंस को और महंगा बनाता है। उच्च इन्फ्रेंस लागत भारतीय मार्जिन को संकुचित करती है।
यही कारण है कि घरेलू इन्फ्रेंस सिर्फ एक संप्रभुता का व्यर्थ प्रोजेक्ट नहीं है, बल्कि यह भारत में हर टेक कंपनी और स्टार्टअप के लिए लगभग एक FX हेज की तरह काम करता है।

GPU DC भविष्य की तेल रिफाइनरियां हैं
रणनीतिक रूप से, GPU AI अर्थव्यवस्था में उत्पादक ऊर्जा संपत्तियों के सबसे करीब हैं क्योंकि वे बिजली, चिप्स, मॉडल और सॉफ्टवेयर को टोकन के रूप में अनुभूति/बुद्धिमत्ता में बदलते हैं। और अब कच्चे टोकन इन दिनों तेजी से काम भी उत्पन्न करते हैं और करते भी हैं।
एक देश जिसके पास कंप्यूट की कमी है, वह उन देशों और कंपनियों से बुद्धिमत्ता किराए पर लेगा जिनके पास यह है। कम से कम तेल के मामले में, आपको अपनी सीमाओं के भीतर तेल खोजने के लिए दिव्य आशीर्वाद की आवश्यकता थी, लेकिन टोकन उत्पादन के लिए आपको केवल जेन्सेन के आशीर्वाद और एक PO की आवश्यकता है (उम्मीद है कि लिसा सु भी आगे आएंगी..)
हम तेजी से एक बहुत ही वास्तविक भविष्य की ओर बढ़ रहे हैं जहाँ भारत को अपने सभी टोकन आयात करने के लिए मजबूर होना पड़ेगा क्योंकि वह एक विश्वसनीय घरेलू इन्फ्रेंस बाजार बनाने में विफल रहा जो डॉलर-मूल्यवर्गित नहीं है।
अकेले खरीदारी से यह हल नहीं होगा
सरकार ने सही दिशा में कदम बढ़ाया है। IndiaAI मिशन के तहत, एक सामान्य कंप्यूट सुविधा के लिए 38,000 से अधिक GPU ऑनबोर्ड किए गए हैं, जिसकी पहुंच स्टार्टअप्स, शिक्षा जगत और सार्वजनिक संस्थानों को उपलब्ध कराई गई है। मिशन के तहत GPU को ₹65 प्रति घंटे पर उपलब्ध बताया गया है।
लेकिन एक मजबूत इन्फ्रेंस लेयर के बिना एक GPU क्लाउड एक और सरकारी पोर्टल बन जाता है। पायलट और सुर्खियों के लिए उपयोगी, उत्पादन उपयोग-मामलों के लिए कमजोर, डेवलपर्स के लिए अदृश्य, उद्यमों के लिए अप्रासंगिक।
एक सार्वजनिक भारतीय इन्फ्रेंस प्लेटफॉर्म कैसा दिखेगा? इसमें होना चाहिए
- रुपया मूल्य निर्धारण।
- सबसे अधिक टोकन-कुशल तरीके से परोसे गए SoTA ओपन-वेट मॉडल (vLLM, SGLang, TensorRT आदि..)
- वास्तविक समय में अपडेट किए गए सार्वजनिक विलंबता और थ्रूपुट बेंचमार्क
- निजी तैनाती विकल्प।
- तेज मॉडल रिफ्रेश चक्र।
- भारतीय भाषा प्रदर्शन।
- प्रति हल किए गए वर्कफ़्लो की लागत, न कि केवल प्रति टोकन लागत।
बेंचमार्क सरल होना चाहिए: क्या कोई भारतीय डेवलपर एप्लिकेशन को फिर से लिखे बिना, विश्वसनीयता का त्याग किए बिना या मॉडल कैटलॉग के पकड़ने के लिए तीन-छह महीने प्रतीक्षा किए बिना विदेशी API से घरेलू एंडपॉइंट पर स्विच कर सकता है?
यदि उत्तर नहीं है, तो हमारे पास अभी तक कोई इन्फ्रेंस प्लेटफॉर्म या रणनीति नहीं है।
हम इस बार फ्रंटियर SoTA LLM प्री-ट्रेनिंग गेम से चूक गए होंगे
भारत को इस बारे में ईमानदार होना चाहिए कि वह कहाँ खड़ा है।
OpenAI, Google, Anthropic, Meta और चीन की सबसे मजबूत प्रयोगशालाओं के खिलाफ एक फ्रंटियर मॉडल को प्रशिक्षित करने के लिए कंप्यूट, प्रतिभा, डेटा, बुनियादी ढांचे, मूल्यांकन गहराई, वितरण और अरबों डॉलर के जोखिम पूंजी की आवश्यकता होती है।
लेकिन तत्काल मैक्रो लड़ाई इन्फ्रेंस है क्योंकि अधिकांश उद्यम वर्कफ़्लो को पृथ्वी पर सबसे स्मार्ट मॉडल की आवश्यकता नहीं होती है। उन्हें सबसे सस्ते मॉडल की आवश्यकता होती है जो कार्य को विश्वसनीय रूप से हल करता है।
और इन्फ्रेंस वास्तव में एक पैसा कमाने वाला व्यवसाय है जब तक GPU आपकी बैलेंस शीट पर नहीं हैं। यह देखते हुए कि अत्याधुनिक इन्फ्रेंस एक हार्डवेयर-सॉफ्टवेयर सह-डिज़ाइन है, यहाँ धातु के जितना करीब होना मदद करता है और आपके व्यवसाय के लिए संरचनात्मक खाई बनाता है।

एक बैक-ऑफिस दावा वर्कफ़्लो को हमेशा नवीनतम Opus/5.5 की आवश्यकता नहीं होती है। एक कंप्लायंस एजेंट को हमेशा अधिकतम फ्रंटियर रीजनिंग की आवश्यकता नहीं होती है। एक कस्टमर सपोर्ट सारांशकर्ता को हमेशा सबसे महंगे उपलब्ध मॉडल की आवश्यकता नहीं होती है।
एक मजबूत ओपन-वेट मॉडल, जो कस्टम वर्कफ़्लो के लिए रूटेड-कैश्ड-फाइन-ट्यून किया गया हो, वास्तविक दुनिया के मूल्यांकन के साथ और कम लागत पर स्थानीय रूप से परोसा गया हो, भारतीय उद्यम कार्यभार का एक बड़ा हिस्सा जीत सकता है।
यहीं पर भारत के पास अभी भी एक खिड़की है। चीन को यह लगभग 2 साल पहले LLM के साथ और 15 साल पहले क्लाउड कंप्यूटिंग बुनियादी ढांचे के साथ एहसास हुआ था।

चीनी टेक दिग्गजों ने महसूस किया है कि वे चुप नहीं रह सकते और मॉडल प्रशिक्षण के साथ पश्चिम को नियंत्रण नहीं सौंप सकते - हाल ही में H200 खरीद और Huawei के स्वदेशी NPU पर उनका ध्यान यह भी दर्शाता है कि वे इस आसन्न आयात कर को कितनी गंभीरता से लेते हैं। हमारे शीर्ष नेता इस बात पर उपदेश देने में व्यस्त हैं कि हमें प्री-ट्रेनिंग कैसे बंद करनी चाहिए और दिखाने के लिए किसी वास्तविक इन्फ्रेंस क्षमता के बिना उपयोग-मामलों से प्यार करना सीखना चाहिए..
अमेरिका पहले से ही इन्फ्रेंस लेयर को गहराई से समझता है और इन्फ्रेंस रिसर्च लैब बन रहा है..
Together (उनके मुख्य वैज्ञानिक Tri Dao Flash Attention के पीछे दिमाग हैं), Fireworks (Cursor के साथ एंकर ग्राहक के रूप में RL पोस्ट-ट्रेनिंग), Baseten, DeepInfra, Modal और अब vLLM (Inferact) और SGLang (Radixark) दोनों सैकड़ों मिलियन डॉलर का फंडिंग जुटा रहे हैं, ओपन-वेट मॉडल के आसपास उच्च-प्रदर्शन इन्फ्रेंस लेयर बना रहे हैं - डी-फैक्टो इन्फ्रेंस नियो-लैब बन रहे हैं।
वे मॉडल कैटलॉग को जल्दी से अपडेट करते हैं। वे विलंबता, लागत और डेवलपर अनुभव पर प्रतिस्पर्धा करते हैं। NVIDIA ने स्वयं Baseten, DeepInfra, Fireworks और Together जैसी कंपनियों को Blackwell सिस्टम पर अनुकूलित इन्फ्रेंस के माध्यम से टोकन लागत कम करने के लिए उजागर किया है।

एक भी भारतीय कंपनी इस पैमाने पर काम नहीं करती है, भले ही दुनिया ने पारंपरिक रूप से IT सेवाएं देने की हमारी क्षमता को मान्यता दी हो।
परिणामस्वरूप, हमारे पास अभी भी डिफ़ॉल्ट घरेलू इन्फ्रेंस प्लेटफॉर्म का अभाव है जिस पर एक गंभीर डेवलपर, बैंक, SaaS कंपनी, IT विक्रेता या सरकारी विभाग पहले संपर्क के बिंदु के रूप में भरोसा कर सके।
जबकि हमारे पास Simplismart, Neysa और Yotta जैसे खिलाड़ी हैं - उनके प्लेटफॉर्म पर एक त्वरित नज़र दिखाती है कि हम विभिन्न मापदंडों पर कितने पीछे हैं।


भारतीय मौजूदा खिलाड़ियों की समस्या
भारत के बड़े GPU और क्लाउड खिलाड़ी इन्फ्रेंस को कैटलॉग पेज की तरह मानते नहीं रह सकते। यदि दुनिया Llama से Qwen से DeepSeek से Kimi से अगले महीने जो कुछ भी आता है (Xiaomi के पास अब एक फ्रंटियर ओपन वेट मॉडल है!!) की ओर बढ़ रही है, तो भारतीय इन्फ्रेंस प्रदाता PSU खरीद गति पर मॉडल कैटलॉग अपडेट नहीं कर सकते।
घरेलू इन्फ्रेंस को विदेशी इन्फ्रेंस के समान मानक पर रखा जाना चाहिए।
- बेहतर, जहाँ भारत-विशिष्ट कार्यभार मायने रखते हैं।
- सस्ता, जहाँ रुपया अर्थशास्त्र मायने रखता है।
- निजी, जहाँ विनियमन मायने रखता है।
- वर्तमान, जहाँ मॉडल प्रदर्शन मायने रखता है।
यह एक नीति समस्या और एक स्टार्टअप अवसर है
अच्छी खबर यह है कि यह निर्माण योग्य है और हमें समुद्र को उबालने की आवश्यकता नहीं है।
हम पहले से ही जानते हैं कि Anthropic, Google और OpenAI, ये सभी भारत को AI खर्च के लिए अपना दूसरा सबसे बड़ा बाजार मानते हैं - भूख स्पष्ट रूप से मौजूद है। ElevenLabs भारत में विशुद्ध रूप से वॉयस इन्फ्रेंस बेचकर $100M वार्षिक राजस्व बनाने की राह पर है।
जबकि IndiaAI मिशन सही रास्ते पर शुरू हुआ, कहीं न कहीं रबर सड़क से नहीं टकरा पाया - क्योंकि हमने सोचा कि अकेले GPU खरीदना पर्याप्त है।
सब्सिडी वाले कंप्यूट को वास्तविक उत्पादन उपयोग को पुरस्कृत करना चाहिए, न कि लोगो संग्रह को।

सवाल यह है कि अंत में मार्जिन कौन कैप्चर करता है (जेन्सेन के अलावा)। यदि विदेशी मॉडल कंपनियां टोकन मार्जिन कैप्चर करती हैं, विदेशी क्लाउड बुनियादी ढांचे का मार्जिन कैप्चर करते हैं, और भारतीय कंपनियां एकीकरण मार्जिन रखती हैं, तो AI हमारे पास मौजूद एकमात्र लाभ (श्रम आर्बिट्रेज) को खा जाता है, जिससे इसकी बाहरी निर्भरता और खराब हो जाती है।
यदि भारत घरेलू इन्फ्रेंस बनाता है, तो कहानी बदल जाती है क्योंकि सभी आयातित GPU घरेलू बुनियादी ढांचा बन जाते हैं - कुछ डॉलर टोकन खर्च रुपया खर्च बन जाता है और कुछ मार्जिन भारतीय बुनियादी ढांचा कंपनियों के पास रहता है।
कुछ AI क्षमता भारतीय स्टार्टअप्स और उद्यमों के लिए निरंतर FX जोखिम के बिना उपलब्ध हो जाती है। कुछ सेवा निर्यात अधिक रक्षात्मक हो जाते हैं।
समापन
भारत का अगला तेल आयात शैली का बिल केवल जामनगर में डॉक करने वाले टैंकरों से नहीं आ सकता है।
यह निश्चित रूप से भारतीय सेवा कंपनियों और स्टार्टअप्स द्वारा किए गए लाखों API कॉल से आएगा जो खुद को AI-नेटिव कहते हैं जबकि डॉलर में बुद्धिमत्ता किराए पर लेते हैं।
दशकों से, भारत ने ऊर्जा आयात की और सॉफ्टवेयर निर्यात किया।
लेकिन यह टालने योग्य है। इसके लिए आवश्यक है कि भारत GPU खरीद को इन्फ्रेंस क्षमता के साथ भ्रमित करना बंद करे, देशभक्तिपूर्ण संप्रभु ब्रांडिंग को भ्रमित करना बंद करे जो उत्पादन-ग्रेड बुनियादी ढांचा नहीं है, और यह दिखावा करना बंद करे कि AI बिल किसी और की समस्या है। बिल पहले से ही आ रहा है। मेरा पिछले महीने $138 था जो भारी सब्सिडी वाला था। आपका निकट भविष्य में जल्द ही नहीं होगा।
घरेलू इन्फ्रेंस अब मैक्रोइकोनॉमिक बुनियादी ढांचा है। हमें युद्ध स्तर पर क्षमता बढ़ाने की आवश्यकता है जैसे कि रुपया इस पर निर्भर हो





