LLM इन्फरेंस: अतीत, वर्तमान और भविष्य — वैल्यू कहाँ जा रही है?

@lightseekorg
अंग्रेज़ी07 अग॰ 2026
133K
170
25
8
261

TL;DR

जैसे-जैसे LLM इन्फरेंस इंजन कमोडिटी बनते जा रहे हैं, प्रतिस्पर्धात्मक लाभ सॉफ्टवेयर कर्नेल से हटकर परिचालन पैमाने, GPU क्षमता और भौतिक डेटा सेंटर संपत्तियों की ओर स्थानांतरित हो रहा है।

LLM इन्फ़रेंस — अतीत, वर्तमान और भविष्य: मूल्य कहाँ स्थानांतरित होता है?

पिछले दो वर्षों से, LLM इन्फ़रेंस AI इंफ्रास्ट्रक्चर की सबसे अधिक प्रतिस्पर्धात्मक परतों में से एक रहा है। दर्जनों इन्फ़रेंस प्रदाता, GPU क्लाउड, ओपन-सोर्स प्रोजेक्ट और चिप विक्रेता — सभी एक ही लक्ष्य का पीछा कर रहे हैं: किसी प्रशिक्षित मॉडल को अगली कंपनी से अधिक तेज़ और सस्ता परोसना।

यह आकर्षण एक तार्किक विचार पर टिका था। इन्फ़रेंस एक सॉफ़्टवेयर समस्या जैसा दिखता था जिसमें सॉफ़्टवेयर-आधारित सुरक्षा खाई (moat) थी। बेहतर कर्नेल, अधिक चतुर शेड्यूलर, या मज़बूत स्पेक्युलेटिव डिकोडिंग प्रीमियम मूल्य निर्धारण या समान मूल्य पर बेहतर मार्जिन का समर्थन कर सकते थे। कुछ समय के लिए, इन-हाउस इंजन एक वास्तविक प्रतिस्पर्धात्मक हथियार था, और बेंचमार्क सौदे जीतते थे।

वह दौर समाप्त हो रहा है। इन्फ़रेंस पहले से कहीं अधिक महत्वपूर्ण है, और बाज़ार बढ़ता ही जा रहा है, लेकिन टिकाऊ मूल्य इंजन से दूर चला गया है। इंजन परत तेज़ी से कमोडिटी बन रही है। मूल्य पहले सर्विंग संचालन और प्लेटफ़ॉर्म की ओर स्थानांतरित हो रहा है, फिर पूंजी, GPU क्षमता और अंततः डेटा सेंटरों की ओर।

सॉफ़्टवेयर प्रदर्शन अब भी मायने रखता है। धीमा या अविश्वसनीय इंजन किसी प्रदाता को अयोग्य घोषित कर सकता है। हालाँकि, अच्छा प्रदर्शन अब व्यापक रूप से उपलब्ध हो गया है, जिससे किसी एक कंपनी के लिए उसके लिए अलग से शुल्क लेना कठिन हो गया है। सवाल अब यह नहीं है कि इंजन मूल्य बनाता है या नहीं, बल्कि यह है कि एक बार इंजन सामान्य इंफ्रास्ट्रक्चर बन जाने पर उस मूल्य को कौन हासिल करता है।

तीन हार्डवेयर पीढ़ियाँ इस बदलाव को स्पष्ट करती हैं। यही पैटर्न आज इन्फ़रेंस प्रदाताओं के बीच प्रतिस्पर्धा और उसकी अगली दिशा को भी समझाता है।

भाग I: अतीत — जब इंजन ही खाई (Moat) था

तीन पीढ़ियाँ, तीन चेकलिस्ट

NVIDIA की प्रत्येक हार्डवेयर पीढ़ी के साथ इन-हाउस इंजन के लिए एक चेकलिस्ट आती थी। जो बदला वह यह था कि चेकलिस्ट कितनी जल्दी सार्वजनिक ज्ञान बन गई, और एक बार सभी के पूरा कर लेने के बाद कितना कम लाभ शेष बचा।

Ampere युग (A100)। शुरुआती मानदंड ठोस था। एक इंजन जो लॉन्च ओवरहेड हटाने के लिए CUDA Graphs का समर्थन करता था, EAGLE-1 या Medusa जैसी स्पेक्युलेटिव डिकोडिंग लागू करता था, और ठोस W8A8 INT8 क्वांटाइज़ेशन शिप करता था, वह अधिकांश प्रतिस्पर्धियों से आगे रहता था। इंजीनियरिंग कठिन थी लेकिन सीमित थी, और उस छोटी सूची को पूरा करना प्रदाता को शीर्ष स्तर पर पहुँचा देता था। ये सुविधाएँ सौदे जीतती थीं।

Hopper युग (H100/H200)। सूची बढ़ी और दो भागों में विभाजित हो गई। एकल परिनियोजन के लिए — चाहे एक रेप्लिका, एक नोड, या कुछ ही — विभेदक कारक FlashAttention-3, FP8 अटेंशन, EAGLE-3 स्पेक्युलेटिव डिकोडिंग और W8A8 FP8 क्वांटाइज़ेशन थे। मज़बूत कार्यान्वयन उत्कृष्ट सिंगल-नोड परिणाम देते थे।

Hopper ने विघटित (disaggregated) परिनियोजन में दूसरा मोर्चा भी खोला। प्रीफिल–डिकोड (PD) डिसएग्रीगेशन, तेजी से प्रभावी होते MoE आर्किटेक्चर के लिए एक्सपर्ट पैरेललिज़्म (EP), और मेमोरी पदानुक्रम में KV कैश ऑफलोड का समर्थन क्लस्टर स्तर पर मायने रखता था, जहाँ सबसे बड़े अनुबंध रहते थे। इस स्तर पर कर्नेल कार्य के साथ-साथ सिस्टम इंजीनियरिंग की भी आवश्यकता थी। कुछ समय के लिए, इसने सबसे मज़बूत प्रदाताओं को बाकी सभी से अलग कर दिया।

दोनों स्तर अलग-अलग क्षमताओं को पुरस्कृत करते थे। कर्नेल टीमें अब भी सीमित परिनियोजन पर बेंचमार्क जीत सकती थीं, जबकि सबसे बड़े प्रोडक्शन वर्कलोड मशीनों, मेमोरी पूल और विफलता डोमेन के बीच समन्वय की माँग करते थे। उस दूसरे स्तर की नकल करने में अधिक समय लगता था, और यह प्रदाताओं को इंजीनियरिंग कार्य को राजस्व में बदलने के लिए एक बड़ी खिड़की देता था।

Blackwell युग (B200/B300/GB200/GB300)। यहाँ चेकलिस्ट एक मुख्य मद तक सिमट गई है: NVFP4 ऑप्टिमाइज़ेशन। प्रमुख मार्ग अब कोई स्वतंत्र कार्यान्वयन नहीं है। टीमें NVIDIA द्वारा शिप किए गए trtllm-gen cubins को एकीकृत करती हैं या सीधे TensorRT-LLM पर निर्माण करती हैं। स्पेक्युलेटिव डिकोडिंग, FP8 और FP4 पथ, डिसएग्रीगेशन समर्थन और MoE पैरेललिज़्म पहले से ही संदर्भ स्टैक में मौजूद हैं।

Blackwell निर्माण-या-खरीद के निर्णय को बदल देता है। स्टैक को एक बार बनाना तकनीकी गहराई प्रदर्शित करता था; अब यह विक्रेता के कार्य को दोहराने के बराबर हो सकता है, जबकि प्रतिस्पर्धी वही इंजीनियर कहीं और लगा रहे हैं। एक स्वामित्व कार्यान्वयन अब भी किसी असामान्य मॉडल या परिनियोजन के लिए उपयुक्त हो सकता है, लेकिन यह अब अग्रणी प्रदर्शन का डिफ़ॉल्ट मार्ग नहीं है।

इन्फ़रेंस में कोई रहस्य नहीं है। हर महत्वपूर्ण तकनीक के पास एक पेपर, एक ओपन-सोर्स कार्यान्वयन, या एक विक्रेता बाइनरी है। ज्ञान जो कभी कुछ प्रदर्शन टीमों के बीच प्रसारित होता था, अब कोड में पैक हो गया है जिसे कोई भी सक्षम समूह देख या एकीकृत कर सकता है। चेकलिस्ट अब भी इंजन को योग्य बनाती है, लेकिन अब उसे अलग नहीं करती।

TRT-LLM Blackwell बेसलाइन क्यों बना

Blackwell युग में TensorRT-LLM की स्थिति बाज़ार के दोनों पक्षों के प्रोत्साहनों से उत्पन्न होती है।

NVIDIA को TRT-LLM का अच्छा प्रदर्शन आवश्यक है। यह सॉफ़्टवेयर उसके नए-हार्डवेयर बेंचमार्क को रेखांकित करता है, जिसमें InferenceX सबमिशन, लॉन्च-दिवस के दावे और कीनोट परिणाम शामिल हैं। इसलिए नए चिप के लिए ऑप्टिमाइज़ेशन पहले दिन TRT-LLM में आते हैं, जो एक बड़े कर्नेल-इंजीनियरिंग संगठन और एक सक्षम रनटाइम द्वारा समर्थित होते हैं।

स्वतंत्र इंजन अकेले प्रयास से उस लाभ को दोहरा नहीं सकते। NVIDIA हार्डवेयर रोडमैप देखता है, निम्नतम सॉफ़्टवेयर परतों को नियंत्रित करता है, और उसके पास प्रत्येक पीढ़ी को लॉन्च के समय मज़बूत दिखाने का सीधा व्यावसायिक कारण है। TRT-LLM वह जगह है जहाँ ये प्रोत्साहन मिलते हैं।

साथ ही, कुछ सीमांत (frontier) ओपन-वेट मॉडल परिवार अब गंभीर प्रोडक्शन ट्रैफ़िक के विशाल बहुमत के लिए ज़िम्मेदार हैं। प्रदाताओं को सैकड़ों आर्किटेक्चर का समर्थन करने की आवश्यकता कम है। उस संकीर्ण मॉडल सेट और Blackwell हार्डवेयर को देखते हुए, TRT-LLM उपलब्ध उच्चतम प्रदर्शन सीमा प्रदान करता है। मॉडल समर्थन की व्यापकता — सामान्य-उद्देश्यीय इंजन का पारंपरिक तर्क — तब कम मायने रखती है जब माँग स्वयं संकीर्ण हो गई हो।

प्रोडक्शन अब विशेषज्ञता को पुरस्कृत करता है। एक इंजन जो लंबी पूंछ (long tail) को अच्छी तरह संभालता है, उपयोगी है, लेकिन एक प्रदाता अपना अधिकांश राजस्व उन मॉडलों से कमाता है जिन्हें ग्राहक वास्तव में माँगते हैं। लोकप्रिय मॉडलों और वर्तमान NVIDIA हार्डवेयर के छोटे मैट्रिक्स पर, पीक प्रदर्शन आर्किटेक्चरल व्यापकता से अधिक महत्वपूर्ण है।

2025 के मध्य से, अधिक इन्फ़रेंस टीमों ने पूरी तरह से स्वतंत्र इंजन बनाए रखना बंद कर दिया है और TRT-LLM पर द्वितीयक विकास की ओर बढ़ गई हैं। इसकी स्थायी कमज़ोरी उपयोगिता है। डेवलपर अनुभव कठिन है, लेकिन एक टीम जिसे GPU फ्लीट से अंतिम 20 प्रतिशत निकालने के लिए भुगतान किया जाता है, वह एक कठिन टूलचेन सहन कर लेगी। उपयोगिता टाई-ब्रेकर है; Blackwell पर TRT-LLM के पास टाई-ब्रेक करने के लिए कोई समकक्ष नहीं है।

उन टीमों ने इंजीनियरिंग बंद नहीं की है। वे अब भी मॉडल ट्यून करती हैं, रनटाइम व्यवहार को पैच करती हैं, और इंजन के चारों ओर प्रोडक्शन सिस्टम बनाती हैं। जो बदला वह परत है जहाँ से वे शुरुआत करती हैं। NVIDIA की बेसलाइन से शुरू करने से अधिक प्रयास उनके वर्कलोड पर केंद्रित होता है और सामान्य मशीनरी को दोबारा बनाने पर कम।

त्वरक: कोडिंग एजेंट

ओपन-सोर्स अभिसरण और NVIDIA का ऊर्ध्वाधर दबाव पहले से ही स्वामित्व लाभों का जीवन छोटा कर रहे थे। पिछले छह महीनों में, कोडिंग एजेंटों ने इन्फ़रेंस इंजीनियरिंग की लागत घटाकर इसे और छोटा कर दिया है।

कर्नेल कार्य, रनटाइम परिवर्तन और सर्विंग इंफ्रास्ट्रक्चर सभी AI सहायता से अधिक तेज़ी से पूरे किए जा सकते हैं। Intent Lab ने TRT-LLM पर एजेंट-सहायता प्राप्त कार्य करते हुए लगभग एक सप्ताह में ऐसे ऑप्टिमाइज़ेशन शिप किए जिनसे बहुत बड़े एंड-टू-एंड लाभ मिले। पहले, उस दायरे का कार्य एक समर्पित इंजीनियर को पूरी तिमाही में व्यस्त रख सकता था।

स्वामित्व इंजन कार्य का अर्थशास्त्र उस गति के साथ बदल जाता है। एक तकनीक जिसके लिए छह इंजीनियर-महीने लगते थे और जो नौ महीने की विशिष्टता खरीदती थी, निवेश को उचित ठहरा सकती थी। यदि इसे बनाने में दो सप्ताह लगते हैं और प्रतिस्पर्धी इसे तीन में दोहरा लेते हैं, तो परिणाम खाई (moat) नहीं है; यह एक ट्रेडमिल है। कार्य तकनीकी रूप से कठिन बना हुआ है, लेकिन लाभ का उपयोगी जीवन शून्य की ओर बढ़ रहा है।

आर्थिक रूप से जो मायने रखता है वह यह है कि बढ़त कितने समय तक रहती है। एक कठिन ऑप्टिमाइज़ेशन व्यावसायिक रूप से कमज़ोर हो सकता है यदि कंपनी इसे बनाने की लागत वसूलने से पहले ही यह फैल जाए। कोडिंग एजेंट इंजीनियरिंग को तुच्छ नहीं बनाते; वे विशिष्टता को तेज़ी से समाप्त कर देते हैं।

ओपन इंजनों के लिए क्या बचा है: समुदाय, उपयोगिता, और बहुत कम वफादारी

vLLM, SGLang और अन्य ओपन-सोर्स इंजन उस बाज़ार की सेवा करते हैं जिसे TRT-LLM के कठिन डेवलपर अनुभव ने खुला छोड़ दिया है। समर्पित इन्फ़रेंस टीमों वाले प्रदाताओं के बाहर कई उपयोगकर्ता शोधकर्ता हैं या ऑफ़लाइन जनरेशन चलाते हैं: विलंबता-संवेदनशील ऑनलाइन सर्विंग के बजाय थ्रूपुट-उन्मुख बैच वर्कलोड। उन सेटिंग्स में, TRT-LLM के साथ प्रदर्शन का अंतर मामूली, अक्सर नगण्य होता है।

वे उपयोगकर्ता एक अलग वर्कफ़्लो के लिए ऑप्टिमाइज़ करते हैं। उन्हें एक मॉडल को जल्दी से तैयार करना होता है, स्टैक को दोबारा लिखे बिना आर्किटेक्चर बदलना होता है, और कुछ टूटने पर उत्तर ढूँढना होता है। थ्रूपुट के कुछ प्रतिशत अंक शायद ही किसी रनटाइम से लड़ने में दिन बिताने को उचित ठहराते हैं, खासकर जब वर्कलोड का कोई इंटरैक्टिव विलंबता लक्ष्य न हो।

अपनाना इसके बजाय उपयोग में आसानी, दस्तावेज़ीकरण और समुदाय पर निर्भर करता है। पैकेज स्थापित करें, उसे Hugging Face रिपॉज़िटरी की ओर इंगित करें, और OpenAI-संगत एंडपॉइंट सामने लाएँ। एक शोधकर्ता या बैच-जनरेशन पाइपलाइन के लिए, यही पूरा खरीद निर्णय है।

अपनाना वफादारी नहीं है। OpenAI-संगत API पर मानकीकरण इंजन बदलने को, सबसे सरल मामले में, base_url में बदलाव तक सीमित कर देता है। एक टीम आज vLLM चला सकती है, कल SGLang आज़मा सकती है, और सप्ताह के अंत तक दोनों का बेंचमार्क कर सकती है। ओपन इंजनों को उन वर्कलोडों के लिए प्रतिस्पर्धा करते रहना होगा जिन्हें वे पहले ही जीत चुके हैं।

उपयोगकर्ता उस पोर्टेबिलिटी से लाभान्वित होते हैं; स्थायी नियंत्रण चाहने वाली परियोजनाएँ नहीं। समुदाय का आकार एक वर्कलोड को आकर्षित कर सकता है, और दस्तावेज़ीकरण उसे कुछ समय के लिए रोक सकता है, लेकिन कोई भी किसी टीम को प्रतिस्पर्धी द्वारा तेज़ संस्करण जारी करने पर तुलना दोबारा चलाने से नहीं रोकता।

वास्तविक स्विचिंग लागत ऑनलाइन प्रोडक्शन में दिखाई देती है। वे मॉनिटरिंग और अलर्टिंग, परिनियोजन पाइपलाइनों, आपदा पुनर्प्राप्ति, स्वचालित विफलता पुनर्प्राप्ति, संचित बग फिक्स और प्रोडक्शन एज केसों की लंबी पूंछ से आती हैं। अकेले टूल-कॉल पार्सिंग उनमें से बहुत कुछ प्रदान करती है। यह परिचालन परत लॉक-इन बनाती है, लेकिन यह क्षमता खाई के बजाय प्रवासन घर्षण है। एक सक्षम टीम इसे किसी अन्य इंजन के चारों ओर हफ्तों में दोबारा बना सकती है। अधिक महत्वपूर्ण बात, वह ज्ञान उपयोगकर्ता के SRE संगठन से संबंधित है, इसलिए इंजन परियोजना इसका कुछ भी हासिल नहीं करती।

व्यावसायिक रूप से, परिचालन ज्ञान एक परिनियोजन को स्थिर बनाता है, बिना इंजन विक्रेता को मूल्य निर्धारण शक्ति दिए। उपयोगकर्ता प्रवासन लागत वहन करता है और अधिकांश आसपास की प्रणालियों का स्वामी होता है। यहाँ तक कि जहाँ प्रतिस्थापन कष्टप्रद है, इंजन ने स्वयं खाता सुरक्षित नहीं किया है।

ओपन सोर्स एक सार्वजनिक वस्तु के रूप में

प्रमुख ओपन-सोर्स इंजनों ने बड़े पैमाने पर इस भूमिका को स्वीकार कर लिया है। vLLM और SGLang अपना लगभग सारा कार्य समुदाय को लौटा देते हैं। उनका रणनीतिक लक्ष्य अपनाना है; परिणाम सुविधाओं, प्रदर्शन और स्थिरता में एक लगातार बेहतर मुफ्त बेसलाइन है। व्यवहार में, पारिस्थितिकी तंत्र सभी के लिए अत्याधुनिक इन्फ़रेंस को सब्सिडी दे रहा है।

परियोजनाओं के लिए स्वयं एक लागत है। बेसलाइन में प्रत्येक सुधार विभेदीकरण की गुंजाइश को सिकोड़ता है, जिसमें इन-हाउस इंजन और वे ओपन इंजन शामिल हैं जिन्होंने वह सुधार किया। मंज़िल ऊपर उठाकर, ये परियोजनाएँ अपनी स्वयं की परत का मूल्य भी संपीड़ित करती हैं।

संकेत: इंजन कंपनियाँ स्टैक में ऊपर बढ़ रही हैं

इंजन लेखकों का व्यवहार सबसे स्पष्ट प्रमाण है कि अकेला इंजन अधिक मूल्य नहीं हासिल कर सकता।

दो प्रमुख ओपन-सोर्स इंजनों के पीछे की कंपनियों ने प्रोडक्शन सर्विंग कार्य लेना शुरू कर दिया है, और प्रमुख मॉडल लैब्स और उपभोक्ता प्लेटफ़ॉर्म के साथ इन्फ़रेंस अनुबंधों पर हस्ताक्षर करने की सूचना है। उनका कहा हुआ कारण समझ में आता है: प्रोडक्शन चलाना उन विफलताओं को उजागर करने का सबसे तेज़ तरीका है जिन्हें एक इंजन को संभालना चाहिए। बड़े पैमाने पर डॉगफ़ूडिंग एज केसों को खोज लेती है।

यह उन कंपनियों को उन प्रदाताओं के साथ प्रतिस्पर्धा में भी लाता है जो कभी उनके सबसे महत्वपूर्ण उपयोगकर्ता और समर्थक थे। परियोजना अपनाने को बढ़ाती है, जबकि सर्विंग अनुबंध राजस्व उत्पन्न करते हैं। उन भूमिकाओं में सामंजस्य बिठाना कठिन है जब परियोजना के उपयोगकर्ता वही सेवा बेचते हैं।

इंजन कंपनियाँ समझने योग्य रूप से प्रदाता लेबल के बारे में सतर्क हैं। उनका पारिस्थितिकी तंत्र उन कंपनियों पर निर्भर करता है जो एक तटस्थ अपस्ट्रीम परियोजना चाहती हैं, न कि एक सब्सिडी वाला प्रतिस्पर्धी। फिर भी एक बार इंजन कंपनी ग्राहकों के लिए प्रोडक्शन संचालित करती है, तो ओवरलैप वास्तविक है चाहे कार्य का वर्णन कैसे भी किया जाए।

सर्विंग की ओर बढ़ना साथ वाले स्पष्टीकरण से अधिक कहता है। इंजन लेखक उम्मीद नहीं करते कि इंजन परत अकेले एक व्यवसाय को सहारा देगी। सवाल यह है कि क्या सर्विंग अधिक सुरक्षित है।

भाग II: वर्तमान — प्रदाताओं को वास्तव में क्या अलग बनाता है

स्थापित प्रदाताओं के वास्तविक लाभों का कर्नेल से कोई संबंध नहीं है

Together AI, Fireworks और Baseten जैसे अग्रणी इन्फ़रेंस प्रदाताओं के स्थायी लाभ किसी इंजन बेंचमार्क पर दिखाई नहीं देते।

प्रथम-प्रवेशक लाभ और ब्रांड। जब किसी मॉडल लैब को लॉन्च पार्टनर की आवश्यकता होती है या किसी AI-मूल स्टार्टअप को प्रोडक्शन इन्फ़रेंस की आवश्यकता होती है, तो ये कंपनियाँ पहली शॉर्टलिस्ट में आती हैं। माइंडशेयर नरम लगता है जब तक यह अनुबंध के बाद अनुबंध का फैसला नहीं कर देता। तेज़ बाज़ार में डिफ़ॉल्ट विचार एक संकीर्ण बेंचमार्क बढ़त से अधिक मूल्यवान है।

प्लेटफ़ॉर्म। वर्षों का कार्य परिनियोजन टूलिंग, ऑब्ज़र्वबिलिटी, एंटरप्राइज़ नियंत्रण और अनुपालन में जमा हुआ है। एक नए प्रवेशक को उस सतह को एक-एक करके दोबारा बनाना होगा जबकि स्थापित प्रदाता उसे बढ़ाते रहते हैं।

इनमें से कोई भी सुविधा सार्वजनिक गति चार्ट नहीं जीतती, लेकिन साथ में वे यह तय करती हैं कि कोई ग्राहक किसी वर्कलोड को प्रोडक्शन में ले जा सकता है या नहीं। वे संयोजित भी होती हैं। प्रत्येक परिनियोजन एक और लापता नियंत्रण या विफलता मोड को उजागर करता है, और सुधार अगले ग्राहक को दिए जाने वाले प्लेटफ़ॉर्म का हिस्सा बन जाता है।

GPU क्षमता और उसकी आपूर्ति श्रृंखला। यह सबसे कठिन लाभ है और सबसे कम चर्चित है। प्रदाताओं को हार्डवेयर पीढ़ियों के बीच आवंटन सुरक्षित करने, क्लाउड और नियोक्लाउड के साथ बातचीत करने, विषम फ्लीट प्रबंधित करने और असमान माँग के विरुद्ध क्षमता की योजना बनाने की आवश्यकता होती है। स्थापित प्रदाताओं ने लोड के तहत ऐसा करना सीखा है। जब कोई बड़ा अनुबंध आता है, तो निर्णायक प्रश्न अक्सर यह नहीं होता कि किसका इंजन तेज़ है, बल्कि यह होता है कि कौन अगले महीने हजारों GPU ऑनलाइन ला सकता है।

देर से आने वाले प्रवेशक उन अर्थशास्त्रों का जवाब दे रहे हैं। Modal ने एक इन्फ़रेंस सेवा लॉन्च की है। Nebius ने अपने क्लाउड में सर्विंग जोड़ने के लिए Eigen AI का अधिग्रहण किया। इन्फ़रेंस कच्चे GPU-घंटों से बेहतर मार्जिन रखता है, इसलिए GPU क्लाउड ऊपर बढ़ रहे हैं जबकि इंजन कंपनियाँ नीचे से सर्विंग में प्रवेश कर रही हैं। प्रदाता, क्लाउड और इंजन कंपनियाँ एक ही परत पर अभिसरण कर रही हैं क्योंकि वहीं मूल्य वर्तमान में एकत्र होता है।

प्रत्येक समूह एक अलग लाभ के साथ शुरू होता है। इंजन कंपनियाँ सॉफ़्टवेयर विशेषज्ञता लाती हैं, GPU क्लाउड क्षमता लाते हैं, और स्थापित प्रदाता ग्राहक और परिचालन अनुभव लाते हैं। एक ही उत्पाद की ओर उनका आंदोलन शेष अंतरों को देखना आसान बनाता है: वितरण, पूंजी, और बड़े पैमाने पर विश्वसनीय सेवा चलाने की क्षमता।

छोटे-बैच TPS रैंकिंग क्यों फीकी पड़ेगी

Artificial Analysis पर छोटे-समवर्ती आउटपुट-गति रैंकिंग अब भी ध्यान आकर्षित करती है, और वर्षों तक यह इंजीनियरिंग गुणवत्ता का एक उचित प्रॉक्सी थी। यह प्रत्येक हार्डवेयर चक्र के साथ कम कहती है। मानक API परीक्षण या तो एक अनुरोध या दस समानांतर अनुरोधों का उपयोग करते हैं। उस लोड पर, एक प्रदाता नए हार्डवेयर को DSpark जैसी लोड-अवेयर स्पेक्युलेटिव डिकोडिंग के साथ जोड़ सकता है, प्रत्येक अनुरोध पर अधिक बैच क्षमता खर्च कर सकता है जबकि मशीन अन्यथा निष्क्रिय हो, और असाधारण प्रति-उपयोगकर्ता TPS पोस्ट कर सकता है। संख्या वास्तविक है लेकिन संकीर्ण है: यह दिखाती है कि एक हल्का-लोडेड एंडपॉइंट एक उपयोगकर्ता के टोकन कितनी तेज़ी से उत्सर्जित कर सकता है, न कि एक फ्लीट किसी व्यवसाय की कितनी कुशलता से सेवा करता है।

प्रोडक्शन का एक अलग उद्देश्य है। पहले, प्रति-उपयोगकर्ता TPS को एप्लिकेशन की आवश्यकता से ऊपर रखें। फिर उस मंज़िल से नीचे गिरे बिना प्रति GPU प्रति मिनट कुल टोकन (TPM/GPU) को अधिकतम करें। एक बार उपयोगकर्ता अनुभव पर्याप्त तेज़ हो जाने पर, हल्के-लोडेड TPS में एक और वृद्धि उसी GPU पर अधिक समवर्ती उपयोगकर्ताओं की सेवा करने से कहीं कम मूल्य की हो सकती है। प्रति वितरित टोकन लागत शीर्षक रैंक से अधिक मायने रखती है।

स्पेक्युलेटिव डिकोडिंग अंतर को और स्पष्ट करती है। सत्यापन कार्य जो कम बैच पर सस्ता होता है, समवर्तीता के तहत मूल्यवान बैच क्षमता को खपत कर सकता है, इसलिए उच्चतम हल्के-लोडेड TPS के लिए ट्यून किया गया कॉन्फ़िगरेशन आवश्यक रूप से सर्वोत्तम प्रोडक्शन लागत वक्र पर नहीं बैठता। उपयोगी परिणाम एक पेरेटो फ्रंटियर है: एक अक्ष पर प्रति-उपयोगकर्ता TPS और दूसरे पर TPM/GPU, जिसमें एप्लिकेशन की गति मंज़िल ऑपरेटिंग बिंदु का चयन करती है और प्रति टोकन लागत उसका अनुसरण करती है।

छोटे-बैच TPS बेकार नहीं है। यह एक इंटरैक्टिविटी मंज़िल स्थापित करता है और उन एंडपॉइंटों को उजागर करता है जो स्पष्ट रूप से बहुत धीमे हैं। Artificial Analysis का अपना रैंप्ड-समवर्ती परीक्षण अधिक उपयोगी दिशा की ओर इशारा करता है — यह मापता है कि समग्र रूप से सिस्टम क्या बनाए रख सकता है। जो फीका पड़ेगा वह छोटे-बैच रैंकिंग का विजेता-सब-कुछ वाला पाठ है। प्रोडक्शन खरीदार इस बात की कम परवाह करेंगे कि कौन उच्चतम TPS पोस्ट करता है और अधिक परवाह करेंगे कि प्रति-उपयोगकर्ता TPS आवश्यक मंज़िल से ऊपर रहते हुए प्रत्येक GPU कितना भुगतान किया गया ट्रैफ़िक वहन करता है। यह निबंध के पैटर्न का लघु रूप है: सबसे दृश्यमान संख्या यह अनुमान लगाना बंद कर देती है कि पैसा कहाँ जाता है।

दिन-0 समर्थन: संबंध खाई और कसती है

2026 में एक बदलाव ने स्थापित प्रदाताओं को और मज़बूत किया है: मॉडल डेवलपर तेजी से सीधे इन्फ़रेंस प्रदाताओं के साथ साझेदारी कर रहे हैं।

दिन-0 समर्थन कभी ओपन-सोर्स इंजनों के माध्यम से चलता था। लॉन्च से पहले, एक लैब vLLM या SGLang के साथ समन्वय करती थी; इंजन समर्थन मर्ज करता था; डाउनस्ट्रीम प्रदाता उसे उठा लेते थे। इसने ओपन इंजनों को वितरण श्रृंखला में एक केंद्रीय स्थान दिया।

पुरानी निर्भरता फीकी पड़ रही है। प्रमुख लैब्स अब रिलीज़ से पहले इन्फ़रेंस प्रदाताओं को प्रारंभिक पहुँच प्रदान करती हैं, कभी-कभी ओपन-सोर्स इंजन टीमों से भी पहले। एक लैब को लॉन्च दिवस पर केवल एक मर्ज किया हुआ पुल अनुरोध से अधिक चाहिए। उसे SLA के साथ ट्यून और लोड-परीक्षणित प्रोडक्शन क्षमता चाहिए। एक प्रदाता पूरा पैकेज दे सकता है; एक इंजन केवल उसका पहला घटक प्रदान करता है।

प्रारंभिक पहुँच एक प्रकाशित तकनीक के बजाय एक संबंध है, इसलिए प्रतिस्पर्धी इसे किसी पेपर या कर्नेल से दोहरा नहीं सकते। लैब्स इसे उन भागीदारों को देती हैं जिन पर वे पहले से भरोसा करते हैं, जिससे उन प्रदाताओं को बल मिलता है जिनके पास पहले से ब्रांड और क्षमता है। इस बीच, ओपन-सोर्स इंजन रिलीज़ पाइपलाइन के मोर्चे पर अपना स्थान खो रहे हैं। प्रदाता तेजी से दिन-0 कार्य का नेतृत्व करते हैं और इंजन अनुसरण करते हैं।

एक सफल लॉन्च एक प्रदाता के अगले लॉन्च के लिए प्रारंभिक पहुँच प्राप्त करने की संभावना बढ़ाता है, और प्रारंभिक पहुँच उसकी संभावना फिर से सुधार देती है। एक ऑप्टिमाइज़ेशन के विपरीत, संबंध प्रकाशन के बाद शेष बाज़ार के लिए उपलब्ध नहीं होता।

सर्विंग परत पर अंतिम खेल: एक पूंजी खेल

एक बार प्रतिस्पर्धी सर्विंग परत तक पहुँच जाते हैं, तो वे एक सामान्य मानदंड का सामना करते हैं। एक विश्वसनीय प्रदाता को दबाव में अपना SLA बनाए रखना चाहिए, शीर्ष-स्तरीय विलंबता देनी चाहिए और सटीकता बनाए रखनी चाहिए। ये कठिन परिचालन आवश्यकताएँ हैं, और ये प्रदाताओं को GPU पुनर्विक्रेताओं से अलग करती हैं। वे प्रवेश की लागत भी हैं: उन्हें पूरा करना प्रवेश देता है, जबकि उन्हें चूकना एक प्रदाता को समाप्त कर देता है।

साझा इंजन और सार्वजनिक तकनीकें गंभीर प्रदाताओं को तुलनीय प्रदर्शन, विश्वसनीयता और मूल्य निर्धारण की ओर खींचती हैं। उस रेखा के ऊपर, GPU क्षमता निर्णायक चर बन जाती है। दूसरे शब्दों में, प्रतियोगिता पूंजी की प्रतियोगिता में बदल जाती है।

फ्लाईव्हील सीधा है। पूंजी GPU क्षमता सुरक्षित करती है। क्षमता बड़े मॉडल-लैब और एंटरप्राइज़ अनुबंधों को सक्षम बनाती है जिन्हें सीमित प्रतिस्पर्धियों को अस्वीकार करना पड़ता है। वे अनुबंध इन्फ़रेंस वॉल्यूम और ARR उत्पन्न करते हैं। उच्च ARR एक बड़े वित्तपोषण दौर और मूल्यांकन का समर्थन करता है, जो क्षमता के अगले ब्लॉक के लिए भुगतान करता है।

एक तैयार फ्लीट बिक्री की बातचीत को भी बदल देता है। एक प्रमुख लॉन्च के लिए प्रदाता चुनने वाला ग्राहक उस क्षमता पर भरोसा नहीं कर सकता जो बाद में उपलब्ध हो सकती है। उसे आरक्षित, नेटवर्क-युक्त और तैयार मशीनें चाहिए। जो प्रदाता उन संसाधनों को प्रतिबद्ध कर सकता है, उसे विलंबता और टोकन मूल्य वार्ता में प्रवेश करने से पहले ही लाभ होता है।

इंजीनियरों के लिए, यह एक असुविधाजनक परिणाम है। सर्विंग का अंतिम खेल एक सॉफ़्टवेयर प्रतियोगिता से कम और पूंजी-गहन इंफ्रास्ट्रक्चर से अधिक दिखता है — शुरुआती क्लाउड कंप्यूटिंग, एयरलाइनों या दूरसंचार के करीब। परिचालन उत्कृष्टता उत्तरजीविता निर्धारित करती है; पूंजी तक पहुँच पैमाना निर्धारित करती है।

संचालन अब भी व्यवहार्य कंपनियों को विफल कंपनियों से अलग करता है। खराब उपयोग, कमज़ोर विश्वसनीयता, या खराब क्षमता योजना एक अच्छी तरह से वित्तपोषित प्रदाता को नष्ट कर सकती है। हालाँकि, एक बार हर गंभीर प्रतिस्पर्धी तकनीकी मानदंड को पूरा कर लेता है, तो एक और कर्नेल सुधार अगले बड़े अनुबंध को स्वीकार करने के लिए आवश्यक बैलेंस शीट का विकल्प नहीं बन सकता।

बाज़ार पहले ही इस दिशा में बढ़ चुका है। अग्रणी प्रदाताओं ने बड़े वित्तपोषण दौर जुटाए हैं और पिछले वर्ष में उनके मूल्यांकन कई गुना बढ़े हैं। निवेशक क्षमता पर कब्ज़ा करने की होड़ में स्थिति के लिए भुगतान कर रहे हैं, न कि कर्नेल इंजीनियरिंग के लिए।

भाग III: भविष्य — मूल्य कंक्रीट में डूब जाता है

भविष्यवाणी: वे सभी डेटा सेंटर खरीदेंगे

पूंजी का तर्क स्वामित्व की ओर इशारा करता है। पर्याप्त पैमाने पर, एक कंपनी जिसकी वस्तुओं की लागत GPU और बिजली से प्रभावित होती है, जब भी वह कंप्यूट या डेटा-सेंटर स्थान किराए पर लेती है, मार्जिन खो देती है। प्रत्येक किराए की परत सकल मार्जिन का एक हिस्सा दूसरी बैलेंस शीट में स्थानांतरित कर देती है।

इसलिए अग्रणी इन्फ़रेंस प्रदाता GPU आवंटन या दीर्घकालिक क्लाउड प्रतिबद्धताओं पर रुकने के बजाय डेटा सेंटर खरीदेंगे या अधिग्रहित करेंगे — जिसमें उनके नीचे की सुविधाएँ और बिजली अनुबंध शामिल हैं। उन्होंने जो युद्धकोष जुटाए हैं, वे किसी अन्य अंतिम खेल के तहत समझ में नहीं आते।

इन्फ़रेंस प्रदाता एक सॉफ़्टवेयर कंपनी के रूप में शुरू हुआ जिसका इंजन उत्पाद था। यह एक प्रबंधित-सेवा कंपनी बन गया जो एक प्लेटफ़ॉर्म और SLA बेचती है। यह अब एक इंफ्रास्ट्रक्चर कंपनी बन रहा है जो क्षमता बेचती है। उस प्रगति में, मूल्य कर्नेल से सर्विंग संचालन और फिर स्टील, भूमि और बिजली-खरीद समझौतों की ओर स्थानांतरित हुआ है।

प्रत्येक कदम कंपनी के कौशल और अर्थशास्त्र को बदल देता है। सॉफ़्टवेयर पुनरावृत्ति फ्लीट प्रबंधन, क्रय, वित्तपोषण और ऊर्जा रणनीति को रास्ता देती है। इंटरफ़ेस एक API बना रह सकता है, लेकिन उसके नीचे का व्यवसाय भारी और उपयोग के प्रति अधिक संवेदनशील हो जाता है।

कहानी एक सॉफ़्टवेयर खाई के नुकसान के साथ शुरू हुई। यह उन्हीं कंपनियों के साथ समाप्त होती है जो दुनिया की सबसे पुरानी खाइयों के लिए प्रतिस्पर्धा कर रही हैं: भूमि, ऊर्जा और पूंजी। खाई वास्तव में कभी सॉफ़्टवेयर में थी ही नहीं।

फिर भी "इन्फ़रेंस प्रदाता," कभी "नियोक्लाउड" नहीं

डेटा सेंटर खरीदने के बाद भी, ये कंपनियाँ खुद को नियोक्लाउड के बजाय इन्फ़रेंस प्रदाता के रूप में वर्णित करती रहेंगी। पूंजी बाज़ार एक AI इंफ्रास्ट्रक्चर कंपनी को अधिक गुणक प्रदान करते हैं जो टोकन बेचती है, उस नियोक्लाउड की तुलना में जो GPU-घंटे किराए पर देता है।

लेबल के तहत, वे एक नए प्रकार के नियोक्लाउड जैसे दिखेंगे: एक अलग इंटरफ़ेस के साथ वही संपत्ति-भारी नींव, नंगे GPU के बजाय टोकन, SLA और API बेचना। दुनिया के CoreWeaves ने पहले संपत्ति आधार बनाया और सर्विंग की ओर बढ़ रहे हैं। दुनिया के Fireworks ने पहले इंटरफ़ेस बनाया और संपत्ति आधार की ओर बढ़ रहे हैं। दोनों मार्ग एक ही कॉर्पोरेट आकार की ओर ले जाते हैं; प्रारंभिक बिंदु लेबल और उससे जुड़ा गुणक निर्धारित करता है।

API के माध्यम से बेचना पैकेजिंग को बदल देता है। टोकन सॉफ़्टवेयर, संचालन और क्षमता को एक उत्पाद में बाँधते हैं जिसे ग्राहक सीधे उपभोग कर सकता है। GPU-घंटे अंतर्निहित वस्तु को अधिक उजागर करते हैं। दो कंपनियाँ समान संपत्ति रख सकती हैं फिर भी बहुत अलग मूल्यांकन प्राप्त कर सकती हैं क्योंकि एक ने उन संपत्तियों को स्टैक में उच्चतर पैकेज किया है।

वे डेटा सेंटरों के मालिक होंगे और फिर भी खुद को इन्फ़रेंस प्रदाता कहेंगे क्योंकि लेबल इमारत से अधिक मूल्यवान है।

असली प्रतिस्पर्धी नीचे से आ रहा है

यदि गंतव्य एक पूंजी-गहन, डेटा-सेंटर-स्वामित्व वाला टोकन व्यवसाय है, तो वर्तमान खिलाड़ियों को उससे उनकी दूरी के आधार पर रैंक करना प्रतिस्पर्धी तस्वीर को बदल देता है।

Together AI, Fireworks और Baseten के पास ब्रांड, प्लेटफ़ॉर्म और अनुबंध हैं। उन्हें अब भी सुविधाओं, बिजली और नियोक्लाउड-पैमाने की आपूर्ति श्रृंखला का संपत्ति आधार बनाना या खरीदना है — यह सब बहु-वर्षीय निर्माण और बिजली लीड समय से बाधित है।

Nebius पहले से ही डेटा सेंटरों का मालिक है और अपनी स्वयं की GPU आपूर्ति श्रृंखला संचालित करता है। एक सार्वजनिक कंपनी के रूप में, उसके पास एक वित्तपोषण चैनल भी है जिसे निजी प्रदाता केवल बार-बार बड़े दौरों के माध्यम से अनुमानित कर सकते हैं। उसका लापता टुकड़ा सर्विंग परत थी। Eigen AI के अधिग्रहण ने सॉफ़्टवेयर और एक टीम लाई, और एक केंद्रित वर्ष अधिकांश सॉफ़्टवेयर अंतर को बंद कर देता है क्योंकि इन्फ़रेंस में कोई रहस्य नहीं है।

इसके विपरीत, एक सॉफ़्टवेयर-प्रथम प्रदाता भौतिक समय-सारणी को उसी तरह संपीड़ित नहीं कर सकता। बिजली इंटरकनेक्ट, निर्माण और उपकरण वितरण बहु-वर्षीय कार्यक्रमों का पालन करते हैं। पूंजी उन कतारों में एक स्थान सुरक्षित कर सकती है, लेकिन यह उन्हें सॉफ़्टवेयर रिलीज़ चक्र में नहीं बदल सकती।

सॉफ़्टवेयर को किसी एसेट बेस में जोड़ा जा सकता है, और यह उससे कहीं ज़्यादा तेज़ होता है जितनी तेज़ी से किसी एसेट बेस को किसी सॉफ़्टवेयर कंपनी में जोड़ा जा सकता है। इंजन कमोडिटाइज़ेशन ने प्रोवाइडर्स को बढ़ने में मदद की, लेकिन इसने उनके सबसे खतरनाक प्रतिद्वंद्वी को भी ताकत दी है।

Together AI, Fireworks और Baseten के सामने सबसे बड़ा प्रतिद्वंद्वी कोई दूसरा प्रोवाइडर नहीं है। वह है Nebius, और उसके बाद कोई भी नियोक्लाउड जो स्टैक में ऊपर की ओर बढ़ने को तैयार हो।

इंजीनियरिंग के घंटे अब कहाँ जाते हैं

प्रोवाइडर्स के अंदर इंफ़रेंस इंजीनियरिंग अब भी मायने रखेगी, लेकिन उसका आवंटन बदल जाएगा। ओपन-सोर्स इंजन इस पुनः आवंटन को संभव बनाते हैं।

जैसे-जैसे मुफ़्त इंजन का आधार स्तर बेहतर होता जाता है, प्रोवाइडर्स महंगे इंजीनियरिंग समय को कर्नेल और रनटाइम से बाहर निकाल सकते हैं। ये घंटे अब इंफ्रास्ट्रक्चर रिलायबिलिटी में जाते हैं, जो SLA को ठोस आधार देती है; प्लेटफ़ॉर्म अनुभव में, जो रिन्यूअल को सहारा देता है; और तेज़ी से बढ़ते हुए RL में। रिइन्फ़ोर्समेंट-लर्निंग रोलआउट इंफ़रेंस-इंटेंसिव होते हैं, इसलिए सर्विंग की विशेषज्ञता सीधे RL इंफ्रास्ट्रक्चर में स्थानांतरित हो जाती है—जो बढ़ते पोस्ट-ट्रेनिंग मार्केट के लिए काम आती है।

प्रोवाइडर्स तकनीकी काम से पीछे नहीं हट रहे हैं। हेटेरोजीनियस फ्लीट में रिलायबिलिटी, लोड के दौरान तेज़ रिकवरी, और कुशल RL रोलआउट—ये सिस्टम की कठिन समस्याएँ हैं। इनके समाधान प्रोवाइडर के ग्राहकों और संचालन के ज़्यादा करीब रहते हैं, जिससे वे डिफ़रेंशिएशन के स्रोत के रूप में ज़्यादा उपयोगी साबित होते हैं।

इंजन लेयर का मूल्य गायब नहीं हुआ है। ओपन सोर्स ने उसे एक मुफ़्त नींव में समेट दिया है, जिससे इंजीनियरिंग का मूल्य उसके ऊपर बने सिस्टम्स में स्थानांतरित हो सका है। ज़्यादातर कंपनियों के लिए रणनीतिक सवाल अब यह नहीं रहा कि इंजन बनाना है या नहीं। सवाल यह है कि मुफ़्त इंजन से बचे समय को कहाँ खर्च किया जाए। ओपन-सोर्स के सार्वजनिक योगदान से लाभ उठाने वाली कंपनियाँ दूसरी कंपनियों के रोडमैप में दिखती हैं।

कहानी अभी खत्म नहीं हुई है

अंतिम परिणाम अभी अनिश्चित है। Vera Rubin, MI455, LPU और अन्य इंफ़रेंस-फर्स्ट हार्डवेयर चेकलिस्ट को रीसेट कर देंगे, जैसा हर पिछला हार्डवेयर ट्रांज़िशन कर चुका है। हर रीसेट नए न्यूमेरिक फ़ॉर्मेट, मेमोरी पद

एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें