**

चीनी AI के तीन रथ
लंबे समय से, चीनी AI मॉडलों ने मोटे तौर पर तीन रास्तों का अनुसरण किया है।
पहला रास्ता जानबूझकर छोटा जाना है। इसके उदाहरणों में minimax-m3, Kimi K2.5 और hy3 शामिल हैं, जो सक्रिय पैरामीटरों को लगभग 20B तक सीमित रखते हैं। 20B वास्तव में "छोटा" है या नहीं, यह एक सूक्ष्म प्रश्न है, लेकिन इंजीनियरिंग की दृष्टि से हम आमतौर पर इसे ऐसा ही मानते हैं।
छोटे सक्रिय पैरामीटर आमतौर पर एक कठोर आर्थिक बाध्यता होते हैं। इन बाध्यताओं के भीतर अधिकतम प्रदर्शन प्राप्त करना एक विशिष्ट "छोटे मॉडल" मानसिकता है।
दूसरा रास्ता DeepSeek है, और वे निर्माता जो इसके बाद समान तकनीकी स्टैक और आकार के साथ उभरे। DeepSeek मार्ग की पहचान केवल पूरी तरह से ओपन-सोर्स होना नहीं है, बल्कि इससे भी महत्वपूर्ण बात यह है कि DeepSeek-V3/R1 शुरू से ही बड़े पैमाने के मॉडल थे, जो OpenAI के शीर्ष-स्तरीय मॉडलों के खिलाफ बेंचमार्क करते थे।
जैसे ही R1 की लोकप्रियता बढ़ी, DeepSeek ने आर्थिक दक्षता पर केंद्रित एक विशाल तकनीकी स्टैक जोड़ा। इस प्रकार, DeepSeek मार्ग की विशेषता है "उच्च प्रदर्शन के साथ-साथ अनुमान की अर्थव्यवस्था सुनिश्चित करना।" GLM-5 इस पथ का एक व्यवस्थित उत्तराधिकारी और व्यवसायी है, और GLM-5.2 इसके प्रसिद्ध परिणामों में से एक है।
तीसरा रास्ता Kimi है। Kimi का तकनीकी स्टैक हमेशा से स्वतंत्र रहा है और DeepSeek से दूर का रिश्ता रखता है। जबकि K2.5 से K2.7 श्रृंखला ने DeepSeek के तकनीकी स्टैक को काफी हद तक आत्मसात किया, नई K3 श्रृंखला अपनी मालिकाना तकनीक पर लौट आई है।
K3 ने कुल पैरामीटरों को 2.8T तक धकेल दिया है, जिसमें सक्रिय पैरामीटर अनुमानित 50B हैं, और यह पूरी तरह से मालिकाना तकनीक का उपयोग करता है। आकार का स्केलिंग लॉ लागू हुआ है, लेकिन इसने Kimi K3 की आर्थिक दक्षता को भी काफी कम कर दिया है, जिससे यह Claude Sonnet की मूल्य सीमा में प्रवेश कर गया है।
हालांकि Claude की तुलना में अभी भी बहुत सस्ता है, Kimi के अनुमान क्लस्टर चीन के भीतर स्थित हैं। GPU संख्याओं पर सीमाओं को देखते हुए, Kimi ने संभवतः K3 के निर्माण में अर्थव्यवस्था को प्राथमिकता नहीं दी।
दूसरे शब्दों में, K3 एक स्वतंत्र तकनीकी स्टैक, विशाल आकार और उच्च प्रदर्शन की पूरी कोशिश का उत्पाद है।
DeepSeek पथ पर प्रदर्शन और अर्थव्यवस्था को संतुलित करने वाले मॉडलों के विपरीत, K3 का लक्ष्य शुरू से ही एक बेहतर R1 बनाना नहीं था, बल्कि OpenAI और Anthropic के अत्याधुनिक, अति-बड़े मॉडलों के खिलाफ बेंचमार्क करना था।
K3 इतना बड़ा क्यों है?
Kimi को DeepSeek से कभी संबंधित नहीं एक स्वतंत्र तकनीकी मार्ग के रूप में वर्णित करना पूरी तरह से सटीक नहीं है।
Kimi K2 पेपर ने इसे स्पष्ट कर दिया: K2 ने DeepSeek-V3 के समान एक अल्ट्रा-स्पार्स MoE और MLA आर्किटेक्चर का उपयोग किया। दोनों में 61 परतें और साझा विशेषज्ञ हैं, प्रत्येक टोकन 8 रूटेड विशेषज्ञों को सक्रिय करता है। K2 ने इस आधार पर विशेषज्ञों की संख्या बढ़ाकर 384 कर दी, ध्यान हेड्स को आधा कर दिया, और स्व-विकसित MuonClip, डेटा रेसिपी, एजेंटिक पोस्ट-ट्रेनिंग और स्वतंत्र बुनियादी ढांचे का उपयोग करके अपना स्वयं का फोर्क बनाया।
इसलिए, K2, DeepSeek-V3 शैली के चेसिस पर एक Kimi शाखा की तरह था, न कि शुरू से एक अलग प्रजाति।
वास्तव में उल्लेखनीय यह है कि K2.5 से K2.7 तक का आधार आकार विस्तारित नहीं हुआ: कुल पैरामीटर लगभग 1T, सक्रिय पैरामीटर लगभग 32B, अभी भी 384 में से 8 विशेषज्ञ चुनता है।
दूसरे शब्दों में, Kimi ने साबित किया कि वह आधार का विस्तार किए बिना पोस्ट-ट्रेनिंग और एजेंट सिस्टम का उपयोग करके एक ही चेसिस से कई पीढ़ियों को निचोड़ सकता है।
लेकिन K3 अलग है। K3 केवल एक नियमित संस्करण उन्नयन नहीं है। यह Kimi के "मौजूदा आधार पर पोस्ट-ट्रेनिंग जारी रखने" के चरण को समाप्त करने और प्री-ट्रेनिंग पैमाने के विस्तार पर लौटने के सक्रिय निर्णय को चिह्नित करता है।

K3 पहले से बिखरी हुई मालिकाना तकनीकों का भारी उपयोग करता है, जैसे कि इसका अपना प्रशिक्षण आधार, ध्यान तंत्र और विशेषज्ञ रूटिंग संरचना। इस स्तर पर, K3 का DeepSeek से संबंध काफी दूर हो गया है।
K3 का उद्देश्य दो बातें साबित करना है: पहला, Kimi अपना स्वयं का तकनीकी प्रतिमान परिभाषित कर सकता है; दूसरा, Kimi OpenAI और Anthropic के खिलाफ बेंचमार्क करने वाले बिल्कुल नए, अति-बड़े मॉडलों को प्रशिक्षित करने के लिए नई तकनीक का उपयोग करने योग्य है।
जैसा कि पता चला, K3 सफल रहा।
सार्वजनिक उपयोगिता से विशेषाधिकार प्राप्त एकाधिकार तक
DeepSeek से पहले, चीन के पास उपयोग योग्य मॉडलों की कमी नहीं थी, लेकिन वे मुश्किल से काम करते थे।
DeepSeek के उद्भव ने पहली बार चीन में एक उच्च-प्रदर्शन मॉडल उपलब्ध कराया, जो चीनी AI की एक पीढ़ी के लिए एक सार्वजनिक उपयोगिता बन गया। एक सार्वजनिक उपयोगिता का मुख्य मिशन अपनाना है: कैसे "अच्छी" क्षमताओं को बड़े पैमाने पर बढ़ावा दिया जाए—विशेष रूप से एक ऐसे अनुमान आधार पर जो बिल्कुल समृद्ध नहीं है?
इसलिए, DeepSeek की भूमिका केवल एक प्रदर्शन सफलता नहीं थी, बल्कि आर्थिक अनुकूलन की एक भारी जिम्मेदारी भी थी।
V3 से V4 तक, DeepSeek ने लगभग धर्मार्थ API मूल्य निर्धारण बनाए रखा है, जो अनुमान अनुकूलन की ओर उन्मुख एक परिपक्व तकनीकी स्टैक द्वारा समर्थित है।
इस चरण में, चीनी AI के सामने समस्या थी: पहले सार्वजनिक उपयोगिता की प्रदर्शन आवश्यकताओं को पूरा करें, फिर उस उपयोगिता की कंप्यूटिंग लागत को कम करें।
DeepSeek के अलावा अन्य चीनी निर्माताओं के लिए, कार्य अचानक दोहरा हो गया: पहला, प्रदर्शन को R1 के बराबर होना चाहिए, अन्यथा मॉडल की कोई प्रतिस्पर्धी स्थिति नहीं है; दूसरा, मूल्य, थ्रूपुट और तैनाती दक्षता DeepSeek के जितना संभव हो उतना करीब होनी चाहिए, अन्यथा अपनाना बस नहीं होगा।
GLM का चरणबद्ध स्टैक परिवर्तन इस औद्योगिक दबाव का सबसे स्पष्ट सूक्ष्म जगत है।
इस अर्थ में, DeepSeek ने चीनी मॉडलों को Adoption चरण में लाया। इस चरण का मुख्य प्रश्न है: कैसे अधिक लोगों को पर्याप्त मजबूत बुद्धिमत्ता का उपयोग करने दिया जाए, और कॉल वॉल्यूम में परिणामी विस्फोट को कैसे संभाला जाए।
लेकिन एक सीमांत प्रयोगशाला को अंततः एक और प्रश्न का उत्तर देना होगा: यदि आप हमेशा दूसरों का सस्ता संस्करण बनने का प्रयास करते हैं, तो उच्च-प्रदर्शन वाले मॉडल कहाँ से आएंगे?
सभी प्रमुख इंटरनेट कंपनियों ने एक विकल्प चुना: प्रतिबंधों को दरकिनार करने और अमेरिका से आयात करने के तरीके खोजें। उदाहरण के लिए, Alibaba की प्रसिद्ध सिंगापुर इकाई ने उपयोगकर्ताओं को सिंगापुर मशीनों पर रिमोट लॉगिन के माध्यम से Claude Code चलाने की अनुमति दी।
फिर उन्हें ब्लॉक कर दिया गया। अगर अंकल सैम ने जल्दी से 5.6-Sol का झटका नहीं दिया होता, तो Dario ने चीनी लोगों के सिर पर पैर रखते हुए कुछ और लेख प्रकाशित किए होते।
व्यापक इंजीनियरिंग अनुकूलन के माध्यम से, चीन ने धीरे-धीरे AI की सार्वजनिक उपयोगिता की नींव का एहसास किया है। लेकिन बड़े, उच्च-प्रदर्शन वाले सीमांत मॉडलों के बिना, यह हमेशा एक कदम पीछे रहेगा, एक दीर्घकालिक नुकसानदेह "विशेषाधिकार प्रतिस्पर्धा" में पड़ जाएगा।
ज़ियांग झुआंग का तलवार नृत्य: सतह से परे लक्ष्य
K3 का 2.8T इस समस्या के लिए Moonshot का उत्तर है।
K2.5 से K2.7 को अभी भी निरंतर प्री-ट्रेनिंग, RL, टूल वातावरण और एजेंट सिस्टम के माध्यम से 1T-A32B आधार पर लागत-प्रदर्शन में सुधार के रूप में समझा जा सकता है।
K3, हालांकि, कुल क्षमता को सीधे 2.8T तक धकेलता है, 64 से अधिक एक्सेलेरेशन कार्ड की तैनाती आवश्यकताओं को स्वीकार करता है और API कीमतों को K2.7 Code के $0.95/$4 से बढ़ाकर $3/$15 कर देता है। हालांकि यह कीमत केवल Sonnet के बराबर है, यह अभी भी बहुत महंगा है।
मुख्य बात 64 एक्सेलेरेशन कार्ड है। आप चीन के अनुमान क्लस्टरों में इतने सारे 64-कार्ड नोड कहाँ पाएंगे?
K3 अभी भी अर्थव्यवस्था बनाए रखने की उम्मीद कर सकता है, लेकिन K3 के लिए यह लगभग असंभव है। 2.8T का एक विशाल मॉडल अमेरिकी अनुमान कंपनियों के लिए भी एक बड़ी परीक्षा है। इसलिए, K3 का इरादा स्पष्ट रूप से व्यापक रूप से अपनाने के लिए नहीं है, बल्कि एक मॉडल मानक को ओपन-सोर्स करना है जिसे सबसे अत्याधुनिक युद्धक्षेत्रों में व्यापक रूप से अपनाया जा सके।
अमेरिकी मॉडलों को कुचलने का दावा करने वाले अधिकांश PR टुकड़ों की तुलना में, Kimi का आधिकारिक शब्दांकन अधिक मध्यम है: K3 समग्र रूप से अभी भी Fable 5 और GPT-5.6 Sol से पीछे है।
बेशक, दूसरे दृष्टिकोण से, यह बहुत आक्रामक है: यह OpenAI और Anthropic के शीर्ष-स्तरीय मॉडलों से केवल थोड़ा पीछे है।
एक बार जब यह इस ब्रैकेट में प्रवेश करता है, तो K3 पहले पिछले वर्ष के Anthropic के सबसे महत्वपूर्ण वाणिज्यिक आख्यान को अस्थिर करता है।
Anthropic की सतत गति कहानी
Anthropic की पद्धति हमेशा स्पष्ट रही है: हम एक अपूरणीय मॉडल बनाते हैं, और एक बार जब उपयोगकर्ता पाते हैं कि यह उन कार्यों को पूरा कर सकता है जो अन्य मॉडल नहीं कर सकते, तो वे उच्च प्रदर्शन के लिए प्रीमियम का भुगतान करने को तैयार होंगे।
Fable 5 इस पद्धति का सबसे चरम उत्पाद है। यह सबसे कठिन ज्ञान कार्य, कोडिंग और जटिल अतुल्यकालिक कार्यों को लक्षित करता है जो दिनों तक चल सकते हैं, API कीमतें $10 प्रति मिलियन इनपुट टोकन और $50 प्रति मिलियन आउटपुट टोकन तक पहुँचती हैं—जो Opus 4.8 की नियमित कीमत से दोगुनी है।
Anthropic अधिक महंगे टोकन नहीं बेच रहा है; यह एक नया कार्य अंतराल बेच रहा है: जिन परियोजनाओं को अतीत में स्थिर रूप से पूरा नहीं किया जा सकता था, अब उन्हें Fable द्वारा संभाला जा सकता है। इन परिदृश्यों में, Fable का अपूरणीय मूल्य है।
जब तक यह अपूरणीयता मौजूद है, मूल्य प्रीमियम पूरी तरह से उचित है। आखिरकार, उच्च-प्रदर्शन वाले मॉडल उच्च-ज्ञान श्रम को प्रतिस्थापित करते हैं, और बाद का वेतन मॉडल की तुलना में बहुत अधिक महंगा है।
Fable की रिलीज़ के बाद, बाजार ने संक्षेप में एक भ्रम बनाया कि OpenAI अब Anthropic से नहीं पकड़ सकता। SemiAnalysis के अति-आशावादी प्रक्षेपण ने भी अनुमान लगाया कि Anthropic का ARR 2027 के अंत तक $300 बिलियन तक पहुँच सकता है, जिसमें 20x ARR गुणक पर $6 ट्रिलियन का उद्यम मूल्य होगा।
यह भविष्यवाणी धारणाओं के एक सेट पर निर्भर करती है: राजस्व का 75%–85% API से, उच्च API सकल मार्जिन, अत्यधिक उच्च शुद्ध राजस्व प्रतिधारण, और Claude Code का निरंतर प्रवेश।
18 जुलाई के समय पर खड़े होकर, ऐसा लग रहा था जैसे SemiAnalysis भ्रमित हो रहा है। लेकिन 8 जुलाई को, कई लोगों ने इसे काफी प्रशंसनीय पाया।
वास्तविकता ने इस आख्यान के लिए एक अत्यधिक नाटकीय समयरेखा की व्यवस्था की। $6 ट्रिलियन मूल्यांकन प्रक्षेपण 8 जुलाई को व्यापक रूप से प्रसारित किया गया था, और GPT-5.6 Sol आधिकारिक तौर पर 9 जुलाई को जारी किया गया था।
Anthropic की सतत गति कहानी उलटने से पहले एक महीने से भी कम समय तक चली। उस दौरान, चीनी मॉडलों के आसवन की आलोचना करने वाले कुछ लेख भी फेंके गए।
किसने कॉक रॉबिन को मारा?
GLM-5.2 की रिलीज़ के बाद, मैंने इसके महत्व का एक व्यवस्थित विश्लेषण लिखा, जिसे जनता ने एक "उत्कृष्ट कृति" के रूप में सराहा।
यह मानते हुए कि Zhipu ने मुझे प्रचार के लिए कभी भुगतान नहीं किया है, मैं एक स्वतंत्र शोधकर्ता बना हुआ हूँ (हँसी)।
हालांकि, GLM-5.2 ने वास्तव में Anthropic की नींव को हिला दिया; लोगों को उस समय स्थिति की गंभीरता का एहसास नहीं हुआ था।
GLM-5.2 अधिकांश कार्यों पर Opus 4.8 से बेहतर प्रदर्शन करता है, जो केवल Opus 4.7 के बाद दूसरे स्थान पर है। आपने सही पढ़ा: 4.8 से बेहतर जबकि केवल 4.7 के बाद दूसरे स्थान पर, जो आश्चर्यचकित करता है कि Anthropic ने 4.8 में कितना पानी मिलाया।
इस बीच, GLM-5.2 की कीमत Opus का केवल पाँचवाँ हिस्सा है, और यह Anthropic की सदस्यता योजनाओं की दर-सीमा समस्याओं से ग्रस्त नहीं है। GLM-5.2 के उद्भव ने पहले से ही Anthropic के मुख्य मॉडल खंड के मूल्य एंकर को काफी हद तक खतरे में डाल दिया है।
परिणामस्वरूप, बाजार ने Anthropic को "अधिक अत्याधुनिक मॉडलों" के लिए मूल्य निर्धारित करने की आशा की, जिससे SemiAnalysis का $6 ट्रिलियन मूल्यांकन पूर्वानुमान लगा।
इसके तुरंत बाद, Sol ने उच्चतम क्षमता स्तर पर Fable से सीधा टकराव किया। Anthropic ने बाद में कई बार Fable की सदस्यता सीमाओं का विस्तार किया और अंततः घोषणा की कि यह Max और Team Premium का स्थायी लाभ बन जाएगा।

फिर K3 आया। इसकी व्यापक क्षमता Fable और Sol से पीछे है—और केवल Fable और Sol से पीछे। इस बीच, K3 ओपन-सोर्स है, और कोई भी अनुमान क्लस्टर इसे तैनात कर सकता है।
बच्चों, उन्नत AI मॉडल वास्तव में खेतों में उगते हैं।
असममित प्रतिस्पर्धा
अतीत में, चीन पर अमेरिकी उन्नत कंप्यूटिंग चिप नियंत्रण का तर्क सीधा था: अपस्ट्रीम कंप्यूटिंग शक्ति को सीमित करके चीन के सीमांत मॉडलों के प्रशिक्षण और एक स्वतंत्र अर्धचालक पारिस्थितिकी तंत्र के निर्माण को धीमा करना। राष्ट्रीय सुरक्षा, सैन्य और निगरानी उपयोग सार्वजनिक कानूनी कारण थे, जबकि प्रमुख प्रौद्योगिकियों में अमेरिकी नेतृत्व बनाए रखना एक समवर्ती औद्योगिक लक्ष्य था।
बेशक, बड़ी समस्या यह थी कि अमेरिका के अपने उन्नत चिप्स पर्याप्त नहीं थे। अमेरिका न केवल चीन द्वारा कंप्यूटिंग शक्ति प्राप्त करने के बारे में चिंतित था, बल्कि वह चीनी कंपनियों को बोली में भाग लेने, अमेरिकी प्रयोगशालाओं और डेटा केंद्रों की कार्ड खरीदने की क्षमता को बाहर निकालने से भी रोकना चाहता था।
इन नियंत्रणों ने निश्चित रूप से चीन के लिए सीमांत मॉडलों को प्रशिक्षित करने की कठिनाई को बढ़ा दिया, लेकिन उन्होंने एक सूक्ष्म प्रतिकार प्रभाव भी पैदा किया: उन्होंने चीनी AI कंपनियों को अतिरिक्त लाभ कमाने की क्षमता से वंचित कर दिया, साथ ही साथ इस नुकसान को खेल में एक हथियार में बदल दिया।
चूंकि आप मुझे अतिरिक्त लाभ कमाने नहीं देंगे, और मैं नहीं चाहता कि मेरी तकनीक अवरुद्ध हो, मैं इसे बनाने के बाद मुफ्त में दे दूंगा।
और ओपन-सोर्स मॉडल ग्राफिक्स कार्ड के बारे में चुनिंदा नहीं हैं। चीनी कार्ड उन्हें तैनात कर सकते हैं, और अमेरिकी कंप्यूटिंग क्लस्टर भी कर सकते हैं। Fireworks, TogetherAI और NeoClouds के एक समूह के पास सभी के पास बहुत सारे GPU हैं।
इस प्रकार, अमेरिका-चीन AI प्रतिस्पर्धा में एक अत्यधिक अमूर्त संयोजन उभरा है:
चीनी मॉडल + अमेरिकी और वैश्विक अनुमान क्लस्टर बनाम अमेरिकी क्लोज-सोर्स AI प्रयोगशालाएँ
चीनी प्रयोगशालाएँ महंगी मॉडल R&D करती हैं, अपनाने और सीमांत स्थिति के लिए ओपन वेट का व्यापार करती हैं; अमेरिकी क्लाउड प्रदाता और अनुमान प्लेटफॉर्म कॉल को संभालने के लिए स्थानीय GPU का उपयोग करते हैं, लागत के आधार पर मूल्य निर्धारण करते हैं और खूब कमाते हैं।
वास्तव में लाभ खोने वाले अमेरिकी सीमांत प्रयोगशालाएँ हैं जो प्रीमियम मूल्य वसूलने के लिए क्लोज वेट और क्षमता दुर्लभता पर निर्भर करती हैं।
चीनी प्रयोगशालाओं के लिए, ओपन वेट का त्याग करने का मतलब संभावित API किराया खोना है जो पहले से ही उनकी अपनी अनुमान क्षमता द्वारा सीमित था।
अमेरिकी क्लोज प्रयोगशालाओं के लिए, जो त्याग किया जाता है वह प्रचुर स्थानीय कंप्यूटिंग शक्ति और वैश्विक क्षमता दुर्लभता पर बनाया गया वास्तविक अतिरिक्त लाभ है।
इसलिए, अमेरिका के सामने "प्रतिबंध जारी रखें या खुली बिक्री" का एक सरल विकल्प नहीं है, बल्कि एक असंभव त्रिमूर्ति है:
- चीन पर प्रतिबंध लगाएं, और चीन ओपन-सोर्स मॉडल जारी करता रहेगा, इसलिए कोई पैसा नहीं कमाता।
- चीन को कार्ड खरीदने दें, और सामूहिक बोली से स्थानीय प्रयोगशालाओं में कार्डों की कमी हो सकती है।
- चीन को उचित रूप से कुछ कार्ड दें ताकि समझौता हो, लेकिन कितने उपयुक्त हैं? कोई नहीं जानता, और कोई बोलने की हिम्मत नहीं करता।
यह विशिष्ट असममित प्रतिस्पर्धा है। वाशिंगटन को असममित प्रतिस्पर्धा के बारे में बात करना पसंद है; अब यह शब्द वाशिंगटन का पीछा करने आया है।
Micron के प्रति वफादारी!
इस श्रृंखला को एक कदम और अपस्ट्रीम धकेलने पर पूरा AI CapEx आख्यान आता है।
अतीत में, क्लोज-सोर्स सीमांत मॉडलों के उच्च अनुमान सकल मार्जिन AI CapEx श्रृंखला के लिए सबसे महत्वपूर्ण गद्दी थे। जब तक मॉडल क्षमताएँ दुर्लभ थीं, API और सदस्यताएँ उच्च कीमतें बनाए रख सकती थीं; प्रयोगशालाओं और क्लाउड प्रदाताओं ने उच्च सकल मार्जिन प्राप्त किया, जिससे वे अधिक महंगे GPU, तेज़ मूल्यह्रास और अधिक आक्रामक डेटा केंद्र निवेश को सहन कर सकते थे; अपस्ट्रीम फिर उत्पादन का विस्तार करना और उच्च मूल्य निर्धारण बनाए रखना जारी रखेगा।
इस श्रृंखला को सरलता से लिखा जा सकता है:
मॉडल क्षमता दुर्लभता → उच्च API मूल्य → डाउनस्ट्रीम उच्च सकल मार्जिन → GPU प्रीमियम सहन करने की क्षमता → CapEx विस्तार → अपस्ट्रीम निरंतर समृद्धि।
जब कई प्लेटफॉर्म एक ही वेट को तैनात कर सकते हैं, तो अनुमान की कीमतें "सीमांत प्रयोगशाला कितना वसूलने को तैयार है" से वापस "एक कुशल क्लस्टर के लिए एक सफल कार्य चलाने में कितना खर्च होता है" में स्थानांतरित हो जाती हैं।
ओपन वेट इस तथ्य को नहीं बदलते हैं कि कंप्यूटिंग की लागत पैसा है; वे कंप्यूटिंग खपत से जुड़े "मॉडल कर" को हटा देते हैं। Fireworks को K3 की प्री-ट्रेनिंग लागत Moonshot के लिए वहन नहीं करनी पड़ती, न ही उसे प्रति टोकन एक क्लोज-सोर्स मॉडल को पूर्ण किराया देना पड़ता है।
उसे अभी भी GPU, अनुमान इंजन, क्वांटाइज़ेशन, कैशिंग, नेटवर्किंग, वित्तपोषण, SLA और एंटरप्राइज़ बिक्री की लागत वहन करनी पड़ती है, लेकिन उसे केवल वास्तविक कंप्यूटिंग लागत, उपयोग, सेवा लागत और प्रतिस्पर्धी लाभ के आधार पर उद्धरण देना होता है। यह विशिष्ट लागत-आधारित मूल्य निर्धारण तर्क है, और समृद्धि पर निर्भर उद्योग के लिए, लागत-आधारित मूल्य निर्धारण का अपस्ट्रीम पर विनाशकारी प्रभाव पड़ता है।
यह प्रत्येक GPU के लिए पूंजी वापसी गणना को उल्टा बदल देगा।
अतीत में, सेवा प्रदाता महंगे हार्डवेयर की लागत को उच्च कीमत वाले मॉडल API में डाल सकते थे और अंतिम ग्राहकों को दे सकते थे।
जब अनुमान प्लेटफॉर्म एक ही ओपन वेट के आसपास प्रतिस्पर्धा करते हैं, तो उनमें से किसी के लिए इस प्रीमियम को पारित करना जारी रखना कठिन हो जाता है। इस प्रकार, GPU खरीद के लिए उच्च उपयोग, छोटी वापसी अवधि, कम वित्तपोषण लागत और अधिक निश्चित ग्राहक अनुबंधों की आवश्यकता होती है।
अल्पावधि में, अधिक बिखरे हुए डाउनस्ट्रीम खरीदार कंप्यूटिंग उत्पादकों (विशेष रूप से NVDA) की सौदेबाजी की शक्ति को कमजोर नहीं करेंगे। लेकिन दीर्घावधि में, डाउनस्ट्रीम सकल मार्जिन में प्रणालीगत गिरावट अनिवार्य रूप से अपस्ट्रीम के लिए बदतर सौदेबाजी लोच का कारण बनेगी, जो पूरे AI CapEx आख्यान के लिए एक अनियंत्रित और विशाल जोखिम है।
फेल होने के लिए बहुत बड़ा
इस बिंदु पर, K3 के 2.8T ने दो प्रतीत होने वाले विरोधाभासी अर्थ प्रकट किए हैं।
एक ओर, K3 बहुत किफायती मॉडल नहीं है, जो मॉडलों को Sonnet मूल्य सीमा और 64-कार्ड+ तैनाती ब्रैकेट में धकेलता है।
दूसरी ओर, यह ठीक यही "अर्थव्यवस्था को प्राथमिकता न देना" है जो K3 को उच्चतम क्षमता समूह में प्रवेश करने, Anthropic के मॉडल किराए को अस्थिर करने, अमेरिका-चीन अनुमान लाभों को पुनर्गठित करने और AI CapEx आख्यान को प्रभावित करने के योग्य बनाता है।
अतीत में, कई कंपनियों को एज-साइड, छोटे आकार और "काफी अच्छा" के बारे में बात करना पसंद था। ये मार्ग निश्चित रूप से महत्वपूर्ण हैं; वे निर्धारित करते हैं कि मौजूदा बुद्धिमत्ता उपकरणों, उपयोगकर्ताओं और उद्योगों तक कितनी दूर फैल सकती है।
लेकिन शब्द "काफी अच्छा" बहुत उबाऊ है; यह केवल उन बाजारों पर लागू होता है जहाँ क्षमता सीमाएँ पहले से ही निश्चित हैं।
सीमांत AI कभी भी कार्यों के एक निश्चित सेट का सामना नहीं करता है: एक मॉडल जिसने आज सिर्फ सिंगल-फ़ाइल प्रोग्रामिंग सीखी है, उसे कल पूरे कोडबेस को संभालना होगा; जिसने अभी टूल कॉलिंग सीखी है, उसे अगली पीढ़ी में घंटों या दिनों तक लगातार काम करना होगा।
मध्यम आकार के मॉडल "अधिक लोगों द्वारा उपयोग कैसे किया जाए" का उत्तर देते हैं, जबकि बड़े मॉडल "किसके पास ओरेकल देने का अधिकार है" के लिए प्रतिस्पर्धा करते हैं।
एक मॉडल जो पहले से ही मजबूत है लेकिन महंगा है, बाद में स्पार्सिफिकेशन, क्वांटाइज़ेशन, कैशिंग, डिस्टिलेशन और अनुमान इंजीनियरिंग के माध्यम से तेज़ और सस्ता बनाया जा सकता है; यह छोटे मॉडलों की एक पूरी लाइन के लिए शिक्षक मॉडल के रूप में भी काम कर सकता है।
एक छोटा मॉडल जिसने शुरू से एक निश्चित क्षमता नहीं सीखी, हालांकि, विस्तारित सोच या तैनाती अनुकूलन के माध्यम से शून्य से पूरक करना कठिन है।
यह असममितता "इतना बड़ा जाओ कि हार न हो" को एक कच्ची लेकिन अक्सर प्रभावी सीमांत पद्धति बनाती है।
2024 में, OpenAI ने o1 जारी किया, जिसने स्केलिंग का ध्यान बड़े प्री-ट्रेनिंग आधारों से प्रशिक्षण-समय सुदृढीकरण सीखने और परीक्षण-समय सोच गणना पर स्थानांतरित कर दिया।
o1 स्वयं एक छोटा अनुमान मॉडल है। इसने साबित किया कि "छोटा आधार + अधिक सोच" गणित, कोड और औपचारिक तर्क में अद्भुत प्रगति कर सकता है, जिससे पैरामीटरों को छोटा करने का एक चक्र शुरू हो गया।
आधार जितना छोटा होगा, यह उतना ही परीक्षण-समय कंप्यूट मुआवजे पर निर्भर करेगा; अनुमान तरकीबें जितनी अधिक सफल होंगी, संगठन के पास आधार का विस्तार करने की प्रेरणा उतनी ही कम होगी। परिणामस्वरूप, OpenAI के मॉडल तेजी से खराब होने लगे।
2025 में, Anthropic विपरीत दिशा में चला गया। Anthropic ने बड़े, अधिक महंगे मॉडल बनाने पर जोर दिया, फिर Claude Code का उपयोग करके क्षमताओं को उत्पादों में बदल दिया।
Claude के प्रति उपयोगकर्ता की वफादारी इसलिए नहीं है क्योंकि यह सस्ता है, बल्कि इसलिए कि सबसे कठिन वास्तविक दुनिया के सॉफ्टवेयर इंजीनियरिंग कार्यों पर, वे Opus को काम देने में अधिक सुरक्षित महसूस करते हैं। 2025 के अंत तक, Anthropic ने दावा किया कि Claude Code ने AI कोडिंग बाजार के आधे से अधिक हिस्से पर कब्जा कर लिया, जिसका एंटरप्राइज़ बाजार हिस्सा 24% से बढ़कर 40% हो गया। राजस्व ने OpenAI को भी पीछे छोड़ दिया।
OpenAI ने बाद में महसूस किया कि अनुमान दक्षता और रूटिंग उच्चतम क्षमता आधार को प्रतिस्थापित नहीं कर सकते। GPT-5 ने मुख्य, सोच, मिनी और Pro की एक पूर्ण सीढ़ी फिर से स्थापित की; GPT-5.6 तक, इसने स्पष्ट रूप से तीन मॉडल आकार—Sol, Terra और Luna—निर्धारित किए और सबसे कठिन कार्यों के लिए बड़े पैमाने के Sol को फ्लैगशिप स्थिति में वापस रखा।
परिणामस्वरूप, Codex उपयोगकर्ताओं ने तेजी से 10 मिलियन को पार कर लिया, जिससे Anthropic को Fable को अपनी सदस्यता योजनाओं में वापस जोड़ने के लिए मजबूर होना पड़ा।
अब, K3 जारी किया गया है, जो केवल Sol और Fable के बाद दूसरे स्थान पर है, यहाँ तक कि इस बारे में चर्चा भी छिड़ गई है कि क्या अमेरिकी सीमांत AI अभी भी इस कार्य के लिए तैयार है।
जब आप वास्तव में पहले स्थान के लिए प्रतिस्पर्धा करने को तैयार हैं, तो परिणाम आमतौर पर बुरा नहीं होता। यह फेल होने के लिए बहुत बड़ा है।
निष्कर्ष: छोटे शहर के युवा पूंजीपतियों को पीट रहे हैं
चीनी AI मॉडल कंपनियों को अक्सर छोटे शहर के युवाओं के रूप में वर्णित किया जाता है: सीमित संसाधन, खराब स्थान, और भी बदतर अंतर्राष्ट्रीय प्रतिष्ठा, और भाग्यशाली अगर उनके GPU अनुमान बनाए रख सकते हैं, प्रशिक्षण की तो बात ही छोड़ दें—बस जब तक वे पीछे न रह जाएँ।
इस बीच, उन्नत अमेरिकी AI प्रयोगशालाओं में एक पूंजीपति का स्वभाव है: मानव विज्ञान और सुरक्षा पर चर्चा करना, परोपकारी मशीनों पर चर्चा करना, इस बारे में चर्चा करना कि क्या भविष्य की दुनिया स्वतंत्रता या अस्वतंत्रता की है, क्या AI पृथ्वी की है या आकाश की।
इस तरह के नाटकीय अंतर के तहत, एक नाटक जहाँ छोटे शहर के युवा पूंजीपतियों को पीटते हैं, वास्तव में मंचित किया जा सकता है। आप इसे कैसे भी घुमाएँ, यह किसी को भी हँसी से लोटपोट करने के लिए पर्याप्त है।
—वास्तव में, जल्दी करने की कोई आवश्यकता नहीं है। अभी सबसे अच्छा आना बाकी है।





