Baseten ने अपने Model APIs पर Kimi K3 के लिए दिन-0 समर्थन प्रदान किया है। हम Moonshot AI टीम का शुक्रिया अदा करना चाहते हैं कि उन्होंने शुरुआती पहुँच के लिए हमारे साथ Kimi K3 के वेट शेयर किए, साथ ही Inferact और RadixArk टीमों का भी धन्यवाद, जिन्होंने पूरे विकास प्रक्रिया के दौरान हमारे साथ सहयोग किया।

Kimi K3 आज Baseten Model APIs पर विज़न इनपुट और पूर्ण 1M-टोकन कॉन्टेक्स्ट विंडो के साथ उपलब्ध है।
Kimi K3 एक नया ओपन फ्रंटियर मॉडल है। 2.8T पैरामीटर के साथ, यह किसी भी पिछले ओपन मॉडल से काफी बड़ा है, जो एक प्रदर्शनकारी इन्फ्रेंस API बनाने में कई चुनौतियों को पेश करता है। नई आर्किटेक्चरल तकनीकों के कारण Kimi K3 पिछले फ्रंटियर ओपन मॉडलों के ट्रिलियन-पैरामीटर थ्रेशोल्ड से आगे बढ़ सकता है:
- Kimi Delta Attention (KDA) और Attention Residuals (AttnRes) Kimi आर्किटेक्चर के लिए एक स्केलेबल बैकबोन के रूप में।
- अत्यंत विरल एक्सपर्ट, जिनमें 896 में से केवल 16 एक्सपर्ट एक समय में सक्रिय होते हैं, जो Stable LatentMoE का उपयोग करके व्यवस्थित किए गए हैं।
- एक नया विज़न एन्कोडर जो इमेज इनपुट को प्रोसेस करने और दृश्य जानकारी को लेटेंट स्पेस में मैप करने के लिए है।
यह लेख Kimi K3 के नवीन मॉडल आर्किटेक्चर और विशाल वेट को लॉन्च के दिन बड़े पैमाने पर चलाने के लिए आवश्यक तकनीकी कार्य का वर्णन करता है।
माइलस्टोन 1: एक टोकन उत्पन्न करें
Moonshot AI टीम से Kimi K3 के वेट तक शुरुआती पहुँच प्राप्त करने के बाद, हमारी पहली प्राथमिकता केवल मॉडल को चालू करना था।
Kimi K3 के पहले टोकन उत्पन्न करने के लिए निम्नलिखित की आवश्यकता थी:
- हार्डवेयर का प्रावधान: Kimi K3 के आकार को देखते हुए, हमने मॉडल को NVIDIA GB300 NVL72 सिस्टम पर चलाने का निर्णय लिया।
- वेट लोड करना: MXFP4 में, Kimi K3 के वेट 1.4TB से अधिक डेटा हैं।
- इन्फ्रेंस इंजन को चालू करना: हमने vLLM और SGLang के पीछे की टीमों के साथ काम किया ताकि Kimi K3 के लिए इन्फ्रेंस इंजनों के प्री-रिलीज़ बिल्ड चलाए जा सकें।
अक्सर, दिन-0 APIs बनाते समय, एक प्रारंभिक कदम वेट को NVFP4 में पोर्ट करना होता है ताकि प्रदर्शन और NVIDIA Blackwell तथा हमारे इन्फ्रेंस स्टैक के साथ संगतता में सुधार हो सके। हालाँकि, Kimi K3 मूल MXFP4 वेट का उपयोग MXFP8 एक्टिवेशन के साथ करता है, और हम इन वेट का सीधे उपयोग करने में सक्षम थे।
वेट हाथ में होने पर, हमने Inferact (vLLM पर) और RadixArk (SGLang पर) के साथ मिलकर काम किया। Baseten Inference Stack पर Kimi K3 चलाने से पहले, हमें प्रमुख ओपन-सोर्स इन्फ्रेंस इंजनों के सहयोग से एक बेसलाइन स्थापित करने की आवश्यकता थी।
किसी मॉडल के लिए इन्फ्रेंस इंजन में समर्थन जोड़ना गैर-तुच्छ है। इसके लिए कोर मॉडलिंग कोड को लागू करना, KDA जैसी नई आर्किटेक्चर के लिए ऑप्टिमाइज़्ड कर्नेल, और टोकनाइज़ेशन से लेकर टूल कॉलिंग तक सब कुछ के लिए Kimi K3 के लिए फ्रंटएंड संगतता बनाना आवश्यक है।
vLLM की NVIDIA Blackwell GPUs के लिए शुरुआती पहुँच इमेज ने हमें बुनियादी फीचर पूर्णता स्थापित करने, प्रारंभिक इवैल्यूएशन पास करने, और एक बेसलाइन प्रदर्शन लक्ष्य निर्धारित करने में मदद की। KDA, AttnRes, और Stable LatentMoE जैसी Kimi K3 की आर्किटेक्चरल विशेषताओं को समायोजित करने का यह काम हमारे लिए एक ठोस नींव बना। हमने Kimi K3 के लिए vLLM इन्फ्रेंस इंजन का व्यापक सत्यापन भी किया, और अपने काम के आधार पर ओपन-सोर्स इंजन में योगदान दिया।
SGLang की शुरुआती पहुँच इमेज ने Kimi K3 की तेज़, विश्वसनीय सर्विंग के लिए एक संदर्भ प्रदान किया। SGLang का विज़न लैंग्वेज मॉडल के लिए मजबूत समर्थन का इतिहास रहा है, और Kimi K3 कोई अपवाद नहीं है। RadixArk टीम के साथ, हमने फ्रंटएंड संगतता और कर्नेल ऑप्टिमाइज़ेशन पर ध्यान केंद्रित किया, और हमारी इंजीनियरिंग टीम ने टूल कॉल हैंडलिंग और स्ट्रक्चर्ड आउटपुट के आसपास फ्रंटएंड बग के लिए फिक्स का योगदान दिया ताकि रिलीज़ की तैयारी को समर्थन मिल सके।
Inferact और RadixArk टीमों का धन्यवाद जिन्होंने पूर्वावलोकन विंडो के दौरान हमारे साथ कंधे से कंधा मिलाकर काम किया। इस काम ने हमारे Kimi K3 API के लिए एक आवश्यक नींव प्रदान की और ओपन-सोर्स समुदाय में वापस योगदान करने का अवसर भी दिया।
माइलस्टोन 2: इन्फ्रेंस इंजन को मान्य करें
Kimi K3 अब तक का सबसे स्मार्ट ओपन मॉडल है। इन्फ्रेंस के दौरान उस बुद्धिमत्ता को वास्तव में प्रदान करना आवश्यक है।

Kimi K3 बेंचमार्क एजेंटिक कार्यों पर मजबूत प्रदर्शन दिखाते हैं, जो सटीक टूल कॉल और उच्च गुणवत्ता वाले मॉडल आउटपुट पर निर्भर करते हैं।
गुणवत्ता सत्यापन कठोरता के विभिन्न स्तरों पर हो सकता है। सरल सैनिटी चेक, जैसे कि मॉडल को एक ज्ञात प्रॉम्प्ट के साथ कॉल करना या gsm8k या BFCL जैसी हल्की बेंचमार्क चलाना और यह जाँचना कि परिणाम त्रुटि के मार्जिन के भीतर हैं, विकास प्रक्रिया के दौरान उपयोगी चेकपॉइंट हैं ताकि यह सुनिश्चित हो सके कि चीजें पटरी से नहीं उतर रही हैं। लेकिन एक सार्वजनिक API जारी करने के लिए अधिक कठोर बेंचमार्किंग की आवश्यकता होती है।
Moonshot AI टीम Kimi Vendor Verifier संचालित करती है, जो इन्फ्रेंस प्रदाताओं को मॉडल वेट की सटीक, उच्च-निष्ठा सर्विंग सुनिश्चित करने में मदद करता है। Kimi Vendor Verifier पास करना हमारे API विकास में एक आवश्यक प्रारंभिक माइलस्टोन था, और यह पूरे विकास प्रक्रिया के दौरान एक अत्यंत उपयोगी उपकरण था।
मॉडलों की सर्विंग में गड़बड़ी करने के कई अवसर हैं। जबकि लोकप्रिय कथा यह है कि क्वांटाइज़ेशन सभी गुणवत्ता समस्याओं की जड़ है, व्यवहार में यह सच नहीं है। अधिकांश गुणवत्ता समस्याएं, विशेष रूप से टूल कॉलिंग और अन्य संरचित मॉडल व्यवहारों के साथ, इन्फ्रेंस सर्वर फ्रंटएंड से आती हैं।

फ्रंटएंड इन्फ्रेंस इंजन के सामने बैठता है और इनपुट और आउटपुट को प्रोसेस करता है।
फ्रंटएंड निर्धारक कोड है जो इन्फ्रेंस लूप के सामने CPU पर चलता है। यह इनपुट स्वीकार करने और आउटपुट लौटाने के लिए जिम्मेदार है। फ्रंटएंड को निम्नलिखित करना होगा:
- API को संचालित और मान्य करना
- प्रॉम्प्ट को टोकनाइज़ करना और आउटपुट को डिटोकनाइज़ करना
- चैट टेम्पलेट को रेंडर करना
- रीज़निंग और टूल कॉल को पार्स करना
- आउटपुट को ChatCompletions, messages, या किसी अन्य मानक में प्रारूपित करना
ये कार्य मॉडल से मॉडल में सूक्ष्म रूप से भिन्न होते हैं, और दिन-0 समर्थन के लिए तेजी से निर्माण करते समय बग और प्रदर्शन में गिरावट को पेश करना बहुत आम है। Kimi Vendor Verifier जैसे मजबूत चेक सामान्य विफलता मोड, जैसे टूल कॉलिंग, पर प्रदर्शन का मूल्यांकन करते हैं ताकि यह सुनिश्चित हो सके कि मॉडल इन्फ्रेंस लूप और API सतह दोनों में उच्च स्तर की निष्ठा के साथ परोसा जा रहा है।
जैसे-जैसे हमने API विकसित करना जारी रखा, हमने बाद के माइलस्टोन पर Kimi Vendor Verifier का उपयोग किया ताकि यह सुनिश्चित हो सके कि प्रदर्शन ऑप्टिमाइज़ेशन ने ऐसे बग पेश नहीं किए हैं जो सटीकता को कम कर देंगे।
माइलस्टोन 3: सही कॉन्फ़िगरेशन ढूँढें
इन्फ्रेंस इंजन विभिन्न मॉडलों, हार्डवेयर, ट्रैफिक पैटर्न, और लेटेंसी/थ्रूपुट ट्रेडऑफ के लिए प्रदर्शन को ट्यून करने के लिए कॉन्फ़िगरेशन विकल्पों की एक विस्तृत श्रृंखला प्रदान करते हैं। ये विकल्प, और उनके बीच की बातचीत, जटिल हैं।
सही कॉन्फ़िगरेशन खोजने के लिए, हम विभिन्न विकल्पों पर एक स्वीप करते हैं जैसे Tensor Parallelism (TP) और Expert Parallelism (EP) सेटिंग्स, Attention Data Parallelism (ADP) टॉगलिंग, बैच साइज़िंग, स्पेक्युलेटिव डिकोडर ड्राफ्ट लंबाई, लीनियर लेयर कैशिंग अंतराल, रूटिंग पैरामीटर, और इन्फ्रेंस इंजन सेटिंग्स।

Tensor Parallelism और Expert Parallelism बड़े मॉडलों को कई GPUs में विभाजित करते हैं।
Kimi K3 चलाने के लिए विशाल मॉडल वेट को VRAM में फिट करने के लिए आठ NVIDIA GB300 GPUs की आवश्यकता होती है। हालाँकि, कई अन्य NVIDIA GPUs के विपरीत जो आठ के नोड्स में आते हैं, GB300 चार के नोड्स में आते हैं। जबकि यह शुरू में संभावित समानांतरता रणनीतियों को सीमित कर सकता है – Tensor Parallelism पारंपरिक रूप से नोड्स के पार संभव नहीं है क्योंकि धीमे इंटरकनेक्ट महंगे all-reduce ऑपरेशन को इन्फ्रेंस के लिए बाधा बना देते हैं – GB300 NVL72 सिस्टम में नोड्स के बीच पर्याप्त तेज़ इंटरकनेक्ट है कि हम नोड्स के पार Tensor Parallelism और Expert Parallelism के साथ इन्फ्रेंस चला सकते हैं।
ये कॉन्फ़िगरेशन निर्णय इन्फ्रेंस इंजन की पसंद के अधीन हैं। इंजीनियरों ने समानांतर रूप से vLLM, SGLang, और हमारे स्वयं के इन-हाउस इंजन को कॉन्फ़िगर करने के लिए काम किया, निष्कर्षों को साझा किया और सीखों को हमारे इन-हाउस इन्फ्रेंस इंजन पर लागू किया, साथ ही ओपन-सोर्स इंजनों में PRs का योगदान भी दिया।
माइलस्टोन 4: प्रदर्शन को अनुकूलित करें
एक बार जब मॉडल एक अनुकूलित कॉन्फ़िगरेशन पर चालू हो जाता है, तो कई इन्फ्रेंस इंजीनियरिंग तकनीकें होती हैं जो लेटेंसी, थ्रूपुट, या दोनों के संयोजन में भौतिक रूप से सुधार कर सकती हैं। मॉडल APIs के लिए, हम आम तौर पर निम्नलिखित देखते हैं:
- स्पेक्यूलेशन: एक छोटे ड्राफ्ट मॉडल का उपयोग करके कई टोकन की भविष्यवाणी करना, फिर उन्हें फॉरवर्ड पास के भाग के रूप में मान्य करना। यह लॉसलेस ऑप्टिमाइज़ेशन प्रति-उपयोगकर्ता TPS को डिकोड पर सुधारता है।
- डिसएग्रीगेशन: प्रीफिल और डिकोड को अलग-अलग वर्कर्स में स्थानांतरित करें। यह संसाधनों के लिए प्रतिस्पर्धा को रोकता है, अधिक लक्षित कॉन्फ़िगरेशन की अनुमति देता है, और ट्रैफिक से मेल खाने के लिए प्रीफिल से डिकोड कंप्यूट के अनुपात को समायोज्य बनाता है।
- कैशिंग: अनुरोधों के बीच KV कैश और KDA स्थितियों को सहेजने के लिए मेमोरी आवंटित करना, जिससे इनपुट अनुक्रमों में साझा उपसर्गों वाले बाद के अनुरोध प्रीफिल के सभी या भाग को छोड़ सकते हैं। यह TTFT और समग्र सिस्टम थ्रूपुट में सुधार करता है।
पिछले माइलस्टोन से मॉडल चालू होना इस कार्य के लिए एक निर्भरता है। उदाहरण के लिए, DSpark, DFlash, या EAGLE-3 जैसी विधि का उपयोग करके एक स्पेक्युलेटर मॉडल को प्रशिक्षित करने के लिए लक्ष्य मॉडल (Kimi K3) से छिपी हुई स्थितियाँ उत्पन्न करने की आवश्यकता होती है, जिसमें प्रॉम्प्ट का एक सेट उपयोग किया जाता है जो अपेक्षित वास्तविक दुनिया के उपयोग से मिलता जुलता हो। ऐसा करने के लिए, आपको मॉडल का एक उचित उच्च-थ्रूपुट उदाहरण चाहिए जो लाइव हो और इन्फ्रेंस चला रहा हो।
एक नवीन प्रदर्शन ऑप्टिमाइज़ेशन टोकनाइज़र में था। वर्षों से, इन्फ्रेंस इंजीनियर टोकनाइज़ेशन समय को नगण्य मानकर अनदेखा करने में सक्षम रहे हैं। Kimi K3 जैसे मॉडल के लिए लंबे इनपुट अनुक्रमों और उच्च KV कैश पुन: उपयोग दरों के साथ, यह वास्तव में बदल जाता है, और टोकनाइज़ेशन प्रीफिल समय के लिए भौतिक हो सकता है, क्योंकि टोकनाइज़ेशन होना चाहिए भले ही इनपुट अनुक्रम कैश हिट हो या नहीं।
हमने एक कस्टम टोकनाइज़र बनाया जो लंबे इनपुट अनुक्रमों के लिए tiktoken से 18 गुना तक तेज़ है और इसे अपने Kimi K3 API के साथ रोल आउट किया।

Basetenkenizer लंबे इनपुट अनुक्रमों के लिए Tiktoken से 18 गुना तक तेज़ है।
प्रदर्शन पर अभी भी और काम किया जाना बाकी है। हम जिस भी मॉडल को लॉन्च करते हैं, उसके साथ हम रिलीज़ के बाद के हफ्तों में लेटेंसी और थ्रूपुट ऑप्टिमाइज़ेशन में निवेश जारी रखते हैं। Kimi K3 के अभूतपूर्व आकार के साथ, हर मुख्य इन्फ्रेंस इंजीनियरिंग तकनीक और इन्फ्रेंस स्टैक की हर परत पर आगे प्रदर्शन सुधार के लिए एक बड़ा सरफेस एरिया है।
माइलस्टोन 5: बड़े पैमाने पर तैनात करें
Kimi K3 के लिए उद्योग-व्यापी उत्साह बहुत बड़ा है। लॉन्च के समय API की भारी मांग की लहर इसके साथ मेल खाएगी। तदनुसार, सिस्टम-व्यापी थ्रूपुट, न कि केवल प्रति-उपयोगकर्ता लेटेंसी, एक शीर्ष प्राथमिकता है।
GB300 NVL72 सिस्टम पर, एक नोड 4 व्यक्तिगत GPUs है, जिसका अर्थ है कि 18 नोड हैं। एक उदाहरण के रूप में, Kimi K3 2 नोड (8 GPUs) लेता है; प्रत्येक NVL72 रैक मॉडल की 9 प्रतिकृति होस्ट कर सकता है। प्रत्येक क्लस्टर में कई GB300 NVL72 रैक होते हैं, और हम अधिक क्षमता तक पहुँचने के लिए कई क्षेत्रों और क्लाउड प्रदाताओं में मॉडल की सेवा करते हैं।

प्रत्येक NVL72 सिस्टम Kimi K3 की नौ प्रतिकृति चला सकता है।
किसी दिए गए प्रतिकृति के थ्रूपुट के लिए सबसे महत्वपूर्ण कारक प्रीफिक्स कैश हिट दर है। तैनाती के पैमाने को देखते हुए, यह इन्फ्रास्ट्रक्चर पर हल करने के लिए KV-अवेयर रूटिंग को प्राथमिक चुनौती बनाता है। जब कोई उपयोगकर्ता इनपुट टोकन का एक अनुक्रम भेजता है जिसे हमने पहले देखा है, तो हमें उस अनुरोध को एक प्रतिकृति पर रूट करने की आवश्यकता होती है जो प्रीफिल को छोड़ने के लिए सहेजे गए KV कैश तक पहुँच सकती है।
हमारी KV-अवेयर रूटिंग प्रणाली, जो NVIDIA Dynamo टूलकिट के साथ बनाई गई है, यह सुनिश्चित करती है कि हम बार-बार क्वेरी के लिए गर्म कैश वाली प्रतिकृति पर ट्रैफिक रूट करने में सक्षम हैं। चूँकि कोडिंग और मल्टी-टर्न एजेंट Kimi K3 के लिए सामान्य उपयोग के मामले हैं, यह कैश-अवेयर रूटिंग सिस्टम उपयोगकर्ताओं के पैसे बचाने और उच्च कुल सिस्टम थ्रूपुट बनाए रखने के लिए महत्वपूर्ण है।
Baseten पर Kimi K3 के साथ बनाएं
हम Model APIs के माध्यम से दिन-0 पहुँच प्रदान करने के लिए उत्साहित हैं, और इस मॉडल के अपने कार्यान्वयन को अनुकूलित करना जारी रखने के लिए तत्पर हैं ताकि प्रदर्शन और विश्वसनीयता के उच्चतम मानकों को प्राप्त किया जा सके।
Moonshot AI टीम की Kimi K3 घोषणा में मॉडल के लिए कई दिलचस्प परीक्षण शामिल हैं, जिनमें कोडिंग कार्य जैसे कर्नेल ऑप्टिमाइज़ेशन और विज़न-इन-द-लूप गेम डेवलपमेंट, शोध कार्य, और एजेंटिक कार्य जैसे वीडियो एडिटिंग और नॉलेज वर्क शामिल हैं। मंगलवार, 28 जुलाई को प्रशांत समयानुसार सुबह 11 बजे, मैं Joey Zwicker के साथ Kimi K3 उपयोग मामलों पर एक कार्यकारी ब्रीफिंग की मेजबानी कर रहा हूँ, जो Baseten में सभी फॉरवर्ड-डिप्लॉयड इंजीनियरिंग का नेतृत्व करते हैं।
Kimi K3 आज Baseten Model APIs पर उपलब्ध है। ओपन वेट इंटेलिजेंस में नई सीमा में आपका स्वागत है।
हमारे Kimi K3 API के पीछे कई इंजीनियरों का धन्यवाद, जिन्होंने मुझे इस लेख में अपनी कड़ी मेहनत का दस्तावेजीकरण करने दिया, जिसमें मॉडल प्रदर्शन, इन्फ्रास्ट्रक्चर, क्षमता, प्रशिक्षण, उत्पाद, और फॉरवर्ड डिप्लॉयड इंजीनियरिंग टीमों के बहुत से लोग शामिल हैं जिनके नाम बताना संभव नहीं है। साथ ही, Moonshot AI, Inferact, और RadixArk की टीमों का उनके सहयोग और समर्थन के लिए धन्यवाद।





