Kimi K3 16 जुलाई 2026 को लॉन्च हुआ। 2.8 ट्रिलियन पैरामीटर। 1 मिलियन टोकन कॉन्टेक्स्ट। अब तक का सबसे बड़ा ओपन-वेट मॉडल।
सबसे बड़ी बात है K3 Swarm Max: एक साथ 300 सब-एजेंट तक, 4,000 स्टेप्स में समन्वय, चैट के जवाबों के बजाय असली फ़ाइलें बनाना। दो वेरिएंट एक ही दिमाग साझा करते हैं। K3 Max रोज़मर्रा के कामों को संभालता है। K3 Swarm Max किसी समस्या पर पूरी टीम लगा देता है।

ज़्यादातर लोग Kimi खोलते हैं, एक सवाल टाइप करते हैं, जवाब पाते हैं, और टैब बंद कर देते हैं। यह प्रोडक्ट की लगभग 10% क्षमता है। यह गाइड बाकी 90% को कवर करती है।

स्वार्म कोई बाहरी जोड़ नहीं है। ऑर्केस्ट्रेटर एक सीखी हुई नीति है जिसे Parallel-Agent Reinforcement Learning से प्रशिक्षित किया गया है। आप लक्ष्य बताते हैं। स्वार्म तय करता है कि उसे कैसे विभाजित करना है, कितने एजेंट बनाने हैं, और परिणामों को कैसे जोड़ना है। स्वार्म्स व्यापक, समानांतर कामों में बेहतर होते हैं: 50+ स्रोतों पर शोध, बैच विश्लेषण, प्रतिस्पर्धी निगरानी, डेटासेट निर्माण। वे गहरे अनुक्रमिक कार्यों में संघर्ष करते हैं जहां चरण 3, चरण 2 पर निर्भर करता है।

- प्रॉम्प्ट नहीं, स्पेक लिखें
"फिटनेस ऐप मार्केट पर शोध करें" ऐसा करने से क्रेडिट बर्बाद होते हैं और बेकार आउटपुट मिलता है। एक लाइन का प्रॉम्प्ट स्वार्म को सब कुछ तय करने की अनुमति देता है। वह गलत तय करेगा।

स्वार्म को एक ठेकेदार की तरह समझें। एक स्पेक परिभाषित करता है कि क्या इकट्ठा करना है, क्या मान्य है, कौन से स्रोत अनुमत हैं, सटीक आउटपुट फ़ॉर्मेट, और विवाद होने पर क्या करना है। स्पेक पूरे वर्कफ़्लो में सबसे उच्च-प्रभाव वाली चीज़ है, क्योंकि लेवल 2 में यह आपके पुन: उपयोग योग्य स्किल का बीज बन जाता है।
1# PROJECT: [नाम]2GOAL: [एक वाक्य, विषय नहीं, बल्कि डिलीवरेबल]3SCOPE: [क्या शामिल है, क्या स्पष्ट रूप से बाहर है]4RULES: [सत्यापन, क्या सत्यापित निष्कर्ष माना जाता है]5SOURCES: [आधिकारिक पोस्ट, पेपर, केवल प्राथमिक, कोई एग्रीगेटर नहीं]6OUTPUT: [फ़ाइल प्रकार / संख्या / नामकरण / फ़ॉर्मेट विवरण]7ON CONFLICT: पंक्ति को चिह्नित करें, कभी चुपचाप हल न करें8STOP CONDITION: [कब रुकना है और अनुमान लगाने के बजाय रिपोर्ट करना है]
- पैसे खर्च करने से पहले डीकंपोज़िशन प्लान पढ़ें
स्पेक सबमिट करने के बाद, Kimi चलाने से पहले आपको एक्ज़ीक्यूशन प्लान दिखाता है: कितने सब-एजेंट, प्रत्येक क्या संभालता है, डिपेंडेंसी ऑर्डर, स्टेप बजट। यह वह कदम है जिसे नए लोग छोड़ देते हैं, और यह सबसे महंगा कदम है।

200 एजेंटों का स्वार्म गलत तरीके से डीकंपोज़ किया गया तो असली पैसा खर्च होता है। प्लान की जाँच करने में कुछ खर्च नहीं होता। आप तीन चीज़ें देख रहे हैं: क्या यह दायरा समझता है, क्या एजेंटों की संख्या कार्य के लिए उचित है, और क्या आउटपुट प्लान आपकी ज़रूरत से मेल खाता है।
1चलाने से पहले प्रस्तावित डीकंपोज़िशन दिखाएँ:2- कितने सब-एजेंट, और प्रत्येक क्या संभालता है3- डिपेंडेंसी ऑर्डर (क्या किसको ब्लॉक करता है)4- अनुमानित स्टेप बजट5- गुणवत्ता में सबसे बड़ा ड्रॉप जोखिम कहाँ है6अभी निष्पादित न करें। मेरी पुष्टि की प्रतीक्षा करें।
एक महत्वपूर्ण जानकारी: 4,000 स्टेप्स पूरे स्वार्म के लिए कुल समन्वित बजट है, प्रति एजेंट 4,000 नहीं। 300 एजेंटों के रन में औसतन लगभग 13 स्टेप्स प्रति एजेंट होते हैं। यह बताता है कि आपका कार्य इस आकार में फिट बैठता है या नहीं।
- इसे चलाएं
अब आप निष्पादित करते हैं। 300 सब-एजेंट तक समानांतर तरंगों में फायर होते हैं, प्रत्येक अपने स्वयं के बाउंडेड कॉन्टेक्स्ट में। केवल संरचित आउटपुट कोऑर्डिनेटर को वापस जाता है।
1स्पेक को शुरू से अंत तक निष्पादित करें।2जहाँ भी प्लान अनुमति दे, समानांतर करें।3किसी भी ब्लॉकर को तुरंत फ़्लैग करें, चुपचाप उसे हल न करें।4सब कुछ स्पेक में परिभाषित OUTPUT में मर्ज करें।
लेवल 1 के बाद आपके पास क्या है
आपके स्पेक से बना एक एकल स्वार्म आउटपुट। कच्चा, असत्यापित, लेकिन संरचित। अधिकांश लोग यहीं रुक जाते हैं। असली मूल्य लेवल 2 में शुरू होता है।

- चैट के जवाब के बजाय असली फ़ाइलों की मांग करें
"एक व्यापक रिपोर्ट" एजेंटों को जल्दी रुकने की अनुमति देता है। "एक 40 पेज का PDF + 20,000 पंक्तियों वाला एक CSV + 14 एक्सपोर्ट-रेडी PNG चार्ट" उन्हें एक गुणवत्ता लक्ष्य देता है।
स्पेक की शुरुआत हमेशा आउटपुट से करें। आउटपुट स्तर पर विशिष्टता ही एक शोध टीम और एक महंगे सुझाव बॉक्स के बीच का अंतर है।
1# मजबूत आउटपुट उदाहरण:2OUTPUT: 1 .xlsx, प्रति मॉडल एक पंक्ति, + 200 शब्दों का ब्रीफ3OUTPUT: 30 HTML फ़ाइलें, प्रति स्टोर एक, व्यवसाय के नाम पर4OUTPUT: 40 पेज का PDF + 20,000 पंक्तियों का CSV + 14 PNG चार्ट
- चैट के जवाब के बजाय असली फ़ाइलों की मांग करें
"एक व्यापक रिपोर्ट" एजेंटों को जल्दी रुकने की अनुमति देता है। "एक 40 पेज का PDF + 20,000 पंक्तियों वाला एक CSV + 14 एक्सपोर्ट-रेडी PNG चार्ट" उन्हें एक गुणवत्ता लक्ष्य देता है। स्पेक की शुरुआत हमेशा आउटपुट से करें। आउटपुट स्तर पर विशिष्टता ही एक शोध टीम और एक महंगे सुझाव बॉक्स के बीच का अंतर है।
1# मजबूत आउटपुट उदाहरण:2OUTPUT: 1 .xlsx, प्रति मॉडल एक पंक्ति, + 200 शब्दों का ब्रीफ3OUTPUT: 30 HTML फ़ाइलें, प्रति स्टोर एक, व्यवसाय के नाम पर4OUTPUT: 40 पेज का PDF + 20,000 पंक्तियों का CSV + 14 PNG चार्ट
- आउटपुट पर एक अलग मॉडल लगाएं
स्वार्म की ज्ञात खामी: जब तक आप स्पष्ट रूप से सत्यापन की मांग नहीं करते, यह आत्मविश्वास से भरे, कम उद्धृत दावे पैदा करता है, और स्वतंत्र सब-एजेंट कभी-कभी एक-दूसरे का खंडन करते हैं। "दिखने में पूरा" और "सही है" दो अलग दुनिया हैं।
एक दूसरे मॉडल को सत्यापन गेट के रूप में उपयोग करें। इसका एकमात्र काम: प्रशंसा नहीं, खंडन करना। आप प्रीमियम टोकन जनरेट करने के लिए नहीं, बल्कि अगले कदम से पहले चुप्पी में छिपी खामी को पकड़ने के लिए खर्च कर रहे हैं, ताकि वर्कफ़्लो को एक पुन: प्रयोग करने योग्य स्किल के रूप में सहेजा जा सके।

1आप VERIFIER हैं। एजेंटों के एक स्वार्म ने संलग्न आउटपुट तैयार किया है।2आपका एकमात्र काम यह पता लगाना है कि क्या गलत है।34जाँच करें:5- क्या प्रत्येक दावा किसी नामित स्रोत से जुड़ा है?6- क्या कोई दो खंड एक-दूसरे का खंडन करते हैं?7- क्या कुछ ऐसा तथ्य के रूप में प्रस्तुत किया गया है जो वास्तव में अनुमान है?8- क्या आउटपुट स्पेक की फ़ॉर्मेट आवश्यकताओं से मेल खाता है?910प्रत्येक समस्या के लिए: सटीक स्थान और समाधान बताएं।11यदि सब कुछ सही है: APPROVED।12यदि कुछ भी विफल होता है: REJECTED + पहले सबसे महत्वपूर्ण सुधार।
- पूरे वर्कफ़्लो को एक स्किल के रूप में सहेजें
एक सत्यापित रन के बाद, Kimi को पूरे वर्कफ़्लो को कैप्चर करने के लिए कहें: इनपुट फ़ॉर्मेट, एजेंट स्टेप्स, आउटपुट फ़ॉर्मेट, सत्यापन नियम। पहले रन में 20 मिनट लगते हैं। उसके बाद प्रत्येक रन में 30 सेकंड लगते हैं। स्किल ही वह कारण है कि सिस्टम हर बार फिर से शुरू करने के बजाय संचयी होता है।
1इस पूरे वर्कफ़्लो को एक पुन: प्रयोग करने योग्य स्किल के रूप में सहेजें: "[नाम]"2कैप्चर करें:3- इनपुट फ़ॉर्मेट (यह किन फ़ाइलों/स्पेक आकार की अपेक्षा करता है)4- एजेंट स्टेप्स जो काम कर गए5- आउटपुट फ़ॉर्मेट और नामकरण परंपरा6- स्पेक से सत्यापन नियम7अगली बार जब मैं इसे चलाऊं, मैं नई फ़ाइलें संलग्न करूंगा और वही आकार पाऊंगा।
लेवल 2 के बाद आपके पास क्या है
एक सत्यापित आउटपुट जिस पर आप भरोसा कर सकते हैं, और एक सहेजी गई स्किल जिसे आप स्पेक को फिर से बनाए बिना दोबारा चला सकते हैं। यहीं से लूप संचयी होना शुरू होता है।

- अपने स्वयं के दस्तावेज़ों को स्वार्म नॉलेज के रूप में फ़ीड करें
स्किल्स प्रक्रिया को कैप्चर करती हैं। डॉक्यूमेंट-टू-स्किल डोमेन को कैप्चर करता है। अपना सबसे अच्छा काम अपलोड करें और Kimi इसकी संरचनात्मक छाप को एक स्किल के रूप में कैप्चर करता है जिसे भविष्य का हर स्वार्म लागू करेगा।

हर PDF, ट्रांसक्रिप्ट, या स्प्रेडशीट जो आप फ़ीड करते हैं, वह संदर्भ बन जाता है जिसके खिलाफ सभी 300 एजेंट खुद को जांचते हैं, प्रशिक्षण डेटा पर वापस जाने के बजाय। जितना अधिक आप इसे फ़ीड करते हैं, आउटपुट उतना ही आपके काम जैसा दिखता है, न कि सामान्य AI जैसा।
1इस दस्तावेज़ को एक पुन: प्रयोग करने योग्य स्किल के रूप में कैप्चर करें। पहचानें कि इसे क्या काम करने योग्य बनाता है:2- संरचना और अनुभाग क्रम3- लहजा और आवाज का स्तर4- प्रति अनुभाग विश्लेषण की गहराई5इसे "[नाम]" के रूप में सहेजें। फिर एक अलग विषय पर एक नया दस्तावेज़ तैयार करें6कैप्चर की गई स्किल का उपयोग करके। सामग्री नहीं, बल्कि गुणवत्ता स्तर से मेल खाएं।
- हर अस्वीकृति को एक स्थायी नियम में बदलें
सत्यापन कदम एक बार एक खामी पकड़ता है। यह कदम सुनिश्चित करता है कि स्वार्म इसे फिर कभी न करे। फीडबैक को कठोर नियमों में आसवित करें और उन्हें एक कंस्ट्रेंट्स फ़ाइल में लिखें जिसे स्वार्म कुछ भी करने से पहले पढ़ता है।
1# CONSTRAINTS.md, स्वचालित रूप से लोड होता है2- हर दावा किसी प्राथमिक स्रोत से जुड़ा होना चाहिए या फ़्लैग किया जाना चाहिए3- कोई चुप्पी में विवाद समाधान नहीं: विरोधाभासों को सतह पर लाएं4- [पिछले रन के सत्यापक फीडबैक से आसवित नियम]5- [वह गलती जिसे आप कभी दोहराना नहीं चाहते]6Scope-lock: स्पेक के SCOPE ब्लॉक के बाहर कुछ भी न छुएं।
- नए इनपुट पर स्किल को दोबारा चलाएं
यहीं पर "संचयी" एक प्रचार शब्द नहीं रह जाता और इनवॉइस पर दिखाई देता है। रन दो शून्य से शुरू नहीं होता। यह ऊपर बनाई गई स्किल, स्वार्म नॉलेज और कंस्ट्रेंट्स फ़ाइल से शुरू होता है। वही वर्कफ़्लो, नई फ़ाइलें, सेटअप का एक छोटा सा हिस्सा।
रीप्ले पर अर्थव्यवस्था नाटकीय रूप से बदल जाती है। K3 की कैश-हिट कीमत दोहराए गए संदर्भ के लिए $0.30 प्रति मिलियन टोकन तक गिर जाती है, जो पहले रन की इनपुट कीमत से 10 गुना सस्ती है। स्किल, कंस्ट्रेंट्स और स्पेक सभी दोहराए गए संदर्भ हैं। केवल आपकी नई इनपुट फ़ाइलों पर पूरी दर लगती है। पहला रन एक निवेश है। हर बाद का रन रिटर्न की कटाई करता है।

आउटपुट संरचनात्मक रूप से भी बेहतर होता है। स्किल फ़ॉर्मेट को लागू करती है। कंस्ट्रेंट्स हर उस गलती को ब्लॉक करते हैं जिसे सत्यापक पहले ही पकड़ चुका है। स्वार्म नॉलेज हर एजेंट को प्रशिक्षण डेटा के बजाय आपके वास्तविक दस्तावेज़ों के खिलाफ जांचता है। रन चार न केवल रन एक से सस्ता है। यह बेहतर परिणाम देता है, क्योंकि सिस्टम ने तीन राउंड के वास्तविक फीडबैक से सीखा है।

1सहेजी गई स्किल "[नाम]" को इन नए इनपुट पर चलाएं।2CONSTRAINTS.md लागू करें। कैप्चर किए गए आउटपुट फ़ॉर्मेट का उपयोग करें।3[नई फ़ाइलें संलग्न करें]45इस रन के आउटपुट की तुलना पिछले रन से करें।6रिपोर्ट करें:7- नए निष्कर्ष जो पिछली बार मौजूद नहीं थे8- निष्कर्ष जो पिछले रन के बाद से बदल गए हैं9- जो कुछ भी गायब हो गया है (संभावित अंतर के रूप में फ़्लैग करें)10- स्किल के अपेक्षित आकार से विचलन
लेवल 3 के बाद आपके पास क्या है
एक स्व-सुधार करने वाली शोध पाइपलाइन। प्रत्येक रन पिछले से सस्ता, तेज़ और अधिक सटीक है क्योंकि स्किल लाइब्रेरी, नॉलेज बेस और कंस्ट्रेंट्स फ़ाइल बढ़ती रहती है।

- स्किल को शेड्यूल्ड एजेंट में अपग्रेड करें
एक बार लूप स्थिर और स्किल-समर्थित हो जाए, तो आप इसे हाथ से लॉन्च करना बंद कर देते हैं। Kimi को एक ट्रिगर पर इंगित करें: एक शेड्यूल, एक नई फ़ाइल ड्रॉप, एक मॉनिटर किया गया URL। इसे पूरे स्वार्म को सक्रिय रूप से चलाने दें, केवल डिलीवरेबल और उन विचलनों को सतह पर लाएं जो आपके ध्यान के लायक हैं।

प्रतिस्पर्धी निगरानी एक साफ उदाहरण है। रन एक: आप हाथ से बनाते और सत्यापित करते हैं। जब तक यह एक बैकग्राउंड एजेंट बन जाता है, यह हर प्रतियोगी को साप्ताहिक रूप से समानांतर में जांच रहा होता है और शून्य सीमांत समय लागत पर आपके इनबॉक्स में एक ब्रीफ गिरा रहा होता है। लूप में बचा एकमात्र इंसान वह सवाल है जो आपने सेट किया है और उस जवाब पर आप जो निर्णय लेते हैं।
1स्किल "[नाम]" को साप्ताहिक शेड्यूल पर चलाएं।2ट्रिगर: [शेड्यूल / नई फ़ाइल / मॉनिटर किया गया URL]3प्रत्येक रन पर: स्वार्म को निष्पादित करें, CONSTRAINTS.md लागू करें,4सत्यापित करें, फिर पिछले रन से OUTPUT + अंतर डिलीवर करें।5मुझे तभी संदेश भेजें जब कोई विचलन [सीमा] पार करे।
2.8T पैरामीटर क्या ठीक नहीं करते

भ्रम समानांतरता के साथ बढ़ता है। अधिक एजेंट खोज कर रहे हैं, जब तक आप एक सत्यापन पास नहीं चलाते, तब तक अधिक आत्मविश्वास से भरे गलत जवाब मिलते हैं। स्वार्म स्वयं तथ्य-जाँच नहीं करता है।
K3 की लागत K2.6 से 3-4 गुना अधिक है। इनपुट: $3.00/M बनाम $0.95/M। आउटपुट: $15.00/M बनाम $4.00/M। कैश रीप्ले पर मदद करता है, लेकिन पहला रन महंगा है। शुद्ध लागत अनुकूलन के लिए, K2.6 अभी भी बजट विकल्प है।
ओपन वेट अभी तक जारी नहीं हुए हैं। Moonshot ने 27 जुलाई 2026 तक उनका वादा किया था। तब तक, K3 केवल API और Kimi ऐप के माध्यम से चलता है।
स्वार्म्स खराब स्पेक को बढ़ाते हैं। एक एजेंट के माध्यम से एक अस्पष्ट प्रॉम्प्ट एक कॉन्टेक्स्ट विंडो बर्बाद करता है। 300 एजेंटों के माध्यम से यह समानांतर में 300 को बर्बाद करता है।
त्वरित सूची
- एक-लाइनर प्रॉम्प्ट। स्वार्म सब कुछ तय करता है। वह गलत तय करता है।
- डीकंपोज़िशन समीक्षा को छोड़ना। सबसे महंगा कदम जिसे छोड़ा जा सकता है।
- कोई सत्यापन पास नहीं। "दिखने में पूरा" "सही है" नहीं है।
- असत्यापित आउटपुट को स्किल के रूप में सहेजना। गलती हर भविष्य के रन पर बढ़ती है।
- एक अनुक्रमिक कार्य पर 300 एजेंट। एक स्वार्म विचार की श्रृंखला को समानांतर नहीं कर सकता।
- जहां K2.6 पर्याप्त है, वहां K3 का उपयोग करना। हर कार्य को 2.8T पैरामीटर की आवश्यकता नहीं है।
निष्कर्ष
अधिकांश लोग Kimi खोलेंगे, एक सवाल टाइप करेंगे, टैब बंद कर देंगे। वह चैटबॉक्स है। यह K3 की लगभग 10% क्षमता है।
बाकी 90% एक शोध टीम है जिसे आप एक बार बनाते हैं और हमेशा के लिए दोहराते हैं। प्रत्येक स्तर अधिक लाभ को अनलॉक करता है: पहले रन, फिर विश्वास, फिर संचय, फिर स्वायत्तता। पहले दिन आपको सभी चार की आवश्यकता नहीं है। एक स्पेक के साथ लेवल 1 से शुरू करें। यदि आउटपुट उपयोगी है, तो लेवल 2 पर जाएं और इसे सत्यापित करें। यदि आप इसे फिर से चलाने की योजना बनाते हैं, तो स्किल को सहेजें। सिस्टम वहां से अपने आप तेज हो जाता है।
प्रॉम्प्ट नहीं, स्पेक लिखें। सहेजने से पहले सत्यापित करें। फिर देखें कि हर रन पिछले से सस्ता और तेज कैसे होता जाता है।





