Kimi K3: Fable 5 को पछाड़ने वाले ओपन मॉडल के लिए A-Z गाइड

@kirillk_web3
अंग्रेज़ी1 दिन पहले · 19 जुल॰ 2026
235K
78
16
13
156

TL;DR

Kimi K3, Moonshot AI का 2.8 ट्रिलियन पैरामीटर वाला ओपन-सोर्स मॉडल है जो Fable 5 जैसे शीर्ष मालिकाना मॉडलों को टक्कर देता है। इसमें हाई-स्पीड, लॉन्ग-कॉन्टेक्स्ट कोडिंग और स्वायत्त सेल्फ-इम्प्रूवमेंट के लिए इनोवेटिव आर्किटेक्चर दिया गया है।

यह Kimi K3 वास्तव में क्या है, यह क्या कर सकता है, और यह अब तक का सबसे महत्वपूर्ण कोडिंग मॉडल क्यों बन रहा है जिसके बारे में कोई बात नहीं कर रहा है, इसका एक पूर्ण A–Z विवरण है।

इस पेज को बुकमार्क कर लें ताकि यह लेख खो न जाए।

2.8 ट्रिलियन पैरामीटर। 1 मिलियन टोकन कॉन्टेक्स्ट।

यहाँ इसके बारे में सब कुछ है।

बेंचमार्क पर बात करने से पहले, बात करते हैं कि अभी क्या हुआ

पिछले तीन सालों से कहानी एक जैसी रही है: अमेरिकी लैब्स फ्रंटियर बनाती हैं, चीनी लैब्स छह महीने बाद सस्ती कॉपी बनाती हैं।

16 जुलाई को, Moonshot AI ने Kimi K3 जारी किया।

https://x.com/Kimi_Moonshot/status/2077830229968683203

2.8 ट्रिलियन कुल पैरामीटर — DeepSeek के V4 Pro से लगभग 75% बड़ा और Zhipu के GLM 5 सीरीज़ से लगभग 4 गुना बड़ा। अब तक का सबसे बड़ा ओपन-सोर्स मॉडल जारी किया गया है।

यह Claude Opus 4.8 से बेहतर प्रदर्शन करता है। यह GPT-5.6 Sol से बेहतर प्रदर्शन करता है। और Moonshot के बेंचमार्क पर, यह Fable 5 के बराबर है — जो आज जनता के लिए उपलब्ध सबसे सक्षम मॉडल है।

कॉपी वाली कहानी खत्म हो गई है।

आंकड़े

Kirill - inline image

वह आखिरी पंक्ति है जिसे लोग गलत पढ़ रहे हैं। आइए ठीक से समझते हैं।

मूल्य निर्धारण की वास्तविकता — इसे ध्यान से पढ़ें

Kimi K3 कोई डिस्काउंट मॉडल नहीं है। $3/$15 प्रति मिलियन टोकन पर, इसकी कीमत लगभग Claude Sonnet स्तर की है — Moonshot के पिछले रिलीज़ के गहरे डिस्काउंट पर नहीं।

तो "Fable 5 से 5 गुना सस्ता" कहाँ से आता है?

प्रति-कार्य लागत, प्रति-टोकन मूल्य नहीं।

K3 समान कार्य को पूरा करने के लिए काफी कम आउटपुट टोकन का उपयोग करता है। एक प्रतिनिधि कोडिंग कार्य पर: Fable 5 की लागत लगभग $1.30 है। K3 की लागत लगभग $0.25 है।

समान आउटपुट स्तर। कम टोकन। कम कुल बिल।

ईमानदार फ्रेमिंग: Sonnet की कीमत, Fable-स्तर का अनुभव। आप बाजार में सबसे सस्ते टोकन नहीं खरीद रहे हैं। आप मध्य-स्तरीय मूल्य पर फ्रंटियर क्षमता खरीद रहे हैं, और वहाँ कम चरणों में पहुँच रहे हैं।

यदि आप कच्चे टोकन मूल्यों की तुलना कर रहे हैं, तो K3 साधारण लगता है। यदि आप तुलना कर रहे हैं कि किसी काम को पूरा करने में कितना खर्च आता है, तो यह पूरी तरह से अलग बातचीत है।

जहाँ Kimi K3 अत्याधुनिक है

Moonshot के प्रकाशित बेंचमार्क के अनुसार, K3 ने SOTA सेट किया है:

  • HLE with tools — Humanity's Last Exam, टूल-ऑगमेंटेड
  • SWE-Bench Pro — वास्तविक दुनिया की सॉफ्टवेयर इंजीनियरिंग
  • SWE-Bench Multilingual — भाषाओं में इंजीनियरिंग
  • BrowseComp — वेब ब्राउज़िंग और रिसर्च
  • Toolathlon — बड़े पैमाने पर टूल का उपयोग
  • CharXiv with Python — चार्ट और फिगर रीजनिंग
  • MathVision with Python — विज़ुअल गणित
Kirill - inline image

प्रतिस्पर्धा के मुकाबले: Opus 4.8 और GPT-5.6 Sol से बेहतर प्रदर्शन, Fable 5 के बराबर।

AI इवैल्यूएटर Arena द्वारा ब्लाइंड टेस्टिंग में, डेवलपर्स ने हर प्रमुख अमेरिकी मॉडल की तुलना में Kimi को प्राथमिकता दी।

दो आर्किटेक्चर इनोवेशन जो वास्तव में मायने रखते हैं

यह वह हिस्सा है जिसे अधिकांश कवरेज छोड़ रही है, और यह रिलीज़ में सबसे दिलचस्प चीज़ है।

Kirill - inline image
  • Kimi Delta Attention (KDA)

एक हाइब्रिड लीनियर अटेंशन मैकेनिज्म। परिणाम: मिलियन-टोकन कॉन्टेक्स्ट में 6.3 गुना तेज़ डिकोडिंग।

1M कॉन्टेक्स्ट विंडो तभी उपयोगी है जब आप वास्तव में हमेशा इंतजार किए बिना उसमें काम कर सकते हैं। KDA ही वह चीज़ है जो कॉन्टेक्स्ट विंडो को सैद्धांतिक के बजाय व्यावहारिक बनाती है।

  • Attention Residuals (AttnRes)

रेज़िड्यूअल कनेक्शन के लिए एक ड्रॉप-इन रिप्लेसमेंट। लगभग 2% अतिरिक्त लागत पर लगभग 25% अधिक प्रशिक्षण दक्षता प्रदान करता है।

दोनों तकनीकों को मॉडल शिप होने से पहले Moonshot टीम द्वारा GitHub पर ओपन रिसर्च के रूप में प्रकाशित किया गया था। यह मार्केटिंग नहीं है — यह पीयर-इंस्पेक्टेबल काम है।

और संयुक्त रूप से, वे टोकन दक्षता की व्याख्या करते हैं: K3 समतुल्य कार्यों पर K2.6 की तुलना में 21% कम आउटपुट टोकन का उपयोग करता है।

वह हिस्सा जो आपको चौंका देना चाहिए: K3 ने अपने स्वयं के आर्किटेक्चर को ऑप्टिमाइज़ किया

Moonshot ने K3 को Attention Residuals का कार्यान्वयन — इसका अपना आर्किटेक्चरल घटक — और एक उद्देश्य दिया: संख्यात्मक व्यवहार को बदले बिना H200 हार्डवेयर पर इसे तेज़ बनाना।

फिर उन्होंने इसे अकेला छोड़ दिया।

20 घंटे के प्रयोग। शून्य मानवीय हस्तक्षेप। 1.6 गुना स्पीडअप।

एक अलग रन में, K3 ने FLA Triton AttnRes फॉरवर्ड/बैकवर्ड समय को 283.6ms से घटाकर 114.4ms कर दिया — 2.48 गुना स्पीडअप — फिर से संख्याओं को बदले बिना।

Kirill - inline image

और इसने उसी कार्य को करने वाले Fable 5 की तुलना में तेज़ी से पुनरावृत्ति की।

इसे फिर से पढ़ें। मॉडल ने उस तंत्र में सुधार किया जो मॉडल को काम करता है। स्वायत्त रूप से। रातोंरात।

यह इस प्रकार है कि "रिकर्सिव सेल्फ-इम्प्रूवमेंट" व्यवहार में कैसा दिखता है — कोई साइंस-फाई परिदृश्य नहीं, एक मापने योग्य परिणाम के साथ 20 घंटे का काम। यह वही क्षमता है जिसे Anthropic ने हफ्तों पहले सावधानी के कारण के रूप में चिन्हित किया था, जो एक ओपन-वेट मॉडल में चल रही है जिसे कोई भी 27 जुलाई को डाउनलोड कर सकता है।

लॉन्ग-होराइज़न कोडिंग ही पूरा मुद्दा है

Moonshot का अपना फ्रेमिंग: "K3, Moonshot AI का अब तक का सबसे शक्तिशाली ओपन-सोर्स कोडिंग मॉडल है। न्यूनतम मानवीय निगरानी के साथ संचालित, यह लंबे इंजीनियरिंग सत्रों को बनाए रख सकता है, विशाल रिपॉजिटरी को नेविगेट कर सकता है, और टर्मिनल टूल्स को ऑर्केस्ट्रेट कर सकता है।"

वास्तविक इंजीनियरिंग कार्य के लिए तीन चीज़ें मायने रखती हैं:

  1. निरंतर सत्र — 20 घंटे का स्वायत्त प्रयोग कोई डेमो नहीं है। यह डिज़ाइन लक्ष्य है।
  2. विशाल रिपॉजिटरी — 6.3 गुना तेज़ डिकोडिंग के साथ 1M कॉन्टेक्स्ट विंडो का मतलब है कि आप एक वास्तविक कोडबेस को कॉन्टेक्स्ट में रख सकते हैं और वास्तव में उसमें काम कर सकते हैं।
  3. टूल ऑर्केस्ट्रेशन — Toolathlon और BrowseComp पर SOTA का मतलब है कि यह टर्मिनल, ब्राउज़र और API कॉल को बिना बिखरे संभालता है।

फ्रंटएंड कोडिंग Fable 5 स्तर पर है। एक ही प्रॉम्प्ट से AAA-गुणवत्ता वाले गेम सीन। WebGPU, Three.js, शेडर्स, फिज़िक्स — वह सब कुछ जिसके लिए पहले एक स्टूडियो की आवश्यकता होती थी।

Kimi K3 के साथ वाइब कोडिंग

यह वह जगह है जहाँ मॉडल बेंचमार्क नंबर होना बंद कर देता है और स्पष्ट रूप से उपयोगी होना शुरू करता है।

K3 का फ्रंटएंड कोडिंग Fable 5 स्तर पर है। व्यवहार में इसका मतलब है कि विवरण और एक काम करने वाले 3D उत्पाद के बीच की दीवार अब एक प्रॉम्प्ट है।

लोगों ने वास्तव में एकल प्रॉम्प्ट से क्या शिप किया है:

गेम्स — VFX के साथ WebGPU कॉम्बैट एरेना। ग्रैपलिंग मैकेनिक्स के साथ ब्राउज़र-आधारित 3D सिटी ट्रैवर्सल।

  1. Zombie FPS.
  2. मल्टीप्लेयर रेसिंग।
  3. एक काम करने वाला 3D GBA एमुलेटर।
  4. पूर्ण MMORPG स्कैफोल्डिंग।

"गेम जैसा डेमो" नहीं — हिट रिएक्शन, इम्पैक्ट फीडबैक, और सही व्यवहार करने वाली फिज़िक्स के साथ खेलने योग्य सीन।

Kirill - inline image

वास्तविक मटेरियल वर्क के साथ 3D ऑब्जेक्ट्स — सही चमक और प्रकाश व्यवहार वाली एक Rolex। एक CSGO हथियार जो 33 अलग-अलग मॉडल किए गए भागों में इकट्ठा और अलग होता है। एक Sony कैमरा टियरडाउन। ग्रेविटेशनल लेंसिंग वाला एक ब्लैक होल। वास्तविक वेव डायनामिक्स के साथ समुद्र सिमुलेशन।

Kirill - inline image

फिज़िक्स सीन — फैब्रिक सिमुलेशन। स्ट्रक्चरल कोलैप्स। मोमेंटम ट्रांसफर के साथ वाहन टक्कर जो स्क्रिप्टेड दिखने के बजाय सही दिखती है।

जो चीज़ इसे पिछले "AI एक वेबसाइट बनाता है" डेमो से अलग बनाती है: K3 उन विवरणों को संभालता है जो आमतौर पर टूटते हैं। लाइटिंग। शैडो। मटेरियल की चमक। वे 20 छोटी चीज़ें जो "स्पष्ट रूप से AI-जनरेटेड" को "किसी ने इसे बनाया है" से अलग करती हैं।

एक प्रॉम्प्ट। चार मिलियन टोकन। एक सीन जिसके लिए पहले एक टीम की आवश्यकता होती थी।

4 युद्ध-परीक्षित प्रॉम्प्ट (कॉपी-पेस्ट के लिए तैयार)

ये उस चीज़ का फायदा उठाने के लिए संरचित हैं जिसमें K3 वास्तव में अच्छा है: लॉन्ग-होराइज़न काम, टूल का उपयोग, और बिना भटके एक बड़े कॉन्टेक्स्ट को धारण करना।

प्रॉम्प्ट 1 — फिज़िक्स स्ट्रेस टेस्ट

यह वह प्रॉम्प्ट है जो वास्तविक क्षमता को डेमो पॉलिश से अलग करता है। यदि कोई मॉडल तीनों सीन को गुणवत्ता के साथ कर सकता है, तो यह वास्तविक है।

text
1वास्तविक भौतिकी के साथ तीन स्व-निहित HTML5 कैनवास सीन बनाएं।
2कोई बाहरी लाइब्रेरी नहीं। प्रति सीन एक फ़ाइल में सब कुछ।
3
4सीन 1: एक ट्रेन पुल से टूटकर पानी में गिर रही है।
5शामिल करें: डिब्बे का संवेग, पुल की संरचनात्मक विफलता,
6प्रभाव पर पानी का विस्थापन।
7
8सीन 2: दो कारें रैंप से कूदकर एक घाटी के ऊपर
9हवा में टकरा रही हैं। शामिल करें: सही प्रक्षेपवक्र चाप,
10टक्कर संवेग स्थानांतरण, मलबा।
11
12सीन 3: एक मॉन्स्टर ट्रक पार्क की गई कारों की एक कतार को कुचल रहा है।
13शामिल करें: सस्पेंशन कम्प्रेशन, शीट मेटल विरूपण,
14वजन वितरण।
15
16तीनों के लिए आवश्यकताएँ:
17- भौतिकी की गणना की जानी चाहिए, एनिमेटेड नहीं
18- 60fps लक्ष्य
19- एक रीसेट बटन शामिल करें
20- भौतिकी गणित पर टिप्पणी करें ताकि मैं इसे सत्यापित कर सकूं
21
22तीनों बनाएं। स्पष्टीकरण प्रश्न न पूछें।

प्रॉम्प्ट 2 — लॉन्ग-होराइज़न रेपो टास्क

यह वही है जिसके लिए K3 वास्तव में बनाया गया था। इसे एक वास्तविक कोडबेस पर इंगित करें और इसे एक कार्य नहीं, बल्कि एक परिणाम दें।

text
1कुछ भी लिखने से पहले इस पूरे कोडबेस को पढ़ें।
2
3[अपनी रेपो पेस्ट करें, या इसे डायरेक्टरी पर इंगित करें]
4
5उद्देश्य: [एक मापने योग्य परिणाम बताएं — जैसे "p95
6API प्रतिक्रिया समय को 30% कम करें" या "डेटा लेयर में
7सभी N+1 क्वेरी को समाप्त करें"]
8
9नियम:
10- पहले प्रोफाइल करें। मुझे दिखाएं कि समय वास्तव में कहाँ जाता है
11 इससे पहले कि आप कुछ बदलें।
12- सार्वजनिक इंटरफ़ेस या संख्यात्मक व्यवहार न बदलें।
13- प्रत्येक परिवर्तन के बाद मौजूदा टेस्ट सूट चलाएं।
14- यदि कोई परिवर्तन चीजों को बदतर बनाता है, तो इसे वापस लें और मुझे बताएं कि क्यों।
15- तब तक काम करें जब तक उद्देश्य प्राप्त न हो जाए या आप साबित न कर सकें कि यह
16 नियमों को तोड़े बिना प्राप्त करने योग्य नहीं है।
17
18अंत में रिपोर्ट करें: आपने क्या बदला, इससे क्या मिला,
19आपने क्या आजमाया जो काम नहीं आया।

"आपने क्या आजमाया जो काम नहीं आया" पंक्ति मायने रखती है। यही आउटपुट को एक डिफ से इंजीनियरिंग लॉग में बदल देती है।

प्रॉम्प्ट 3 — 3D प्रोडक्ट बिल्ड

फ्रंटएंड, लैंडिंग पेज या उत्पाद विज़ुअलाइज़ेशन करने वाले किसी भी व्यक्ति के लिए।

text
1ब्राउज़र में एक इंटरैक्टिव 3D [ऑब्जेक्ट] बनाएं।
2एकल HTML फ़ाइल। Three.js।
3
4ऑब्जेक्ट: [इसे सटीक रूप से वर्णित करें — सामग्री,
5भागों की संख्या, क्या चलता है]
6
7इसमें शामिल होना चाहिए:
8- सही सामग्री गुण (चमक, खुरदरापन,
9 धात्विकता जहाँ प्रासंगिक हो)
10- वास्तविक छाया के साथ तीन-बिंदु प्रकाश व्यवस्था
11- ऑर्बिट नियंत्रण
12- [कोई भी इंटरैक्शन — असेंबली/डिसअसेंबली, एनिमेशन,
13 होवर स्टेट्स]
14
15गुणवत्ता बार: यह एक उत्पाद रेंडर जैसा दिखना चाहिए,
16WebGL डेमो नहीं। यदि कोई विवरण वास्तविक जीवन में दिखाई देता है,
17तो इसे मॉडल करें।
18
19पूरी चीज़ बनाएं। मुझे फ़ाइल दिखाएं।

"गुणवत्ता बार" पंक्ति प्रॉम्प्ट में किसी भी अन्य चीज़ से अधिक काम करती है। K3 निर्देशों पर नहीं, बल्कि मानकों पर प्रतिक्रिया करता है।

प्रॉम्प्ट 4 — एक चलने वाले भाग के साथ रीयल-टाइम फीचर

फुल-स्टैक CRUD ऐप का एक आकार है। रीयल-टाइम पूरी तरह से एक अलग आकार है — स्टेट को क्लाइंट के बीच सिंक में रहना होता है, न कि केवल डेटाबेस में बना रहना होता है। यह वह जगह है जहाँ बहुत सारे मॉडल चुपचाप टूट जाते हैं।

text
1मौजूदा ऐप में एक रीयल-टाइम फीचर जोड़ें: Figma जैसी
2लाइव सहयोगी कर्सर + टिप्पणी प्रणाली।
3
4आवश्यकताएँ:
5- WebSocket कनेक्शन (Socket.io या नेटिव ws का उपयोग करें)
6- अन्य कनेक्टेड उपयोगकर्ताओं के कर्सर की स्थिति रीयल टाइम में दिखाएं
7- टिप्पणी पिन छोड़ने के लिए कहीं भी क्लिक करें
8- टिप्पणियाँ सभी कनेक्टेड क्लाइंट के लिए लाइव अपडेट होती हैं
9- डिस्कनेक्ट/रीकनेक्ट को सुचारू रूप से संभालें — कोई भूत कर्सर नहीं
10- कर्सर अपडेट को डीबाउंस करें ताकि यह सॉकेट में बाढ़ न लाए
11
12बिल्ड:
131. WebSocket सर्वर सेट करें
142. ऑटो-रीकनेक्ट के साथ क्लाइंट-साइड कनेक्शन बनाएं
153. डीबाउंसिंग के साथ कर्सर ब्रॉडकास्टिंग लागू करें
164. टिप्पणी पिन सिस्टम लागू करें
175. एक सरल उपस्थिति संकेतक जोड़ें (कौन ऑनलाइन है)
186. सिंक की पुष्टि करने के लिए कम से कम 2 सिम्युलेटेड क्लाइंट के साथ परीक्षण करें
19
20मुझे दिखाएं कि इसे पूरा कहने से पहले आपने मल्टी-क्लाइंट सिंक का परीक्षण कैसे किया।

अपेक्षित परिणाम: 15-30 मिनट में एक काम करने वाली रीयल-टाइम लेयर, जिसमें एक से अधिक क्लाइंट के खिलाफ परीक्षण किए जाने का दृश्य प्रमाण हो।

Kirill - inline image

अंतिम पंक्ति महत्वपूर्ण भाग है। रीयल-टाइम बग एक ब्राउज़र टैब खुला होने पर नहीं दिखते — वे दो खुले होने पर दिखते हैं। एक मॉडल जो मल्टी-क्लाइंट परीक्षण छोड़ता है, वह आपको कोड देगा जो पूरा दिखता है और नहीं है।

जब K3 गलत हो जाता है: समस्या निवारण गाइड

यह वास्तविक खुरदुरे किनारों वाला एक नया मॉडल है। यहाँ बताया गया है कि क्या टूटता है और क्या करना है।

  • समस्या: यह तुच्छ कार्यों पर टोकन जलाता है

यह बड़ी समस्या है, और यह संरचनात्मक है।

K3 वर्तमान में केवल एक रीजनिंग एफर्ट लेवल — 'मैक्स' के साथ शिप करता है। कोई "बस जल्दी से जवाब दो" मोड नहीं है। स्वतंत्र परीक्षकों ने एक साधारण SVG जनरेट करने के लिए 13,241 रीजनिंग टोकन गिने — लगभग $0.25 किसी ऐसी चीज़ के लिए जिसकी लागत एक पैसे के अंश होनी चाहिए।

फिक्स:

सरल काम को K3 पर न भेजें। यह एक गियर वाला फ्रंटियर मॉडल है, और वह गियर "हर चीज़ के बारे में गहराई से सोचो" है। बॉयलरप्लेट, फ़ॉर्मेटिंग और किसी भी यांत्रिक चीज़ के लिए K2.7 या छोटे मॉडल का उपयोग करें। K3 को उस काम के लिए बचाकर रखें जो रीजनिंग को सही ठहराता है।

पहले महीने में लोग यह सबसे बड़ी गलती करेंगे: K3 को हर चीज़ के लिए डिफ़ॉल्ट बनाना और फिर बिल को देखकर हैरान होना।

  • समस्या: कॉन्टेक्स्ट विंडो वैसे भी भर जाती है

1M टोकन अनंत लगता है जब तक आप इसमें एक वास्तविक रेपो नहीं डालते और यह अनंत नहीं होता।

फिक्स:

सब कुछ डंप न करें। इसे उन डायरेक्टरी पर इंगित करें जो मायने रखती हैं। लॉन्ग-होराइज़न काम पर K3 की ताकत निरंतर फोकस से आती है, हर फ़ाइल को कॉन्टेक्स्ट में रखने से नहीं। सही कोड का एक टाइट 200K, पूरे मोनोरेपो के ब्लोटेड 900K से बेहतर है।

  • समस्या: यह बहुत लंबे स्वायत्त रन पर भटक जाता है

20 घंटे का स्वायत्त प्रयोग वास्तविक है, लेकिन यह इसलिए काम करता है क्योंकि उद्देश्य मापने योग्य था — "संख्यात्मक व्यवहार को बदले बिना इसे H200 पर तेज़ बनाएं।" इसे एक अस्पष्ट लक्ष्य और एक लंबी लगाम दें और यह भटक जाएगा।

फिक्स:

हर लॉन्ग-होराइज़न प्रॉम्प्ट को एक सत्यापन योग्य सफलता की स्थिति की आवश्यकता होती है। "कोड में सुधार करें" नहीं। एक संख्या, एक परीक्षण जो पास होता है, एक बेंचमार्क जो चलता है। यदि आप यह नहीं बता सकते कि आप कैसे जांचेंगे कि यह सफल हुआ या नहीं, तो यह भटक जाएगा।

  • समस्या: आप किसी के बेंचमार्क परिणाम को दोबारा नहीं बना सकते

Moonshot के बाहर किसी ने भी इस मॉडल का ऑडिट नहीं किया है। वेट 27 जुलाई तक ड्रॉप नहीं होते हैं। इस समय प्रसारित होने वाला हर नंबर — इस लेख में भी — विक्रेता-रिपोर्ट किया गया है।

फिक्स:

27 जुलाई तक प्रतीक्षा करें, या अपने स्वयं के कार्यों पर परीक्षण करें और उस पर भरोसा करें। आपके पांच वास्तविक कार्य किसी के बेंचमार्क टेबल से अधिक मूल्यवान हैं।

  • समस्या: OpenAI या Anthropic से स्विच करने के बाद एकीकरण त्रुटियाँ

K3 OpenAI SDK संगत है, जो 90% माइग्रेशन को संभालता है। शेष 10% आमतौर पर रीजनिंग व्यवहार है — K3 डिफ़ॉल्ट रूप से सोचता है और रीजनिंग टोकन लौटाता है जिसकी आप अपने प्रतिक्रिया हैंडलिंग में उम्मीद नहीं कर सकते हैं।

फिक्स:

मॉडल के टूटने का अनुमान लगाने से पहले अपने टोकन अकाउंटिंग और अपने प्रतिक्रिया पार्सिंग की जांच करें। अधिकांश "K3 महंगा है" शिकायतें वास्तव में "मैं भूल गया कि रीजनिंग टोकन आउटपुट टोकन हैं" हैं।

वह संदर्भ जिसे किसी को नज़रअंदाज़ नहीं करना चाहिए

Moonshot बीजिंग में स्थित है, जिसकी स्थापना Yang Zhilin ने की है, जो पूर्व Google शोधकर्ता हैं, और Alibaba द्वारा समर्थित है।

https://x.com/kirillk_web3/status/2057528102368977328

उन्होंने उन्नत चिप्स पर अमेरिकी निर्यात नियंत्रणों के बढ़ने के तीन साल के तहत एक 2.8-ट्रिलियन-पैरामीटर फ्रंटियर मॉडल बनाया।

Bank of America के विश्लेषकों ने इसे सीधे तौर पर कहा: "चीन में लगातार हार्डवेयर/कंप्यूट क्षमता की बाधाओं के बावजूद, K3 प्रदर्शित करता है कि प्री-ट्रेनिंग स्केलिंग, आर्किटेक्चरल इनोवेशन के साथ मिलकर, प्रमुख चीनी मॉडलों के लिए अभी भी स्टेप-चेंज गेन दे सकती है।"

और समय आकस्मिक नहीं है: K3 शंघाई में 2026 विश्व कृत्रिम बुद्धिमत्ता सम्मेलन से कुछ दिन पहले आया।

27 जुलाई का प्रश्न

वेट 27 जुलाई को ड्रॉप होते हैं। यह तारीख लॉन्च की तारीख से अधिक मायने रखती है।

तब तक, K3 एक फ्रंटियर मॉडल है जिसका उपयोग आप API के माध्यम से कर सकते हैं — प्रभावशाली।

27 जुलाई को, यह कुछ और बन जाता है: एक फ्रंटियर-क्लास मॉडल जिसे कोई भी डाउनलोड कर सकता है, निरीक्षण कर सकता है, संशोधित कर सकता है और अपने स्वयं के हार्डवेयर पर चला सकता है। कोई API नहीं। कोई उपयोग सीमा नहीं। कोई सेवा की शर्तें नहीं। कोई 30-दिवसीय प्रॉम्प्ट प्रतिधारण नहीं।

यह वास्तविक कहानी है। "चीन ने पकड़ लिया" नहीं।

चीन ने पकड़ लिया और इसे मुफ्त दे दिया।

Kirill - inline image

ध्यान देने योग्य बात: चीनी नियामक अपने स्वयं के AI निर्यात नियंत्रणों पर चर्चा कर रहे हैं। K3 चीन से अंतिम फ्रंटियर ओपन-वेट रिलीज़ है या कई में से पहला, यह अभी स्पष्ट नहीं है।

इसे कैसे आज़माएं

चैट: kimi.com — K3 अब लाइव है

API: OpenAI SDK संगत, इसलिए यदि आप पहले से ही OpenAI या Anthropic टूलचेन पर निर्माण कर रहे हैं, तो एकीकरण एक कॉन्फ़िग परिवर्तन है, पुनर्लेखन नहीं

वेट: 27 जुलाई

SDK संगतता जितना लगता है उससे कहीं अधिक बड़ी बात है। मॉडल बदलने का मतलब आमतौर पर आपकी एकीकरण परत को फिर से लिखना होता है। यहाँ इसका मतलब बेस URL और एक मॉडल स्ट्रिंग को बदलना है।

Kimi Code कैसे स्थापित करें (टर्मिनल एजेंट)

यदि आप K3 को चैट विंडो के बजाय अपने वास्तविक कोडबेस के अंदर चलाना चाहते हैं, तो यह सेटअप है।

Kirill - inline image

आवश्यकताएँ:

  • एक कंप्यूटर (Mac, Windows, या Linux)
  • टर्मिनल एक्सेस
  • Kimi खाता — kimi.com

चरण 1 — Kimi Code स्थापित करें

Mac/Linux:

bash
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash

Windows (PowerShell):

text
1irm https://code.kimi.com/kimi-code/install.ps1 | iex

Windows पर, पहले Git for Windows स्थापित करें — Kimi Code CLI शेल वातावरण के रूप में इसके बंडल Git Bash का उपयोग करता है।

स्थापना सत्यापित करें:

bash
1kimi --version

macOS Gatekeeper के कारण, पहला रन काफी अधिक समय ले सकता है। बाद के लॉन्च को गति देने के लिए अपने टर्मिनल ऐप को System Settings → Privacy & Security → Developer Tools में जोड़ें।

यदि आपने पहले से uv स्थापित किया है, तो आप सीधे स्थापित कर सकते हैं:

bash
1uv tool install --python 3.13 kimi-cli

Kimi Code CLI Python 3.12–3.14 का समर्थन करता है, जिसमें सबसे अच्छी संगतता के लिए 3.13 अनुशंसित है।

चरण 2 — अपने प्रोजेक्ट पर नेविगेट करें और लॉन्च करें

bash
1cd your-project
2kimi

पहले लॉन्च पर, अपने API स्रोत को कॉन्फ़िगर करने के लिए सत्र के अंदर /login चलाएं — यह OAuth के लिए एक ब्राउज़र विंडो खोलता है।

चरण 3 — इसे एक कार्य दें

Kimi Code अब आपके प्रोजेक्ट के अंदर चल रहा है, जिसमें हर फ़ाइल तक सीधी रीड/राइट एक्सेस है। सादे अंग्रेजी में एक कार्य का वर्णन करें — यह चरणों की योजना बनाता है, कोड संपादित करता है, परीक्षण चलाता है, और रिपोर्ट करता है कि उसने क्या किया।

इसका वास्तव में क्या मतलब है

यदि आप उत्पादन वर्कलोड चला रहे हैं:

स्विच करने से पहले इसका परीक्षण करें। विक्रेता बेंचमार्क और वास्तविक दुनिया का प्रदर्शन लगातार विचलन करता है। पांच वास्तविक कार्य चुनें, K3 और अपने वर्तमान मॉडल को साथ-साथ चलाएं, प्रति पूर्ण किए गए कार्य की लागत मापें — प्रति टोकन लागत नहीं।

Kirill - inline image

प्रति-कार्य गणित पूरा तर्क है। $3/$15 पर K3 कागज पर सस्ता नहीं है। 21% कम टोकन और Fable-स्तर के आउटपुट पर, यह वहाँ सस्ता है जहाँ यह मायने रखता है।

27 जुलाई गणित को बदल देता है। ओपन वेट का मतलब है सेल्फ-होस्टिंग, फाइन-ट्यूनिंग, और किसी के API के ऑनलाइन रहने या किसी की शर्तों के अनुकूल रहने पर शून्य निर्भरता। किसी भी संवेदनशील चीज़ के लिए, यह कोई छोटी बात नहीं है।

निष्कर्ष

फ्रंटियर वह जगह हुआ करती थी जहाँ अमेरिकी लैब्स बनाती थीं और बाकी सभी छह महीने बाद विज़िट करते थे।

2.8 ट्रिलियन पैरामीटर। 1M कॉन्टेक्स्ट। Sonnet मूल्य पर Fable 5-स्तर की कोडिंग। निर्यात नियंत्रणों के तहत बनाया गया, कमरे में सबसे कम मूल्य वाली लैब द्वारा, और 27 जुलाई को मुफ्त दे दिया गया।

दिलचस्प सवाल यह नहीं है कि K3 किसी बेंचमार्क पर Fable 5 को हराता है या नहीं। यह है कि बंद फ्रंटियर मॉडल के अर्थशास्त्र का क्या होता है जब एक ओपन-वेट मॉडल उनसे मेल खाता है।

लिंक

अधिक Vibe Coding जानकारी के लिए फॉलो करें। पढ़ने के लिए धन्यवाद!

YouMind में रीमिक्स करें

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें