पेश है INT21 और PTX Kernel Factory

@int21_ai
अंग्रेज़ी16 जून 2026
110K
8
0
0
5

TL;DR

INT21 ने PTX Kernel Factory लॉन्च किया है, जो एक ऐसा AI सिस्टम है जो NVIDIA GPU कर्नल्स के निर्माण और अनुकूलन को स्वचालित करता है, और विशेषज्ञ मानव-लिखित बेसलाइन की तुलना में प्रदर्शन में महत्वपूर्ण वृद्धि प्रदान करता है।

हम आधुनिक AI के अंतर्गत सॉफ्टवेयर के लिए स्व-सुधार करने वाली AI प्रणालियाँ बना रहे हैं। हमारा पहला उत्पाद निम्न-स्तरीय GPU सॉफ्टवेयर तैयार और अनुकूलित करता है, फिर परीक्षणों और बेंचमार्क के साथ अपने काम को सिद्ध करता है।

आज, हम INT21 लॉन्च कर रहे हैं: स्व-सुधार करने वाले AI एजेंट झुंड हासिल करने वाली पहली कंपनी, जिसे AI बुनियादी ढांचे पर लागू किया गया है।

वह परत जो ज्यादातर लोग नहीं देखते

AI प्रगति के बारे में अधिकांश चर्चाएँ मॉडलों पर केंद्रित होती हैं। लेकिन हर मॉडल एक कम दिखाई देने वाली परत पर निर्भर करता है: वह सॉफ्टवेयर जो GPU को बताता है कि प्रत्येक ऑपरेशन कैसे करना है।

उस सॉफ्टवेयर का गति और लागत पर बहुत बड़ा प्रभाव पड़ता है। इसे बनाना भी कठिन है। नए GPU पर सर्वश्रेष्ठ प्रदर्शन तक पहुँचने के लिए अक्सर ऐसे विशेषज्ञों की आवश्यकता होती है जो एल्गोरिदम और हार्डवेयर दोनों को असाधारण गहराई से समझते हों।

INT21 इस काम को और अधिक स्केलेबल बनाने के लिए मौजूद है। हम इस नई श्रेणी को स्व-सुधार करने वाला कंप्यूट बुनियादी ढांचा कहते हैं।

हमारा पहला उत्पाद: PTX Kernel Factory

PTX Kernel Factory एक AI प्रणाली है जो NVIDIA GPU के लिए सॉफ्टवेयर तैयार और बेहतर बनाती है। एक टीम ऑपरेशन, आवश्यकताओं और सफलता के मापदंड को परिभाषित करती है। फैक्ट्री एक कार्यान्वयन लिखती है, उसका परीक्षण करती है, लक्ष्य हार्डवेयर पर मापती है, परिणाम से सीखती है, और दोहराती है।

PTX Kernel Factory द्वारा तैयार किए गए पहले चार कार्यान्वयन आज ओपन सोर्स हैं। उत्पाद बीटा में भी प्रवेश कर रहा है, जिसमें int21.ai पर प्रारंभिक पहुँच उपलब्ध है।

NVIDIA GPU पर चलने वाले AI वर्कलोड के लिए, प्रत्येक मॉडल ऑपरेशन अंततः हार्डवेयर द्वारा निष्पादित निर्देश बन जाता है। GPU कर्नेल एक छोटा, विशिष्ट प्रोग्राम है जो एक ऐसे ऑपरेशन के लिए जिम्मेदार होता है, जैसे नॉर्मलाइज़ेशन, अटेंशन, या मेमोरी के माध्यम से डेटा ले जाना। हजारों ऐसे कर्नेल हर ट्रेनिंग जॉब और AI एप्लिकेशन के नीचे चलते हैं।

PTX NVIDIA की निम्न-स्तरीय, असेंबली-जैसी GPU भाषा है। यह उच्च-स्तरीय GPU सॉफ्टवेयर और हार्डवेयर द्वारा निष्पादित अंतिम मशीन निर्देशों के बीच बैठती है, जो इसे NVIDIA स्टैक में सबसे करीबी प्रोग्रामेबल परतों में से एक बनाती है।

इस स्तर पर काम करने से डेटा के मेमोरी में चलने, थ्रेड्स के सहयोग करने, काम के सिंक्रोनाइज़ होने, और किस विशेष GPU निर्देशों का उपयोग करने पर सटीक नियंत्रण मिलता है। वे विकल्प यह निर्धारित कर सकते हैं कि कोई महंगा GPU अपना समय काम करने में बिताता है या प्रतीक्षा करने में।

बहुत कम इंजीनियर PTX को अच्छी तरह लिख और अनुकूलित कर सकते हैं। इस कार्य में एल्गोरिदम ज्ञान, GPU आर्किटेक्चर विशेषज्ञता, संख्यात्मक कठोरता, और प्रदर्शन अंतर्ज्ञान का एक दुर्लभ संयोजन आवश्यक है। उच्च-स्तरीय उपकरण, लाइब्रेरी और कंपाइलर GPU विकास को और अधिक लोगों के लिए सुलभ बनाते हैं, लेकिन जब किसी नए AI ऑपरेशन का कोई परिपक्व कार्यान्वयन नहीं होता है, या जब मौजूदा अब्स्ट्रक्शन आवश्यक प्रदर्शन तक नहीं पहुँच सकते हैं, तो यह दुर्लभ निम्न-स्तरीय विशेषज्ञता एक बाधा बन जाती है।

यह असाधारण रूप से कठिन भी है। एक कर्नेल सही दिख सकता है लेकिन एक दुर्लभ इनपुट पर विफल हो सकता है। यह एक आकार के लिए तेज़ और दूसरे के लिए धीमा हो सकता है। यह बहुत अधिक रजिस्टरों का उपयोग कर सकता है, बहुत अधिक डेटा स्थानांतरित कर सकता है, या Hopper पर अच्छा प्रदर्शन कर सकता है और Blackwell पर पीछे हट सकता है। विशेषज्ञ इंजीनियरों को भी कई विचारों का परीक्षण करना होता है, और उनमें से अधिकांश काम नहीं करते। प्रत्येक हार्डवेयर पीढ़ी समस्या के हिस्से को बदल देती है।

यह संयोजन PTX को INT21 के लिए एक आदर्श पहला परीक्षण स्थल बनाता है: यह तकनीकी रूप से मांग वाला, आर्थिक रूप से महत्वपूर्ण और वस्तुनिष्ठ रूप से मापने योग्य है। एक उत्पन्न कर्नेल सही है या नहीं। यह तेज़ है या नहीं।

PTX Kernel Factory निम्न-स्तरीय GPU कोड लिखने, परीक्षण करने, प्रोफाइल करने और संशोधित करने के विशेषज्ञ लूप को एक ऐसी प्रक्रिया में बदल देता है जो लगातार चल सकती है और अपने परिणामों से सीख सकती है।

PTX Kernel Factory कैसे काम करता है

इंटरफ़ेस जानबूझकर सरल है:

  1. ऑपरेशन का वर्णन करें। परिभाषित करें कि कर्नेल को क्या करने की आवश्यकता है और इसे किन इनपुट का समर्थन करना चाहिए।
  2. आवश्यकताएँ निर्धारित करें। सहीता परीक्षण, लक्ष्य हार्डवेयर और कोई भी एकीकरण बाधाएँ प्रदान करें।
  3. सफलता को परिभाषित करें। वह प्रदर्शन मीट्रिक चुनें जिसे सिस्टम को अनुकूलित करना चाहिए।

वहाँ से, फैक्ट्री एक लंबी अवधि की इंजीनियरिंग प्रक्रिया चलाती है। यह उम्मीदवार कार्यान्वयन उत्पन्न करती है, उन्हें संकलित करती है, गलत परिणामों को अस्वीकार करती है, वैध उम्मीदवारों को बेंचमार्क करती है, और अगले दौर का मार्गदर्शन करने के लिए साक्ष्य का उपयोग करती है।

जारी किए गए कार्यान्वयन इनलाइन PTX के साथ CUDA C++ को जोड़ते हैं, जो सिस्टम को हार्डवेयर विवरणों पर नियंत्रण देता है जिन्हें उच्च-स्तरीय उपकरण जानबूझकर छिपा सकते हैं। एक एकल एजेंट पर एक बार का उत्तर उत्पन्न करने पर निर्भर रहने के बजाय, PTX Kernel Factory इस लूप में कई AI एजेंटों का समन्वय करता है।

मानव इंजीनियर अभी भी लक्ष्य, बाधाओं और स्वीकृति मानदंडों को परिभाषित करते हैं। PTX Kernel Factory एक स्पष्ट विनिर्देश और एक मजबूत कार्यान्वयन के बीच महंगी खोज को स्वचालित करता है।

स्व-सुधार से हमारा क्या मतलब है

एक कोडिंग एजेंट एक उत्तर उत्पन्न कर सकता है। एक विश्वसनीय इंजीनियरिंग सिस्टम को यह भी निर्धारित करने की आवश्यकता है कि उत्तर काम करता है या नहीं, समझें कि एक प्रयास क्यों विफल हुआ, और अगले प्रयास में उपयोगी ज्ञान ले जाए।

हमारा इसी से मतलब है स्व-सुधार से।

इस क्षेत्र में अधिकांश प्रयास AI को स्वयं स्व-सुधार करने पर केंद्रित हैं। हम एक मौलिक रूप से भिन्न मार्ग अपना रहे हैं, जहाँ एजेंट झुंड स्वयं उस बुनियादी ढांचे को स्व-सुधारते हैं जिस पर वे चलते हैं, मानव नियंत्रण बनाए रखते हुए और प्रत्येक उत्पादन चक्र के साथ प्रदर्शन को बढ़ाते हैं।

चुनौती एक संभावित कर्नेल उत्पन्न करने से कम है, और एक ऐसी प्रणाली बनाने से अधिक है जो हजारों गलत, नाजुक या भ्रामक प्रयासों को अस्वीकार कर सके, उन कुछ पाठों को संरक्षित कर सके जो मायने रखते हैं, और सहीता से दूर हटे बिना सुधार करता रहे।

PTX Kernel Factory हर पीढ़ी को एक ताजा प्रॉम्प्ट के रूप में नहीं मानता। यह सफल और असफल प्रयोगों से उपयोगी खोजों को संरक्षित करता है, जिससे बाद का काम पहले के साक्ष्य पर निर्माण कर सके। लक्ष्य उस प्रक्रिया में सुधार करना है जो कोड का उत्पादन करती है।

इस तरह फैक्ट्री का प्रदर्शन समय के साथ बढ़ता है। प्रत्येक पीढ़ी इस बारे में अधिक साक्ष्य के साथ शुरू होती है कि क्या काम करता है, क्या विफल होता है, और कौन सी दिशाएँ तलाशने लायक हैं।

हमारी व्यापक थीसिस है:

कंप्यूट का उपयोग करके कंप्यूट में सुधार करें।

बुद्धिमत्ता केवल वह नहीं है जो एक मॉडल जानता है। यह खोजने, परीक्षण करने, याद रखने, सुधारने और बेहतर बनाने की क्षमता है। हमारा मानना है कि जो प्रणालियाँ उन क्षमताओं को संचयी बनाती हैं, वे भविष्य के कंप्यूट बुनियादी ढांचे और AI में व्यापक स्व-सुधार विकास का एक महत्वपूर्ण हिस्सा बन जाएँगी।

हमारा पहला प्रमाण: दो बहुत अलग AI वर्कलोड

पहली सार्वजनिक रिलीज़ के लिए, हमने दो वर्कलोड चुने जो विभिन्न क्षमताओं का परीक्षण करते हैं।

RMSNorm एक सामान्य ऑपरेशन है जो आधुनिक भाषा मॉडल में उपयोग किया जाता है। यह परिपक्व है, व्यापक रूप से समझा जाता है, और पहले से ही मजबूत मानव-लिखित कार्यान्वयन हैं। यह परीक्षण करता है कि क्या फैक्ट्री स्थापित कार्य पर प्रतिस्पर्धा कर सकती है।

Kimi Delta Attention (KDA) एक नया अटेंशन मैकेनिज्म है। यह अधिक विशिष्ट है और इसमें कम स्थापित कार्यान्वयन पैटर्न हैं। यह परीक्षण करता है कि क्या फैक्ट्री एक नए शोध वर्कलोड के लिए जल्दी से अनुकूलित हो सकती है।

हमने उत्पन्न कार्यान्वयन की तुलना अच्छी तरह से अनुकूलित मानव-निर्मित बेसलाइन से की: RMSNorm के लिए QuACK और KDA के लिए CUTLASS-आधारित FlashKDA कार्यान्वयन। तुलनाएँ समान हार्डवेयर पर सहीता जाँच के बाद और समय मापन से पहले चलाई गईं।

बेंचमार्क हाइलाइट्स

वर्कलोड

हार्डवेयर

विशेषज्ञ बेसलाइन के विरुद्ध परिणाम

KDA

NVIDIA GH200, Hopper

छह निश्चित- और परिवर्तनीय-लंबाई परिदृश्यों में 1.24x से 1.59x तेज़

KDA

NVIDIA B200, Blackwell

मानक सार्वजनिक इंटरफ़ेस के माध्यम से 1.42x तेज़, और अनुकूलित एकीकरण में 1.52x तेज़

RMSNorm

NVIDIA GH200, Hopper

एक सामान्य 16-बिट AI प्रारूप का उपयोग करके 11 फॉरवर्ड मामलों में ज्यामितीय माध्य पर 8.17% तेज़; चयनित बैकवर्ड तुलनाओं में 15% से 34% तेज़

RMSNorm

NVIDIA B200, Blackwell

पूर्ण डिफ़ॉल्ट बेंचमार्क मैट्रिक्स में सभी 126 तुलनीय मामलों में तेज़

ये ऑपरेटर-स्तरीय बेंचमार्क परिणाम हैं, पूर्ण-मॉडल गति में वृद्धि के दावे नहीं। किसी एप्लिकेशन पर प्रभाव उसके मॉडल, वर्कलोड, आकृतियों, सॉफ्टवेयर स्टैक और अनुकूलित ऑपरेशन में बिताए गए कुल समय पर निर्भर करता है।

हम कम अनुकूल परिणाम भी रिपोर्ट करते हैं। Hopper RMSNorm मैट्रिक्स में, दो अन्य संख्या प्रारूपों में छोटी गिरावटें शामिल थीं; सबसे धीमे मामले QuACK से 0.42% और 0.84% पीछे थे। हम एक एकल अनुकूल संख्या के पीछे छिपाने के बजाय परिणाम की सीमा प्रकाशित करना पसंद करेंगे।

सहीता गति से पहले आती है

एक तेज़ कर्नेल बेकार है यदि वह परिणाम बदलता है या वास्तविक इनपुट पर विफल होता है।

इसलिए प्रत्येक प्रदर्शन तुलना सहीता से शुरू होती है:

  • B200 KDA कार्यान्वयन ने सभी 580 अपस्ट्रीम परीक्षण पास किए।
  • Hopper KDA कार्यान्वयन ने मान्य GH200 सिस्टम पर 584 अपस्ट्रीम परीक्षण और 235 पैकेज परीक्षण पास किए।
  • RMSNorm कार्यान्वयन ने मान्य हार्डवेयर पर अपने पूर्ण पैकेज सूट पास किए: GH200 पर 48 परीक्षण प्लस 65 उप-परीक्षण और B200 पर 66 परीक्षण।

सूट विभिन्न डेटा प्रकारों, इनपुट आकारों, निश्चित और परिवर्तनीय-लंबाई अनुक्रमों, वैकल्पिक स्थिति, फॉरवर्ड और बैकवर्ड पथ (जहाँ समर्थित) और कठिन किनारे के मामलों को कवर करते हैं।

बेंचमार्क अभी भी पर्यावरण-विशिष्ट हो सकते हैं, इसलिए प्रत्येक रिपॉजिटरी में परिणामों का निरीक्षण और पुनरुत्पादन करने के लिए आवश्यक स्रोत, परीक्षण कमांड, मापन विधि, सॉफ्टवेयर संस्करण और कच्ची या उत्पन्न रिपोर्ट शामिल हैं।

यहाँ से शुरू क्यों करें

GPU कर्नेल हमारे दृष्टिकोण के लिए एक उपयोगी पहला परीक्षण हैं क्योंकि प्रतिक्रिया निर्दयी है।

आउटपुट सही है या नहीं। कार्यान्वयन तेज़ है या नहीं। एक परिवर्तन को संकलित, परीक्षण और मापा जा सकता है। प्रगति साक्ष्य पर आधारित होती है, न कि उत्पन्न पाठ कितना ठोस लगता है, इससे आंकी जाती है।

कर्नेल ऑप्टिमाइज़ेशन एक महत्वपूर्ण बाधा पर भी बैठता है। AI मॉडल तेज़ी से विकसित हो रहे हैं, हार्डवेयर हर पीढ़ी में बदल रहा है, और निम्न-स्तरीय ऑप्टिमाइज़ेशन विशेषज्ञता की आपूर्ति उसी दर से नहीं बढ़ सकती है।

इस काम को एक दोहराने योग्य प्रणाली में बदलने से टीमों को मदद मिल सकती है:

  • नए मॉडल ऑपरेशन को तेज़ी से उत्पादन में लाना।
  • नई GPU पीढ़ियों का बेहतर उपयोग करना।
  • ऑप्टिमाइज़ेशन विचारों का पता लगाना जो मैन्युअल रूप से परीक्षण करने के लिए बहुत महंगे होंगे।
  • आर्किटेक्चर, आवश्यकताओं और सिस्टम-स्तरीय निर्णयों के लिए विशेषज्ञ समय को आरक्षित करना।

यह इंजीनियरों को हटाने के बारे में नहीं है। यह कुछ विशेषज्ञों को अधिक लाभ देने के बारे में है।

पहले चार फैक्ट्री आर्टिफैक्ट को ओपन-सोर्स करना

आज, हम जारी कर रहे हैं:

  • Int21-AI/KDA-B200: Blackwell के लिए Kimi Delta Attention, NVIDIA B200 पर मान्य।
  • Int21-AI/KDA-H100: Hopper के लिए Kimi Delta Attention, NVIDIA GH200 पर मान्य।
  • Int21-AI/RMSNorm-B200: Blackwell के लिए RMSNorm, NVIDIA B200 पर मान्य।
  • Int21-AI/RMSNorm-H100: Hopper के लिए RMSNorm, NVIDIA GH200 पर मान्य।

हम कोड प्रकाशित कर रहे हैं क्योंकि प्रदर्शन के दावे निरीक्षण योग्य होने चाहिए। डेवलपर्स को कार्यान्वयन पढ़ने, परीक्षण चलाने, बेंचमार्क को पुनरुत्पादित करने और परिणामों को चुनौती देने में सक्षम होना चाहिए।

ये रिलीज़ अंतिम उत्पाद नहीं हैं। वे पहला सार्वजनिक साक्ष्य हैं कि फैक्ट्री स्थापित और उभरते दोनों वर्कलोड और NVIDIA हार्डवेयर की दो पीढ़ियों में उपयोगी निम्न-स्तरीय सॉफ्टवेयर का उत्पादन कर सकती है।

हमारे बारे में

INT21 की स्थापना Bing Xu ने अप्रैल 2026 में एक AI-नेटिव कंपनी के रूप में की थी, जो एक सरल विचार पर बनी है: कंपनी की अपनी इंजीनियरिंग क्षमता को कंप्यूट के साथ बढ़ना चाहिए।

Bing मूल Generative Adversarial Nets पेपर के सह-लेखक, XGBoost के पायथन पैकेज के मूल निर्माता, और MXNet और AITemplate के सह-निर्माता थे।

फरवरी 2025 में, उन्होंने एजेंटिक GPU कर्नेल जनरेशन पर NVIDIA के प्रारंभिक कार्य का सह-लेखन किया, जिसमें अटेंशन कर्नेल उत्पन्न और अनुकूलित करने के लिए एक रीज़निंग मॉडल और इन्फरेंस-टाइम स्केलिंग का उपयोग किया गया। INT21 से पहले, Bing NVIDIA में एक विशिष्ट इंजीनियर थे। वे NVIDIA में तब शामिल हुए जब उसने HippoML का अधिग्रहण किया, जो GPU इन्फरेंस स्टार्टअप था जिसकी उन्होंने सह-स्थापना की और CEO के रूप में नेतृत्व किया।

कंप्यूट का एक नया युग

PTX Kernel Factory अब AI मॉडल, इन्फरेंस सिस्टम, ट्रेनिंग प्लेटफ़ॉर्म और अन्य GPU-गहन उत्पाद बनाने वाली टीमों के लिए बीटा में है।

शुरुआती बिंदु एक ऑपरेशन हो सकता है जो बहुत धीमा है, एक नया आर्किटेक्चर जिसमें परिपक्व कर्नेल नहीं है, या एक महत्वपूर्ण वर्कलोड जिसने विशेषज्ञ के हफ्तों के समय को उचित नहीं ठहराया है। टीम समस्या और सफलता की परिभाषा प्रदान करती है। फैक्ट्री खोज का कार्यभार संभालती है।

PTX Kernel Factory INT21 के लिए, और अधिक व्यापक रूप से उद्योग के लिए, एक बड़ी दिशा में पहला कदम भी है।

अधिकांश कंप्यूट बुनियादी ढांचा आज स्थिर है: लोग इसे लिखते हैं, अनुकूलित करते हैं, और जब आवश्यकताएँ या हार्डवेयर बदलते हैं तो इस पर पुनर्विचार करते हैं। AI सिस्टम प्रभावशाली आउटपुट उत्पन्न कर सकते हैं, लेकिन उन्हें उत्पादन में, पैमाने पर, विश्वसनीय रूप से तैनात करना काफी हद तक अनसुलझा है।

हमारा मानना है कि उस बुनियादी ढांचे का अधिक हिस्सा अनुकूली बन जाएगा। यह अपने काम का परीक्षण करेगा, जो सीखता है उसे संरक्षित करेगा, और अगली समस्या को हल करने का तरीका सुधारेगा।

हम स्टैक की सबसे कठिन, सबसे मापने योग्य परतों में से एक से शुरू कर रहे हैं। मानव ज्ञान स्केल नहीं होता, लेकिन एजेंट झुंड हर रन के साथ बेहतर होते रह सकते हैं। स्व-सुधार करने वाला कंप्यूट बुनियादी ढांचा AI के निर्माण के तरीके में एक मौलिक बदलाव है।

कर्नेल का वर्णन करें। सफलता को परिभाषित करें। फैक्ट्री को कार्यान्वयन में सुधार करने दें।

और अधिक जानें और प्रारंभिक पहुँच का अनुरोध करें।

एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें