यह यांग ज़िलिन के साथ मेरा पहला साक्षात्कार था, जो 2024 की शुरुआत में आयोजित किया गया था और 1 मार्च, 2024 को प्रकाशित हुआ—ठीक किमी की स्थापना की पहली वर्षगांठ पर। उस समय, किमी में केवल 80 लोग थे, जो अपने पहले, कुछ हद तक जर्जर कार्यालय में काम कर रहे थे। प्रवेश द्वार पर कोई लोगो नहीं था। केवल एक सफेद पियानो दरवाजे पर पहरा दे रहा था।
इस लेख ने उस समय चीन के तकनीकी समुदाय में काफी हलचल मचा दी थी।
उस समय, मैं अभी भी एक प्रिंट पत्रकार था, इसलिए यह साक्षात्कार केवल टेक्स्ट और एक ऑडियो पॉडकास्ट के रूप में मौजूद है।
जैसा कि हम देख सकते हैं, इस लेख में व्यक्त किए गए कई विचार तब से सच साबित हुए हैं।
दो साल पहले के इन शब्दों को फिर से पढ़कर, आप वास्तव में यह सोचने से खुद को नहीं रोक सकते कि दुनिया कितनी नाटकीय रूप से बदल गई है!
(यह अनुवाद Kimi K3 द्वारा तैयार किया गया था।)
यांग ज़िलिन: "अगर हर कोई सोचता है कि तुम सामान्य हो—अगर तुम्हारा सपना ऐसा है जो किसी के भी पास हो सकता है—तो इससे मानवता के सपनों के कुल योग में कुछ नहीं जुड़ता।"
लेखक: झांग शियाओजुन
ठीक एक साल पहले, AI वैज्ञानिक यांग ज़िलिन ने सिलिकॉन वैली में एक सटीक गणना की। उन्होंने महसूस किया कि अगर वह AGI के उद्देश्य से एक फाउंडेशन-मॉडल स्टार्टअप शुरू करने का फैसला करते हैं, तो उन्हें अगले कुछ महीनों में $100 मिलियन से अधिक जुटाने की आवश्यकता होगी।
फिर भी वह केवल खेल में प्रवेश का टिकट था। एक साल बाद, यह आंकड़ा तेरह गुना बढ़ गया था।
फाउंडेशन-मॉडल कंपनियों के लिए, प्रतिस्पर्धा एक वैज्ञानिक प्रतियोगिता से कम और सबसे पहले, पैसे की एक क्रूर प्रतियोगिता है। निवेशक अपनी पर्स की डोर कसकर पकड़े हुए हैं, आपको अधिक पैसा जुटाने, अधिक GPU खरीदने और अधिक प्रतिभा हथियाने में अपने प्रतिद्वंद्वियों से आगे रहना होगा।
"इसके लिए प्रतिभा की एकाग्रता और पूंजी की एकाग्रता की आवश्यकता होती है," यांग ज़िलिन कहते हैं, जो Moonshot AI के संस्थापक और CEO हैं, जो 1 मार्च, 2023 को स्थापित एक फाउंडेशन-मॉडल कंपनी है।
पिछले एक साल में, चीनी फाउंडेशन-मॉडल कंपनियां एक तनावपूर्ण, संकुचित अस्तित्व के किनारे पर जीती हुई प्रतीत हुई हैं। सतह पर, उनमें से प्रत्येक के पास भारी मात्रा में नकदी है। लेकिन एक तरफ, उन्हें नए जुटाए गए पैसे को तुरंत अत्यधिक महंगे शोध में लगाना होगा ताकि OpenAI का पीछा किया जा सके—पहले GPT-3.5 को पकड़ना, और GPT-4 तक पहुंचने से पहले ही, Sora आ जाता है। दूसरी तरफ, उन्हें व्यवहार्य वास्तविक दुनिया के उपयोग के मामलों को खोजने के लिए लगातार दौड़ लगानी होगी, ताकि खुद को यह सत्यापित कर सकें कि वे कंपनियां हैं, न कि केवल पूंजी को निगलने वाले शोध संस्थान। और यह पर्याप्त नहीं है: इनमें से प्रत्येक उद्यम के लिए, चाहे निकास IPO हो या अधिग्रहण, बाहर निकलने का रास्ता अभी भी स्पष्ट नहीं है।
चीन की फाउंडेशन-मॉडल कंपनियों के संस्थापकों में, यांग ज़िलिन सबसे कम उम्र के हैं, जिनका जन्म 1992 में हुआ था। उद्योग उन्हें एक कट्टर AGI आस्तिक और दुर्लभ तकनीकी करिश्मा वाले संस्थापक के रूप में वर्णित करता है। उनके अकादमिक और पेशेवर रिकॉर्ड का अधिकांश हिस्सा सामान्य-उद्देश्यीय AI से जुड़ा है, और उनके पेपरों को 22,000 से अधिक बार उद्धृत किया गया है।
2023 के मध्य में, चीन का तकनीकी समुदाय फाउंडेशन मॉडलों पर उत्साह से ठंडक की ओर अचानक मुड़ गया, और वास्तविक दुनिया में तैनाती में तेजी लाना व्यावहारिक मुख्यधारा की धुन बन गया। इसने अनिवार्य रूप से फाउंडेशन-मॉडल CEOs को आदर्श और वास्तविकता के बीच बुरी तरह से फाड़ दिया। एक चीनी AI पारिस्थितिकी तंत्र में जहां हर कोई PMF (उत्पाद/बाजार फिट) का जाप करता है और हर कोई व्यावसायीकरण का जाप करता है, यह संस्थापक—जो प्रशिक्षण से एक AI शोधकर्ता है—कोई विशेष जल्दी में नहीं है।
80 लोगों के साथ, Moonshot AI के पास चीन की अग्रणी फाउंडेशन-मॉडल कंपनियों में सबसे छोटा कर्मचारी आकार है। अपने प्रतिद्वंद्वियों के विपरीत, यांग ने सुरक्षित B2B व्यवसाय या स्वास्थ्य सेवा या गेमिंग जैसे क्षेत्रों में तैनाती का विकल्प नहीं चुना। उन्होंने एक—और केवल एक—उपभोक्ता उत्पाद बनाया: AI सहायक Kimi, जो 200,000 चीनी वर्णों तक के इनपुट स्वीकार करता है। Kimi यांग ज़िलिन का अंग्रेजी नाम भी है।
यांग अपनी कंपनी को एक ऐसी प्रणाली के रूप में देखना पसंद करते हैं जो विज्ञान, इंजीनियरिंग और व्यवसाय को जोड़ती है। आप इसे इस तरह चित्रित कर सकते हैं: मानव दुनिया के ऊपर, वह एक AI प्रयोगशाला बेंच खड़ा कर रहा है—एक हाथ से वह प्रयोग चलाता है, और दूसरे हाथ से वह अत्याधुनिक तकनीक को वास्तविक दुनिया में लाता है, लोगों के साथ बातचीत के माध्यम से अनुप्रयोगों की खोज करता है और उन अनुप्रयोगों को उपभोक्ताओं के हाथों में पहुंचाता है। आदर्श रूप से, पूर्व अरबों और दसियों अरबों डॉलर की पूंजी जलाता है; बाद वाला उस पैसे को सैकड़ों या हजारों गुना वापस कमाता है। आप इसे जैसे भी सुनें, यह उतना ही रोमांचक—और उतना ही खतरनाक—लगता है जितना कि एक रस्सी पर चलना।
"AI इस बारे में नहीं है कि मुझे अगले एक या दो साल में कौन सा PMF मिल सकता है; यह इस बारे में है कि अगले दस से बीस वर्षों में दुनिया को कैसे बदला जाए," वे कहते हैं।
इस तरह की अमूर्त, आदर्शवादी सोच उनकी ओर से कोई भी घबराहट महसूस करता है: क्या एक युवा AI वैज्ञानिक एक यथार्थवादी चीन में जीवित रहने के लिए जगह बना सकता है?
फरवरी 2024 में, Moonshot AI ने बाजार की धारा के विपरीत एक बड़ा फंडिंग राउंड बंद किया। यह समझा जाता है कि कंपनी ने $1.5 बिलियन के प्री-मनी वैल्यूएशन पर $1 बिलियन से अधिक की सीरीज़ B जुटाई, जिसका नेतृत्व Alibaba ने किया और Monolith Management, Xiaohongshu और अन्य ने अनुवर्ती भागीदारी की। सौदे के पूरा होने पर, Moonshot AI का पोस्ट-मनी वैल्यूएशन लगभग $2.5 बिलियन था—जो इसे, इस स्तर पर, चीन की फाउंडेशन-मॉडल दौड़ में सबसे अधिक मूल्य वाला यूनिकॉर्न बनाता है। (कंपनी ने इस मामले पर प्रतिक्रिया देने या टिप्पणी करने से इनकार कर दिया।)
इस तीसरे फंडिंग राउंड के बीच, हमने उद्यमिता के अपने पहले वर्ष के बारे में बात करने के लिए यांग ज़िलिन के साथ बैठक की—एक लघु रूप में, एक वर्ष का एक क्रॉस-सेक्शन जिसमें चीनी फाउंडेशन-मॉडल कंपनियां शुरुआती रेखा से आगे दौड़ रही थीं।
उनकी कंपनी ने बीजिंग में Sohu Network Plaza में स्थापित नहीं किया, जो फाउंडेशन-मॉडल कंपनियों के क्लस्टर का केंद्र है। लगभग RMB 9 बिलियन के कुल फंडिंग वाली कंपनी के लिए, Liangzi Xinzuo बिल्डिंग में यह कार्यालय कच्चा और जर्जर दिखता है। प्रवेश द्वार पर कंपनी का कोई लोगो भी नहीं है—केवल एक सफेद पियानो दरवाजे पर पहरा दे रहा है।
मीटिंग रूम एक कोने में है; इसकी छोटी खिड़कियों के साथ अंदर अंधेरा है, और हीटर सर्दी की ठंड के खिलाफ गर्म हवा उड़ाते हुए गुनगुनाता है। मंद रोशनी में, यांग वर्णन करता है कि पिछला साल उसे कैसा लगा: "यह थोड़ा उस सड़क पर गाड़ी चलाने जैसा है जहां आगे बर्फ के पहाड़ों की एक श्रृंखला फैली हुई है। तुम नहीं जानते कि उनके अंदर क्या है। तुम बस आगे बढ़ते रहते हो, एक कदम एक बार में।"
नीचे यांग ज़िलिन के साथ पूरा साक्षात्कार है। (पठनीयता के लिए, लेखक ने कुछ पाठ्य संपादन किए हैं।)

यह तस्वीर 2024 की शुरुआत में बीजिंग में किमी के पहले कार्यालय में ली गई थी। वे अब इस स्थान से बाहर चले गए हैं। प्रवेश द्वार पर कोई लोगो नहीं थे—केवल एक सफेद पियानो चुपचाप दरवाजे के पास खड़ा था।
**
भाग 1
शुरुआत में खड़े होना
"आपको लहर की सवारी करनी होगी"
**
झांग शियाओजुन: आप हाल ही में कैसे हैं?
यांग ज़िलिन: व्यस्त—बहुत कुछ चल रहा है। लेकिन मैं अभी भी उत्साहित हूं। हम एक उद्योग की बिल्कुल शुरुआत में खड़े हैं, और कल्पना के लिए बहुत बड़ी गुंजाइश है।
झांग शियाओजुन: जब मैं अभी अंदर आया, तो मैंने आपकी कंपनी के प्रवेश द्वार पर एक शुद्ध सफेद पियानो देखा।
यांग ज़िलिन: उस पर एक Pink Floyd एल्बम भी रखा है। मुझे नहीं पता कि उन्हें वहां किसने रखा—मैंने कुछ दिन पहले अचानक उन्हें देखा और मुझे पूछने का मौका नहीं मिला। (Pink Floyd ब्रिटिश रॉक बैंड है जिसने एल्बम The Dark Side of the Moon जारी किया था।)
झांग शियाओजुन: जिस दिन नवंबर 2022 में ChatGPT जारी किया गया था, उस दिन आप क्या कर रहे थे?
यांग ज़िलिन: मैं पहले से ही इसकी तैयारी कर रहा था—लोगों की भर्ती करना, एक टीम बनाना, नए विचारों का आदान-प्रदान करना। ChatGPT को देखना रोमांचक था। तीन से पांच साल पहले—यहां तक कि 2021 में भी—यह अकल्पनीय होता। उस तरह का उच्च-क्रम तर्क हासिल करना बहुत मुश्किल था।
मैंने महसूस किया कि बाजार में कई चर बदलने वाले थे: एक तरफ पूंजी, दूसरी तरफ प्रतिभा—AI के लिए उत्पादन के मुख्य कारक। अगर वे चर जगह पर आ गए, तो इसे करने के लिए एक उचित कंपनी बनाना संभव हो जाएगा—एक संगठन जो AGI के लिए बनाया गया है, 0 से 1 तक जा सकता है। यह एक बड़ी अंतर्दृष्टि थी। एक स्वतंत्र कंपनी अधिक समझ में आती थी, लेकिन यह ऐसा कुछ नहीं था जो आप तुरंत कर सकते थे जब आप चाहते थे; ChatGPT ने चरों को झटका दिया और उत्पादन के कारकों को एक साथ लाया। आपको लहर की सवारी करनी होगी।
झांग शियाओजुन: एक AGI कंपनी की स्थापना का फैसला करने के बाद, आपने क्या तैयारियां कीं? आपने उत्पादन के दो कारकों—पूंजी और प्रतिभा—को कैसे इकट्ठा किया?
यांग ज़िलिन: यह एक घुमावदार प्रक्रिया थी। ChatGPT को फैलने में समय लगा। कुछ लोगों ने इसके बारे में जल्दी सीखा, कुछ ने देर से; कुछ ने पहले संदेह किया, फिर हैरान हुए, फिर विश्वासी बन गए। लोगों और पैसे को ढूंढना समय के साथ कसकर बंधा हुआ था।
हमने फरवरी 2023 में अपने पहले फंडिंग राउंड पर ध्यान केंद्रित करना शुरू किया। अगर हमने अप्रैल तक देरी कर दी होती, तो मूल रूप से हमारे पास कोई मौका नहीं होता। लेकिन दिसंबर 2022 या जनवरी 2023 में करना भी काम नहीं करता—महामारी अभी भी चल रही थी, और लोगों ने अभी तक इसे संसाधित नहीं किया था। तो असली विंडो सिर्फ एक महीना था।
एक रात संयुक्त राज्य अमेरिका में, मैंने एक सटीक गणना की। जब मैंने समाप्त किया, तो मैंने निष्कर्ष निकाला कि हमें कुछ महीनों के भीतर कम से कम $100 मिलियन जुटाने की आवश्यकता है। बाजार में कई लोगों ने फंडरेज़िंग शुरू नहीं की थी, और कई लोगों को विश्वास नहीं था कि आप जरूरी इतना जुटा सकते हैं। लेकिन यह संभव साबित हुआ—उससे भी अधिक।
प्रतिभा बाजार भी हिलना शुरू हो गया। ChatGPT से प्रेरित होकर, कई लोगों को मार्च या अप्रैल 2023 में यह अहसास हुआ: यह एकमात्र चीज है जो अगले दशक में करने लायक है। आपको सही समय पर सही लोगों तक पहुंचना होगा। एक या दो साल पहले, प्रतिभा इस हद तक क्लस्टर नहीं होती। उस समय, अधिक लोग पारंपरिक AI या AI-संबंधित व्यवसाय कर रहे थे—इनमें से कोई भी सामान्य-उद्देश्यीय AI नहीं था।
झांग शियाओजुन: संक्षेप में: फरवरी फंडरेज़िंग के लिए विंडो था, और मार्च और अप्रैल हायरिंग के लिए विंडो थे?
यांग ज़िलिन: लगभग।
झांग शियाओजुन: वह रात अमेरिका में—जब आपने यह गणित किया, तो आप कहां थे? आपने वास्तव में इसकी गणना कैसे की?
यांग ज़िलिन: 2022 के अंत से 2023 की शुरुआत तक, मैंने एक या दो महीने अमेरिका में बिताए, लोगों से बात की। मैंने इसे वहां किया जहां मैं रह रहा था। आप यह पता लगाते हैं कि आपको कितने FLOPs चाहिए, प्रशिक्षण लागत, अनुमान, और उपयोगकर्ता संख्याएं।
झांग शियाओजुन: उस पल में, सिलिकॉन वैली में प्रचलित मूड क्या था?
यांग ज़िलिन: उत्पाद ने कई शुरुआती अपनाने वालों को उठाना शुरू कर दिया, जो तकनीकी सर्कल में केंद्रित थे। हम खुद उस सर्कल में थे, इसलिए हमने इसे और अधिक तीव्रता से महसूस किया। सिलिकॉन वैली की बड़ी कंपनियों में, लोगों को हर छह महीने में प्रदर्शन समीक्षा लिखनी होती है, और कई ने उन्हें ChatGPT के साथ लिखना शुरू कर दिया। कुछ लोग जिनका लेखन आमतौर पर इतना पेशेवर नहीं था, उन्होंने ChatGPT के साथ लिखी समीक्षाएं जमा कीं, और हर कोई बहुत गंभीर लग रहा था।
अंडरकरंट हिल रहे थे। कई लोग अपनी अगली नौकरी या कंपनी शुरू करने के बारे में सोच रहे थे। काफी कुछ दोस्त जिन्होंने बाद में हमसे बात की, वे स्टार्टअप शुरू करने चले गए। और तीव्र FOMO था—छूट जाने का डर। कोई सो नहीं सकता था। चाहे वह आधी रात हो, रात 1 बजे, या रात 2 बजे, अगर आप संपर्क करते, तो लोग हमेशा वहां होते। थोड़ा चिंतित, थोड़ा FOMO, और बहुत उत्साहित।
झांग शियाओजुन: जिस रात आपने गणना की कि आपको $100 मिलियन जुटाने की जरूरत है—आप कितनी देर तक जागते रहे?
यांग ज़िलिन: यह ठीक था—गणना में खुद ज्यादा समय नहीं लगा। लेकिन बाद में, मैं बहुत से लोगों को नहीं बता सका। अगर मैंने बताया होता, तो किसी को विश्वास नहीं होता कि यह किया जा सकता है।
भाग 2
तकनीकी वंशावली
"अनंत नक्काशी से खुद को मुक्त करें"
झांग शियाओजुन: जब उद्यम पूंजी की दुनिया आपके बारे में बात करती है, तो वे कहते हैं, "संस्थापक प्रतिभाशाली है, उसके पास तकनीकी करिश्मा है, और टीम तकनीकी सितारों से भरी है।" इसलिए इससे पहले कि हम आपके फाउंडेशन-मॉडल उद्यम पर चर्चा करें, मैं आपकी अकादमिक पृष्ठभूमि से शुरू करना चाहूंगा। आपने स्नातक के रूप में त्सिंगुआ में कंप्यूटर विज्ञान का अध्ययन किया और कार्नेगी मेलन के स्कूल ऑफ कंप्यूटर साइंस से पीएचडी की। क्या AI हमेशा आपका फोकस रहा है?
यांग ज़िलिन: मेरा जन्म 1992 में हुआ था और मैंने 2011 में अपनी स्नातक की डिग्री शुरू की। अपने दूसरे वर्ष से अब तक—एक दशक से अधिक—मैं इस क्षेत्र में हूं। पहले मैंने अधिक विविध रूप से खोज की, हर जगह देखा; मैंने ग्राफ और मल्टीमॉडलिटी से संबंधित कुछ काम किया। 2017 में, मैं भाषा मॉडलों पर केंद्रित हो गया। उस समय मुझे लगा कि भाषा मॉडल अपेक्षाकृत महत्वपूर्ण समस्या थे; बाद में मुझे लगा कि यह एकमात्र महत्वपूर्ण समस्या है।
झांग शियाओजुन: 2017 में, AI उद्योग आम तौर पर भाषा मॉडलों को कैसे समझता था, और वह समझ कैसे विकसित हुई?
यांग ज़िलिन: उस समय यह एक मॉडल था जिसका उपयोग भाषण पहचान परिणामों को रैंक करने के लिए किया जाता था। (हंसते हुए।) भाषण के एक खंड को पहचानने के बाद, आपको कई उम्मीदवार परिणाम मिलते थे, और आप भाषा मॉडल का उपयोग यह देखने के लिए करते थे कि किसकी सबसे अधिक संभावना है और सबसे संभावित को आउटपुट करते हैं। इसके अनुप्रयोग बहुत सीमित थे।
लेकिन आपको एहसास होता है कि यह एक मौलिक समस्या है, क्योंकि आप दुनिया की संभावनाओं का मॉडलिंग कर रहे हैं। भाषा सीमित है, लेकिन यह दुनिया का एक प्रक्षेपण है; सिद्धांत रूप में, यदि आप टोकन स्पेस—सभी संभावित टोकन का स्थान—को पर्याप्त बड़ा बनाते हैं, तो आप एक सामान्य विश्व मॉडल बना सकते हैं। दुनिया में सब कुछ कैसे उत्पन्न होता है और विकसित होता है, उसे एक संभावना सौंपी जा सकती है। हर समस्या को इस बात तक कम किया जा सकता है कि संभावनाओं का अनुमान कैसे लगाया जाए।
झांग शियाओजुन: आपके अकादमिक गुरु बहुत प्रमुख हैं: आपके पीएचडी सलाहकार Apple में AI प्रमुख Ruslan Salakhutdinov और Google AI के मुख्य वैज्ञानिक William W. Cohen थे। दोनों उद्योग और शिक्षा में फैले हुए हैं।
यांग ज़िलिन: पिछले वर्षों में, उद्योग और शिक्षा एक साथ अधिक आए, लेकिन रुझान अब बदल रहा है: अधिक मूल्यवान सफलताएं उद्योग में होंगी। यह विकास का एक अपरिहार्य नियम है। यह खोजपूर्ण शोध से शुरू होता है और धीरे-धीरे एक अधिक परिपक्व औद्योगीकरण प्रक्रिया में बदल जाता है। इसका मतलब यह नहीं है कि औद्योगीकरण के दौरान शोध अनावश्यक है—केवल इतना कि शुद्ध शोध को मूल्यवान सफलताएं उत्पन्न करने में कठिनाई होगी।
झांग शियाओजुन: आपने इन प्रसिद्ध गुरुओं से क्या सीखा?
यांग ज़िलिन: मैंने Google में सबसे अधिक सीखा, जहां मैंने लंबे समय तक इंटर्न किया। मैंने 2018 के अंत में ट्रांसफॉर्मर-आधारित भाषा मॉडलों पर काम करना शुरू किया। मेरी सबसे बड़ी सीख यह थी कि मैंने खुद को अनंत 'नक्काशी'—सतही विवरणों के जुनूनी शोधन—से मुक्त किया। यह महत्वपूर्ण था।
आपको देखना चाहिए कि बड़ी दिशा क्या है, बड़ा ग्रेडिएंट क्या है। जब आपके सामने दस सड़कें होती हैं, तो औसत व्यक्ति चिंता करता है कि इस एक सड़क पर आगे एक पैदल यात्री के लिए कैसे ब्रेक लगाया जाए—अल्पकालिक विवरण। लेकिन दस सड़कों में से कौन सी लेनी है, यही सबसे महत्वपूर्ण है।
इस क्षेत्र में पहले बिल्कुल यही समस्या थी। उदाहरण के लिए, केवल एक या दो मिलियन टोकन के डेटासेट पर, आप देखते थे कि कैसे perplexity को कम किया जाए, कैसे loss को कम किया जाए, कैसे सटीकता में सुधार किया जाए—और आप अनंत नक्काशी में पड़ जाते थे। लोगों ने कई विचित्र आर्किटेक्चर का आविष्कार किया; ये नक्काशी की तरकीबें थीं। नक्काशी के बाद, आप उस तरह के डेटासेट पर बेहतर कर सकते थे, लेकिन आप समस्या के सार से चूक जाते थे।
सार यह विश्लेषण करना है कि क्षेत्र में क्या कमी है। पहला सिद्धांत क्या है? स्केलिंग लॉ पहले सिद्धांत के रूप में क्यों काम कर सकता है? आपको केवल एक ऐसी संरचना खोजने की आवश्यकता है जो दो शर्तों को पूरा करती हो: पहली, यह पर्याप्त रूप से सामान्य है; दूसरी, यह स्केलेबल है। सामान्य का मतलब है कि आप इस ढांचे के भीतर सभी समस्याओं का मॉडल कर सकते हैं; स्केलेबल का मतलब है कि जब तक आप पर्याप्त कंप्यूट डालते हैं, यह बेहतर होता जाता है।
यह वह सोच है जो मैंने Google में सीखी: अगर किसी चीज को किसी अधिक मौलिक चीज से समझाया जा सकता है, तो आपको ऊपरी परतों पर अधिक नक्काशी नहीं करनी चाहिए। एक महत्वपूर्ण पंक्ति है जिससे मैं दृढ़ता से सहमत हूं: अगर आप पैमाने के साथ किसी समस्या को हल कर सकते हैं, तो इसे एक नए एल्गोरिदम के साथ हल न करें। एक नए एल्गोरिदम का सबसे बड़ा मूल्य यह है कि यह आपको बेहतर पैमाना बनाने में कैसे मदद करता है। जब आप नक्काशी से मुक्त हो जाते हैं, तो आप बहुत कुछ देख सकते हैं।
झांग शियाओजुन: क्या Google भी उस समय स्केलिंग लॉ का अनुयायी था? उसने पहले सिद्धांत सोच को कैसे लागू किया?
यांग ज़िलिन: ऐसे कई विचार पहले से ही वहां मौजूद थे, लेकिन Google ने उन्हें विशेष रूप से अच्छी तरह से लागू नहीं किया। उसके पास सोचने का यह तरीका था, लेकिन वह खुद को एक सच्चे मूनशॉट में संगठित नहीं कर सका। यह अधिक ऐसा था: यहां पांच लोग मेरे पहले सिद्धांतों का पीछा कर रहे हैं, और वहां पांच लोग अपने पीछा कर रहे हैं। ऊपर से नीचे तक कुछ भी नहीं था।
झांग शियाओजुन: अपनी पीएचडी के दौरान, आपने ट्यूरिंग अवार्ड विजेताओं Yann LeCun और Yoshua Bengio के सहयोग से पेपर प्रकाशित किए—और आप उन पेपरों पर पहले लेखक थे। वे सहयोग कैसे हुए? मेरा मतलब है: वे ट्यूरिंग अवार्ड विजेता हैं और वे आपके सलाहकार नहीं थे—आपने उन्हें आकर्षित करने के लिए किस पर भरोसा किया?
यांग ज़िलिन: शिक्षा बहुत खुली है। जब तक आपके पास एक अच्छा विचार और एक सार्थक समस्या है, यह ठीक है। दो दिमाग—या n दिमाग—एक दिमाग से अधिक उत्पादन करते हैं। यह AGI विकसित करने पर भी लागू होता है। AI में एक महत्वपूर्ण रणनीति को 'एन्सेम्बलिंग' कहा जाता है—कई अलग-अलग मॉडलों या विधियों का उपयोग करना और बेहतर प्रदर्शन के लिए उनकी भविष्यवाणियों को संयोजित करना। यह मूल रूप से वही काम कर रहा है: जब आपके पास विविध दृष्टिकोण होते हैं, तो आप कई नई चीजों को प्रज्वलित कर सकते हैं। सहयोग अत्यधिक लाभदायक है।
झांग शियाओजुन: क्या आप पहले एक विचार रखते और फिर उनसे पूछते कि क्या वे रुचि रखते हैं?
यांग ज़िलिन: मोटे तौर पर ऐसा ही हुआ।
झांग शियाओजुन: कौन सा कठिन है: शोध में अकादमिक भारी-भरकम लोगों को जीतना, या फंडरेज़िंग में पूंजी के भारी-भरकम लोगों को जीतना? समानताएं क्या हैं?
यांग ज़िलिन: 'जीतना' एक अच्छा वाक्यांश नहीं है—इसके पीछे का सार सहयोग है। सहयोग का मतलब है कि दोनों पक्ष जीतते हैं, क्योंकि पारस्परिक लाभ सहयोग के लिए पूर्व शर्त है। तो वास्तव में कोई अंतर नहीं है: आपको दूसरों को अद्वितीय मूल्य प्रदान करने की आवश्यकता है।
झांग शियाओजुन: आप उनका विश्वास कैसे अर्जित करते हैं? आपको क्या लगता है कि आपका उपहार क्या है?
यांग ज़िलिन: कोई विशेष उपहार नहीं है—बस कड़ी मेहनत करना।
भाग 3
पुरानी प्रणाली अब काम नहीं करती
"AGI को एक नए प्रकार के संगठन की आवश्यकता है"
**
झांग शियाओजुन: आपने अभी कहा "अधिक मूल्यवान सफलताएं उद्योग में होंगी"—क्या इसमें स्टार्टअप और दिग्गजों की AI प्रयोगशालाएं शामिल हैं?
यांग ज़िलिन: प्रयोगशालाएं इतिहास हैं। Google Brain उद्योग में सबसे बड़ी AI प्रयोगशाला हुआ करती थी, लेकिन यह एक बड़ी कंपनी के अंदर एम्बेडेड एक शोध संगठन था। उस तरह का संगठन नए विचारों का पता लगा सकता है, लेकिन उसके लिए एक महान प्रणाली का उत्पादन करना बहुत मुश्किल है—यह ट्रांसफॉर्मर का उत्पादन कर सकता था, लेकिन यह ChatGPT का उत्पादन नहीं कर सकता था।
जिस तरह से विकास अब विकसित होता है, वह यह है कि आप एक विशाल प्रणाली का निर्माण कर रहे हैं, जिसके लिए नए एल्गोरिदम, ठोस इंजीनियरिंग, और यहां तक कि बहुत सारे उत्पाद और व्यावसायीकरण कार्य की आवश्यकता होती है। यह 2000 के दशक की शुरुआत जैसा है: आप एक प्रयोगशाला में सूचना पुनर्प्राप्ति पर शोध नहीं कर सकते थे; इसे वास्तविक दुनिया में, एक विशाल प्रणाली, उपयोगकर्ताओं वाले उत्पाद के रूप में रहना पड़ता था—जैसे Google। तो शोध और शिक्षा प्रणालियां अपने कार्य को मुख्य रूप से प्रतिभा के विकास की ओर स्थानांतरित कर देंगी।
झांग शियाओजुन: आप इस नए प्रकार की प्रणाली का वर्णन कैसे करेंगे? क्या OpenAI इसका प्रोटोटाइप है?
यांग ज़िलिन: यह आज इस तरह का सबसे परिपक्व संगठन है, और यह अभी भी धीरे-धीरे विकसित हो रहा है।
झांग शियाओजुन: तो इसे मानवता के भव्य वैज्ञानिक लक्ष्यों के लिए स्थापित एक संगठन के रूप में समझा जा सकता है?
यांग ज़िलिन: मैं जोर देना चाहता हूं: यह शुद्ध विज्ञान नहीं है—यह विज्ञान, इंजीनियरिंग और व्यवसाय का एक संयोजन है। इसे एक वाणिज्यिक संगठन, एक कंपनी होना चाहिए, न कि एक शोध संस्थान। लेकिन यह कंपनी शून्य से एक तक बनाई गई है, क्योंकि AGI को एक नए प्रकार के संगठन की आवश्यकता है। पहला, उत्पादन का तरीका इंटरनेट युग से अलग है; दूसरा, यह शुद्ध शोध से शोध, इंजीनियरिंग, उत्पाद और व्यवसाय के संयोजन में बदल जाता है।
इसके मूल में, यह एक मूनशॉट कार्यक्रम होना चाहिए, जिसमें ऊपर से नीचे तक बहुत सारी योजना हो—फिर भी उस योजना के भीतर नवाचार के लिए जगह हो, क्योंकि सभी तकनीक पूर्व निर्धारित नहीं है। ऊपर से नीचे के ढांचे के भीतर नीचे से ऊपर तक के तत्व मौजूद हैं। ऐसा संगठन पहले मौजूद नहीं था, लेकिन संगठन को तकनीक के अनुकूल होना चाहिए, क्योंकि तकनीक उत्पादन का तरीका निर्धारित करती है; यदि वे मेल नहीं खाते, तो आप प्रभावी रूप से उत्पादन नहीं कर सकते। हम मानते हैं कि इसे बहुत संभावना है कि इसे खरोंच से फिर से डिजाइन करने की आवश्यकता होगी।
झांग शियाओजुन: पिछले साल OpenAI के बोर्डरूम तख्तापलट के दौरान, Sam Altman के लिए एक विकल्प Microsoft में शामिल होना और एक नई Microsoft AI टीम का नेतृत्व करना था। उस और OpenAI के CEO होने के बीच मूलभूत अंतर क्या है?
यांग ज़िलिन: आपको एक पुरानी संस्कृति के अंदर एक नया संगठन विकसित करना होगा—और यह अत्यंत कठिन है।
झांग शियाओजुन: आप "चीन का OpenAI" बनाना चाहते हैं—क्या हम इसे इस तरह कह सकते हैं?
यांग ज़िलिन: बिल्कुल सटीक नहीं। हम चीन का कुछ भी नहीं बनना चाहते, और हम जरूरी OpenAI नहीं बनना चाहते।
पहला, वास्तविक AGI निश्चित रूप से वैश्विक होगा। ऐसी कोई चीज नहीं है—कम से कम लंबी अवधि में नहीं—जैसे कि बाजार सुरक्षा तंत्र के कारण किसी क्षेत्रीय बाजार तक सीमित AGI कंपनी। वैश्वीकरण, AGI, और एक बहुत बड़े उपयोगकर्ता आधार वाला उत्पाद: ये तीन अंततः आवश्यक शर्तें हैं।
दूसरा, क्या यह OpenAI होना चाहिए? यदि आप 2017–2018 को देखें, तो OpenAI की प्रतिष्ठा बहुत खराब थी। जब हमारे सर्कल में लोग नौकरियों की तलाश करते थे, तो वे आम तौर पर Google जैसी जगहों पर विचार करते थे। कई लोग जिन्होंने OpenAI के मुख्य वैज्ञानिक Ilya Sutskever से बात की, वे यह सोचकर आए कि वह आदमी पागल था और बहुत आत्म-महत्वपूर्ण था—OpenAI या तो पागल थे या धोखेबाज। लेकिन उन्होंने बहुत जल्दी प्रतिबद्धता दिखाई, गैर-सहमति पाई, और जो अब AI में एकमात्र काम करने वाला पहला सिद्धांत है: अगले-टोकन भविष्यवाणी के माध्यम से स्केलिंग।
मेरा मानना है कि OpenAI से बड़ी एक कंपनी होगी। एक वास्तव में महान कंपनी तकनीकी आदर्शवाद को एक महान उत्पाद के साथ जोड़ सकती है, अपने उपयोगकर्ताओं के साथ सह-निर्माण कर सकती है—AGI अंततः अपने सभी उपयोगकर्ताओं के साथ सह-कार्य द्वारा उत्पादित किया जाएगा। तो यह केवल तकनीक के बारे में नहीं है; इसके लिए व्यावहारिकता और वास्तविक दुनिया की खोजों की भी आवश्यकता है—अंततः, दोनों का एक आदर्श संयोजन।
फिर भी, हमें OpenAI के तकनीकी आदर्शवाद से सीखना चाहिए। अगर हर कोई सोचता है कि तुम सामान्य हो—अगर तुम्हारा सपना ऐसा है जो किसी के भी पास हो सकता है—तो इससे मानवता के सपनों के कुल योग में कुछ नहीं जुड़ता।
भाग 4
मूनशॉट का पहला कदम 'लॉन्ग कॉन्टेक्स्ट' है—दूसरा क्या है?
"आगे दो बड़े माइलस्टोन आ रहे हैं"
**
झांग शियाओजुन: कंपनी शुरू करने का फैसला करने के पल पर वापस आते हैं—क्या आपने चीन लौटने के तुरंत बाद पहला फंडिंग राउंड शुरू किया?
यांग ज़िलिन: यह फरवरी (पिछले साल) में अमेरिका में शुरू हुआ, कुछ हिस्सा रिमोट से। अंत में, घरेलू निवेशकों ने बहुमत बनाया।
झांग शियाओजुन: क्या पहले राउंड में $100 मिलियन जुटाए गए?
यांग ज़िलिन: पहला राउंड इतना नहीं था; बाद के राउंड उस आंकड़े से अधिक थे। हमने 2023 में दो राउंड पूरे किए, कुल मिलाकर लगभग RMB 2 बिलियन।
यह अब तीसरा राउंड है। हमने औपचारिक रूप से फंडिंग की घोषणा नहीं की है, इसलिए मैं इस समय टिप्पणी नहीं कर सकता।
झांग शियाओजुन: कुछ लोग कहते हैं कि 2023 की दूसरी छमाही से, कोई भी फाउंडेशन-मॉडल कंपनियों में निवेश करने को तैयार नहीं है। क्या वे गलत हैं?
यांग ज़िलिन: अभी भी हैं। आप वास्तव में भावना में बदलाव देख सकते हैं, लेकिन ऐसा नहीं है कि कोई निवेश नहीं कर रहा—कम से कम अभी के लिए, बाजार में काफी निवेश रुचि है।
झांग शियाओजुन: पूंजी और लोगों के अलावा, आपने 2023 में और कौन से प्रमुख निर्णय लिए?
यांग ज़िलिन: यह तय करना कि क्या करना है। यह हमारी जैसी कंपनियों का लाभ है—उच्चतम स्तर पर निर्णयों के लिए एक तकनीकी दृष्टि होना।
हम लॉन्ग कॉन्टेक्स्ट करते हैं। इसके लिए भविष्य के बारे में निर्णय की आवश्यकता होती है: आपको यह जानना होगा कि क्या मौलिक है और चीजें आगे कहां जा रही हैं। फिर से, यह पहले सिद्धांत हैं—'डी-कार्विंग' की प्रक्रिया। यदि आप नक्काशी पर ध्यान केंद्रित करते हैं, तो आप केवल यह देख सकते हैं कि OpenAI ने पहले ही क्या किया है और यह पता लगा सकते हैं कि इसे कैसे पुन: पेश किया जाए।
आप पाएंगे कि Kimi में दोषरहित लंबे-पाठ संपीड़न करना उत्पाद को एक अद्वितीय अनुभव देता है। जब आप अंग्रेजी-भाषा के पेपर पढ़ते हैं, तो यह आपको उन्हें उल्लेखनीय रूप से अच्छी तरह से समझने में मदद करता है। आज Claude या GPT-4 का उपयोग करते हुए, आप जरूरी उतना अच्छा नहीं करेंगे; इसके लिए पहले से आधार तैयार करने की आवश्यकता थी। हमने इस पर आधे साल से अधिक काम किया। यह आज एक लॉन्ग-कॉन्टेक्स्ट प्रवृत्ति को देखने, जल्दबाजी में दो टीमों को इकट्ठा करने, और इसे अधिकतम गति से विकसित करने से बहुत अलग है।
बेशक, मैराथन अभी शुरू हुई है; और अधिक विभेदीकरण आएगा, और इसके लिए आपको पहले से अनुमान लगाना होगा कि "एक गैर-सहमति जो सत्य साबित होती है" क्या मायने रखती है।
झांग शियाओजुन: यह निर्णय किस महीने में लिया गया था?
यांग झिलिन: फरवरी या मार्च—कंपनी की स्थापना के तुरंत बाद ही यह तय कर लिया गया था।
झांग शियाओजुन: लंबा संदर्भ मूनशॉट का पहला कदम क्यों है?
यांग झिलिन: क्योंकि यह मौलिक है। यह नए कंप्यूटर की मेमोरी है।
पुराने कंप्यूटर की मेमोरी पिछले कुछ दशकों में कई गुना बढ़ी है, और वही बात नए कंप्यूटर के साथ होगी। यह आज की कई समस्याओं को हल कर सकता है। उदाहरण के लिए, वर्तमान मल्टीमॉडल आर्किटेक्चर को अभी भी एक टोकनाइज़र की आवश्यकता है, लेकिन एक हानिरहित रूप से संपीड़ित लंबे संदर्भ के साथ, आपको इसकी आवश्यकता नहीं है—आप सीधे कच्चा इनपुट डाल सकते हैं। आगे बढ़ते हुए, यह नए कंप्यूटिंग प्रतिमान को अधिक सामान्य बनाने की नींव है।
पुराना कंप्यूटर 0 और 1 के साथ सब कुछ दर्शा सकता था; सब कुछ डिजिटलीकृत किया जा सकता था। लेकिन आज का नया कंप्यूटर अभी तक ऐसा नहीं कर सकता—पर्याप्त संदर्भ नहीं है, इसलिए यह उतना सामान्य नहीं है। एक सामान्य विश्व मॉडल बनने के लिए, आपको लंबे संदर्भ की आवश्यकता है।
दूसरा, यह वैयक्तिकरण को सक्षम बनाता है। AI का मुख्य मूल्य वैयक्तिकृत इंटरैक्शन है; मूल्य अंततः वैयक्तिकरण पर टिकता है, और AGI पिछली पीढ़ी के अनुशंसा इंजनों की तुलना में अधिक वैयक्तिकृत होगा।
लेकिन वैयक्तिकरण फ़ाइन-ट्यूनिंग के माध्यम से प्राप्त नहीं किया जाता है—यह बहुत लंबे संदर्भ का समर्थन करके प्राप्त किया जाता है। मशीन के साथ आपका पूरा इतिहास संदर्भ है, और वह संदर्भ वैयक्तिकरण प्रक्रिया को परिभाषित करता है। इसे दोहराया नहीं जा सकता है, और यह अधिक प्रत्यक्ष संवाद बनाता है—ऐसा संवाद जो जानकारी उत्पन्न करता है।
झांग शियाओजुन: इसे बढ़ाने के लिए कितनी गुंजाइश है?
यांग झिलिन: बहुत बड़ी। एक ओर, विंडो का विस्तार करने में अभी भी एक लंबा रास्ता तय करना है—कई गुना वृद्धि।
दूसरी ओर, आप केवल विंडो का विस्तार नहीं कर सकते, और आप केवल संख्या को नहीं देख सकते; चाहे विंडो आज कुछ मिलियन टोकन या कुछ बिलियन हो, यह अपने आप में अर्थहीन है। आपको उस विंडो के भीतर सक्षम तर्क क्षमता, निष्ठा—मूल जानकारी के प्रति निष्ठा—और निर्देश-पालन क्षमता को देखना होगा। आपको एक ही मीट्रिक का पीछा नहीं करना चाहिए; आपको मीट्रिक्स को क्षमताओं के साथ जोड़ना होगा।
यदि ये दो आयाम लगातार सुधरते रहें, तो आप बहुत कुछ कर सकते हैं। यह हजारों शब्दों लंबे निर्देश का पालन कर सकता है, और निर्देश स्वयं कई एजेंटों को परिभाषित कर सकता है—अत्यधिक वैयक्तिकृत।
झांग शियाओजुन: क्या लंबे संदर्भ और GPT-4 की बराबरी करने के पीछे की तकनीकें एक-दूसरे के लिए पुन: प्रयोज्य हैं? क्या वे एक ही चीज़ हैं?
यांग झिलिन: मुझे ऐसा नहीं लगता। यह एक नया आयाम जोड़ने के बारे में अधिक है—एक ऐसा आयाम जो GPT-4 के पास नहीं है।
झांग शियाओजुन: बहुत से लोग कहते हैं कि चीन की अग्रणी फाउंडेशन-मॉडल कंपनियां मोटे तौर पर एक ही काम कर रही हैं—2023 में GPT-3.5 का पीछा करना, 2024 में GPT-4 का पीछा करना। क्या आप सहमत हैं?
यांग झिलिन: सामान्य क्षमताओं में सुधार के निश्चित रूप से प्रमुख मील के पत्थर हैं, इसलिए यह कथन कुछ हद तक सही है—एक पिछड़े व्यक्ति के रूप में, आप अनिवार्य रूप से एक पकड़ने की प्रक्रिया से गुज़रते हैं। लेकिन यह एकतरफा भी है। सामान्य क्षमताओं के अलावा, विशिष्ट क्षमताओं को विकसित करने और कुछ दिशाओं में अत्याधुनिक स्तर तक पहुंचने के लिए बहुत जगह है। लंबा संदर्भ एक ऐसी दिशा है। DALL-E 3 की छवि निर्माण क्षमता Midjourney V6 से पूरी तरह से पिछड़ गई है। इसलिए आपको दोनों मोर्चों पर काम करना होगा।
झांग शियाओजुन: सामान्य क्षमताओं बनाम नए आयामों पर समय और संसाधनों का कितना अनुपात खर्च होता है?
यांग झिलिन: उन्हें संयुक्त करना होगा। एक नया आयाम सामान्य क्षमताओं से अलग अस्तित्व में नहीं रह सकता, इसलिए सीधा अनुपात देना मुश्किल है। लेकिन नए आयाम को अच्छी तरह से करने के लिए पर्याप्त निवेश की आवश्यकता है।
झांग शियाओजुन: क्या ये सभी नए आयाम Kimi द्वारा वहन किए जाएंगे?
यांग झिलिन: Kimi निश्चित रूप से हमारे लिए एक बहुत ही महत्वपूर्ण उत्पाद है, और हमारे कुछ अन्य प्रयास भी होंगे।
झांग शियाओजुन: Shixiang के संस्थापक Li Guangmi की इस टिप्पणी के बारे में आप क्या सोचते हैं कि आज चीनी फाउंडेशन-मॉडल कंपनियों की तकनीकी विशिष्टता अभी भी बहुत अधिक नहीं है?
यांग झिलिन: मुझे लगता है कि यह ठीक है—हमने आज पहले ही काफी विभेदीकरण पैदा कर लिया है। यह समय की बात है; इस साल आपको और अधिक आयाम देखने चाहिए। पिछले साल, हर कोई बस मचान खड़ा कर रहा था और पहले चीजों को चालू कर रहा था।
झांग शियाओजुन: यदि मूनशॉट का पहला कदम लंबा संदर्भ है, तो दूसरा क्या है?
यांग झिलिन: आगे दो बड़े मील के पत्थर होंगे। पहला, एक वास्तव में एकीकृत विश्व मॉडल—एक जो सभी विभिन्न मोडैलिटी को एकीकृत करता है, एक वास्तव में स्केलेबल और सामान्य आर्किटेक्चर।
दूसरा, मानव डेटा इनपुट के बिना AI को लगातार विकसित होने में सक्षम बनाना।
झांग शियाओजुन: इन दो मील के पत्थर तक पहुंचने में कितना समय लगेगा?
यांग झिलिन: दो से तीन साल—संभवतः इससे भी तेज़।
झांग शियाओजुन: तो तीन साल बाद, हम पहले से ही आज की दुनिया से पूरी तरह से अलग दुनिया देख रहे होंगे।
यांग झिलिन: विकास की वर्तमान गति को देखते हुए, हाँ। तकनीक अब एक अंकुरित, तेज़ी से बढ़ने वाले चरण में है।
झांग शियाओजुन: क्या आप कल्पना कर सकते हैं कि तीन साल बाद क्या मौजूद होगा?
यांग झिलिन: कुछ हद तक AGI होगा। आज हम जो कई काम करते हैं, AI भी वे कर पाएगा—हमसे भी बेहतर। लेकिन मुख्य बात यह है कि हम इसका उपयोग कैसे करते हैं।
झांग शियाओजुन: और आपके लिए—Moonshot AI कंपनी के लिए—दूसरा कदम क्या है?
यांग झिलिन: हम वे दो काम करेंगे। बाकी सभी समस्याएं इन दो कारकों से उत्पन्न होती हैं। तर्क और एजेंट जिनके बारे में लोग आज बात करते हैं, वे इन दो समस्याओं को हल करने के उपोत्पाद हैं। कुछ अतिरिक्त नक्काशी की आवश्यकता है, लेकिन कोई मौलिक अवरोध नहीं है।
झांग शियाओजुन: क्या आप GPT-4 की बराबरी करने में पूरी तरह से जुट जाएंगे?
यांग झिलिन: GPT-4 AGI की राह पर एक आवश्यक पड़ाव है। मुख्य बात केवल GPT-4 से मेल खाने से संतुष्ट नहीं होना है। पहला, आपको पूछना होगा कि अब वास्तविक गैर-सहमति क्या है: GPT-4 से परे, आगे क्या है? GPT-5 और GPT-6 को कैसा दिखना चाहिए? दूसरा, आपको देखना होगा कि उसके भीतर आपके पास कौन सी विशिष्ट क्षमताएं हैं—और यह अधिक मायने रखता है।
झांग शियाओजुन: अन्य फाउंडेशन-मॉडल कंपनियां अपने...





