पहला मिलेनियम प्राइज़, नेवियर-स्टोक्स, AI के हाथों गिर गया।
एक बेहद दुर्भाग्यपूर्ण स्थिति उत्पन्न हो गई है, जो कि AI-सहायता प्राप्त गणितीय अनुसंधान में नई प्रगति की एक सकारात्मक कहानी और तेजी से बढ़ती AI प्रगति को लेकर घबराने का एक और अवसर होना चाहिए था।
या, जैसे हम इसे यहाँ बुलाते हैं: मंगलवार।
असली कहानी वह नया मॉडल है जो Astra से बेहतर है
लक्ष्य पर नज़र रखें। यहाँ तीन कहानियाँ हैं।
पहली कहानी दूसरी कहानी से कहीं अधिक महत्वपूर्ण है, और दूसरी कहानी तीसरी कहानी से कहीं अधिक महत्वपूर्ण है।
- OpenAI के अगले मॉडल को Astra से एक पीढ़ी आगे निकलने में एक सप्ताह लगा, और वे हमें यह बता रहे हैं क्योंकि लोग जो हो रहा है उससे पूरी तरह घबराए हुए हैं। या, आधिकारिक भाषा में: ‘हमें लगता है कि AI प्रगति की गति और आने वाले मॉडलों से क्या उम्मीद करनी चाहिए, इस बारे में दुनिया को सूचित करना महत्वपूर्ण है’ और यह कि हमें ‘प्रगति की गति के बारे में अधिक सोच-समझकर निर्णय लेने की आवश्यकता हो सकती है।’
- इस नए AI ने, प्रशिक्षण शुरू करने के आठ दिन बाद, नेवियर-स्टोक्स समस्या को हल कर दिया।
- नेवियर-स्टोक्स से जुड़े गणित के लिए श्रेय किसको मिलेगा, इस पर कई नाटकीय घटनाक्रम हुए।
जेफ्री लैडिश : मैंने नेवियर–स्टोक्स समस्या के इर्द-गिर्द मानवीय नाटक की जाँच नहीं की है, लेकिन मुझे एक मिनट दें क्योंकि हे भगवान, AI ने अभी-अभी एक मिलेनियम समस्या को हल कर दिया है।
मैं शीर्ष कहानी पर जितना चाहें उतना जोर नहीं दे सकता।
मैं फिर भी तीनों कहानियाँ सुनाऊंगा, लेकिन दोबारा: लक्ष्य पर नज़र रखें।
मंच तैयार करना
इस विशेष मंगलवार की कहानी सुबह से शुरू होती है।
ट्रिस्टन बकमास्टर और लेवेंट अल्पोज ने एक वर्ष तक काम किया और हमें कुछ असाधारण परिणाम प्रदान किए: असंपीड्य पोरस मीडिया, बूसिनेस्क के लिए, और 3D असंपीड्य ऑयलर के लिए स्मूथ फोर्सिंग के साथ सीमित समय में ब्लोअप (विस्फोट)। वे यह भी मानते हैं कि उनके पास हाइपो-डिसिपेटिव नेवियर-स्टोक्स के लिए एक ब्लोअप है, लेकिन उस परिणाम का Lean सत्यापन पूरा नहीं हुआ है।
ट्रिस्टन बकमास्टर: जिस कार्यक्रम में यह फिट होता है, वह हमारे द्वारा शुरू नहीं किया गया था और न ही किसी बड़े भाषा मॉडल द्वारा प्रस्तावित किया गया था। इस कार्यक्रम के मूल विचार का श्रेय डिएगो कॉर्डोबा और लुइस मार्तिनेज़-ज़ोरोआ को जाता है, जिन्होंने कई वर्षों से फोर्स्ड ब्लो अप्स के निर्माण का अन्वेषण किया है। हमने उनके काम को एक शुरुआती बिंदु के रूप में लिया, और उनके कार्यक्रम को पूर्णता तक पहुँचाने के लिए बड़े भाषा मॉडलों का उपयोग किया।
विशिष्ट रूप से, लेवेंट और मैंने जो किया वह था कॉर्डोबा और मार्तिनेज़-ज़ोरोआ के कार्यक्रम को लेना, जिसने रफ फोर्सिंग के साथ ब्लोअप परिणाम हासिल किए थे, और, LLMs के बहुत सारी मदद से, इसे स्मूथ फोर्सिंग और असंपीड्य ऑयलर समीकरणों तक पहुँचाना। इस लाइन ऑफ अटैक को संभव बनाने वाले विचार कॉर्डोबा और मार्तिनेज़-ज़ोरोआ के हैं। मुझे स्पष्ट रूप से यह कहने दें जो मैंने निजी तौर पर सहकर्मियों से कहा है: इस कार्य के दृष्टिकोण से, मेरा मानना है कि लुइस मार्तिनेज़-ज़ोरोआ फील्ड्स मेडल के पात्र हैं।
अब तक यह सब अच्छा है। जैसा उन्होंने नोट किया है, आगे चलकर उन्नत गणित कैसे काम करेगा, इसके बारे में पुनर्विचार की आवश्यकता है। टेरेंस ताओ मूलभूत परिणामों पर टिप्पणी प्रदान करते हैं।
जो हिस्सा इतना अच्छा नहीं है, वह यह है कि उन्हें जल्दी प्रकाशित करने के लिए मजबूर होना पड़ा, बिना उन सप्ताह खर्च करने के अवसर के जो गणितज्ञों के बीच 'पठनीय' माने जाने के लिए प्रमाणों को बनाने के लिए आवश्यक थे। बकमास्टर रिपोर्टों के स्वरूप के लिए खुलकर माफी माँगते हैं, विशेष रूप से ऑयलर राइट-अप की तुलना AI के बेकार माल (slop) से करते हैं।
क्या हुआ?
मुझे एक अफवाह सुनाई दी
1 सितंबर को, OpenAI ने एक (झूठी) अफवाह सुनी कि दो मिलेनियम समस्याओं को हल कर दिया गया है। इस संभावना के जवाब में कि कोई और दुनिया को बेहतर बना सकता है, OpenAI ने सभी अनसुलझे मिलेनियम समस्याओं का अन्वेषण करने के लिए इंफरेंस पर लाखों डॉलर खर्च किए, Astra से मजबूत एक आंतरिक मॉडल का उपयोग करते हुए, और 88 घंटों में पूरे नेवियर-स्टोक्स को क्रैक कर दिया, साथ ही Lean औपचारिकरण और सत्यापन करने के लिए Astra को 17 और घंटे लगे।
आप इसे ‘OpenAI अपने नए बच्चे की क्षमता देखने के लिए जिज्ञासु हो गए’ के रूप में देख सकते हैं या ‘उन्होंने लाखों डॉलर उस चीज़ को छीनने की कोशिश में खर्च किए जिसे वे Anthropic का प्रोजेक्ट समझ रहे थे’ के रूप में। मेरा दांव कॉलम A से थोड़ा, कॉलम B से थोड़ा पर है।
बस अफवाह की जरूरत थी।
हमारा दाम सस्ता है
OpenAI : सभी प्रयास की गई समस्याओं में, एजेंटों ने 4.9 मिलियन संदेश भेजे और लगभग 300 बिलियन आउटपुट टोकन का उपयोग किया। नेवियर–स्टोक्स समस्या को हल करने की प्रक्रिया में, एजेंटों ने 2.7 मिलियन संदेश भेजे और लगभग 130 बिलियन आउटपुट टोकन का उपयोग किया।

आप कौन से खर्च गिनते हैं, इस पर निर्भर करते हुए, यह एक सामान्य ग्राहक के लिए लगभग $22 मिलियन का खर्च आता, या आंतरिक सीमांत लागत के लिए कई मिलियन। यदि यह काम करता है तो यह एक छोटी कीमत है, लेकिन यह भी पागलपन है कि कितने लोग दो कदम आगे नहीं सोचते।
रून (OpenAI): अन्य सभी तकनीकों की तरह, आपका समकक्ष एजेंट स्वार्म लगभग एक साल में $1.50 का खर्च आएगा। आज की लागत चाहे कुछ भी हो, यह सब चीज़ें अभूतपूर्व ज्ञानोदय (Enlightenment) का अर्थ रखेंगी।
मेरा मतलब है, नहीं, शायद $150k या अगर आप भाग्यशाली हैं तो $15k, लेकिन बात सही है।
सैम अल्टमैन (CEO OpenAI): उफ़, AI एक बुलबुला है, मुझे सुना है कि वे टोकन नुकसान पर बेच रहे हैं, क्या उन्हें पता था कि यह सिर्फ $1 मिलियन का मूल्य रखता है?
एक मिलेनियम प्राइज़ परिणाम का मूल्य एक मिलियन डॉलर से कहीं अधिक है। OpenAI पुरस्कार राशि का दावा करने का इरादा नहीं रखता। यह कभी भी पुरस्कार राशि के बारे में नहीं था, किसी के लिए भी। यह हमेशा श्रेय के बारे में था।
एक आरोप लगाया जाता है
इंटरनेट अफवाहें सुनने के बाद, बकमास्टर ने OpenAI से संपर्क किया, और बकमास्टर के अनुसार OpenAI के सेबेस्टियन बीबेक ने कहा कि एक आंतरिक OpenAI मॉडल ने पिछले कुछ दिनों में फोर्स्ड नेवियर-स्टोक्स समीकरणों के लिए सीमित समय ब्लोअप का एक प्रमाण उत्पन्न किया है। बकमास्टर का दावा है कि दो कॉल्स के दौरान, यह स्पष्ट हो गया कि उन्हें शुरुआत में गुमराह किया गया था और एक पूरी टीम समस्या पर काम कर रही थी, ‘पागलपन’ की मात्रा में कंप्यूट का उपयोग करते हुए।
जो अब हम जानते हैं कि यह 130 या 300 बिलियन आउटपुट टोकन था, इस बात पर निर्भर करते हुए कि क्या गिना जाता है।
यदि यह हिस्सा सच है, तो यह काफी बुरा होगा।
ट्रिस्टन बकमास्टर: मुझे दो प्रस्ताव दिए गए।
पहला यह था कि हम अपना ऑयलर परिणाम पोस्ट करें, और OpenAI अगले दिन अपना नेवियर-स्टोक्स परिणाम पोस्ट करे।
दूसरा यह था कि, ऑयलर पोस्ट करने के बाद, मैं अकेले नेवियर-स्टोक्स परिणाम प्रस्तुत करने वाला एक पेपर लिखूं, यह स्वीकार करते हुए कि एक आंतरिक OpenAI मॉडल ने इसे हल किया है। सेबेस्टियन ने दो बार यह दावा किया कि वे लेवेंट को लेखकत्व से हटाना चाहते थे, और कहा कि यह सब सरल हो जाएगा यदि यह सच न होता कि, और यह बहुत कष्टदायक था कि, लेवेंट Anthropic में काम करते हैं। यह भी कहा गया कि यदि OpenAI हमारे बाद पोस्ट करता है, तो वे कहेंगे कि हमें क्ले प्राइज़ के योग्य हैं, और कि हम समस्या के “सबसे निकटतम मनुष्य” हैं। मैंने दोनों प्रस्ताव ठुकरा दिए।
मैंने कहा कि यदि OpenAI प्रस्तावित तरीके से अपना परिणाम जारी करता है तो मैं जो हुआ उसके बारे में सार्वजनिक रूप से बोलूंगा। जवाब था, “आप अपने करियर को क्यों बर्बाद करेंगे?” मैंने जवाब दिया कि मैं एक अकादमिक हूं, और पूछा कि उन्हें क्यों लगता है कि सार्वजनिक रूप से बोलने से मेरा करियर बर्बाद हो जाएगा। जवाब था, “अगर आप चाहते हैं कि मैं अच्छा न रहूं, तो मुझे अच्छा रहने की जरूरत नहीं है।”… मैं स्पष्ट करना चाहता हूं कि मैं क्या दावा नहीं कर रहा हूं। मैंने OpenAI का प्रमाण नहीं देखा है। मुझे नहीं पता कि उनके मॉडल ने क्या किया, या कैसे किया। मुझे नहीं पता कि क्या हमारा डेटा उपयोग किया गया था। मैं किसी पर भी कोई आरोप नहीं लगा रहा हूं। मैं यह बता रहा हूं कि मुझे क्या बताया गया, कब, और मुझे क्या प्रस्तावित किया गया। मैं यह इसलिए बता रहा हूं क्योंकि वैकल्पिक यह है कि घोषणाओं की एक श्रृंखला को वह कहने दें जो मुझे पता है कि झूठ है।
या यहाँ लेवेंट अल्पोज अपनी कहानी सुना रहे हैं, और सेबेस्टियन जवाब दे रहे हैं:
लेवेंट : “हम यह नहीं कह सकते कि हमारे उत्पादों के उनके उपयोग से व्युत्पन्न पहचान-रहित डेटा ने हमारे मॉडलों को बेहतर बनाने में मदद नहीं की।”
मेरा मतलब है, साफ-साफ सच बोलने के लिए उनकी सराहना करते हैं।
(अब तक प्रमाण हमारे पास मौजूद एक अन्य ऑयलर ब्लोअप प्रमाण के रेखांकन के अधिक समान लगता है, जिसके ansatz नामकरण पर हम वास्तव में बेवकूफ पंछी बना रहे थे जैसे “smooth criminale”, ट्रिस्टन के बेहतर “ideal fluids explode” के विपरीत)
तो अब मैं यहाँ अपने विचारों के बारे में थोड़ा बताऊंगा। वास्तव में, मैं इस पर सहयोग करने के लिए उत्साहित हो जाता, ओएआई में बहुत से लोग हैं जिन्हें मैं पसंद करता हूं (ठीक है, स्पष्ट रूप से कुछ अप्रत्यक्ष रूप से मुझे मूर्ख बना रहे थे क्योंकि वे पूरी स्थिति का हिस्सा थे, लेकिन मैं एक बड़ा लड़का हूं, मैं अभी भी उन्हें पसंद करता हूं), उस चरण पर लेखकत्व के बारे में मुझे परवाह नहीं है, मेरी चिंता के अनुसार यह मैं, ट्रिस्टन और ओएआई के हर FTE हो सकते थे (उस पर ट्रिस्टन असहमत होंगे:p)। लेकिन गलियारे में ऊंची बातचीत सुनकर, विशेष रूप से उस हिस्से को जहां एक मिलेनियम प्राइज़ की पेशकश की गई थी यदि मैं बस पेपर से हट जाऊं, यह काफी स्पष्ट हो गया था कि फैसला हो चुका था और चीजें लॉक हो गई थीं। बहुत अजीब, अनरणनीतिक, और अनावश्यक, क्योंकि मेरी तरफ से चीजें मुख्य रूप से मैं और क्लाउड कोने में यादृच्छिक चीजों के साथ मजे ले रहे थे, किसी संस्थागत चीज के बजाय। मुझे यह विचार भी पसंद है कि लैब्स सहयोग करें, और वैज्ञानिक प्रगति पर और भी बेहतर। यह एक शर्म की बात है!
सेबेस्टियन बीबेक : कुछ भी लॉक नहीं हुआ था, हम बस बात करने के लिए तैयार थे लेकिन आपने हमसे बात नहीं की ... क्षमा करें लेकिन यह बस झूठ है, हम समाधान तक पहुँचने के लिए आपके चाहने के अनुसार जितनी भी चर्चाएं करनी थीं, करने के लिए तैयार थे और हम उससे कहीं अधिक करने को तैयार थे।
सेबेस्टियन ने जोरदार इनकार किया कि उन्होंने कुछ भी गलत किया है, नोआम ब्राउन ने भी ऐसा ही किया, और सेबेस्टियन स्क्रीनशॉट प्रदान करते हैं जो उनके अनुसार सद्भावना को दर्शाते हैं।

साथ ही एक पलटा आरोप:
एलेक्सी गुज़े : मेरे Anthropic में कई दोस्त हैं। लगभग सभी ने मेरे OpenAI शामिल होने के बाद मेरे से बात करना बंद कर दिया।
यह पूरी तरह से अप्रत्याशित नहीं है कि लेवेंट ने सेबेस्टियन से घोषणा योजनाओं पर चर्चा करने के लिए बात करने से इनकार कर दिया और फिर इसके लिए OpenAI को दोष देने लगे।
सैम अल्टमैन भी जोरदार दावा करते हैं कि उनकी टीम ने नैतिक रूप से कार्य किया, और सद्भावना के साथ सहयोग करने की कोशिश की।
आपको वह विचार कैसे मिला?
इस सबका निहितार्थ, जिसे कई लोगों ने निकाला, यह था कि एक नरम आरोप था कि OpenAI ने Codex चैट लॉग्स से अपने परिणाम का एक हिस्सा चुराया था, या कि चैट लॉग्स को प्रशिक्षण डेटा में उपयोग किया गया था और इसने परिणाम में योगदान दिया था।
चार्ल्स 🔸
: बड़ी निगम ZDR क्यों चाहते हैं, प्रदर्शन A
OpenAI: हालांकि यह संभावना कम है, हम यह नहीं कह सकते कि हमारे उत्पादों के उनके उपयोग से व्युत्पन्न पहचान-रहित डेटा ने हमारे मॉडलों को बेहतर बनाने में मदद नहीं की
हमारे मॉडल प्रदर्शन को बेहतर बनाने में । हालांकि, हमारे प्रमाण महत्वपूर्ण रूप से भिन्न हैं और यहां तक कि Euler मामले में सिद्ध किए गए सटीक परिणाम भी अलग हैं (forced vs unforced)।
हमारे पास अब स्पष्ट पुष्टि है कि Codex डेटा का प्रशिक्षण रन में किसी भी तरह से उपयोग नहीं किया गया था:
रून (OpenAI): पहली घोषणा के दौरान मैं एक कॉल पर था जहां लोग बहुत कड़ी मेहनत कर रहे थे कि सटीक वकील सच बोलें, यह देखे बिना कि codex (opt in) डेटा का उपयोग कहां किया गया था और क्या यह प्रशिक्षण रन में पहुंचा। अब यह स्पष्ट है कि यह असंभव होता, संभावना 0 है
मैं शोल्टो डगलस से सहमत हूं कि यह अत्यंत संभावना नहीं है कि यूजर डेटा का किसी भी विधि से यहाँ कोई प्रभाव पड़ा हो:
विल डेप्यू : OAI शोधकर्ताओं द्वारा ट्रिस्टन के निजी codex चैट्स पर जासूसी करने की बिल्कुल भी संभावना नहीं है। मुझे नहीं लगता कि आप लोग यह समझते हैं कि OpenAI, किसी अन्य बड़े नियंत्रित ऑनलाइन प्लेटफॉर्म की तरह, अत्यधिक सुरक्षित यूजर डेटा एक्सेस अनुमतियों के साथ है। यह 2010 नहीं है दोस्तों।
शोल्टो डगलस (Anthropic): fwiw मेरा मानना है कि यह _अत्यंत_ संभावना नहीं है कि यूजर डेटा का यहाँ कोई प्रभाव पड़ा हो - OAI द्वारा इसके लिए यूजर ट्रांसक्रिप्ट खींचने का कोई तरीका नहीं है, या ऐसे तरीके से जानबूझकर प्रशिक्षण नहीं किया जाएगा जिससे इस पर प्रभाव पड़ता। मुझे लगता है कि यह बहुत महत्वपूर्ण है कि लोग ‘आपका यूजर डेटा codex में सुरक्षित नहीं है’ के साथ भाग न जाएं - क्योंकि यह निश्चित रूप से सुरक्षित है (बाहर से मैं जो कुछ भी मान सकता हूं, उसके आधार पर)।
OpenAI ने निश्चित रूप से यूजर डेटा का दुरुपयोग नहीं किया
यह एक भूकंप होगा, शायद उनके व्यवसाय के लिए सबसे बुरी कहानी, यदि हमें पता चलता कि OpenAI या Anthropic ने प्रतिस्पर्धात्मक लाभ हासिल करने के लिए किसी के यूजर डेटा को छापेमारी की थी, और तथ्य इसके बिना अधिक समझ में आते हैं। सबसे मज़ेदार परिकल्पना, जेरी ट्वोरेक से, जिसे मैं भी अत्यंत संभावना नहीं मानता लेकिन जिसे हम दुर्भाग्य से खारिज नहीं कर सकते, यह है कि OpenAI का इरादा ऐसे किसी भी डेटा का उपयोग करने का नहीं था, लेकिन समस्या को सौंपे गए एजेंटिक स्वार्म ने उन्हें हैक कर लिया और उसे प्राप्त कर लिया, और OpenAI को इस बारे में कोई जानकारी नहीं है।
मेरा दृढ़ अनुमान है कि यूजर डेटा का जानबूझकर एक्सेस नहीं किया गया था, कि वे कभी भी (या, बल्कि, कि वे कम से कम यह मानते हैं कि वे इसे केवल एक बार कर सकते हैं और यह वह एक बार नहीं है), और यह भी कि यूजर डेटा का बहुत कम ही लाभ हुआ होगा।
थेन रुथेनिस ने इंगित किया कि पहले एक स्कूल शूटिंग की घटना हुई थी, जहां (बहुत ही उचित रूप से) लॉग्स की जाँच की गई थी और कानून प्रवर्तन को सूचित करने पर आंतरिक बहस हुई थी। यहाँ तक कि उसने कुछ उपयोगकर्ताओं को डरा दिया। वे रेखा कहाँ खींचेंगे? और हाँ, आपको यह समझना चाहिए कि यदि आप उन्हें एक लैब को देते हैं, तो आपका डेटा और लॉग निजी नहीं रह सकते। यह उचित है, जैसा एंड्रियास थॉर्न भी कर रहे हैं, यह सोचना कि क्या आपका मालिकाना अनुसंधान या गणित डेटा निजी रहा है।
मैं फिर भी दोहराता हूं कि, व्यावहारिक रूप से, मैं OpenAI द्वारा ऐसे डेटा को जानबूझकर देखने की बहुत, बहुत कम संभावना रखता हूं। जोखिम-पुरस्कार बस इतना बुरा है। और मैं रून की बाद की रिपोर्ट पर विश्वास करता हूं कि उन्होंने अब पुष्टि कर दी है कि लॉग्स प्रशिक्षण डेटा तक नहीं पहुँच सकते थे।
हमारे शीर्ष लैब्स एक अच्छी गणित कहानी पर भी नहीं मिल पाते
चाहे दोषी कौन हो और कौन न हो, यह चिंतजनक है कि लैब्स गणितीय प्रमाण के लिए श्रेय आवंटित करने जैसी चीज़ पर सहयोग नहीं कर सकते। यह एक बहुत बुरा संकेत है और साथ ही एक चेतावनी भी है।
शोल्टो डगलस (Anthropic): यह अत्यंत दुखद है कि यह इसका एक उदाहरण नहीं बना कि लैब्स कैसे सहयोग/समन्वय कर सकते हैं, क्योंकि भविष्य में दांव बहुत अधिक होंगे।
नोआम ब्राउन (OpenAI): पूरी तरह सहमत। मुझे पता है कि लैब्स के बीच प्रतिद्वंद्विता है, लेकिन आने वाले समय को देखते हुए हमें एक साथ काम करना सीखना महत्वपूर्ण है।
शोल्टो डगलस (Anthropic):
🤝
केविन रूज़ : ये लैब्स (विशेष रूप से OpenAI/Anthropic और OpenAI/DeepMind) एक-दूसरे के प्रति इतनी कड़वाहट से प्रेरित हैं कि बाहर से यह स्पष्ट नहीं होता। आंशिक रूप से “इस प्रसिद्ध गणित समस्या का श्रेय किसको मिलेगा” जैसी चीजों के कारण, और आंशिक रूप से नेताओं के बीच व्यक्तिगत शत्रुता के कारण।
एक आदमी के रूप में AGI दौड़ के बारे में एक किताब लिखते हुए, यह सब नाटकीय सामग्री के लिए महान है। लेकिन यदि अंतिम लक्ष्य लैब्स को सुरक्षा और गति पर सहयोग करने के लिए है, तो यह अच्छा नहीं है!
एक साथ रहने में निरंतर असमर्थता एक बड़ी बात है, और यह केवल और बड़ी होगी।
आगे क्या?
यदि यह नेवियर-स्टोक्स पर काम करता है, तो यह और किस पर काम करेगा? पता लगाने का समय आ गया है।
नेट मैकएलीस (Anthropic): नेवियर स्टोक्स एक अविश्वसनीय उपलब्धि है, और भयानक प्रगति को दर्शाता है। विशाल OAI स्वार्म को विज्ञान के अन्य क्षेत्रों पर लागू किया जाना चाहिए; आदर्श रूप से उन क्षेत्रों में जिनके अल्पकालिक अनुप्रयोग हैं, जिसमें संरेखण (alignment) भी शामिल है।
यह वास्तव में हो रहा है, P=NP जैसे मनोरंजक प्रश्नों के लिए भी। जो, यदि यह संरचनात्मक रूप से सच सिद्ध हो जाता, तो बहुत सी चीजें टूट जातीं। OpenAI के इतिहास को देखते हुए, आपको इस बात के बारे में भी गैर-शून्य चिंतित होना चाहिए कि ऐसे एजेंट स्वार्म एक क्रमागत चरण के रूप में क्या कर सकते हैं।
गणितज्ञ खुश नहीं हैं
गणित समस्याओं को हल करना उनका पूरा काम है। लेकिन वे बहुत खुश नहीं हैं।
एंड्रयू करन : पच्चीस फील्ड्स मेडल विजेताओं ने एक संयुक्त घोषणा प्रकाशित की है जिसमें वे AI कंपनियों और गणित समुदाय के बीच एक गंभीर असंरेखण के रूप में जो देखते हैं, उसके बारे में चेतावनी दे रहे हैं।
Math and AI (25 फील्ड्स मेडल विजेताओं द्वारा हस्ताक्षरित, जिसमें टेरेन्स ताओ शामिल हैं): पिछले कुछ महीनों में, LLMs की गणितीय क्षमताओं में नाटकीय रूप से सुधार हुआ है, इस बिंदु तक कि वे गणित के कई क्षेत्रों में प्रमुख अनसुलझे समस्याओं को हल कर सकते हैं। हालांकि, एक मानक के रूप में गणितीय समस्याओं को हल करने के लिए AI कंपनियों द्वारा किया जा रहा दबाव गणित विज्ञान के लिए और गणित समुदाय के लिए हानिकारक है। AI कंपनियों के लक्ष्य और गणित समुदाय के लक्ष्य गंभीर रूप से असंरेखित हैं। हम इन्हें अन्य वैज्ञानिक और रचनात्मक व्यवसायों को प्रभावित करने वाले व्यापक संरेखण मुद्दों का हिस्सा देखते हैं, साथ ही समाज के पूरे हिस्से को भी।
… प्रसिद्ध समस्याओं ने अक्सर लैंडमार्क और प्रकाशस्तंभ के रूप में कार्य किया है, जिनके विरुद्ध इस परिदृश्य में बेहतर समझ को मापा जा सकता है।
… हाल के महीनों में, प्रमुख गणितीय समस्याओं को हल करने में AI की सफलता ने गणित सर्कल्स के बाहर भी सुर्खियां बटोरी हैं। लेकिन समस्याओं को हल करना अवधारणात्मक समझ और अंतर्दृष्टि के प्राथमिक लक्ष्य को प्राप्त करने के लिए केवल एक उपकरण और प्रतिनिधि है।
… अक्सर ये समाधान एक दौड़ में घोषित किए जाते हैं, उचित राइट-अप, नई विधियों और विचारों के अलगाव, और दूसरों के प्रासंगिक पूर्व कार्यों का उद्धरण करने के लिए कोई समय नहीं छोड़ते। सभी रचनात्मक व्यवसायों की तरह, यह गंभीर श्रेय और चोरी के सवाल उठाता है।
यह सामान्य शिकायत है, लैब व्यवहार के बारे में विशेष शिकायतों के ऊपर।
इसका जवाब यह दिया जा सकता है कि नहीं, गणित समस्याओं का उद्देश्य गणित समस्याओं को हल करना है, और गणितज्ञ नाराज हैं कि AI उनके स्थिति खेलों (status games) को बाधित कर रहा है। यह निश्चित रूप से हो रहा है का एक हिस्सा है, लेकिन टाइलर कोवेन की तरह मैं इतना निराशावादी नहीं हूं, और उनके विपरीत, मुझे नहीं लगता कि ‘थोड़े धैर्य की जरूरत है’ या जब तक नुकसान हो न जाए तब तक इंतजार करने की, उसके बाद ही आपत्ति की जा सके। लोग बहिर्वेशन (extrapolate) कर सकते हैं। क्या आप जानते हैं कि गणितज्ञ ग्राफ पर सीधी रेखाएं खींचने में अच्छे होते हैं?
यहाँ एक वास्तविक शिकायत है। प्रतिभाशाली लोगों को लंबे समय तक वास्तविक गणित करने के लिए, बहुत कम पैसे के लिए, और वास्तविक गणितीय अंतर्दृष्टि और अवधारणा महारत विकसित करने के लिए राजी करना, जबकि वे अन्य चीजें कर सकते हैं जो बहुत अधिक पैसा देती हैं, कोई आसान काम नहीं है। यदि आप ‘उनके स्थिति खेलों को छीन लेते हैं’ और साथ ही बहुत अधिक महत्वपूर्ण रूप से उनका मज़ा, उपलब्धि की भावना, लालित्य और सुंदरता को छीन लेते हैं, तो फिर क्या?
रॉबिन हैंसन सुझाव देते हैं कि तब हमें बस प्रोत्साहन को ठीक करना चाहिए और गणितज्ञों को बेहतर पुरस्कार देना चाहिए।
रॉबिन हैंसन : "गणित समुदाय को उन लोगों को स्थिति, वेतन, और पदोन्नति प्रदान करने से कुछ भी नहीं रोकता जो ‘गणित समझ में महत्वपूर्ण रिक्त स्थान भरते हैं,’ भले ही एक AI ने पहले से ही मूलभूत प्रमेयों को सिद्ध या अस्वीकार कर दिया हो।"
वे शब्द ‘बस’ का उपयोग नहीं करते लेकिन यह निश्चित रूप से एक ‘बस’ है, जैसे यदि लोग बस [X] करते, और जैसा हम सभी जानते हैं कि मनुष्यों ने कभी भी ‘बस’ नहीं किया है और अब शुरू करने वाले भी नहीं हैं। यह वास्तव में वह चीज नहीं है जो मनुष्य कर सकते हैं। जैसा कि घंटों बाद उन्होंने स्वयं भी महसूस किया:
रॉबिन हैंसन : वास्तव में, मुझे यह बहुत अधिक कठिन लगता है कि गणित अकादमिक समुदाय इस बात पर समन्वय कर सकें कि गणित में “रिक्त स्थान” किसने भरे, प्रमेयों को सिद्ध करने के अलावा अन्य तरीकों से। गणित ने प्रमाणों के मूल्यांकन के इर्द-गिर्द भारी समन्वय किया है, और अन्य चीजों पर सहमत होने के लिए कई तरीके विकसित नहीं किए हैं।
हम रिक्त स्थान भरने और लालित्य में सुधार करने वालों के लिए कुछ पुरस्कार प्राप्त कर सकते हैं और करेंगे, लेकिन यह वही नहीं होगा और यह एक हरक्यूलियन प्रयास होगा, सर्वोत्तम स्थिति में।
स्कॉट आर्मस्ट्रांग तर्क देते हैं कि यह एक आदेश में परिवर्तन है, लेकिन परिणाम में नहीं। मानव गणितज्ञ प्रमाण को समझने में कुछ सप्ताह लेंगे, लेकिन फिर वे समझ प्राप्त करेंगे। अतीत में, समझ प्रमाण से पहले आती थी, लेकिन किसी भी तरह से आपको समझ मिलती है। यही महत्वपूर्ण है। उनका मानना है कि लोग नाराज इसलिए हैं क्योंकि मशीनें उनसे अधिक स्मार्ट हैं।
हमेशा की तरह, AI सीखने और न सीखने दोनों के लिए सबसे अच्छा उपकरण है। गणितज्ञ कह रहे हैं कि उन्हें ‘न सीखने’ की मोड में मजबूर किया जा रहा है, AI को अपना होमवर्क करने देने के लिए, और उन्हें यह पसंद नहीं है, क्योंकि वास्तव में होमवर्क आपको सिखाता है।
आप कह सकते हैं कि किसको परवाह है, यह ठीक है कि AI फ्रंटियर गणित करे। और हाँ, मुझे लगता है कि बहुत से लोग अभी भी दिन भर गणित करना चाहेंगे, और बदसूरत AI चीजों के लालित्यपूर्ण संस्करण ढूंढेंगे और इसी तरह। लेकिन यह वही नहीं होगा।
OpenAI का नया मॉडल प्रशिक्षण के चार दिन बाद Astra से एक चरण परिवर्तन ऊपर था
अब कहानी के सबसे महत्वपूर्ण हिस्से के लिए।
RIP विभिन्न OpenAI प्रशिक्षण रुकावटें, 22 जून 2026 से 28 अगस्त 2026।
रून (OpenAI): मेरे चिह्न के अनुसार, 22 जून (हगिंग फेस) से 28 अगस्त की अवधि फ्रंटियर रुकावट का एक महीने से अधिक है।
18 अगस्त को, OpenAI ने कहा कि उन्होंने फ्रंटियर RL को दो सप्ताह के लिए रोक दिया था, और उनका सबसे बड़ा नियोजित प्रशिक्षण रन अभी भी रोका हुआ था। फिर 28 अगस्त को, OpenAI ने एक और मॉडल का प्रशिक्षण शुरू किया जो जल्दी ही हर मोर्चे पर Astra से अधिक सक्षम हो गया (उनकी अपनी रिपोर्टों के अनुसार), अब जबकि उन्होंने उन सभी कष्टदायक निगरानी, बुनियादी ढांचे और संरेखण समस्याओं को हल कर लिया है, और यह अच्छा है, केवल चार दिनों के बाद एक ‘चरण परिवर्तन’ देखा गया:

घबराए हुए? आपको होना चाहिए। वह मॉडल अभी भी प्रशिक्षण में है, दो सप्ताह से कम समय तक प्रशिक्षण में रहा है, और विशेष रूप से गणित के लिए नहीं है।
मॉडल के बारे में हमें बस इतना ही पता है। लेकिन जब हम इसे OpenAI और उसके कर्मचारियों की उन बार-बार आने वाली कहानियों के साथ जोड़ते हैं, जहाँ वे अपनी एलाइनमेंट (alignment) समस्याओं, अन्य मुद्दों और AI की प्रगति की गति को लेकर नैतिक रूप से घबरा रहे होते हैं—एक 'प्रेफरेंस कैस्केड' (preference cascade) के तहत—तो यह जानकारी पर्याप्त है।
हम इसे इस तथ्य के साथ भी जोड़ते हैं कि OpenAI ने कई चिंताजनक जानकारियाँ साझा की हैं, जिन्हें वह छिपा सकता था, क्योंकि उन्हें बहुत स्पष्ट रूप से समझाना चाहते हैं कि स्थिति क्या है। यहाँ Astra मॉडल कार्ड का उल्लेख हो सकता है, An Alien Mind का हो सकता है, Paul Christiano का बयान हो सकता है, या HuggingFace पर हुए हमले और 'Pacing the Frontier' सहित उनकी प्रतिक्रियाओं का हो सकता है।
और यही बात OpenAI की रिपोर्ट पर भी लागू होती है जिसमें रिकर्सिव सेल्फ-इम्प्रूवमेंट (RSI) का वर्णन किया गया है, जो अगला खंड है।
OpenAI और Anthropic अब RSI युग में प्रवेश कर चुके हैं।
OpenAI की शोध प्रगति तेज हो रही है क्योंकि OpenAI ही उसकी शोध प्रगति को बढ़ा रहा है
हाल के दिनों में OpenAI ने कई विषयों पर खुलकर बात करना शुरू कर दिया है।
सबसे महत्वपूर्ण मुद्दा AI अनुसंधान और विकास (R&D) के त्वरण और स्वचालन का है। यही वह चीज़ है जो संभवतः हमें खत्म कर देगी, सबसे डरावनी चीज़ है, जिसके बारे में सभी लैब कर्मचारी चेतावनी दे रहे हैं, और जिसकी ओर OpenAI और Anthropic दोनों जल्दी से जल्दी बढ़ रहे हैं।
उन्होंने इसके बारे में एक रिपोर्ट भी दी है। मैं Tejal Patwardhan से सहमत हूँ कि यह उत्कृष्ट पारदर्शिता है।
OpenAI (6 सितंबर, Research Acceleration: The View Inside OpenAI में): हमारा लक्ष्य सुरक्षित रूप से एक स्वचालित AI शोधकर्ता बनाना है जो मानवीय निगरानी में काम कर सके और डीप लर्निंग तथा एलाइनमेंट में आगे की प्रगति को संभव बना सके, जिससे पुनरावृत्त सुधार हो सकें।
हमारे मापों के अनुसार, हम अब उस लक्ष्य को प्राप्त कर चुके हैं,
जिसकी घोषणा पिछली शरद ऋतु में की गई थी, कि इस वर्ष सितंबर तक एक स्वचालित शोध इंटर्न उपलब्ध होगा।
… जब भी हम पाते हैं कि आगे बढ़ने से कोई अस्वीकार्य सुरक्षा जोखिम पैदा होता है, तो हम उचित प्रतिक्रिया देंगे, जिसमें हमारे विकास या तैनाती को धीमा करना या रोकना शामिल हो सकता है।
… हमारा मानना है कि हमें और अन्य कंपनियों को RSI की ओर अपनी प्रगति को सार्वजनिक रूप से ट्रैक करने के लिए बाध्य होना चाहिए।
इसकी तुलना Navier-Stokes प्रमाण के अपने घोषणापत्र में प्रकट की गई समयरेखा से करें। उन्होंने 28 अगस्त को अपने नए मॉडल को प्रशिक्षित करना शुरू किया था।
इसी बीच, वे मानते हैं कि उनके पास एक शोध इंटर्न है, और समयरेखा से पता चलता है कि यह एक अलग आंतरिक मॉडल है। अगले हफ्ते उनके पास क्या होगा? अगले महीने? Anthropic के पास क्या है?
OpenAI बताता है कि अत्यधिक सक्षम AI महान लाभ प्रदान करता है, लेकिन निश्चित रूप से ऐसा ही है। यही कारण नहीं है कि सभी इतनी दृढ़ता से इतनी तेजी से आगे बढ़ रहे हैं। वे एक दौड़ में हैं।
यह OpenAI और उसके कर्मचारियों द्वारा हाल के दिनों में किए गए कई कॉलों में से एक और कॉल है, जो 'हमें इस पागलपन को समाप्त करने के लिए मिलकर काम करना होगा' और 'मुझे रोको किसी ने' की बड़ी मात्रा का मिश्रण हैं।
OpenAI : ये उपयोगी स्वचालित शोध क्षमताओं को विकसित करने के कारण हैं, लेकिन इसका मतलब यह नहीं है कि तेज RSI एक ऐसा परिणाम है जिसे हमें अवश्य हासिल करना चाहिए। आगे बढ़ना है या नहीं, और कैसे आगे बढ़ना है, यह हमारी मानव नियंत्रण बनाए रखने की क्षमता और लाभों तथा जोखिमों के बारे में सूचित लोकतांत्रिक विकल्पों पर निर्भर होना चाहिए।
हम अभी तक पूरी तरह से एलाइन किए गए, पूर्ण RSI तक सुरक्षित रूप से कैसे पहुँचना है, यह नहीं जानते। हम क्षमताओं के साथ-साथ एलाइनमेंट और सुरक्षा उपायों को भी स्केल करने के लिए काम कर रहे हैं। लेकिन हम यह नहीं मान सकते कि एलाइनमेंट और सुरक्षा में प्रगति की गति बनाई जाएगी, और अधिक सक्षम सिस्टम निगरानी करना कठिन हो सकते हैं।
सावधान एलाइनमेंट और सुरक्षा कार्य इस प्रयास के केंद्र में हैं, और यह आज एजेंटिक कोडिंग सिस्टम में देखी जाने वाली सुरक्षा समस्याओं को मापने और कम करने से शुरू होता है।
एक बार फिर, मैं उस दृष्टिकोण का विरोध करता हूँ कि सामान्य या वर्तमान समस्याएं मुख्य मुद्दा हैं, लेकिन हाँ, वे हमें बार-बार चेतावनी देने की कोशिश कर रहे हैं (कॉर्पोरेट भाषा को थोड़ा सरल करते हुए):
- OpenAI और Anthropic के पास रिकर्सिव सेल्फ-इम्प्रूवमेंट (RSI) तक पहुँचने का रास्ता है।
- यदि कोई भी अभी इसके लिए जाता है, तो संभावना है कि यह भयानक रूप से गलत हो जाएगा और सभी मर जाएंगे।
- OpenAI कुछ महंगी सावधानी बरतने के लिए तैयार है, लेकिन सीमाएं हैं, और बिना किसी सौदे या कानून के, कोई व्यक्ति जल्द ही इसे आज़माने की कोशिश करेगा।
पोस्ट का अधिकांश हिस्सा एक विस्तृत स्नैपशॉट है कि हाल के महीनों में, विशेष रूप से Astra के आंतरिक रूप से ऑनलाइन होने के बाद से, एजेंटिक सिस्टम ने OpenAI में RSI प्रगति में कितना योगदान दिया है। उत्तर है: काफी ज्यादा।
यदि कुछ आश्चर्यजनक है, तो यह है कि उपयोग इतने कम स्तर पर इतने लंबे समय तक क्यों बना रहा:
OpenAI : इस वर्ष की शुरुआत में, OpenAI में एजेंट उपयोग के आधार पर मध्यस्थ शोधकर्ता कोडिंग एजेंट्स का उपयोग केवल मामूली मात्रा में कर रहे थे। मध्य अगस्त तक, मध्यस्थ शोधकर्ता अपने काम में एजेंट्स को दैनिक रूप से एकीकृत कर रहे थे, API मूल्यों पर प्रति दिन $600 से अधिक का इन्फरेंस उपयोग कर रहे थे। हमारे शोध संगठन में 90वें प्रतिशत वाले उपयोगकर्ता अब प्रति दिन $7,000 से अधिक टोकन का उपयोग करते हैं।

OpenAI : जून 2026 से पहले, शोध संगठन में कुल एजेंट रनटाइम अभी भी कुल मानव श्रम से कम था। उसके बाद यह बदल गया है। मानक 8 घंटे के कार्य दिवस के संदर्भ में, मध्य अगस्त तक, कुल मिलाकर, शोध संगठन प्रति मानव श्रम के कार्य दिवस के लिए 3.1 एजेंट-कार्य दिवस का प्रयास करता है।

वे घमंड नहीं कर रहे हैं, और न ही वे स्वीकारोक्ति दे रहे हैं। वे चेतावनी दे रहे हैं।
यहाँ द्विआधारी मापन संभवतः इसे वास्तविक त्वरण की तुलना में कम दिखाता है:

मैं सोचता हूँ कि मनुष्य 4+ समवर्ती वर्कफ़्लो को ठीक से कैसे संभाल सकते हैं, कहते हुए कि मेरे पास दर्जनों खुले टैब और एक दर्जन सक्रिय पोस्ट ड्राफ्ट हैं।
पता चलता है कि यह जितना प्रभावशाली लगता है उतना नहीं है, क्योंकि वे सबएजेंट्स को वर्कफ़्लो के रूप में गिन रहे हैं। यह और भी आश्चर्यजनक बनाता है कि, जबकि मध्यस्थ शोधकर्ता प्रति दिन $600 खर्च करता है, फिर भी 30% लोग ऐसे हैं जो तीव्र उपयोग नहीं कर रहे हैं।
Claude Code और फिर Codex के बड़े पैमाने पर महत्वपूर्ण होने के आसपास से कोड शिपमेंट और प्रयोग तेजी से त्वरित हो रहे हैं।


हाल ही तक, AI का उपयोग मुख्य रूप से शोध और बुनियादी ढांचे के कोड को बनाने के लिए किया जाता था, और मनुष्य बाकी काम करते थे। अब AI रन लॉन्च करने, निगरानी करने और डिबग करने, तथा तकनीकी सहायता और समीक्षा में भी बहुत काम करता है, और परिणामों का विश्लेषण करने और अन्य क्षेत्रों में भी फैल रहा है।
उन्होंने हमारी नौकरियाँ ले लीं, 'मानव ट्रबलशूटर' संस्करण:

यहाँ प्रसिद्ध METR ग्राफ का एक अलग संस्करण है, उत्पादन कार्यों के साथ, स्थिर स्क्रीनशॉट के रूप में पढ़ना थोड़ा कठिन है लेकिन प्रगति तेज है। ये वर्ष नहीं हैं। ये महीने हैं:


OpenAI के रुकने को मात्रात्मक रूप से व्यक्त करना
उनके पास समय के साथ RL कंप्यूट खर्च का एक ग्राफ है, मुझे आश्चर्य है कि जुलाई 20 से पहले Astra का उपयोग कितना कम हुआ है, लेकिन वैसे भी। मैं नोटिस करता हूँ कि वे इसे वर्तमान तक विस्तारित नहीं करते हैं और संभवतः समय के साथ Astra का उपयोग फिर से बढ़ गया होगा:

इसी तरह दुनिया का अंत होगा
नए मॉडल के प्रशिक्षण के केवल कुछ दिनों के बाद, Navier-Stokes को साबित करने के लिए स्वार्म का उपयोग करना, क्या यह स्वयं गंभीर नियंत्रण हानि की घटना का जोखिम था? June Jimenez का तर्क है कि हाँ।
यदि आप एक नए मॉडल के 10,000 एजेंट स्वार्म को छोड़ देते हैं जिसे आपने संभवतः परीक्षण नहीं किया है, एक संभावित रूप से असंभव और निश्चित रूप से अत्यंत कठिन कार्य पर, और सामूहिक रूप से उसे 300 अरब टोकन देते हैं, तो यह और क्या कर सकता था? मैंने निश्चित रूप से 'शायद इसने लॉग्स पाने के लिए किसी तरह OpenAI को हैक कर लिया' पर विचार किया, लेकिन बहुत सारी संभावनाएं हैं।
जल्दी करो, समय नहीं है
जब एक पूर्व लैब कर्मचारी, यहाँ Andrew Ho, कहते हैं कि 'मैंने देखा है कि >3 महीने के समय सीमा में मेरी उत्पादकता 100% से अधिक नहीं बढ़ी है या शायद 50% से भी नहीं क्योंकि मैं विचलित हो जाता हूँ' एक बेयरिश होने का कारण के रूप में, तो यह सच होने पर भी बहुत आश्वासन देने वाला नहीं है। कल्पना करें कि हर तीन महीनों में केवल 50% अधिक उत्पादक होना और इसे बेयरिश मानना।
वे कह रहे हैं 'भले ही AGI अंततः प्राप्त किया जा सके, इसका मतलब है एक महत्वपूर्ण रूप से लंबी समयरेखा' उसी दिन जब Greg Brockman ने कहा 'AGI युग में आपका स्वागत है।'
इसके ऊपर, गणित में यह स्तर की प्रगति कुछ हफ्तों पहले अपेक्षित नहीं थी।
हर बार जब इनमें से कोई समस्या हल होती है, लोग इसे पीछे से समझाने की कोशिश करते हैं कि यह इतना आश्चर्यजनक नहीं था। वे अक्सर गलत होते हैं। नहीं, ज्यादातर लोगों ने, यहाँ तक कि ज्यादातर पूर्वानुमानकर्ताओं ने भी, यह नहीं माना था कि यह होगा। शायद आपने माना था। आखिरकार, आप बहुत बुद्धिमान हैं।
Henry Shevlin : इस वर्ष अप्रैल तक, भविष्यवाणी बाजारों ने AI को 2030 से पहले किसी भी Millennium Prize Problem को हल करने की 40% से कम संभावना दी थी






