दावा: AI वैज्ञानिक सफलताएँ हासिल कर सकता है।
प्रमाण: OpenAI के एक आंतरिक मॉडल ने असतत ज्यामिति में सबसे प्रसिद्ध अनुमान को हल कर दिया, अर्थात् इकाई दूरी समस्या के लिए ग्रिड की इष्टतमता (या उसकी कमी)। इस अनुमान में 80 साल पहले से शुरू होने के बाद से, बहुत रुचि के बावजूद, कोई प्रगति नहीं हुई थी। (हालाँकि इसके आस-पास बहुत गतिविधि और प्रगति हुई थी!)
मैं इस थ्रेड का उपयोग करके स्पष्ट रूप से समझाऊँगा कि क्या हुआ। आप विभिन्न जटिलता स्तरों पर स्पष्टीकरण हमारे ब्लॉगपोस्ट, सहयोगी पेपर में (जो दुनिया के अग्रणी गणितज्ञों द्वारा लिखा गया है और आज बाद में arxiv पर आएगा), रिपोर्ट में मूल AI प्रमाण के साथ, और मॉडल की (पुनःलिखित) विचार श्रृंखला में समस्या को हल करते हुए पा सकते हैं।
ठीक है, तो हम किस बारे में बात कर रहे हैं: सवाल बेहद सरल है; यदि मैं समतल में n बिंदु रखूँ, तो उन बिंदुओं के बीच कितनी दूरियाँ समान हो सकती हैं? (पुनर्स्केलिंग करके आप यह भी पूछ सकते हैं कि उनमें से कितनी दूरियाँ 1 के बराबर हो सकती हैं, इसलिए इसे 'इकाई' दूरी समस्या कहा जाता है)। खैर, निश्चित रूप से आप एक बिंदु को एक वृत्त के केंद्र में रख सकते हैं और बाकी सभी बिंदुओं को इस बिंदु पर केंद्रित एक वृत्त पर रख सकते हैं, जिसके परिणामस्वरूप n-1 दूरियाँ समान होंगी। और स्पष्ट रूप से अधिकतम n^2/2 दूरियाँ होती हैं। तो सच क्या है, क्या सबसे अच्छा संभव क्रम n का है या n^2 का?
जब एर्डोस ने 1946 में इस समस्या को प्रस्तुत किया, तो उन्होंने इस समस्या के लिए सबसे स्वाभाविक निर्माण का विश्लेषण किया: बिंदुओं को एक साधारण ग्रिड पर रखना। ठीक है, तो अब एक बिंदु के इस ग्रिड पर 4 पड़ोसी हैं, इसलिए निश्चित रूप से कम से कम क्रम 2
की दूरियाँ समान हैं (2n, 4n नहीं क्योंकि दोहरी गिनती होती है)। लेकिन थोड़ा और चतुर बनें, दूरी 1 वाले शीर्षों को देखने के बजाय (मान लें कि ग्रिड की भुजाएँ इकाई लंबाई की हैं) हम उन शीर्षों को देख सकते हैं जो sqrt(5) = sqrt(1+2^2) दूरी पर हैं। बस एक छोटी सी तस्वीर बनाएँ और आप देखेंगे कि उस दूरी पर 8 बिंदु हैं! वास्तव में, आप मूल रूप से एक L आकार में किसी भी दिशा में चलते हैं (और ऐसा करने के 8 तरीके हैं)। एर्डोस ने जो साबित किया (और मैं नीचे प्रमाण दूँगा) वह यह है कि आप इस तरह 2 की घातों में आगे बढ़ सकते हैं, लगभग u(n) = 2^{log(n)/loglog(n)} तक। तो इसका मतलब है कि ग्रिड में कम से कम लगभग u(n)
समान दूरियाँ हैं, और वास्तव में यह गणना ग्रिड के लिए इष्टतम है। ध्यान दें कि u(n)*n = n^{1+o(1)} (विशेष रूप से, n^{1+cst/loglog(n)})।
एर्डोस ने अनुमान लगाया कि ग्रिड मूल रूप से इष्टतम है: बिंदुओं के किसी भी विन्यास में अधिकतम n^{1+o(1)} समान दूरियाँ होनी चाहिए। यह वह समस्या है जिसमें पिछले 80 वर्षों में कोई प्रगति नहीं हुई, फिर से बहुत रुचि के बावजूद क्योंकि यह प्रश्न कितना बुनियादी और स्वाभाविक है। मेरी समझ में, एर्डोस का दृढ़ विश्वास था कि ग्रिड इष्टतम है, और वास्तव में निकट से संबंधित समस्या (उसी 1946 के पेपर में प्रस्तुत!) भिन्न दूरियों की समस्या में उनका समर्थन हुआ। भिन्न दूरियों की समस्या केवल प्रश्न का विपरीत संस्करण है, जहाँ पूछा जाता है कि n बिंदु न्यूनतम कितनी भिन्न दूरियाँ बना सकते हैं? ग्रिड आपको n/sqrt(log(n)) भिन्न दूरियाँ देता है, और 10 साल पहले गुथ और काट्ज़ द्वारा एक सफल पेपर ने दिखाया कि यह वास्तव में n/log(n) की निचली सीमा के साथ मूल रूप से इष्टतम है। दूसरे शब्दों में: सब कुछ इशारा कर रहा था कि ग्रिड इकाई दूरी समस्या के लिए भी एक इष्टतम उम्मीदवार है।
यहाँ OpenAI का आंतरिक मॉडल आता है। इसने वास्तव में इस लंबे समय से चली आ रही मान्यता को STRONGLY गलत साबित कर दिया और कुछ delta>0 के लिए n^{1+delta} क्रम की समान दूरियों के साथ एक नया (दिमाग हिला देने वाला) निर्माण खोजा। इस सफलता को मॉडल ने कैसे हासिल किया, इसके बारे में कुछ शब्द कहने के लिए मुझे पहले आपको एर्डोस के प्रमाण के बारे में थोड़ा और बताना होगा और 2^{log(n)/loglog(n)} कहाँ से आता है। पता चलता है कि अभाज्य संख्याएँ आसपास छिपी हुई हैं!
हम अभाज्य संख्याओं के बारे में दो बातें मान लेंगे: पहला, अभाज्य संख्या प्रमेय जो कहता है कि n से नीचे लगभग n/log(n) अभाज्य संख्याएँ हैं (वास्तव में हमें थोड़ा अधिक परिष्कृत संस्करण चाहिए, लेकिन इस व्याख्या के स्तर के लिए इससे कोई फर्क नहीं पड़ता)। दूसरा, यदि कोई अभाज्य संख्या 1 मॉड्यूलो 4 के बराबर है, तो वह गाऊसी पूर्णांकों (जो a+ib के रूप के पूर्णांक हैं जहाँ a और b पूर्णांक हैं) पर गुणनखंडित होती है, अर्थात् इस मामले में p = z bar{z}. उदाहरण के लिए 5=(1+2i)(1-2i), और यह आपको ऊपर याद दिलाना चाहिए जब हमने sqrt(5) = sqrt(1+2^2) दूरी पर 8 शीर्ष गिने थे। ठीक है, तो अब पहले k अभाज्य संख्याएँ लें जो 1 मॉड्यूलो 4 के बराबर हैं, p_1, …, p_k, और संख्या R=p_1…p_k = z_1 bar{z_1} … z_k \bar{z_k} पर विचार करें। मुख्य बिंदु यह है कि हमें इससे 2^k गाऊसी पूर्णांक मिलते हैं जिनका मापांक sqrt{R} के बराबर है, प्रत्येक अभाज्य p_i के लिए या तो z_i या bar{z_i} लेकर और फिर उनका गुणनफल लेकर (महत्वपूर्ण रूप से हम इस तथ्य का उपयोग करते हैं कि मापांक गुणात्मक है और संयुग्मन मापांक को संरक्षित करता है)। दूसरे शब्दों में, हमने ग्रिड पर मूल बिंदु से sqrt{R} दूरी पर 2^k बिंदु पाए हैं! (सटीक होने के लिए हमें यह भी साबित करना होगा कि ये बिंदु भिन्न हैं, जहाँ Z[i] में अद्वितीय गुणनखंडन महत्वपूर्ण हो जाता है, और यह कुछ ऐसा है जो नए प्रमाण में महत्वपूर्ण होगा, लेकिन इसे यहाँ अनदेखा करते हैं।) तो अब हमें बस यह देखना है कि हम k को कितना बड़ा ले सकते हैं जबकि sqrt{R}<sqrt{n} रखें (बाद वाला n बिंदुओं वाले ग्रिड की भुजा की लंबाई है)। हमारे पास log(R) = sum_{i=1}^k log(p_i) है, जो अभाज्य संख्या प्रमेय द्वारा लगभग sum_{i=1}^k log(ilog(i)) है, जो मूल रूप से klog(k) है। तो हमें klog(k) को log(n) से कम चाहिए, इसलिए k लगभग log(n)/loglog(n) होना चाहिए, और हमें अभीष्ट 2^k = 2^{log(n)/loglog(n)} मिलता है।
उपरोक्त एक-पैराग्राफ तर्क (चतुर, मैं मानता हूँ) 80 वर्षों तक SOTA बना रहा। अब AI ने जो किया, मेरी राय में, वह काफी पागलपन भरा है। सबसे पहले, जैसा कि CoT में देखा जा सकता है, इसने लगभग तुरंत ही ग्रिड निर्माण में सुधार करने का प्रयास करने का निर्णय लिया, जो कि अधिकांश गणितज्ञ अब तक करने की कोशिश कर रहे थे, इसके विपरीत है। मेरी सीमित समझ में, इसने जो रणनीति अपनाई (और इसे पूरी तरह से निष्पादित किया) मोटे तौर पर इस प्रकार है: क्या यह बढ़िया नहीं होगा यदि अभाज्य संख्याओं को विभाजित करने के और तरीके हों? शायद यदि हम Q के अलावा किसी अन्य क्षेत्र पर विचार करें, उच्च घात वाला, तो यह पूर्णांक Z को उस क्षेत्र के पूर्णांक वलय से बदलकर काम कर सकता है? शायद 2^k के बजाय हम 2^{f k} प्राप्त कर सकते हैं जहाँ f क्षेत्र की घात है? पहला अनुमान चक्रवर्ती विस्तारों पर ध्यान देना होगा, लेकिन मॉडल अपने CoT में पहले ऐसा करता है और जल्दी से महसूस करता है कि यह काम नहीं करेगा। यह कड़ी मेहनत करता रहता है और अंततः आदर्शों की भाषा लाता है जहाँ गैर-अद्वितीय गुणनखंडन हो सकते हैं जिन्हें वर्ग समूह द्वारा संभाला जाता है। अब आपको यह सोचना शुरू करना होगा कि आप सभी मापदंडों को नियंत्रित करके उच्च घात वाले क्षेत्रों का निर्माण कैसे करेंगे (पहले वर्ग संख्या, लेकिन यह एक उच्च-आयामी जालक भी होगा, इसलिए इसे वापस सम्मिश्र तल पर प्रक्षेपित करने की आवश्यकता होगी, और यह प्रक्षेपण कुछ संकुचन प्रेरित करेगा जिसे नियंत्रित करने की आवश्यकता है, और इसी तरह)। यहाँ मॉडल वर्ग क्षेत्र सिद्धांत से एक हथौड़ा, गोलोड-शफारेविच से अनंत टावरों का उपयोग करता है। इस बिंदु पर, आपके लिए विषय के वास्तविक विशेषज्ञों द्वारा सहयोगी पेपर पर जाना शायद बेहतर होगा!
ठीक है, मैं एक कदम पीछे हटता हूँ: मूल रूप से AI ने जो किया वह यह है कि वह गणित के अपने विशाल ज्ञान का उपयोग करके असतत ज्यामिति और बीजगणितीय संख्या सिद्धांत के बीच एक संबंध देखने में सक्षम था, और फिर महत्वपूर्ण रूप से वह हर कदम पर विशेषज्ञ-स्तरीय गणनाओं के साथ तर्क को कुशलतापूर्वक जोड़ने में सक्षम था। यह वास्तव में एक सफल परिणाम है, फिर भी साथ ही यह भी सच है कि मॉडल ने कोई 'नया गणित' 'आविष्कार' नहीं किया (मान लें कि इसने कोई वैकल्पिक वर्ग क्षेत्र सिद्धांत का आविष्कार नहीं किया, इसका जो भी अर्थ हो)। लेकिन यह महत्वपूर्ण बिंदु है: केवल एक वैज्ञानिक क्षेत्र के सभी परिणामों को गहराई से जानने में सक्षम होना, और सभी ज्ञात तर्कों का विशेषज्ञता और सही मापदंडों के चयन के साथ उपयोग करने में सक्षम होना, अकेला ही बहुत सारी सफलताओं को जन्म दे सकता है, और यह केवल गणित तक सीमित नहीं है, इस प्रकार का (अत्यधिक) ठोस विशेषज्ञ निष्पादन कई वैज्ञानिक प्रगतियों का मुख्य आधार है।
अंत में, इस बारे में एक शब्द कि आगे गणित के लिए इसका क्या अर्थ है। सहयोगी पेपर में अग्रणी गणितज्ञों से इस पर बहुत सारे विचार हैं, इसलिए बेहतर होगा कि आप सीधे वही पढ़ें जो उन्होंने कहा है। लेकिन एक दिलचस्प बात यह है कि हम मॉडल के प्रमाण को arxiv पर सबमिट नहीं कर रहे हैं। वास्तव में कोई भी मानव लेखक पारंपरिक अर्थों में योगदान का दावा नहीं कर सकता (हालाँकि निश्चित रूप से यह वास्तव में OpenAI के सभी मानव शोधकर्ताओं के फल का परिणाम है जिन्होंने इस अद्भुत मॉडल को बनाया, साथ ही सामान्य रूप से मानवता जो सहस्राब्दियों से गणित विकसित कर रही है ...)। दूसरी ओर, मनुष्यों द्वारा लिखा गया सहयोगी पेपर केवल पल के महत्व पर विचारों से परे जाता है, यह प्रमाण को पचाता भी है, इसे व्यापक संदर्भ में रखता है, और इसे थोड़ा सरल भी करता है। जबकि समुदाय को इन नए विकासों के लिए पूरी तरह से अनुकूल होने में अभी भी बहुत काम करना है, हम मानते हैं कि AI प्रमाण को मनुष्य की उसकी समझ से अलग करने का यह सिद्धांत पहेली का एक महत्वपूर्ण टुकड़ा होगा।





