İddia: Yapay zeka bilimsel atılımlar yapabilir.
Kanıt: OpenAI'in dahili bir modeli, ayrık geometrinin en ünlü sanısını, yani grid yapısının birim uzaklık problemi için optimalliği (ya da optimallikten yoksunluğu) sorununu çözdü. Bu sanı, 80 yıl önce ortaya atıldığından bu yana, büyük ilgiye rağmen hiçbir ilerleme kaydetmemişti. (Yine de etrafında çok fazla etkinlik ve ilerleme vardı!)
Ne olduğunu somut olarak açıklamak için bu yazıyı kullanayım. Ayrıca, farklı karmaşıklık seviyelerindeki açıklamaları blog yazımızda, dünyanın önde gelen matematikçileri tarafından yazılan eşlik eden makalede (bugün arxiv'te yayımlanacak), orijinal AI kanıtını içeren raporda ve modelin sorunu çözerkenki düşünce zincirinde bulabilirsiniz.
Peki neden bahsediyoruz: soru aptalca basit; düzleme n nokta koyarsam bu noktalar arasındaki mesafelerden kaç tanesi aynı olabilir? (Yeniden ölçeklendirerek bu mesafelerden kaç tanesinin 1'e eşit olabileceğini de sorabilirsiniz, bu yüzden "birim" uzaklık problemi adı verilmiştir). Elbette, bir noktayı bir dairenin merkezine, diğer tüm noktaları da bu nokta merkezli bir daire üzerine koyabilirsiniz, bu da n-1 mesafenin aynı olmasıyla sonuçlanır. Ve açıkçası en fazla n^2/2 mesafe vardır. Peki gerçek nedir, yapılabilecek en iyi şey n mertebesinde mi yoksa n^2 mertebesinde mi?
Erdos problemi 1946'da ortaya attığında, bu problem için en doğal yapıyı analiz etti: noktaları basit bir grid üzerine koymak. Şimdi bir noktanın bu grid üzerinde 4 komşusu var, dolayısıyla en az 2
mertebesinde aynı mesafe vardır (2n, 4n değil, çünkü çift sayım söz konusu). Ama biraz daha akıllı olalım, mesafe 1 olan köşelere (diyelim gridin kenar uzunlukları birim) bakmak yerine, sqrt(5) = sqrt(1+2^2) uzaklığındaki köşelere bakabiliriz. Küçük bir resim çizin ve bu mesafede 8 nokta olduğunu göreceksiniz! Gerçekten de, temel olarak herhangi bir şekilde döndürülmüş bir L şekli boyunca hareket edersiniz (ve bunu yapmanın 8 yolu vardır). Erdos'un kanıtladığı (ve aşağıda ispatını vereceğim) şey, bu şekilde 2'nin kuvvetleri halinde, yaklaşık u(n) = 2^{log(n)/loglog(n)}'e kadar devam edebileceğinizdir. Yani grid, en az yaklaşık u(n)
kadar aynı mesafeye sahiptir ve aslında bu hesaplama grid için optimaldir. u(n)*n = n^{1+o(1)} olduğuna dikkat edin (özellikle, n^{1+cst/loglog(n)}).
Erdos'un varsaydığı şey, gridin esasen optimal olduğuydu: herhangi bir nokta konfigürasyonu en fazla n^{1+o(1)} kadar eşit mesafeye sahip olmalıdır. Bu, son 80 yılda sıfır ilerleme kaydeden problemdir ve yine, bu sorunun ne kadar temel ve doğal olduğu göz önüne alındığında büyük ilgiye rağmen böyledir. Benim anladığım, Erdos gridin optimal olduğuna güçlü bir şekilde inanıyordu ve aslında, aynı 1946 makalesinde tanıtılan farklı mesafeler problemi olarak adlandırılan çok yakından ilişkili problemde haklı çıktı. Farklı mesafeler problemi, sorunun tam tersi versiyonudur: n noktanın oluşturabileceği farklı mesafelerin minimum sayısı nedir? Grid size n/sqrt(log(n)) farklı mesafe verir ve 10 yıl önce Guth ve Katz tarafından yayımlanan çığır açıcı bir makale, bunun n/log(n) alt sınırı ile gerçekten de esasen optimal olduğunu gösterdi. Başka bir deyişle: her şey, gridin birim uzaklık problemi için de optimal bir aday olduğuna işaret ediyordu.
İşte bu noktada OpenAI'in dahili modeli devreye giriyor. Model aslında bu uzun süredir devam eden inancı GÜÇLÜ bir şekilde çürüttü ve delta>0 için n^{1+delta} mertebesinde eşit mesafe sayısına sahip yeni (akıl almaz) bir yapı buldu. Bu atılımın model tarafından nasıl başarıldığına dair birkaç kelime söylemek için, önce size Erdos'un ispatı ve 2^{log(n)/loglog(n)}'in nereden geldiği hakkında biraz daha bilgi vermem gerekiyor. Görünüşe göre asal sayılar işin içinde!
Asal sayılar hakkında iki şey varsayacağız: ilk olarak, n'den küçük yaklaşık n/log(n) asal sayı olduğunu söyleyen asal sayı teoremi (aslında biraz daha rafine bir versiyona ihtiyacımız var ama bu açıklama seviyesi için önemli değil). İkinci olarak, eğer bir asal sayı 1 modulo 4'e eşitse, Gauss tamsayıları (a ve b tamsayı olmak üzere a+ib formundaki tamsayılar) üzerinde çarpanlarına ayrılır, yani bu durumda p = z bar{z}. Örneğin 5=(1+2i)(1-2i) ve bu, yukarıda sqrt(5) = sqrt(1+2^2) mesafesinde 8 köşe saydığımızı hatırlatmalı. Şimdi, 1 modulo 4'e eşit olan ilk k asal sayıyı alalım, p_1, …, p_k, ve R=p_1…p_k = z_1 bar{z_1} … z_k \bar{z_k} sayısını ele alalım. Kilit nokta, her bir p_i asalı için z_i veya bar{z_i}'yi seçip çarpımlarını alarak (kritik olarak, modülün çarpımsal olduğunu ve eşleniğin modülü koruduğunu kullanıyoruz), modülü sqrt{R}'ye eşit olan 2^k tane Gauss tamsayısı elde etmemizdir. Başka bir deyişle, grid üzerinde orijinden sqrt{R} uzaklıkta 2^k nokta bulduk! (Kesin olmak gerekirse, bu noktaların farklı olduğunu da kanıtlamamız gerekir, burada Z[i]'deki tek türlü çarpanlara ayırma önem kazanır ve bu, yeni ispatta da anahtar rol oynayacaktır, ancak bunu şimdilik geçelim.) Şimdi yapmamız gereken, sqrt{R}<sqrt{n} (ikincisi n noktalı bir gridin kenar uzunluğu) koşulunu sağlarken k'yı ne kadar büyük alabileceğimize bakmak. log(R) = sum_{i=1}^k log(p_i) ki asal sayı teoremine göre yaklaşık sum_{i=1}^k log(ilog(i)) yani kabaca klog(k) eder. Yani klog(k)'nin log(n)'den küçük olması gerekir, bu nedenle k yaklaşık log(n)/loglog(n) olmalıdır ve iddia edilen 2^k = 2^{log(n)/loglog(n)}'i elde ederiz.
Yukarıdaki tek paragraflık argüman (size söyleyeyim, zekice bir argüman) 80 yıldır SOTA (en son teknoloji) olarak kaldı. Şimdi AI'ın yaptığı şey bence oldukça çılgınca. Her şeyden önce, CoT'te (düşünce zinciri) görülebileceği gibi, neredeyse hemen grid yapısını iyileştirmeye çalışmaya karar verdi ki bu, çoğu matematikçinin şimdiye kadar yapmaya çalıştığının tam tersiydi. Sınırlı anlayışımla, bulduğu (ve mükemmel bir şekilde uyguladığı) strateji kabaca şöyle: Asal sayıları bölmenin daha fazla yolu olsaydı harika olmaz mıydı? Belki Q'dan başka, daha yüksek dereceli bir cisim düşünürsek, bu, Z tamsayılarının yerine o cismin tamsayılar halkasını koyarak çalışabilir mi? Belki 2^k yerine 2^{f k} elde edebiliriz, burada f cismin derecesi? İlk tahmin, siklotomik genişlemelere bakmak olacaktır, ancak model CoT'inde önce bunu yapıyor ve hızlıca bunun işe yaramayacağını anlıyor. Sıkı çalışmaya devam ediyor ve sonunda, bir sınıf grubu tarafından yönetilen tek türlü olmayan çarpanlara ayırmanın olabileceği idealler dilini devreye sokuyor. Şimdi, tüm parametrelerin kontrol edildiği yüksek dereceli cisimlerin nasıl inşa edileceğini düşünmeye başlamanız gerekiyor (önce sınıf sayısı, ancak bu aynı zamanda daha yüksek boyutlu bir kafes olacak, bu nedenle karmaşık düzleme geri yansıtılması gerekecek ve bu yansıma kontrol edilmesi gereken bir çöküşe yol açacak, ve böyle devam ediyor). İşte model bu noktada sınıf cisim teorisinden bir çekiç kullanıyor: Golod-Shafarevich'in sonsuz kuleleri. Bu noktada, daha fazla ayrıntı için konunun gerçek uzmanları tarafından yazılmış eşlik eden makaleye yönelmeniz muhtemelen daha iyi olacaktır!
Pekala, bir adım geri çekileyim: temelde AI'ın yaptığı şey, tüm matematik hakkındaki geniş bilgisini kullanarak ayrık geometri ile cebirsel sayı teorisi arasında bir bağlantı görebilmesi ve ardından kritik bir şekilde, her adımda uzman düzeyinde hesaplamalarla argümanı ustalıkla birbirine bağlayabilmesidir. Bu gerçekten çığır açıcı bir sonuçtur, ancak aynı zamanda modelin herhangi bir "yeni matematik" icat etmediği de doğrudur (diyelim ki, ne anlama geliyorsa, alternatif bir sınıf cisim teorisi icat etmedi). Ancak asıl önemli nokta şu: bir bilimsel alandaki tüm sonuçları derinlemesine bilmek ve bilinen tüm argümanları uzman bir şekilde ve doğru parametre seçimiyle kullanabilmek, tek başına birçok atılıma yol açabilir ve bu sadece matematikle sınırlı değildir, bu tür (son derece) sağlam uzman yürütmesi, birçok bilimsel ilerlemenin temelini oluşturur.
Son olarak, bunun matematik için ileriye dönük ne anlama geldiği hakkında bir söz. Eşlik eden makale, önde gelen matematikçilerin bu konuda birçok yansımasını içeriyor, bu nedenle onların söyleyeceklerini okumak daha iyi. Ancak dikkat edilmesi gereken ilginç bir şey, modelin ispatını arxiv'e göndermiyoruz. Gerçekten de, geleneksel anlamda katkıda bulunduğunu iddia edebilecek hiçbir insan yazar yok (tabii ki bu aslında bu harika modeli yaratan OpenAI'deki tüm insan araştırmacıların ve ayrıca bin yıldır matematiği geliştiren insanlığın bir ürünü olsa da ...). Öte yandan, insanlar tarafından yazılan eşlik eden makale, anın önemi hakkındaki yansımaların ötesine geçiyor; ispatı sindiriyor, daha geniş bir bağlama oturtuyor ve hatta biraz basitleştiriyor. Topluluğun bu yeni gelişmelere tam olarak uyum sağlamak için hâlâ yapacak çok işi olsa da, AI ispatını insanın onu anlamasından ayırma ilkesinin, bulmacanın önemli bir parçası olacağına inanıyoruz.





