Yeni Yapay Zeka Modeli, Bin Yıl Ödülü'nü Çözdü

@TheZvi
İNGILIZCE13 Eyl 2026
135K
199
17
16
237

TL;DR

OpenAI'ın yeni modeli Navier-Stokes Bin Yıl Ödülü'nü çözdü; bu gelişme, övgü dağılımı, veri gizliliği ve yapay zeka destekli araştırma hızının endişe verici temposu hakkında yoğun tartışmalara yol açtı.

Bin Yıl Ödülü'nün ilki, Navier-Stokes, Yapay Zeka'ya düştü.

Yapay zeka destekli matematiksel araştırmalarda yeni ilerlemelerle ilgili olması gereken olumlu bir hikaye ile hızlı yapay zeka gelişmeleri hakkında panik yapmak için başka bir fırsatın karışımı olan derinden talihsiz bir durum ortaya çıktı.

Ya da bizim burada dediğimiz gibi: Salı günü.

Gerçek Hikaye, Astra'dan Daha İyi Olan Yeni Modeldir

Gözünüz ödüllerde olsun. Burada üç hikaye var.

Birinci hikaye, ikinci hikayeden çok daha önemli; ikinci hikaye de üçüncü hikayeden çok daha önemli.

  1. OpenAI’ın bir sonraki modeli, Astra’dan bir nesil öne geçmek için bir hafta harcadı ve bunu bize söylüyorlar çünkü herkes neler olduğu konusunda tamamen çılgına dönmüş durumda. Ya da resmi dilde: ‘Yapay zeka ilerleme hızı ve yaklaşan modellerden neler beklenmesi gerektiği konusunda dünyayı bilgilendirmenin önemli olduğuna inanıyoruz’ ve ‘ilerleme hızı konusunda daha bilinçli seçimler gerekebilir.’
  2. Bu yeni yapay zeka, eğitime başladıktan sekiz gün sonra Navier-Stokes problemini çözdü.
  3. Navier-Stokes ile ilgili matematikte kimin kredi alacağına dair bir sürü drama.

Jeffrey Ladish : Navier–Stokes problemi etrafındaki insan dramalarına bakmadım ama bana bir dakika verin çünkü AZIZİM YAPAY ZEKA BİR MİLENNIUM PROBLEMİNİ ÇÖZDÜ.

En üstteki hikayeyi yeterince vurgulayamıyorum.

Her üç hikayeyi de anlatmaya devam edeceğim ama tekrar: Gözünüz ödüllerde olsun.

Sahneyi Hazırlamak

Bu özel salı gününün hikayesi sabah başlıyor.

Tristan Buckmaster ve Levent Alpoge, bir yıl boyunca çalışmışlardı ve bize dikkat çekici sonuçlar serisi sunuyorlardı: Sıkıştırılamaz gözenekli ortamlar, Boussinesq için ve 3D sıkıştırılamaz Euler için pürüzsüz zorlama ile sonlu zamanlı patlama (blowup). Ayrıca hipo-dissipatif Navier-Stokes için bir patlama elde ettiklerine inanıyorlar ancak bu sonucun Lean doğrulaması henüz tamamlanmadı.

Tristan Buckmaster: Bu programın parçası olduğumuz çalışma ne biz tarafından başlatıldı ne de Büyük Dil Modelleri tarafından önerildi. Bu programın temel fikrinin kredisi Diego Cordoba ve Luis Martınez-Zoroa’ya ait; onlar birkaç yıldır zorlanmış patlamaların inşasını keşfediyorlardı. Biz onların çalışmalarını başlangıç noktası olarak aldık ve Büyük Dil Modellerini kullanarak programlarını tamamlamaya ittik.

Somut olarak, Levent ve benim yaptığımız şey, Cordoba ve Martınez-Zoroa programını almak (bu program pürüzlü zorlama ile patlama sonuçları elde etmişti) ve LLM’lerden büyük ölçüde yardım alarak bunu pürüzsüz zorlamaya ve sıkıştırılamaz Euler denklemlerine taşımaktı. Bu saldırı hattını mümkün kılan fikirler Cordoba ve Martınez-Zoroa’ya aittir. Meslektaşlarıma özel olarak söylediğim şeyi açıkça belirtmeme izin verin: Bu çalışma bütünü ışığında, Luis Martınez-Zoroa’nın Fields Madalyası hak ettiğine inanıyorum.

Şu ana kadar her şey harika. Not ettiği gibi, tüm ileri matematiğin gelecekte nasıl işleyeceği konusunda yeniden düşünmeyi gerektiriyor. Terence Tao, altta yatan sonuçlar üzerine yorumlar sunuyor.

O kadar da iyi olmayan kısım ise, kanıtları matematikçiler arasında okunabilir kabul edilen hale getirmek için gerekli haftaları harcama fırsatı bulamadan erken yayınlamak zorunda hissetmeleriydi. Buckmaster, raporların görünüşü için doğrudan özür diliyor ve özellikle Euler yazımını yapay zeka çöpüyle (AI slop) karşılaştırıyor.

Ne oldu?

Bir Dedikodu Duydum

1 Eylül’de OpenAI, iki Millennium Probleminin çözüldüğüne dair (yanlış) bir dedikodu duydu. Başka birinin dünyayı daha iyi bir yer haline getirebileceği olasılığına tepki olarak OpenAI, Astra’dan daha güçlü iç bir model kullanarak çözülmemiş tüm Millennium Problemlerini keşfetmek için milyonlarca dolarlık çıkarım (inference) harcadı ve Navier-Stokes’un tamamını 88 saatte çözdü, ayrıca Lean formalizasyonu ve doğrulamasını yapmak için Astra’ya ek 17 saat verdi.

Bunu ‘OpenAI, yeni bebeklerinin neler yapabileceğini merak etti’ şeklinde görebilirsiniz ya da da ‘Anthropic projesi olduğunu düşündükleri şeyi kapmak için milyonlarca dolar harcadılar’ şeklinde görebilirsiniz. Benim bahsim biraz A sütunundan, biraz B sütunundan yönünde.

Tek gereken dedikoduydu.

Fiyatımız Ucuz

OpenAI : Denenen tüm problemler genelinde, ajanlar 4,9 milyon mesaj gönderdi ve yaklaşık 300 milyar çıktı token kullandı. Navier–Stokes problemini çözme sürecinde ise ajanlar 2,7 milyon mesaj gönderdi ve yaklaşık 130 milyar çıktı token kullandı.

Zvi Mowshowitz - inline image

Hangi maliyetleri saydığınıza bağlı olarak, bu durum normal bir müşteri için yaklaşık 22 milyon dolara mal olurdu veya dahili marjinal maliyetlerle birkaç milyon dolara. İşe yararsa küçük bir fiyat ama aynı zamanda insanların neden iki adım sonrasını düşünmedikleri de çılgınca.

roon (OpenAI): diğer tüm teknolojiler gibi, eşdeğer ajan sürünüz muhtemelen bir yıl içinde 1,50 dolara mal olacak. Bugünkü maliyetler ne olursa olsun, tüm bunlar benzeri görülmemiş bir Aydınlanma anlamına gelecek

Yani, hayır, belki 150 bin dolar ya da şanslıysanız 15 bin dolar, ama nokta geçerli.

Sam Altman (CEO OpenAI): of be, yapay zeka gerçekten bir balonmuş, tokenları zarara sattıklarını duydum, bunun sadece 1 milyon dolar değerinde olduğunu biliyorlar mıydı?

Bir Millennium Ödülü sonucu, bir milyon dolardan çok daha fazla değerlidir. OpenAI ödül parasını talep etmeyi niyet etmiyor. Bu hiç kimse için asla para değildi. Her zaman kredi meselesiydi.

Bir Suçlama Ortaya Atılıyor

İnternet dedikodularını duyduktan sonra Buckmaster, OpenAI’a ulaştı ve Buckmaster’e göre OpenAI’dan Sebastien Bubeck, dahili bir OpenAI modelinin son birkaç gündür zorlanmış Navier-Stokes denklemleri için sonlu zamanlı patlama kanıtı ürettiğini söyledi. Buckmaster, iki görüşme süresince başlangıçta yanıltıldığının ve tüm bir ekibin 'çılgın' miktarda işlem gücü kullanarak problem üzerinde çalıştığının netleştiğini iddia ediyor.

Ki bu sayının, neyin sayıldığına bağlı olarak 130 veya 300 milyar çıktı token olduğunu artık biliyoruz.

Bu kısım doğruysa, oldukça kötü olurdu.

Tristan Buckmaster: Bana iki teklif sunuldu.

Birincisi, bizim Euler sonucumuzu yayınlamamız ve OpenAI’ın ertesi gün Navier-Stokes sonucunu yayınlamasıydı.

İkincisi ise, Euler’ı yayınladıktan sonra, dahili bir OpenAI modelinin bunu çözdüğünü kabul ederek Navier-Stokes sonucunu sunan bir makaleyi yalnızca benim yazmam istendi. Sebastien, Levent’in yazarlıktan çıkarılmasını iki kez iddia etti ve eğer Levent Anthropic’ta çalışmasaydı ve bu durumun sinir bozucu olmaması halinde her şeyin basit olacağını söyledi. Ayrıca, eğer OpenAI bizden sonra yayın yaparsa, Clay Ödülü’nü hak ettiğimizi ve "probleme en yakın insanlar" olduğumuzu söyleyecekleri de ifade edildi. Her iki teklifi de reddettim.

Eğer OpenAI önerilen şekilde sonucunu yayınlarsa, yaşananları kamuoyuyla paylaşacağımı söyledim. Cevap, “Neden kariyerini mahvedesin?” oldu. Ben de bir akademisyen olduğumu ve neden kamuoyuyla paylaşmanın kariyerimi mahvedeceğini düşündüğünü sordum. Cevap, “Benim nazik olmamı istemiyorsan, o zaman nazik olmak zorunda değilim.”… Ne iddia etmediğim konusunda net olmak istiyorum. OpenAI’ın kanıtını görmedim. Modellerinin ne yaptığını veya nasıl yaptığını bilmiyorum. Verilerimizin kullanılıp kullanılmadığını bilmiyorum. Kimseyi hiçbir şeyle suçlamıyorum. Bana söylenenleri, ne zaman söylendiğini ve bana ne teklif edildiğini belirtiyorum. Alternatifin, yanlış olduğunu bildiğim bir şeyi söyleyen ardışık duyurulara izin vermek olması nedeniyle bunu belirtiyorum.

Ya da Levent Alpoge kendi tarafını anlatırken, Sebastien cevap veriyor:

levent : “ürünlerimizi kullanmalarından türetilen anonimleştirilmiş verilerin modellerimizi iyileştirmeye yardımcı olduğunu dışlayamayız.”

Yani dürüstçe ortaya çıkıp itiraf ettikleri için kendilerini tebrik ederim.

(Şimdilik kanıt, daha önce sahip olduğumuz başka bir euler patlama kanıtına daha çok benziyor, ki bu kanıtın ansatz adlandırması üzerinden "smooth criminale" gibi aptalca kelime oyunları yapıyorduk, Tristan’ın çok daha iyi olan "ideal fluids explode" oyununun aksine)

Şimdi burada düşüncelerim hakkında biraz bilgi vereyim. Aslında bunun üzerinde işbirliği yapmaktan heyecan duyardım, oai’da sevdiğim çok kişi var (tamam, açıkça bazıları tüm bu durumun parçası oldukları için dolaylı olarak bana pislik yaptı ama ben büyüdüm, onları hala seviyorum), o adımdaki yazarlık konusunda umurumda bile değil, benim, Tristan ve oai’daki her tam zamanlı çalışan olabilirdi, umurumda değil (bu konuda Tristan katılmaz:p). Ama koridorda yüksek sesle konuşulanları, özellikle de kağıttan çıkarılmam karşılığında bir Millennium Ödülü teklif edildiği kısmı duyduğumda, kararın verildiği ve işlerin kilitlendiği oldukça açıktı. Oldukça tuhaf, stratejik olmayan ve gereksiz, çünkü benim tarafımda işler çoğunlukla kurumsal bir şeyden ziyade köşede rastgele şeylerle yolo yapan ben ve claude idi. Laboratuvarların işbirliği yapması fikrini ve hatta bilimsel ilerleme açısından daha iyisini seviyorum. Yazık!

Sebastien Bubeck : Hiçbir şey kilitlenmedi, sadece konuşmaya istekliydik ama siz bizimle konuşmadınız ... üzgünüm ama bu sadece doğru değil, çözüm bulmak için fazlasıyla fazlasını yapmaya ve istediğiniz kadar tartışma yürütmeye hazırdık.

Sebastien, herhangi bir yanlış yaptığı iddiasını kesinlikle reddediyor, Noam Brown da öyle, ve Sebastien, iyi niyeti gösterdiğini söylediği ekran görüntüleri paylaşıyor.

Zvi Mowshowitz - inline image

Ayrıca bir karşı suçlama:

Alexey Guzey : Anthropic’te birçok arkadaşım var. OpenAI’a katıldığımdan beri neredeyse hepsi benimle konuşmayı bıraktı.

Levent’in Sebastian’la duyuru planlarını tartışmak için konuşmayı reddetmesi ve ardından OpenAI’ı bununla suçlaması tamamen şaşırtıcı değil.

Sam Altman da ekibinin etik davrandığını kesinlikle iddia ediyor ve iyi niyetle işbirliği yapmaya çalıştıklarını söylüyor.

Bu Fikri Nereden Buldunuz?

Bunun ima ettiği ve birçok kişinin çıkardığı sonuç, OpenAI’ın Codex sohbet kayıtlarından sonuçlarının bir kısmını çaldığına veya sohbet kayıtlarının eğitim verisinde kullanıldığına ve bunun sonuca katkıda bulunduğuna dair yumuşak bir suçlama olduğuydu.

Charles 🔸

: Büyük şirketlerin neden ZDR (Zero Data Retention - Sıfır Veri Saklama) istediğinin kanıtı, Örnek A

OpenAI: Olasılık düşük olsa da, ürünlerimizi kullanmalarından türetilen anonimleştirilmiş verilerin

modellerimizi iyileştirmeye yardımcı olduğunu dışlayamayız⁠. Ancak kanıtlarımız önemli ölçüde farklı ve hatta Euler durumunda (zorlanmış vs. zorlanmamış) ispatlanan kesin sonuçlar bile farklı.

Codex verisinin eğitim koşularında hiçbir şekilde kullanılmadığına dair artık açık bir teyidimiz var:

roon (OpenAI): İlk duyuru sırasında, codex (opt-in) verilerinin nerede kullanıldığına ve eğitim koşularına girip girmediğine bakmadan, avukatça kesin gerçeği söylemeye çalışan kişilerin olduğu bir aradaydım. Artık bunun imkansız olduğu ve ihtimalin 0 olduğu açık.

Kullanıcı verilerinin herhangi bir yöntemle burada herhangi bir etkisi olmasının son derece düşük bir olasılık olduğu konusunda Sholto Douglas’a katılıyorum:

will depue : OAI araştırmacılarının Tristan’ın özel codex sohbetlerini casusluk yoluyla izlediğine dair kelimenin tam anlamıyla sıfır şans var. Sanırım farkında değilsiniz ama openai, diğer büyük düzenlenmiş çevrimiçi platformlar gibi, kullanıcı veri erişim izinlerini son derece sıkı tutuyor. Artık 2010 yılı değil beyler.

Sholto Douglas (Anthropic): fwiw (benim fikrimce), kullanıcı verilerinin burada herhangi bir etkisi olmasının _son derece_ düşük bir olasılık olduğunu düşünüyorum - OAI’nin bunun için kullanıcı transkriptlerini çekmesinin veya bunu etkileyecek şekilde bilerek eğitim yapmasının imkanı yok. İnsanların 'codex'te kullanıcı verileriniz güvende değil' diye kaçıp gitmesinin oldukça önemli olduğunu düşünüyorum - çünkü kesinlikle güvende (dışarıdan varsayabildiğim her şeye dayanarak).

OpenAI Muhtemelen Kullanıcı Verilerini Yanlışlıkla Kullanmadı

Eğer OpenAI veya Anthropic’in rekabet avantajı elde etmek için birinin kullanıcı verilerine el koyduğu ortaya çıkarsa, bu bir deprem olurdu, belki de işleri için mümkün olan en kötü hikaye olurdu ve gerçekler bu olmadan daha mantıklı hale geliyor. Jerry Tworek’ten gelen en komik hipotez, benim de son derece düşük olasılık gördüğüm ama maalesef dışlayamadığımız şey, OpenAI’ın böyle bir veriyi kullanmayı niyet etmemiş olması, ancak probleme atanan ajan sürüsünün onları hackleyip yine de ele geçirmiş olması ve OpenAI’ın bundan habersiz olmasıdır.

Güçlü varsayımım, kullanıcı verilerine kasıtlı olarak erişilmediği, asla yapmayacakları (veya daha doğrusu, bunu ancak bir kez yapabileceklerini ve bunun o bir kez olmadığını anladıkları) ve ayrıca kullanıcı verilerinin pek faydalı olmayacağı yönünde.

Thane Ruthenis, daha önce bir okul silahlı saldırısı olayının yaşandığını, burada (çok makul bir şekilde) logların incelendiğini ve kolluk kuvvetlerini bilgilendirme konusunda dahili bir tartışma olduğunu belirtiyor. Hatta bu bile bazı kullanıcıların tüylerini diken diken etti. Sınırı nereye çekecekler? Ve evet, bir laboratuvara verirseniz verilerinizin ve loglarınızın gizli kalmayabileceğini anlamalısınız. Telif hakkınıza tabi araştırmanızın veya matematik verilerinizin gizli kalıp kalmadığını merak etmek, Andreas Thorn’un da yaptığı gibi, makuldür.

Pratikte, OpenAI’ın böyle verilere kasıtlı olarak baktığına dair çok, çok düşük bir olasılık verdiğimi yinelemek isterim. Risk-getiri dengesi sadece çok, çok kötü. Ve Roon’un, logların eğitim verisine ulaşamayacağını şimdi teyit ettiklerine dair sonraki raporuna inanıyorum.

Üst Düzey Laboratuvarlarımız, İyi Hissettiren Bir Matematik Hikayesinde Bile Geçinemiyor

Kimin suçlu olup olmadığından bağımsız olarak, laboratuvarların bir matematik kanıtı için kredi tahsisi gibi bir konuda bile işbirliği yapamamaları oldukça endişe verici. Bu çok kötü bir işaret ve aynı zamanda bir uyarı niteliğinde.

Sholto Douglas (Anthropic): Bunun, laboratuvarların nasıl işbirliği/yönlendirme yapabileceğine dair bir örnek olarak sonuçlanmaması son derece üzücü, çünkü gelecekte riskler çok daha yüksek olacak.

Noam Brown (OpenAI): Kesinlikle katılıyorum. Laboratuvarlar arasında bir rekabet olduğunu biliyorum ama gelecekte olacaklar göz önüne alındığında birlikte çalışmayı öğrenmemiz önemli.

Sholto Douglas (Anthropic):

🤝

Kevin Roose : Bu laboratuvarlar (özellikle OpenAI/Anthropic ve OpenAI/DeepMind), dışarıdan belli olmayan bir derecede birbirlerine karşı kinle besleniyor. Kısmen "bu ünlü matematik problemi için kim kredi alacak" gibi şeylerden, kısmen de liderler arasındaki kişisel husumetten kaynaklanıyor.

AGI yarışı hakkında kitap yazan biri olarak, tüm bunlar harika dramatik malzemeler. Ama nihai hedefin laboratuvarların güvenlik ve hız konusunda işbirliği yapması olması durumunda harika değil!

Geçinememeye devam etmeleri büyük bir mesele ve sadece daha da büyüyecek.

Sırada Ne Var?

Navier-Stokes üzerinde işe yaradıysa, başka nelerde işe yarayacak? Öğrenmenin zamanı geldi.

Nat McAleese (Anthropic): Navier Stokes inanılmaz bir başarı ve harika ilerlemeyi yansıtıyor. Devasa oai sürülerinin bilimin diğer alanlarına uygulanması gerekir; ideal olarak yakın vadeli uygulamaları olan, hizalama (alignment) dahil olmak üzere.

Bu gerçekten de gerçekleşiyor olarak bildiriliyor, P=NP gibi eğlenceli sorular dahil. Eğer bu yapıcı olarak doğru kanıtlanırsa, birçok şeyi bozacaktır. OpenAI’ın geçmişi göz önüne alındığında, bu tür ajan sürülerinin artımlı bir adım olarak neler yapabileceği konusunda sıfır olmayan bir endişe taşımalısınız.

Matematikçiler Memnun Değiller

Matematik problemlerini çözmek onların tüm işi. Ancak onlar çok memnun değiller.

Andrew Curran : Yirmi beş Fields Madalyası sahibi, yapay zeka şirketleri ile matematik topluluğu arasında ciddi bir hizalanma eksikliği gördükleri konusunda uyaran ortak bir bildiri yayınladı.

Math and AI (Terence Tao dahil 25 Fields Madalyası sahibi tarafından imzalandı): Son birkaç ayda, LLM’lerin matematiksel yetenekleri dramatik bir şekilde iyileşti, öyle ki birçok matematik alanında büyük açık problemleri çözebilir hale geldiler. Ancak, yapay zeka şirketlerinin matematik problemlerini bir benchmark olarak çözme baskısı, matematik bilimine ve matematik topluluğuna zarar veriyor. Yapay zeka şirketlerinin hedefleri ile matematik topluluğunun hedefleri ciddi şekilde hizalanmamış durumda. Bunları, diğer bilimsel ve yaratıcı meslekleri ve toplumun tamamını etkileyen daha geniş hizalanma sorunlarının bir parçası olarak görüyoruz.

… Ünlü problemler, genellikle bu manzaraya karşı geliştirilmiş bir anlayışı ölçmek için dönüm noktaları ve deniz fenerleri olarak hizmet etmiştir.

… Son aylarda, yapay zekanın büyük matematik problemlerini çözmedeki başarısı, matematik çevrelerinin dışında bile manşetlere çıktı. Ancak problemleri çözmek, kavramsal anlama ve içgörü sağlama şeklindeki birincil amaca ulaşmak için yalnızca bir araç ve vekildir.

… Genellikle bu çözümler aceleyle duyurulur, uygun bir yazım için, yeni yöntem ve fikirlerin izolasyonu için ve başkalarının ilgili önceki çalışmalarının alıntılanması için zaman bırakmaz. Tüm yaratıcı mesleklerde olduğu gibi, bu ciddi atıf ve intihal sorularını gündeme getirir.

Bu, laboratuvar davranışlarına ilişkin özel şikayetlerin yanı sıra genel şikayettir.

Hayır, matematik problemlerinin amacı matematik problemlerini çözmektir ve matematikçiler, yapay zekanın statü oyunlarını bozmasına kızgınlar diye yanıt verilebilir. Bu kesinlikle olan bitenin bir parçası, ancak Tyler Cowen gibi ben de o kadar sinik değilim ve onun aksine, 'biraz sabra ihtiyaç var' demiyorum veya hasar verilene kadar beklemiyorum. İnsanlar dışavurum yapabilir. Matematikçilerin grafiklere düz çizgiler çizmede iyi olduklarını biliyor muydunuz?

Burada gerçek bir şikayet var. Yetenekli insanları, çok az para karşılığında uzun süreler boyunca gerçek matematik yapmaya, gerçek matematik sezgileri ve kavram hakimiyeti geliştirmeye ikna etmek, başka şeyler yaparak çok daha fazla para kazanabilecekken kolay bir iş değildir. Eğer 'statü oyunlarını ellerinden alırsanız' ve daha da önemlisi eğlencelerini, başarı duygularını, zarafet ve güzelliği ellerinden alırsanız, o zaman ne olur?

Robin Hanson, o zaman yapmamız gerekenin teşvikleri düzeltmek ve matematikçileri daha iyi ödüllendirmek olduğunu öne sürüyor.

Robin Hanson : "Bir yapay zeka zaten altta yatan teoremleri kanıtlamış veya çürütmüş olsa bile, 'matematiksel anlamadaki önemli boşlukları dolduran' kişilere statü, ücret ve terfi vermekten matematik topluluğunu alıkoyan hiçbir şey yoktur."

'Sadece' kelimesini kullanmıyor ama bu kesinlikle bir 'sadece', yani insanlar sadece [X] yapsalar keşke gibi, ve hepimizin bildiği gibi insanlar asla 'sadece' yapmadılar ve şimdi başlayacak değiller. Bu, insanların fiilen yapabileceği bir şey değil. Çünkü o bile saatler sonra farketti:

Robin Hanson : Aslında, matematik akademik topluluğunun, teorem kanıtlamanın dışında, matematiğe "boşlukları dolduran" kişileri yargılamak için koordinasyon sağlamasının oldukça zor göründüğünü düşünüyorum. Matematik, kanıtları değerlendirmek etrafında yoğun bir şekilde koordine oldu ve diğer konularda anlaşmak için birçok yol geliştirmediler.

Boşlukları dolduran ve zarafeti iyileştiren kişiler için bazı ödüller alabilir ve alacağız, ama aynı olmayacak ve en iyi ihtimalle Herkül gibi bir çaba gerektirecek.

Scott Armstrong, bunun bir düzen değişikliği olduğunu savunuyor, ancak sonuç değişikliği değil. İnsan matematikçiler kanıtı anlamak için birkaç hafta alacaklar, ama sonra anlayışı kazanacaklar. Geçmişte, anlayış kanıttan önce gelirdi, ama her iki durumda da anlayışı kazanırsınız. Önemli olan budur. Ona göre insanların kızgın olduğu şey, makinelerin onlardan daha akıllı olması.

Her zaman olduğu gibi, yapay zeka hem öğrenmek hem de öğrenmemek için en iyi araçtır. Matematikçiler, 'öğrenmeme' moduna, yani ödevlerini yapay zekaya yaptırmaya zorlandıklarını söylüyorlar ve bundan hoşlanmıyorlar, çünkü aslında ödev size öğretir.

Umursayan kim var diyebilirsiniz, sınır matematiği yapay zekaya yaptırmak sorun değil. Ve evet, birçok insanın hala bütün gün matematik yapmak ve çirkin yapay zeka şeylerinin zarif versiyonlarını aramak isteyeceğini düşünüyorum. Ama aynı olmayacak.

OpenAI’ın Yeni Modeli, Eğitimin Dördüncü Gününde Astra’nın Üzerinde Bir Adım Değişikliğiydi

Şimdi hikayenin en önemli kısmına geliyoruz.

RIP çeşitli OpenAI eğitim duraklamaları, 22 Haziran 2026 – 28 Ağustos 2026.

roon (OpenAI): benim işaretimle, 22 Haziran’dan (hugging face) 28 Ağustos’a kadar olan dönem, bir aydan fazla bir sınır (frontier) duraklamasıdır.

18 Ağustos’ta OpenAI, sınır RL (pekiştirmeli öğrenme) eğitimini iki hafta durdurduklarını ve planlanan en büyük eğitim koşusunun askıda kaldığını söyledi. Ardından 28 Ağustos’ta OpenAI, tüm o sinir bozucu denetim, altyapı ve hizalama sorunlarını çözdükten sonra, Astra’dan her alanda daha yetenekli hale gelen başka bir modelin eğitimine başladı ve sadece dört gün sonra bir 'adım değişikliği' gözlemlendi:

Zvi Mowshowitz - inline image

Korkuyor musunuz? Olmalısınız. O model hala eğitimde, iki haftadan az bir süredir eğitim görüyor ve özellikle matematiğe yönelik değil.

Bu model hakkında bildiğimiz tek şey bu. Ancak bunu, OpenAI ve OpenAI’daki kişilerin hizalama (alignment) sorunları ve diğer problemler ile yapay zeka gelişiminin hızı konusunda tercih kaskadı (preference cascade) içinde erdemli bir şekilde çılgına döndüklerine dair tekrarlanan hikayelerle birleştirdiğimizde, bu yeterli oluyor.

Ayrıca, durumun anlaşılması için buna mecbur olduklarından, kaçınabilecekleri halde yayınladıkları o kadar çok endişe verici bilgi parçasını da hesaba katıyoruz. Astra model kartı burada sayılır, An Alien Mind da öyle, Paul Christiano’nun açıklaması da, HuggingFace saldırısına verilen tepkiler de, Pacing the Frontier dahil olmak üzere.

Bir sonraki bölüm olan, özyinelemeli öz-gelişim (RSI) hakkındaki OpenAI raporu da aynı şekilde.

OpenAI ve Anthropic, RSI çağına girdi.

OpenAI Araştırma İlerlemesi, Yine OpenAI Araştırma İlerlemesi Nedeniyle Hızlanıyor

OpenAI son zamanlarda birçok konuda şeffaflığını artırıyor.

En önemli mesele, Yapay Zeka Ar-Ge’sinin hızlanması ve otomasyonudur. Bu, bizi öldürme ihtimali yüksek olan, en korkutucu olan, tüm laboratuvar çalışanlarının uyardığı ve hem OpenAI’ın hem de Anthropic’in mümkün olduğunca hızlı bir şekilde ilerlemeye çalıştığı şeydir.

Bu konuda da bize bir rapor verdiler. Tejal Patwardhan’a katılıyorum; bu mükemmel bir şeffaflık örneği.

OpenAI (6 Eylül, Research Acceleration: The View Inside OpenAI): Derin öğrenme ve hizalama alanlarında iteratif iyileştirmeleri mümkün kılmak için insan gözetimi altında çalışabilen güvenli bir otomatik yapay zeka araştırmacısı inşa etmeyi hedefliyoruz.

Ölçümlerimize göre, şu anda geçen yıl sonbaharda duyurulan,

bu yılın Eylül ayına kadar otomatik bir araştırma stajyerine sahip olma hedefine ulaştık.

… İlerlemenin kabul edilemez bir güvenlik riski oluşturduğunu tespit ettiğimiz her durumda, geliştirmeyi veya dağıtımı yavaşlatmak ya da durdurmak dahil olmak üzere uygun şekilde yanıt vereceğiz.

… Bizim ve diğer şirketlerin RSI’ya doğru ilerlememizi kamuya açık olarak takip etmemizin zorunlu tutulması gerektiğine inanıyoruz.

Bunu, Navier-Stokes ispatının duyurusunda ortaya koydukları zaman çizelgesiyle karşılaştırın. Yeni modellerini eğitmeye 28 Ağustos’ta başladılar.

Bu arada, zaman çizelgesinin farklı ve ayrı bir dahili modeli işaret ettiği bir araştırma stajyerine sahip olduklarına inanıyorlar. Gelecek hafta neye sahip olacaklar? Bir sonraki ay? Anthropic’in elinde ne var?

OpenAI, yüksek yetenekli yapay zekanın büyük faydalar sunduğunu açıklıyor ama tabii ki öyle. Herkesin bu kadar hızlı gitmeye kararlı olmasının nedeni bu değil. Bir yarış içindeler.

Bu, son zamanlarda OpenAI ve çalışanlarından gelen, ‘bu deliliği bitirmek için birlikte çalışmalıyız’ çağrısı ile bolca ‘beni biri durdursun’ mesajının karışımı olan birçok çağrıdan sadece biri.

OpenAI : Bunlar, faydalı otomatik araştırma yeteneklerini geliştirmek için nedenlerdir ancak bu, hızlı RSI’nın peşinden koşmamız gereken bir sonuç olduğu anlamına gelmez. İlerleyip ilerlemeyeceğimiz ve nasıl ilerleyeceğimiz, insan kontrolünü koruma yeteneğimize ve faydalar ile risklere ilişkin bilinçli demokratik seçimlere bağlı olmalıdır.

Hizalanmış, tam RSI’ya güvenli bir şekilde nasıl ulaşılacağını henüz bilmiyoruz. Yeteneklerle birlikte hizalama ve güvenlik önlemlerini ölçeklendirmek için çalışıyoruz. Ancak hizalama ve güvenlikteki ilerlemenin ayak uyduracağını varsayamayız ve daha yetenekli sistemler izlenmesi daha zor hale gelebilir.

Dikkatli hizalama ve güvenlik çalışmaları bu çabanın merkezindedir ve ajantik kodlama sistemlerinde bugün gördüğümüz güvenlik sorunlarını ölçmek ve azaltmakla başlar.

Sıradan veya mevcut sorunların ana mesele olduğu görüşüne yine itiraz ediyorum ama evet, bizi defalarca uyarmaya çalışıyorlar (kurumsal dili biraz çevirerek):

  1. OpenAI ve Anthropic’in özyinelemeli öz-gelişime (RSI) giden bir yolu var.
  2. Şu an ikisinden biri bunu denerse, muhtemelen korkunç sonuçlar doğar ve herkes ölür.
  3. OpenAI, pahalı bir ihtiyat düzeyini uygulamaya hazırdır ancak sınırlar vardır ve bir anlaşma veya yasa olmadan yakında biri bunu deneyecektir.

Gönderinin büyük kısmı, Astra’nın dahili olarak devreye girmesinden bu yana son aylarda OpenAI’daki RSI ilerlemesine ajantik sistemlerin ne kadar katkıda bulunduğuna dair detaylı bir anlık görüntüdür. Cevap oldukça fazladır.

Eğer bir sürpriz varsa, kullanımın bu kadar uzun süre bu kadar düşük kalmasıdır:

OpenAI : Bu yılın başında, OpenAI’daki ajan kullanımına göre sıralanan medyan araştırmacı, kodlama ajanlarını yalnızca mütevazı miktarlarda kullanıyordu. Ağustos ortasına gelindiğinde, medyan araştırmacı ajanları işlerine günlük olarak entegre ediyor ve API fiyatlarıyla günde 600 dolardan fazla çıkarım (inference) harcıyordu. Araştırma organizasyonumuzdaki yüzde 90’lık dilimdeki kullanıcı artık günde 7.000 dolardan fazla token kullanıyor.

Zvi Mowshowitz - inline image

OpenAI : Haziran 2026’dan önce, araştırma organizasyonu genelindeki toplam ajan çalışma süresi, toplam insan emeğinin hâlâ altındaydı. O zamandan beri bu değişti. Standart 8 saatlik bir iş günü açısından bakıldığında, Ağustos ortası itibarıyla toplamda, her bir insan emeği iş günü başına araştırma organizasyonu 3,1 ajan-iş günü efor kullanıyor.

Zvi Mowshowitz - inline image

Övünmüyor değiller ve itiraf etmiyor değiller. Uyarıyorlar.

Buradaki ikili ölçüm, bunun aslında olduğundan daha az bir hızlanma gibi görünmesine neden olabilir:

Zvi Mowshowitz - inline image

Düzgün bir şekilde aynı anda 4’ten fazla iş akışını insanların ne kadar kaldırabildiğini merak ediyorum diyen kişi, onlarca açık sekmesi ve düzinelerce aktif taslak gönderisi olan adamın ta kendisi.

Meğer bu göründüğü kadar etkileyici değilmiş çünkü alt ajanları (subagents) iş akışı olarak sayıyorlarmış. Medyan araştırmacı günde 600 dolar harcarken, yoğun kullanım yapmayan %30’luk kesimin hala var olması, bu durumu daha da şaşırtıcı kılıyor.

Claude Code ve ardından Codex’in büyük bir olay haline gelmeye başladığı noktadan itibaren kod sevkiyatları ve deneyler hızla artıyor.

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

Yakın zamana kadar yapay zekanın çoğu, araştırma ve altyapı kodu yazmak için kullanılıyordu ve geri kalanını insanlar yapıyordu. Artık yapay zeka, çalıştırmaları başlatma, izleme ve hata ayıklama ile teknik yardım ve inceleme konularında da çok fazla iş yapıyor ve ayrıca sonuç analizi gibi diğer alanlara da yayılıyor.

İşlerimizi aldılar, ‘insan hata ayıklayıcıları’ versiyonu:

Zvi Mowshowitz - inline image

Ünlü METR grafiğinin üretim görevleriyle ilgili farklı bir varyasyonu burada, statik bir ekran görüntüsü olarak okuması biraz zor ancak ilerleme hızlı. Bunlar yıllar değil. Bunlar aylar:

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

OpenAI’ın Duraklamasını Ölçmek

Zaman içinde RL hesaplama harcamalarının bir grafiği var. Temmuz 20’den önce Astra’nın ne kadar az kullanıldığına şaşırdım ama işte böyle. Bunu günümüze kadar uzatmadıklarını fark ediyorum ve muhtemelen Astra kullanımı zamanla tekrar artmıştır:

Zvi Mowshowitz - inline image

Dünya Böyle Son Bulacak

Yeni modelin eğitimine başlamasından sadece birkaç gün sonra, sürüyü (swarm) Navier-Stokes’u kanıtlamak için kullanmak, ciddi bir kontrol kaybı olayı riskini mi taşıyordu? June Jimenez, evet diyor.

Test etmenizin imkansız olduğu yeni bir modelin 10.000 ajanlık sürüsünü, potansiyel olarak imkansız ve kesinlikle son derece zor bir görev üzerinde serbest bırakıp kolektif olarak ona 300 milyar token verirseniz, başka neler yapabilirdi? Kesinlikle ‘belki logları almak için OpenAI’a bir şekilde hack’ledi’ diye düşündüm ama o kadar çok olasılık var ki.

Çabuk Olun, Zaman Yok

Eski bir laboratuvar çalışanı, burada Andrew Ho, ‘3 aydan uzun bir zaman diliminde üretkenliğimin %100’ün üzerine, belki de dikkat dağınıklığı nedeniyle %50’nin bile üzerine çıktığını düşünmüyorum’ demesi, ayı piyasası (bearish) olmak için bir neden olarak, doğru olsa bile pek rahatlatıcı değil. Üç ayda bir sadece %50 daha üretken olmayı hayal edin ve bunun ayı piyasası olduğunu düşünün.

Greg Brockman’ın ‘AGI çağına hoş geldiniz’ dediği aynı gün, ‘AGI sonunda achievable olsa bile, bu önemli ölçüde daha uzun bir zaman çizelgesi gerektirir’ diyor.

Bunun yanı sıra, bu düzeyde matematiksel ilerleme birkaç hafta önce beklenmiyordu.

Bu sorunlardan biri her düştüğünde, insanlar bunu o kadar da şaşırtıcı olmayan bir şey olarak yeniden yorumlamaya (retcon) çalışıyorlar. Genellikle yanılıyorlar. Hayır, çoğu insan, hatta çoğu tahminci, bunun olacağını varsaymadı. Belki siz varsaydınız. Sonuçta, çok zekisiniz.

Henry Shevlin : Bu yılın Nisan ayında bile, tahmin piyasaları yapay zekanın 2030’dan önce herhangi bir Bin Yıl Ödülü Problemini çözme şansını %40’ın altında gösteriyordu.

Zvi Mowshowitz - inline image
Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet