GPT 6 Astra Gerçekte Nasıl Düşünüyor?

@Mikadzyki_NFT
İNGILIZCE08 Eyl 2026
955K
83
16
16
142

TL;DR

GPT 6 Astra, modelin ağırlıkları yeniden kullanmasına ve metin çıktısı vermeden önce iç durumları birden çok kez işlemesine olanak tanıyan döngüsel bir transformer mimarisi sunar. Bu, parametre sayısını hesaplama derinliğinden ayırarak çıkarım sırasında uyarlanabilir hesaplamaya imkan tanır.

**

OpenAI, GPT 6 Astra'yı şimdiye kadarki en yetenekli ve en uyumlu modeli olarak tanımlıyor.

Greg Brockman daha da ileri giderek Astra'nın erken bir yapay genel zeka formu olarak görülmesinin makul olacağını söyledi.

Model ayrıca OpenAI'ın siber güvenlik için Kritik eşiğini geçen ilk model oldu. Şirkete göre, daha önce bilinmeyen güvenlik açıklarını keşfedebiliyor ve sınırlı insan yönlendirmesiyle çalışan istismarlar oluşturabiliyor.

Bu iddialar çarpıcı olsa da, sürümün en önemli kısmı bunlar değil.

Gerçek değişiklik mimariyle ilgili.

Geleneksel bir dil modeli, bilgiyi sabit bir dizi transformatör bloğundan geçirir ve bir sonraki tokeni üretir. Astra, kullanıcıya tek bir kelime göstermeden önce iç durumunu aynı hesaplama bloklarından birden çok kez işleyebilir.

Sadece daha uzun bir düşünce zinciri oluşturmaz.

Cevap vermeden önce daha fazla düşünmek için zaman harcar.

1 Modern Dil Modelleri Nasıl Çalışır

Şunu yazdığınızı hayal edin:

Everest...

Modelin sıradakinin ne olacağını tahmin etmesi gerekir.

Dikkat mekanizması, bağlamın hangi bölümlerinin önemli olduğunu belirler. Everest kelimesi dağlar, yükseklik, Himalayalar, Nepal, Tibet, tırmanma ve keşifler gibi ilgili kavramları etkinleştirir.

Model daha sonra bu ilişkilendirmeleri çevreleyen bağlamla birleştirir. Çoğu durumda, Dünya'nın en yüksek dağı gibi bir devam cümlesi oldukça olası hale gelir.

Geleneksel bir transformatörün içinde, bu temsil bir dizi bloktan geçer. Her blok onu bir kez dönüştürür ve sonucu bir sonrakine iletir.

Bir model 40 blok içeriyorsa, gizli durum sırayla 40'ının hepsinden geçer. Nihai temsil, bir sonraki token için bir olasılık dağılımına dönüştürülür.

Daha fazla blok genellikle daha fazla hesaplama derinliği anlamına gelir. Daha derin bir model, bir cevaba karar vermeden önce daha fazla dönüşüm gerçekleştirebilir.

Ancak blok eklemek aynı zamanda parametre sayısını, bellek gereksinimlerini ve eğitim maliyetini de artırır.

Olağan varsayım basit olmuştur: daha derin bir model istiyorsanız, daha büyük bir katman yığını oluşturmanız gerekir.

Döngülü bir mimari bu prensibi değiştirir.

2 Döngülü Bir Mimari Neyi Değiştirir

The Information'dan gelen haberlere göre, GPT 6 Astra döngülü bir transformatör mimarisi kullanıyor.

OpenAI tam bir teknik şartname yayınlamadı, bu nedenle kesin uygulama gizli kalıyor. Ancak genel mekanizma, kamuya açık araştırmalardan zaten iyi anlaşılmış durumda.

Gizli durumu her bloktan yalnızca bir kez geçirmek yerine, model sonucu bir hesaplama bloğuna geri gönderebilir ve onu yeniden işleyebilir.

Bunu bir iç taslak olarak düşünün.

Model bir ön temsil üretir, onu aynı ağırlıklardan tekrar geçirir, iyileştirir ve bu işlemi birkaç kez tekrarlar. Döngü tamamlandıktan sonra bir sonraki görünür token ortaya çıkar.

Mikadzyki🌙 - inline image

Parametre sayısı aynı kalır. Ağırlıklar bir bloğun içinde kalır, hesaplama döngü sayısıyla birlikte artar ve yalnızca nihai token yayılır.

Kilit detay, parametre sayısının mutlaka artmamasıdır.

Aynı ağırlıklar her geçişte yeniden kullanılır.

Artan şey, hesaplama miktarıdır.

Geleneksel bir transformatörde, bir token farklı bloklardan oluşan bir diziden geçer. Döngülü bir transformatörde, aynı paylaşılan yapıdan birden çok kez geçebilir.

Model, parametre sayısıyla büyümeden, hesaplama yoluyla daha derin hale gelir.

Bu yeni bir ödünleşim yaratır:

  • Daha fazla parametre daha fazla bellek gerektirir
  • Daha fazla döngü daha fazla hesaplama gerektirir
  • Bir model, farklı görevler için farklı miktarlarda hesaplama harcayabilir

Son nokta özellikle önemlidir. Hesaplama derinliği, yeni bir model oluşturmadan değişebilir.

3 Tekrarlayan Derinlik Nasıl Eğitilir

Bir transformatör bloğunu bir döngünün içine yerleştirmek yeterli değildir.

Bir model eğitim sırasında her zaman tam olarak 32 geçiş gerçekleştirirse, her adımın konumuna güvenmeyi öğrenebilir. İlk geçiş bir işlevi, onuncu geçiş başka bir işlevi öğrenebilir ve otuz ikinci geçiş sabit bir çıktı katmanı haline gelebilir.

Sonuç, döngü kılığına girmiş geleneksel bir 32 katmanlı ağ olurdu.

Araştırmacılar bu sorunu, eğitim sırasında tekrarlayan geçişlerin sayısını değiştirerek çözerler.

En net gösterimlerden biri, tekrarlayan derinlik modeli Huginn'den geldi. Yaratıcıları, yaklaşık 800 milyar token üzerinde 3,5 milyar parametreli bir ağ eğitti.

Her eğitim adımında, döngü sayısı ortalaması 32'ye yakın bir dağılımdan örneklendi. Bir örnek dört geçiş, bir diğeri 17, bir başkası 40 ve bir diğeri 90'a yakın geçiş alabilirdi.

Model, hangi geçişin sonuncusu olacağını önceden bilemezdi.

Bu nedenle, sabit bir işlem dizisinden daha genel bir şey öğrenmek zorundaydı.

Mevcut iç durumunu nasıl iyileştireceğini öğrenmek zorundaydı.

Mikadzyki🌙 - inline image

arXiv'deki Tekrarlayan Derinlik Makalesinden Özet

Düzinelerce tekrarlayan adım boyunca eğitim başka bir sorun yaratır: bellek.

Standart geri yayılım, her döngüden ara aktivasyonların depolanmasını gerektirir. Yeterli tekrarla, bellek maliyeti muazzam hale gelir.

Huginn araştırmacıları pratik bir uzlaşma kullandı. İleri geçiş birçok döngü için çalışabilirdi, ancak gradyanlar yalnızca son sekiz geçiş üzerinden hesaplandı.

Daha önceki geçişler nihai sonucu hâlâ etkiliyordu, ancak tam aktivasyon geçmişlerinin bellekte kalması gerekmiyordu.

Bu, kesilmiş geri yayılıma benzer. Fark, tekrarlamanın bir dizideki kelimeler arasında değil, hesaplama derinliği boyunca gerçekleşmesidir.

Mikadzyki🌙 - inline image

Döngü sayısı her eğitim adımında örneklenirken, gradyan yalnızca son sekiz geçiş üzerinden hesaplanır.

Modele, 32 işlemden oluşan katı bir dizi gerçekleştirmesi öğretilmiyor.

Süreç ne zaman durdurulursa durdurulsun, gizli durumunu yararlı bir cevaba doğru hareket ettirmesi öğretiliyor.

Bu, derinliğin ne anlama geldiğini değiştiriyor.

Derinlik artık yalnızca eğitimden önce mühendisler tarafından seçilen bir özellik değil. Çıkarım sırasında bir değişken haline gelebilir.

4 Çıkarım Sırasında Uyarlanabilir Hesaplama

Mevcut akıl yürütme kontrollerinin çoğu, görünür tokenler düzeyinde çalışır.

Bir modelden daha uzun düşünmesi istenirse, daha uzun bir düşünce zinciri oluşturur, daha fazla çıktı tokeni kullanır veya ek ara metin oluşturur.

Döngülü bir mimari farklı bir mekanizma sunar.

İç geçişlerin sayısı, ağırlıkları değiştirmeden ve modeli daha uzun bir açıklama yazmaya zorlamadan değişebilir.

Basit bir görev dört döngü alabilir.

Zor bir matematiksel kanıt 32 döngü alabilir.

Karmaşık bir kodlama problemi 64 döngü alabilir.

Model aynı kalır. Yalnızca iç hesaplama miktarı değişir.

Mikadzyki🌙 - inline image

Ağırlıklar sabit kalır. Yalnızca her tokeni işlemek için kullanılan iç geçişlerin sayısı değişir.

Kamuya açık tekrarlayan derinlik deneyleri zaten beklenen modeli göstermektedir.

Performans ilk döngüler sırasında hızla iyileşir. Daha sonra kazanımlar, eğriler bir platoya yaklaşana kadar küçülür.

Bu, gizli durumun yakınsadığını gösterir.

Erken geçişler büyük düzeltmeler yapar. Sonraki geçişler daha küçük ayrıntıları iyileştirir. Sonunda, ek hesaplama anlamlı iyileştirmeler üretmeyi durdurur.

Gelecekteki bir sistem bu anı otomatik olarak algılayabilir.

Her istem için sabit bir döngü sayısı atamak yerine, model gizli durumu yeterince kararlı hale gelene kadar işleme devam edebilir. Kolay tokenler ucuz olurdu. Zor tokenler daha fazla hesaplama alırdı.

Bu, gerçek uyarlanabilir hesaplama derinliği yaratırdı.

Daha uzun düşünmek artık daha fazla yazmak anlamına gelmek zorunda kalmazdı.

5 Araştırma ve Erken Pratik Sonuçlar

Transformatör katmanlarını yeniden kullanmak yeni bir fikir değil.

Evrensel Transformatörler, 2018'de tekrarlayan işlemeyi tanıttı. ALBERT, katmanlar arasında ağırlıkları paylaşarak parametre sayılarını azalttı. Özyineleme Karışımı, tokenleri farklı miktarlarda hesaplama yoluyla yönlendirmeyi araştırdı.

Açık Nanbeige4.2 3B modeli özellikle doğrudan bir örnek sunuyor.

Yapılandırması 22 katman ve num_loops: 2 içeriyor. Etkili bir şekilde, model bu katmanlardan iki kez geçiyor. Yaklaşık olarak 22 katmanlı bir ağın parametre sayısına, ancak yaklaşık 44 katmanlı bir ağın hesaplama derinliğine sahip.

Mikadzyki🌙 - inline image

Hugging Face'de Nanbeige4.2 3B Yapılandırması

Yirmi iki katman, num_loops: 2 ve bir Apache 2.0 lisansı. Mekanizma zaten açık bir model yapılandırmasında görülebiliyor.

Yıllar boyunca, tekrarlayan transformatör tasarımları baskın yaklaşım olmaktan ziyade ilginç araştırma fikirleri olarak kaldı.

Eksik bileşen, güçlü ölçekleme kanıtıydı.

1 Eylül'de bir grup araştırmacı, eşleşen koşullar altında döngülü ve geleneksel transformatörleri karşılaştırmak için tasarlanmış bir çalışma olan SMELT'i yayınladı.

Parametre sayısını, eğitim hesaplamasını ve KV önbellek boyutunu kontrol ettiler. Bu kısıtlamalar altında, döngülü modeller aynı performans seviyesine ulaşmak için %6,8 ila %18 daha az eğitim hesaplaması gerektirdi.

En büyük kazanımlar kod üzerinde görüldü.

Mikadzyki🌙 - inline image

arXiv'deki SMELT Makalesinden Özet

Hesaplama, parametreler ve KV önbelleği eşleştirildiğinde, döngüleme eğitim hesaplamasının %6,8 ila %18'ini kurtarır, en güçlü kazanımlar kod üzerindedir.

Araştırmacılar ayrıca dikkat davranışında bir değişiklik gözlemledi.

Geleneksel transformatörlerde, bir dizideki en erken tokenler genellikle dikkat havuzları haline gelir. Anlamsal önemleri sınırlı olsa bile orantısız miktarda dikkat alırlar.

Aynı bloklardan ikinci bir geçişten sonra, modelin dikkati daha alakalı tokenlere kaydı.

İkinci döngü birinciyi basitçe tekrarlamadı. Daha seçici işleme için bir temel olarak ilk geçişin sonucunu kullandı.

SMELT, gelecekteki her modelin tekrarlayan olması gerektiğini kanıtlamaz. Ancak, ana deneysel koşullar eşleştirildikten sonra döngülemenin rekabetçi kaldığını gösterir.

Soru artık tekrarlayan derinliğin çalışıp çalışamayacağı değil.

Soru, ne kadar uzağa ölçeklenebileceği.

6 Yorumlanabilirlik ve Kontrol

Döngüleri çekici kılan aynı mimari özellik, model izlemeyi de karmaşıklaştırır.

Açık düşünce zinciri akıl yürütmesiyle, en azından bazı ara adımlar okunabilir metin olarak görünür. Araştırmacılar bunları inceleyebilir, şüpheli kalıpları arayabilir ve belirtilen akıl yürütmeyi nihai cevapla karşılaştırabilir.

Tekrarlayan bir model, herhangi bir metin oluşturmadan gizli aktivasyonların içinde daha fazla işlem gerçekleştirebilir.

Buck Shlegeris ve Ryan Greenblatt, bunun düşünce zinciri izlemenin kullanışlılığını azaltabileceğini savundu. Daha fazla işlem gizli hesaplamaya taşınırsa, görünür açıklama modelin sonucuna nasıl ulaştığı hakkında daha az şey ortaya çıkarabilir.

Sebastian Raschka önemli bir karşı nokta sundu.

Ağırlıkları yeniden kullanmak otomatik olarak gizli veya erişilemez biliş yaratmaz. İç aktivasyonlar yine de yorumlanabilirlik araçlarıyla incelenebilir. Temel fark, modelin daha az görünür ara token gerektirmesidir çünkü daha fazla hesaplama oluşturma başlamadan önce gerçekleşir.

OpenAI Baş Bilim İnsanı Jakub Pachocki ayrıca Astra'nın hesaplama grafiğinin kabaca GPT 4'ün derinliğinin iki katı içinde kaldığını ve döngünün izleme yeteneklerini korumak için kasıtlı olarak sınırlandırıldığını söyledi.

Bu, sınırsız bir tekrarlayan süreçten ziyade ölçülü bir uygulamayı gösteriyor.

Bir düşünce zincirinin, modelin iç hesaplamasının sadık bir kopyası olacağı garanti edilmez. Sistem, her gizli işlemin bilimsel olarak doğru bir raporunu sağlamak için değil, yararlı cevaplar üretmek için ödüllendirilir.

OpenAI, Anthropic ve Google DeepMind'ı içeren araştırmalar, bir modelin açıklamasının önemli faktörleri atlayabileceğini, bir kararı sonradan rasyonalize edebileceğini veya sonucu gerçekten etkileyenden daha temiz bir yol sunabileceğini gösteriyor.

Döngülü bir mimari bu ayrımı görmezden gelmeyi zorlaştırıyor.

Görünür akıl yürütme bir arayüz olabilir.

Ana hesaplama, herhangi bir metin görünmeden önce modelin içinde gerçekleşebilir.

7 GPT 6 Astra Sonuçları

GPT 6 Astra'nın en muhteşem kıyaslama sonucu, ARC AGI 3'te %99,9'luk bir puandır.

Bu sayı neredeyse nihai gibi görünüyor, ancak büyük ölçüde testin nasıl yürütüldüğüne bağlı.

Simon Willison, %99,9'luk sonucun OpenAI'ın özel Sağlayıcı Adaptörü donanımından geldiğini vurguladı. Standart ARC Ödülü donanımı altında, aynı model %62,7 puan aldı.

Model değişmedi.

Değerlendirme ortamı değişti.

Mikadzyki🌙 - inline image

Aynı model, iki farklı çalıştırma maliyetinde iki farklı puan üretir.

OpenAI çalıştırması yaklaşık 19.000 dolara mal oldu. Standart çalıştırma yaklaşık 26.000 dolara mal oldu.

Önemli ölçüde daha yüksek puan aynı zamanda daha ucuz kurulum tarafından üretildi.

Bu, sonucu mutlaka geçersiz kılmaz. Özel bir adaptör, modelle daha etkili bir şekilde etkileşime girebilir veya genel bir değerlendirme çerçevesinin kaçırdığı yetenekleri ortaya çıkarabilir.

Ancak manşet sayı, onu üreten koşullardan ayrı olarak yorumlanamaz.

Mikadzyki🌙 - inline image

ARC AGI 3'te GPT 6 Astra

Bir model, iki değerlendirme donanımı ve 37,2 yüzde puanlık bir fark.

Diğer değerlendirmeler daha az dramatiktir.

Yapay Analiz Zeka Endeksi'nde Astra, kabaca GPT 5.6 Sol ile eşit ve Claude Fable 5.1'in yaklaşık beş puan altında puan alıyor.

Daha pratik avantajı, daha düşük bir maliyetle rekabetçi performansa ulaşabildiği aracı görevlerdeki verimliliği olabilir.

Kıyaslamalar, bir modelin neler başarabileceğini gösterir. Mimari, bu yeteneklerin nereden geldiğini ve nasıl gelişebileceğini açıklamaya yardımcı olur.

8 Bunun Yapay Zekanın Geleceği İçin Anlamı

Yıllar boyunca, dil modellerini ölçeklendirmek öncelikle parametre eklemek, veri eklemek ve daha büyük sabit transformatör blok yığınları oluşturmak anlamına geliyordu.

Her yeni nesil daha büyük, daha pahalı ve çalıştırması daha zorlu hale geldi.

GPT 6 Astra başka bir yola işaret ediyor.

Bir model aynı parametreleri yeniden kullanabilir, zor görevlere daha fazla hesaplama ayırabilir ve ilk kelimesini üretmeden önce iç temsilini iyileştirebilir.

Bu, model boyutunu akıl yürütmesinin derinliğinden ayırır.

Sabit bir hesaplama yolunu takip etmek yerine, sistem belirli bir problemin zorluğuna göre iş miktarını ayarlayabilir.

Bu, hem model performansını hem de yapay zeka kullanmanın ekonomisini değiştirebilir. Aynı zeka, basit istekler için hızlı ve ucuz bir modda çalışabilir, ardından bir görev gerçekten daha fazla akıl yürütme gerektirdiğinde hesaplama derinliğini artırabilir.

Tekrarlama, dil modellerine geri dönüyor. Bu sefer, öncelikle kelimeler arasında değil, onları yaratan sürecin içinde çalışıyor.

Bir sonraki sistem nesli, yalnızca daha fazla parametre içerdikleri için daha güçlü hale gelmeyebilir.

Belirleyici avantajları, iyi bir cevabın ne zaman bulunduğunu ve iç döngüde bir kez daha dolaşmaya değer olduğunu bilmek olabilir.

Kaynaklar

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet