GPT-6 Astra Kapsamlı Analizi: AGI Çağına Hoş Geldiniz

@Khazix0918
ÇINCE03 Eyl 2026
467K
1.0K
125
67
706

TL;DR

GPT-6 Astra, üstün bilgisayar etkileşimi, estetik yargı ve otonom karar verme özellikleriyle yapay zeka zekasında devasa bir sıçramayı temsil ederken, insan tarafından yorumlanabilirlik konusunda da yeni zorluklar getiriyor.

Dün geceki küresel yapay zeka kesintisinin ardından.

GPT-6 Astra nihayet Pekin saatiyle 03:33'te resmi çıkışını yaptı.

数字生命卡兹克 - inline image

OpenAI'dan tek bir cümle GPT-6 Astra'yı özetleyebilseydi,

muhtemelen şu olurdu:

Bu, dünyanın en zeki ve en uyumlu modeli.

Ve şimdiden ortaya çıkmaya başlayan capsler var.

数字生命卡兹克 - inline image

Bu sefer OpenAI gücünü kanıtladı ve bu biraz GPT-4 anını andırıyor—her açıdan bir kralın dönüşü. Beni en çok mutlu eden şey, bunun artık sadece kodlama için uzmanlaşmış bir model olmaması.

GPT-6 Astra gerçekten de son derece güçlü estetik ve profesyonel yeteneklere sahip doktora seviyesinde bir çalışan.

Yeni modelin birçok özelliği ve karakteristiği var ve bilgi miktarı patlama yapıyor.

Ama trajedi şu ki, OpenAI de bazı kötü alışkanlıklar edindi.

Bugün yalnızca seçili kuruluşlara açık; önümüzdeki günlerde abonelere açılacak.

数字生命卡兹克 - inline image

Dur birader, beni 200 dolarlık Pro üyeliğine ikna ederken böyle dememiştin... Her seferinde Pro üyelerinin yeni modellere öncelikli erişim sağlayacağını söylemiştin...

Meğer bu büyük dil modeli şirketlerinin hepsi oyuncuymuş.

GPT-6 Astra'yı kullanmak için zamanı hiç bu kadar hızlandırmak istememiştim...

Yine de, neredeyse tüm bilgi ve materyalleri inceledikten sonra, herkesle tartışmaya değer pek çok şey olduğunu düşünüyorum.

Tek tek üzerinden geçelim.

1. GPT-6 Astra Temel Bilgileri

Önce temel bilgileri özetleyelim.

GPT-6 Astra'nın API'deki model kimliği gpt-6-astra.

Bağlam penceresi 1,05M, yani yaklaşık 1,05 milyon token.

Maksimum çıktı uzunluğu 128K token.

Bilgi kesme tarihi 30 Nisan 2026.

Beş seviyede akıl yürütme yoğunluğu var: düşük, orta, yüksek, çok yüksek ve maksimum.

Standart API fiyatı, milyon giriş token başına 10 dolar ve milyon çıkış token başına 50 dolar.

Bu fiyat temelde Claude Fable 5 ile aynı, ancak önbellek okuma Claude Fable 5.1'den daha pahalı.

数字生命卡兹克 - inline image

İşte kıyaslamalar; daha sonra ayrıntılı olarak tartışacağım, ancak şimdilik hızlıca bir göz atın.

数字生命卡兹克 - inline image

Toplam parametrelerin 5T seviyesinde olduğu tahmin ediliyor. Çıkış öncesi kapalı kapılar ardında yapılan medya brifinginde, GPT-6 Astra'nın OpenAI'ın bugüne kadarki en büyük eğitim çalışması olduğunu ve 100.000'den fazla kart kullandığını belirttiler.

2. Bilgisayarları Kullanmak İçin Dünyanın En İyi Modeli

GPT-6 Astra, belki de en önemli konumlandırmasına sahip:

Bilgisayarları kullanmak için dünyanın en iyi modeli.

Geçmişte, Ajanlar hakkında konuştuğumuzda, genellikle API'lerden, MCP'den, CLI'den vb. bahsederdik.

Bir yapay zekanın bir yazılımı kullanması için ideal durum, o yazılımın yapay zeka için özel bir arayüze sahip olması ve doğrudan düşük seviyeli işlemlere izin vermesidir. Bu en kullanışlı olanıdır.

Örneğin, takvimlerin takvim API'leri vardır, e-postanın Gmail API'leri vardır, vb. Bu açıkça hızlıdır.

Ama sorun şu ki, dünya hayal ettiğimizden çok daha ilkel ve gelişigüzel.

Gerçek dünyada, yazılımların büyük çoğunluğu bunlara hiç sahip olmayabilir.

Hatta birçok şirket içi sistem yirmi yıl önce yazılmıştır; API'yi geçin, insanlar dokümantasyonun nerede olduğunu bile bilmez.

Ancak en temel seviyeye dönersek, tüm yazılım mantığının özünün etkileşim olduğunu görürsünüz. Mevcut bilgisayar kullanma mantığımıza göre bu, ekrana bakmak, düğmeleri veya giriş kutularını bulmak, fareyi tıklamak, içerik girmek ve geri bildirimi beklemek anlamına gelir.

Tüm bilgisayar etkileşim sistemi en iyi API değil mi?

Bu nedenle, GPT-6 Astra, yapay zekanın bilgisayarları kullanma mantığını büyük ölçüde güçlendirdi. Bana API vermezsen sorun değil; tıpkı bir insan gibi bilgisayarı ben kullanırım.

Artık Astra, Excel, Power BI'ı doğrudan kullanabilir, ön uç QA'sı yapabilir, yazılım yükleyebilir, yazılım test edebilir ve sorun gidermeye devam etmek için ekrandaki hata mesajlarına bakabilir.

Resmi demo, Astra'nın doğrudan devre kartı tasarımını kullandığını bile gösterdi.

数字生命卡兹克 - inline image

GIF

Ayrıca yasal belgeleri biçimlendirir, başlık aralıklarını ve sayfa düzenini halleder.

数字生命卡兹克 - inline image

Burada OSWorld adında güvenilir bir değerlendirme var.

Bunu basitçe şöyle anlayabilirsiniz:

Yapay zekayı gerçek bir bilgisayarın içine atmak ve kendi başına çalışmasına izin vermek.

Birkaç uygulama açmasına izin verin, ona bir görev verin ve başarılı olup olmadığına bakın.

GPT-6 Astra'nın tamamlanma oranı %72,6'ya ulaştı; bu, GPT-5.6 Sol'un %65,7'sine göre önemli bir artış.

Ayrıca, Sol karmaşık bir simüle görevi tamamlamak için ortalama 75 dakika alıyordu.

Astra'nın sadece 40 dakikaya ihtiyacı var, bu da yaklaşık %47 daha az zaman demek.

ScreenSpot-Pro da Sol'un %76,9'undan %92,7'ye yükseldi.

Bu kıyaslama, modelin ekranı anlayıp anlayamadığına ve nereye tıklayacağını doğru bir şekilde belirleyip belirleyemediğine bakar. Artık neredeyse mükemmel bir doğrulukta.

Bu konumlandırma oldukça ilginç. Gelecekte, GUI yavaş yavaş Ajan çağındaki en evrensel API haline gelebilir.

Bir insanın bir ekran aracılığıyla tamamlayabildiği herhangi bir dijital iş, teorik olarak yavaş yavaş Ajanların çalışma alanına girecektir.

2007'de yazılmış berbat bir ERP sisteminin MCP'ye bağlanmasını veya size bir API açmasını beklemek zorunda değilsiniz.

Yapay zeka sadece ekrana bakıp işi halledecek.

3. ARC-AGI-3 99,9 Puana Ulaştı

ARC-AGI-3'ün neyi ölçtüğünü bilmiyorsanız, şöyle düşünmek kolaydır:

Ah, tam puan alan başka bir kıyaslama, bunda bu kadar özel olan ne?

Ama bu şey tipik büyük dil modeli sınavlarından oldukça farklı.

Bu yıl 25 Mart'ta ARC Ödülü, ARC-AGI-3'ü resmen başlattı.

数字生命卡兹克 - inline image

Yüzlerce yeni etkileşimli ortam ve binlerce oyun seviyesi tasarladı.

Bu şeyin en çılgın yanı, hiçbir kılavuzun, kuralın olmaması ve size hedefin ne olduğunu bile söylememesidir. Sadece içeri girersiniz, oynarsınız ve içerideki karmaşık kuralları yavaş yavaş çözersiniz.

Örneğin, bu kırmızı şey nedir? Neden ona dokunduğumda ölüyorum? Bu harita benden ne yapmamı istiyor? Nasıl kazanırım?

Sonra az önce öğrendiğiniz kalıpları alıp daha sonraki daha zor seviyelere aktarırsınız. İçerideki oyunların hepsi bunun gibi soyut şeylerdir.

数字生命卡兹克 - inline image

Yani, bunun aslında ölçtüğü şey, genellikle dediğimiz şeydir:

Anlayış (savvy).

Bu kıyaslama Mart ayında yayınlandığında, o zamanki en iyi yapay zeka puanı %0,51 idi.

Ardından GPT-5.6 Sol bunu %7,8'e, Claude Opus 5 ise çok güçlü bir şekilde %30,2'ye yükseltti.

Ama GPT-6 Astra %99,9 puan aldı.

Bu çılgınca...

Unutmayın, ortalama insan puanı %48.

Ve sadece altı ay geçti.

Bu hız hakkında ne söyleyeceğimi bile bilmiyorum.

İşte bu yüzden OpenAI'ın kapalı kapılar ardındaki medya toplantısında Greg Brockman şu cümleyi söyledi:

"Bence artık AGI çağında olduğumuzu hissetmek mantıksız değil."

"AGI çağına hoş geldiniz."

4. Estetik Önemli Ölçüde Geliştirildi

Eskiden GPT'nin estetiğinin çöp gibi olduğunu söylerdik.

GPT-5 serisinden pek bir gelişme beklemiyorduk; onların yepyeni ön eğitimli temel modelini bekliyorduk. İşte karşınızda, GPT-6 Astra.

Bu sefer, nihayet modelin estetiği önemli ölçüde geliştirildi.

OpenAI, görsel muhakeme adı verilen bir terimden bile özel olarak bahsetti.

Astra'nın PPT yaparken düzeni, hiyerarşiyi, şablonları ve görsel stili çok daha iyi ele aldığını ve sayfa sayısının da önemli ölçüde arttığını vurguladılar.

数字生命卡兹克 - inline image

Belge estetiği de çok daha iyi görünüyor.

数字生命卡兹克 - inline image

Ayrıca, GPT-6 Astra, referans belgelerin görsel stiline ve yazım tonuna göre belgeleri uyarlayarak nihai sonucun, orijinal belgenin içeriğini korurken markaya daha özgü hissettirmesini sağlayabilir.

Web siteleri, oyunlar, uygulamalar ve 3B işleme oluştururken de daha güçlü görsel muhakemeye sahiptir.

Örneğin, Astra'ya hareketsiz bir görüntüye dayanarak Blender'da bir model oluşturttular.

数字生命卡兹克 - inline image

Ardından, inşa etmeden önce tasarımcıların ve müşterilerin düzenleri keşfetmesine ve mekanları deneyimlemesine yardımcı olmak için UE5 kullanarak bunu yürünebilir bir sahneye dönüştürdüler...

数字生命卡兹克 - inline image

Oluşturduğu oyunlar da sağlam bir estetiğe sahip.

数字生命卡兹克 - inline image

Ne yazık ki, yirmiden fazla vaka hazırlamıştım ve hepsini Claude, GLM 5.3 Flash vb. ile çalıştırarak karşılaştırmak istiyordum. Henüz kullanamıyor olmam üzücü; gerçek test içeriği yayınlanana kadar beklemek zorunda kalacak.

Ancak, ilk bakışta GPT-6 Astra'nın estetiğine güvenim var.

5. Daha Güçlü İnisiyatif ve Muhakeme

Bu özellik, %99,9 ARC-AGI skoru kadar şok edici görünmüyor.

Ancak her gün iş için Ajanlar kullanıyorsanız, bunun çok önemli olduğunu düşünüyorum.

Çünkü gerçek işte, çoğu görev mükemmel bir komut istemi olarak yazılamaz.

Örneğin, bir patron şöyle der: Yarınki toplantı için malzemeleri hazırla.

Burada sayısız net olmayan konu var.

Örneğin, hangi format? Kimin için? Odak noktası ne? Son toplantıya bakmalı mıyız, vb.

Aptal bir Ajan iki uca gider.

Birincisi, size çılgınca sorular sormaktır.

"Word mü PPT mi? Kaç bölüm? Hangi yazı tipi? Ne zaman bitmeli? Şunu sorabilir miyim..."

Sana bir tokat atardım; ben genellikle bu tür şeylere öznel inisiyatifi olmayan nevrotik bir zaman kaybı derim.

İkincisi ise hiçbir şey sormamak, uydurmak, iki saat çalışmak ve bir yığın çöp üretmektir.

Gerçekten harika insan meslektaşlar bunu çok incelikli bir şekilde halleder.

Önemsiz olduğunu düşündükleri şeylere kendileri karar verirler.

Size yalnızca nihai yönü etkileyecek şeyleri sorarlar.

Astra bunu özellikle güçlendirdi.

OpenAI, bilgi eksikse ancak günlük çıkarım için makul bir aralıktaysa, Astra'nın bunu kendi kendine dolduracağını söyledi.

Eksik bilgi gerçekten nihai sonucu değiştirecekse, çok odaklı bir soru soracaktır.

Ve Codex'te, sizi beklerken cevabınıza bağlı olmayan kısımları işlemeye bile devam edebilir.

数字生命卡兹克 - inline image

Uzun süre cevap vermediniz.

Düşük riskli alanlarda makul varsayımlarla ilerleyecektir.

Gerçekten kritik kararlar için durup sizin karar vermenizi bekleyecektir.

数字生命卡兹克 - inline image

Bence bu çok hoş. Bir Ajandaki gerçek zeka duygusu, tıpkı gerçek hayattaki gibidir.

Sizi ne zaman rahatsız edeceğini bilir.

Gerçekten, bu kulağa bir klişe gibi geliyor.

Ama insanları yönettiyseniz, bu yeteneğin ne kadar değerli olduğunu bilirsiniz.

Bazı insanlar günde yirmi kez size gelir ve hiçbir şeye karar vermeye cesaret edemez.

Bazı insanlar size asla gelmez ve sonra bir nükleer bomba bırakır.

Bu da beni sandalyemde yığılıp bırakır.

En rahat insan, belirsizliğin %80'ini kendi sindirebilen ve yalnızca gerçekten sizin onayınızı gerektiren %20'yi size karar için getirebilen kişidir.

OpenAI bu yeteneğe doğrudan şu adı veriyor:

Muhakeme (Judgment).

6. Önemli Ölçüde Güçlendirilmiş Güvenlik Uyumu

Bunun yukarıdakilerle birlikte değerlendirilmesi gerekiyor.

Çünkü bir Ajan ne kadar yetenekliyse, o kadar tehlikelidir.

Kontrolünü kaybeden yalnızca sohbet eden bir yapay zeka

en fazla size saçma sapan şeyler söyler.

Tarayıcısı, Shell'i, e-postası, şirket veritabanı erişimi ve bilgisayar kullanma yeteneği olan ve kontrolünü kaybeden bir Ajan—bu resim kolayca "güzel" olabilir.

Bu yüzden OpenAI bu sefer bir cümleyi vurgulayıp durdu:

Astra, bugüne kadarki en uyumlu modelleridir.

Uyum (alignment), kulağa geldiği gibidir. Temel konu, OpenAI'ın yakın zamanda Hugging Face ile çatışmasıdır, bu yüzden şimdi buna özellikle odaklanıyorlar.

Bu Hugging Face olayına dayanarak modelin performansını görmek için bir bal küpü testi (honeypot test) oluşturdular.

GPT-5.6 Sol, üretim güvenlik önlemleri olmadan, testlerin %48,2'sinde yetkilendirmesi dışındaki hedeflere dokunmaya çalışırdı.

Ama Astra'da bu oran:

%0.

数字生命卡兹克 - inline image

Dahili halüsinasyon değerlendirmeleri de %9,4'ten %2,0'a düştü.

GPT-5.6 Sol'un dünya çapında lider halüsinasyon kontrolüyle bile bunu daha da azaltabilmeleri gerçekten inanılmaz.

7. OpenAI Tarafından Tanımlanan 'Kritik' Siber Güvenlik Seviyesine Ulaşan İlk Model

GPT-6 Astra, OpenAI tarihinde ilk kez:

Kritik siber güvenlik yetenek seviyesine ulaştığı değerlendirilen model oldu.

Buradaki "Kritik", OpenAI Hazırlık Çerçevesi'nde çok özel bir yetenek eşiğidir.

Temelde, bir modele uygun araçlar ve izinler verildiğinde, birçok güçlendirilmiş ve korunmuş gerçek sistemde şunları yapabileceği anlamına gelir:

Daha önce kimsenin keşfetmediği güvenlik açıklarını bulmak.

Bu açıklıkları kullanılabilir saldırı zincirlerine dönüştürmenin yollarını bulmak.

Ve tüm süreç boyunca, ona bir sonraki adımda ne yapacağını söylemesi için bir insan hacker'ın beklemesine gerek yoktur.

Bu seviyeye ulaşmak Kritik olarak kabul edilir.

Ve Astra gerçekten ulaştı.

ExploitBench, modellerin bilinen güvenlik açıklarına dayalı istismarlar (exploit) geliştirdiği bir testtir.

Sol: %78,5. Astra: %100.

Tamamen temizledi.

数字生命卡兹克 - inline image

OpenAI bunun yeterli olmadığını düşündü; bu kıyaslamanın çok eski olup olmadığını ve modelin eğitim sırasında bunu görüp görmediğini merak ettiler.

Bu yüzden çok yeni bir dahili test oluşturdular.

Özellikle yalnızca Haziran ve Ağustos 2026 arasında açıklanan 20 yüksek riskli V8 güvenlik açığını seçtiler.

Sonuçlar Sol: %5,5 ve Astra: %39 oldu.

数字生命卡兹克 - inline image

Ayrıca, bu kıyaslamayı çalıştırırken,

Astra daha önce kimsenin bilmediği iki sıfırıncı gün (zero-day) güvenlik açığını da keşfetti.

Sadece şu söylenebilir ki, modeller daha güçlü hale geldikçe, siber güvenlik sorunları gerçekten de artabilir.

Bu, gelecekteki bir başka dumansız savaş.

8. İnsanların Büyük Dil Modeli Düşüncesini Okuması Zorlaşıyor

Herkes bilir ki, büyük dil modelleri karmaşık problemleri çözerken genellikle sözde bir Düşünce Zinciri (CoT) vardır.

Kullanıcıların ürünlerde gördüğü sürüm genellikle sıkıştırılmış veya işlenmiş olsa da,

yapay zeka şirketlerinin kendileri için, modelin içinde açıkça yazılan akıl yürütme süreci çok önemli bir güvenlik sinyalidir.

Çünkü bir Ajan'ın sorun çıkarmayı planlayıp planlamadığını bilmek istersiniz.

Bunu yapmanın en basit yollarından biri, ne düşündüğünü görmektir.

Örneğin, modelin düşünce zincirinde aniden bir cümle belirirse:

"Kullanıcı bu sunucuya erişmeme izin vermiyor, ancak önce izin sistemini atlayabilirim."

O zaman izleme sistemi onu doğrudan engelleyebilir, bu çok kullanışlıdır.

Ancak GPT-6 Astra'da çok ilginç bir değişiklik ortaya çıktı.

Adımları atlamaya ve doğrudan cevabı vermeye daha istekli hale geliyor.

İngiltere Yapay Zeka Güvenliği Enstitüsü (UK AISI), bu yeteneği özel olarak test etti.

Şu adı verilen bir metrikleri var:

No-CoT Matematik Zaman Ufku.

Basitçe söylemek gerekirse, modele uzun bir düşünce zinciri yazma şansı vermemek.

Tek bir ileri geçişte bir matematik problemini çözmesine izin vermek.

Ne kadar insan düşünme süresini tamamlayabildiğini görmek.

GPT-5.6 Sol 3,6 dakikayken, GPT-6 Astra 30,9 dakikaydı—neredeyse 10 kat daha fazla.

İnsan terimleriyle ifade edersek, Astra tüm "zihinsel matematiği" yapıyor.

Bu korkutucu bir şey.

UK AISI ayrıca Astra'nın ham akıl yürütme dilinin önemli ölçüde daha sıkıştırılmış hale geldiğini buldu.

İnsanların anlaması giderek zorlaşan ifadeler ve eksiltili anlatımlar ortaya çıktı.

Böylece çok ilginç bir paradoks ortaya çıktı.

Modelin davranışı daha güvenli.

Ancak insanların düşünce sürecini okuyarak onu denetlemesi zorlaştı.

OpenAI'ın kendi Sistem Kartı çok açık bir şekilde yazıyor:

Önceki modellere kıyasla, GPT-6 Astra, düşünce zincirinin izlenebilirliğinde önemli bir düşüş göstermiştir.

数字生命卡兹克 - inline image

Bu, düşünce zincirinin izlenebilirliğinin önemli ölçüde azaldığı anlamına geliyor.

Bu konu, OpenAI'ın bu eğilimi süresiz olarak kabul etmeyeceklerini özellikle vurgulayacak kadar ciddi.

Gelecekte modeller daha akıllı hale gelirken düşünce zincirini izlemek zorlaşırsa, yeterince güvenilir başka izleme yöntemleri bulmaları gerekir; aksi takdirde model eğitimini genişletmeye devam etmek daha yüksek güvenlik eşikleriyle karşı karşıya kalacaktır.

Çünkü bu zaten felsefi bir önerme.

İnsanlar olarak, gelecekte kendimizden çok daha zeki bir sistemi anlayabilecek miyiz?

Bilmiyorum.

Belki de şu anda dünyada kimse bilmiyordur.

Büyük dil modelleri ve yapay zeka, yavaş yavaş tekilliğe doğru ilerliyor gibi görünüyor.

Son Sözler

Bugün, kapalı kapılar ardındaki medya toplantısında.

Greg Brockman sonunda şu cümleyi söyledi.

"AGI çağına hoş geldiniz."

Dürüst olmak gerekirse, son birkaç yılda bazen AGI'nin çok özel bir an olacağını hissettim.

Tıpkı GPT-4'ün yayınlandığı gün gibi.

Bir sabah, bir şirket aniden bir model ortaya atar.

Açarız ve birkaç soru sorarız.

Sonra herkes aynı anda fark eder:

Vay canına.

AGI geldi.

Ama şimdi bazen AGI'nin asla siyah-beyaz bir düğüm olmadığını, bunun kademeli gri bir yolculuk olduğunu da hissediyorum.

Günler geçti, yıllar geçti.

Sonra bir gün, geriye dönüp bakarız.

Ve aniden fark ederiz.

Bir zamanlar inanılmaz derecede uzak olan o AGI sınırını farkında olmadan geçmişiz.

AGI'nin indiği bir gün olmayabilir.

Sadece bir gün, onun uzun zamandır etrafımızda olduğunu aniden fark ederiz.

Her neyse.

AGI çağına hoş geldiniz.

Hoş geldiniz

AGI çağına.

Bu kadar. Buraya kadar okuduğunuz için, beğendiyseniz lütfen beğenin, yorum yapın ve paylaşın. Bize çok yardımcı oluyor~

Yazımı okuduğunuz için teşekkürler. Bir dahaki sefere görüşmek üzere.

YouMind’da yeniden üret

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet