Model yönlendiriciler (router) şu an her yerde, ancak temel bir sınırlamaları var. İster gelişmiş sezgisel kurallara ister her adımı okuyup hangi LLM'i kullanacağına karar veren küçük bir modele dayansın, bir yönlendirici her zaman seçim yaptığı modelden daha az yetenekli olacaktır. Replit Agent ise bu kararı modele bırakıyor.
Ana agent ya da çekirdek döngü, alt agent'larının katmanını ve efor seviyesini seçiyor; görev ilerledikçe kendi ayarlarını da buna göre güncelliyor. Bu özgürlük sayesinde GPT-6 Astra, rutin uygulamaları daha düşük maliyetli alt agent'lara devrediyor ve token'larını nerede harcamaya değer olduğuna kendisi karar veriyor. Hem DeepSWE hem de Terminal-Bench'te Replit Agent, tek başına çalışan Astra'ya kıyasla Pareto-etkin bir performans sergiliyor: Yayımlanmış hiçbir Astra taban çizgisi, daha düşük maliyetle daha yüksek puan almıyor. Ayrıca aynı yapıyı tek bir uzun ömürlü işçiyle kullanan "sidekick" mimarisini de sırasıyla 11 ve 16 puan farkla geride bırakıyor.

Animasyonlar ve dipnotlarla birlikte yazının tamamına https://replit.com/blog/free-the-models adresinden ulaşabilirsiniz.
Neden daha az iskelet (scaffold) kuruyoruz?
Yeni çıkan her model, test altyapısına (harness) gömülü varsayımları geçersiz kılıyor.
Modeller uzun vadeli görevlerde güçlendikçe, altyapı katmanında o kadar fazla iskelete ihtiyaç duymuyorlar. Pratikte, modellerin kendi başlarına daha çok delegasyona yöneldiğini gözlemledik: bağlam yönetimi ve paralellik için alt agent'ları kullanıyorlar. Navier–Stokes dahil son dönemdeki birçok çığır açıcı gelişme, kısmen frontier modeller tarafından desteklenen agent sürülerinin koordinasyonu sayesinde mümkün oldu [[1]](https://openai.com/index/navier-stokes-solution/).
Ancak frontier her zaman pürüzsüz değil. En güçlü kodlama modeli, UI tasarlamakta veya sunum hazırlamakta mutlaka en iyisi olmayacağı gibi, e-posta yazmakta da zirvede olmayabilir.
Bu yüzden altyapımızı, her modelin kendi tarzında çalışmasına izin verecek şekilde tasarlıyoruz; hâlâ ihtiyaç duyduğu güvenlik bariyerleriyle birlikte, minimum maliyetle maksimum kaliteyi hedefliyoruz.
Her yeni model, kesin doğrularımız olarak kabul ettiğimiz şeyleri yeniden test etmemizi ve ortaya çıkan davranışlara dayalı tekniklerle hızlıca deney yapmamızı gerektiriyor. Dolayısıyla modeli özgür bırakmak; ne kadar derin düşüneceğine, işi ne zaman devredeceğine ve kime devredeceğine kendisinin karar vermesine izin vermek anlamına geliyor.

Şekil 1: Çekirdek döngünün her adımda verdiği üç karar.
Delegasyon için birleştirilebilir temel yapı taşları
GPT-6 Astra ile denemelere başladığımızda [[2]](https://openai.com/index/gpt-6-astra), modelin delegasyon konusunda oldukça başarılı olduğunu gördük. GPT-6 ailesi ayrıca OpenAI'ın, önbelleği bozmadan adım ortasında efor değişikliğini destekleyen ilk modeli olma özelliğini taşıyor.
Bu yeteneklerden yararlanmak için dört altyapı yapı taşını geliştirdik. Bunlar, çekirdek döngüye her adımda küçük bir seçenek kümesi sunuyor: ne tür bir alt agent gönderileceği, hangi boyut ve efor seviyesinde olacağı, daha önce bilgilendirilmiş birine geri dönülüp dönülmeyeceği ve ne kadar derin düşünüleceği:
- Alan farkındalığına sahip alt agent'lar. Genel amaçlı bir işçinin yanı sıra altyapı, uzmanlar da sunar: salt okunur kâşifler, tarayıcı testçileri, inceleyiciler ve Slides ile UI için bir tasarım alt agent'ı. Her birinin kendi modeli ve araç seti bulunur. Şimdilik hangi uzmanların var olacağına altyapı karar veriyor; bunların ne zaman ve nasıl kullanılacağına ise çekirdek döngü karar veriyor.
- Alt agent katmanları ve eforu. Küçük, standart ve büyük olmak üzere üç katman; her biri maliyet ve yetenek açısından bir üst basamağı temsil ediyor ve her katmanın kendi içinde bir efor seviyesi bulunuyor. Her ikisi de tüm alt agent'lar için geçerli ve çekirdek döngü bunları her gönderimde seçiyor. Örneğin mekanik bir yeniden adlandırma işlemi düşük eforlu küçük katmana giderken, inatçı bir hata için hipotez üretmek yüksek eforlu büyük katmana gidiyor.
- Yeniden kullanılabilir alt agent'lar. Çekirdek döngü, her şeyi sıfırdan başlatmak yerine daha önce bilgilendirdiği bir alt agent'a geri dönebiliyor. Oturum boyunca hayatta tutulan tek bir sidekick yok: farklı tür ve katmanlarda istediğiniz sayıda alt agent hazır bekliyor ve hangisinin uyandırılacağına döngü karar veriyor. OpenAI'ın yeni modellerindeki daha uzun önbellek süresi, bu işlemin maliyetini düşük tutuyor.
- Dinamik efor ayarı. Bazı modellerde adım ortasında efor değiştirmek artık önbelleği koruduğu için, her adımda gidişatı kontrol eden ve eforu görevin zorluğuyla eşleştiren bir yükseltme sistemi eğittik. Bir yönlendiriciden farklı olarak bu sistem, isteğe yalnızca bir kez değil, devam eden iş üzerinde adım ortasında müdahale ediyor.
Astra ve Fable 5.1'in kod kalitesi [[3]](https://www.anthropic.com/claude-fable-and-mythos-5-1), değerlendirme puanlarımızda hiçbir düşüş olmadan kod inceleme alt agent'ımızı daha az kullanmamıza da olanak tanıdı. Daha önce hiçbir modelde bu düzeyde bir mühendislik kalitesi görmemiştik.
Yeni modeller kendi başlarına delegasyon yapıyor
Astra ve Fable gibi frontier modellerin token başına maliyeti daha yüksektir, bu da onları küçük modellere kıyasla ekonomik görünmez hale getirir. Ancak bu modellerin doğal olarak daha düşük maliyetli alt agent'lara delegasyon yaptığını ve kendi token'larını gerçekten ihtiyaç duyulan kararlara sakladığını gözlemledik.
Replit Agent, çekirdek döngüyü asla alt agent oluşturması için zorlamaz. Tablo 1, üç modelin üretim ortamında bu kararı nasıl verdiğini göstermektedir:

Tablo 1: Replit Agent üretim ortamında delegasyon; her model orta düzey akıl yürütme eforunda.
Üç model de delegasyon yapıyor ama her biri kendi tarzında. Orta efor seviyesinde Fable modelleri işi nadiren genel bir işçiye devreder: Salt okunur kâşifler ve inceleyiciler gönderir, uygulamanın kendisini ise üstlenir. Astra, kendisine söylenmeden genel işçilere rutin olarak delegasyon yapan ilk modeldir ve bir işçiyi bilgilendirdikten sonra sıfırdan başlamak yerine ona geri dönmeyi tercih eder. Bu geri dönüş oranı, her yeni model nesliyle birlikte arttı.

Şekil 2: İz kayıtlarından alınan, 17 Eylül 2026 tarihli bir üretim adımı. Çekirdek döngü bir kâşif, iki işçi ve bir testçi gönderdi; beş işçi gönderiminin üçü, daha önce bilgilendirdiği bir işçiye geri dönüştü.
Sonuçlar
Replit Agent'ı, çekirdek döngü olarak Astra'yı kullanan en yüksek kaliteli ayarımız olan Max modunda, iki yazılım mühendisliği benchmark'ında değerlendirdik: DeepSWE ve Terminal-Bench. Karşılaştırma için iki taban çizgisi kullandık: mini-swe-agent içinde tek başına çalışan ve ilgili liderlik tablolarında yayımlanan Astra ile aynı yapıdaki tek farkı alt agent yapı taşlarının yerini tek bir uzun ömürlü işçinin aldığı sidekick mimarisi. Her grafik, puana karşı görev başına maliyeti gösteriyor; dolayısıyla en verimli yapılandırmalar sol üst köşeye yakın konumlanıyor.
Aktif açık kaynak depolarındaki uzun vadeli değişiklikleri test eden DeepSWE v1.1'de [[4]](https://deepswe.datacurve.ai/), Replit Agent görev başına 2,11 $ maliyetle %72 puan alıyor. Düşük eforla mini-swe-agent içindeki Astra %67 puanla 1,60 $, xhigh eforda ise %74 puanla 4,43 $ maliyete ulaşıyor; sidekick mimarisi 1,34 $ karşılığında %61 puan alıyor. Tamamen bir shell üzerinden gerçekleştirilen çok adımlı işleri test eden Terminal-Bench 4.0'ta [[5]](https://www.tbench.ai/) Replit Agent görev başına 2,53 $ ile %49'a ulaşırken, düşük efordaki Astra 2,25 $ ile %42, xhigh eforda ise 5,86 $ ile %60 elde ediyor. Sidekick mimarisi 1,84 $ maliyetle %33'te kalıyor.

Replit Agent, her iki benchmark'ta da sidekick mimarisini sırasıyla 11 ve 16 puan farkla geride bırakıyor. Sidekick daha düşük maliyetli olsa da bunun karşılığında puanının altıda biri ile üçte biri arasında bir kısmından feragat ediyor. Tek başına Astra'nın daha yüksek puan almasının tek yolu daha fazla harcama yapmak: En iyi ayarları, iki katından fazla maliyetle Replit Agent'ın sadece 2 ve 11 puan üzerine çıkabiliyor. Hiçbir taban çizgisi hem maliyet hem de puan açısından aynı anda kazanamıyor. Replit Agent'ı, promptlama veya altyapıda hiçbir değişiklik yapmadan, kullanıcılara sunulduğu haliyle test ettik.
Altyapı tasarımının acı dersi
Bu sonuçları Sutton'ın acı dersinin [[6]](http://www.incompleteideas.net/IncIdeas/BitterLesson.html) somut bir örneği olarak okuyoruz. İnsan bilgisini bir agent'a gömmek kısa vadede işe yarar, uzun vadede tavan yapar ve nihayetinde hesaplama gücüyle ölçeklenen genel yöntemlerin gerisinde kalır. Katı bir altyapı modeli tek bir çalışma biçimine zorlarken, birleştirilebilir bir altyapı onun seçim yapmasına izin verir. Modeller akıllandıkça, altyapının onlar adına karar vermesi gereken şeyler azalmalıdır.
Daha kuralcı bir mimariyle karşılaştırıldığında bu yaklaşım bize üç avantaj sağlıyor:
- Model ölçeklenme yasalarına oynuyor. Modelin zevkine ve takdirine dayanan delegasyon, her yeni sürümle birlikte gelişiyor. Yeni nesil modellerin erken önizlemeleri bu trendi sürdürüyor.
- Göreve uyum sağlıyor. Model, küçük bir görev için hiçbir şey oluşturmazken, bir arama için tek bir kâşif, bağımsız parçalara bölünen bir derleme için ise bir ekip oluşturuyor.
- Kalıcı hale getirmeden yeniden kullanıyor. Bir alt agent, modelin onu tekrar isteyebilme ihtimaline karşı bağlamını koruyor ve model istemedikçe hiçbir şey kalıcı olmuyor.
Sutton'ın terminolojisiyle ifade etmek gerekirse, altyapı bizim nasıl yapacağımızı dikte etmek yerine, modelin işi nasıl yürüteceğini keşfetmesine izin vermelidir. Modelleri özgür bırakın.
Teşekkürler
Daniel Furman, Jacky Zhao, Vaibhav Kumar, Ed Sioufi ve Michele Catasta tarafından yazılmıştır. Bu çalışmaya katkılarından dolayı James Austin, Toby Ho, Preeya Kirani, Zhen Li, Robin Newhouse, Devanshu Sen Pandey, Ibrahim Sheikh, Samuel Spitz, Peter Zhong ve Replit'teki AI ekibinin geri kalanına teşekkür ederiz. Replit'te AI üzerine çalışmak istiyorsanız ekibim eleman arıyor; pirroh@repl.it adresinden bana ulaşabilirsiniz.





