ORO modeli: Bir Teşvik Mekanizması Olarak Eval
Ajan yeteneklerini test eden subnet sahipleri, doğrulama süreçlerini bir teşvik mekanizması olarak EVAL (EAAIM) çerçevesinde düşünmelidir. Sağlam ve yüksek kaliteli bir eval oluşturduğunuzda, yüksek kaliteli bir teşvik mekanizması kurmak için gereken temeli atmış olursunuz. Bundan sonrası, subnet'inizin sistem tasarımı ve teşvik mekanizmanızı (IM) sunmak için tercih ettiğiniz altyapıya bağlıdır; bu sayede subnet'inizden en yüksek verimi alabilirsiniz. Bu konunun detaylarını da hazırladık, aşağıdaki videoya göz atın. Bunu ShoppingBench ile başardık. Bugün ise yeni benchmark'ımız ORO Bench ile bunu nasıl yaptığımızı duyurmaktan ve hayata geçirmekten büyük heyecan duyuyoruz.
Neden ShoppingBench'ten uzaklaşmamız gerekti?
Daha önce EAAIM'imiz ShoppingBench'ti. Model yetenekleri arttıkça ve ajan yetenekleri de onu takip ettikçe, ShoppingBench'in doygunluğa ulaştığını gördük. Çok adımlı akıl yürütme açısından karmaşıklık bakımından sunacağı çok şey olan statik bir benchmark'tı; ancak statik benchmark'lar er ya da geç doygunluğa ulaşır. Sektörün beklentisi de zaten budur. Benchmark'ınızı sürekli gelişen bir yazılım olarak ele almazsanız — tıpkı Ryan Marten'ın "Continuous Benchmarks" (Sürekli Benchmark'lar) yazısında belirttiği gibi — sonuç hep aynı olacaktır. Bu ilk kez olmuyor; nitekim ShoppingReasoningBench de piyasaya sürüldükten sadece 2 hafta sonra doygunluğa ulaşmıştı. Haziran 2026'da çıkan Gemini 3.5 Pro, lansmandan 2 hafta içinde bu benchmark'ta %77 başarı oranına ulaşmıştı. Hatta ICML 2026'da yayımlanan sistematik bir çalışma, benchmark'ların neredeyse yarısının doygunluk gösterdiğini ve bu oranın zamanla arttığını ortaya koyuyor.
Yeni Benchmark'ımız
Bir ekip olarak sıradaki adımımız, tüketici alışveriş ajanları için belirleyici standart haline gelecek o benchmark'ı inşa etmekti. Doygunluğa ulaşması (%80+ performans) uzun zaman alacak bir benchmark.
Bu yeni benchmark'a dalmadan önce, neden bizim için vazgeçilmez olduğunu netleştirmek önemli:
- Ajan tabanlı ticarette açık kaynak çalışmalarının eksikliği. Benim yerime alışveriş yapacak en iyi ajanın işini düzgün yapacağını nereden bilebilirim? Daha küçük ve düşük performanslı ajanlar pazarda daha kötü sonuçlar veriyor. Bunu önceki bir makalemizde de ele almıştık; Opus 4.5 ajanları alıcı olarak aynı ürünler için Haiku 4.5 ajanlarına kıyasla 2,45$ daha az ödedi ve satıcı olarak 2,68$ daha fazla kazandı. Üstelik zayıf modelin temsil ettiği kişiler bunun farkına bile varmadı.
- Eval'i bir Bittensor subnet'inde barındırarak güçlendirmek. Bittensor, akademi dünyasının eval'lerini test edip sağlamlaştırması için mükemmel bir oyun alanıdır; çünkü bir madenci, bulabildiği her açığı kullanmaya çalışacaktır. Yakın zamanda Epoch AI, Eylül 2026 tarihli SWE-bench Verified incelemesini yayımladı ve genel olarak çözülemeyen görevlerin yarısından fazlasında, işlevsel olarak doğru gönderimleri reddeden testler bulunduğunu ve tüm öncü modellerin eğitim aşamasında bu sorunlardan bazılarını gördüğünü tespit etti. Benchmark'lardaki bu tür "kusurlar", Bittensor'daki madenciler tarafından kesinlikle ortaya çıkarılırdı.
- Arenamızdaki her gönderim bir yörünge (trajectory) üretir. Yani bir çalıştırmanın eylemler, gözlemler, araç çağrıları ve sonuçlarından oluşan tam dizisi. Dikey şirketler kendi nişlerinde pazar payı elde etmek için tam da bu etkileşim verisini kullandı (kodlamada Cursor, klinik tıpta OpenEvidence, müşteri hizmetlerinde Sierra, hukukta Harvey ve Legora). Bu yörüngelerin eğitim sonrası veri olarak son derece değerli olabileceğini fark ettik (yörünge makalemizi okuyun: bir subnet izinden alışveriş ajanı damıtmak).
Yeni benchmark'ı planlarken kendimize şunu sorduk: Anında doygunluğa ulaşmayacak bir şeyi nasıl inşa ederiz? Sürekli arkasından yetişmeye çalışmayacağımız bir yapıyı nasıl kurarız? Cevap şu: Bir benchmark inşa etmeyerek. Bir ortam oluşturucu inşa ederek.
Karşınızda ORO Bench
Ajan tabanlı ticaret için bir genelleme motoru inşa edersek, her gün yeni ve doğrulanabilir ticaret ortamları ile görevler üretebiliriz. Böylece ajanları ezberleyebilecekleri bir benchmark üzerinden değil, daha önce hiç görmedikleri ortamlarda ne kadar verimli akıl yürüttüklerine göre ödüllendirebiliriz.
Bu, ajan tabanlı akıl yürütme için sürekli olarak taze ortamlar üreten bir makinedir. Hem madenci teşviklerini hem de gelecekteki bir ürünü besleyecek doğrulanabilirliği ve ölçeklenebilirliği sağlamak adına, bunları burada bağlantısı verilen yöntemlerle temellendiriyoruz.
Bir ortam nelerden oluşur?
Her ortam bir ürün kataloğundan başlar: 11 milyon kaynak SKU içeren gerçek bir e-ticaret indeksinin anlık görüntüsü. Bu ortamı oluşturan oluşturucu hiçbir model çağrısı yapmaz. Kataloğu kategoriye, özelliğe ve fiyat bandına göre dilimler; yedi görev ailesinin her biri görevlerini bu dilimlerden alır. Böylece bir görev, kalıba uydurulmak yerine kataloğun destekleyebileceği verilerden türetilir. Bir görev ajana şunları sunar:
- Bütçe ve müşterinin en baştan belirttiği kısıtlamalarla birlikte sade bir dille ifade edilmiş bir alışveriş hedefi. Müşteri bir kullanıcı simülasyonu olduğundan, ajanın yumuşak tercihleri ortaya çıkarmak için ek sorular sorma fırsatı vardır ve bu durum doğrulamada ödüllendirilir.
- On araçtan oluşan bir başlangıç seti: arama, filtreleme, görüntüleme, karşılaştırma, stok ve sepet inceleme, sepet düzenleme, simüle edilmiş müşteriyle mesaj kanalı ve sipariş çağrısı.
- Kurtarma görevleri için mühürlenmiş bir olay: seçilen ürünün bölümün sabit bir noktasında stokta kalmaması veya bütçenin üzerine çıkacak şekilde yeniden fiyatlandırılması.
- Nihai durumu inceleyen ve ödülü iki aşamada veren aileye özgü bir doğrulayıcı: önce katı geçitler (sipariş edilen ürün kabul edilen sette mi, stokta mı, bütçe dahilinde mi, yasadışı yan etkiler var mı), ardından bir aile metriği (niyet, kısıtlama ve gerekçe için ikili; geri getirme, tercih, sıralama ve kurtarma için sürekli). Başarısız olan bir geçit sıfır puan verir.
Görevler bir sürümde (EnvPack) derlenir: madencilerin yerel olarak üzerinde çalışabileceği herkese açık bir eleme listesi ve günlük yarış için kullanılan gizli bir yarış listesi. Detaylar çok da önemli değildir; çünkü madenciler sınırları zorladıkça görevlerin nasıl üretileceği sürekli değişecektir ve asıl mesele de budur. Sabit kalan tek şey ORO Bench dokümanlarındaki sözleşmedir.
Eval sürekli güncellendiği için doğası gereği manipülasyona karşı dirençlidir. "Bir Teşvik Mekanizması Olarak Eval" yaklaşımımızı takip edersek, bu durum teşvik mekanizmasını da doğal olarak manipülasyona karşı dayanıklı hale getirmemize yardımcı olur.
Dynamical Systems'ten Jarrod Barnes ile İşbirliği
Bu yeni teşvik mekanizmasını geliştirmek için Dynamical Systems'ten Jarrod Barnes ile birlikte çalışıyoruz. Buradaki ilham kaynağının ticarete uyarlanmış ARC-AGI-3 olduğunu belirtiyor. Ajanları, ezberlemiş olamayacakları yepyeni ortamlara bırakarak zekâyı ölçmek. ORO Bench'in temel fikri de tam olarak bu. Alışveriş hedefi verildiği için puanlama doğrulanabilir kalıyor ve her döngüde yeni olan yalnızca ortam oluyor. Ajan, kodlanmış bir senaryoyu tekrarlamak yerine gerçek tercihler, kısıtlamalar ve ödünleşimler üzerinde keşif yapıp akıl yürütmek zorunda kalıyor.
Bugün, "benchmark olmayan" benchmark'ımız ORO Bench'i tanıtmaktan büyük heyecan duyuyoruz. Bunu subnet'imizde umut verici sonuçlarla çalıştırıyoruz (stokta kalmayan bir üründen kurtulan üst düzey bir ajanın yayımlanan yarış bölümü).
Bu subnet'imiz için ne anlama geliyor?
Zeki madencilere ayak uydurmanın tek yolu, her gün yeni bir teşvik mekanizması yaratmaktır.
Madencilerin bunu nereye taşıyacağını görmek için sabırsızlanıyoruz. Eğer bir geliştiriciyseniz ve ORO'da ajan göndermiyorsanız, çok şey kaçırıyorsunuz demektir. Hemen oroagents.com adresine göz atın.
Yazanlar: @shardiban, @ironseth_s, @JarrodBarnes





