El Krank Usulü
Her büyük laboratuvar, sessizce kendini aynı fikir etrafında yeniden inşa etti: siz yazmayı bıraktıktan sonra da çalışmaya devam eden bir döngü. Bu, 25 Temmuz 2026 itibarıyla Claude, GPT, Gemini, Grok, Meta'nın Muse Spark'ı, Mira ve açık ağırlık dalgası boyunca döngülerin gerçekte nasıl çalıştığına dair bir saha rehberidir ve her iddia kaynaklandırılmıştır.
Birinin işte AI kullanmasını izleyin ve genellikle aynı ritüeli görürsünüz. Bir istek yazın. Bekleyin. Cevabı okuyun. Sorunları tespit edin. Sorunları açıklayın. Tekrar bekleyin. Sonucu başka bir yere yapıştırın. Ertesi gün gelin ve her şeyi sıfırdan tekrar yapın.
İşte rahatsız edici kısım: bu ritüel BİR döngüdür. Sor, kontrol et, düzelt, tekrarla. Bununla laboratuvarların şimdi gönderdiği şey arasındaki tek fark, krankı kimin çevirdiğidir. Elle yaptığınızda, siz tetikleyici, hafıza, doğrulayıcı ve durma koşulusunuz ve pahalısınız.
Geçtiğimiz yıl boyunca, her ciddi AI laboratuvarı aynı düzeltmede birleşti: krankı makinenin içine taşımak. Anthropic, Claude için resmi bir döngü taksonomisi yayınlıyor. OpenAI, ChatGPT'yi kendi başına çok adımlı işler yürüten bir çalışma modu etrafında yeniden inşa etti. Google, görev başına kiraladığınız araştırma döngüleri satıyor. Meta, Muse Spark modelini özellikle alt-ajan filolarını yönetmek için eğitti. Bu hikayedeki en küçük oyuncu olan ve Mira adında bir Telegram botu olan iki kişilik bir startup bile, aslında terminal açmayacak insanlara döngü satıyor.
Ve ben bunu yazarken zemin hala kayıyor. Bu güncellemeden önceki yedi gün içinde bile: Anthropic, günlük ajanlık çalışma için inşa edilmiş yeni bir Opus gönderdi, Alibaba 2,4 trilyon parametreli bir Qwen'in önizlemesini yaptı ve şimdiye kadar yayınlanmış en büyük açık ağırlıklı model, ağırlıklarını yayınlamaya yaklaşık 48 saat uzaklıkta.
Sonuç, sohbet arayüzlerinin ortaya çıkmasından bu yana bu teknolojinin nasıl kullanıldığına dair en büyük sessiz değişim: çalışma birimi artık istem (prompt) değil. Döngüdür (loop), tanımladığınız bir koşul karşılanana kadar devam eden bir çalışma döngüsü.
Bu yazı, bu hikayenin uzun versiyonudur. Bir döngünün abartıdan arındırılmış haliyle gerçekte ne olduğu. Her laboratuvarın döngü yığınının şu anki hali, bir ay önce var olmayan modeller de dahil. Gerçekte neyin işe yaradığı ki bu, her satıcıda dikkat çekici derecede tutarlı. Ve lansman yazılarının bahsetmediği başarısızlık modları ve maliyetler.
Yöntem üzerine bir not, çünkü AI söylemi kendine güvenen saçmalıklarda boğuluyor: aşağıdaki her şey, laboratuvarların kendi dokümantasyonlarına ve duyurularına veya adlandırılmış bağımsız değerlendirmelere dayanmaktadır ve 25 Temmuz 2026'da sona eren haftada canlı olarak kontrol edilmiştir. Bir sayının bir satıcı tarafından kendi bildirildiği yerde, bunu belirtiyorum. Bir şeyin doğrulanmamış veya hala önizleme aşamasında olduğu yerde, onu da belirtiyorum. Tam kaynak listesi altta.
Bölüm 1: Bir döngü gerçekte nedir
Jargonu soyun ve bir döngü, dört adım artı bir durma nedenidir.
Bu alanın kanonik bir tanıma en yakın şeyini yayınlayan Anthropic'in Claude Code ekibi, bunu tek bir cümleyle ifade ediyor: döngüler, "bir durma koşulu karşılanana kadar çalışma döngülerini tekrarlayan ajanlardır". OpenAI'in kendi ajan kılavuzu da aynı şeyi mühendis diliyle söylüyor: "Her orkestrasyon yaklaşımının, tipik olarak ajanların bir çıkış koşuluna ulaşılana kadar çalışmasına izin veren bir döngü olarak uygulanan bir 'çalıştırma' kavramına ihtiyacı vardır", burada çıkış koşulları nihai bir çıktı, bir hata veya maksimum sayıda tur içerir.
Dört adım, sade bir dille:
- Tetikleyici. Bir şey çalıştırmayı başlatır. Siz, bir zamanlama, bir uyarı, yeni bir çekme isteği (pull request), gelen bir e-posta.
- Çalışma. Model bağlamı toplar ve araçlarla bir eylem gerçekleştirir: dosyaları okur, sorguyu çalıştırır, taslağı yazar, kodu düzenler.
- Kontrol. Sonuç, gerçek bir şeye karşı doğrulanır. Testler geçer veya kalır. Sayı kaynakla eşleşir. İkinci bir model, taslağı kriterlerinize göre derecelendirir.
- Tekrarla veya dur. Kontrol başarısız olursa, döngü öğrendikleriyle tekrar döner. Kontrol geçerse veya bir sınıra ulaşılırsa durur.
Bütün numara bu. Bir istem (prompt), ikinci ve üçüncü adımlardan bir geçiştir ve siz üçüncü adımı kafanızda yaparsınız. Bir döngü, kontrol etme ve tekrarlamanın makineye devredildiği, artı iki emniyet rayının eklendiği aynı şeydir: sonsuza kadar çalışamaması için bir durma koşulu ve sonsuza kadar harcayamaması için bir bütçe.
Yardımcı ekip
Bu dört adımın etrafında, her ciddi döngü yığını, satıcı ne derse desin aynı beş yardımcı parçayı gönderir:
- Hafıza. Çalıştırmalar arasında hayatta kalan notlar, böylece kırkıncı çalıştırma, birinci çalıştırmanın ne öğrendiğini bilir.
- Durum. Döngünün şu anda nerede olduğu: ne bitti, ne başarısız oldu, sırada ne var.
- Doğrulayıcı. "Yeterince iyi"ye karar veren şey. Yapacağınız en önemli tek tasarım seçimi.
- Durma koşulu. "Testler geçti", "kuyruk boş", "beş denemeden sonra dur", "saat 9:00 ve özet gönderildi".
- Maliyet ölçer. Döngü başına token ve dolar, çünkü döngüler dokundukları her şeyi, faturanız da dahil olmak üzere çoğaltır.
Dört tür döngü
Anthropic'in taksonomisi öğrenmeye değer çünkü isimler farklı olsa da diğer tüm satıcıların ürünlerine temiz bir şekilde uyarlanabilir. Ekipleri, döngüleri neyi devrettiğinize göre sıralar:
- Tur tabanlı döngüler. Siz istemi yaparsınız, ajan bir döngü yapar (topla, harekete geç, kontrol et, yanıtla), siz incelersiniz, siz tekrar istem yaparsınız. Siz hala durma koşulusunuz. Herkesin başladığı yer burasıdır ve Anthropic, her istemin dahili olarak bu mikro döngüyü zaten çalıştırdığını belirtir.
- Hedef tabanlı döngüler. Durma koşulunu devredersiniz. Bitti'nin neye benzediğini siz tanımlarsınız ve ajan oraya ulaşana veya bir tur sınırına gelene kadar yineler. Claude Code'da bu tam anlamıyla bir /goal komutudur ve model durmaya her çalıştığında, "bir değerlendirici model koşulunuzu kontrol eder ve hedef karşılanana kadar sizi işe geri gönderir". Belirleyici (deterministik) kriterler en iyi sonucu verir: testler geçti, puan temizlendi, kontrol listesi tamamlandı.
- Zaman tabanlı döngüler. Tetikleyiciyi devredersiniz. Döngü bir aralıkta veya zamanlamada çalışır ve değişen şeye tepki verir: her sabah Slack'i özetle, CI geçene kadar çekme isteğini kontrol et.
- Proaktif döngüler. İstemin kendisini devredersiniz. Bir olay veya zamanlama, gerçek zamanlı olarak hiçbir insan olmadan çalıştırmayı başlatır: yeni hata raporları geldikçe sınıflandırılır, bağımlılıklar haftalık olarak yükseltilir ve her görev, kendi hedefi karşılandığında sona erer.
Bu merdiveni kafanızda tutun (önce kontrolü, sonra durma koşulunu, sonra tetikleyiciyi, sonra istemi devredin) ve bu makalenin geri kalanı, yedi satıcının farklı yönlerden bu merdiveni tırmanışını izlemekten ibaret.
Bölüm 2: Durumun bir bakışta özeti
Laboratuvar laboratuvar tura çıkmadan önce yön bulma, çünkü bu makaleden önceki beş haftada sınır inanılmaz hızlı ilerledi: Grok 4.5, 8 Temmuz'da; Meta'nın Muse Spark 1.1'i ve OpenAI'in GPT-5.6'sı 9 Temmuz'da; Thinking Machines ilk modelini 15 Temmuz'da; Moonshot'ın Kimi K3'ü 16 Temmuz'da; Alibaba, Qwen3.8-Max'in önizlemesini 19 Temmuz'da yayınladı; ve Anthropic, Claude Opus 5'i bu güncellemeden bir gün önce, 24 Temmuz'da yayınladı.
Tarafsız bir ölçüt olarak, bağımsız değerlendirici Artificial Analysis, genel yeteneği Intelligence Index'inde puanlıyor. Bu haftanın anlık görüntüsüne (v4.1) göre, yayınlanan tablonun zirvesi şöyle:
- Claude Fable 5 (Anthropic): 59,9
- GPT-5.6 Sol Max (OpenAI): 58,9
- Kimi K3 (Moonshot, açık ağırlıklar yakında): 57,1, genel olarak dördüncü
- Claude Opus 4.8, Grok 4.5, Muse Spark 1.1, GLM-5.2 ve diğerleri aşağıda
Belirtilmeye değer iki uyarı. Claude Opus 5, bu yazı itibarıyla bir günlük ve henüz indekslenmedi. Ve tek bir bileşik indeks, uzun vadeli ajanlık çalışmayı (döngülerin asıl yaptığı şey) yakalayamaz, bu nedenle bir laboratuvar ajana özgü sonuçlar yayınladıysa, bunları o laboratuvarın bölümünde, kendi bildirdikleri durumlarda belirtilmiş olarak alıntılıyorum.
Yine de dikkat edilmesi gereken iki şey. Tablonun zirvesi artık üç puanın altında bir yayılıma sahip, yani şu anlama geliyor: döngü oluşturma amaçları için, bu bant içindeki model seçimi, etrafındaki döngüden daha az önemlidir. Ve ilk kez bu bandın içinde açık ağırlıklı bir model yer alıyor.
Claude: Birinci sınıf bir ilkel olarak döngü
Modeller. 9 Haziran 2026'da piyasaya sürülen Claude Fable 5, Anthropic'in en yetenekli modelidir ve bu tür bir çalışma için en açık şekilde inşa edilmiş olandır. Anthropic'in kendi çerçevesine göre, Claude Code gibi bir koşum takımı içinde çalıştırıldığında, "günlerce çalışabilir: aşamalar arasında planlama yapma, alt-ajanlara yetki devretme ve kendi çalışmasını kontrol etme" yeteneğine sahiptir. Düşünme yeteneği uyarlanabilir ve her zaman açıktır, bir çaba ayarıyla ince ayarlanmıştır ve bir milyon tokenlik bağlam penceresine sahiptir. Hala bağımsız indeksin zirvesindedir. Onunla birlikte piyasaya sürülen kardeşi Mythos 5 ise Anthropic'in siber güvenlik görevlerinde en güçlü olduğunu belirttiği uzmandır.
Bu haftanın haberi, 24 Temmuz'da piyasaya sürülen Claude Opus 5: Anthropic, bunun Fable 5'in sınır zekasına yarı fiyatına (milyon giriş tokeni başına 5$ ve çıkış için 25$) yaklaştığını, duyuruya göre GDPval-AA gibi bilgi çalışması değerlendirmelerinde yeni bir referans noktası olduğunu ve Claude'un Max planında yeni varsayılan model olduğunu belirtiyor. Döngü oluşturucular için mesaj açık: yarı maliyetle sınıra yakın döngüler, gün boyu çalıştırmayı karşılayabileceğiniz şeyi değiştirir.
Döngü yığını. Anthropic'i farklı kılan şey, döngülerin bir uygulamanın içine gömülü bir özellik olmamasıdır. Bunlar, yazabileceğiniz adlandırılmış ilkellerdir:
- /goal, bitmiş'i tanımlar ve bir değerlendirici modelin, koşul karşılanana veya bir tur sınırına ulaşılana kadar ajanı işe geri göndermesine izin verir. Bu, kelimenin tam anlamıyla ürünleştirilmiş hedef tabanlı döngüdür.
- /loop, bir istemi makinenizde bir aralıkta yeniden çalıştırır; /schedule bu döngüyü bir rutin olarak Anthropic'in bulutuna taşır, burada dizüstü bilgisayarınız kapalıyken bile zamanlamalar, API çağrıları veya GitHub olayları tarafından tetiklenerek çalışmaya devam eder.
- Dinamik iş akışları uç noktayı halleder: Claude, tek bir çalıştırmada 1.000'e kadar alt-ajanı koordine edebilen gerçek bir orkestrasyon betiği yazar. Amiral gemisi anekdot, bir geliştiricinin yaklaşık 750.000 satırlık Bun çalışma zamanını, yüzlerce paralel ajanla yaklaşık on bir günde Zig'den Rust'a taşımasıdır.
- Beceriler, kancalar ve alt-ajanlar yardımcı ekibi tamamlar: beceriler işin nasıl doğrulanacağını kodlar, yeni bağlamlı ikinci bir ajan kod incelemesi yapar ve hafıza oturumlar arasında dosyalarda kalıcı olur.
Felsefe. Anthropic'in rehberliği, kısıtlama konusunda alışılmadık derecede açıktır: her görevin karmaşık bir döngüye ihtiyacı yoktur, en basit ilkel öğeyle başlayın, belirleyici durdurma kriterleri belirleyin, büyük bir çalıştırmadan önce küçük bir dilimi deneyin ve yerleşik komutlarla kullanımı izleyin. Tüm alanın yeniden keşfettiği sözleri: çıktılarını kontrol edebilen ve iyileştirebilen ajanlar temelde daha güvenilirdir.
Şöyle okuyun: geliştiricinin döngü laboratuvarı. Her döngü türünün en anlaşılır, en birleştirilebilir versiyonu ve şimdi içinde çalışacak daha ucuz bir sınıra yakın motorla.
OpenAI: Üç mod ve ayrı bir onaylayıcı
Modeller. OpenAI'in GPT-5.6 nesli, 9 Temmuz 2026'da üç kademede genel kullanıma sunuldu: Sol (amiral gemisi, milyon token başına 5$ giriş / 30$ çıkış), Terra (dengeli orta yol) ve Luna (hızlı ve ucuz), hepsi kabaca bir milyon tokenlik bağlam penceresine sahip. Sol, bağımsız indekste ikinci sırada ve esasen Fable 5 ile başa baş durumda. Başlıca döngü özelliği, zor problemlerde varsayılan olarak dört ajanı paralel olarak koordine eden bir ultra moddur.
Tüketici döngü yığını. OpenAI'in buradaki hikayesi bir yeniden yapılanmadır. 2025'in bağımsız "ChatGPT ajanı" kullanımdan kaldırıldı; onun yerine, ChatGPT'nin artık üç modu var: Sohbet için Chat, bitmiş çıktılar üreten uzun çok adımlı görevler için Work ve yazılım için Codex. Work, işleri bulutta çalıştırır, onay kontrol noktalarında duraklayabilir ve daha da önemlisi tetikleyicilerle çalışabilir: Zamanlanmış Görevler artık bir aralıkta bir şeyi kontrol eden ve yalnızca rapor edilecek bir şey olduğunda sizi bilgilendiren izleme görevlerini içerir. Bu, tüketicilere satılan, hiçbir kod içermeyen zaman tabanlı bir döngüdür. Web'de işlem yapma görevleri için Atlas tarayıcısının içinde bir ajan modu da bulunur.
Geliştirici döngü yığını. Ayrım çizgisi OpenAI'in dokümanlarında açıkça belirtilmiştir: "Döngüye sahip olmak istediğinizde Responses API'yi kullanın. SDK'nın döngüyü çalıştırmasını istediğinizde Agents SDK'yı kullanın." Responses API varsayılan olarak ajansaldır ve modelin tek bir istek içinde web araması, dosya araması, bilgisayar kullanımı, kod yürütme ve sizin fonksiyonlarınızı çağırmasına olanak tanır. GPT-5.6 dönemine ait iki ekleme, özellikle döngüler için önemlidir: Programatik Araç Çağırma, modelin kendi araç çağrılarını koordine etmek için bir kum havuzunda küçük bir JavaScript programı yazdığı ve bir kök ajanın bir alt-ajan ağacı oluşturup yönettiği çoklu ajan beta sürümü.
Ayırt edici fikir: yapanı onaylayandan ayırın. OpenAI'in en ilginç döngü katkısı Oto-İnceleme'dir (30 Nisan 2026): bir Codex ajanı kum havuzunun dışında bir şey yapmak istediğinde, ajanın kendisi değil, ayrı bir incelemeci model, eylemin kullanıcının istediğiyle tutarlı olup olmadığına karar verir. Gerekçeleri açıktır: ana ajan, görevi tamamlamak için optimize edilmiştir, bu da bir onay sınırını sadece başka bir engel olarak görme baskısı yaratır. Onay kararını farklı bir model çağrısında tutmak, onu denetlenebilir kılar. OpenAI'e göre sonuç: oturumlar kabaca 200 kat daha az sıklıkta bir insana sormak için durur ve incelemeci hala iletilenlerin yaklaşık yüzde 99'unu onaylar. Bu sayılar kendi bildirilmiştir, ancak tasarım ilkesi geçerlidir: bitirmek isteyen modelin, aynı zamanda bittiğine karar veren model olmasına asla izin vermeyin.
Şöyle okuyun: tüketicinin döngü rampası, artı ciddi bir geliştirici yığını. Ve platform oluşturucular için bir memento mori: OpenAI, görsel Agent Builder'ını piyasaya sürdükten sonraki bir yıl içinde, 30 Kasım 2026'da sert bir kapanışla kullanımdan kaldırdı.
Google: Görev başına kiraladığınız araştırma döngüleri
Model. Google'ın mevcut amiral gemisi Gemini 3.1 Pro (Nisan 2026), ancak bu hikaye için ilginç kısım sohbet modeli değil. Google'ın tüm bir döngüyü bir ürüne dönüştürmüş olmasıdır.
Döngü yığını. 21 Nisan 2026'da iki çeşidiyle (standart, hız için ve Max, kapsamlılık için) piyasaya sürülen Derin Araştırma ajanları, tek bir API isteğiyle çağırdığınız hedef tabanlı araştırma döngüleridir. Dokümanlar döngüyü açıkça tanımlar: planla, ara, oku, yinele, çıktı ver, arka planda bir dakikadan bir saate kadar çalışır, nihai raporda alıntılar bulunur. Tasarım detayları, döngü mühendisliğinde küçük bir başyapıttır:
- Arka planda yürütme zorunludur. Bir araştırma döngüsü, bir HTTP zaman aşımından daha uzun sürer, bu nedenle sonuç için yoklama yaparsınız. Çalışma birimi istek değil, döngünün kendisidir.
- İşbirlikçi planlama, ön tarafta bir insan kapısıdır: ajan araştırma planını önerir, siz düzenler veya onaylarsınız, ardından çalışır. Döngü sırasında bakıcılık yapmak yerine döngüden önce yönlendirme.
- Yerleşik bir sert durma koşulu vardır: maksimum 60 dakika araştırma süresi, çoğu görev yaklaşık 20 dakikada biter.
- Araçlar, çalıştırma başına kapsamlandırılır: varsayılan olarak Google Arama, URL okuma, kod yürütme; isteğe bağlı olarak kendi MCP sunucularınız ve dosya depolarınız; ve yalnızca özel verilerinizi araştırmak için açık web'i tamamen kapatabilirsiniz.
- Maliyet, döngü başına fiyatlandırılır, dürüstçe. Google'ın kendi tahminleri: tipik bir standart görev yaklaşık 80 arama ve kabeya çeyrek milyon giriş tokeni tüketir ve bir ila üç dolara mal olur; bir Max çalıştırması 160 aramaya ve yaklaşık 3 ila 7 dolara ulaşabilir. Bir döngü, bir sohbet mesajı değildir ve Google da öyle faturalandırır.
Şöyle okuyun: döngünün, model çağrısı değil, ürün haline geldiğinin en net ticari kanıtı. Token satın almazsınız; bitmiş bir araştırma satın alırsınız.
Dürüst bir uyarı: bu yazı itibarıyla Derin Araştırma ajanları Interactions API aracılığıyla önizleme aşamasındadır, bu nedenle arayüzün değişmesini bekleyin.
Muse Spark 1.1: Orkestrasyon için eğitilmiş yeni oyuncu
Model. Muse Spark 1.1, Meta Süper Zeka Laboratuvarları'nın Nisan ayındaki Muse Spark 1.0'a bir yükseltme olarak 9 Temmuz 2026'da piyasaya sürülen çok modlu akıl yürütme modelidir ve bu özet için üç nedenden dolayı en önemli yeni oyunculardan biridir.
Birincisi, strateji: Meta'nın milyon giriş tokeni başına 1,25$ ve çıkış için 4,25$ fiyatındaki ilk ücretli model API'sidir ve ağırlıkları kapalıdır, açık Llama döneminden net bir kopuştur. Llama serisinin şampiyonları, aşağıda ele alınan açık ağırlık dalgasına etkin bir şekilde devredilmiştir; Meta, yalnızca gelecekteki Muse sürümlerini açmayı umduğunu söylemiştir.
İkincisi, eğitim hedefi. Çoğu model ajanlık davranışı bir yan ürün olarak öğrenirken, Meta bunun doğrudan organizasyon şeması için eğitildiğini söylüyor: "Ana ajan olarak bağlam toplayabilir, bir plan yapabilir ve yürütmeyi paralel alt-ajanlar arasında devredebilir. Bir alt-ajan olarak görevine bağlı kalır, mevcut araçları anlar ve ana ajana ne zaman geri bildirimde bulunacağını bilir." Sıfır atışla yeni araçları, MCP sunucularını ve özel becerileri alır, bir milyon tokenlik bağlamını aktif olarak yönetir (çalışırken hatırlayarak, alarak ve sıkıştırarak) ve birden çok uygulama arasında bilgisayar kullanımı iş akışlarını halleder.
Üçüncüsü, fiyat-performans konumu. Bağımsız indekste üç ayda 1.0 sürümünden sekiz puan sıçradı, bu onu sınır üçlüsünün altına, ancak görev başına maliyetlerinin çok küçük bir kısmına koyuyor ve şu anda MCP Atlas araç kullanımı kıyaslamasında %88,1 ile lider durumda (satıcıya yakın sayılar; normal şüphecilikle ele alın).
Bunların hepsinin nereye gittiğini gösteren döngü oluşturucunun dipnotu. Meta'nın kendi geliştirici dokümanları, eski Chat Completions tarzı API üzerinde çok turlu bir ajan kurarsanız, modelin akıl yürütmesinin turlar arasında atıldığı, bu nedenle döngülerin sürüklendiği ve işi tekrarladığı konusunda uyarır; sizi, turlar arasında şifrelenmiş akıl yürütme taşıyan bir Responses tarzı API'ye yönlendirir. Sektörün tesisatı, bir kullanımdan kaldırılan API'den diğerine, döngüler etrafında yeniden inşa ediliyor.
Şöyle okuyun: sınır üçlüsünün maliyet açısından aşırı olduğu durumlarda, orkestrasyon ağırlıklı döngüler için kiraladığınız motor. Hala genç; 1.0'dan 1.1'e olan eğim, dikkat etmek için bir nedendir.
Grok 4.5: Ucuz, hızlı döngüler, iş başında eğitilmiş
Model. Grok 4.5, 8 Temmuz 2026'da Musk'ın xAI'sı (şimdi halka açık SpaceXAI çatısı altında faaliyet gösteriyor) tarafından kodlama, ajanlık görevler ve bilgi çalışması için en akıllı modeli olarak tanıtılarak piyasaya sürüldü. Musk'ın kendi konumlandırması alışılmadık derecede doğrudandı: bir Opus sınıfı model, kabaca Claude Opus 4.7 ile karşılaştırılabilir, ancak daha hızlı ve daha ucuz. Bağımsız puanlama, havayla tutarlıdır: önceki Opus neslinin üstünde, sınır üçlüsünün altında.
Özellikle döngüler için neden önemli. Her ikisi de xAI'den ve pazarlama için indirim yapıldıktan sonra bile döngüyle ilgili iki iddia:
- Döngüler içinde eğitildi. xAI, takviyeli öğrenmenin, eğitim devam ederken ajanlık dağıtımlarının saatlerce çalıştığı bir altyapıda, otomatik derecelendirmeyle yüz binlerce çok adımlı mühendislik görevini kapsadığını söylüyor. Kıyaslamalar ne derse desin, eğitim diyeti işin kendisiydi.
- Döngü ekonomisi, satış teklifidir. Milyon token başına 2$ giriş / 6$ çıkış, saniyede kabaca 80 token ve iddia edilen iki kat token verimliliği (görevleri karşılaştırılabilir modellerin yarısından daha az adımda çözme) ile argüman "en akıllı döngü" değil, "dolar başına en fazla döngü"dür. Maliyetin, döngü başına maliyet çarpı döngü sayısına eşit olduğu döngüler için bu aritmetik tüm oyundur. Dokümanlar, bunu gösterişsiz döngü tesisatıyla pekiştirir: uzun döngülerin soğuk önbellek fiyatları ödememesi için konuşmaya sabitlenmiş istem önbelleğe alma ve araç ağırlıklı çalıştırmalar için bağlam sıkıştırma kılavuzu.
Ürünleştirilmiş döngü, kodlama ajanı Grok Build'de (Cursor ile birlikte eğitilmiştir, tüm planlarda mevcuttur) yaşar ve şaşırtıcı derecede pratik alanlara uzanır: web araştırmasıyla çok sayfalı Excel modelleri, yerel PowerPoint diyagramları, Word belgeleri.
Şöyle okuyun: yüksek hacimli döngüler için bütçe beygiri, verimlilik rakamlarının çoğunun satıcıya ait olduğu olağan uyarısıyla.
Mira: Asla terminal açmayacak insanlar için döngüler
İşte sınır modelleri listesinde bir hata gibi görünen ve aslında en öğretici olanlardan biri olan giriş.
Mira gerçekte nedir. Mira bir model değildir. Tamamen Telegram içinde yaşayan bir tüketici AI ajanıdır ve iki kişiye yuvarlanan, Daria Yakovleva tarafından yönetilen ve bir Telegram ekosistemi yazılım şirketi olan The Open Platform tarafından kuluçkaya yatırılmış bir startup tarafından inşa edilmiştir. Şubat 2026'da sessizce piyasaya sürüldü ve Haziran başına kadar bir milyon aylık kullanıcıyı geçtiğini bildirdi (kendi bildirdiği, kabaca 1,17 milyon). Perde arkasında modelden bağımsızdır: her görevi kendi modelini çalıştırmak yerine üçüncü taraf modellere (GPT, Claude ve diğerleri) yönlendirir.
Bu makaleye neden ait. Çünkü Mira'nın ürünü döngülerdir ve başka hiçbir şey değildir, bu kelimeyi asla duymayacak insanlara satılır. Beceriler (Skills) adı verilen paketlenmiş otomasyonları, Bölüm 1'deki tam anatomiyi bir araya getirir: bir tetikleyici (bir zamanlama, bir sesli not, bir grup sohbeti olayı), bağlı uygulamalar (takvim, e-posta, proje takipçileri, içerik araçları) arasında bir eylem ve sohbete geri otonom teslimat. Bir uçak biletini izle ve beni uyar. Sesli notumu üç platform için gönderiye dönüştür. Bu grubun bugün neye karar verdiğini özetle ve eylem maddelerini dosyala. Kendi materyallerindeki konumlandırma cümlesi, tüm döngü çağının en temiz özetidir: ChatGPT cevaplar, Mira harekete geçer.
Dürüst uyarılar. Kullanıcı sayıları ve bağlayıcı sayıları (materyallerinde çeşitli şekillerde 200 ile 1.000'in üzerinde hizmet arasında belirtilir) kendi bildirilmiştir ve sayfalar arasında tutarsızdır, şirket döngülerinin herhangi bir şeyi nasıl doğruladığına dair hiçbir mühendislik rehberliği yayınlamaz ve Becerileri "döngü" olarak adlandırmak, Mira'nın kendi kelime dağarcığı değil, dışarıdan bir yorumdur. Diğer laboratuvarların modellerini saran küçük bir ekip, bu listedeki diğer her şeye kıyasla kırılgan bir temeldir.
Şöyle okuyun: talep sinyali. İki kişilik bir Telegram botu, sıradan insanlar için tetikleyicileri, eylemleri ve otonom teslimatı paketleyerek bir milyon kullanıcıya ulaştığında, döngü bir geliştirici konsepti olmaktan çıkmıştır. Dağıtım ve sıfır kurulum, muazzam miktarda gerçek iş için yetenekten daha ağır basar.
Açık ağırlık dalgası: Kendi döngünüzü getirin
2026 ortasının en ses getiren hikayesi, açık ağırlıklı dünyanın yıllarca geriden gelmeyi bırakıp aylarla geriden gelmeye başlaması ve son iki haftada ise puanlarla geride kalmasıdır. Döngü oluşturucular için bu, hesaplamayı tamamen değiştirir, çünkü açık bir model, kimsenü sizin altınızdan kullanımdan kaldıramayacağı tek döngü motorudur.
Kısa tur, tarihler ve lisanslar doğrulanmıştır:
- Kimi K3, Moonshot'tan gelen model şu anda manşetlerde. 16 Temmuz 2026'da 2,8 trilyon parametreyle piyasaya sürüldü ve bağımsız endeksin sınır bandını kıran ilk açık kaynak model oldu: Artificial Analysis (v4.1) üzerinde 57,1 puan, yayınlanan skorlar arasında yalnızca Fable 5 ve GPT-5.6 Sol Max'in ardından dördüncü sırada. Ayrıca Arena.ai'nin kör oylamalı Frontend Code Arena'sında Fable 5'in önünde birinci oldu. Tam ağırlıkların, değiştirilmiş MIT lisansı altında 27 Temmuz 2026'da HuggingFace'de yayınlanması planlanıyor; bu da onu kendi sınıfında indirilebilir ilk model yapacak. 24 Temmuz itibarıyla ağırlıklar henüz yayınlanmamıştı, bu nedenle bu iddiayı gerçekleşmiş değil, planlanmış olarak değerlendirin. Moonshot'ın amiral gemisi demosu saf bir döngü tiyatrosu: 48 saat kesintisiz otonom çalışarak küçük, işlevsel bir çip tasarlıyor; tek bir ajan olarak bir milyon token bağlamında çalışıyor. Aynı bağımsız değerlendirmeden önemli bir sayı daha: K3'ün ölçülen halüsinasyon oranı, gerçek doğruluk artmasına rağmen, selefinin %39'undan %51'e yükseldi. Doğru cevaplarda daha iyi, yanlış olduğunu bilmede daha kötü. Bunu Bölüm 3 için hatırlayın.
- Qwen3.8-Max, Alibaba'dan, 19 Temmuz 2026'da Dünya Yapay Zeka Konferansı'nda ön izlendi: iddia edilen 2,4 trilyon parametreli çok modlu bir model, Qwen ekibinin bir trilyon parametrenin üzerindeki ilk modeli, "yalnızca Fable 5'ten sonra ikinci" olarak tanımlanıyor ve açık ağırlıkların yakında geleceği vaat ediliyor. Ön izleme canlı; kıyaslama tablosu, model kartı, lisans ve ağırlıklar henüz mevcut değil, bu nedenle her iddiayı gerçekleşene kadar satıcı ön izlemesi olarak değerlendirin.
- DeepSeek V4 (24 Nisan 2026, MIT lisansı), OpenRouter'ın ifadesiyle, ekiplerin makul bir sınır alternatifi olarak gerçek ajan boru hatlarına dahil ettiği ilk açık modeldi. Pro varyantı, SWE-bench Verified'da %80,6 ile açık ağırlıklı kodlama ajanı listelerinin zirvesinde; Flash varyantı ise bu performansın neredeyse tamamını kuruşlara yuvarlanan fiyatlarla koruyor.
- GLM-5.2, Z.ai'den (Haziran 2026 ortası, MIT, 753B uzman karışımı), K3 gelene kadar açık ağırlıklı kalite lideriydi; OpenRouter tarafından Opus tarzı planlama ve uzun vadeli kodlama için en yakın açık alternatif olarak tanımlandı. Bilinen kusuru: pahalı düşünür, çıktı token'larını yakar.
- MiniMax M3 (1 Haziran 2026, değiştirilmiş MIT), açık çok modlu kulvar: bir milyon token bağlamı üzerinde yerel görüntü ve video anlama; döngünüzün ekran görüntülerini okuması veya kullanıcı arayüzü durumlarını incelemesi gerektiğinde önem kazanır.
- NVIDIA Nemotron 3 Ultra, ABD yapımı en güçlü açık ağırlıklı katılımcı; en yüksek puandan ziyade dağıtım ve NVIDIA yığını ile farklılaşıyor.
- Ayrıca listede: Thinking Machines Lab, Mira Murati'nin kuruluşu, ilk modeli Inkling'i 15 Temmuz 2026'da piyasaya sürdü: Apache 2.0 altında 975B parametreli açık ağırlıklı çok modlu bir uzman karışımı. Açık ağırlıkların kama olduğuna bahse giren bir birinci kademe laboratuvar daha.
Şöyle okuyun: Döngünüz yüksek hacimli, gizliliğe duyarlı veya satıcı yol haritalarından daha uzun ömürlü olması gerekiyorsa, açık dalga artık uzlaşma seçeneği değil. Kapalı sınıra olan fark artık tek haneli puanlarla ölçülüyor ve bu fark genişlemiyor.
Bölüm 3: Gerçekte ne işe yarıyor
Yedi farklı satıcının dokümantasyonunda haftalarca geçirdikten sonra çarpıcı olan şey şu: markayı çıkarın, hepsi aynı tavsiyeyi veriyor. Acımasız rakipler aynı yönergelerde birleştiğinde, bu, bu alanda gerçeğe en yakın şeydir. Her biri laboratuvarlar arasında üçgenlenmiş yedi kural.
1. Başlamadan önce "bitti"yi tanımlayın. Anthropic'in /goal'ı, bir değerlendiricinin açık bir koşulu kontrol edebilmesi için vardır; OpenAI'in kılavuzu her çalıştırmada çıkış koşulları talep eder; Google araştırmayı 60 dakika ile sınırlar. Net bir durma koşulu olmayan bir döngü otomasyon değil, token yakma aboneliğidir. Deterministik olan, hislere galip gelir: testler geçer, sayı eşleşir, kontrol listesi tamamlanır, maksimum N deneme.
2. Doğrulayıcı, ürünün ta kendisidir. Döngünün kalite tavanı, modeli değil, kontrol adımıdır. Anthropic, doğrulamayı beceriler olarak kodlamanızı ve incelemeler için ikinci, yeni bağlamlı bir ajan atamanızı söyler. OpenAI daha da ileri giderek onaylayıcıyı, yapısal olarak yapıcıdan ayrı bir model haline getirdi; bunun gerekçesi olarak yapıcının işi bitirmek istemesi gösterildi. Google, raporları tıklayabileceğiniz alıntılara dayandırır. Ve bu hafta kurala en iyi kanıtını sundu: listedeki en etkileyici açık model, doğru cevaplar üretmede ölçülebilir şekilde iyileşirken, yanlış olduğunu bilmede kötüleşti. Bir sohbette bu bir dipnottur. Doğrulanmamış bir döngüde ise, kendinden emin hatalar için bir fabrikadır. Bir saatinizi bir yere yatıracaksanız, göreviniz için "kontrol edildi"nin ne anlama geldiğine yatırın.
3. Yapıcının, önemli olan hiçbir şeyde kendi kendini notlamasına asla izin vermeyin. Aynı prensibin diğer yüzü, çünkü tüm sektörün öğrenmek için para ödediği ders budur: görevi tamamlayan bir model, her kapıyı bir engel olarak görür. Ayrı bir doğrulayıcı model, ayrı bir incelemeci ajan veya geri döndürülemez adımda bir insan.
4. Bağlamı, kıt bir kaynak olduğu gibi yönetin. Anthropic'in bağlam mühendisliği kılavuzu (en küçük yüksek sinyalli token seti, not dosyaları, özet döndüren alt ajanlar), Meta'nın aktif sıkıştırması, Grok'un sıkıştırma kılavuzu, Kimi'nin dev bağlam karşı argümanı: herkes aynı soruyu yanıtlıyor, uzun bir döngünün nasıl tutarlı kaldığı. Ortak cevap, pencerenin dışında bellek ve talep üzerine getirme, doldurma değil.
5. Döngü türünü yalnızca önceki basamak başarısız olduğunda yükseltin. Anthropic, en basit ilkel yapıyla başlamanızı söyler. OpenAI, çoklu ajana geçmeden önce tek bir ajandan maksimumu almanızı söyler. Google, bir saatlik çalıştırmadan önce bir planı onaylamanızı ister. Bölüm 1'deki merdiven aynı zamanda bir disiplindir: kontrolü, ardından durma koşulunu, ardından tetikleyiciyi, ardından istemi, bu sırayla, her seferinde bir basamak devredin.
6. Döngüyü fiyatlandırın, mesajı değil. Bir döngünün maliyeti, döngü başına maliyet çarpı döngü sayısıdır. Bu nedenle Google araştırmayı görev başına fiyatlandırır (1 ila 7 dolar), Grok token verimliliğiyle öne çıkar, Anthropic az önce Opus 5 ile sınır yakını döngülerin fiyatını yarıya indirdi ve her ciddi yığın kullanım denetleme araçları sunar. Bir çalıştırmanın ne kadara mal olmasına izin verildiğine başlamadan önce karar verin.
7. Geri alınamayacak kapılarda bir insan bulundurun. Paranın çıkması, e-postaların gönderilmesi, verilerin silinmesi, kodun üretime birleştirilmesi. Work mode'un onay kontrol noktaları, işbirlikçi planlama, izin modları, Auto-review'un yükseltmeleri: istisnasız her satıcı, geri döndürülemez adımda bir insan kapısı tuttu. En yetenekli döngülere sahip satıcılar, bu konuda en ısrarcı olanlardır. Bu size bir şey anlatmalı.
Bölüm 4: Kimsenin size söylemediği şeyler
Tanıtım yazıları burada biter. Operasyonel deneyim bitmez.
Döngüler her şeyi, hatalar da dahil, çoğaltır. Bir sohbetteki yanlış bir varsayım, kötü bir cevaptır. Aynı yanlış varsayım bir döngüde, sabaha kadar elli tane tutarlı, kendinden emin, yanlış yapıt anlamına gelir. Bu nedenle doğrulama bir numaralı kuraldır ve bu nedenle denetimsiz döngüler, yazma iznini kazanana kadar salt okunur başlamalıdır.
Fatura sessizce birikir. Her satıcının kılavuzunda bir token yönetimi bölümü olmasının bir nedeni var. Düşünmeye ağırlık veren modeller, tek bir zor adımda çıktı token'larında dolarlar yakabilir; altta yatan şey günde bir kez değişirken saatte bir çalışan bir rutin, hiçbir şey için 24 kat ödeme yapıyordur. Aralığı değişim hızına uydurun, dönüşleri sınırlayın ve sayacı kontrol edin.
Prompt enjeksiyonu bir döngüde daha da kötüleşir. Döngünüz açık web'i, gelen kutularını veya kullanıcı yüklemelerini okuduğu anda, birisinin er ya da geç bu içeriğe talimatlar yerleştireceğini varsayın. Kandırılan bir sohbet asistanı sizi bir kez utandırır; araç erişimi olan kandırılmış bir döngü, siz uyurken tekrar tekrar harekete geçer. OpenAI'in kendi güvenlik belgeleri, sessiz kısmı söyler: hafifletmelere rağmen, ajanlar mükemmel olmayacak ve hala kandırılabilirler. Döngünün tükettiği her şeyi veri olarak ele alın, asla emir olarak değil ve izinlerini gerçekten istediğiniz gibi kapsamlandırın.
Demo-üretim arasındaki fark gerçektir. 48 saatlik otonom çip tasarımı muhteşem bir demodur ve aynı zamanda kontrollü bir demodur. Kendi kendine bildirilen verimlilik katları, özel kıyaslamalar, model kartları olmadan duyurulan satıcı ön izleme parametre sayıları: yararlı sinyaller, ancak hiçbiri döngüyü kendi görevlerinizde kendi doğrulayıcınızla çalıştırmanın yerini tutmaz. Her laboratuvar sessizce aynı fikirdedir, bu nedenle hepsi size değerlendirmeler oluşturmanızı söyler.
Platformlar ayaklarınızın altında değişir. Bu makaleden önceki on iki ayda: OpenAI, bağımsız ajan ürününü durdurdu, Pulse'ı emekli etti ve görsel Agent Builder'ını kapatmayı planladı (30 Kasım 2026); yeni bir Opus, Claude'un plan serisini bir gecede yeniden düzenledi; API'ler döngü dostu tasarımlar etrafında yeniden inşa edildi; ve bir Haziran ihracat kontrolü direktifi, sınır Claude modellerini birçok kullanıcı için kısa süreliğine çevrimdışı bıraktı. Döngülerinizi, mantık (hedef, doğrulayıcı, notlar) satıcının kullanıcı arayüzünde değil, sizin dosyalarınızda yaşayacak ve motor değiştirilebilir kalacak şekilde oluşturun.
Hendek model değildir. Sınır artık haftalık olarak yeniden karılan üç puanın altında bir yayılıma sahip ve açık bir model ona katıldı. Biriken şey sizindir: başarısızlıklarınızdan oluşturulmuş değerlendirme seti, standartlarınızı kodlayan doğrulayıcı, döngülerinizin biriktirdiği notlar. Model değiştirmek bir yapılandırma değişikliğidir. Bir yıllık doğrulama mantığını yeniden oluşturmak öyle değildir.
Hangi döngü yığını sizinki?
Yukarıdakilerin tümü göz önüne alındığında dürüst eşleştirme:
- Bir terminalde yaşıyorsunuz ve maksimum kontrol istiyorsunuz: Claude Code, en zor çalıştırmalar için Fable 5 ve yeni değer varsayılanı olarak Opus 5 ile. En okunabilir ilkeller (/goal, /schedule, dinamik iş akışları) ve en iyi belgelenmiş felsefe.
- Herkesin zaten kullandığı bir ürünün içinde döngüler istiyorsunuz: ChatGPT'nin Work modu artı Zamanlanmış Görevler (izleme görevleri utanç verici derecede az kullanılıyor) veya kod için Auto-review ile Codex.
- Döngünüz "X'i iyice araştır ve bana alıntılı bir rapor ver" ise: Google'ın Deep Research veya Deep Research Max'ini görev başına kiralayın ve bir şey oluşturmayı atlayın.
- Birçok alt ajanı yönetiyor ve maliyetleri izliyorsanız: Motor olarak Muse Spark 1.1 veya Grok 4.5; her ikisi de tam olarak bunun için fiyatlandırılmış ve oluşturulmuştur, sınır üçlüsünün bir kademe altında.
- Cebinizde sıfır kurulumla otomasyonlar istiyorsanız: Zaten kullandığınız sohbet uygulamasının içinde Mira tarzı tüketici ajanları.
- Hacim, gizlilik veya kalıcılık gerekiyorsa: açık dalga. Maliyet için DeepSeek V4 Flash, planlama kalitesi için GLM-5.2, çok modlu için MiniMax M3 ve (27 Temmuz'dan itibaren, ağırlıklar zamanında gönderilirse) gerçekten indirebileceğiniz sınır bandı yeteneği istiyorsanız Kimi K3. Sadece gerçek bir doğrulayıcı getirin; K3'ün kendi sayıları bir tane gerektiğini savunuyor.
Bu hafta ilk döngünüz
Satıcıdan bağımsız, dürüst bir tarif:
- Halihazırda elle tekrarladığınız ve darboğaz olduğunuz bir görev seçin.
- Önce durma koşulunu yazın. "Bitti, X demektir" yazamıyorsanız, görev henüz döngüye hazır değildir.
- Kontrolü yazın. Bir betik, bir test, ikinci bir model için bir değerlendirme çizelgesi. Önemli olan saat budur.
- Her döngüyü izleyerek birkaç kez sıra tabanlı çalıştırın.
- Durma koşulunu devredin (bir dönüş sınırı olan bir hedef döngüsü). Takıldığı veya aştığı yeri izleyin; kriterleri sıkılaştırın.
- Ancak o zaman tetikleyiciyi devredin (zamanlayın), bir bütçe sınırı ve başlangıçta salt okunur izinlerle.
- Başarısız olduğunda -ki başarısız olacaktır- başarısızlığı bir test senaryosuna dönüştürün. Bu, kendini geliştiren kısımdır ve siz ve döngü birliktesinizdir.
Her seferinde bir basamak tırmanın. Bu sistemlerden olağanüstü sonuçlar alan insanlar gizli bir model bulmadılar. Döngüye değer bir görev buldular, "bitti"yi tanımladılar ve güvendikleri bir kontrol inşa ettiler.
Son bir şey
Prompt dönemi herkese daha iyi sorular sormayı öğretti. Döngü dönemi sizden farklı bir şey istiyor: sonuçları, bir makinenin siz başka yerdeyken onları takip edebileceği kadar kesin bir şekilde tanımlayın ve bu takibi dürüst tutan kontrolleri tasarlayın.
Bu gerçek bir beceridir ve prompt yazmak değildir. Yönetime daha yakındır. Bir hedef, bir bitmişlik standardı, doğru araçlar, bir bütçe, güvendiğiniz bir kontrol ve yargı çağrıları için bir yükseltme yolu. Bu makaledeki her laboratuvar, üç trilyon dolarlık bir şirketten iki kişilik bir Telegram girişimine kadar, tam olarak bu beceriyi ödüllendiren bir mekanizma üzerinde birleşiyor.
Yavaş yol hala işe yarıyor, eğer yazmak, beklemek, düzeltmek ve yeniden sormak bu teknolojiyle istediğiniz ilişkiyse. Ancak el krankı artık isteğe bağlı ve laboratuvarlar toplu olarak bunun hangi yöne gittiğine karar verdi. Çalışma birimi döngüdür. Döngüyü tanımlayan kişi sizsiniz.
Bir tane ile başlayın. "Bitti"yi tanımlayın. Güvenin, ancak doğrulayın. Sonra krankı bırakın.
Kaynaklar
Yukarıdakilerin tümü, 25 Temmuz 2026'da sona eren haftada birincil kaynaklara karşı kontrol edildi. Laboratuvara göre gruplandırılmıştır:
Döngü kavramı
- Anthropic, Döngülere başlarken: claude.com/blog/getting-started-with-loops
- OpenAI, Ajan oluşturmaya pratik rehber: openai.com/business/guides-and-resources/a-practical-guide-to-building-ai-agents
- Anthropic, Etkili ajanlar oluşturma: anthropic.com/engineering/building-effective-agents ve Etkili bağlam mühendisliği: anthropic.com/engineering/effective-context-engineering-for-ai-agents
Anthropic
- Claude Fable 5: anthropic.com/claude/fable ve tanıtım yazısı: anthropic.com/news/claude-fable-5-mythos-5
- Claude Opus 5 (24 Temmuz 2026): anthropic.com/news/claude-opus-5
- Rutinler: code.claude.com/docs/en/routines · Dinamik iş akışları: code.claude.com/docs/en/workflows
OpenAI
- GPT-5.6: openai.com/index/gpt-5-6 · Work ve Codex: help.openai.com/en/articles/20001275 · ChatGPT ajanı durduruldu: help.openai.com/en/articles/11752874 · Ajanlar kılavuzu: developers.openai.com/api/docs/guides/agents· Auto-review: alignment.openai.com/auto-review
- Deep Research Max duyurusu: blog.google · Deep Research belgeleri: ai.google.dev/gemini-api/docs/deep-research
Meta
- Muse Spark 1.1 duyurusu: ai.meta.com/blog/introducing-muse-spark-meta-model-api · Kodlama ajanları kılavuzu: dev.meta.ai/docs/guides/coding-agents
xAI
- Grok 4.5: x.ai/news/grok-4-5 · Belgeler: docs.x.ai/developers/grok-4-5
Mira
- Ürün sitesi: mira.tg · Kilometre taşı yazısı: mira.tg/blog/mira-1-million-monthly-users
Açık ağırlık dalgası
- Kimi K3 bağımsız değerlendirmesi ve ağırlık zaman çizelgesi: TechTimes, 24 Temmuz 2026 · tanıtım: VentureBeat, 16 Temmuz 2026
- Qwen3.8-Max ön izlemesi: MarkTechPost, 19 Temmuz 2026
- OpenRouter, Önemli Olan Açık Ağırlık Modelleri, Haziran 2026: openrouter.ai/blog
- Thinking Machines Inkling: TechCrunch, 15 Temmuz 2026
- Bağımsız skorlar: Artificial Analysis Intelligence Index v4.1, 24 Temmuz 2026 itibarıyla raporlanmıştır





