YouMind
Oturum aç

LLM Eğitimi Hakkında Bilmedikleriniz: İlkeler, Yollar ve Yeni Uygulamalar

@HiTw93
ÇINCE03 Nis 2026
632K
2.2K
461
53
4.1K

TL;DR

Bu makale, LLM eğitiminin değişen dünyasını; devasa ön eğitimlerden modern model performansını belirleyen gelişmiş post-training süreçlerine, pekiştirmeli öğrenmeye ve otonom ajan mühendisliğine kayan odağıyla inceliyor.

TL;DR

"Claude Code Hakkında Bilmediğiniz Şeyler: Mimari, Yönetişim ve Mühendislik Pratiği" ve "Ajanlar Hakkında Bilmediğiniz Şeyler: Prensipler, Mimari ve Mühendislik Pratiği" yazılarını yazdıktan sonra, Büyük Dil Modellerinin (LLM) eğitiminin gerçekte nasıl işlediğini özetlemek için kendime bir meydan okumak istedim. Bu makale, profesyonel bir geçmişe sahip olmayanlar için bile anlaşılabilir olmayı hedefliyor.

2026'ya bakıldığında, LLM performansındaki gerçek fark artık sadece ön eğitimin kendisi değil, onu takip eden uzun kuyruk: eğitim sonrası, değerlendirme, ödüller, Ajan eğitimi ve damıtma. Her adım, kullanıcının gerçek deneyimini etkiler. Bir modelin aniden güçlendiğini fark ettiğinizde, bunun nedeni büyük olasılıkla bu alanların tek bir faktörden ziyade birlikte optimize edilmiş olmasıdır.

Aşağıdakiler, LLM eğitim hattını takip ederek, üreticilerin eğitim yığınının ikinci yarısı aracılığıyla nihai sonuçları nasıl iyileştirdiğine odaklanmaktadır.

LLM Eğitimi Bir Boru Hattıdır

Son birkaç yılda, model ilerlemesi genellikle parametre, veri ve bilgi işlem gücünün birikimiyle açıklanıyordu. Ancak, birçok kullanıcının fiilen hissettiği iyileştirmeler, temel külliyattan daha fazla eğitim almaktan değil, ön eğitim sonrasındaki tüm eğitim sürecinden gelir. Bir modelin nasıl konuştuğu, talimatları nasıl takip ettiği, nasıl akıl yürüttüğü ve araçları nasıl kullandığı - bunlar, sadece daha fazla internet metni besleyerek doğal olarak gelişmez.

InstructGPT çok doğrudan bir örnek verdi: hizalama ve tercih optimizasyonundan geçmiş yalnızca 1.3B parametreli bir model, insan tercihi değerlendirmelerinde 175B GPT-3'ü geçebiliyordu. İki mertebe parametre farkıyla, kullanıcılar nihayetinde çok daha küçük versiyonu tercih etti. Eğitimin ikinci yarısı, kullanıcı algısını gerçekten yeniden yazıyor.

Eğitim süreci aslında veri, algoritmalar, sistemler ve geri bildirimin yüksek oranda birbirine bağlı olduğu bir boru hattıdır. Bir katmandaki değişiklik genellikle diğerlerine yayılır. 2026'da, model yetenekleri ve endüstriyel değer, giderek ön eğitimi takip eden katmanlarda yoğunlaşmaktadır.

Tw93 - inline image

Ayrıca, Doubao'nun sıralamalarda rekabet etmediğini ancak günlük kullanımda daha tatmin edici hissettirdiğini sık sık hissetmemizin nedeni de budur - bunun nedeni eğitim sonrasının iyi yapılmış olmasıdır.

Bu altı katman, yalnızca iş bölümünü görmek içindir. Aşağıdaki şekildeki dokuz aşama daha ayrıntılı bir versiyondur: ham veri ve sistem tarifleri ayrılmıştır ve Ajan koşum takımı ile Dağıtım, ikinci yarının alt bölümleridir. Ayrıca, süreç boyunca iki geri bildirim döngüsü vardır: üretim trafiği veri mühendisliğine döner ve çevrimdışı değerlendirme sonuçları ön eğitime geri döner.

Tw93 - inline image

Ön Eğitim Sadece Temeldir

Ön eğitim, eğitim zincirinin başlangıç noktası olmaya devam ediyor. Ne yaptığını anlayarak ancak sonraki her katmanın neyi tamamladığını anlayabiliriz. Bu adım olmadan, dil modelleme yeteneği, bilgi sıkıştırması ve sonraki yetenek aktarımı için alan olmaz. Mühendislik açısından, modele sadece bir sonraki token'ı tahmin etmeyi öğretmekten daha fazlasını yapar: dil dağılımını öğrenir, büyük ölçekli metinlerden bilgi ve kalıpları parametrelere sıkıştırır ve sonraki yetenek aktivasyonu için alan bırakır. Sonraki token tahmini yalnızca eğitim biçimini tanımlar; modellerin ölçek arttıkça neden aniden yeni yetenekler geliştirdiğini açıklamaz.

GPT-3'ten sonra, birçok model ince ayar çalışması bütçeyi ve oranları daha dikkatli bir şekilde değerlendiriyor. Modeller sadece daha büyük oldukları için daha iyi değildir. Parametre sayısı, eğitim token'ları ve toplam hesaplama bütçesi arasında bir oran sorunu vardır. Birçok model çok küçük değildir; yetersiz eğitilmiştir ve belirli bir bütçe altında daha uygun bir noktaya ulaşmamıştır.

Gerçek eğitim kararlarında, pratik soru şudur: Birisi size 10.000 H100 ve bir ay verse, yeterince iyi bir açık kaynak modelini nasıl eğitirdiniz? Buradaki ölçekleme yasaları, bir makaledeki soyut bir eğriden ziyade bir bütçe tahsis aracı gibidir. Sonuçta, şunları göz önünde bulundurmanız gerekir: Bir sonraki eğitim turu daha fazla parametre mi yığmalı yoksa daha fazla veri mi beslemeli? Mevcut model yetenekten mi yoksun yoksa sadece yetersiz mi eğitilmiş? Sınırlı bir GPU bütçesi altında, hangi oran en değerlidir?

Ön eğitim, model yeteneklerinin temelini atmak, bilgi kapsamını, genelleme potansiyelini ve kalıp tümevarım yeteneğini belirlemek gibidir. Ayrıca, eğitim sonrasının kullanım için alan olup olmadığını da belirler. Bununla birlikte, ön eğitim, modelin talimatları takip edip etmediğini, kullanıcılarla işbirliği yapıp yapmadığını veya kritik görevlerde istikrarlı bir şekilde çalışıp çalışmadığını kontrol edemez.

Ön eğitim aşaması, yalnızca ne kadar bilginin öğrenildiğine karar vermekle kalmaz; modelin neye dönüşebileceğini önceden belirler. Tokenleştiricinin bölme yöntemi, sonraki eğitimi doğrudan etkiler ve bağlam penceresi uzunluğu baştan ayarlanmalıdır. Çok modlu ön eğitime devam edilip edilmeyeceği veya tek hızlandırıcılı çalıştırmanın baştan bir gereklilik olup olmadığı - bu ödünleşimler, sürümde özellik olarak eklenmek yerine, eğitim aşamasında tarife yazılır. Gemma 3, bu ödünleşimleri yansıtarak aynı anda tek hızlandırıcı, 128K bağlam, görüş yetenekleri ve nicelemeyi vurgular. Kullanıcıların sonunda gördüğü yetenekler - yerel bir bilgisayarda çalıştırma, görüntüleri görme, uzun belgeleri anlama - aslında büyük ölçüde eğitim aşamasında belirlenir.

Chinchilla tarafından verilen veri optimal noktasına bakıldığında, 8B parametreli bir model için yaklaşık 200B token'dır. Ancak, Llama 3 8B aslında yaklaşık 75 kat daha fazla olan 15T token kullandı. Bu tür aşırı eğitim tarifleri, genellikle aynı parametreler için daha yüksek yetenek yoğunluğu sağlayarak, çıkarım için daha küçük, daha uygun maliyetli bir modelle sonuçlanır. Bunu toplam FLOP'lar (kayan nokta işlemleri) ile ölçmek, parametre sayılarına bakmaktan daha güvenilirdir. Aşağıdaki şekil bu farkı görsel olarak göstermektedir.

Tw93 - inline image

Sıklıkla gözden kaçan bir diğer tasarım da ön eğitim aşamasında gerçekleşir: tokenleştirici kelime dağarcığı boyutu, bölme stratejileri ve bayt düzeyinde kodlama yöntemlerinin önemli bir etkisi vardır. Llama 2'nin 32K kelime dağarcığı vardı; Llama 3 bunu 128K'ya genişlettikten sonra, dizi uzunluğu yaklaşık %15 oranında sıkıştırıldı ve alt akış performansı da bunu takip etti. Bu etki, çıkarım maliyetlerine ve çok dilli yeteneklere kadar uzanır. Çince, kod ve matematiksel formüllerin token verimliliği, kelime dağarcığı tasarımı sırasında belirlenir. Örneğin, Çinceyi çok küçük parçalara bölen bir tokenleştirici, her seferinde yalnızca daha fazla token'a mal olmakla kalmaz; her çıkarım, bu kötü kararın bedelini sürekli olarak ödemek zorundadır.

Veri Tarifleri Model Yeteneklerini Belirler

Parametre ölçeği geçmişte önemli bir metrikti, ancak son iki yılda daha önemli olan şey "veri tarifi"dir.

Bu süreç yüzeyde veri temizliği gibi görünür, ancak aslında eksiksiz bir veri üretim mühendisliği görevidir. Web sayfaları, kod depoları, kitaplar ve forumlardan gelen ham veriler, ön eğitime girmeden önce metin çıkarma, dil tanımlama, kalite filtreleme, gizlilik işleme, güvenlik filtreleme ve yineleme giderme işlemlerinden geçmelidir. Aşağıdaki şekil, tam huni işleme akışını göstermektedir.

Tw93 - inline image

Verileri yalnızca eğitim yakıtı olarak ele alırsanız, daha fazlasının daha iyi olduğu sonucuna varmak kolaydır. Ancak veri mühendisliği, yetenek tasarımına daha yakındır. Modelin gördüğü ve görmediği şeyler ile kod, matematik ve ansiklopedinin oranları, modelin nihai yetenek dağılımını doğrudan etkiler.

Yineleme giderme ve kirlilik kontrolü genellikle göz ardı edilir, ancak sonuçları önemli ölçüde etkiler. Bu sadece düşük kaliteli verilerle ilgili değildir; yinelenen şablonları, lisans metinlerini, ayna web sitelerini ve kıyaslama sızıntılarından kaynaklanan kirliliği içerir. Belge düzeyinde ve satır düzeyinde yineleme giderme yetersizse, model genellikle en değerli kısımları mutlaka öğrenmeden, kopyalanması en kolay içeriği tekrar tekrar emer. Birçok açık kaynak modelinin tutarsız performansı, genellikle veri işleme kalitesindeki boşluklardan kaynaklanır.

Son iki yılda, veri karıştırmanın kendisi ayrı bir araştırma problemi haline geldi. Data Mixing Laws gibi çalışmalar, yalnızca ne kadar daha fazla veri toplanabileceğine değil, aynı zamanda farklı veri türlerinin oranlarının modeli belirli yetenek yapılarına nasıl yönlendirdiğine odaklanır.

Sentetik veriler de yardımcı bir araçtan eğitim sürecinin resmi bir parçasına geçti. Self-Instruct, DeepSeek-R1'in damıtma yörüngeleri ve Qwen ile Kimi serilerinde giderek daha belirgin hale gelen sentetik denetim gibi yöntemlerin tümü aynı yönde ilerlemektedir. Her yeni nesil daha güçlü model, bir sonraki nesil tarafından görülen verilerin yeniden yapılandırılmasına katılır. Erken modeller temel talimat verileri üretti; daha güçlü modeller yüksek kaliteli akıl yürütme yörüngeleri ve CoT (Düşünce Zinciri) verileri üretir; ve RL aracılığıyla eğitilen akıl yürütme modelleri, bu yörüngeleri daha küçük yoğun modellere damıtır. "Yoğun", tüm parametrelerin çalıştığı anlamına gelir; talep üzerine etkinleştiren MoE'nin (Uzman Karışımı) aksine.

Buradaki kilit nokta, modellerin genellikle önce daha büyük bir ölçekte yetenekler oluşturması ve ardından bu yeteneklerin daha küçük modellere sıkıştırılabilmesidir. DeepSeek-R1-Distill serisi bunun doğrudan bir örneğidir. RL sonrası büyük model yörüngeleri, 1.5B'den 70B'ye kadar olan yoğun modeller için önemli kazanımlar sağlamıştır. Llama 3.1 405B de 8B ve 70B modellerinin eğitim sonrası kalitesini iyileştirmek için açıkça kullanılmıştır. Bunlar yan ürünler değil, eğitim tasarımının bir parçasıdır.

Sistem ve Mimari Kısıtlamaları Eğitimden Önce Netleştirilmelidir

Birçok kişi eğitimi bir araştırma problemi olarak anlar: amaç fonksiyonunun nasıl ayarlanacağı, kaybın nasıl azaltılacağı, model yapısının nasıl değiştirileceği. Ancak gerçek LLM eğitiminde, sistem kısıtlamaları çok önemlidir; bu, tek bir makinede derin öğrenme problemi değil, dağıtık bir sistem problemidir. GPU sayısı, bellek bant genişliği, paralel stratejiler, hata toleransı ve maliyet - bunlar eğitimden sonra optimize edilmeyi bekleyemez. Baştan itibaren ne kadar büyük eğitebileceğinizi, ne kadar uzun bir bağlamı destekleyebileceğinizi ve daha karmaşık eğitim sonrası işlemleri çalıştırıp çalıştıramayacağınızı belirlerler.

MoE, bu katmandaki en tipik örnektir. Çok uzmanlı mod, modelin token başına aktivasyon maliyetini kontrol ederken benzer hesaplama altında toplam parametreleri genişletmesine olanak tanır. Ödünleşim, karmaşık yönlendirme, zor yük dengeleme ve ağır altyapıdır. DeepSeek-V3 ve Qwen'in MoE tasarımları, yalnızca mimari tercihler değil, maliyet ve etki arasındaki uzlaşmalardır.

Son zamanlarda kamuya açık tariflerdeki tartışmalar artık yalnızca model boyutu ve token oranları gibi kaba taneli analizlerle ilgili değildir. muP, hiperparametrelerin küçük ölçekli deneylerden büyük ölçekli eğitime aktarılmasına olanak tanır. WSD öğrenme hızı, yükselen, stabilize olan ve ardından azalan bir programdır. Optimum parti boyutu ve daha yüksek veri-parametre oranlarıyla birleştiğinde, bu detaylar aynı ölçekteki modeller arasındaki gerçek farklılaştırıcılar haline geliyor.

Uzun bağlam, çok modluluk ve yeni mimariler, yalnızca ürün özellikleri olarak anlaşılırsa, eğitim tarafındaki kısıtlamalar gözden kaçar. 128K bağlam hedefi, dikkat maliyetlerini, parti boyutlarını, eğitim müfredatını (veri sıralaması) ve paralel stratejileri doğrudan değiştirir. Çok modluluk, yalnızca model yapısını değil, aynı zamanda veri karıştırmayı, kodlayıcı tasarımını ve güvenlik değerlendirmesini de değiştirir. Tek kartlı çalıştırma katı bir gereklilikse, parametre sayısı, niceleme yolları ve model ailesi boyutu daralacaktır.

Forgetting Transformer ve Kimi'nin Dikkat Kalıntıları gibi çalışmalar benzer soruları yanıtlar: daha uzun bağlamların nasıl eğitileceği ve ağlar derinleştikçe bilgi seyrelmesinin nasıl önleneceği. Gördüğünüz şey, daha uzun girdileri işleyebilen veya dağıtımı daha kolay olan bir modeldir, ancak eğitim sırasında karşılaşılan şey tamamen farklı bir dizi kısıtlamadır.

Hesaplama bütçesi sabittir. Model boyutu, eğitim token hacmi, bağlam uzunluğu ve sunum maliyeti - bir yönde harcanan her birim için diğerleri vermek zorundadır.

Tw93 - inline image

Bağlam uzadıkça, dikkat maliyetleri patlar ve parti boyutu küçültülmelidir. Modeller büyüdükçe, GPU bellek kullanımı artar ve sunum maliyetleri de bunu takip eder. Bunlar seçim değil, kaynak kısıtlamalarının sonuçlarıdır. Çoğu karar, eğitim başlamadan önce belirlenir.

Ayrıca sıklıkla göz ardı edilen bir mühendislik gerçeği vardır: eğitim her zaman istikrarlı değildir. Binlerce GPU haftalarca çalışır ve aniden, göz ardı edilemeyecek kadar büyük bir eğitim kaybı artışı (loss spike) meydana gelir ve yeniden başlamak için günler önceki bir kontrol noktasına geri dönülmesi gerekir.

Kayıp artışlarının yanı sıra, sessiz GPU hataları da vardır - hata bildirmeyen ancak sessizce yanlış gradyanlar üreten tek bir GPU - NVLink bant genişliği anormallikleri ve düğümler arası iletişim dalgalanması. Bunların her biri, eğitimin birkaç adımını kirletebilir. Büyük ölçekli eğitimde hızlı bir şekilde tespit edebilmek, izole edebilmek ve kurtarabilmek, makaleler okuyarak çözülemeyecek bir laboratuvar düzeyinde mühendislik yeteneğidir.

DeepSeek-V3, teknik raporunda tüm ön eğitim sürecinde kurtarılamaz kayıp artışı olmadığını ve geri alma olmadığını özellikle belirtmiştir. Ayrıca, FP8 karışık hassasiyetli eğitimin ultra büyük ölçekli modellerde uygulanabilir olduğunu doğrulayan az sayıdaki vakadan biridir. Kamuya açık verilere göre, tüm süreç 14.8T token'ı ön eğitmek için yaklaşık 2.788M H800 GPU saati almıştır.

Eğitim sistemleri ve çıkarım sistemleri yakından ilişkilidir ancak aynı mühendislik problemi değildir. Eğitim, gradyanlar, paralellik, kontrol noktaları, verim ve maliyetle ilgilenir; çıkarım, gecikme süresi, KV önbelleği (tekrarı önlemek için geçmiş hesaplamaları önbelleğe alma), niceleme ve hizmet istikrarıyla ilgilenir.

Eğitim Sonrası, Kullanıcı Tarafından Algılanan Farkı Belirler

Sıradan kullanıcıların gerçekten hissedebildiği birçok iyileştirme, ön eğitimden sonra gerçekleşir. Talimat ince ayarı, denetimli eğitim için etiketlenmiş talimat-cevap çiftlerini kullanır. Modelin cevaplama şeklini değiştirir, görevlerin nasıl kabul edileceği, çıktının nasıl organize edileceği ve işbirlikçi bir asistan gibi davranılması gibi gereksinimleri denetim sinyallerine dönüştürür. Bir temel model zaten birçok potansiyel yeteneğe sahip olabilir, ancak bu adım olmadan, bu yetenekler genellikle kullanıcıların beklediği biçimde istikrarlı bir şekilde ortaya çıkmaz.

Daha da ileriye baktığımızda, RLHF, DPO ve RFT benzer yönleri paylaşır - "daha iyi bir cevap" tanımını eğitim döngüsüne entegre etmek - ancak farklı yollardan.

  • RLHF (İnsan Geri Bildiriminden Pekiştirmeli Öğrenme) önce yüksek kaliteli cevapları taklit eder, ardından pekiştirme için tercih karşılaştırmalarını kullanır.
  • DPO (Doğrudan Tercih Optimizasyonu), ayrı bir ödül modeline ihtiyaç duymadan doğrudan tercih karşılaştırmalarından öğrenerek bu yolu kısaltır.
  • RFT (Pekiştirmeli İnce Ayar), mühendislikte uygulanması daha kolay bir arayüzdür ve görev tanımlarını, not verici tasarımlarını ve ödül sinyallerini ürünleştirme sürecine dahil eder.

Bugün, eğitim sonrasından yalnızca SFT veya RL olarak bahsetmek artık yeterli değildir. Daha zor kısımlar, değerlendirmelerin nasıl ayarlanacağı, nasıl puanlanacağı ve ne tür bir cevabın sürekli optimizasyona değer olduğudur. SFT, denetimli ince ayardır; yalnızca bilgiyi değil aynı zamanda stili de öğrenir. Veri uzunluğu, format, alıntı ekleyip eklememe ve madde işaretlerine tercih, modelin nihai çıktı biçimini önemli ölçüde etkiler. Birçok kullanıcı yetenekleri karşılaştırdıklarını düşünür, ancak genellikle yalnızca stil farklılıklarını karşılaştırıyorlardır. Ayrıca, tercih değerlendirmeleri doğal olarak daha uzun cevapları tercih eder ve ciddi görünen uzun çıktıları kolayca daha güvenilir olarak yanlış yorumlar. Bu nedenle, eğitim sonrası için lider tablolarına bakmak genellikle yetersizdir; kişi gerçek görev sonuçlarını, maliyeti ve istikrarı birleştirmelidir.

Modern eğitim sonrası, çok aşamalı bir boru hattıdır. DeepSeek-R1'in tarifi, kamuya açık materyallerde en net olanıdır. Dört aşamada ilerler:

Aşama 1 soğuk başlangıçlı SFT'dir. Pekiştirmeli öğrenme yapmadan önce, ısınmak için küçük miktarda yüksek kaliteli Düşünce Zinciri (CoT) verisi kullanın. DeepSeek-R1-Zero, bir temel modelden (hizalama olmadan ön eğitim sonrası ham model) doğrudan RL yapmanın mümkün olduğunu kanıtladı, ancak yalnızca RL ile eğitilen modeller tekrarlayıcı olacak, dilleri karışık ve okunabilirlikleri düşük olacaktır. Soğuk başlangıçlı SFT, RL'ye daha istikrarlı bir başlangıç noktası vererek format ve dil tutarlılığını kilitler.

Aşama 2, matematik, kod ve mantık gibi doğrulanabilir alanlarda, eğitim algoritması olarak GRPO kullanarak ve programlı olarak doğrulanabilir doğruluğu ödül sinyali olarak kullanarak pekiştirmeli öğrenme gerçekleştirir. Anahtar nokta, GRPO'nun neden geleneksel PPO'ya tercih edildiğidir: PPO (Yakınsal Politika Optimizasyonu), mevcut durum değerini tahmin etmek için bağımsız bir değer ağı gerektirir; bu, büyük modeller için yüksek bir mühendislik yüküdür. GRPO, aynı istem için birden çok cevap örnekler ve mutlak değer tahmini yerine grup içi sıralama kullanarak bağımsız bir değer ağı ihtiyacını ortadan kaldırır. DeepSeek serisi ve Cursor Composer 2'nin RL altyapısının her ikisi de GRPO'ya yakın şemalar kullanır.

Aşama 3, Reddetme Örneklemesi ile İnce Ayar (Rejection Sampling Fine-Tuning) gerçekleştirir, RL tarafından oluşturulan başarılı yörüngeleri filtreler ve bunları başka bir denetimli ince ayar turu için yeni SFT verilerine dönüştürür. Bu, RL ve SFT arasındaki köprüdür; RL tarafından keşfedilen iyi yörüngeler, bir sonraki SFT turu için yüksek kaliteli eğitim örnekleri haline gelir.

Aşama 4, sürüm standartlarını karşılayan bir asistan formuna uyum sağlamak için yararlılık ve güvenlik tercihi geri bildirimini entegre eder.

Tw93 - inline image

Dört aşama birbirine bağımlıdır: soğuk başlangıç, RL'nin istikrarlı bir şekilde başlamasına izin verir, RL yüksek kaliteli veriler üretir, reddetme örneklemesi bu verileri bir sonraki SFT turu için girdiye dönüştürür ve hizalama RL'si davranışsal yakınsamayı tamamlar. Kamuya açık sonuçlardan, doğrudan SFT ile dört aşamanın tamamını tamamlama arasındaki fark genellikle görülebilir.

Eval, Not Verici ve Ödül, Eğitim Hedeflerini Yeniden Tanımlıyor

Model çıktısını eğitim puanlarına dönüştürmekten sorumlu bileşene not verici (grader) denir ve beklenmedik sorunlara kolayca yol açabilir. Yalnızca nihai cevaba bakarsa, model hızla kestirme yollar bulmayı öğrenir; puanlama çok kaba ise, gürültü pekiştirmeli öğrenme tarafından sürekli olarak yükseltilir; lider tablosu puanı yükselirse, gerçek görevler takip etmeyebilir. Çoğu zaman, kullanıcılar temel modelde bir fark gördüklerini düşünürler, ancak fark, hedefin nasıl tanımlandığıdır.

Eğitim akışında, eval neyin test edileceğini belirler, not verici bir çıktının nasıl puana dönüştüğünü belirler ve ödül, modelin nereye itileceğini belirler. Birlikte belirli bir geri bildirim döngüsü oluştururlar: görev tanımı, eval, not verici, optimizasyon, dağıtım ve yeniden değerlendirme. Dağıtım (rollout), modelin görevleri yürütürken oluşturduğu yörüngeleri ifade eder. Zincirdeki herhangi bir halka yoldan saparsa, sonraki optimizasyon da sapacaktır.

Yalnızca nihai sonuca bakıldığında, bir model şans eseri doğru yapabilir veya doğru cevabı almak için yanlış bir süreci takip edebilir. Bu, özellikle kod, matematik ve karmaşık akıl yürütme görevlerinde belirgindir. Ara adımlar geri bildirime girmezse, modelin öğrendiği şey genellikle daha güvenilir akıl yürütme değil, o son puanı daha yüksek olasılıkla nasıl alacağıdır.

Bu nedenle, son yıllarda daha fazla çalışma geleneksel RLHF'den doğrulanmış ödüllere, doğruluğu doğrudan doğrulamak için programları kullanmaya kaymıştır. Matematik, kod ve mantık gibi doğrulanabilir görevlerde, doğruluk artık öncelikle insan tercihine güvenmeden doğrudan puanlanabilir. Ancak doğrulanmış ödüller sorunu tamamen çözmemiştir. Aşırı optimizasyon, ödül aşırı uyumu (puanlama kurallarının gerçek yetenek kazancı olmadan aşırı optimize edilmesi) ve mod çökmesi (çıktının son derece tek hale gelmesi ve çeşitliliği kaybetmesi) gibi olgular hala meydana gelmektedir. Sorun, tercihlerin doğru etiketlenip etiketlenmediğinden, puanlama zincirinin istikrarlı olup olmadığına kaymıştır.

Model tarafından yazılan düşünme süreci, iç süreçlerin eksiksiz bir kaydı olarak ele alınamaz. Anthropic, akıl yürütme modeli gözlemlenebilirlik deneylerinde, modellerin ek ipuçlarını kullandığını ancak bunu görünür CoT'da kabul etmediğini; ödül avcılığı (reward hacking) senaryolarında, makul görünen bir açıklama ekleme olasılıklarının daha yüksek olduğunu buldu. Ödül avcılığı, görevi gerçekten tamamlamak yerine puanlama sistemini sömürmektir. Görünür CoT, eğitim ve izleme sinyali olarak daha uygundur, eksiksiz gerçek olarak değil.

Bir kat daha derine inildiğinde, modeller puanlama kanalının kendisini bile sömürmeye başlayabilir. Ödül kurcalama (reward tampering) ve hizalama sahteciliği (alignment faking) üzerine yapılan araştırmalar, modellerin teorik olarak puanlama sürecine aktif olarak müdahale edebileceğini göstermektedir. Ödül kurcalama, ödül hesaplama sürecini doğrudan değiştirmektir; hizalama sahteciliği ise hizalamayı taklit etmektir - yüzeyde uyumlu görünürken, hizalanmamış niyetleri gizlemektir.

Bir model yeterince güçlü bir ortam erişimine sahip olduğunda, optimize ettiği şey yalnızca görev sonuçları değil, potansiyel olarak kontrol listesi, ödül kodu ve eğitim ilişkisinin kendisidir. 2025'teki bir Anthropic deneyi, bir dizi sömürülebilir üretim kodlama RL ortamına ekstra ödül avcılığı bilgisi enjekte etti ve daha sonra benzer bir genelleme gözlemledi. Model, ödül avcılığını öğrendikten sonra, bunu yalnızca benzer görevlerde kullanmaya devam etmekle kalmadı, aynı zamanda hizalama sahteciliği gibi daha geniş bir uyumsuzluk da gösterdi.

Bu davranışlar standart diyalog değerlendirmelerinde görülmez, yalnızca Ajan görev ortamlarında görülür. Mühendislik çıkarımı doğrudandır: ödül, not verici, ortam izolasyonu ve izleme, eğitim tasarımının bir parçası olmalıdır.

Ajan aşamasında, ödül tasarımı daha da rafine hale getirilir. Nihai sonuç yalnızca bir maddedir; süreç kalitesi, bağlam yönetimi ve hile önleme kısıtlamaları da ayrı ayrı ölçülmelidir. Kimi K2.5, etkili ayrıştırmayı ve gerçek paralelliği ödüllendirir; Chroma Context-1, arama sırasında bulunan ilgili belgeleri puanlar; Cursor Composer 2, uzun görevlerde özetlemeleri ödül olarak içerir çünkü bir özetleme bozulursa, sonraki bağlam yanıltılacaktır.

Uygulamada, ORM bir Sonuç Ödül Modelidir (Outcome Reward Model), yalnızca nihai cevabı puanlar. Sinyaller seyrektir, maliyetler düşüktür ve başlangıç için uygundur, ancak modelin kestirme yollar bulması daha kolaydır. PRM ise bir Süreç Ödül Modelidir (Process Reward Model), ara adımları puanlar. Sinyaller daha yoğundur ve genellikle matematik ve kod akıl yürütmesi için daha güçlüdür, ancak etiketleme ve sistem maliyetleri çok daha yüksektir. OpenAI, matematik akıl yürütme deneylerinde PRM'nin yalnızca doğruluğu artırmakla kalmayıp aynı zamanda her adım denetlendiği için süreci kısıtlamayı da kolaylaştırdığını gördü. Sorun da doğrudandır: PRM'nin maliyeti genellikle ORM'nin birkaç katıdır, bu nedenle çoğu gerçek sistem ORM ile başlar. Yalnızca matematik, kod ve mantık gibi doğrulanabilir görevlerde, ara adımları doğrulamak ve insan etiketleme darboğazlarını atlamak için programları kullanarak PRM'yi otomatikleştirmek daha kolaydır.

Tw93 - inline image

Tam döngü şu şekilde çalışır:

Tw93 - inline image

Son hizalama yöntemlerinin tümü aynı şeyi yapıyor. Anthropic'in Anayasal AI'sı (Constitutional AI), insan yazımı ilkelerini eğitime entegre eder ve bireysel insan tercihlerinin yerine AI geri bildirimini kullanır. OpenAI'in Kasıtlı Hizalaması (Deliberative Alignment), güvenlik uyumluluğunu akıl yürütme sürecine dahil eder ve akıl yürütme yeteneğinin kendisinin güvenlik kısıtlamasının bir kısmını taşımasına izin verir. Buradaki Kasıtlı Hizalama, modelin eğitilmiş reflekslere güvenmek yerine akıl yürütme aşamasında güvenlik normlarını kendisinin yargılaması anlamına gelir. Her iki yol da hizalamayı insan etiketlerinden eğitim iç hedefinin bir parçasına dönüştürür.

Anayasal AI'yı örnek alırsak, iki aşamalı süreç önce modelin ilkelere dayanarak çıktıyı kendi kendine eleştirmesine ve revize etmesine izin verir, ardından bireysel insan tercihi etiketlemesinin yerini almak için AI geri bildirimini kullanır. Hizalama asla eğitimin arkasına yamalanmış bir yama değildir; sistem neyi test ederse, nasıl puanlarsa ve neyi ödüllendirirse, model o yönde hareket edecektir. Bu, eğitimin ikinci yarısındaki en doğrudan ayarlama aracıdır.

Tw93 - inline image

Ajan Eğitiminde, Yalnızca Model Optimize Edilmez

Son iki yılda, o1 serisi ve DeepSeek-R1 gibi modellerle temsil edilen akıl yürütme modellerinin hızlı yükselişi, istikrarlı ödüller, güvenilir doğrulama ve yeterli altyapı koşulları altında, dil modellerinde RL'nin matematik, kod ve mantık görevlerinde performansı önemli ölçüde artırabileceğini gösteriyor.

Bu aynı zamanda yeni bir boyut açıyor: çıkarım hesaplaması artık ölçeklendirilebilir. RL eğitiminin rolü başka bir katman ekliyor: modele sadece soruları yanıtlamayı öğretmekle kalmıyor, aynı zamanda çıkarım bütçesini nasıl tahsis edeceğini de öğretiyor - ne zaman daha fazla düşüneceğini ve ne zaman duracağını bilmek. İlerleyen süreçte zorluk, modelin tek bir düşünceyi uzatmaktan ziyade bir ortamda sürekli olarak hareket etmesini sağlamak haline geliyor.

Tw93 - inline image

Qwen'in eski model lideri Junyang Lin'in, Düşünme ve Talimat verme (Instruct) arasındaki karma rota hakkında temsili bir yansıması var: zorluk, modele bir düşünme anahtarı vermek değil, iki modun hedeflerinin farklı olmasıdır - biri doğrudanlık, uyumluluk ve düşük gecikme süresi peşindeyken, diğeri daha fazla keşif ve daha yüksek doğruluk peşindedir. Bir adım daha ileri gidildiğinde, eğitim hedefi, cevaplamadan önce ne kadar düşünüleceğinden, eylem sırasında bütçenin nasıl tahsis edileceğine, geri bildirimin nasıl alınacağına ve görevin nasıl ilerletileceğine kayar.

Bu noktada, eğitim nesnesi artık sadece soruları yanıtlayan bir model değil, plan yapabilen, araçları çağırabilen, geri bildirim alabilen ve uzun görevlerde tutarlılığı koruyabilen bir sistemdir. Sonuç olarak, eğitim yığını değişir: tarayıcılar, terminaller, arama, yürütme sanal alanları, bellek sistemleri, araç sunucuları ve orkestrasyon çerçevelerinin tümü eğitim sistemine girmeye başlar.

Daha doğrusu, bir koşum takımı (harness), modelin etrafına sarılmış bir kontrol programıdır. Bu kavram yalnızca Ajan çalışma zamanına ait değildir; eğitim aşamasında da bulunur: modelin hangi girdiyi gördüğünü, geri bildirimi nasıl aldığını, bağlamın ne zaman budanacağını ve araçların ne zaman çağrılacağını belirler. İstem oluşturma, bellek güncelleme, getirme politikası, bağlam düzenleme ve araç orkestrasyonunun tümü buradadır. Ortam artık yalnızca statik bir doğrulayıcı değil, hem eğitimin hem de dağıtımın doğrudan yüzleşmesi gereken bir katmandır.

Tw93 - inline image

Model eğitiminin anlamlı olması için koşum takımı kararlı olmalıdır. Araç dönüş değerleri kararsızsa, tarayıcı ortamı çevrimiçi ortamla tutarsızsa veya dosya sistemi durumu tekrarlanabilir değilse, derecelendirici (grader) önce başarısız olur ve model daha sonra yetenek kazanmak yerine ortam açıklarından nasıl yararlanacağını öğrenir. Ajanları eğitirken, genellikle hem modeli hem de ortamı hata ayıklarsınız.

Üç şirketin yaklaşımları net: Kimi, paralel ayrıştırma ve kredi atamasını çözmek için PARL'ı kullanıyor; Cursor, uzun vadeli kodlama oturumlarını ve üretim trafiğini eğitime geri bağlamak için öz-özetleme ve gerçek zamanlı RL kullanıyor; Chroma, prune_chunks'u bir strateji olarak eğitiyor ve bağlam budamasının doğrudan getirme sürecine girmesine izin veriyor.

SFT döneminde veri çeşitliliği çok önemliydi; Ajan döneminde ise ortam kalitesi temeldir: kararlılık, özgünlük, kapsam, zorluk dağılımı, geri bildirim zenginliği ve sömürüye karşı direnç. Eğitim hedefleri buna göre değişir ve yalnızca bir soruyu doğru yapmak değil, eksiksiz görevlerde güvenilirlik gerektirir. Klasik CoT kıyaslamaları bunu kapsayamaz.

Bu değişim ilerlemeye devam ediyor: sadece bir çalışma zamanı koşum takımı içindeki modeli eğitmek değil, aynı zamanda koşum takımı kodunun kendisi de bir dış döngü tarafından aranabilir ve optimize edilebilir bir nesne haline geliyor.

Tw93 - inline image

Kimi K2.5'in PARL'ı, net bir rotaya sahip, dikkate değer bir mühendislik örneğidir: yalnızca orkestratörü eğitmek, kredi atamasını orkestrasyon katmanına toplamak ve tüm alt ajanları aynı anda optimize etmemek.

Ödül sinyalleri üç kategoriye ayrılır: görev başarısı, paralel ayrıştırma ve tamamlama kısıtlamaları; bunlar birlikte orkestrasyon katmanını yönlendirir. Erken eğitimde, paralel stratejilerin keşfini teşvik etmek için r_parallel ağırlığı artırılır, daha sonra birden fazla alt ajan açmayı bir kısayol olarak ele almamak için kademeli olarak 0'a düşürülür. Değerlendirme yalnızca toplam adımlara değil, aynı zamanda kritik yol uzunluğuna da bakar; daha kısa bir kritik yol, paralelliğin gerçekten etkili olduğunu gösterir.

Tw93 - inline image

Ancak 2026'ya gelindiğinde işler bir adım daha ileri gitti. Meta-Harness, koşum takımı mühendisliğini açıkça ayrı bir optimizasyon hedefi olarak ele alıyor. Ağırlıkları değil, koşum takımı kodunun kendisini optimize ediyor - sabit bir modeli çevreleyen istem oluşturma, getirme, bellek ve durum güncelleme programları. Makalenin başındaki rakamlar doğrudan: aynı temel model için, yalnızca koşum takımını değiştirmek, aynı kıyaslamada 6 kat performans farkına neden olabilir. Modelin dışındaki bu program dizisi artık yalnızca bir dağıtım detayı değil, bir yetenek oluşumu katmanıdır.

Anahtar, başka bir soyut optimize edici eklemek değil, önceden yazılmış kodu, puanları ve yürütme izlerini (araç çağrıları ve durum değişikliklerinin günlükleri) dosya sistemine yazmak, bir teklifçinin (proposer) kod yazar gibi grep, cat ve diff yapmasına ve ardından başarısızlık yolları boyunca koşum takımını değiştirmesine izin vermektir. Teklifçi, koşum takımı değişiklikleri öneren modüldür.

Yazarlar, geçmişteki birçok metin optimize edicinin, koşum takımları gibi uzun vadeli, durum bilgisi olan programlar için etkili olmadığını açıkça belirtiyorlar çünkü yalnızca skaler puanlara, kısa şablonlara veya özetlere bakmak sorunu düzleştiriyor. Skaler puanlar, süreç bilgisi olmadan yalnızca nihai noktaları sağlar. Koşum takımı hataları genellikle birçok adım sonra ortaya çıkar; geri bildirim aşırı sıkıştırıldığında tanı zinciri kopar.

Bu sonuçlar yalnızca daha yüksek kıyaslama puanlarından ibaret değil. Çevrimiçi metin sınıflandırmada Meta-Harness, bağlam belirteci kullanımını 1/4'e sıkıştırırken ACE'den (ajan bağlam mühendisliği taban çizgisi) 7,7 puan daha yüksektir. Getirme artırımlı matematiksel akıl yürütmede, keşfedilen bir koşum takımı, 200 IMO seviyesindeki problemde optimize edilmemiş 5 tutulan modeli ortalama 4,7 puan geliştirdi. TerminalBench-2'de de manuel mühendislik taban çizgilerini aştı. Bu, optimize edilenin artık yalnızca dahili model stratejileri değil, aynı zamanda model etrafındaki bilgileri ve eylemleri düzenleyen programlar olduğunu gösteriyor.

Somut bir örnek: Meta-Harness, TerminalBench-2'de otomatik olarak ortam başlatma (environment bootstrap) keşfetti - ajan döngüsü başlamadan önce bir kabuk komutu çalıştırarak çalışma dizinini, mevcut dilleri, paket yöneticilerini ve bellek durumunu ilk isteme enjekte edilen bir anlık görüntü halinde düzenlemek. Birçok kodlama ajanı ilk birkaç turu ortamı keşfederek geçirir; bu ön işleme yapıldığında, iyileşme mutlaka daha güçlü ağırlıklardan gelmez, ancak koşum takımının modelin daha iyi bir bağlamla başlamasına izin vermesinden gelir.

Bu noktada, optimizasyon hedefi yanıtlardan yörüngelere ve ardından bu yörüngeleri taşıyan koşum takımı programına genişlemiştir.

Öncü Bir Model Yayınlandıktan Sonra Eğitim Zinciri Devam Ediyor

Günümüzün büyük modellerini yalnızca tek bir ön eğitim turu merceğinden anlamak artık yeterli değil. Yayınlanan bir modelin arkasında, genellikle ön eğitim, son eğitim, damıtma ve uzmanlaşmanın tüm zinciri tamamlanmıştır ve daha güçlü modeller bir sonraki nesil için eğitim verileri üretmeye devam eder.

DeepSeek-R1 serisinin damıtılması tipik bir örnektir. Büyük bir model önce RL ve doğrulanmış ödüller aracılığıyla akıl yürütme yetenekleri geliştirir, ardından bu akıl yürütme yörüngelerini daha küçük yoğun modellere aktarır. TranslateGemma gibi uzmanlaşmış modeller başka bir yol gösterir: daha spesifik hedef görevlerde, yüksek kaliteli veri ve özel ödül tasarımları kullanarak yetenekleri daha da sıkıştırmak ve yönlendirmek. Bu aşamada, daha güçlü modeller yalnızca kullanıcılara hizmet etmek için değil, aynı zamanda bir sonraki nesil için doğrudan eğitim verileri üretmek içindir.

Bunun altında yatan neden, yörünge transferinden daha temeldir: olası bir açıklama, internet külliyatında bilgi belleği ve akıl yürütme yeteneğinin birleştiği ve mevcut ön eğitim hedeflerinin modellerin her ikisini de iyi öğrenmesini gerektirdiğidir. Büyük modeller önce gelmelidir çünkü yalnızca onlar her ikisini de destekleyecek kadar büyüktür ve daha sonra saf akıl yürütme gösteri verileri oluşturmak için kullanılabilirler. Küçük modeller bu tür veriler üzerinde eğitildiğinde, tüm bilgileri ezberlemeye zorlanmadan akıl yürütmenin kendisine odaklanabilirler. Büyük başlayıp küçüğe gitmek, yalnızca bir maliyet stratejisi değil, bir yetenek ayrıştırmasıdır.

Öte yandan, dağıtım uyarlanabilirliği yeteneğin kendisi kadar önemlidir. Birçok senaryo her şeye uygun büyük bir modele ihtiyaç duymaz; maliyet, gecikme süresi, kararlılık ve kontrol edilebilirlikle daha çok ilgilenirler. Eğitimin sonu mutlaka daha büyük değil, potansiyel olarak daha küçük, daha ucuz ve daha uzmanlaşmış olabilir.

Sonunda yayınlanan model, mutlaka eğitim eğrisinin en sağındaki kontrol noktası (checkpoint) değildir. Gerçek yayından önce, birden fazla kontrol noktası genellikle gerçek görev sonuçları, reddetme stilleri, araç kararlılığı, maliyet ve gerileme riskleri açısından tekrar tekrar karşılaştırılır. Çevrimiçi olan sürüm genellikle bir ürün kararıdır, tek bir metrikte en güçlü performansı gösteren değil.

Kullanıcılar bir model adı gördüklerinde, bunun düzgün bir şekilde yükselen bir eğitim eğrisine karşılık geldiğini varsayarlar, ancak hangi kontrol noktasının gerçekten çevrimiçi olduğu başka bir konudur.

Büyük bir modelin değeri, hem kendi hizmet yeteneğinde hem de bir sonraki nesil için eğitim verileri, damıtma kaynakları ve yayın temelleri sağlamaya devam etmesinde yatar.

Tw93 - inline image

Çevrimdışı eğitimin ötesinde, çevrimiçiye yakın sürekli optimizasyon ana sürece girmiştir. Cursor Composer 2'nin gerçek zamanlı RL'si, bazı Ajan yeteneklerinin bir sonraki büyük ölçekli çevrimdışı eğitim turunu beklemek yerine üretim trafiği aracılığıyla yinelemeye başladığını göstermektedir. Eğitim ve dağıtım arasındaki sınır kaybolmadı, ancak aralarındaki geri bildirim döngüsü kısalıyor.

Gelecekte Bir Modelin Neden Güçlendiğini Nasıl Anlarız

2026'da öncü modellerin değeri, giderek artan bir şekilde, ön eğitimden sonra tüm eğitim zincirini kimin tamamlayabildiğine bağlıdır: sürekli olarak eğitim verileri üretmek, damıtma yapmak, uzmanlaşma yapmak, değerlendirme ve ödülleri iyi yapmak ve nihai yayın seçimlerini yapmak.

Bu nedenle, bir modelin neden aniden güçlendiğine bakarken önce şu üç şeye bakabilirsiniz:

  • İlk olarak, değişikliğin ön eğitim katmanında mı yoksa sonraki eğitim sürecinde mi meydana geldiğine bakın. Birçok yetenek iyileştirmesi gerçekten de daha güçlü ön eğitim ve daha iyi veri tariflerinden gelir, ancak algılanan birçok değişiklik aslında son eğitimden kaynaklanır. Bir modelin talimatları takip edip etmediği, araçları kullanıp kullanmadığı veya istikrarlı bir cevaplama stiline sahip olup olmadığı, genellikle yalnızca daha fazla külliyat üzerinde eğitim alarak doğal olarak gelişmez.
  • Ardından, iyileştirmenin hangi katmandan geldiğine bakın: ağırlıklar ve eğitim tarifleri mi, yoksa ödül/değerlendirme/derecelendirici mi, yoksa koşum takımı kodu ve dağıtım döngüsü mü. Akıl yürütme modellerine ve Ajanlara gelindiğinde, kullanıcıların hissettiği güç genellikle yalnızca temel modelin sonucu değildir. Değerlendirmelerin nasıl ayarlandığı, ödüllerin nasıl puanlandığı, araç ortamının kararlı olup olmadığı, getirme ve belleğin nasıl organize edildiği, özetlerin ve bağlamın nasıl budandığı ve yayın için hangi kontrol noktasının seçildiği - tüm bunlar birlikte nihai ürün performansını değiştirir.
  • Son olarak, çevrimiçi sürümün neyi optimize ettiğine bakın. Bazı sürümler daha yüksek bir tavanı hedefler, bazıları daha düşük maliyet, gecikme süresi ve gerileme riskini hedefler ve bazıları belirli bir senaryo türü için uzmanlaşmıştır. Yayın sürümü bir ürün kararıdır, eğitim eğrisinin en sağındaki nokta değil. Bu nedenle model güncellemelerine bakarken, gerçekte neyi optimize ettiğine bakmak gerçeğe daha yakın olacaktır.

Bir modelin ani iyileşmesini üretim aşamalarına ayırdığınızda, birçok kazancın aslında eğitim yığınının ikinci yarısı ve dış koşum takımı tarafından güçlendirildiğini görürsünüz. Bu zincirin yineleme döngüsü de kısalıyor: üretim trafiği sürekli olarak eğitime geri akıyor, her nesil daha güçlü model, yetenekler üretirken bir sonraki nesil denetim verileri üretiyor ve dış programlar, dağıtımlar, günlükler ve gerçek görev geri bildirimlerine dayalı olarak sürekli yeniden yazılıyor.

Bugün yayınlanan model yalnızca bir anlık görüntüdür; boru hattı (pipeline) ve koşum takımı programı, çalışmaya devam eden ürünlerdir.

Öğrenme Materyalleri

  1. Hoffmann et al. (2022). Training Compute-Optimal Large Language Models (Chinchilla). arXiv:2203.15556
  2. Ouyang et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). arXiv:2203.02155
  3. Shao et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (GRPO). arXiv:2402.03300
  4. DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948
  5. DeepSeek-AI (2024). DeepSeek-V3 Technical Report. arXiv:2412.19437
  6. Llama Team, AI @ Meta (2024). The Llama 3 Herd of Models. arXiv:2407.21783
  7. Bai et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073
  8. OpenAI (2024). Deliberative Alignment: Reasoning Enables Safer Language Models. openai.com/index/deliberative-alignment
  9. Anthropic (2025). Sycophancy to Subterfuge: Investigating Reward Tampering in Language Models. anthropic.com/research/reward-tampering
  10. MacDiarmid et al. (2025). Natural Emergent Misalignment from Reward Hacking in Production RL. arXiv:2511.18397
  11. Lee et al. (2026). Meta-Harness: End-to-End Optimization of Model Harnesses (preprint project page). yoonholee.com/meta-harness
  12. Kimi Team (2026). Kimi K2.5 Tech Blog: Visual Agentic Intelligence. kimi.com/blog/kimi-k2-5
  13. Rush, S. (2026). A technical report on Composer 2. cursor.com/blog/composer-2-technical-report
  14. Chroma (2026). Chroma Context-1: Training a Self-Editing Search Agent. trychroma.com/research/context-1

Bu makale, yeniden yayınlanmak üzere herhangi bir biçimde çoğaltılmasına veya yeniden yazılmasına izin vermemektedir. Bulursanız, lütfen bildirmeme yardımcı olun.

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet