Uçtan uca M&A incelemesi için eğitim sonrası RLM ajanları

@nikogrupen
İNGILIZCE08 Eyl 2026
193K
218
21
11
335

TL;DR

Harvey araştırmacıları, eğitim sonrası özyinelemeli dil modeli ajanlarının M&A incelemesi için 80 milyon token'ı nasıl işleyebildiğini ve doğruluğu %29'dan %63'e çıkardığını ortaya koyuyor.

Makale bağlantısı: https://www.harvey.ai/blog/post-training-rlm-agents-for-m-and-a-diligence

Yakın tarihli Harvey Tenet araştırma önizlememizde, karmaşık, uçtan uca hukuki görevleri çözmek için model-donanım (model-harness) ortak optimizasyonunun önemini vurgulamış ve tek bir görevin 80M token'a kadar belge bağlamını taramayı gerektirdiği Birleşme ve Satın Alma (M&A) Durum Tespiti (Diligence) konusundaki ilk sonuçları paylaşmıştık. Bugün, devam eden deneylerimizden elde ettiğimiz güncellenmiş sonuçları paylaşıyoruz.

Baseten ile birlikte, M&A Durum Tespiti için yinelemeli bir dil modeli (RLM) donanımı oluşturduk. RLM formülasyonumuzda, eksiksiz bir veri odası (dataroom) bir Python REPL ortamına yüklenir ve bir kök ajan (root agent), sınırlı inceleme ve analizi, kendi bağlam pencereleri içinde çalışan alt ajanlara (sub-agents) devreder. LAB Diligence görevlerinde, bu donanım, değerlendirdiğimiz yedi modelde ortalama olarak rubrik kriter geçme oranını 39,1 yüzde puanı artırmaktadır.

RLM donanımı içinde eğitim sonrası (post-training) yapmanın, kalite-verimlilik ödünleşimlerinde gezinmek için daha fazla performans kazancı ve seçenek sağladığını görüyoruz. Bir Qwen3.5-122B-A10B orkestratörünü pekiştirmeli öğrenme (reinforcement learning) yoluyla eğitim sonrasından geçirdik ve eğitim sonrasının, 50 adet ayrılmış (held-out) LAB Diligence veri odasında rubrik kriter geçme oranını %29,9'dan %63,0'a çıkardığını bulduk.

Niko - inline image

Şekil 1: Standart araç döngüsü donanımındaki temel modeller, kendi donanımlarındaki kodlama ajanları ve RLM donanımımızdaki modeller için LAB Diligence'deki ortalama kriter geçme oranı. Yıldız işaretleri, SFT öncesi ve sonrası eşleştirilmiş GLM-5.2 sonuçlarını, ayrı bir 20 odalı ayrılmış küme üzerinde değerlendirilmiş olarak işaretler. Diğer tüm sonuçlar 50 odalı ayrılmış kümeyi kullanır.

Bu sonuçlar, göreve özgü bir donanım içinde eğitim sonrası yapmanın, M&A Durum Tespiti gibi belge yoğun hukuki işler için pratik bir yol olduğunu ve RLM donanımı içinde RL'yi ölçeklendirmenin gelecekteki çalışmalar için umut verici bir yön olduğunu göstermektedir. Bu nedenle, devam eden bir ölçek büyütme çalışmasında kök model olarak büyük bir sınır açık ağırlık modeli olan GLM-5.3'ü de eğitiyoruz.

Bu yazının geri kalanında, değerlendirdiğimiz LAB Diligence ortamlarını, metodolojimizi ve eğitim sonrası deneylerimizi daha ayrıntılı olarak açıklıyoruz.

M&A Durum Tespiti için Ortamlar

Geçtiğimiz günlerde, M&A Durum Tespiti için sentetik ortamlar içeren LAB Diligence'i, LAB'in bir uzantısı olarak tanıttık. LAB Diligence'deki tek bir veri odası, kategoriye göre düzinelerce klasör halinde düzenlenmiş 5.000'e kadar belge ve toplam 80M token'a kadar bağlam içerir.

Niko - inline image

Şekil 2: Örnek bir LAB Diligence veri odası. Aravon Bridge Bank, 14 kategoride 82 klasörde 2.270 belge içerir, toplamda 31M token. Ajanın bu görev için hazırladığı durum tespiti raporu (diligence memo), 571 rubrik kriterine göre derecelendirilir.

Bu veri odasında çalışan ajana, bulgularını belge alıntılarıyla, ilgili yerlerde niceliksel maruziyetle ve işlem için önerilen sonraki adımlarla birlikte eksiksiz bir durum tespiti raporu üretme görevi verilir. Bir LLM yargıcı (judge), durum tespiti raporunu, yüzlerce geçer/kalır kriterinden oluşan uzman bir rubriğe göre puanlar. Aravon Bridge Bank örneğinde toplam 571 rubrik kriteri bulunmaktadır.

Niko - inline image

Şekil 3: LAB Diligence'deki Aravon Bridge Bank görevi için rubrik örnekleri, her türden birer birebir kriter ile birlikte.

Durum tespiti için gereken kanıtlar veri odasına dağılmıştır. Bazı bulgular birden fazla belgenin birleştirilmesini gerektirirken, diğerleri destekleyici kanıtların eksik olup olmadığının kontrol edilmesini gerektirir. Temel çalıştırmalarımızda (baseline runs), ajanlar seçici olarak arama yapıp okumuş ve veri odasının büyük bir kısmını incelemeden bırakmıştır. Bu görevler, incelemeyi birçok sınırlı bağlama dağıtabilen ve bulguları bir araya getirebilen bir donanım gerektirir.

M&A Durum Tespiti için Bir RLM Donanımı

Bir temel çizgi oluşturmak için, Legal Agent Bench'teki standart araç döngüsü donanımıyla başladık. Bu donanımda, temel modeller, 50 ayrılmış veri odası genelinde ortalama olarak rubrik kriterlerinin %23,3'ünü geçmekte ve hiçbir model herhangi bir veri odasındaki tüm kriterleri geçememektedir.

Niko - inline image

Şekil 4: 50 ayrılmış durum tespiti veri odasında standart araç döngüsü donanımındaki ortalama kriter geçme oranı.

Bu sonuçlar, görev ile donanım arasında bir uyumsuzluk olduğunu göstermektedir. Bir LAB Diligence veri odası, tek bir model bağlamına sığmayacak kadar büyüktür, ancak ilk incelemenin büyük bir kısmı kategoriye göre bölünebilir. Kök ajan daha sonra raporu oluşturmak için bulguları kategoriler arasında birleştirebilir. Hukuk firmalarındaki anlaşma ekipleri, durum tespiti çalışmalarını benzer bir şekilde böler.

Niko - inline image

Şekil 5: Derinlik-1'deki RLM donanımı. Veri odası, sorgulanabilir değişkenler olarak bir Python REPL ortamına yüklenir. Kök ajan, kod üzerinde çalışır ve sınırlı okuma görevlerini, bulgularını REPL değişkenleri olarak döndüren alt ajanlara devreder. Kök ajanın yazdırdığı çıktı yalnızca kendi bağlam penceresine girer, bu nedenle kök ajan hiçbir zaman tüm veri odasını elinde tutmaz.

Bu bizi, M&A Durum Tespiti için bir donanım olarak RLM'leri keşfetmeye yöneltti. Bir RLM donanımında, bir kök ajana, veri odasının sorgulanabilir değişkenler olarak yüklendiği bir Python REPL verilir; bu, ajanın külliyatı programlı bir şekilde aramasını sağlar. Kök ajan, incelemeyi planlar ve kapsamını belirler ve alt görevleri alt ajanlara dağıtır. Her bir alt ajan, külliyatın sınırlı bir dilimini ve kök ajandan gelen talimatları alır, kendi bağlam penceresi içinde çalışır ve bulgularını REPL değişkenleri olarak döndürür. Aksi belirtilmedikçe aşağıdaki deneyler tek bir alt ajan katmanı kullanır ve pratikte kök ajan birçok çağrıyı paralel olarak dağıtır.

Niko - inline image

Şekil 6: 50 odalı ayrılmış küme üzerinde, standart araç döngüsü donanımında ve RLM donanımının kökü olarak (derinlik-1, Qwen3.6-35B-A3B alt ajanları) yedi model için ortalama kriter geçme oranı.

Yedi model genelinde, RLM donanımı ortalama geçme oranını %23,3'ten %62,4'e yükselterek 39,1 yüzde puanlık bir kazanç sağlamıştır. Ayrıca, web araçları devre dışı bırakılmış iki genel amaçlı kodlama ajanını, Claude Code (Opus-5 ile) ve Codex'i (GPT-5.6 Sol ile) araç döngüsü donanımıyla aynı minimal talimatı kullanarak çalıştırdık. Claude Code kriterlerin %24,6'sını, Codex ise %12,0'ını geçerek, aynı modellerin araç döngüsü donanımındaki performanslarının sırasıyla 17,9 ve 4,6 puan altında kalmıştır. İzlemelerde (traces), her iki ajan da erken okumayı bırakmış ve daha kısa raporlar yazmıştır ve hiçbiri bu yeteneğe sahip olmasına rağmen alt ajanlar oluşturmamıştır.

Kapsam ve Maliyet

RLM donanımı, ajan bağlamı haline gelen faydalı içerik miktarını önemli ölçüde artırmaktadır. Kapsamı, donanımdaki herhangi bir modele (kök veya alt ajan) ulaşan veri odası içeriğinin payını ölçen sondalar (probes) ile tahmin ediyoruz. Standart araç döngüsü donanımında, hiçbir çalıştırma veri odasının %1'inden fazlasını okumaz ve çoğu %0,1 ile %0,5 arasında okur. RLM donanımında, neredeyse her çalıştırma veri odasının %10'undan fazlasını okur ve çoğu tamamına yakınını okur. Bu aralıkta, daha yüksek kapsam, daha yüksek rubrik kriter geçme oranları ile ilişkilidir.

Niko - inline image

Şekil 7: LAB Diligence'den 50 ayrılmış veri odası üzerinde, her bir donanımdaki yedi model için, çalıştırma başına bir nokta olacak şekilde, rubrik kriter geçme oranı ve sonda tabanlı kapsam. Kapsam logaritmik ölçektedir.

RLM donanımına geçmek, Şekil 8'de gösterildiği gibi, yedi temel modelden altısı için veri odası başına üretim maliyetini artırmaktadır. Claude Opus 5 bir istisnadır. Araç döngüsü donanımında, kendi başına okuyarak veri odası başına ~$18 harcarken; bir RLM kökü olarak ~$7 harcamakta ve 35 puan daha yüksek puan almaktadır.

Niko - inline image

Şekil 8: Her bir donanımdaki yedi model için, 50 ayrılmış veri odası üzerinde ortalaması alınmış, veri odası başına ortalama kriter geçme oranı ve üretim maliyeti. Noktalı çizgiler aynı modeli donanımlar arasında birbirine bağlar. Maliyetler, liste fiyatları üzerinden önbellek farkında (cache-aware) tahminlerdir, logaritmik ölçek.

İş Bölümü

Performansın ne kadarının kök ajana karşı alt ajanlara bağlı olduğunu incelemek için, dört kök modeli üç Qwen alt ajan modeliyle 30 ayrılmış veri odası üzerinde eşleştirdik (bkz. Şekil 9). Test edilen konfigürasyonlar genelinde, kökü değiştirmenin daha büyük bir etkisi oldu. Alt ajan modelini sabit tutup kök modeli değiştirirken, en yüksek ve en düşük puan alan kökler arasındaki fark ortalama olarak yaklaşık 38 yüzde puanıydı. Kökü sabit tutup alt ajanları değiştirirken, alt ajan modelleri arasındaki karşılık gelen fark ortalama olarak yaklaşık 8 puandı (Şekil 9b).

Niko - inline image

Şekil 9: RLM donanımında iş bölümü, 30 ayrılmış veri odası üzerinde dört kök model ve üç alt ajan modeli üzerinden toplanmıştır. (a) Kökün girdi ve çıktı token payı, alt ajan seçenekleri üzerinden ortalaması alınmıştır. (b) En yüksek ve en düşük puan alan kökler arasındaki fark, alt ajan seçenekleri üzerinden ortalaması alınmış ve kökler üzerinden ortalaması alınmış alt ajanlar arasındaki karşılık gelen fark.

Bu fark dikkate değerdir çünkü RLM donanımında, kökün ajanın toplam token kullanımının bir azınlığını oluşturduğunu gözlemliyoruz. Örneğin, Opus 5 orkestrasyonu ile kök, girdi tokenlarının %3,8'ini ve çıktı tokenlarının %1,1'ini oluşturmaktadır (bkz. Şekil 9a). Metnin çoğunu alt ajanlar işlerken, kök incelemenin nasıl bölüneceğine ve bulguların nasıl bir araya getirileceğine karar verir.

Niko - inline image

Şekil 10: 30 ayrılmış veri odası üzerinde, üç alt ajan modeliyle eşleştirilmiş dört kök model için ortalama kriter geçme oranı.

Bu sonuçlar, koordinasyonu iyileştirmenin bu kurulumda önemli bir fırsat olduğunu göstermektedir, bu nedenle ilk eğitim sonrası deneylerimizi kök üzerine odakladık.

RLM Donanımında Eğitim Sonrası

Yukarıdaki sonuçlar, eğitim sonrası için bir hedef olarak kök ajana işaret etmektedir. Bu bölümde, RLM donanımı içinde açık ağırlıklı kök modelleri eğitim sonrasından geçirmenin sonuçlarını rapor ediyoruz.

Kendi Kendine Damıtma SFT'si (Self-Distillation SFT)

İlk olarak, bir GLM-5.2 kökünü reddetme örneklemesi (rejection-sampling) kendi kendine damıtma SFT'si kullanarak eğitim sonrasından geçirdik. Bu deney, başka bir yerde rapor edilen 50 odalı değerlendirmelerden farklı, ayrı bir 20 odalı ayrılmış değerlendirme seti kullanmaktadır. Bu ayrılmış küme üzerindeki eşleştirilmiş temel model puanı, daha büyük ayrılmış küme üzerinde Şekil 6'da rapor edilen %65,4'lük GLM-5.2 sonucunun altında, %46,1'dir.

Temel GLM-5.2, kutu dışında (out of the box) yüksek puan alan bir politikayı istikrarlı bir şekilde yürütemez – temel modelin kök ajan olarak hareket ederken erken pes ettiği, yetersiz yetki devrettiği veya alt ajan çıktılarını güçlü bir teslimata dönüştüremediği sık performans çöküşleri vardır. Güçlü bir politika zaten modelin dağılımı içinde olmasına rağmen daha sağlam hale getirilmesi gerektiğinden, GLM-5.2'nin dağılımını istenen moda (mode) keskinleştirmek için reddetme örneklemesi kendi kendine damıtma kullanıyoruz. Yüksek veri odası kapsamına sahip başarılı GLM-5.2 çalıştırmalarını seçtik ve kökü bu yörüngeler (trajectories) üzerinde ince ayar yaptık.

Niko - inline image

Şekil 11: GLM-5.2'nin RLM kökü olarak reddetme örneklemesi kendi kendine damıtma SFT'si öncesi ve sonrası, ayrı bir 20 odalı ayrılmış küme üzerinde değerlendirilmiştir. Bunlar, Şekil 6'da kullanılan 50 odalı değerlendirme değil, SFT deneyi içindeki eşleştirilmiş sonuçlardır.

Bu 20 veri odalı ayrılmış küme üzerinde, SFT eğitimi almış kök, temel modelin %46,1'ine karşılık %60,1 puan almıştır (bkz. Şekil 11). Eğitim sonrası ajanın izlemelerinin bir incelemesi, eğitimin kök ajanın veri odasını kapsamlı bir şekilde incelemesine ve alt ajan bulgularının daha büyük bir yüzdesini nihai rapora taşımasına yardımcı olduğunu göstermektedir.

Tablo 1, eğitim sonrası gözlemlediğimiz diğer davranış değişikliklerini özetlemektedir. En dikkat çekici olarak, alt ajan çağrı hacmi ile veri odası boyutu arasındaki korelasyon 0,17'den 0,84'e yükselerek, eğitilmiş kök ajanın yetki devrini veri odasının boyutuna göre ölçeklendirdiğini göstermektedir. Eğitilmiş kök ayrıca, RL çalıştırmalarımızda bulduğumuza benzer şekilde, alt ajanlar hala okurken raporu yazmaya başlamayı öğrenir.

Niko - inline image

Tablo 1: GLM-5.2 kökünün SFT öncesi ve sonrası davranışı, ayrı 20 odalı ayrılmış küme üzerinde ortalaması alınmıştır. Kapsam bir yüzdedir; son satır bir korelasyon katsayısıdır.

Kapsamlı yetki devri gibi güçlü bir kök durum tespiti ajanını oluşturan davranışlar, ayrıcalıklı bilgi veya etiketlenmiş hukuki bilgi olmaksızın, nispeten az sayıda politika içi (on-policy) izlemeden öğrenilebilir. Burada, kendi kendine damıtma etkilidir çünkü iyi davranış zaten modelin dağılımında mevcuttur ve eğitim onu stabilize eder.

Bu deney bizi, modeli mevcut dağılımının ötesine itmek ve görevin ödülü aracılığıyla doğrudan yeni davranış ortaya çıkarmak için RL tabanlı eğitim sonrasını keşfetmeye motive etti.

Pekiştirmeli Öğrenme (Reinforcement Learning)

Pekiştirmeli öğrenme için, ilk RL deney döngüsünü yönetilebilir tutmak amacıyla daha küçük bir kök model olan Qwen3.5-122B-A10B ile başladık.

RLM kökünü GRPO ile eğittik, ödül olarak yargılanan rubrik kriter geçme oranını kullandık ve alt ajan modellerini sabit tuttuk (alt ajanların her biri Qwen3.6-35B-A3B modeliydi). 40 eğitim adımı boyunca, ortalama dağıtım (rollout) geçme oranının yaklaşık %23'ten yaklaşık %56'ya yükseldiğini bulduk. 50 odalı ayrılmış küme üzerinde, son kontrol noktası (checkpoint), temel modelin %29,9'una karşılık %63,0 puan almıştır.

Niko - inline image

Şekil 12: Sabit Qwen3.6-35B-A3B alt ajanları ile Qwen3.5-122B-A10B kökü üzerinde pekiştirmeli öğrenme. (a) 40 eğitim adımının her birinde ortalama dağıtım kriter geçme oranı. (b) 50 odalı ayrılmış küme üzerinde temel model ve son kontrol noktası.

RL'den sonra, kapsam açık bir ödül terimi olmamasına rağmen, ortalama veri odası kapsamı %62'den %96'ya yükselmiştir. Temel çalıştırmalar, tam kapsam aralığına yayılmıştır ve sıfıra yakın puan alan %20'nin altında bir küme vardır. RL eğitimi almış her çalıştırma, veri odasının %60'ından fazlasını okur ve çoğu tamamını okur.

Niko - inline image

Şekil 13: 50 odalı ayrılmış küme üzerinde, RL öncesi ve sonrası Qwen3.5-122B-A10B kökü için, çalıştırma başına bir nokta olacak şekilde, kriter geçme oranı ve sonda tabanlı kapsam.

Eğitim sonrası kök, veri odası başına %64 daha fazla alt ajan çağrısı yapmaktadır. RL ayrıca yetki devri hacmini SFT'den daha fazla değiştirmiştir, %64'e karşı %29.

Niko - inline image

Tablo 2: Qwen3.5-122B-A10B kökünün RL öncesi ve sonrası davranışı, 50 odalı ayrılmış küme üzerinde ortalaması alınmıştır.

Eğitim sonrasından önce, Qwen kök ajanı durum tespiti raporunu tek seferde ve ancak tüm alt ajanlar döndükten sonra yazmaya çalışıyordu. RL eğitimi sonrası sırasında, daha verimli bir yaklaşım öğrenir, raporu aşamalı olarak yazar ve bölüm yazmayı alt ajan çalışmalarının gözden geçirilmesiyle iç içe geçirir.

GLM-5.3 ile RL'yi Ölçeklendirme

RL tarifimizi ölçekte test etmek için, şimdi GLM-5.3'ü aynı GRPO tarzı konfigürasyonla RLM kökü olarak eğitiyoruz: ödül olarak yargılanan kriter geçme oranı, sabit tutulan Qwen3.6-35B-A3B alt ajanları, kök üzerinde LoRA, grup boyutu 8 ve parti boyutu 24. GLM-5.3 dağıtımları, Qwen kökünün başladığı noktanın oldukça üzerinde başlar, bu nedenle daha az iyileştirme payı vardır. 0'dan 20'ye kadar olan adımlarda (Şekil 14), gösterilen ilk ve son sekiz adımın ortalaması alındığında, ortalama dağıtım geçme oranı yaklaşık %51'den yaklaşık %59'a yükselir ve bu parti boyutunda beklenen adımdan adıma gürültü mevcuttur.

Niko - inline image

Şekil 14: Sabit Qwen3.6-35B-A3B alt ajanları ile devam eden GLM-5.3 RL çalıştırması için erken eğitim ilerlemesi. Ortalama dağıtım kriter geçme oranı, 20 eğitim adımı boyunca gösterilmiştir. Gri, adım başına ham değerleri gösterir; siyah, üstel hareketli ortalamayı gösterir. Bu şekil, ayrılmış performansı değil, eğitim puanlarını rapor etmektedir.

Sırada Ne Var

RLM donanımı, test ettiğimiz modeller genelinde performansı artırmakta ve RL, bu donanım içindeki Qwen kökü için daha fazla kazanç sağlamaktadır. Bu puanlar ile üzerinde çalıştığımız neredeyse mükemmel geçme oranları arasında hala önemli bir boşluk bulunmaktadır.

Yukarıda detaylandırılan eğitim deneyleri ilk keşiflerdir. Ölçeklendirilmiş GLM-5.3 eğitim çalıştırmasını tamamlamanın yanı sıra, SFT ve RL kombinasyonlarını ve eğitilmiş alt ajanları da keşfedeceğiz. RLM donanımı, kökün orkestrasyonunu alt ajanların okumasından ayırır, böylece her biri kendi başına veya birlikte eğitilebilir; buna alt ajanların sırayla yetki devretmek üzere eğitildiği kurulumlar da dahildir.

Son olarak, buradaki temel bulgu, yani model-donanım ortak optimizasyonunun uzun ufuklu ortamlarda ajan performansını anlamlı bir şekilde iyileştirebileceği, yalnızca durum tespitine özgü değildir. Aynı donanım yapısını ve eğitim yaklaşımını diğer uzun bağlamlı hukuki işlere uyarlamanın yollarını araştırıyoruz.

Ek

RLM Özyineleme Derinliği

Başka bir yetki devri katmanı eklemenin performansı iyileştirip iyileştirmediğini de test ettik. Derinlik-1'de, alt ajanlar, kendi araçları veya yetki devirleri olmaksızın, düz LLM tamamlamaları döndürür. Derinlik-2'de, alt ajanlar bir Python REPL alır ve daha fazla yetki devredebilir. Her deney içinde, kök ve her bir alt ajan için aynı modeli kullandık.

Hem GLM-5.2'yi hem de Qwen3.5-122B-A10B'yi değerlendirdik. Birçok GLM-5.2 derinlik-2 çalıştırması zaman sınırı içinde tamamlanamadı, bu nedenle aşağıda Qwen sonuçlarını rapor ediyoruz. 14 veri odası genelinde, derinlik-2 dört tanede puanları iyileştirirken on tanede düşürmüş ve ortalama kriter geçme oranını 19 yüzde puanı azaltmıştır (Şekil A2). On gerilemenin dördünde, derinlik-2 ajanı veri odası içeriğini okumuş ancak hiçbir zaman bir rapor üretmemiştir.

Niko - inline image

Şekil A1: 14 veri odası için derinlik-1 ve derinlik-2'de oda başına kriter geçme oranı. Modeli sabit tuttuk ve düz tamamlama alt ajanlarını, bir REPL kullanabilen ve yetki devredebilen alt ajanlarla karşılaştırdık. On gerilemenin dördünde, derinlik-2 çalıştırması veri odasını okur ancak raporu asla yazmaz.

Bu sonuçlar, ilk eğitim sonrası deneyler için derinlik-1 kullanımımızı motive etmiştir. Ajanları özellikle daha derin yetki devri için eğitmenin ek katmanları faydalı kılıp kılamayacağı açık bir soru olmaya devam etmektedir.

RL Altyapısı

RL, özellikle bu kadar uzun bölüm (episode) uzunluklarıyla, bir eğitim sinyali problemi olduğu kadar bir altyapı problemidir. Bu görev için, tek bölümlü dağıtımların tamamlanması duvar saati (wall-clock) olarak bir saat veya daha fazla sürebilir. Eğitim duvar saati süresini optimize etmek için, asenkron politika dışı (off-policy) çıkarım, sürekli çıkarım gruplaması (continuous inference batching), aşırı örnekleme (oversampling) ve uçuş sırasında ağırlık güncellemeleri (in-flight weight updates) gibi yöntemler uyguladık. Politika dışılığın (off-policyness) etkisini kontrol etmek için seçici token maskeleme (selective token masking) ve asenkron ile ilgili sınırlamalar uygulandı. RLM donanımında duvar saati süresinin çoğu alt ajanların tamamlanmasını beklemekle geçtiğinden, küçük ve hızlı alt ajanlar kullanabilme yeteneği RL eğitim sürecini büyük ölçüde hızlandırmaya yardımcı olmuştur.

Adım duvar saati süresini aşağıda çiziyoruz. Bu süreye, ajan daha kapsamlı hale geldikçe ve daha büyük alt ajan dalgaları gönderdikçe RL süresince artan dağıtım süresi hakimdir.

Niko - inline image

Şekil A2: 40 adımlı çalıştırma için RL eğitim adımı başına duvar saati dakikası, 5 adımlı hareketli ortalama ile. Adım 2–10 ortalama 48 dakika ve adım 31–40 ortalama 74 dakikadır; artış, eğitilmiş modelin dağıtım başına daha fazla alt ajan göndermesinden kaynaklanmaktadır.

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet