एंड-टू-एंड M&A ड्यू डिलिजेंस के लिए पोस्ट-ट्रेनिंग RLM एजेंट्स

@nikogrupen
अंग्रेज़ी08 सित॰ 2026
193K
218
21
11
335

TL;DR

Harvey के शोधकर्ताओं ने खुलासा किया है कि कैसे पोस्ट-ट्रेनिंग रिकर्सिव लैंग्वेज मॉडल एजेंट्स M&A ड्यू डिलिजेंस के लिए 80M टोकन को प्रोसेस कर सकते हैं, जिससे सटीकता 29% से बढ़कर 63% हो गई है।

लेख का लिंक: https://www.harvey.ai/blog/post-training-rlm-agents-for-m-and-a-diligence

Harvey Tenet के लिए अपने हालिया शोध पूर्वावलोकन में, हमने जटिल, एंड-टू-एंड कानूनी कार्यों को हल करने के लिए मॉडल-हार्नेस सह-अनुकूलन के महत्व पर प्रकाश डाला था, और M&A ड्यू डिलिजेंस पर प्रारंभिक परिणाम प्रस्तुत किए थे, जहां एक एकल कार्य के लिए 80M टोकन तक के दस्तावेज़ संदर्भ को पार करना आवश्यक होता है। आज, हम अपने निरंतर प्रयोगों से अद्यतन परिणाम साझा कर रहे हैं।

Baseten के साथ मिलकर, हमने M&A ड्यू डिलिजेंस के लिए एक रिकर्सिव लैंग्वेज मॉडल (RLM) हार्नेस बनाया। हमारे RLM फॉर्मूलेशन में, एक संपूर्ण डेटारूम को Python REPL में लोड किया जाता है और एक रूट एजेंट सीमित समीक्षा और विश्लेषण को उप-एजेंटों को सौंपता है जो अपने स्वयं के संदर्भ विंडो में काम करते हैं। LAB ड्यू डिलिजेंस कार्यों पर, यह हार्नेस उन सात मॉडलों में रूब्रिक मानदंड पास दर में औसतन 39.1 प्रतिशत अंकों का सुधार करता है जिनका हमने मूल्यांकन किया।

हम पाते हैं कि RLM हार्नेस के भीतर पोस्ट-ट्रेनिंग से आगे के प्रदर्शन लाभ और गुणवत्ता-दक्षता व्यापार-बंद को नेविगेट करने के विकल्प मिलते हैं। हमने सुदृढीकरण सीखने के माध्यम से एक Qwen3.5-122B-A10B ऑर्केस्ट्रेटर को पोस्ट-ट्रेन किया और पाया कि पोस्ट-ट्रेनिंग ने 50 होल्ड-आउट LAB ड्यू डिलिजेंस डेटारूम पर रूब्रिक मानदंड पास दर को 29.9% से बढ़ाकर 63.0% कर दिया।

Niko - inline image

चित्र 1: मानक टूल-लूप हार्नेस में बेस मॉडल, अपने स्वयं के हार्नेस में कोडिंग एजेंट, और हमारे RLM हार्नेस में मॉडल के लिए LAB ड्यू डिलिजेंस पर औसत मानदंड पास दर। तारांकन चिह्न SFT से पहले और बाद में मिलान किए गए GLM-5.2 परिणामों को चिह्नित करते हैं, जिनका मूल्यांकन एक अलग 20-कक्ष होल्ड-आउट सेट पर किया गया है। अन्य सभी परिणाम 50-कक्ष होल्ड-आउट सेट का उपयोग करते हैं।

ये परिणाम बताते हैं कि कार्य-विशिष्ट हार्नेस के भीतर पोस्ट-ट्रेनिंग M&A ड्यू डिलिजेंस जैसे दस्तावेज़-गहन कानूनी कार्य के लिए एक व्यावहारिक मार्ग है, और RLM हार्नेस के भीतर RL को स्केल करना भविष्य के काम के लिए एक आशाजनक दिशा है। इस कारण से, हम एक चल रहे स्केल-अप रन में रूट मॉडल के रूप में GLM-5.3, एक बड़ा फ्रंटियर ओपन वेट मॉडल भी प्रशिक्षित कर रहे हैं।

इस पोस्ट के शेष भाग में, हम उन LAB ड्यू डिलिजेंस वातावरणों का वर्णन करते हैं जिनका हमने मूल्यांकन किया, हमारी पद्धति, और अधिक विस्तार से पोस्ट-ट्रेनिंग प्रयोगों का वर्णन करते हैं।

M&A ड्यू डिलिजेंस के लिए वातावरण

हमने हाल ही में LAB ड्यू डिलिजेंस पेश किया, जो LAB का एक विस्तार है जिसमें M&A ड्यू डिलिजेंस के लिए सिंथेटिक वातावरण शामिल हैं। LAB ड्यू डिलिजेंस में एक एकल डेटा रूम में श्रेणी के अनुसार दर्जनों फ़ोल्डरों में व्यवस्थित 5,000 दस्तावेज़ तक और 80M टोकन तक का कुल संदर्भ होता है।

Niko - inline image

चित्र 2: एक उदाहरण LAB ड्यू डिलिजेंस डेटारूम। Aravon Bridge Bank में 14 श्रेणियों में 82 फ़ोल्डरों में 2,270 दस्तावेज़ हैं, कुल 31M टोकन। इस कार्य के लिए एजेंट के ड्यू डिलिजेंस मेमो का मूल्यांकन 571 रूब्रिक मानदंडों के विरुद्ध किया जाता है।

इस डेटारूम के भीतर काम करते हुए, एजेंट को एक पूर्ण ड्यू डिलिजेंस मेमो तैयार करने का कार्य सौंपा जाता है, जिसमें दस्तावेज़ उद्धरणों के साथ उसके निष्कर्ष, जहाँ प्रासंगिक हो वहाँ मात्रात्मक जोखिम, और लेन-देन के लिए अनुशंसित अगले कदम शामिल हों। एक LLM जज सैकड़ों पास या फेल मानदंडों वाले एक विशेषज्ञ रूब्रिक के विरुद्ध ड्यू डिलिजेंस मेमो को स्कोर करता है। Aravon Bridge Bank उदाहरण में कुल 571 रूब्रिक मानदंड हैं।

Niko - inline image

चित्र 3: LAB ड्यू डिलिजेंस में Aravon Bridge Bank कार्य के लिए रूब्रिक उदाहरण, प्रत्येक प्रकार के एक शाब्दिक मानदंड के साथ।

ड्यू डिलिजेंस के लिए आवश्यक साक्ष्य डेटारूम में फैले हुए हैं। कुछ निष्कर्षों के लिए कई दस्तावेज़ों को संयोजित करने की आवश्यकता होती है, जबकि अन्य के लिए यह जाँचने की आवश्यकता होती है कि सहायक साक्ष्य गायब है या नहीं। हमारे बेसलाइन रन में, एजेंटों ने चुनिंदा रूप से खोज और पढ़ाई की, जिससे डेटारूम का अधिकांश भाग अजांचा रह गया। ये कार्य एक ऐसे हार्नेस की मांग करते हैं जो समीक्षा को कई सीमित संदर्भों में वितरित कर सके और निष्कर्षों को एक साथ ला सके।

M&A ड्यू डिलिजेंस के लिए एक RLM हार्नेस

बेसलाइन स्थापित करने के लिए, हमने Legal Agent Bench से मानक टूल-लूप हार्नेस से शुरुआत की। इस हार्नेस में, बेस मॉडल 50 होल्ड-आउट डेटारूम में औसतन 23.3% रूब्रिक मानदंड पास करते हैं, और कोई भी मॉडल किसी भी डेटारूम पर हर मानदंड को पास नहीं करता है।

Niko - inline image

चित्र 4: 50 होल्ड-आउट ड्यू डिलिजेंस डेटारूम पर मानक टूल-लूप हार्नेस में औसत मानदंड पास दर।

ये परिणाम कार्य और हार्नेस के बीच एक बेमेल का सुझाव देते हैं। एक LAB ड्यू डिलिजेंस डेटारूम एक एकल मॉडल संदर्भ में फिट होने के लिए बहुत बड़ा है, लेकिन प्रारंभिक समीक्षा का अधिकांश भाग श्रेणी के अनुसार विभाजित किया जा सकता है। इसके बाद रूट श्रेणियों में निष्कर्षों को मिलाकर मेमो तैयार कर सकता है। कानूनी फर्मों के भीतर डील टीमें ड्यू डिलिजेंस कार्य को समान तरीके से विभाजित करती हैं।

Niko - inline image

चित्र 5: डेप्थ-1 पर RLM हार्नेस। डेटारूम को क्वेरी करने योग्य चर के रूप में Python REPL में लोड किया जाता है। रूट एजेंट कोड में उस पर काम करता है और सीमित पढ़ने के कार्यों को उप-एजेंटों को सौंपता है, जो अपने निष्कर्षों को REPL चर के रूप में लौटाते हैं। केवल वह आउटपुट जो रूट एजेंट प्रिंट करता है, उसके संदर्भ विंडो में प्रवेश करता है, इसलिए रूट कभी भी पूर्ण डेटारूम को धारण नहीं करता है।

इसने हमें M&A ड्यू डिलिजेंस के लिए एक हार्नेस के रूप में RLM का पता लगाने के लिए प्रेरित किया। एक RLM हार्नेस में, एक रूट एजेंट को एक Python REPL दिया जाता है जिसमें डेटारूम क्वेरी करने योग्य चर के रूप में लोड होता है, जो इसे प्रोग्रामेटिक रूप से कॉर्पस खोजने देता है। रूट एजेंट समीक्षा की योजना बनाता है और उसका दायरा तय करता है और उप-कार्यों को उप-एजेंटों को भेजता है। प्रत्येक उप-एजेंट कॉर्पस का एक सीमित टुकड़ा और रूट एजेंट से निर्देश प्राप्त करता है, अपनी स्वयं की संदर्भ विंडो के भीतर काम करता है, और अपने निष्कर्षों को REPL चर के रूप में लौटाता है। नीचे दिए गए प्रयोग जब तक अन्यथा उल्लेख न किया गया हो, उप-एजेंटों की एक एकल परत का उपयोग करते हैं, और व्यवहार में रूट समानांतर में कई कॉल भेजता है।

Niko - inline image

चित्र 6: 50-कक्ष होल्ड-आउट सेट पर, मानक टूल-लूप हार्नेस में और RLM हार्नेस (डेप्थ-1, Qwen3.6-35B-A3B उप-एजेंट) के रूट के रूप में सात मॉडलों के लिए औसत मानदंड पास दर।

सात मॉडलों में, RLM हार्नेस औसत पास दर को 23.3% से बढ़ाकर 62.4% कर देता है, जो 39.1 प्रतिशत अंकों का लाभ है। हमने वेब टूल बंद करके दो सामान्य-उद्देश्यीय कोडिंग एजेंट भी चलाए, Claude Code Opus-5 के साथ और Codex GPT-5.6 Sol के साथ, टूल-लूप हार्नेस के समान न्यूनतम निर्देश का उपयोग करते हुए। Claude Code 24.6% मानदंड पास करता है और Codex 12.0%, जो टूल-लूप हार्नेस में समान मॉडलों से क्रमशः 17.9 और 4.6 अंक कम है। ट्रेस में, दोनों एजेंट जल्दी पढ़ना बंद कर देते हैं और छोटे मेमो लिखते हैं, और क्षमता होने के बावजूद कोई भी उप-एजेंट नहीं बनाता है।

कवरेज और लागत

RLM हार्नेस उपयोगी सामग्री की मात्रा में काफी वृद्धि करता है जो एजेंट संदर्भ बन जाती है। हम प्रोब के साथ कवरेज का अनुमान लगाते हैं जो हार्नेस में किसी भी मॉडल, रूट या उप-एजेंट तक पहुंचने वाली डेटारूम सामग्री के हिस्से को मापते हैं। मानक टूल-लूप हार्नेस में, कोई भी रन डेटारूम के 1% से अधिक नहीं पढ़ता है, और अधिकांश 0.1% और 0.5% के बीच पढ़ते हैं। RLM हार्नेस में, लगभग हर रन डेटारूम का 10% से अधिक पढ़ता है और अधिकांश इसके लगभग सभी को पढ़ते हैं। इस सीमा में उच्च कवरेज उच्च रूब्रिक मानदंड पास दरों से जुड़ा है।

Niko - inline image

चित्र 7: प्रति रन एक बिंदु, LAB ड्यू डिलिजेंस के 50 होल्ड-आउट डेटा रूम पर प्रत्येक हार्नेस में सात मॉडलों के लिए प्रोब-आधारित कवरेज बनाम रूब्रिक मानदंड पास दर। कवरेज एक लॉग स्केल पर है।

RLM हार्नेस में जाने से सात बेसलाइन मॉडलों में से छह के लिए प्रति डेटारूम जनरेशन लागत बढ़ जाती है, जैसा कि चित्र 8 में दिखाया गया है। Claude Opus 5 अपवाद है। टूल-लूप हार्नेस में यह अपने आप पढ़ने में प्रति डेटा रूम ~$18 खर्च करता है; RLM रूट के रूप में यह ~$7 खर्च करता है और 35 अंक अधिक स्कोर करता है।

Niko - inline image

चित्र 8: 50 होल्ड-आउट डेटा रूम पर औसत, प्रत्येक हार्नेस में सात मॉडलों के लिए प्रति डेटा रूम जनरेशन लागत बनाम औसत मानदंड पास दर। बिंदीदार रेखाएं हार्नेस में एक ही मॉडल को जोड़ती हैं। लागत सूची मूल्यों पर कैश-अवेयर अनुमान हैं, लॉग स्केल।

श्रम का विभाजन

यह जांचने के लिए कि प्रदर्शन रूट एजेंट बनाम उप-एजेंटों पर कितना निर्भर करता है, हमने 30 होल्ड-आउट डेटा रूम पर चार रूट मॉडलों को तीन Qwen उप-एजेंट मॉडलों के साथ जोड़ा (चित्र 9 देखें)। परीक्षण किए गए कॉन्फ़िगरेशन में, रूट को बदलने का अधिक प्रभाव पड़ा। उप-एजेंट मॉडल को स्थिर रखते हुए रूट मॉडल को बदलने पर, उच्चतम और निम्नतम स्कोरिंग रूट के बीच का अंतर औसतन लगभग 38 प्रतिशत अंक था। रूट को स्थिर रखते हुए उप-एजेंटों को बदलने पर, उप-एजेंट मॉडल के बीच संबंधित अंतर औसतन लगभग 8 अंक था (चित्र 9b)।

Niko - inline image

चित्र 9: RLM हार्नेस में श्रम का विभाजन, 30 होल्ड-आउट डेटारूम पर चार रूट मॉडलों और तीन उप-एजेंट मॉडलों पर एकत्रित। (a) उप-एजेंट विकल्पों पर औसत, इनपुट और आउटपुट टोकन का रूट हिस्सा। (b) उप-एजेंट विकल्पों पर औसत, उच्चतम और निम्नतम स्कोरिंग रूट के बीच का अंतर, और रूट पर औसत, उप-एजेंटों के बीच संबंधित अंतर।

यह अंतर उल्लेखनीय है क्योंकि, RLM हार्नेस में, हम देखते हैं कि रूट एजेंट के कुल टोकन उपयोग का एक अल्पसंख्यक हिस्सा है। उदाहरण के लिए, Opus 5 के ऑर्केस्ट्रेट करने पर, रूट इनपुट टोकन का 3.8% और आउटपुट टोकन का 1.1% हिस्सा होता है (चित्र 9a देखें)। उप-एजेंट अधिकांश टेक्स्ट को संसाधित करते हैं, जबकि रूट यह तय करता है कि समीक्षा को कैसे विभाजित किया जाए और निष्कर्षों को कैसे इकट्ठा किया जाए।

Niko - inline image

चित्र 10: 30 होल्ड-आउट डेटा रूम पर, तीन उप-एजेंट मॉडलों के साथ युग्मित चार रूट मॉडलों के लिए औसत मानदंड पास दर।

ये परिणाम बताते हैं कि इस सेटअप में समन्वय में सुधार एक महत्वपूर्ण अवसर है, इसलिए हमने अपने प्रारंभिक पोस्ट-ट्रेनिंग प्रयोगों को रूट पर केंद्रित किया।

RLM हार्नेस में पोस्ट-ट्रेनिंग

उपरोक्त परिणाम रूट एजेंट को पोस्ट-ट्रेनिंग के लिए एक लक्ष्य के रूप में इंगित करते हैं। इस खंड में, हम RLM हार्नेस के अंदर ओपन-वेट रूट मॉडल को पोस्ट-ट्रेन करने के परिणामों की रिपोर्ट करते हैं।

सेल्फ-डिस्टिलेशन SFT

सबसे पहले, हमने रिजेक्शन-सैंपलिंग सेल्फ-डिस्टिलेशन SFT का उपयोग करके एक GLM-5.2 रूट को पोस्ट-ट्रेन किया। यह प्रयोग कहीं और रिपोर्ट किए गए 50-कक्ष मूल्यांकनों से एक अलग 20-कक्ष होल्ड-आउट मूल्यांकन सेट का उपयोग करता है। इस होल्ड-आउट पर इसका मिलान किया गया बेस-मॉडल स्कोर 46.1% है, जो बड़े होल्ड-आउट सेट पर चित्र 6 में रिपोर्ट किए गए 65.4% GLM-5.2 परिणाम से कम है।

बेस GLM-5.2 बॉक्स से बाहर एक उच्च-स्कोरिंग नीति को स्थिर रूप से निष्पादित नहीं करता है – बार-बार प्रदर्शन में गिरावट आती है जहां बेस मॉडल, रूट एजेंट के रूप में कार्य करते हुए, जल्दी हार मान लेता है, कम प्रतिनिधि करता है, या उप-एजेंट आउटपुट को एक मजबूत डिलिवरेबल में बदलने में विफल रहता है। यह देखते हुए कि एक मजबूत नीति पहले से ही मॉडल के वितरण के भीतर है, लेकिन इसे और अधिक मजबूत बनाने की आवश्यकता है, हम GLM-5.2 के वितरण को वांछित मोड पर तेज करने के लिए रिजेक्शन-सैंपलिंग सेल्फ-डिस्टिलेशन का उपयोग करते हैं। हमने उच्च डेटारूम कवरेज वाले सफल GLM-5.2 रन का चयन किया और उन प्रक्षेपवक्रों पर रूट को फाइन-ट्यून किया।

Niko - inline image

चित्र 11: RLM रूट के रूप में GLM-5.2 रिजेक्शन-सैंपलिंग सेल्फ-डिस्टिलेशन SFT से पहले और बाद में, एक अलग 20-कक्ष होल्ड-आउट सेट पर मूल्यांकन किया गया। ये SFT प्रयोग के भीतर मिलान किए गए परिणाम हैं, चित्र 6 में उपयोग किए गए 50-कक्ष मूल्यांकन नहीं।

इस 20-डेटारूम होल्ड-आउट सेट पर, SFT-प्रशिक्षित रूट बेस मॉडल के 46.1% के मुकाबले 60.1% स्कोर करता है (चित्र 11 देखें)। पोस्ट-ट्रेंड एजेंट के ट्रेस की समीक्षा से पता चलता है कि प्रशिक्षण रूट एजेंट को डेटारूम की व्यापक रूप से समीक्षा करने और अंतिम मेमो में उप-एजेंट निष्कर्षों का एक बड़ा प्रतिशत ले जाने में मदद करता है।

तालिका 1 पोस्ट-ट्रेनिंग के बाद हम जो अन्य व्यवहारिक परिवर्तन देखते हैं, उनका सारांश प्रस्तुत करती है। विशेष रूप से, उप-एजेंट कॉल वॉल्यूम और डेटारूम आकार के बीच सहसंबंध 0.17 से बढ़कर 0.84 हो जाता है, यह दर्शाता है कि प्रशिक्षित रूट एजेंट अपने प्रतिनिधिमंडल को डेटारूम के आकार के अनुसार स्केल करता है। प्रशिक्षित रूट उप-एजेंटों के अभी भी पढ़ते समय मेमो लिखना शुरू करना भी सीखता है, जैसा कि हमने अपने RL रन में पाया था।

Niko - inline image

तालिका 1: SFT से पहले और बाद में GLM-5.2 रूट का व्यवहार, अलग 20-कक्ष होल्ड-आउट सेट पर औसत। कवरेज एक प्रतिशत है; अंतिम पंक्ति एक सहसंबंध गुणांक है।

एक मजबूत रूट ड्यू डिलिजेंस एजेंट बनाने वाले व्यवहार, जैसे संपूर्ण प्रतिनिधिमंडल, अपेक्षाकृत कम संख्या में ऑन-पॉलिसी ट्रेस से सीखने योग्य हैं, बिना किसी विशेषाधिकार प्राप्त जानकारी और बिना लेबल किए गए कानूनी ज्ञान के। यहां, सेल्फ-डिस्टिलेशन प्रभावी है क्योंकि अच्छा व्यवहार पहले से ही मॉडल के वितरण में मौजूद है और प्रशिक्षण इसे स्थिर करता है।

इस प्रयोग ने हमें कार्य के पुरस्कार के माध्यम से सीधे नए व्यवहार को उत्पन्न करते हुए, मॉडल को उसके वितरण से परे धकेलने के प्रयास के रूप में RL-आधारित पोस्ट-ट्रेनिंग का पता लगाने के लिए प्रेरित किया।

सुदृढीकरण सीखना

सुदृढीकरण सीखने के लिए हमने प्रारंभिक RL प्रयोग लूप को प्रबंधनीय रखने के लिए एक छोटे रूट मॉडल, Qwen3.5-122B-A10B से शुरुआत की।

हमने RLM रूट को GRPO के साथ प्रशिक्षित किया, निर्णित रूब्रिक मानदंड पास दर को पुरस्कार के रूप में उपयोग करते हुए और उप-एजेंट मॉडल को स्थिर रखते हुए (उप-एजेंट प्रत्येक Qwen3.6-35B-A3B मॉडल थे)। 40 प्रशिक्षण चरणों में, हमने पाया कि औसत रोलआउट पास दर लगभग 23% से बढ़कर लगभग 56% हो गई। 50-कक्ष होल्ड-आउट सेट पर, अंतिम चेकपॉइंट बेस मॉडल के 29.9% के मुकाबले 63.0% स्कोर करता है।

Niko - inline image

चित्र 12: निश्चित Qwen3.6-35B-A3B उप-एजेंटों के साथ Qwen3.5-122B-A10B रूट पर सुदृढीकरण सीखना। (a) 40 प्रशिक्षण चरणों में से प्रत्येक पर औसत रोलआउट मानदंड पास दर। (b) 50-कक्ष होल्ड-आउट सेट पर बेस मॉडल और अंतिम चेकपॉइंट।

RL के बाद, औसत डेटा रूम कवरेज 62% से बढ़कर 96% हो जाता है, भले ही कवरेज एक स्पष्ट पुरस्कार शब्द नहीं है। बेस रन पूर्ण कवरेज रेंज में फैले हुए हैं, जिसमें 20% से नीचे एक क्लस्टर है जो लगभग शून्य स्कोर करता है। प्रत्येक RL-प्रशिक्षित रन डेटा रूम का 60% से अधिक पढ़ता है और अधिकांश इसके सभी को पढ़ते हैं।

Niko - inline image

चित्र 13: 50-कक्ष होल्ड-आउट सेट पर RL से पहले और बाद में Qwen3.5-122B-A10B रूट के लिए, प्रति रन एक बिंदु, प्रोब-आधारित कवरेज बनाम मानदंड पास दर।

पोस्ट-ट्रेंड रूट प्रति डेटारूम 64% अधिक उप-एजेंट कॉल करता है। RL ने SFT की तुलना में प्रतिनिधिमंडल की मात्रा को भी अधिक बदल दिया, 64% बनाम 29%।

Niko - inline image

तालिका 2: 50-कक्ष होल्ड-आउट सेट पर औसत, RL से पहले और बाद में Qwen3.5-122B-A10B रूट का व्यवहार।

पोस्ट-ट्रेनिंग से पहले, Qwen रूट एजेंट ने अपने ड्यू डिलिजेंस मेमो को एक ही बार में और सभी उप-एजेंटों के लौटने के बाद ही लिखने का प्रयास किया। RL पोस्ट-ट्रेनिंग के दौरान, यह एक अधिक कुशल दृष्टिकोण सीखता है, मेमो को वृद्धिशील रूप से लिखता है और उप-एजेंट कार्य की समीक्षा के साथ अनुभाग लेखन को इंटरलीव करता है।

GLM-5.3 के साथ RL को स्केल करना

अपने RL रेसिपी को पैमाने पर परीक्षण करने के लिए, हम अब GLM-5.3 को RLM रूट के रूप में उसी GRPO-शैली कॉन्फ़िगरेशन के साथ प्रशिक्षित कर रहे हैं: निर्णित मानदंड पास दर पुरस्कार के रूप में, Qwen3.6-35B-A3B उप-एजेंट स्थिर रखे गए, रूट पर LoRA, समूह आकार 8 और बैच आकार 24। GLM-5.3 रोलआउट उस स्थान से काफी ऊपर शुरू होते हैं जहां Qwen रूट ने शुरू किया था, इसलिए कम हेडरूम है। चरण 0 से 20 (चित्र 14) पर, दिखाए गए पहले और अंतिम आठ चरणों पर औसत, औसत रोलआउट पास दर लगभग 51% से बढ़कर लगभग 59% हो जाती है, इस बैच आकार पर अपेक्षित चरण-दर-चरण शोर के साथ।

Niko - inline image

चित्र 14: चल रहे GLM-5.3 RL रन के लिए प्रारंभिक प्रशिक्षण प्रगति, Qwen3.6-35B-A3B उप-एजेंट स्थिर रखे गए। 20 प्रशिक्षण चरणों के दौरान औसत रोलआउट मानदंड पास दर दिखाई गई है। ग्रे कच्चे प्रति-चरण मान दिखाता है; काला एक घातीय चलती औसत दिखाता है। यह आंकड़ा प्रशिक्षण स्कोर रिपोर्ट करता है, होल्ड-आउट प्रदर्शन नहीं।

आगे क्या है

RLM हार्नेस उन मॉडलों में प्रदर्शन में सुधार करता है जिनका हमने परीक्षण किया, और RL उस हार्नेस के भीतर Qwen रूट के लिए और लाभ उत्पन्न करता है। इन स्कोर और लगभग-पूर्ण पास दरों के बीच अभी भी एक महत्वपूर्ण अंतर है जिसकी ओर हम काम कर रहे हैं।

ऊपर विस्तृत प्रशिक्षण प्रयोग प्रारंभिक खोज हैं। स्केल किए गए GLM-5.3 प्रशिक्षण रन को पूरा करने के अलावा, हम SFT और RL के संयोजन, और प्रशिक्षित उप-एजेंटों का भी पता लगाएंगे। RLM हार्नेस रूट के ऑर्केस्ट्रेशन को उप-एजेंटों के पढ़ने से अलग करता है, इसलिए प्रत्येक को अपने दम पर या संयुक्त रूप से प्रशिक्षित किया जा सकता है, जिसमें ऐसे सेटअप शामिल हैं जिनमें उप-एजेंटों को बारी-बारी से प्रतिनिधि करने के लिए प्रशिक्षित किया जाता है।

अंत में, यहां मुख्य निष्कर्ष, कि मॉडल-हार्नेस सह-अनुकूलन लंबे-क्षितिज वातावरण में एजेंट प्रदर्शन में सार्थक सुधार कर सकता है, ड्यू डिलिजेंस के लिए विशिष्ट नहीं है। हम उसी हार्नेस संरचना और प्रशिक्षण दृष्टिकोण को अन्य लंबे-संदर्भ कानूनी कार्यों में मैप करने के तरीकों की खोज कर रहे हैं।

परिशिष्ट

RLM रिकर्सन डेप्थ

हमने यह भी परीक्षण किया कि क्या प्रतिनिधिमंडल की एक और परत जोड़ने से प्रदर्शन में सुधार होता है। डेप्थ-1 पर, उप-एजेंट सादे LLM पूर्णताएं लौटाते हैं, बिना किसी टूल या अपने स्वयं के प्रतिनिधिमंडल के। डेप्थ-2 पर, उप-एजेंट एक Python REPL प्राप्त करते हैं और आगे प्रतिनिधि कर सकते हैं। प्रत्येक प्रयोग के भीतर, हमने रूट और प्रत्येक उप-एजेंट के लिए एक ही मॉडल का उपयोग किया।

हमने GLM-5.2 और Qwen3.5-122B-A10B दोनों का मूल्यांकन किया। कई GLM-5.2 डेप्थ-2 रन समय सीमा के भीतर समाप्त नहीं हुए, इसलिए हम नीचे Qwen परिणाम रिपोर्ट करते हैं। 14 डेटारूम में, डेप्थ-2 ने चार पर स्कोर में सुधार किया और दस पर उन्हें कम किया, औसत मानदंड पास दर को 19 प्रतिशत अंक कम कर दिया (चित्र A2)। दस प्रतिगमनों में से चार में, डेप्थ-2 एजेंट ने डेटारूम सामग्री पढ़ी लेकिन कभी रिपोर्ट तैयार नहीं की।

Niko - inline image

चित्र A1: 14 डेटारूम के लिए डेप्थ-1 और डेप्थ-2 पर प्रति-कक्ष मानदंड पास दर। हमने मॉडल को स्थिर रखा और सादे-पूर्णता उप-एजेंटों की तुलना उन उप-एजेंटों से की जो REPL का उपयोग कर सकते थे और प्रतिनिधि कर सकते थे। दस प्रतिगमनों में से चार में, डेप्थ-2 रन डेटारूम पढ़ता है लेकिन कभी रिपोर्ट नहीं लिखता है।

इन परिणामों ने प्रारंभिक पोस्ट-ट्रेनिंग प्रयोगों के लिए डेप्थ-1 के हमारे उपयोग को प्रेरित किया। क्या गहरे प्रतिनिधिमंडल के लिए विशेष रूप से एजेंटों को प्रशिक्षित करना अतिरिक्त परतों को उपयोगी बना सकता है, यह एक खुला प्रश्न बना हुआ है।

RL बुनियादी ढांचा

RL, विशेष रूप से इतनी लंबी एपिसोड लंबाई के साथ, उतना ही एक बुनियादी ढांचे की समस्या है जितना कि एक प्रशिक्षण संकेत समस्या। इस कार्य के लिए, एकल-एपिसोड रोलआउट को पूरा होने में एक घंटे या उससे अधिक का वॉल-क्लॉक समय लग सकता है। प्रशिक्षण वॉल-क्लॉक समय को अनुकूलित करने के लिए, हमने एसिंक्रोनस ऑफ-पॉलिसी इन्फ्रेंस, निरंतर इन्फ्रेंस बैचिंग, ओवरसैंपलिंग, और इन-फ्लाइट वेट अपडेट जैसी विधियों को लागू किया। ऑफ-पॉलिसीनेस के प्रभाव को नियंत्रित करने के लिए चयनात्मक टोकन मास्किंग और एसिंक-संबंधित कैप लागू किए गए थे। यह देखते हुए कि RLM हार्नेस में अधिकांश वॉल-क्लॉक उप-एजेंटों के पूरा होने की प्रतीक्षा में व्यतीत होता है, छोटे तेज़ उप-एजेंटों का उपयोग करने की क्षमता ने RL प्रशिक्षण प्रक्रिया को बहुत तेज करने में मदद की।

हम नीचे स्टेप वॉल-क्लॉक समय प्लॉट करते हैं। यह रोलआउट समय का प्रभुत्व है जो RL के दौरान बढ़ता है क्योंकि एजेंट अधिक गहन हो जाता है और उप-एजेंटों की बड़ी लहरें भेजता है।

Niko - inline image

चित्र A2: 40-चरणीय रन के लिए प्रति RL प्रशिक्षण चरण वॉल-क्लॉक मिनट, 5-चरणीय रोलिंग माध्य के साथ। चरण 2–10 औसत 48 मिनट और चरण 31–40 औसत 74 मिनट; वृद्धि प्रशिक्षित मॉडल द्वारा प्रति रोलआउट अधिक उप-एजेंट भेजने से आती है।

एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें