लेख का लिंक: https://www.harvey.ai/blog/post-training-rlm-agents-for-m-and-a-diligence
Harvey Tenet के लिए अपने हालिया शोध पूर्वावलोकन में, हमने जटिल, एंड-टू-एंड कानूनी कार्यों को हल करने के लिए मॉडल-हार्नेस सह-अनुकूलन के महत्व पर प्रकाश डाला था, और M&A ड्यू डिलिजेंस पर प्रारंभिक परिणाम प्रस्तुत किए थे, जहां एक एकल कार्य के लिए 80M टोकन तक के दस्तावेज़ संदर्भ को पार करना आवश्यक होता है। आज, हम अपने निरंतर प्रयोगों से अद्यतन परिणाम साझा कर रहे हैं।
Baseten के साथ मिलकर, हमने M&A ड्यू डिलिजेंस के लिए एक रिकर्सिव लैंग्वेज मॉडल (RLM) हार्नेस बनाया। हमारे RLM फॉर्मूलेशन में, एक संपूर्ण डेटारूम को Python REPL में लोड किया जाता है और एक रूट एजेंट सीमित समीक्षा और विश्लेषण को उप-एजेंटों को सौंपता है जो अपने स्वयं के संदर्भ विंडो में काम करते हैं। LAB ड्यू डिलिजेंस कार्यों पर, यह हार्नेस उन सात मॉडलों में रूब्रिक मानदंड पास दर में औसतन 39.1 प्रतिशत अंकों का सुधार करता है जिनका हमने मूल्यांकन किया।
हम पाते हैं कि RLM हार्नेस के भीतर पोस्ट-ट्रेनिंग से आगे के प्रदर्शन लाभ और गुणवत्ता-दक्षता व्यापार-बंद को नेविगेट करने के विकल्प मिलते हैं। हमने सुदृढीकरण सीखने के माध्यम से एक Qwen3.5-122B-A10B ऑर्केस्ट्रेटर को पोस्ट-ट्रेन किया और पाया कि पोस्ट-ट्रेनिंग ने 50 होल्ड-आउट LAB ड्यू डिलिजेंस डेटारूम पर रूब्रिक मानदंड पास दर को 29.9% से बढ़ाकर 63.0% कर दिया।

चित्र 1: मानक टूल-लूप हार्नेस में बेस मॉडल, अपने स्वयं के हार्नेस में कोडिंग एजेंट, और हमारे RLM हार्नेस में मॉडल के लिए LAB ड्यू डिलिजेंस पर औसत मानदंड पास दर। तारांकन चिह्न SFT से पहले और बाद में मिलान किए गए GLM-5.2 परिणामों को चिह्नित करते हैं, जिनका मूल्यांकन एक अलग 20-कक्ष होल्ड-आउट सेट पर किया गया है। अन्य सभी परिणाम 50-कक्ष होल्ड-आउट सेट का उपयोग करते हैं।
ये परिणाम बताते हैं कि कार्य-विशिष्ट हार्नेस के भीतर पोस्ट-ट्रेनिंग M&A ड्यू डिलिजेंस जैसे दस्तावेज़-गहन कानूनी कार्य के लिए एक व्यावहारिक मार्ग है, और RLM हार्नेस के भीतर RL को स्केल करना भविष्य के काम के लिए एक आशाजनक दिशा है। इस कारण से, हम एक चल रहे स्केल-अप रन में रूट मॉडल के रूप में GLM-5.3, एक बड़ा फ्रंटियर ओपन वेट मॉडल भी प्रशिक्षित कर रहे हैं।
इस पोस्ट के शेष भाग में, हम उन LAB ड्यू डिलिजेंस वातावरणों का वर्णन करते हैं जिनका हमने मूल्यांकन किया, हमारी पद्धति, और अधिक विस्तार से पोस्ट-ट्रेनिंग प्रयोगों का वर्णन करते हैं।
M&A ड्यू डिलिजेंस के लिए वातावरण
हमने हाल ही में LAB ड्यू डिलिजेंस पेश किया, जो LAB का एक विस्तार है जिसमें M&A ड्यू डिलिजेंस के लिए सिंथेटिक वातावरण शामिल हैं। LAB ड्यू डिलिजेंस में एक एकल डेटा रूम में श्रेणी के अनुसार दर्जनों फ़ोल्डरों में व्यवस्थित 5,000 दस्तावेज़ तक और 80M टोकन तक का कुल संदर्भ होता है।

चित्र 2: एक उदाहरण LAB ड्यू डिलिजेंस डेटारूम। Aravon Bridge Bank में 14 श्रेणियों में 82 फ़ोल्डरों में 2,270 दस्तावेज़ हैं, कुल 31M टोकन। इस कार्य के लिए एजेंट के ड्यू डिलिजेंस मेमो का मूल्यांकन 571 रूब्रिक मानदंडों के विरुद्ध किया जाता है।
इस डेटारूम के भीतर काम करते हुए, एजेंट को एक पूर्ण ड्यू डिलिजेंस मेमो तैयार करने का कार्य सौंपा जाता है, जिसमें दस्तावेज़ उद्धरणों के साथ उसके निष्कर्ष, जहाँ प्रासंगिक हो वहाँ मात्रात्मक जोखिम, और लेन-देन के लिए अनुशंसित अगले कदम शामिल हों। एक LLM जज सैकड़ों पास या फेल मानदंडों वाले एक विशेषज्ञ रूब्रिक के विरुद्ध ड्यू डिलिजेंस मेमो को स्कोर करता है। Aravon Bridge Bank उदाहरण में कुल 571 रूब्रिक मानदंड हैं।

चित्र 3: LAB ड्यू डिलिजेंस में Aravon Bridge Bank कार्य के लिए रूब्रिक उदाहरण, प्रत्येक प्रकार के एक शाब्दिक मानदंड के साथ।
ड्यू डिलिजेंस के लिए आवश्यक साक्ष्य डेटारूम में फैले हुए हैं। कुछ निष्कर्षों के लिए कई दस्तावेज़ों को संयोजित करने की आवश्यकता होती है, जबकि अन्य के लिए यह जाँचने की आवश्यकता होती है कि सहायक साक्ष्य गायब है या नहीं। हमारे बेसलाइन रन में, एजेंटों ने चुनिंदा रूप से खोज और पढ़ाई की, जिससे डेटारूम का अधिकांश भाग अजांचा रह गया। ये कार्य एक ऐसे हार्नेस की मांग करते हैं जो समीक्षा को कई सीमित संदर्भों में वितरित कर सके और निष्कर्षों को एक साथ ला सके।
M&A ड्यू डिलिजेंस के लिए एक RLM हार्नेस
बेसलाइन स्थापित करने के लिए, हमने Legal Agent Bench से मानक टूल-लूप हार्नेस से शुरुआत की। इस हार्नेस में, बेस मॉडल 50 होल्ड-आउट डेटारूम में औसतन 23.3% रूब्रिक मानदंड पास करते हैं, और कोई भी मॉडल किसी भी डेटारूम पर हर मानदंड को पास नहीं करता है।

चित्र 4: 50 होल्ड-आउट ड्यू डिलिजेंस डेटारूम पर मानक टूल-लूप हार्नेस में औसत मानदंड पास दर।
ये परिणाम कार्य और हार्नेस के बीच एक बेमेल का सुझाव देते हैं। एक LAB ड्यू डिलिजेंस डेटारूम एक एकल मॉडल संदर्भ में फिट होने के लिए बहुत बड़ा है, लेकिन प्रारंभिक समीक्षा का अधिकांश भाग श्रेणी के अनुसार विभाजित किया जा सकता है। इसके बाद रूट श्रेणियों में निष्कर्षों को मिलाकर मेमो तैयार कर सकता है। कानूनी फर्मों के भीतर डील टीमें ड्यू डिलिजेंस कार्य को समान तरीके से विभाजित करती हैं।

चित्र 5: डेप्थ-1 पर RLM हार्नेस। डेटारूम को क्वेरी करने योग्य चर के रूप में Python REPL में लोड किया जाता है। रूट एजेंट कोड में उस पर काम करता है और सीमित पढ़ने के कार्यों को उप-एजेंटों को सौंपता है, जो अपने निष्कर्षों को REPL चर के रूप में लौटाते हैं। केवल वह आउटपुट जो रूट एजेंट प्रिंट करता है, उसके संदर्भ विंडो में प्रवेश करता है, इसलिए रूट कभी भी पूर्ण डेटारूम को धारण नहीं करता है।
इसने हमें M&A ड्यू डिलिजेंस के लिए एक हार्नेस के रूप में RLM का पता लगाने के लिए प्रेरित किया। एक RLM हार्नेस में, एक रूट एजेंट को एक Python REPL दिया जाता है जिसमें डेटारूम क्वेरी करने योग्य चर के रूप में लोड होता है, जो इसे प्रोग्रामेटिक रूप से कॉर्पस खोजने देता है। रूट एजेंट समीक्षा की योजना बनाता है और उसका दायरा तय करता है और उप-कार्यों को उप-एजेंटों को भेजता है। प्रत्येक उप-एजेंट कॉर्पस का एक सीमित टुकड़ा और रूट एजेंट से निर्देश प्राप्त करता है, अपनी स्वयं की संदर्भ विंडो के भीतर काम करता है, और अपने निष्कर्षों को REPL चर के रूप में लौटाता है। नीचे दिए गए प्रयोग जब तक अन्यथा उल्लेख न किया गया हो, उप-एजेंटों की एक एकल परत का उपयोग करते हैं, और व्यवहार में रूट समानांतर में कई कॉल भेजता है।

चित्र 6: 50-कक्ष होल्ड-आउट सेट पर, मानक टूल-लूप हार्नेस में और RLM हार्नेस (डेप्थ-1, Qwen3.6-35B-A3B उप-एजेंट) के रूट के रूप में सात मॉडलों के लिए औसत मानदंड पास दर।
सात मॉडलों में, RLM हार्नेस औसत पास दर को 23.3% से बढ़ाकर 62.4% कर देता है, जो 39.1 प्रतिशत अंकों का लाभ है। हमने वेब टूल बंद करके दो सामान्य-उद्देश्यीय कोडिंग एजेंट भी चलाए, Claude Code Opus-5 के साथ और Codex GPT-5.6 Sol के साथ, टूल-लूप हार्नेस के समान न्यूनतम निर्देश का उपयोग करते हुए। Claude Code 24.6% मानदंड पास करता है और Codex 12.0%, जो टूल-लूप हार्नेस में समान मॉडलों से क्रमशः 17.9 और 4.6 अंक कम है। ट्रेस में, दोनों एजेंट जल्दी पढ़ना बंद कर देते हैं और छोटे मेमो लिखते हैं, और क्षमता होने के बावजूद कोई भी उप-एजेंट नहीं बनाता है।
कवरेज और लागत
RLM हार्नेस उपयोगी सामग्री की मात्रा में काफी वृद्धि करता है जो एजेंट संदर्भ बन जाती है। हम प्रोब के साथ कवरेज का अनुमान लगाते हैं जो हार्नेस में किसी भी मॉडल, रूट या उप-एजेंट तक पहुंचने वाली डेटारूम सामग्री के हिस्से को मापते हैं। मानक टूल-लूप हार्नेस में, कोई भी रन डेटारूम के 1% से अधिक नहीं पढ़ता है, और अधिकांश 0.1% और 0.5% के बीच पढ़ते हैं। RLM हार्नेस में, लगभग हर रन डेटारूम का 10% से अधिक पढ़ता है और अधिकांश इसके लगभग सभी को पढ़ते हैं। इस सीमा में उच्च कवरेज उच्च रूब्रिक मानदंड पास दरों से जुड़ा है।

चित्र 7: प्रति रन एक बिंदु, LAB ड्यू डिलिजेंस के 50 होल्ड-आउट डेटा रूम पर प्रत्येक हार्नेस में सात मॉडलों के लिए प्रोब-आधारित कवरेज बनाम रूब्रिक मानदंड पास दर। कवरेज एक लॉग स्केल पर है।
RLM हार्नेस में जाने से सात बेसलाइन मॉडलों में से छह के लिए प्रति डेटारूम जनरेशन लागत बढ़ जाती है, जैसा कि चित्र 8 में दिखाया गया है। Claude Opus 5 अपवाद है। टूल-लूप हार्नेस में यह अपने आप पढ़ने में प्रति डेटा रूम ~$18 खर्च करता है; RLM रूट के रूप में यह ~$7 खर्च करता है और 35 अंक अधिक स्कोर करता है।

चित्र 8: 50 होल्ड-आउट डेटा रूम पर औसत, प्रत्येक हार्नेस में सात मॉडलों के लिए प्रति डेटा रूम जनरेशन लागत बनाम औसत मानदंड पास दर। बिंदीदार रेखाएं हार्नेस में एक ही मॉडल को जोड़ती हैं। लागत सूची मूल्यों पर कैश-अवेयर अनुमान हैं, लॉग स्केल।
श्रम का विभाजन
यह जांचने के लिए कि प्रदर्शन रूट एजेंट बनाम उप-एजेंटों पर कितना निर्भर करता है, हमने 30 होल्ड-आउट डेटा रूम पर चार रूट मॉडलों को तीन Qwen उप-एजेंट मॉडलों के साथ जोड़ा (चित्र 9 देखें)। परीक्षण किए गए कॉन्फ़िगरेशन में, रूट को बदलने का अधिक प्रभाव पड़ा। उप-एजेंट मॉडल को स्थिर रखते हुए रूट मॉडल को बदलने पर, उच्चतम और निम्नतम स्कोरिंग रूट के बीच का अंतर औसतन लगभग 38 प्रतिशत अंक था। रूट को स्थिर रखते हुए उप-एजेंटों को बदलने पर, उप-एजेंट मॉडल के बीच संबंधित अंतर औसतन लगभग 8 अंक था (चित्र 9b)।

चित्र 9: RLM हार्नेस में श्रम का विभाजन, 30 होल्ड-आउट डेटारूम पर चार रूट मॉडलों और तीन उप-एजेंट मॉडलों पर एकत्रित। (a) उप-एजेंट विकल्पों पर औसत, इनपुट और आउटपुट टोकन का रूट हिस्सा। (b) उप-एजेंट विकल्पों पर औसत, उच्चतम और निम्नतम स्कोरिंग रूट के बीच का अंतर, और रूट पर औसत, उप-एजेंटों के बीच संबंधित अंतर।
यह अंतर उल्लेखनीय है क्योंकि, RLM हार्नेस में, हम देखते हैं कि रूट एजेंट के कुल टोकन उपयोग का एक अल्पसंख्यक हिस्सा है। उदाहरण के लिए, Opus 5 के ऑर्केस्ट्रेट करने पर, रूट इनपुट टोकन का 3.8% और आउटपुट टोकन का 1.1% हिस्सा होता है (चित्र 9a देखें)। उप-एजेंट अधिकांश टेक्स्ट को संसाधित करते हैं, जबकि रूट यह तय करता है कि समीक्षा को कैसे विभाजित किया जाए और निष्कर्षों को कैसे इकट्ठा किया जाए।

चित्र 10: 30 होल्ड-आउट डेटा रूम पर, तीन उप-एजेंट मॉडलों के साथ युग्मित चार रूट मॉडलों के लिए औसत मानदंड पास दर।
ये परिणाम बताते हैं कि इस सेटअप में समन्वय में सुधार एक महत्वपूर्ण अवसर है, इसलिए हमने अपने प्रारंभिक पोस्ट-ट्रेनिंग प्रयोगों को रूट पर केंद्रित किया।
RLM हार्नेस में पोस्ट-ट्रेनिंग
उपरोक्त परिणाम रूट एजेंट को पोस्ट-ट्रेनिंग के लिए एक लक्ष्य के रूप में इंगित करते हैं। इस खंड में, हम RLM हार्नेस के अंदर ओपन-वेट रूट मॉडल को पोस्ट-ट्रेन करने के परिणामों की रिपोर्ट करते हैं।
सेल्फ-डिस्टिलेशन SFT
सबसे पहले, हमने रिजेक्शन-सैंपलिंग सेल्फ-डिस्टिलेशन SFT का उपयोग करके एक GLM-5.2 रूट को पोस्ट-ट्रेन किया। यह प्रयोग कहीं और रिपोर्ट किए गए 50-कक्ष मूल्यांकनों से एक अलग 20-कक्ष होल्ड-आउट मूल्यांकन सेट का उपयोग करता है। इस होल्ड-आउट पर इसका मिलान किया गया बेस-मॉडल स्कोर 46.1% है, जो बड़े होल्ड-आउट सेट पर चित्र 6 में रिपोर्ट किए गए 65.4% GLM-5.2 परिणाम से कम है।
बेस GLM-5.2 बॉक्स से बाहर एक उच्च-स्कोरिंग नीति को स्थिर रूप से निष्पादित नहीं करता है – बार-बार प्रदर्शन में गिरावट आती है जहां बेस मॉडल, रूट एजेंट के रूप में कार्य करते हुए, जल्दी हार मान लेता है, कम प्रतिनिधि करता है, या उप-एजेंट आउटपुट को एक मजबूत डिलिवरेबल में बदलने में विफल रहता है। यह देखते हुए कि एक मजबूत नीति पहले से ही मॉडल के वितरण के भीतर है, लेकिन इसे और अधिक मजबूत बनाने की आवश्यकता है, हम GLM-5.2 के वितरण को वांछित मोड पर तेज करने के लिए रिजेक्शन-सैंपलिंग सेल्फ-डिस्टिलेशन का उपयोग करते हैं। हमने उच्च डेटारूम कवरेज वाले सफल GLM-5.2 रन का चयन किया और उन प्रक्षेपवक्रों पर रूट को फाइन-ट्यून किया।

चित्र 11: RLM रूट के रूप में GLM-5.2 रिजेक्शन-सैंपलिंग सेल्फ-डिस्टिलेशन SFT से पहले और बाद में, एक अलग 20-कक्ष होल्ड-आउट सेट पर मूल्यांकन किया गया। ये SFT प्रयोग के भीतर मिलान किए गए परिणाम हैं, चित्र 6 में उपयोग किए गए 50-कक्ष मूल्यांकन नहीं।
इस 20-डेटारूम होल्ड-आउट सेट पर, SFT-प्रशिक्षित रूट बेस मॉडल के 46.1% के मुकाबले 60.1% स्कोर करता है (चित्र 11 देखें)। पोस्ट-ट्रेंड एजेंट के ट्रेस की समीक्षा से पता चलता है कि प्रशिक्षण रूट एजेंट को डेटारूम की व्यापक रूप से समीक्षा करने और अंतिम मेमो में उप-एजेंट निष्कर्षों का एक बड़ा प्रतिशत ले जाने में मदद करता है।
तालिका 1 पोस्ट-ट्रेनिंग के बाद हम जो अन्य व्यवहारिक परिवर्तन देखते हैं, उनका सारांश प्रस्तुत करती है। विशेष रूप से, उप-एजेंट कॉल वॉल्यूम और डेटारूम आकार के बीच सहसंबंध 0.17 से बढ़कर 0.84 हो जाता है, यह दर्शाता है कि प्रशिक्षित रूट एजेंट अपने प्रतिनिधिमंडल को डेटारूम के आकार के अनुसार स्केल करता है। प्रशिक्षित रूट उप-एजेंटों के अभी भी पढ़ते समय मेमो लिखना शुरू करना भी सीखता है, जैसा कि हमने अपने RL रन में पाया था।

तालिका 1: SFT से पहले और बाद में GLM-5.2 रूट का व्यवहार, अलग 20-कक्ष होल्ड-आउट सेट पर औसत। कवरेज एक प्रतिशत है; अंतिम पंक्ति एक सहसंबंध गुणांक है।
एक मजबूत रूट ड्यू डिलिजेंस एजेंट बनाने वाले व्यवहार, जैसे संपूर्ण प्रतिनिधिमंडल, अपेक्षाकृत कम संख्या में ऑन-पॉलिसी ट्रेस से सीखने योग्य हैं, बिना किसी विशेषाधिकार प्राप्त जानकारी और बिना लेबल किए गए कानूनी ज्ञान के। यहां, सेल्फ-डिस्टिलेशन प्रभावी है क्योंकि अच्छा व्यवहार पहले से ही मॉडल के वितरण में मौजूद है और प्रशिक्षण इसे स्थिर करता है।
इस प्रयोग ने हमें कार्य के पुरस्कार के माध्यम से सीधे नए व्यवहार को उत्पन्न करते हुए, मॉडल को उसके वितरण से परे धकेलने के प्रयास के रूप में RL-आधारित पोस्ट-ट्रेनिंग का पता लगाने के लिए प्रेरित किया।
सुदृढीकरण सीखना
सुदृढीकरण सीखने के लिए हमने प्रारंभिक RL प्रयोग लूप को प्रबंधनीय रखने के लिए एक छोटे रूट मॉडल, Qwen3.5-122B-A10B से शुरुआत की।
हमने RLM रूट को GRPO के साथ प्रशिक्षित किया, निर्णित रूब्रिक मानदंड पास दर को पुरस्कार के रूप में उपयोग करते हुए और उप-एजेंट मॉडल को स्थिर रखते हुए (उप-एजेंट प्रत्येक Qwen3.6-35B-A3B मॉडल थे)। 40 प्रशिक्षण चरणों में, हमने पाया कि औसत रोलआउट पास दर लगभग 23% से बढ़कर लगभग 56% हो गई। 50-कक्ष होल्ड-आउट सेट पर, अंतिम चेकपॉइंट बेस मॉडल के 29.9% के मुकाबले 63.0% स्कोर करता है।

चित्र 12: निश्चित Qwen3.6-35B-A3B उप-एजेंटों के साथ Qwen3.5-122B-A10B रूट पर सुदृढीकरण सीखना। (a) 40 प्रशिक्षण चरणों में से प्रत्येक पर औसत रोलआउट मानदंड पास दर। (b) 50-कक्ष होल्ड-आउट सेट पर बेस मॉडल और अंतिम चेकपॉइंट।
RL के बाद, औसत डेटा रूम कवरेज 62% से बढ़कर 96% हो जाता है, भले ही कवरेज एक स्पष्ट पुरस्कार शब्द नहीं है। बेस रन पूर्ण कवरेज रेंज में फैले हुए हैं, जिसमें 20% से नीचे एक क्लस्टर है जो लगभग शून्य स्कोर करता है। प्रत्येक RL-प्रशिक्षित रन डेटा रूम का 60% से अधिक पढ़ता है और अधिकांश इसके सभी को पढ़ते हैं।

चित्र 13: 50-कक्ष होल्ड-आउट सेट पर RL से पहले और बाद में Qwen3.5-122B-A10B रूट के लिए, प्रति रन एक बिंदु, प्रोब-आधारित कवरेज बनाम मानदंड पास दर।
पोस्ट-ट्रेंड रूट प्रति डेटारूम 64% अधिक उप-एजेंट कॉल करता है। RL ने SFT की तुलना में प्रतिनिधिमंडल की मात्रा को भी अधिक बदल दिया, 64% बनाम 29%।

तालिका 2: 50-कक्ष होल्ड-आउट सेट पर औसत, RL से पहले और बाद में Qwen3.5-122B-A10B रूट का व्यवहार।
पोस्ट-ट्रेनिंग से पहले, Qwen रूट एजेंट ने अपने ड्यू डिलिजेंस मेमो को एक ही बार में और सभी उप-एजेंटों के लौटने के बाद ही लिखने का प्रयास किया। RL पोस्ट-ट्रेनिंग के दौरान, यह एक अधिक कुशल दृष्टिकोण सीखता है, मेमो को वृद्धिशील रूप से लिखता है और उप-एजेंट कार्य की समीक्षा के साथ अनुभाग लेखन को इंटरलीव करता है।
GLM-5.3 के साथ RL को स्केल करना
अपने RL रेसिपी को पैमाने पर परीक्षण करने के लिए, हम अब GLM-5.3 को RLM रूट के रूप में उसी GRPO-शैली कॉन्फ़िगरेशन के साथ प्रशिक्षित कर रहे हैं: निर्णित मानदंड पास दर पुरस्कार के रूप में, Qwen3.6-35B-A3B उप-एजेंट स्थिर रखे गए, रूट पर LoRA, समूह आकार 8 और बैच आकार 24। GLM-5.3 रोलआउट उस स्थान से काफी ऊपर शुरू होते हैं जहां Qwen रूट ने शुरू किया था, इसलिए कम हेडरूम है। चरण 0 से 20 (चित्र 14) पर, दिखाए गए पहले और अंतिम आठ चरणों पर औसत, औसत रोलआउट पास दर लगभग 51% से बढ़कर लगभग 59% हो जाती है, इस बैच आकार पर अपेक्षित चरण-दर-चरण शोर के साथ।

चित्र 14: चल रहे GLM-5.3 RL रन के लिए प्रारंभिक प्रशिक्षण प्रगति, Qwen3.6-35B-A3B उप-एजेंट स्थिर रखे गए। 20 प्रशिक्षण चरणों के दौरान औसत रोलआउट मानदंड पास दर दिखाई गई है। ग्रे कच्चे प्रति-चरण मान दिखाता है; काला एक घातीय चलती औसत दिखाता है। यह आंकड़ा प्रशिक्षण स्कोर रिपोर्ट करता है, होल्ड-आउट प्रदर्शन नहीं।
आगे क्या है
RLM हार्नेस उन मॉडलों में प्रदर्शन में सुधार करता है जिनका हमने परीक्षण किया, और RL उस हार्नेस के भीतर Qwen रूट के लिए और लाभ उत्पन्न करता है। इन स्कोर और लगभग-पूर्ण पास दरों के बीच अभी भी एक महत्वपूर्ण अंतर है जिसकी ओर हम काम कर रहे हैं।
ऊपर विस्तृत प्रशिक्षण प्रयोग प्रारंभिक खोज हैं। स्केल किए गए GLM-5.3 प्रशिक्षण रन को पूरा करने के अलावा, हम SFT और RL के संयोजन, और प्रशिक्षित उप-एजेंटों का भी पता लगाएंगे। RLM हार्नेस रूट के ऑर्केस्ट्रेशन को उप-एजेंटों के पढ़ने से अलग करता है, इसलिए प्रत्येक को अपने दम पर या संयुक्त रूप से प्रशिक्षित किया जा सकता है, जिसमें ऐसे सेटअप शामिल हैं जिनमें उप-एजेंटों को बारी-बारी से प्रतिनिधि करने के लिए प्रशिक्षित किया जाता है।
अंत में, यहां मुख्य निष्कर्ष, कि मॉडल-हार्नेस सह-अनुकूलन लंबे-क्षितिज वातावरण में एजेंट प्रदर्शन में सार्थक सुधार कर सकता है, ड्यू डिलिजेंस के लिए विशिष्ट नहीं है। हम उसी हार्नेस संरचना और प्रशिक्षण दृष्टिकोण को अन्य लंबे-संदर्भ कानूनी कार्यों में मैप करने के तरीकों की खोज कर रहे हैं।
परिशिष्ट
RLM रिकर्सन डेप्थ
हमने यह भी परीक्षण किया कि क्या प्रतिनिधिमंडल की एक और परत जोड़ने से प्रदर्शन में सुधार होता है। डेप्थ-1 पर, उप-एजेंट सादे LLM पूर्णताएं लौटाते हैं, बिना किसी टूल या अपने स्वयं के प्रतिनिधिमंडल के। डेप्थ-2 पर, उप-एजेंट एक Python REPL प्राप्त करते हैं और आगे प्रतिनिधि कर सकते हैं। प्रत्येक प्रयोग के भीतर, हमने रूट और प्रत्येक उप-एजेंट के लिए एक ही मॉडल का उपयोग किया।
हमने GLM-5.2 और Qwen3.5-122B-A10B दोनों का मूल्यांकन किया। कई GLM-5.2 डेप्थ-2 रन समय सीमा के भीतर समाप्त नहीं हुए, इसलिए हम नीचे Qwen परिणाम रिपोर्ट करते हैं। 14 डेटारूम में, डेप्थ-2 ने चार पर स्कोर में सुधार किया और दस पर उन्हें कम किया, औसत मानदंड पास दर को 19 प्रतिशत अंक कम कर दिया (चित्र A2)। दस प्रतिगमनों में से चार में, डेप्थ-2 एजेंट ने डेटारूम सामग्री पढ़ी लेकिन कभी रिपोर्ट तैयार नहीं की।

चित्र A1: 14 डेटारूम के लिए डेप्थ-1 और डेप्थ-2 पर प्रति-कक्ष मानदंड पास दर। हमने मॉडल को स्थिर रखा और सादे-पूर्णता उप-एजेंटों की तुलना उन उप-एजेंटों से की जो REPL का उपयोग कर सकते थे और प्रतिनिधि कर सकते थे। दस प्रतिगमनों में से चार में, डेप्थ-2 रन डेटारूम पढ़ता है लेकिन कभी रिपोर्ट नहीं लिखता है।
इन परिणामों ने प्रारंभिक पोस्ट-ट्रेनिंग प्रयोगों के लिए डेप्थ-1 के हमारे उपयोग को प्रेरित किया। क्या गहरे प्रतिनिधिमंडल के लिए विशेष रूप से एजेंटों को प्रशिक्षित करना अतिरिक्त परतों को उपयोगी बना सकता है, यह एक खुला प्रश्न बना हुआ है।
RL बुनियादी ढांचा
RL, विशेष रूप से इतनी लंबी एपिसोड लंबाई के साथ, उतना ही एक बुनियादी ढांचे की समस्या है जितना कि एक प्रशिक्षण संकेत समस्या। इस कार्य के लिए, एकल-एपिसोड रोलआउट को पूरा होने में एक घंटे या उससे अधिक का वॉल-क्लॉक समय लग सकता है। प्रशिक्षण वॉल-क्लॉक समय को अनुकूलित करने के लिए, हमने एसिंक्रोनस ऑफ-पॉलिसी इन्फ्रेंस, निरंतर इन्फ्रेंस बैचिंग, ओवरसैंपलिंग, और इन-फ्लाइट वेट अपडेट जैसी विधियों को लागू किया। ऑफ-पॉलिसीनेस के प्रभाव को नियंत्रित करने के लिए चयनात्मक टोकन मास्किंग और एसिंक-संबंधित कैप लागू किए गए थे। यह देखते हुए कि RLM हार्नेस में अधिकांश वॉल-क्लॉक उप-एजेंटों के पूरा होने की प्रतीक्षा में व्यतीत होता है, छोटे तेज़ उप-एजेंटों का उपयोग करने की क्षमता ने RL प्रशिक्षण प्रक्रिया को बहुत तेज करने में मदद की।
हम नीचे स्टेप वॉल-क्लॉक समय प्लॉट करते हैं। यह रोलआउट समय का प्रभुत्व है जो RL के दौरान बढ़ता है क्योंकि एजेंट अधिक गहन हो जाता है और उप-एजेंटों की बड़ी लहरें भेजता है।

चित्र A2: 40-चरणीय रन के लिए प्रति RL प्रशिक्षण चरण वॉल-क्लॉक मिनट, 5-चरणीय रोलिंग माध्य के साथ। चरण 2–10 औसत 48 मिनट और चरण 31–40 औसत 74 मिनट; वृद्धि प्रशिक्षित मॉडल द्वारा प्रति रोलआउट अधिक उप-एजेंट भेजने से आती है।





