針對端到端 M&A 盡職調查的訓練後 RLM Agent

@nikogrupen
英語2026年9月08日
193K
218
21
11
335

TL;DR

Harvey 研究人員揭示了訓練後遞迴式語言模型 Agent 如何處理 80M tokens 的 M&A 盡職調查資料,將準確率從 29% 提升至 63%。

文章連結:https://www.harvey.ai/blog/post-training-rlm-agents-for-m-and-a-diligence

在我們最近的 Harvey Tenet 研究預覽 中,我們強調了模型與框架協同優化對於解決複雜、端到端的法律任務的重要性,並預覽了在 M&A 盡職調查上的初步結果,該單一任務需要遍歷高達 8000 萬個 token 的文件上下文。今天,我們將分享持續實驗的最新結果。

我們與 Baseten 合作,為 M&A 盡職調查建立了一個遞迴語言模型(RLM)框架。在我們的 RLM 公式中,完整的資料室會被載入到一個 Python REPL 中,然後一個根 Agent 會將有範圍限制的審查與分析工作,委派給在其各自上下文視窗內運作的子 Agent。在 LAB Diligence 任務上,這個框架在我們評估的七個模型中,平均將評分標準通過率提升了 39.1 個百分點。

我們發現,在 RLM 框架內進行後訓練能帶來進一步的性能提升,並提供在品質與效率之間取得平衡的選項。我們透過強化學習對一個 Qwen3.5-122B-A10B 協調器進行了後訓練,結果發現,在 50 個保留的 LAB Diligence 資料室中,後訓練將評分標準通過率從 29.9% 提升到了 63.0%。

Niko - inline image

圖 1:在 LAB Diligence 上,基礎模型在標準工具循環框架、編碼 Agent 在其自有框架,以及模型在我們的 RLM 框架中的平均標準通過率。星號標記了 GLM-5.2 在 SFT 前後的匹配結果,並在一個獨立的 20 個資料室保留集上進行評估。所有其他結果均使用 50 個資料室的保留集。

這些結果表明,在特定任務的框架內進行後訓練,是處理文件密集型法律工作(如 M&A 盡職調查)的一條實用途徑,並且在 RLM 框架內擴展 RL 是未來工作的一個有前景的方向。為此,我們也正在訓練 GLM-5.3(一個大型前沿開放權重模型),作為正在進行的規模化實驗中的根模型。

在本文的其餘部分,我們將更詳細地描述我們評估的 LAB Diligence 環境、我們的方法論以及後訓練實驗。

M&A 盡職調查的環境

我們最近推出了 LAB Diligence,這是 LAB 的擴展,包含了用於 M&A 盡職調查的合成環境。LAB Diligence 中的一個資料室包含多達 5,000 份文件,按類別組織在數十個資料夾中,總上下文多達 8000 萬個 token。

Niko - inline image

圖 2:一個 LAB Diligence 資料室範例。Aravon Bridge Bank 包含 2,270 份文件,分布在 14 個類別的 82 個資料夾中,總計 3100 萬個 token。Agent 為此任務撰寫的盡職調查備忘錄將根據 571 條評分標準進行評分。

在該資料室中,Agent 的任務是產出一份完整的盡職調查備忘錄,內容需包含附有文件引用的調查結果、相關的量化風險敞口,以及為該交易建議的後續步驟。一個 LLM 評審會根據一份包含數百條通過/不通過標準的專家評分量表,對這份盡職調查備忘錄進行評分。上述的 Aravon Bridge Bank 範例總共有 571 條評分標準。

Niko - inline image

圖 3:LAB Diligence 中 Aravon Bridge Bank 任務的評分標準範例,每種類型各附有一條逐字標準。

盡職調查所需的證據分散在整個資料室中。有些調查結果需要結合多份文件才能得出,而另一些則需要檢查是否缺少佐證資料。在我們的基準測試運行中,Agent 會選擇性地進行搜尋和閱讀,導致資料室的大部分內容未被檢視。這些任務需要一個能夠將審查工作分配到許多有範圍限制的上下文中,並最終匯總調查結果的框架。

用於 M&A 盡職調查的 RLM 框架

為了建立基準,我們從 Legal Agent Bench 的標準工具循環框架開始。在此框架中,基礎模型在 50 個保留的資料室中平均通過了 23.3% 的評分標準,並且沒有任何模型能在任何一個資料室中通過所有標準。

Niko - inline image

圖 4:在 50 個保留的盡職調查資料室中,標準工具循環框架下的平均標準通過率。

這些結果表明任務與框架之間存在不匹配。一個 LAB Diligence 資料室太大,無法放入單一模型的上下文中,但大部分的初步審查可以按類別進行劃分。然後,根模型可以跨類別整合調查結果以產出備忘錄。律師事務所內的交易團隊也以類似的方式劃分盡職調查工作。

Niko - inline image

圖 5:深度為 1 的 RLM 框架。資料室作為可查詢的變數載入到 Python REPL 中。根 Agent 透過程式碼對其進行操作,並將有範圍限制的閱讀任務委派給子 Agent,子 Agent 將其調查結果作為 REPL 變數返回。只有根 Agent 列印的輸出會進入其上下文視窗,因此根 Agent 永遠不會持有整個資料室。

這引導我們探索將 RLM 作為 M&A 盡職調查的框架。在 RLM 框架中,根 Agent 會獲得一個 Python REPL,其中資料室已作為可查詢的變數載入,這使其能夠以程式化方式搜尋語料庫。根 Agent 負責規劃和界定審查範圍,並將子任務分派給子 Agent。每個子 Agent 會收到語料庫的一個有範圍限制的切片以及根 Agent 的指令,在其自己的上下文視窗內工作,並將其調查結果作為 REPL 變數返回。除非另有說明,以下實驗使用單層子 Agent,並且在實踐中,根 Agent 會並行分派許多呼叫。

Niko - inline image

圖 6:七個模型在標準工具循環框架中以及作為 RLM 框架(深度為 1,Qwen3.6-35B-A3B 子 Agent)的根模型時,在 50 個資料室保留集上的平均標準通過率。

在七個模型中,RLM 框架將平均通過率從 23.3% 提升到了 62.4%,提升了 39.1 個百分點。我們還運行了兩個停用網路工具的通用編碼 Agent:Claude Code(搭配 Opus-5)和 Codex(搭配 GPT-5.6 Sol),使用了與工具循環框架相同的簡潔指令。Claude Code 通過了 24.6% 的標準,Codex 通過了 12.0%,分別比相同模型在工具循環框架中的表現低了 17.9 和 4.6 個百分點。在軌跡記錄中,這兩個 Agent 都過早停止閱讀並撰寫了較短的備忘錄,並且儘管有能力,但都沒有產生子 Agent。

覆蓋率與成本

RLM 框架大幅增加了成為 Agent 上下文的有用內容量。我們透過探針來估算覆蓋率,該探針衡量資料室內容中到達框架內任何模型(根 Agent 或子 Agent)的比例。在標準工具循環框架中,沒有任何一次運行讀取了超過 1% 的資料室內容,大多數運行僅讀取了 0.1% 到 0.5%。在 RLM 框架中,幾乎每次運行都讀取了超過 10% 的資料室內容,大多數運行讀取了接近全部的內容。在此範圍內,較高的覆蓋率與較高的評分標準通過率相關聯。

Niko - inline image

圖 7:評分標準通過率與基於探針的覆蓋率關係圖,每個點代表一次運行,涵蓋了 LAB Diligence 中 50 個保留資料室上每個框架中的七個模型。覆蓋率採用對數尺度。

如圖 8 所示,轉向 RLM 框架會提高七個基準模型中六個模型每個資料室的生成成本。Claude Opus 5 是個例外。在工具循環框架中,它獨自閱讀每個資料室花費約 18 美元;而作為 RLM 根模型,它花費約 7 美元,得分卻高出 35 分。

Niko - inline image

圖 8:七個模型在每個框架中的平均標準通過率與每個資料室的生成成本關係圖,數據為 50 個保留資料室的平均值。虛線連接了跨框架的相同模型。成本是基於快取感知的估算,採用列表價格和對數尺度。

分工

為了檢驗性能在多大程度上取決於根 Agent 與子 Agent,我們將四個根模型與三個 Qwen 子 Agent 模型配對,在 30 個保留的資料室上進行了測試(參見圖 9)。在所測試的配置中,更換根模型的影響更大。在固定子 Agent 模型並更換根模型的情況下,得分最高與最低的根模型之間的平均差距約為 38 個百分點。在固定根模型並更換子 Agent 的情況下,子 Agent 模型之間的相應平均差距約為 8 個百分點(圖 9b)。

Niko - inline image

圖 9:RLM 框架中的分工情況,匯總了四個根模型和三個子 Agent 模型在 30 個保留資料室上的結果。(a) 根模型在輸入和輸出 token 中的佔比,按子 Agent 選擇取平均。(b) 得分最高與最低的根模型之間的差距(按子 Agent 選擇取平均),以及子 Agent 之間的相應差距(按根模型取平均)。

這個差異值得注意,因為在 RLM 框架中,我們觀察到根模型僅佔 Agent 總 token 使用量的少數。例如,在使用 Opus 5 進行協調時,根模型佔了 3.8% 的輸入 token 和 1.1% 的輸出 token(參見圖 9a)。子 Agent 處理了大部分文本,而根模型則決定如何劃分審查工作並匯總調查結果。

Niko - inline image

圖 10:四個根模型與三個子 Agent 模型配對時,在 30 個保留資料室上的平均標準通過率。

這些結果表明,在此設置中,改善協調是一個重要的機會,因此我們將初步的後訓練實驗重點放在根模型上。

在 RLM 框架中進行後訓練

上述結果指出根 Agent 是後訓練的目標。在本節中,我們報告在 RLM 框架內對開放權重根模型進行後訓練的結果。

自我蒸餾 SFT

首先,我們使用拒絕取樣自我蒸餾 SFT 對一個 GLM-5.2 根模型進行了後訓練。此實驗使用了一個與其他地方報告的 50 個資料室評估不同的、獨立的 20 個資料室保留評估集。其在此保留集上的匹配基礎模型得分為 46.1%,低於圖 6 在更大保留集上報告的 65.4% 的 GLM-5.2 結果。

基礎 GLM-5.2 無法開箱即用地穩定執行高分策略——經常出現性能崩潰的情況,例如基礎模型作為根 Agent 時過早放棄、委派不足,或未能將子 Agent 的輸出轉化為強有力的交付成果。鑑於一個強有力的策略已經存在於模型的分佈中,但需要使其更加穩健,我們使用拒絕取樣自我蒸餾來將 GLM-5.2 的分佈銳化到期望的模式。我們選擇了具有高資料室覆蓋率的成功 GLM-5.2 運行,並在這些軌跡上對根模型進行了微調。

Niko - inline image

圖 11:GLM-5.2 作為 RLM 根模型,在拒絕取樣自我蒸餾 SFT 前後的表現,在一個獨立的 20 個資料室保留集上進行評估。這些是 SFT 實驗內的匹配結果,而非圖 6 中使用的 50 個資料室評估。

在此 20 個資料室的保留集上,經過 SFT 訓練的根模型得分為 60.1%,而基礎模型為 46.1%(參見圖 11)。對後訓練 Agent 軌跡的審查表明,訓練有助於根 Agent 全面審查資料室,並將更高比例的子 Agent 調查結果納入最終備忘錄。

表 1 總結了我們在後訓練後觀察到的其他行為變化。最值得注意的是,子 Agent 呼叫量與資料室大小之間的相關性從 0.17 上升到 0.84,這表明經過訓練的根 Agent 會根據資料室的大小來調整其委派規模。經過訓練的根 Agent 也學會了在子 Agent 仍在閱讀時就開始撰寫備忘錄,這與我們在 RL 運行中發現的情況類似。

Niko - inline image

表 1:GLM-5.2 根模型在 SFT 前後的行為,在獨立的 20 個資料室保留集上取平均。覆蓋率為百分比;最後一行是相關係數。

構成一個強大盡職調查根 Agent 的行為,例如詳盡的委派,可以從相對少量的在策略軌跡中學習到,無需特權資訊,也無需標記的法律知識。在這裡,自我蒸餾之所以有效,是因為良好的行為已經存在於模型的分佈中,而訓練則將其穩定下來。

這個實驗激勵我們探索基於 RL 的後訓練,試圖將模型推向超越其現有分佈的範圍,直接透過任務的獎勵來引發新的行為。

強化學習

對於強化學習,我們從一個較小的根模型 Qwen3.5-122B-A10B 開始,以保持初始 RL 實驗循環易於處理。

我們使用 GRPO 訓練 RLM 根模型,以經評審的評分標準通過率作為獎勵,並固定子 Agent 模型(每個子 Agent 都是 Qwen3.6-35B-A3B 模型)。在 40 個訓練步驟中,我們發現平均展開通過率從約 23% 上升到約 56%。在 50 個資料室的保留集上,最終檢查點的得分為 63.0%,而基礎模型為 29.9%。

Niko - inline image

圖 12:對 Qwen3.5-122B-A10B 根模型(固定 Qwen3.6-35B-A3B 子 Agent)進行強化學習。(a) 在 40 個訓練步驟中,每個步驟的平均展開標準通過率。(b) 基礎模型與最終檢查點在 50 個資料室保留集上的表現。

RL 之後,平均資料室覆蓋率從 62% 上升到 96%,儘管覆蓋率並非明確的獎勵項。基礎運行分佈在整個覆蓋率範圍內,其中一個低於 20% 的集群得分接近於零。每個經過 RL 訓練的運行都讀取了超過 60% 的資料室內容,大多數讀取了全部內容。

Niko - inline image

圖 13:Qwen3.5-122B-A10B 根模型在 RL 前後,在 50 個資料室保留集上的標準通過率與基於探針的覆蓋率關係圖,每個點代表一次運行。

後訓練的根模型每個資料室發出的子 Agent 呼叫增加了 64%。RL 對委派量的改變也比 SFT 更大,分別為 64% 和 29%。

Niko - inline image

表 2:Qwen3.5-122B-A10B 根模型在 RL 前後的行為,在 50 個資料室保留集上取平均。

在後訓練之前,Qwen 根 Agent 嘗試一次性撰寫其盡職調查備忘錄,並且僅在所有子 Agent 返回之後才開始。在 RL 後訓練期間,它學會了一種更有效率的方法,即增量式地撰寫備忘錄,並將章節撰寫與審查子 Agent 的工作交織進行。

使用 GLM-5.3 擴展 RL

為了大規模測試我們的 RL 配方,我們現在正在訓練 GLM-5.3 作為 RLM 根模型,採用相同的 GRPO 風格配置:以經評審的標準通過率作為獎勵,固定 Qwen3.6-35B-A3B 子 Agent,對根模型使用 LoRA,組大小為 8,批次大小為 24。GLM-5.3 的展開起點遠高於 Qwen 根模型的起點,因此提升空間較小。在步驟 0 到 20(圖 14)中,平均展開通過率從約 51% 上升到約 59%(取所示前八個和後八個步驟的平均值),並伴隨著在此批次大小下預期的步驟間噪聲。

Niko - inline image

圖 14:正在進行的 GLM-5.3 RL 運行的早期訓練進展,固定 Qwen3.6-35B-A3B 子 Agent。圖中顯示了在 20 個訓練步驟過程中平均展開標準通過率的變化。灰色顯示每個步驟的原始值;黑色顯示指數移動平均值。此圖報告的是訓練分數,而非保留集的表現。

下一步計劃

RLM 框架改善了我們測試的所有模型的性能,而 RL 則在該框架內為 Qwen 根模型帶來了進一步的提升。然而,這些分數與我們正在努力達到的近乎完美的通過率之間仍存在著相當大的差距。

上述詳細介紹的訓練實驗是初步探索。除了完成規模化的 GLM-5.3 訓練運行之外,我們還將探索 SFT 和 RL 的組合,以及訓練子 Agent。RLM 框架將根模型的協調工作與子 Agent 的閱讀工作分離開來,因此每個部分都可以獨立訓練或聯合訓練,包括訓練子 Agent 進行逐級委派的設置。

最後,這裡的核心發現——模型與框架的協同優化可以在長週期環境中顯著提升 Agent 性能——並非盡職調查所獨有。我們正在探索將相同的框架結構和訓練方法應用於其他長上下文法律工作的途徑。

附錄

RLM 遞迴深度

我們也測試了增加另一層委派是否會提升性能。在深度為 1 時,子 Agent 返回純 LLM 補全結果,沒有自己的工具或委派能力。在深度為 2 時,子 Agent 會獲得一個 Python REPL 並可以進一步委派。在每個實驗中,我們對根模型和所有子 Agent 使用了相同的模型。

我們評估了 GLM-5.2 和 Qwen3.5-122B-A10B。許多 GLM-5.2 深度為 2 的運行未能在時間限制內完成,因此我們在下面報告 Qwen 的結果。在 14 個資料室中,深度為 2 在四個資料室上提高了分數,在十個資料室上降低了分數,使平均標準通過率降低了 19 個百分點(圖 A2)。在十個性能下降的案例中,有四個案例中深度為 2 的 Agent 讀取了資料室內容,但從未產出報告。

Niko - inline image

圖 A1:14 個資料室在深度為 1 和深度為 2 時的每個資料室標準通過率。我們固定模型,比較了使用純補全的子 Agent 與可以使用 REPL 並進行委派的子 Agent。在十個性能下降的案例中,有四個案例中深度為 2 的運行讀取了資料室,但從未撰寫報告。

這些結果促使我們在初步的後訓練實驗中使用深度為 1。專門訓練 Agent 進行更深層次的委派是否能讓額外的層級變得有用,仍然是一個開放性問題。

RL 基礎設施

RL,尤其是在如此長的回合長度下,既是訓練訊號問題,也是基礎設施問題。對於此任務,單一回合的展開可能需要一個小時或更長的實際時間才能完成。為了優化訓練的實際時間,我們應用了非同步離策略推理、連續推理批次處理、過度取樣和飛行中權重更新等方法。應用了選擇性 token 遮罩和與非同步相關的上限來控制離策略性的影響。考慮到在 RLM 框架中,大部分實際時間都花在等待子 Agent 完成上,使用小型快速的子 Agent 的能力大大加快了 RL 訓練過程。

我們在下方繪製了每個步驟的實際時間。該時間主要由展開時間主導,而展開時間會隨著 RL 的進行而增長,因為 Agent 變得更加徹底,並發出更大規模的子 Agent 浪潮。

Niko - inline image

圖 A2:40 步運行的每個 RL 訓練步驟的實際時間(分鐘),附帶 5 步滾動平均值。步驟 2–10 平均為 48 分鐘,步驟 31–40 平均為 74 分鐘;時間的增加來自於訓練後的模型在每次展開中分派了更多的子 Agent。

一鍵儲存

使用 YouMind AI 深度閱讀爆款文章

保存原文、追問細節、總結觀點,並在一個 AI 工作空間裡把爆款文章沉澱成可複用筆記。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章