Посттренинговые RLM-агенты для комплексной проверки при слияниях и поглощениях (M&A)

@nikogrupen
АНГЛИЙСКИЙ08 сент. 2026 г.
193K
218
21
11
335

Суть

Исследователи Harvey раскрывают, как посттренинговые рекурсивные языковые модели (RLM) могут обрабатывать 80 млн токенов для проверки при сделках M&A, повышая точность с 29% до 63%.

Ссылка на статью: https://www.harvey.ai/blog/post-training-rlm-agents-for-m-and-a-diligence

В нашем недавнем предварительном обзоре исследований для Harvey Tenet мы подчеркнули важность совместной оптимизации модели и обвязки для решения сложных, сквозных юридических задач и представили первые результаты по комплексной проверке M&A, где для выполнения одной задачи требуется обработать до 80 миллионов токенов документального контекста. Сегодня мы делимся обновленными результатами наших дальнейших экспериментов.

Совместно с Baseten мы создали рекурсивную языковую модель (RLM) для комплексной проверки M&A. В нашей формулировке RLM полное хранилище данных загружается в Python REPL, а корневой агент делегирует ограниченный обзор и анализ субагентам, которые работают в своих собственных контекстных окнах. На задачах LAB Diligence эта обвязка повышает средний процент прохождения критериев рубрики на 39,1 процентных пункта для семи протестированных моделей.

Мы обнаружили, что дообучение в рамках обвязки RLM дает дополнительный прирост производительности и возможности для выбора между качеством и эффективностью. Мы дообучили оркестратор Qwen3.5-122B-A10B с помощью обучения с подкреплением и обнаружили, что дообучение повысило процент прохождения критериев рубрики с 29,9% до 63,0% на 50 отложенных хранилищах данных LAB Diligence.

Niko - inline image

Рисунок 1: Средний процент прохождения критериев в LAB Diligence для базовых моделей в стандартной обвязке инструментального цикла, кодирующих агентов в их собственных обвязках и моделей в нашей обвязке RLM. Звездочками отмечены соответствующие результаты GLM-5.2 до и после SFT, оцененные на отдельном отложенном наборе из 20 хранилищ. Все остальные результаты используют отложенный набор из 50 хранилищ.

Эти результаты позволяют предположить, что дообучение в рамках специфичной для задачи обвязки является практичным путем для юридической работы с интенсивным использованием документов, такой как комплексная проверка M&A, и что масштабирование RL в рамках обвязки RLM является многообещающим направлением для будущих исследований. По этой причине мы также обучаем GLM-5.3, большую фронтирную модель с открытым весом, в качестве корневой модели в текущем эксперименте по масштабированию.

В остальной части этого поста мы более подробно описываем среды LAB Diligence, которые мы оценивали, нашу методологию и эксперименты по дообучению.

Среды для комплексной проверки M&A

Недавно мы представили LAB Diligence, расширение LAB, которое включает синтетические среды для комплексной проверки M&A. Одно хранилище данных в LAB Diligence содержит до 5000 документов, организованных в десятки папок по категориям, и до 80 миллионов токенов общего контекста.

Niko - inline image

Рисунок 2: Пример хранилища данных LAB Diligence. Aravon Bridge Bank содержит 2270 документов в 82 папках по 14 категориям, всего 31 миллион токенов. Меморандум агента по комплексной проверке для этой задачи оценивается по 571 критерию рубрики.

Работая в этом хранилище данных, агент должен составить полный меморандум по комплексной проверке, включая свои выводы со ссылками на документы, количественную оценку рисков, где это уместно, и рекомендуемые следующие шаги для сделки. Судья LLM оценивает меморандум по экспертной рубрике, содержащей сотни критериев прохождения или непрохождения. Пример Aravon Bridge Bank содержит в общей сложности 571 критерий рубрики.

Niko - inline image

Рисунок 3: Примеры рубрик для задачи Aravon Bridge Bank в LAB Diligence с одним дословным критерием каждого типа.

Доказательства, необходимые для комплексной проверки, распределены по хранилищу данных. Некоторые выводы требуют объединения нескольких документов, в то время как другие требуют проверки отсутствия подтверждающих доказательств. В наших базовых прогонах агенты искали и читали выборочно, оставляя большую часть хранилища данных неисследованной. Эти задачи требуют обвязки, которая может распределить обзор по множеству ограниченных контекстов и собрать результаты воедино.

Обвязка RLM для комплексной проверки M&A

Чтобы установить базовый уровень, мы начали со стандартной обвязки инструментального цикла из Legal Agent Bench. В этой обвязке базовые модели в среднем проходят 23,3% критериев рубрики по 50 отложенным хранилищам данных, и ни одна модель не проходит все критерии ни в одном хранилище данных.

Niko - inline image

Рисунок 4: Средний процент прохождения критериев в стандартной обвязке инструментального цикла по 50 отложенным хранилищам данных комплексной проверки.

Эти результаты указывают на несоответствие между задачей и обвязкой. Хранилище данных LAB Diligence слишком велико, чтобы поместиться в контекст одной модели, но большая часть первоначального обзора может быть разделена по категориям. Затем корневой агент может объединить результаты по категориям, чтобы составить меморандум. Команды сделок в юридических фирмах распределяют работу по комплексной проверке аналогичным образом.

Niko - inline image

Рисунок 5: Обвязка RLM на глубине 1. Хранилище данных загружается в Python REPL в виде запрашиваемых переменных. Корневой агент работает с ним в коде и делегирует задачи ограниченного чтения субагентам, которые возвращают свои результаты в виде переменных REPL. Только вывод, который выводит корневой агент, попадает в его контекстное окно, поэтому корневой агент никогда не удерживает полное хранилище данных.

Это привело нас к исследованию RLM в качестве обвязки для комплексной проверки M&A. В обвязке RLM корневой агент получает Python REPL с хранилищем данных, загруженным в виде запрашиваемых переменных, что позволяет ему программно искать в корпусе. Корневой агент планирует и определяет объем обзора и распределяет подзадачи субагентам. Каждый субагент получает ограниченный фрагмент корпуса и инструкции от корневого агента, работает в своем собственном контекстном окне и возвращает свои результаты в виде переменных REPL. В приведенных ниже экспериментах используется один уровень субагентов, если не указано иное, и на практике корневой агент отправляет много вызовов параллельно.

Niko - inline image

Рисунок 6: Средний процент прохождения критериев для семи моделей в стандартной обвязке инструментального цикла и в качестве корня обвязки RLM (глубина 1, субагенты Qwen3.6-35B-A3B), на отложенном наборе из 50 хранилищ.

Для семи моделей обвязка RLM повышает средний процент прохождения с 23,3% до 62,4%, что составляет прирост на 39,1 процентных пункта. Мы также запустили два универсальных кодирующих агента с отключенными веб-инструментами, Claude Code с Opus-5 и Codex с GPT-5.6 Sol, используя те же минимальные инструкции, что и в обвязке инструментального цикла. Claude Code проходит 24,6% критериев, а Codex — 12,0%, что ниже, чем у тех же моделей в обвязке инструментального цикла, на 17,9 и 4,6 пункта соответственно. В трассировках оба агента рано прекращают чтение и пишут более короткие меморандумы, и ни один из них не порождает субагентов, несмотря на наличие такой возможности.

Охват и стоимость

Обвязка RLM значительно увеличивает объем полезного контента, который становится контекстом агента. Мы оцениваем охват с помощью зондов, которые измеряют долю содержимого хранилища данных, попадающую в любую модель в обвязке, корневую или субагента. В стандартной обвязке инструментального цикла ни один прогон не читает более 1% хранилища данных, а большинство читает от 0,1% до 0,5%. В обвязке RLM почти каждый прогон читает более 10% хранилища данных, а большинство читает почти все. Более высокий охват связан с более высокими показателями прохождения критериев рубрики в этом диапазоне.

Niko - inline image

Рисунок 7: Процент прохождения критериев рубрики в зависимости от зондового охвата, одна точка на прогон, для семи моделей в каждой обвязке по 50 отложенным хранилищам данных из LAB Diligence. Охват показан в логарифмическом масштабе.

Переход на обвязку RLM увеличивает стоимость генерации на одно хранилище данных для шести из семи базовых моделей, как показано на рисунке 8. Claude Opus 5 является исключением. В обвязке инструментального цикла он тратит ~18 долларов на хранилище данных, читая самостоятельно; в качестве корня RLM он тратит ~7 долларов и набирает на 35 пунктов выше.

Niko - inline image

Рисунок 8: Средний процент прохождения критериев в зависимости от стоимости генерации на одно хранилище данных для семи моделей в каждой обвязке, усредненный по 50 отложенным хранилищам данных. Пунктирные линии соединяют одну и ту же модель в разных обвязках. Стоимость представляет собой оценку с учетом кэша по прейскурантным ценам, логарифмическая шкала.

Разделение труда

Чтобы изучить, насколько производительность зависит от корневого агента по сравнению с субагентами, мы объединили четыре корневые модели с тремя моделями субагентов Qwen в 30 отложенных хранилищах данных (см. Рисунок 9). В протестированных конфигурациях изменение корневого агента имело больший эффект. При фиксированной модели субагента и варьировании корневой модели разрыв между корневыми агентами с самым высоким и самым низким баллом составлял в среднем около 38 процентных пунктов. При фиксированном корневом агенте и варьировании субагентов соответствующий разрыв между моделями субагентов составлял в среднем около 8 пунктов (Рисунок 9b).

Niko - inline image

Рисунок 9: Разделение труда в обвязке RLM, агрегированное по четырем корневым моделям и трем моделям субагентов в 30 отложенных хранилищах данных. (a) Доля корневого агента во входных и выходных токенах, усредненная по выбору субагентов. (b) Разрыв между корневыми агентами с самым высоким и самым низким баллом, усредненный по выбору субагентов, и соответствующий разрыв между субагентами, усредненный по корневым агентам.

Это различие примечательно, потому что в обвязке RLM мы наблюдаем, что на корневой агент приходится меньшинство общего использования токенов агентом. Например, при оркестровке Opus 5 на корневой агент приходится 3,8% входных токенов и 1,1% выходных токенов (см. Рисунок 9a). Субагенты обрабатывают большую часть текста, в то время как корневой агент решает, как разделить обзор и собрать результаты.

Niko - inline image

Рисунок 10: Средний процент прохождения критериев для четырех корневых моделей в паре с тремя моделями субагентов в 30 отложенных хранилищах данных.

Эти результаты позволяют предположить, что улучшение координации является важной возможностью в этой установке, поэтому мы сосредоточили наши первоначальные эксперименты по дообучению на корневом агенте.

Дообучение в обвязке RLM

Приведенные выше результаты указывают на корневой агент как на цель для дообучения. В этом разделе мы сообщаем результаты дообучения корневых моделей с открытым весом внутри обвязки RLM.

SFT с самодистилляцией

Во-первых, мы дообучили корневой агент GLM-5.2, используя SFT с самодистилляцией на основе отклоняющей выборки. В этом эксперименте используется другой оценочный набор из 20 отложенных хранилищ, отличный от оценки на 50 хранилищах, о которой сообщается в других местах. Соответствующий базовый показатель модели на этом отложенном наборе составляет 46,1%, что ниже результата GLM-5.2 в 65,4%, о котором сообщалось на Рисунке 6 по большему отложенному набору.

Базовая GLM-5.2 нестабильно выполняет высокорезультативную политику «из коробки» — часто случаются коллапсы производительности, когда базовая модель, действуя как корневой агент, сдается рано, недостаточно делегирует или не может преобразовать результаты субагентов в качественный результат. Учитывая, что сильная политика уже находится в распределении модели, но ее необходимо сделать более надежной, мы используем SFT с самодистилляцией на основе отклоняющей выборки, чтобы сузить распределение GLM-5.2 до желаемого режима. Мы отобрали успешные прогоны GLM-5.2 с высоким охватом хранилища данных и дообучили корневой агент на этих траекториях.

Niko - inline image

Рисунок 11: GLM-5.2 в качестве корня RLM до и после SFT с самодистилляцией на основе отклоняющей выборки, оцененная на отдельном отложенном наборе из 20 хранилищ. Это соответствующие результаты в рамках эксперимента SFT, а не оценка на 50 хранилищах, используемая на Рисунке 6.

На этом отложенном наборе из 20 хранилищ корневой агент, обученный с помощью SFT, набирает 60,1% против 46,1% у базовой модели (см. Рисунок 11). Анализ трассировок дообученного агента показывает, что обучение помогает корневому агенту всесторонне просматривать хранилище данных и переносить больший процент результатов субагентов в итоговый меморандум.

В Таблице 1 обобщены другие изменения в поведении, которые мы наблюдаем после дообучения. Наиболее заметно, что корреляция между количеством вызовов субагентов и размером хранилища данных возрастает с 0,17 до 0,84, что указывает на то, что обученный корневой агент масштабирует свое делегирование в зависимости от размера хранилища данных. Обученный корневой агент также учится начинать писать меморандум, пока субагенты еще читают, аналогично тому, что мы обнаружили в наших прогонах RL.

Niko - inline image

Таблица 1: Поведение корневого агента GLM-5.2 до и после SFT, усредненное по отдельному отложенному набору из 20 хранилищ. Охват указан в процентах; последняя строка представляет собой коэффициент корреляции.

Поведение, которое делает корневого агента сильным в комплексной проверке, такое как исчерпывающее делегирование, может быть изучено на относительно небольшом количестве он-политик траекторий, без привилегированной информации и без размеченных юридических знаний. Здесь самодистилляция эффективна, потому что хорошее поведение уже существует в распределении модели, и обучение его стабилизирует.

Этот эксперимент побудил нас исследовать дообучение на основе RL как попытку вывести модель за пределы ее распределения, вызывая новое поведение непосредственно через вознаграждение за задачу.

Обучение с подкреплением

Для обучения с подкреплением мы начали с меньшей корневой модели, Qwen3.5-122B-A10B, чтобы сделать начальный цикл эксперимента RL управляемым.

Мы обучили корневой агент RLM с помощью GRPO, используя оцененный процент прохождения критериев рубрики в качестве вознаграждения и фиксируя модели субагентов (субагенты были моделью Qwen3.6-35B-A3B). За 40 шагов обучения мы обнаружили, что средний процент прохождения развертывания вырос с примерно 23% до примерно 56%. На отложенном наборе из 50 хранилищ финальная контрольная точка набирает 63,0% против 29,9% у базовой модели.

Niko - inline image

Рисунок 12: Обучение с подкреплением на корневом агенте Qwen3.5-122B-A10B с фиксированными субагентами Qwen3.6-35B-A3B. (a) Средний процент прохождения критериев развертывания на каждом из 40 шагов обучения. (b) Базовая модель и финальная контрольная точка на отложенном наборе из 50 хранилищ.

После RL средний охват хранилища данных возрастает с 62% до 96%, хотя охват не является явным членом вознаграждения. Базовые прогоны распределены по всему диапазону охвата, с кластером ниже 20%, который набирает почти ноль. Каждый прогон, обученный с помощью RL, читает более 60% хранилища данных, и большинство читает все.

Niko - inline image

Рисунок 13: Процент прохождения критериев в зависимости от зондового охвата, одна точка на прогон, для корневого агента Qwen3.5-122B-A10B до и после RL на отложенном наборе из 50 хранилищ.

Дообученный корневой агент совершает на 64% больше вызовов субагентов на одно хранилище данных. RL также изменил объем делегирования больше, чем SFT, на 64% против 29%.

Niko - inline image

Таблица 2: Поведение корневого агента Qwen3.5-122B-A10B до и после RL, усредненное по отложенному набору из 50 хранилищ.

До дообучения корневой агент Qwen пытался написать свой меморандум по комплексной проверке за один раз и только после того, как все субагенты вернутся. Во время дообучения RL он изучает более эффективный подход, записывая меморандум постепенно и чередуя написание разделов с просмотром работы субагентов.

Масштабирование RL с GLM-5.3

Чтобы протестировать наш рецепт RL в масштабе, мы сейчас обучаем GLM-5.3 в качестве корня RLM с той же конфигурацией в стиле GRPO: оцененный процент прохождения критериев в качестве вознаграждения, фиксированные субагенты Qwen3.6-35B-A3B, LoRA на корневом агенте, размер группы 8 и размер пакета 24. Развертывания GLM-5.3 начинаются значительно выше, чем у корневого агента Qwen, поэтому запас для улучшения меньше. На шагах с 0 по 20 (Рисунок 14) средний процент прохождения развертывания возрастает с примерно 51% до примерно 59%, усредненный по первым и последним восьми показанным шагам, с ожидаемым при таком размере пакета пошаговым шумом.

Niko - inline image

Рисунок 14: Ранний прогресс обучения для текущего прогона RL GLM-5.3 с фиксированными субагентами Qwen3.6-35B-A3B. Показан средний процент прохождения критериев развертывания в течение 20 шагов обучения. Серым цветом показаны необработанные значения по шагам; черным — экспоненциальное скользящее среднее. На этом рисунке показаны результаты обучения, а не производительность на отложенном наборе.

Что дальше

Обвязка RLM повышает производительность всех протестированных нами моделей, а RL дает дополнительный прирост для корневого агента Qwen в рамках этой обвязки. Между этими показателями и почти идеальными показателями прохождения, к которым мы стремимся, все еще существует значительный разрыв.

Подробно описанные выше эксперименты по обучению являются начальными исследованиями. В дополнение к завершению масштабированного прогона обучения GLM-5.3, мы также изучим комбинации SFT и RL, а также обученных субагентов. Обвязка RLM отделяет оркестровку корневого агента от чтения субагентов, поэтому каждый из них может быть обучен самостоятельно или совместно, включая конфигурации, в которых субагенты обучаются делегировать, в свою очередь.

Наконец, ключевой вывод здесь, заключающийся в том, что совместная оптимизация модели и обвязки может значительно улучшить производительность агента в средах с длинным горизонтом, не является специфичным для комплексной проверки. Мы изучаем способы применения той же структуры обвязки и подхода к обучению к другой юридической работе с длинным контекстом.

Приложение

Глубина рекурсии RLM

Мы также проверили, улучшает ли производительность добавление еще одного уровня делегирования. На глубине 1 субагенты возвращают обычные завершения LLM, без инструментов или собственного делегирования. На глубине 2 субагенты получают Python REPL и могут делегировать дальше. В рамках каждого эксперимента мы использовали одну и ту же модель для корневого агента и всех субагентов.

Мы оценили как GLM-5.2, так и Qwen3.5-122B-A10B. Многие прогоны GLM-5.2 на глубине 2 не завершились в течение установленного времени, поэтому мы приводим результаты Qwen ниже. В 14 хранилищах данных глубина 2 улучшила показатели в четырех и снизила их в десяти, снизив средний процент прохождения критериев на 19 процентных пунктов (Рисунок A2). В четырех из десяти регрессий агент на глубине 2 читал содержимое хранилища данных, но так и не создал отчет.

Niko - inline image

Рисунок A1: Процент прохождения критериев на хранилище на глубине 1 и глубине 2 для 14 хранилищ данных. Мы зафиксировали модель и сравнили субагентов с обычным завершением с субагентами, которые могли использовать REPL и делегировать. В четырех из десяти регрессий прогон на глубине 2 читает хранилище данных, но никогда не пишет отчет.

Эти результаты побудили нас использовать глубину 1 для начальных экспериментов по дообучению. Остается открытым вопрос, может ли обучение агентов специально для более глубокого делегирования сделать дополнительные уровни полезными.

Инфраструктура RL

RL, особенно с такой большой длиной эпизода, является проблемой инфраструктуры не в меньшей степени, чем проблемой сигнала обучения. Для этой задачи развертывание одного эпизода могло занимать порядка часа или более астрономического времени. Чтобы оптимизировать астрономическое время обучения, мы применили такие методы, как асинхронный вывод вне политики, непрерывный пакетный вывод, передискретизацию и обновление весов на лету. Для контроля эффекта внеполитичности были применены селективное маскирование токенов и асинхронные ограничения. Учитывая, что в обвязке RLM большая часть астрономического времени тратится на ожидание завершения субагентов, возможность использовать маленьких быстрых субагентов значительно ускорила процесс обучения RL.

Ниже мы приводим график астрономического времени шага. В нем доминирует время развертывания, которое растет по ходу RL, поскольку агент становится более тщательным и отправляет более крупные волны субагентов.

Niko - inline image

Рисунок A2: Астрономические минуты на шаг обучения RL для 40-шагового прогона со скользящим средним по 5 шагам. Шаги 2–10 в среднем составляют 48 минут, а шаги 31–40 — в среднем 74 минуты; увеличение связано с тем, что обученная модель отправляет больше субагентов на одно развертывание.

Сохранение в один клик

Используйте YouMind для глубокого чтения вирусных статей с помощью ИИ

Сохраняйте источники, задавайте точные вопросы, обобщайте аргументы и превращайте вирусные статьи в полезные заметки в одном рабочем пространстве ИИ.

Исследовать YouMind
Для авторов

Превратите ваш Markdown в аккуратную статью для 𝕏

Когда вы публикуете длинные тексты, изображения, таблицы и блоки кода, форматирование в 𝕏 становится мучением. YouMind превращает полный черновик в Markdown в чистую статью, готовую к публикации в 𝕏.

Попробовать Markdown для 𝕏

Другие паттерны для анализа

Недавние виральные статьи

Смотреть другие виральные статьи