Ось перекладений текст українською мовою згідно з вашими інструкціями:
Посилання на статтю: https://www.harvey.ai/blog/post-training-rlm-agents-for-m-and-a-diligence
У нашому нещодавньому попередньому дослідженні для Harvey Tenet ми підкреслили важливість спільної оптимізації моделі та середовища для вирішення складних наскрізних юридичних завдань, а також представили попередні результати щодо комплексної перевірки (Due Diligence) при злиттях та поглинаннях (M&A), де одне завдання вимагає опрацювання до 80 мільйонів токенів документального контексту. Сьогодні ми ділимося оновленими результатами наших подальших експериментів.
Разом із Baseten ми створили середовище рекурсивної мовної моделі (RLM) для M&A Due Diligence. У нашій формулюванні RLM повне сховище документів (dataroom) завантажується в Python REPL, а кореневий агент делегує обмежені завдання з перегляду та аналізу підагентам, які працюють у межах власних контекстних вікон. На завданнях LAB Diligence це середовище підвищує середній показник проходження критеріїв рубрики на 39,1 відсоткового пункту для семи оцінених моделей.
Ми виявили, що пост-тренування в середовищі RLM дає додаткові переваги в продуктивності та можливості для навігації компромісами між якістю та ефективністю. Ми провели пост-тренування оркестратора Qwen3.5-122B-A10B за допомогою навчання з підкріпленням (RL) і виявили, що пост-тренування підвищило показник проходження критеріїв рубрики з 29,9% до 63,0% на 50 зарезервованих сховищах документів LAB Diligence.

Рисунок 1: Середній показник проходження критеріїв у LAB Diligence для базових моделей у стандартному середовищі інструментального циклу, кодуючих агентів у власних середовищах та моделей у нашому середовищі RLM. Зірочками позначені відповідні результати GLM-5.2 до та після SFT, оцінені на окремому наборі з 20 кімнат. Всі інші результати використовують набір з 50 кімнат.
Ці результати свідчать про те, що пост-тренування в межах середовища, специфічного для завдання, є практичним шляхом для інтенсивної роботи з документами, як-от M&A Due Diligence, і що масштабування RL у середовищі RLM є перспективним напрямком для майбутніх досліджень. З цієї причини ми також тренуємо GLM-5.3, велику фронтирну модель з відкритою вагою, як кореневу модель у поточному запуску масштабування.
У решті цього допису ми детальніше описуємо середовища LAB Diligence, які ми оцінювали, нашу методологію та експерименти з пост-тренуванням.
Середовища для M&A Due Diligence
Нещодавно ми представили LAB Diligence, розширення LAB, яке включає синтетичні середовища для M&A Due Diligence. Одне сховище документів у LAB Diligence містить до 5000 документів, організованих у десятки папок за категоріями, та до 80 мільйонів токенів загального контексту.

Рисунок 2: Приклад сховища документів LAB Diligence. Aravon Bridge Bank містить 2270 документів у 82 папках за 14 категоріями, загалом 31 мільйон токенів. Меморандум агента щодо комплексної перевірки для цього завдання оцінюється за 571 критерієм рубрики.
Працюючи в цьому сховищі документів, агент повинен створити повний меморандум щодо комплексної перевірки, включаючи свої висновки з посиланнями на документи, кількісну оцінку ризиків, де це доречно, та рекомендовані подальші кроки для транзакції. Суддя LLM оцінює меморандум щодо комплексної перевірки за експертною рубрикою, яка містить сотні критеріїв проходження або непроходження. Приклад Aravon Bridge Bank має загалом 571 критерій рубрики.

Рисунок 3: Приклади рубрик для завдання Aravon Bridge Bank у LAB Diligence, з одним дослівним критерієм кожного типу.
Докази, необхідні для комплексної перевірки, розподілені по всьому сховищу документів. Деякі висновки вимагають поєднання кількох документів, тоді як інші вимагають перевірки наявності підтверджуючих доказів. У наших базових запусках агенти шукали та читали вибірково, залишаючи більшу частину сховища документів недослідженою. Ці завдання потребують середовища, яке може розподілити перегляд між багатьма обмеженими контекстами та зібрати результати разом.
Середовище RLM для M&A Due Diligence
Щоб встановити базовий рівень, ми почали зі стандартного середовища інструментального циклу з Legal Agent Bench. У цьому середовищі базові моделі в середньому проходять 23,3% критеріїв рубрики на 50 зарезервованих сховищах документів, і жодна модель не проходить усі критерії в жодному сховищі документів.

Рисунок 4: Середній показник проходження критеріїв у стандартному середовищі інструментального циклу на 50 зарезервованих сховищах документів для комплексної перевірки.
Ці результати свідчать про невідповідність між завданням та середовищем. Сховище документів LAB Diligence занадто велике, щоб поміститися в контекст однієї моделі, але більшу частину початкового перегляду можна розділити за категоріями. Потім кореневий агент може об'єднати результати за категоріями, щоб створити меморандум. Команди угод у юридичних фірмах поділяють роботу з комплексної перевірки подібним чином.

Рисунок 5: Середовище RLM на глибині-1. Сховище документів завантажується в Python REPL як змінні, доступні для запитів. Кореневий агент працює з ним у коді та делегує обмежені завдання з читання підагентам, які повертають свої результати як змінні REPL. Лише вихідні дані, які виводить кореневий агент, потрапляють у його контекстне вікно, тому кореневий агент ніколи не утримує повне сховище документів.
Це привело нас до дослідження RLM як середовища для M&A Due Diligence. У середовищі RLM кореневий агент отримує Python REPL із завантаженим сховищем документів як змінними, доступними для запитів, що дозволяє йому програмно шукати в корпусі. Кореневий агент планує та визначає обсяг перевірки та відправляє підзавдання підагентам. Кожен підагент отримує обмежений фрагмент корпусу та інструкції від кореневого агента, працює у власному контекстному вікні та повертає свої результати як змінні REPL. Експерименти нижче використовують один шар підагентів, якщо не зазначено інше, і на практиці кореневий агент відправляє багато викликів паралельно.

Рисунок 6: Середній показник проходження критеріїв для семи моделей у стандартному середовищі інструментального циклу та як кореня середовища RLM (глибина-1, підагенти Qwen3.6-35B-A3B), на наборі з 50 зарезервованих кімнат.
Для семи моделей середовище RLM підвищує середній показник проходження з 23,3% до 62,4%, що становить приріст на 39,1 відсоткового пункту. Ми також запустили два універсальних кодуючих агенти з вимкненими веб-інструментами, Claude Code з Opus-5 та Codex з GPT-5.6 Sol, використовуючи ту саму мінімальну інструкцію, що й у середовищі інструментального циклу. Claude Code проходить 24,6% критеріїв, а Codex — 12,0%, що нижче, ніж у тих самих моделей у середовищі інструментального циклу, на 17,9 та 4,6 пункту відповідно. У трасах обидва агенти передчасно припиняють читання та пишуть коротші меморандуми, і жоден не породжує підагентів, незважаючи на наявність такої можливості.
Покриття та вартість
Середовище RLM значно збільшує обсяг корисного вмісту, який стає контекстом агента. Ми оцінюємо покриття за допомогою зондів, які вимірюють частку вмісту сховища документів, що потрапляє до будь-якої моделі в середовищі, кореневої чи підагента. У стандартному середовищі інструментального циклу жоден запуск не читає більше 1% сховища документів, і більшість читає від 0,1% до 0,5%. У середовищі RLM майже кожен запуск читає більше 10% сховища документів, і більшість читає майже все. Вище покриття пов'язане з вищими показниками проходження критеріїв рубрики в цьому діапазоні.

Рисунок 7: Показник проходження критеріїв рубрики проти покриття на основі зондів, одна точка на запуск, для семи моделей у кожному середовищі на 50 зарезервованих сховищах документів з LAB Diligence. Покриття наведено в логарифмічному масштабі.
Перехід на середовище RLM підвищує вартість генерації на одне сховище документів для шести з семи базових моделей, як показано на рисунку 8. Claude Opus 5 є винятком. У середовищі інструментального циклу він витрачає ~$18 на одне сховище документів, читаючи самостійно; як корінь RLM він витрачає ~$7 і набирає на 35 пунктів більше.

Рисунок 8: Середній показник проходження критеріїв проти вартості генерації на одне сховище документів для семи моделей у кожному середовищі, усереднено за 50 зарезервованими сховищами документів. Пунктирні лінії з'єднують ту саму модель у різних середовищах. Вартість — це оцінки з урахуванням кешу за прейскурантними цінами, логарифмічний масштаб.
Розподіл праці
Щоб дослідити, наскільки продуктивність залежить від кореневого агента порівняно з підагентами, ми об'єднали чотири кореневі моделі з трьома моделями підагентів Qwen на 30 зарезервованих сховищах документів (див. рисунок 9). У протестованих конфігураціях зміна кореневого агента мала більший ефект. Утримуючи модель піагента фіксованою та змінюючи кореневу модель, розрив між коренями з найвищим та найнижчим балами в середньому становив близько 38 відсоткових пунктів. Утримуючи корінь фіксованим та змінюючи підагентів, відповідний розрив між моделями підагентів у середньому становив близько 8 пунктів (рисунок 9b).

Рисунок 9: Розподіл праці в середовищі RLM, агрегований за чотирма кореневими моделями та трьома моделями підагентів на 30 зарезервованих сховищах документів. (a) Частка кореня у вхідних та вихідних токенах, усереднена за вибором підагентів. (b) Розрив між коренями з найвищим та найнижчим балами, усереднений за вибором підагентів, та відповідний розрив між підагентами, усереднений за коренями.
Ця різниця є помітною, оскільки в середовищі RLM ми спостерігаємо, що корінь становить меншість загального використання токенів агентом. Наприклад, з Opus 5 як оркестратором, корінь становить 3,8% вхідних токенів та 1,1% вихідних токенів (див. рисунок 9a). Підагенти обробляють більшу частину тексту, тоді як корінь вирішує, як розділити перевірку та зібрати результати.

Рисунок 10: Середній показник проходження критеріїв для чотирьох кореневих моделей у парі з трьома моделями підагентів на 30 зарезервованих сховищах документів.
Ці результати свідчать про те, що покращення координації є важливою можливістю в цій установці, тому ми зосередили наші початкові експерименти з пост-тренуванням на кореневому агенті.
Пост-тренування в середовищі RLM
Результати вище вказують на кореневого агента як на ціль для пост-тренування. У цьому розділі ми повідомляємо результати пост-тренування кореневих моделей з відкритою вагою в середовищі RLM.
SFT на основі самодистиляції з відхиленням
По-перше, ми провели пост-тренування кореня GLM-5.2 за допомогою SFT на основі самодистиляції з вибіркою відхилення. Цей експеримент використовує інший набір для оцінки з 20 зарезервованих кімнат, ніж оцінки на 50 кімнатах, про які повідомлялося в інших місцях. Його відповідний базовий бал моделі на цьому зарезервованому наборі становить 46,1%, що нижче за результат GLM-5.2 у 65,4%, про який повідомлялося на рисунку 6 для більшого зарезервованого набору.
Базова модель GLM-5.2 не стабільно виконує високоефективну політику "з коробки" — спостерігаються часті збої продуктивності, коли базова модель, діючи як кореневий агент, передчасно здається, недостатньо делегує або не може перетворити результати підагентів на якісний результат. Враховуючи, що сильна політика вже існує в розподілі моделі, але її потрібно зробити більш надійною, ми використовуємо SFT на основі самодистиляції з вибіркою відхилення, щоб звузити розподіл GLM-5.2 до бажаного режиму. Ми відібрали успішні запуски GLM-5.2 з високим покриттям сховища документів та доналаштували корінь на цих траєкторіях.

Рисунок 11: GLM-5.2 як корінь RLM до та після SFT на основі самодистиляції з вибіркою відхилення, оцінений на окремому наборі з 20 зарезервованих кімнат. Це відповідні результати в рамках експерименту SFT, а не оцінка на 50 кімнатах, яка використовувалася на рисунку 6.
На цьому зарезервованому наборі з 20 сховищ документів корінь, навчений за допомогою SFT, набирає 60,1% проти 46,1% для базової моделі (див. рисунок 11). Огляд трас агента після пост-тренування свідчить про те, що навчання допомагає кореневому агенту всебічно переглянути сховище документів та перенести більший відсоток результатів підагентів у остаточний меморандум.
Таблиця 1 підсумовує інші поведінкові зміни, які ми спостерігаємо після пост-тренування. Найбільш помітно, що кореляція між кількістю викликів підагентів та розміром сховища документів зростає з 0,17 до 0,84, що вказує на те, що навчений кореневий агент масштабує своє делегування відповідно до розміру сховища документів. Навчений корінь також вчиться починати писати меморандум, поки підагенти ще читають, подібно до того, що ми виявили в наших запусках RL.

Таблиця 1: Поведінка кореня GLM-5.2 до та після SFT, усереднена за окремим набором з 20 зарезервованих кімнат. Покриття наведено у відсотках; останній рядок — це коефіцієнт кореляції.
Поведінки, які роблять сильного кореневого агента для комплексної перевірки, такі як вичерпне делегування, можна вивчити з відносно невеликої кількості трас, отриманих за поточною політикою, без привілейованої інформації та без маркованих юридичних знань. Тут самодистиляція є ефективною, оскільки хороша поведінка вже існує в розподілі моделі, а навчання її стабілізує.
Цей експеримент спонукав нас дослідити пост-тренування на основі RL як спробу вивести модель за межі того, що є в її розподілі, викликаючи нову поведінку безпосередньо через винагороду завдання.
Навчання з підкріпленням
Для навчання з підкріпленням ми почали з меншої кореневої моделі, Qwen3.5-122B-A10B, щоб зробити початковий цикл експерименту RL керованим.
Ми навчали корінь RLM за допомогою GRPO, використовуючи оцінений показник проходження критеріїв рубрики як винагороду та утримуючи моделі підагентів фіксованими (підагенти були моделлю Qwen3.6-35B-A3B). Протягом 40 кроків навчання ми виявили, що середній показник проходження rollout зріс приблизно з 23% до приблизно 56%. На зарезервованому наборі з 50 кімнат остаточна контрольна точка набирає 63,0% проти 29,9% для базової моделі.

Рисунок 12: Навчання з підкріпленням на корені Qwen3.5-122B-A10B з фіксованими підагентами Qwen3.6-35B-A3B. (a) Середній показник проходження критеріїв rollout на кожному з 40 кроків навчання. (b) Базова модель та остаточна контрольна точка на зарезервованому наборі з 50 кімнат.
Після RL середнє покриття сховища документів зростає з 62% до 96%, хоча покриття не є явним терміном винагороди. Базові запуски розподілені по всьому діапазону покриття, з кластером нижче 20%, який набирає близько нуля. Кожен запуск, навчений за допомогою RL, читає більше 60% сховища документів, і більшість читає все.

Рисунок 13: Показник проходження критеріїв проти покриття на основі зондів, одна точка на запуск, для кореня Qwen3.5-122B-A10B до та після RL на зарезервованому наборі з 50 кімнат.
Корінь після пост-тренування робить на 64% більше викликів підагентів на одне сховище документів. RL також змінив обсяг делегування більше, ніж SFT: 64% проти 29%.

Таблиця 2: Поведінка кореня Qwen3.5-122B-A10B до та після RL, усереднена за набором з 50 зарезервованих кімнат.
До пост-тренування кореневий агент Qwen намагався написати свій меморандум щодо комплексної перевірки одним махом і лише після того, як усі підагенти повернулися. Під час пост-тренування RL він вивчає більш ефективний підхід, пишучи меморандум поступово та чергуючи написання розділів з переглядом роботи підагентів.
Масштабування RL з GLM-5.3
Щоб перевірити наш рецепт RL у масштабі, ми зараз тренуємо GLM-5.3 як корінь RLM з тією ж конфігурацією в стилі GRPO: оцінений показник проходження критеріїв як винагорода, фіксовані підагенти Qwen3.6-35B-A3B, LoRA на корені, розмір групи 8 та розмір пакету 24. Rollouts GLM-5.3 починаються значно вище, ніж там, де починався корінь Qwen, тому залишається менше простору для покращення. Протягом кроків 0–20 (рисунок 14) середній показник проходження rollout зростає приблизно з 51% до приблизно 59%, усереднений за першими та останніми вісьмома показаними кроками, з очікуваним для цього розміру пакету шумом від кроку до кроку.

Рисунок 14: Ранній прогрес навчання для поточного запуску RL GLM-5.3 з фіксованими підагентами Qwen3.6-35B-A3B. Середній показник проходження критеріїв rollout показано протягом 20 кроків навчання. Сірим показано необроблені значення на крок; чорним показано експоненціальне ковзне середнє. На цьому рисунку наведено навчальні бали, а не продуктивність на зарезервованому наборі.
Що далі
Середовище RLM покращує продуктивність усіх протестованих моделей, а RL дає додаткові переваги для кореня Qwen у цьому середовищі. Між цими балами та майже ідеальними показниками проходження, до яких ми прагнемо, все ще існує значний розрив.
Детально описані вище експерименти з навчанням є початковими дослідженнями. Окрім завершення масштабованого запуску навчання GLM-5.3, ми також дослідимо комбінації SFT та RL, а також навчених підагентів. Середовище RLM відокремлює оркестрацію кореня від читання підагентів, тому кожен можна навчати окремо або спільно, включаючи установки, в яких підагенти навчаються делегувати далі.
Нарешті, ключовий висновок тут, що спільна оптимізація моделі та середовища може значно покращити продуктивність агента в довгострокових середовищах, не є специфічним для комплексної перевірки. Ми досліджуємо способи застосування тієї ж структури середовища та підходу до навчання до іншої довгоконтекстної юридичної роботи.
Додаток
Глибина рекурсії RLM
Ми також перевірили, чи додавання ще одного рівня делегування покращує продуктивність. На глибині-1 підагенти повертають звичайні завершення LLM, без інструментів або власного делегування. На глибині-2 підагенти отримують Python REPL і можуть делегувати далі. У кожному експерименті ми використовували ту саму модель для кореня та всіх підагентів.
Ми оцінили як GLM-5.2, так і Qwen3.5-122B-A10B. Багато запусків GLM-5.2 на глибині-2 не завершилися в межах ліміту часу, тому ми наводимо результати Qwen нижче. На 14 сховищах документів глибина-2 покращила бали на чотирьох та знизила на десяти, знизивши середній показник проходження критеріїв на 19 відсоткових пунктів (рисунок A2). У чотирьох з десяти регресій агент на глибині-2 читав вміст сховища документів, але ніколи не створював звіт.

Рисунок A1: Показник проходження критеріїв на кімнату на глибині-1 та глибині-2 для 14 сховищ документів. Ми утримували модель фіксованою та порівнювали підагентів зі звичайним завершенням з підагентами, які могли використовувати REPL та делегувати. У чотирьох з десяти регресій запуск на глибині-2 читає сховище документів, але ніколи не пише звіт.
Ці результати мотивували наше використання глибини-1 для початкових експериментів з пост-тренуванням. Чи може навчання агентів спеціально для глибшого делегування зробити додаткові рівні корисними, залишається відкритим питанням.
Інфраструктура RL
RL, особливо з такою великою довжиною епізодів, є настільки ж проблемою інфраструктури, наскільки проблемою сигналу навчання. Для цього завдання одноепізодні rollouts можуть займати близько години або більше реального часу для завершення. Щоб оптимізувати реальний час навчання, ми застосували такі методи, як асинхронний висновок поза політикою, безперервне пакетування висновку, надмірна вибірка та оновлення ваг під час виконання. Для контролю впливу позаполітичності були застосовані селективне маскування токенів та обмеження, пов'язані з асинхронністю. Враховуючи, що в середовищі RLM більша частина реального часу витрачається на очікування завершення підагентів, можливість використовувати маленьких швидких підагентів допомогла значно прискорити процес навчання RL.
Ми наводимо реальний час кроку нижче. Він визначається часом rollout, який зростає протягом RL, оскільки агент стає більш ретельним і відправляє більші хвилі підагентів.

Рисунок A2: Хвилини реального часу на крок навчання RL для 40-крокового запуску з 5-кроковим ковзним середнім. Кроки 2–10 в середньому становлять 48 хвилин, а кроки 31–40 — 74 хвилини; збільшення пов'язане з тим, що навчена модель відправляє більше підагентів на один rollout.





