Agentes RLM post-entrenamiento para procesos de diligencia debida en fusiones y adquisiciones (M&A)

@nikogrupen
INGLÉS08 sept 2026
193K
218
21
11
335

TL;DR

Los investigadores de Harvey revelan cómo los agentes de modelos de lenguaje recursivos post-entrenamiento pueden procesar 80 millones de tokens para la diligencia debida en fusiones y adquisiciones, aumentando la precisión del 29% al 63%.

Enlace al artículo: https://www.harvey.ai/blog/post-training-rlm-agents-for-m-and-a-diligence

En nuestro reciente avance de investigación para Harvey Tenet, destacamos la importancia de la co-optimización modelo-herramienta para resolver tareas legales complejas de principio a fin, y presentamos resultados preliminares en Diligencia de Fusiones y Adquisiciones (M&A), donde una sola tarea requiere recorrer hasta 80 millones de tokens de contexto documental. Hoy, compartimos resultados actualizados de nuestra experimentación continua.

Junto con Baseten, construimos un sistema de modelo de lenguaje recursivo (RLM) para Diligencia de M&A. En nuestra formulación RLM, una sala de datos completa se carga en un REPL de Python y un agente raíz delega la revisión y el análisis acotados a subagentes que trabajan dentro de sus propias ventanas de contexto. En las tareas de LAB Diligence, este sistema mejora la tasa de aprobación de criterios de rúbrica en un promedio de 39.1 puntos porcentuales en los siete modelos que evaluamos.

Descubrimos que el post-entrenamiento dentro del sistema RLM produce mejoras adicionales en el rendimiento y ofrece opciones para navegar las compensaciones entre calidad y eficiencia. Post-entrenamos un orquestador Qwen3.5-122B-A10B mediante aprendizaje por refuerzo y encontramos que el post-entrenamiento aumentó la tasa de aprobación de criterios de rúbrica del 29.9% al 63.0% en 50 salas de datos de LAB Diligence reservadas.

Niko - inline image

Figura 1: Tasa media de aprobación de criterios en LAB Diligence para modelos base en el sistema de bucle de herramientas estándar, agentes de codificación en sus propios sistemas y modelos en nuestro sistema RLM. Los asteriscos marcan los resultados coincidentes de GLM-5.2 antes y después de SFT, evaluados en un conjunto de reserva separado de 20 salas. Todos los demás resultados utilizan el conjunto de reserva de 50 salas.

Estos resultados sugieren que el post-entrenamiento dentro de un sistema específico de la tarea es una ruta práctica para el trabajo legal intensivo en documentos, como la Diligencia de M&A, y que escalar el RL dentro del sistema RLM es una dirección prometedora para trabajos futuros. Por esta razón, también estamos entrenando GLM-5.3, un modelo grande de peso abierto de frontera, como modelo raíz en una ejecución de escalado en curso.

En el resto de esta publicación, describimos los entornos de LAB Diligence que evaluamos, nuestra metodología y los experimentos de post-entrenamiento con más detalle.

Entornos para Diligencia de M&A

Recientemente presentamos LAB Diligence, una extensión de LAB que incluye entornos sintéticos para Diligencia de M&A. Una sola sala de datos en LAB Diligence contiene hasta 5,000 documentos, organizados en docenas de carpetas por categoría, y hasta 80 millones de tokens de contexto total.

Niko - inline image

Figura 2: Un ejemplo de sala de datos de LAB Diligence. Aravon Bridge Bank contiene 2,270 documentos en 82 carpetas distribuidas en 14 categorías, 31 millones de tokens en total. El memorando de diligencia del agente para esta tarea se califica según 571 criterios de rúbrica.

Trabajando dentro de esta sala de datos, el agente tiene la tarea de producir un memorando de diligencia completo, incluyendo sus hallazgos con citas de documentos, exposición cuantificada cuando sea relevante y los próximos pasos recomendados para la transacción. Un juez LLM califica el memorando de diligencia según una rúbrica experta con cientos de criterios de aprobación o reprobación. El ejemplo de Aravon Bridge Bank tiene 571 criterios de rúbrica en total.

Niko - inline image

Figura 3: Ejemplos de rúbrica para la tarea de Aravon Bridge Bank en LAB Diligence, con un criterio textual de cada tipo.

La evidencia necesaria para la diligencia está dispersa por toda la sala de datos. Algunos hallazgos requieren combinar varios documentos, mientras que otros requieren verificar si falta evidencia de respaldo. En nuestras ejecuciones de referencia, los agentes buscaron y leyeron de forma selectiva, dejando gran parte de la sala de datos sin examinar. Estas tareas requieren un sistema que pueda distribuir la revisión en muchos contextos acotados y reunir los hallazgos.

Un Sistema RLM para Diligencia de M&A

Para establecer una línea base, comenzamos con el sistema de bucle de herramientas estándar de Legal Agent Bench. En este sistema, los modelos base aprueban un promedio del 23.3% de los criterios de rúbrica en las 50 salas de datos reservadas, y ningún modelo aprueba todos los criterios en ninguna sala de datos.

Niko - inline image

Figura 4: Tasa media de aprobación de criterios en el sistema de bucle de herramientas estándar en las 50 salas de datos de diligencia reservadas.

Estos resultados sugieren un desajuste entre la tarea y el sistema. Una sala de datos de LAB Diligence es demasiado grande para caber dentro del contexto de un solo modelo, pero gran parte de la revisión inicial se puede dividir por categoría. La raíz puede luego combinar los hallazgos entre categorías para producir el memorando. Los equipos de negociación dentro de los bufetes de abogados dividen el trabajo de diligencia de manera similar.

Niko - inline image

Figura 5: El sistema RLM a profundidad 1. La sala de datos se carga en un REPL de Python como variables consultables. El agente raíz opera sobre ella en código y delega tareas de lectura acotadas a subagentes, que devuelven sus hallazgos como variables REPL. Solo la salida que el agente raíz imprime ingresa a su ventana de contexto, por lo que la raíz nunca contiene la sala de datos completa.

Esto nos llevó a explorar los RLM como un sistema para Diligencia de M&A. En un sistema RLM, a un agente raíz se le proporciona un REPL de Python con la sala de datos cargada como variables consultables, lo que le permite buscar en el corpus de forma programática. El agente raíz planifica y delimita la revisión y envía subtareas a los subagentes. Cada subagente recibe una porción acotada del corpus e instrucciones del agente raíz, trabaja dentro de su propia ventana de contexto y devuelve sus hallazgos como variables REPL. Los experimentos a continuación utilizan una sola capa de subagentes a menos que se indique lo contrario, y en la práctica, la raíz envía muchas llamadas en paralelo.

Niko - inline image

Figura 6: Tasa media de aprobación de criterios para siete modelos en el sistema de bucle de herramientas estándar y como raíz del sistema RLM (profundidad 1, subagentes Qwen3.6-35B-A3B), en el conjunto de reserva de 50 salas.

En los siete modelos, el sistema RLM eleva la tasa media de aprobación del 23.3% al 62.4%, una ganancia de 39.1 puntos porcentuales. También ejecutamos dos agentes de codificación de propósito general con herramientas web desactivadas, Claude Code con Opus-5 y Codex con GPT-5.6 Sol, utilizando la misma instrucción mínima que el sistema de bucle de herramientas. Claude Code aprueba el 24.6% de los criterios y Codex el 12.0%, por debajo de los mismos modelos en el sistema de bucle de herramientas en 17.9 y 4.6 puntos, respectivamente. En los seguimientos, ambos agentes dejan de leer temprano y escriben memorandos más cortos, y ninguno genera subagentes a pesar de tener la capacidad de hacerlo.

Cobertura y Costo

El sistema RLM aumenta sustancialmente la cantidad de contenido útil que se convierte en contexto del agente. Estimamos la cobertura con sondas que miden la proporción del contenido de la sala de datos que llega a cualquier modelo en el sistema, raíz o subagente. En el sistema de bucle de herramientas estándar, ninguna ejecución lee más del 1% de la sala de datos, y la mayoría lee entre el 0.1% y el 0.5%. En el sistema RLM, casi todas las ejecuciones leen más del 10% de la sala de datos y la mayoría lee casi todo. Una mayor cobertura se asocia con tasas de aprobación de criterios de rúbrica más altas en este rango.

Niko - inline image

Figura 7: Tasa de aprobación de criterios de rúbrica versus cobertura basada en sonda, un punto por ejecución, para siete modelos en cada sistema en las 50 salas de datos reservadas de LAB Diligence. La cobertura está en escala logarítmica.

Pasar al sistema RLM aumenta el costo de generación por sala de datos para seis de los siete modelos base, como se muestra en la Figura 8. Claude Opus 5 es la excepción. En el sistema de bucle de herramientas, gasta ~$18 por sala de datos leyendo por sí solo; como raíz RLM, gasta ~$7 y obtiene 35 puntos más.

Niko - inline image

Figura 8: Tasa media de aprobación de criterios versus costo de generación por sala de datos para siete modelos en cada sistema, promediado en 50 salas de datos reservadas. Las líneas punteadas conectan el mismo modelo entre sistemas. Los costos son estimaciones conscientes de la caché a precios de lista, escala logarítmica.

División del Trabajo

Para examinar cuánto depende el rendimiento del agente raíz frente a los subagentes, emparejamos cuatro modelos raíz con tres modelos de subagentes Qwen en 30 salas de datos reservadas (ver Figura 9). En las configuraciones probadas, cambiar la raíz tuvo un efecto mayor. Manteniendo fijo el modelo de subagente mientras se variaba el modelo raíz, la brecha entre las raíces con mayor y menor puntuación promedió alrededor de 38 puntos porcentuales. Manteniendo fija la raíz mientras se variaban los subagentes, la brecha correspondiente entre los modelos de subagentes promedió alrededor de 8 puntos (Figura 9b).

Niko - inline image

Figura 9: División del trabajo en el sistema RLM, agregada en cuatro modelos raíz y tres modelos de subagentes en 30 salas de datos reservadas. (a) Proporción de la raíz de los tokens de entrada y salida, promediada entre las opciones de subagentes. (b) La brecha entre las raíces con mayor y menor puntuación, promediada entre las opciones de subagentes, y la brecha correspondiente entre los subagentes, promediada entre las raíces.

Esta diferencia es notable porque, en el sistema RLM, observamos que la raíz representa una minoría del uso total de tokens del agente. Con Opus 5 orquestando, por ejemplo, la raíz representa el 3.8% de los tokens de entrada y el 1.1% de los tokens de salida (ver Figura 9a). Los subagentes procesan la mayor parte del texto, mientras que la raíz decide cómo dividir la revisión y ensamblar los hallazgos.

Niko - inline image

Figura 10: Tasa media de aprobación de criterios para cuatro modelos raíz emparejados con tres modelos de subagentes, en 30 salas de datos reservadas.

Estos resultados sugieren que mejorar la coordinación es una oportunidad importante en esta configuración, por lo que centramos nuestros experimentos iniciales de post-entrenamiento en la raíz.

Post-Entrenamiento en el Sistema RLM

Los resultados anteriores apuntan al agente raíz como un objetivo para el post-entrenamiento. En esta sección, informamos los resultados del post-entrenamiento de modelos raíz de peso abierto dentro del sistema RLM.

SFT de Autodestilación

Primero, post-entrenamos una raíz GLM-5.2 utilizando SFT de autodestilación por muestreo de rechazo. Este experimento utiliza un conjunto de evaluación de reserva diferente de 20 salas en comparación con las evaluaciones de 50 salas informadas en otros lugares. Su puntuación de modelo base coincidente en este conjunto de reserva es del 46.1%, por debajo del resultado de 65.4% de GLM-5.2 informado en la Figura 6 sobre el conjunto de reserva más grande.

GLM-5.2 base no ejecuta de manera estable una política de alta puntuación de fábrica: hay colapsos de rendimiento frecuentes donde el modelo base, actuando como agente raíz, se rinde temprano, delega insuficientemente o no logra convertir los resultados del subagente en un entregable sólido. Dado que una política sólida ya está dentro de la distribución del modelo pero necesita hacerse más robusta, utilizamos la autodestilación por muestreo de rechazo para afinar la distribución de GLM-5.2 en el modo deseado. Seleccionamos ejecuciones exitosas de GLM-5.2 con alta cobertura de la sala de datos y ajustamos la raíz en esas trayectorias.

Niko - inline image

Figura 11: GLM-5.2 como raíz RLM antes y después del SFT de autodestilación por muestreo de rechazo, evaluado en un conjunto de reserva separado de 20 salas. Estos son resultados coincidentes dentro del experimento SFT, no la evaluación de 50 salas utilizada en la Figura 6.

En este conjunto de reserva de 20 salas de datos, la raíz entrenada con SFT obtiene un 60.1% frente al 46.1% del modelo base (ver Figura 11). Una revisión de los seguimientos del agente post-entrenado sugiere que el entrenamiento ayuda al agente raíz a revisar exhaustivamente la sala de datos y a trasladar un mayor porcentaje de los hallazgos de los subagentes al memorando final.

La Tabla 1 resume otros cambios de comportamiento que observamos después del post-entrenamiento. Más notablemente, la correlación entre el volumen de llamadas a subagentes y el tamaño de la sala de datos aumenta de 0.17 a 0.84, lo que indica que el agente raíz entrenado escala su delegación al tamaño de la sala de datos. La raíz entrenada también aprende a comenzar a escribir el memorando mientras los subagentes aún están leyendo, similar a lo que encontramos en nuestras ejecuciones de RL.

Niko - inline image

Tabla 1: Comportamiento de la raíz GLM-5.2 antes y después del SFT, promediado en el conjunto de reserva separado de 20 salas. La cobertura es un porcentaje; la fila final es un coeficiente de correlación.

Los comportamientos que conforman un agente de diligencia raíz sólido, como la delegación exhaustiva, se pueden aprender de un número relativamente pequeño de seguimientos en política, sin información privilegiada ni conocimiento legal etiquetado. Aquí, la autodestilación es efectiva porque el buen comportamiento ya existe en la distribución del modelo y el entrenamiento lo estabiliza.

Este experimento nos motivó a explorar el post-entrenamiento basado en RL como un intento de empujar al modelo más allá de lo que está dentro de su distribución, provocando un nuevo comportamiento directamente a través de la recompensa de la tarea.

Aprendizaje por Refuerzo

Para el aprendizaje por refuerzo, comenzamos con un modelo raíz más pequeño, Qwen3.5-122B-A10B, para mantener manejable el bucle inicial del experimento de RL.

Entrenamos la raíz RLM con GRPO, utilizando la tasa de aprobación de criterios de rúbrica juzgada como recompensa y manteniendo fijos los modelos de subagentes (los subagentes eran cada uno un modelo Qwen3.6-35B-A3B). Durante 40 pasos de entrenamiento, encontramos que la tasa media de aprobación de las ejecuciones aumentó de aproximadamente el 23% a aproximadamente el 56%. En el conjunto de reserva de 50 salas, el punto de control final obtiene un 63.0% frente al 29.9% del modelo base.

Niko - inline image

Figura 12: Aprendizaje por refuerzo en la raíz Qwen3.5-122B-A10B con subagentes Qwen3.6-35B-A3B fijos. (a) Tasa media de aprobación de criterios de las ejecuciones en cada uno de los 40 pasos de entrenamiento. (b) Modelo base y punto de control final en el conjunto de reserva de 50 salas.

Después del RL, la cobertura media de la sala de datos aumenta del 62% al 96%, aunque la cobertura no es un término de recompensa explícito. Las ejecuciones base se distribuyen en todo el rango de cobertura, con un grupo por debajo del 20% que obtiene una puntuación cercana a cero. Cada ejecución entrenada con RL lee más del 60% de la sala de datos y la mayoría lo lee todo.

Niko - inline image

Figura 13: Tasa de aprobación de criterios versus cobertura basada en sonda, un punto por ejecución, para la raíz Qwen3.5-122B-A10B antes y después del RL en el conjunto de reserva de 50 salas.

La raíz post-entrenada realiza un 64% más de llamadas a subagentes por sala de datos. RL también cambió el volumen de delegación más que SFT, un 64% frente a un 29%.

Niko - inline image

Tabla 2: Comportamiento de la raíz Qwen3.5-122B-A10B antes y después del RL, promediado en el conjunto de reserva de 50 salas.

Antes del post-entrenamiento, el agente raíz Qwen intentaba escribir su memorando de diligencia de una sola vez y solo después de que todos los subagentes regresaran. Durante el post-entrenamiento con RL, aprende un enfoque más eficiente, escribiendo el memorando de forma incremental e intercalando la escritura de secciones con la revisión del trabajo de los subagentes.

Escalando RL con GLM-5.3

Para probar nuestra receta de RL a escala, ahora estamos entrenando GLM-5.3 como la raíz RLM con la misma configuración de estilo GRPO: tasa de aprobación de criterios juzgada como recompensa, subagentes Qwen3.6-35B-A3B mantenidos fijos, LoRA en la raíz, tamaño de grupo 8 y tamaño de lote 24. Las ejecuciones de GLM-5.3 comienzan muy por encima de donde comenzó la raíz Qwen, por lo que hay menos margen de mejora. En los pasos 0 a 20 (Figura 14), la tasa media de aprobación de las ejecuciones aumenta de aproximadamente el 51% a aproximadamente el 59%, promediada entre los primeros y últimos ocho pasos mostrados, con el ruido paso a paso esperado en este tamaño de lote.

Niko - inline image

Figura 14: Progreso temprano del entrenamiento para la ejecución de RL en curso de GLM-5.3, con subagentes Qwen3.6-35B-A3B mantenidos fijos. La tasa media de aprobación de criterios de las ejecuciones se muestra a lo largo de 20 pasos de entrenamiento. El gris muestra los valores brutos por paso; el negro muestra una media móvil exponencial. Esta figura informa las puntuaciones de entrenamiento, no el rendimiento en el conjunto de reserva.

Próximos Pasos

El sistema RLM mejora el rendimiento en todos los modelos que probamos, y RL produce ganancias adicionales para la raíz Qwen dentro de ese sistema. Todavía existe una brecha sustancial entre estas puntuaciones y las tasas de aprobación casi perfectas hacia las que estamos trabajando.

Los experimentos de entrenamiento detallados anteriormente son exploraciones iniciales. Además de completar la ejecución de entrenamiento escalada de GLM-5.3, también exploraremos combinaciones de SFT y RL, y subagentes entrenados. El sistema RLM separa la orquestación de la raíz de la lectura de los subagentes, por lo que cada uno puede ser entrenado por separado o conjuntamente, incluyendo configuraciones en las que los subagentes son entrenados para delegar a su vez.

Finalmente, el hallazgo central aquí, que la co-optimización modelo-herramienta puede mejorar significativamente el rendimiento del agente en entornos de largo horizonte, no es específico de la diligencia. Estamos explorando formas de mapear la misma estructura de sistema y enfoque de entrenamiento a otro trabajo legal de contexto largo.

Apéndice

Profundidad de Recursión RLM

También probamos si agregar otra capa de delegación mejora el rendimiento. A profundidad 1, los subagentes devuelven completaciones LLM simples, sin herramientas ni delegación propia. A profundidad 2, los subagentes reciben un REPL de Python y pueden delegar más. Dentro de cada experimento, utilizamos el mismo modelo para la raíz y todos los subagentes.

Evaluamos tanto GLM-5.2 como Qwen3.5-122B-A10B. Muchas ejecuciones de GLM-5.2 a profundidad 2 no terminaron dentro del límite de tiempo, por lo que informamos los resultados de Qwen a continuación. En 14 salas de datos, la profundidad 2 mejoró las puntuaciones en cuatro y las redujo en diez, disminuyendo la tasa media de aprobación de criterios en 19 puntos porcentuales (Figura A2). En cuatro de las diez regresiones, el agente a profundidad 2 leyó el contenido de la sala de datos pero nunca produjo un informe.

Niko - inline image

Figura A1: Tasa de aprobación de criterios por sala a profundidad 1 y profundidad 2 para 14 salas de datos. Mantuvimos el modelo fijo y comparamos subagentes de completación simple con subagentes que podían usar un REPL y delegar. En cuatro de las diez regresiones, la ejecución a profundidad 2 lee la sala de datos pero nunca escribe el informe.

Estos resultados motivaron nuestro uso de profundidad 1 para los experimentos iniciales de post-entrenamiento. Si el entrenamiento de agentes específicamente para una delegación más profunda puede hacer que las capas adicionales sean útiles sigue siendo una pregunta abierta.

Infraestructura de RL

El RL, especialmente con longitudes de episodio tan largas, es tanto un problema de infraestructura como un problema de señal de entrenamiento. Para esta tarea, las ejecuciones de un solo episodio podrían tomar del orden de una hora o más de tiempo de pared para completarse. Para optimizar el tiempo de pared del entrenamiento, aplicamos métodos como inferencia asíncrona fuera de política, agrupación continua de inferencia, sobremuestreo y actualizaciones de pesos en vuelo. Se aplicaron enmascaramiento selectivo de tokens y límites relacionados con la asincronía para controlar el efecto de la falta de política. Dado que en el sistema RLM la mayor parte del tiempo de pared se dedica a esperar que los subagentes completen, la capacidad de usar subagentes pequeños y rápidos ayudó a acelerar enormemente el proceso de entrenamiento de RL.

Graficamos el tiempo de pared por paso a continuación. Está dominado por el tiempo de ejecución que crece a lo largo del curso del RL a medida que el agente se vuelve más minucioso y envía oleadas más grandes de subagentes.

Niko - inline image

Figura A2: Minutos de tiempo de pared por paso de entrenamiento de RL para la ejecución de 40 pasos, con una media móvil de 5 pasos. Los pasos 2–10 promedian 48 minutos y los pasos 31–40 promedian 74 minutos; el aumento proviene de que el modelo entrenado envía más subagentes por ejecución.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales