LAB: Conocimiento de firmas legales

240K
193
22
17
380

TL;DR

Harvey AI lanza como código abierto Calderwood & Harkness, un entorno de firma legal sintética con 108 millones de tokens para evaluar agentes de IA en tareas complejas de recuperación y razonamiento legal.

Estamos publicando como código abierto nuestra próxima expansión de LAB: un bufete de abogados sintético, Calderwood & Harkness (“C&H” o “el bufete”). Construido en colaboración con @engramlab, el bufete contiene el trabajo de más de 250 asuntos de clientes, con casi 10,000 archivos y más de 100 millones de tokens.

Spec

Value

Clientes

46

Áreas de práctica

15

Asuntos

266

Archivos

9,288

Tokens

108M

Tareas

250

Evaluación

Juez LLM contra rúbricas por tarea

Conjunto de datos

https://github.com/harveyai/harvey-labs/tree/main/tasks/firm-knowledge

El entorno contiene 250 tareas que abarcan diversas formas de recuperación de conocimiento y razonamiento. Cada tarea refleja el tipo de tareas de recuperación y razonamiento que un bufete podría pedir a sus sistemas de gestión de documentos y está diseñada para ser una prueba de resistencia de las capacidades de los agentes: el contexto necesario para responder cualquiera de estas preguntas está distribuido, a menudo no hay palabras clave para buscar y, con 100 millones de tokens, el corpus es demasiado grande para buscar de manera exhaustiva.

En esta publicación, describimos cómo se estructuran los bufetes de abogados, cómo construimos un entorno de bufete sintético y fundamentado que refleja esa estructura, y qué revelan las ejecuciones de referencia sobre la capacidad de los agentes actuales para acceder a corpus de conocimiento a escala.

Cómo se estructura un bufete de abogados

Los bufetes de abogados organizan su trabajo mediante un conjunto común de relaciones: los clientes para los que trabajan y los asuntos en los que trabajan para esos clientes. Fundamentamos C&H en estas relaciones centrales.

Julio Pereyra - inline image

El bufete tiene 46 clientes ficticios, que representan a diferentes corporaciones e individuos para los que trabaja. Definimos intencionalmente clientes diversos para obtener una amplia gama de trabajo: las firmas de capital privado requieren servicios legales diferentes a los de los fabricantes industriales.

El bufete trabaja para esos clientes en distintas prácticas. Estas áreas de práctica representan diferentes tipos de experiencia legal que abarcan grupos de práctica comunes en bufetes de abogados medianos y grandes.

El trabajo real del bufete se representa en asuntos de clientes. Un cliente puede tener muchos asuntos y estos pueden involucrar a abogados de múltiples áreas de práctica. El bufete tiene actualmente 266 asuntos en curso o completados en su sistema de archivos.

Estos tres conceptos definen el alcance de C&H: para quién trabaja, qué experiencia puede aportar y en qué proyectos específicos está trabajando.

Construcción del conjunto de datos

Cada asunto de cliente comienza con una especificación que define los detalles estructurales relevantes del bufete: para qué cliente es y cuál es la forma general del proyecto. Luego se enriquecen con un conjunto concreto de hechos sustanciales que el asunto debe contener para fundamentar una tarea específica.

Estos pueden ser hechos concretos — un depósito en garantía del 10% o una cláusula de no competencia por dos años en un acuerdo particular — o estructurales: una demanda fue desestimada o resuelta. Estas características nos permiten definir y revisar las verdades de referencia a partir de especificaciones cortas en lugar de un corpus grande y no estructurado. En general, un asunto puede especificarse en unos 1,000 tokens y a la vez incluir muchas características relevantes para la tarea.

Nuestro pipeline de datos sintéticos luego convierte cada especificación en un sistema de archivos de 10 a 200 documentos realistas (según el estado, tamaño y tipo del asunto) que expresan las características relevantes. Las características están vinculadas a documentos específicos para poder rastrearlas tanto a nivel de asunto como de archivo. Los asuntos en sí son colecciones de archivos con una estructura flexible que contienen los aspectos principales de un asunto: contratación, ejecución de fases, decisiones importantes y resultados finales. El sistema de archivos exacto no está estandarizado y refleja una organización lógica basada en el tipo de asunto, las preferencias del socio y cómo se desarrolló cada asunto en particular.

Julio Pereyra - inline image

Entorno y definición de tareas

Los asuntos del bufete se tratan como un corpus persistente, y cada tarea se ejecuta contra todo el sistema de archivos. Las tareas en sí se enumeran a partir de las especificaciones resumidas de los asuntos, y las verdades de referencia se calculan como asuntos o documentos que contienen una combinación particular de características. Las características subyacentes de un asunto no se muestran a los agentes en tiempo de ejecución; deben recuperarlas del sistema de archivos no estructurado mediante una combinación de búsqueda y razonamiento.

Aunque las características en sí están estructuradas, permiten flexibilidad para expresar varios tipos de tareas de búsqueda y razonamiento. Estas incluyen buscar precedentes, comprender tendencias de la industria e identificar preferencias o resultados a nivel de cliente.

Julio Pereyra - inline image

En el formato estándar de LAB, los agentes se evalúan con jueces LLM contra una rúbrica que desglosa la verdad de referencia en criterios atómicos necesarios para completar la tarea con éxito.

Rendimiento actual

Medimos el rendimiento de referencia utilizando el entorno de evaluación estándar de LAB y dos modelos fundacionales potentes: GPT-5.6-sol y Opus-4.8. Descubrimos que ambos tienen dificultades con el rendimiento general de las tareas, así como con el rendimiento eficaz en términos de latencia. Ambos resuelven un conjunto común de tareas fáciles y un conjunto único de tareas más difíciles, pero tardan cinco minutos o más por tarea y solo cumplen alrededor de la mitad de todos los criterios de evaluación.

Al revisar las trayectorias, esperamos que tanto el costo como la latencia aumenten con el tamaño del corpus, lo que plantea problemas reales para corpora de escala empresarial real que pueden superar a C&H por varios órdenes de magnitud.

Julio Pereyra - inline image

Los fallos se explican en gran parte por la incapacidad de buscar y comprender exhaustivamente el corpus. Los modelos razonan correctamente sobre lo que encuentran, pero a menudo no logran encontrar toda la información relevante.

Este modo de fallo es particularmente grave en tareas que requieren enumerar un gran conjunto de asuntos, archivos o piezas de información relevantes. A medida que aumenta el número de puntos atómicos necesarios para completar la tarea con éxito, ambos modelos retroceden a un 0% de aprobación completa.

Julio Pereyra - inline image

Esto no es un fallo de la estrategia de búsqueda. Los agentes encuentran de manera consistente la información central y cumplen alrededor de la mitad de los criterios. Es, en cambio, un fallo al saber cuándo seguir buscando información adicional. Esto sugiere que los agentes no construyen un modelo intermedio efectivo de lo que contiene el corpus que les permita saber cuándo sus búsquedas han sido suficientemente exhaustivas.

Completar tareas con éxito frente al conocimiento empresarial requiere mejorar esta capacidad específica.

Conclusión

El trabajo legal requiere comprender cómo se relaciona un problema con el trabajo previo: qué precedente es relevante para un cliente o cómo es el estándar del mercado. Los agentes actuales intentan derivar ese conocimiento desde cero en cada tarea.

C&H demuestra que esta estrategia es costosa y débil a escala de conocimiento empresarial. Creemos que una dirección prometedora para mejorar a los agentes en esta capacidad es permitirles construir representaciones más ricas del corpus desde el principio — índices, resúmenes, memoria — y amortizar el costo de construir dichas representaciones en ejecuciones posteriores. Debido a que el entorno es persistente, estos costos de comprensión únicos se amortizan en muchas tareas. Pronto compartiremos más sobre nuestro trabajo aquí.

Los datos del bufete de abogados sintético que creamos para esta publicación están disponibles en nuestro repositorio de código abierto. La versión actual de C&H cubre solo parte del trabajo que realiza un bufete de abogados, y sus tareas representan solo un subconjunto de las preguntas que los abogados podrían querer hacer a su conocimiento institucional. Planeamos ampliar ambos con el tiempo.

Queremos agradecer especialmente a los siguientes colaboradores por sus comentarios tanto sobre el conjunto de datos como sobre el texto: Dan Biderman (Engram), Jessy Lin (Engram), Mayee Chen (Engram), Neel Guha (Columbia Law School / Engram), Shizhe He (Engram), Calvin Qi (Harvey), Gabe Pereyra (Harvey)

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales