LAB: Conocimiento de firmas de abogados

240K
193
22
17
380

TL;DR

Harvey AI lanza como código abierto Calderwood & Harkness, un entorno de firma de abogados sintética con 108 millones de tokens para evaluar a los agentes de IA en tareas complejas de recuperación y razonamiento legal.

Estamos liberando el código de nuestra próxima expansión de LAB: un bufete de abogados sintético, Calderwood & Harkness («C&H» o «el bufete»). Construido en colaboración con @engramlab, el bufete contiene el trabajo realizado en más de 250 asuntos de clientes, que comprenden casi 10 000 archivos y más de 100 millones de tokens.

Especificación

Valor

Clientes

46

Áreas de práctica

15

Asuntos

266

Archivos

9 288

Tokens

108M

Tareas

250

Evaluación

juez LLM con rúbricas por tarea

Conjunto de datos

https://github.com/harveyai/harvey-labs/tree/main/tasks/firm-knowledge

El entorno contiene 250 tareas que abarcan diversas formas de recuperación de conocimiento y razonamiento. Cada tarea refleja el tipo de tareas de recuperación y razonamiento que un bufete podría pedir a sus sistemas de gestión documental, y está diseñada para ser una prueba de estrés de las capacidades de los agentes: el contexto necesario para responder a cualquiera de estas preguntas está distribuido, a menudo no hay palabras clave que permitan una búsqueda directa y, con 100 millones de tokens, el corpus es demasiado grande para explorarse de forma exhaustiva.

En esta publicación, describimos cómo se estructuran los bufetes de abogados, cómo construimos un entorno sintético de bufete fundamentado que refleja esa estructura y qué revelan las ejecuciones de referencia sobre la capacidad de los agentes actuales para acceder a corpus de conocimiento a escala.

Cómo se estructura un bufete de abogados

Los bufetes de abogados organizan su trabajo mediante un conjunto común de relaciones: los clientes para los que trabajan y los asuntos que llevan a cabo para esos clientes. Basamos C&H en estas relaciones fundamentales.

Julio Pereyra - inline image

El bufete tiene 46 clientes ficticios que representan a distintas corporaciones e individuos para los que trabaja. Definimos clientes diversos a propósito para abarcar una amplia gama de trabajo: las firmas de capital privado requieren servicios legales diferentes a los de los fabricantes industriales.

El bufete trabaja para esos clientes en distintas prácticas. Estas áreas de práctica representan diferentes tipos de experiencia jurídica que abarcan los grupos de práctica habituales en bufetes medianos y grandes.

El trabajo real que realiza el bufete se representa mediante asuntos de clientes. Un cliente puede tener muchos asuntos, y los asuntos pueden involucrar a abogados de varias áreas de práctica. Actualmente, el bufete tiene 266 asuntos en curso o finalizados en su sistema de archivos.

Estos tres conceptos definen el alcance de C&H: para quién trabaja, qué experiencia puede aportar y en qué proyectos específicos está trabajando.

Construcción del conjunto de datos

Cada asunto de cliente comienza con una especificación que define los detalles estructurales relevantes del bufete: para qué cliente es y cuál es la forma general del proyecto. Luego se enriquecen con un conjunto concreto de hechos sustantivos que el asunto debe contener para fundamentar una tarea específica.

Pueden ser hechos concretos (un depósito en garantía del 10 % o una cláusula de no competencia de dos años en un acuerdo concreto) o estructurales: un litigio fue desestimado o resuelto. Estas características nos permiten definir y revisar las verdades de referencia a partir de especificaciones breves en lugar de un corpus grande y no estructurado. En conjunto, un asunto puede especificarse en alrededor de 1 000 tokens y a la vez contener muchas características relevantes para las tareas.

Nuestro pipeline de datos sintéticos convierte cada especificación en un sistema de archivos de 10 a 200 documentos realistas (según el estado, el tamaño y el tipo del asunto) que expresan las características relevantes. Las características se anclan a documentos específicos, de modo que pueden rastrearse tanto a nivel del asunto como del archivo. Los asuntos en sí son colecciones de archivos con una estructura laxa que contienen los aspectos principales de un caso: contratación, ejecución de fases, decisiones importantes y resultados finales. El sistema de archivos exacto no está estandarizado y refleja una organización lógica basada en el tipo de asunto, las preferencias del socio y cómo se desarrolló cada caso en particular.

Julio Pereyra - inline image

Entorno y definición de tareas

Los asuntos del bufete se tratan como un corpus persistente, y cada tarea se ejecuta contra todo el sistema de archivos. Las tareas se enumeran a partir de las especificaciones resumidas de los asuntos, y las verdades de referencia se calculan como asuntos o documentos que contienen una combinación particular de características. Las características subyacentes de un asunto no se muestran a los agentes en tiempo de ejecución; deben recuperarlas del sistema de archivos no estructurado mediante una combinación de búsqueda y razonamiento.

Aunque las características en sí están estructuradas, permiten flexibilidad para expresar varios tipos de tareas de búsqueda y razonamiento. Estas incluyen la búsqueda de precedentes, la comprensión de tendencias del sector y la identificación de preferencias o resultados a nivel de cliente.

Julio Pereyra - inline image

Siguiendo el formato estándar de LAB, los agentes se evalúan mediante jueces LLM frente a una rúbrica que desglosa la verdad de referencia en criterios atómicos necesarios para completar la tarea con éxito.

Rendimiento actual

Medimos el rendimiento de referencia utilizando el banco de pruebas estándar de LAB y dos modelos fundacionales potentes: GPT-5.6-sol y Opus-4.8. Encontramos que ambos tienen dificultades tanto en el rendimiento general de las tareas como en el rendimiento eficaz en términos de latencia. Ambos resuelven un conjunto común de tareas fáciles y un conjunto único de tareas más difíciles, pero tardan cinco minutos o más por tarea y solo cumplen alrededor de la mitad de todos los criterios de evaluación.

Al revisar las trayectorias, esperaríamos que tanto el costo como la latencia aumenten con el tamaño del corpus, lo que plantea problemas reales para corpus a escala empresarial real que pueden superar a C&H en varios órdenes de magnitud.

Julio Pereyra - inline image

Los fallos se explican en gran medida por la incapacidad de buscar y comprender el corpus de forma exhaustiva. Los modelos razonan correctamente sobre lo que encuentran, pero a menudo no logran encontrar toda la información relevante.

Este modo de fallo es especialmente severo en tareas que requieren enumerar un gran conjunto de asuntos, archivos o piezas de información relevantes. A medida que aumenta el número de puntos atómicos necesarios para completar la tarea con éxito, ambos modelos caen al 0 % de aprobación total.

Julio Pereyra - inline image

Esto no es un fallo de la estrategia de búsqueda. Los agentes encuentran de forma consistente la información principal y cumplen alrededor de la mitad de los criterios. Es, más bien, un fallo a la hora de saber cuándo seguir buscando información adicional. Esto sugiere que los agentes no construyen un modelo intermedio eficaz de lo que contiene el corpus que les permita saber cuándo sus búsquedas han sido suficientemente exhaustivas.

Completar tareas con éxito frente al conocimiento empresarial exige mejorar esta capacidad concreta.

Conclusión

El trabajo legal requiere comprender cómo se relaciona un problema con el trabajo previo: qué precedente es relevante para un cliente o cuál es el estándar del mercado. Los agentes actuales intentan obtener ese conocimiento desde cero en cada tarea.

C&H demuestra que esta estrategia es costosa y débil a la escala del conocimiento empresarial. Creemos que una dirección prometedora para mejorar a los agentes en esta capacidad es permitirles construir representaciones más ricas del corpus de antemano —índices, resúmenes, memoria— y amortizar el costo de construir esas representaciones en ejecuciones posteriores. Dado que el entorno es persistente, estos costos de comprensión, que se pagan una sola vez, se rentabilizan a lo largo de muchas tareas. Pronto compartiremos más sobre nuestro trabajo aquí.

Los datos del bufete sintético que creamos para esta publicación están disponibles en nuestro repositorio de código abierto. La versión actual de C&H cubre solo una parte del trabajo que realiza un bufete de abogados, y sus tareas representan solo un subconjunto de las preguntas que los abogados pueden querer plantear a su conocimiento institucional. Planeamos ampliar ambas cosas con el tiempo.

Nos gustaría agradecer especialmente a los siguientes colaboradores por sus comentarios sobre el conjunto de datos y el artículo: Dan Biderman (Engram), Jessy Lin (Engram), Mayee Chen (Engram), Neel Guha (Columbia Law School / Engram), Shizhe He (Engram), Calvin Qi (Harvey), Gabe Pereyra (Harvey)

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales