LAB : Connaissances en cabinet d'avocats

240K
193
22
17
380

TL;DR

Harvey AI publie en open-source Calderwood & Harkness, un environnement de cabinet d'avocats synthétique de 108 millions de jetons pour évaluer les agents IA sur des tâches complexes de recherche et de raisonnement juridique.

Nous publions en open source notre prochaine extension de LAB : un cabinet d’avocats synthétique, Calderwood & Harkness (« C&H » ou « le cabinet »). Construit en collaboration avec @engramlab, le cabinet contient les documents produits dans le cadre de plus de 250 dossiers clients, soit près de 10 000 fichiers et plus de 100 millions de tokens.

Spécification

Valeur

Clients

46

Domaines de pratique

15

Dossiers

266

Fichiers

9 288

Tokens

108 M

Tâches

250

Évaluation

Juge LLM selon des grilles d’évaluation par tâche

Jeu de données

https://github.com/harveyai/harvey-labs/tree/main/tasks/firm-knowledge

L’environnement contient 250 tâches couvrant diverses formes de recherche et de raisonnement sur les connaissances. Chaque tâche reproduit le type de tâches de recherche et de raisonnement qu’un cabinet pourrait confier à ses systèmes de gestion documentaire, et est conçue comme un test de résistance des capacités des agents — le contexte nécessaire pour répondre à l’une quelconque de ces questions est distribué, il n’y a souvent aucun mot-clé à chercher et, avec 100 millions de tokens, le corpus est trop vaste pour être exploré de manière exhaustive.

Dans cet article, nous décrivons comment les cabinets d’avocats sont structurés, comment nous avons construit un environnement de cabinet d’avocats synthétique et ancré dans la réalité qui reflète cette structure, et ce que les exécutions de référence révèlent sur la capacité des agents actuels à accéder à des corpus de connaissances à grande échelle.

Comment un cabinet d’avocats est structuré

Les cabinets d’avocats organisent leur travail autour d’un ensemble commun de relations : les clients pour lesquels ils travaillent et les dossiers qu’ils traitent pour ces clients. Nous ancrons C&H dans ces relations fondamentales.

Julio Pereyra - inline image

Le cabinet compte 46 clients fictifs, représentant différentes entreprises et particuliers pour lesquels il travaille. Nous définissons volontairement des clients variés pour couvrir un large éventail de missions — les fonds de private equity n’ont pas les mêmes besoins juridiques que les industriels.

Le cabinet travaille pour ces clients dans le cadre de pratiques distinctes. Ces domaines de pratique représentent différents types d’expertise juridique, couvrant les groupes de pratique courants des cabinets de taille moyenne et des grands cabinets.

Le travail réellement effectué par le cabinet est représenté par les dossiers clients. Un client peut avoir de nombreux dossiers, et un dossier peut impliquer des avocats de plusieurs domaines de pratique. Le cabinet compte actuellement 266 dossiers en cours ou terminés dans son système de fichiers.

Ces trois concepts définissent le périmètre de C&H : pour qui travaille-t-il, quelle expertise peut-il mobiliser, et sur quels projets spécifiques travaille-t-il ?

Construction du jeu de données

Chaque dossier client commence par une spécification qui définit les détails structurels pertinents du cabinet : pour quel client le dossier est ouvert et quelle est la forme générale du projet. Ces spécifications sont ensuite enrichies d’un ensemble concret de faits de fond que le dossier doit contenir pour servir de base à une tâche particulière.

Il peut s’agir de faits précis — un séquestre de 10 % ou une clause de non-concurrence de deux ans dans un contrat donné — ou de faits structurels : une procédure judiciaire rejetée ou ayant fait l’objet d’une transaction. Ces caractéristiques nous permettent de définir et d’examiner les vérités de terrain à partir de spécifications courtes plutôt que d’un vaste corpus non structuré. Dans l’ensemble, un dossier peut être spécifié en environ 1 000 tokens tout en portant de nombreuses caractéristiques pertinentes pour les tâches.

Notre pipeline de données synthétiques transforme ensuite chaque spécification en un système de fichiers de 10 à 200 documents réalistes (selon l’état, la taille et le type du dossier) qui reflètent les caractéristiques concernées. Les caractéristiques sont rattachées à des documents spécifiques afin de pouvoir être retracées au niveau du dossier comme du fichier. Les dossiers eux-mêmes sont des collections de fichiers à la structure souple qui contiennent les principaux aspects d’un dossier : la mission, l’exécution des phases, les décisions majeures et les résultats finaux. Le système de fichiers exact n’est pas standardisé et reflète une organisation logique fondée sur les types de dossiers, les préférences des associés et le déroulement de chaque dossier.

Julio Pereyra - inline image

Environnement et définition des tâches

Les dossiers du cabinet sont traités comme un corpus persistant, chaque tâche étant exécutée sur l’ensemble du système de fichiers. Les tâches sont elles-mêmes énumérées à partir des spécifications courtes des dossiers, les vérités de terrain étant calculées comme les dossiers ou documents contenant une combinaison particulière de caractéristiques. Les caractéristiques sous-jacentes d’un dossier ne sont pas montrées aux agents au moment de l’exécution ; ils doivent les retrouver dans le système de fichiers non structuré en combinant recherche et raisonnement.

Bien que les caractéristiques soient structurées, elles offrent une certaine flexibilité pour exprimer différents types de tâches de recherche et de raisonnement, notamment la recherche de précédents, la compréhension des tendances sectorielles et l’identification des préférences ou résultats au niveau des clients.

Julio Pereyra - inline image

Dans le format standard de LAB, les agents sont évalués par des juges LLM sur la base d’une grille d’évaluation qui décline la vérité de terrain en critères atomiques nécessaires à la réussite de la tâche.

Performances actuelles

Nous mesurons les performances de référence à l’aide du banc d’essai standard de LAB ainsi que de deux modèles de fondation performants : GPT-5.6-sol et Opus-4.8. Nous constatons que ces deux modèles peinent sur la performance globale des tâches, ainsi que sur la performance en termes de latence. Les deux résolvent un ensemble commun de tâches faciles et un ensemble propre de tâches plus difficiles, mais ils prennent cinq minutes ou plus par tâche et ne satisfont qu’environ la moitié de tous les critères d’évaluation.

En examinant les trajectoires, nous nous attendons à ce que le coût et la latence augmentent avec la taille du corpus, ce qui pose de réels problèmes pour les corpus à l’échelle d’entreprise, qui peuvent dépasser C&H de plusieurs ordres de grandeur.

Julio Pereyra - inline image

Les échecs s’expliquent en grande partie par l’incapacité à rechercher et à comprendre le corpus de manière exhaustive. Les modèles raisonnent correctement sur ce qu’ils trouvent, mais échouent souvent à trouver toutes les informations pertinentes.

Ce mode d’échec est particulièrement marqué sur les tâches qui exigent d’énumérer un grand nombre de dossiers, fichiers ou informations pertinents. À mesure que le nombre de points atomiques nécessaires à la réussite d’une tâche augmente, les deux modèles retombent à 0 % de réussite complète.

Julio Pereyra - inline image

Ce n’est pas un échec de la stratégie de recherche. Les agents trouvent systématiquement les informations centrales et satisfont environ la moitié des critères. C’est plutôt une incapacité à savoir quand continuer à chercher des informations supplémentaires. Cela suggère que les agents ne construisent pas un modèle intermédiaire efficace de ce que contient le corpus, qui leur permettrait de savoir quand leurs recherches sont suffisamment exhaustives.

Pour réussir les tâches sur des connaissances d’entreprise, il faut améliorer cette capacité spécifique.

Conclusion

Le travail juridique exige de comprendre comment un problème se rapporte aux travaux antérieurs : quel précédent est pertinent pour un client, ou à quoi ressemble la norme du marché. Les agents actuels tentent de reconstruire ces connaissances à partir de zéro pour chaque tâche.

C&H montre que cette stratégie est coûteuse et inefficace à l’échelle des connaissances d’entreprise. Nous pensons qu’une direction prometteuse pour améliorer les agents sur ce point est de leur permettre de construire au préalable des représentations plus riches du corpus — index, résumés, mémoire — et d’amortir le coût de ces représentations sur les exécutions suivantes. Comme l’environnement est persistant, ces coûts de compréhension ponctuels portent leurs fruits sur de nombreuses tâches. Nous partagerons bientôt davantage de détails sur nos travaux.

Les données de cabinet d’avocats synthétique que nous avons créées pour cet article sont disponibles dans notre dépôt open source. La version actuelle de C&H ne couvre qu’une partie du travail d’un cabinet d’avocats, et ses tâches ne représentent qu’un sous-ensemble des questions que les avocats pourraient vouloir poser à leur connaissance institutionnelle. Nous prévoyons d’enrichir les deux au fil du temps.

Nous tenons tout particulièrement à remercier les contributeurs suivants pour leurs retours sur le jeu de données et sur l’article : Dan Biderman (Engram), Jessy Lin (Engram), Mayee Chen (Engram), Neel Guha (Columbia Law School / Engram), Shizhe He (Engram), Calvin Qi (Harvey), Gabe Pereyra (Harvey)

Enregistrer en un clic

Lire les articles viraux en profondeur avec l’IA de YouMind

Enregistrez la source, posez des questions ciblées, résumez l’argument et transformez un article viral en notes réutilisables dans un seul espace de travail IA.

Découvrir YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux