LAB: Wissen einer Anwaltskanzlei

240K
193
22
17
380

TL;DR

Harvey AI veröffentlicht Calderwood & Harkness als Open Source – eine synthetische Umgebung für Anwaltskanzleien mit 108 Mio. Token, um KI-Agenten bei komplexen Aufgaben der juristischen Recherche und Argumentation zu bewerten.

Wir machen unsere nächste LAB-Erweiterung als Open Source verfügbar: eine synthetische Anwaltskanzlei, Calderwood & Harkness („C&H“ oder „die Kanzlei“). In Zusammenarbeit mit @engramlab erstellt, enthält die Kanzlei Arbeitsergebnisse aus mehr als 250 Mandaten, die aus fast 10.000 Dateien und mehr als 100 Millionen Tokens bestehen.

Spezifikation

Wert

Mandanten

46

Fachbereiche

15

Mandate

266

Dateien

9.288

Tokens

108M

Aufgaben

250

Bewertung

LLM-Judge anhand von Rubriken pro Aufgabe

Datensatz

https://github.com/harveyai/harvey-labs/tree/main/tasks/firm-knowledge

Die Umgebung enthält 250 Aufgaben, die verschiedene Formen des Wissensabrufs und der Schlussfolgerung abdecken. Jede Aufgabe spiegelt die Art von Abruf- und Reasoning-Aufgaben wider, die eine Kanzlei an ihre Dokumentenmanagementsysteme stellen könnte, und ist als Belastungstest für Agentenfähigkeiten konzipiert – der Kontext, der zur Beantwortung einer dieser Fragen benötigt wird, ist verteilt, es gibt oft keine Keywords, nach denen man mit grep suchen kann, und mit 100 Millionen Tokens ist das Korpus zu groß, um es erschöpfend zu durchsuchen.

In diesem Beitrag beschreiben wir, wie Anwaltskanzleien strukturiert sind, wie wir eine fundierte, synthetische Kanzlei-Umgebung aufgebaut haben, die diese Struktur widerspiegelt, und was Basis-Läufe über die Fähigkeit aktueller Agenten verraten, auf skalierte Wissenskorpora zuzugreifen.

Wie eine Anwaltskanzlei strukturiert ist

Anwaltskanzleien organisieren ihre Arbeit über eine gemeinsame Reihe von Beziehungen: Mandanten, für die sie arbeiten, und Mandate, an denen sie für diese Mandanten arbeiten. Wir verankern C&H in diesen Kernbeziehungen.

Julio Pereyra - inline image

Die Kanzlei hat 46 fiktive Mandanten, die verschiedene Unternehmen und Einzelpersonen repräsentieren, für die sie arbeitet. Wir definieren bewusst vielfältige Mandanten, um ein breites Spektrum an Arbeit zu erhalten – Private-Equity-Firmen benötigen andere Rechtsdienstleistungen als Industriehersteller.

Die Kanzlei arbeitet für diese Mandanten in verschiedenen Fachbereichen. Diese Praxisbereiche repräsentieren verschiedene Arten von juristischem Fachwissen, das sich über gängige Praxisgruppen mittelgroßer und großer Anwaltskanzleien erstreckt.

Die eigentliche Arbeit der Kanzlei wird durch Mandate repräsentiert. Ein Mandant kann viele Mandate haben, und Mandate können Anwälte aus mehreren Fachbereichen umfassen. Die Kanzlei hat derzeit 266 laufende oder abgeschlossene Mandate in ihrem Dateisystem.

Diese drei Konzepte legen den Umfang von C&H fest: Für wen arbeitet die Kanzlei, welches Fachwissen kann sie einbringen, und an welchen konkreten Projekten arbeitet sie?

Aufbau des Datensatzes

Jedes Mandat beginnt mit einer Spezifikation, die relevante strukturelle Details der Kanzlei definiert: für welchen Mandanten es ist und welche grundlegende Form das Projekt hat. Diese werden dann um eine konkrete Menge inhaltlicher Fakten ergänzt, die das Mandat enthalten muss, um eine bestimmte Aufgabe zu verankern.

Das können enge Fakten sein – ein 10-prozentiges Treuhandkonto oder ein zweijähriges Wettbewerbsverbot in einer bestimmten Vereinbarung – oder strukturelle: ein Rechtsstreit wurde abgewiesen oder beigelegt. Diese Merkmale ermöglichen es uns, Ground-Truths anhand kurzer Spezifikationen zu definieren und zu überprüfen, statt anhand eines großen, unstrukturierten Korpus. Insgesamt lässt sich ein Mandat mit etwa 1.000 Tokens spezifizieren und trägt dabei viele aufgabenrelevante Merkmale.

Unsere synthetische Datenpipeline überführt dann jede Spezifikation in ein Dateisystem aus 10–200 realistischen Dokumenten (abhängig vom Status, der Größe und dem Typ des Mandats), die die relevanten Merkmale ausdrücken. Merkmale sind an bestimmte Dokumente gebunden, sodass sie sowohl auf Mandats- als auch auf Dateiebene nachverfolgt werden können. Die Mandate selbst sind lose strukturierte Sammlungen von Dateien, die die wichtigsten Aspekte eines Mandats enthalten: Beauftragung, Durchführung von Phasen, wichtige Entscheidungen und endgültige Ergebnisse. Das genaue Dateisystem ist nicht standardisiert und spiegelt eine logische Organisation wider, die auf Mandatstypen, Partnerpräferenzen und dem Verlauf des jeweiligen Mandats basiert.

Julio Pereyra - inline image

Umgebung und Aufgabendefinition

Die Mandate der Kanzlei werden als persistentes Korpus behandelt, wobei jede Aufgabe gegen das gesamte Dateisystem läuft. Die Aufgaben selbst werden anhand der Kurzspezifikationen der Mandate aufgelistet, wobei Ground-Truths als Mandate oder Dokumente berechnet werden, die eine bestimmte Mischung von Merkmalen enthalten. Die zugrunde liegenden Merkmale eines Mandats werden den Agenten zur Laufzeit nicht angezeigt; sie müssen sie aus dem unstrukturierten Dateisystem durch eine Kombination aus Suche und Schlussfolgerung zurückgewinnen.

Obwohl die Merkmale selbst strukturiert sind, ermöglichen sie Flexibilität bei der Formulierung verschiedener Arten von Such- und Reasoning-Aufgaben. Dazu gehören die Suche nach Präzedenzfällen, das Verständnis von Branchentrends und die Identifizierung von Präferenzen oder Ergebnissen auf Mandantenebene.

Julio Pereyra - inline image

In der standardmäßigen LAB-Form werden Agenten mithilfe von LLM-Judges anhand einer Rubrik bewertet, die die Ground-Truth in atomare Kriterien aufschlüsselt, die für den erfolgreichen Abschluss der Aufgabe erforderlich sind.

Aktuelle Leistung

Wir messen die Baseline-Leistung mit dem standardmäßigen LAB-Harness sowie zwei starken Basismodellen: GPT-5.6-sol und Opus-4.8. Wir stellen fest, dass beide sowohl bei der Gesamtaufgabenleistung als auch bei der latenzwirksamen Leistung Schwierigkeiten haben. Beide lösen eine gemeinsame Menge einfacher Aufgaben und eine jeweils eigene Menge schwierigerer Aufgaben, benötigen aber fünf oder mehr Minuten pro Aufgabe und erfüllen nur etwa die Hälfte aller Bewertungskriterien.

Bei der Überprüfung der Trajektorien würden wir erwarten, dass sowohl Kosten als auch Latenz mit der Korpusgröße zunehmen, was echte Probleme für Korpora auf Enterprise-Ebene darstellt, die C&H um mehrere Größenordnungen übertreffen können.

Julio Pereyra - inline image

Fehler lassen sich größtenteils durch die Unfähigkeit erklären, das Korpus umfassend zu durchsuchen und zu verstehen. Modelle schlussfolgern meist korrekt über das, was sie finden, aber es gelingt ihnen oft nicht, jede relevante Information zu finden.

Diese Fehlerform ist besonders ausgeprägt bei Aufgaben, die die Aufzählung einer großen Menge relevanter Mandate, Dateien oder Informationen erfordern. Wenn die Anzahl der atomaren Punkte, die für den erfolgreichen Abschluss der Aufgabe erforderlich sind, zunimmt, fallen beide Modelle auf eine All-Pass-Rate von 0 % zurück.

Julio Pereyra - inline image

Das ist kein Versagen der Suchstrategie. Agenten finden durchgängig die Kerninformationen und erfüllen etwa die Hälfte der Kriterien. Es ist vielmehr ein Versagen zu erkennen, wann sie weiter nach zusätzlichen Informationen suchen müssen. Das deutet darauf hin, dass Agenten kein effektives Zwischenmodell davon aufbauen, was das Korpus enthält, das ihnen ermöglicht zu wissen, wann ihre Suchen ausreichend erschöpfend waren.

Ein erfolgreicher Aufgabenabschluss bei Enterprise-Wissen erfordert die Verbesserung genau dieser Fähigkeit.

Fazit

Juristische Arbeit erfordert ein Verständnis dafür, wie ein Problem mit früheren Arbeiten zusammenhängt: welcher Präzedenzfall für einen Mandanten relevant ist oder wie der Marktstandard aussieht. Die heutigen Agenten versuchen, dieses Wissen bei jeder Aufgabe von Grund auf neu abzuleiten.

C&H zeigt, dass diese Strategie im Maßstab von Enterprise-Wissen kostspielig und schwach ist. Wir denken, dass ein vielversprechender Ansatz zur Verbesserung von Agenten in dieser Hinsicht darin besteht, ihnen zu erlauben, von vornherein reichhaltigere Repräsentationen des Korpus aufzubauen – Indizes, Zusammenfassungen, Memory – und die Kosten für den Aufbau solcher Repräsentationen über nachfolgende Läufe zu amortisieren. Da die Umgebung persistent ist, zahlen sich diese einmaligen Verständniskosten über viele Aufgaben hinweg aus. Wir werden hier bald mehr über unsere Arbeit berichten.

Die synthetischen Kanzleidaten, die wir für diesen Beitrag erstellt haben, sind in unserem Open-Source-Repository verfügbar. Die aktuelle Version von C&H deckt nur einen Teil der Arbeit einer Anwaltskanzlei ab, und ihre Aufgaben repräsentieren nur eine Teilmenge der Fragen, die Anwälte an ihr institutionelles Wissen stellen möchten. Wir planen, beide im Laufe der Zeit zu erweitern.

Wir möchten insbesondere den folgenden Mitwirkenden für ihr Feedback zum Datensatz und zum Beitrag danken: Dan Biderman (Engram), Jessy Lin (Engram), Mayee Chen (Engram), Neel Guha (Columbia Law School / Engram), Shizhe He (Engram), Calvin Qi (Harvey), Gabe Pereyra (Harvey)

Mit einem Klick speichern

Virale Artikel mit YouMind per KI tief lesen

Speichere die Quelle, stelle gezielte Fragen, fasse die Argumentation zusammen und verwandle einen viralen Artikel in wiederverwendbare Notizen in einem einzigen KI-Arbeitsbereich.

YouMind entdecken
Für Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mühsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum Entschlüsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken