實驗室:法律事務所知識庫

@ItsJulioPereyra
英語2026年8月07日
240K
193
22
17
380

TL;DR

Harvey AI 開源了 Calderwood & Harkness,這是一個包含 1.08 億個 token 的合成法律事務所環境,用於評估 AI Agents 在複雜法律檢索與推理任務上的表現。

我們正在將下一個 LAB 擴充開源:一間合成律師事務所 Calderwood & Harkness(以下簡稱「C&H」或「本所」)。這間事務所與 @engramlab 合作打造,內含超過 250 個客戶案件的工作成果,共計近 10,000 份檔案與超過 1 億個 token。

規格

數值

客戶

46

實務領域

15

案件

266

檔案

9,288

Token 數

108M

任務

250

評分方式

LLM 評審依各任務評分標準評分

資料集

https://github.com/harveyai/harvey-labs/tree/main/tasks/firm-knowledge

這個環境包含 250 個任務,涵蓋各種形式的知識檢索與推理。每個任務都模擬律師事務所可能要求其文件管理系統執行的檢索與推理任務類型,旨在對 Agent 的能力進行壓力測試——回答任何一個問題所需的背景資訊都分散各處,通常沒有可供 grep 的關鍵字,而且在 1 億個 token 的規模下,這個語料庫也大到無法徹底搜尋。

在這篇文章中,我們將說明律師事務所的組織方式、我們如何建立一個貼近實際且反映該結構的合成律師事務所環境,以及基準測試結果如何反映當前 Agent 在存取大規模知識語料庫方面的能力。

律師事務所的組織結構

律師事務所透過一套共同的關係來組織其工作:為其提供服務的客戶,以及為這些客戶處理的案件。我們以這些核心關係作為 C&H 的基礎。

Julio Pereyra - inline image

本所擁有 46 個虛構客戶,代表其所服務的不同企業與個人。我們刻意定義了多元的客戶,以涵蓋廣泛的工作類型——私募股權公司所需的法律服務與工業製造商截然不同。

本所透過不同的實務領域為這些客戶提供服務。這些實務領域代表不同類型的法律專業,涵蓋中大型律師事務所常見的業務組別。

本所實際執行的工作以客戶案件來呈現。一個客戶可以有多個案件,而一個案件可能涉及多位來自不同實務領域的律師。本所檔案系統中目前有 266 個進行中或已完成的案件。

這三個概念界定了 C&H 的範圍:為誰工作、能運用哪些專業知識,以及正在執行哪些具體專案。

建立資料集

每個客戶案件都始於一份定義事務所相關結構細節的規格:它屬於哪個客戶,以及專案的大致樣貌。接著,我們會加入一組具體的實質事實,這些事實是案件為奠定特定任務基礎所必須包含的內容。

這些事實可以是狹義的事實——例如特定協議中的 10% 託管條款或兩年競業禁止條款——也可以是結構性的事實:某件訴訟被駁回或和解。這些特徵讓我們能夠從簡短的規格中定義與審查基準真相(ground truth),而無須依賴龐大且非結構化的語料庫。整體而言,一個案件可以用大約 1,000 個 token 來描述,同時涵蓋許多與任務高度相關的特徵。

接著,我們的合成資料管線會將每份規格渲染成一個包含 10 到 200 份擬真文件的檔案系統(視案件狀態、規模與類型而定),這些文件會呈現相關特徵。特徵會綁定到特定文件上,以便特徵可以追溯至案件層級與檔案層級。案件本身是結構鬆散的文件集合,包含案件的主要面向:委任、各階段的執行、重大決策與最終結果。檔案系統的具體結構並未標準化,而是反映依案件類型、合夥人偏好以及每個案件實際發展歷程而定的邏輯組織方式。

Julio Pereyra - inline image

環境與任務定義

本所的案件被視為一個持續存在的語料庫,每個任務都會針對整個檔案系統執行。任務本身是依據案件的簡式規格來列舉,基準真相則以包含特定特徵組合的案件或文件來計算。案件的底層特徵在執行時不會顯示給 Agent 看,Agent 必須從非結構化的檔案系統中,透過搜尋與推理的組合自行發掘這些特徵。

雖然特徵本身是結構化的,但它們在表達各種類型的搜尋與推理任務時提供了足夠的彈性,包括搜尋判例、理解產業趨勢,以及辨識客戶層級的偏好或結果。

Julio Pereyra - inline image

按照標準 LAB 的形式,Agent 會由 LLM 評審根據評分標準進行評分,這些評分標準會將基準真相細分為成功完成任務所需的原子化標準。

目前表現

我們使用標準 LAB 測試框架以及兩個強大的基礎模型來衡量基準表現:GPT-5.6-sol 與 Opus-4.8。我們發現兩者在整體任務表現與延遲效率表現上都有困難。兩者都能解決一組共同的簡單任務,也各自能解決一組獨特的較難任務,但每個任務需花費五分鐘以上,且只能滿足大約一半的評分標準。

從檢視執行軌跡來看,我們預期成本與延遲都會隨語料庫規模增加而上升,這對真正的企業級語料庫構成實際問題,因為其規模可能比 C&H 大上數個數量級。

Julio Pereyra - inline image

失敗的原因大多可歸因於無法全面搜尋與理解語料庫。模型對於找到的資訊大多能正確推理,但往往無法找出所有相關的資訊片段。

這種失敗模式在需要列舉大量相關案件、檔案或資訊片段的任務上特別嚴重。隨著成功完成任務所需的原子化要點數量增加,兩個模型的完全通過率都退化至 0%。

Julio Pereyra - inline image

這並非搜尋策略的失敗。Agent 確實能穩定找到核心資訊,並滿足大約一半的標準。真正的問題在於它們不知道何時該繼續尋找更多資訊。這顯示 Agent 並未建立一個有效的語料庫內容中間模型,讓它們得以判斷搜尋是否已足夠徹底。

要成功完成企業知識相關的任務,就必須改善這項能力。

結論

法律工作需要理解問題與先前工作之間的關聯:哪些判例與客戶相關,或市場標準樣貌為何。如今的 Agent 試圖在每個任務中從零開始推導這些知識。

C&H 顯示,在企業知識規模下,這種策略既昂貴又薄弱。我們認為,要提升 Agent 這方面能力,一個有前景的方向是讓它們事先建立更豐富的語料庫表徵——索引、摘要、記憶——並將建立這些表徵的成本攤提到後續的執行中。由於環境是持續存在的,這些一次性的理解成本會在許多任務中獲得回報。我們很快就會分享更多相關工作。

我們為這篇文章建立的合成律師事務所資料已開放於我們的開源 repo 中。目前版本的 C&H 僅涵蓋律師事務所執行工作的一部分,其任務也僅代表律師可能想向其機構知識提出的問題的一部分。我們計畫隨著時間持續擴充兩者。

我們特別感謝以下貢獻者對資料集與文章的意見回饋:Dan Biderman (Engram)、Jessy Lin (Engram)、Mayee Chen (Engram)、Neel Guha (Columbia Law School / Engram)、Shizhe He (Engram)、Calvin Qi (Harvey)、Gabe Pereyra (Harvey)

一鍵儲存

使用 YouMind AI 深度閱讀爆款文章

保存原文、追問細節、總結觀點,並在一個 AI 工作空間裡把爆款文章沉澱成可複用筆記。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章