实验室:律所知识库

@ItsJulioPereyra
英语2026年8月07日
240K
193
22
17
380

TL;DR

Harvey AI 开源了 Calderwood & Harkness,这是一个包含 1.08 亿 token 的合成律所环境,用于评估 AI Agents 在复杂法律检索和推理任务中的表现。

我们正在开源下一个 LAB 扩展:一家合成律师事务所 Calderwood & Harkness(“C&H”或“事务所”)。该事务所与 @engramlab 合作构建,包含 250 多个客户案件的工作成果,涵盖近 10,000 个文件和超过一亿个 Token。

规格

数值

客户

46

业务领域

15

案件

266

文件

9,288

Token

108M

任务

250

评分

LLM 根据每项任务的量规进行评判

数据集

https://github.com/harveyai/harvey-labs/tree/main/tasks/firm-knowledge

该环境包含 250 项任务,涵盖各种形式的知识检索与推理。每项任务都模拟了律师事务所可能要求其文档管理系统执行的检索和推理任务类型,旨在对 Agent 能力进行压力测试——回答其中任何一个问题所需的上下文都是分散的,通常没有可供 grep 的关键词,而且在超过一亿个 Token 的语料库规模下,穷举搜索已经不可行。

在这篇文章中,我们介绍了律师事务所的组织架构,如何构建一个以现实为基础、复现该架构的合成律师事务所环境,以及基线运行揭示了当前 Agent 在规模化知识语料库访问方面的哪些能力。

律师事务所的组织架构

律师事务所通过一套共同的关系统一组织工作:为哪些客户服务,以及为客户处理哪些案件。我们以这些核心关系为基础构建 C&H。

Julio Pereyra - inline image

该事务所有 46 个虚构客户,代表其服务的不同企业和个人。我们有意识地定义多样化的客户,以获得广泛的工作类型——PE 公司所需的法律服务与工业制造商截然不同。

事务所跨多个不同的业务领域为客户提供服务。这些业务领域代表了不同类型的法律专业知识,涵盖中大型律所常见的业务团队。

事务所实际完成的工作通过客户案件来体现。一个客户可以有多个案件,案件可能涉及多个业务领域的律师。该事务所目前在文件系统中拥有 266 个进行中或已完成的案件。

这三个概念界定了 C&H 的范围:为谁工作、能运用哪些专业知识、正在开展哪些具体项目。

构建数据集

每个客户案件都从一份规范开始,该规范定义了相关的事务所结构细节:服务于哪个客户,以及项目的整体形态。随后,一系列具体的实质性事实会被补充进来,这些是案件为支撑特定任务而必须包含的内容。

这些事实可以是具体的事实——特定协议中的 10% 托管金或两年竞业限制——也可以是结构性事实:某起诉讼被驳回或和解。这些特性使我们能够基于简短的规范来定义和审查基准事实,而无需面对庞大的非结构化语料库。总体而言,一个案件可以用约 1,000 个 Token 来完整描述,同时承载许多与任务密切相关的特征。

我们的合成数据管道随后将每个规范生成为一个包含 10-200 个真实文档的文件系统(取决于案件状态、规模和类型),这些文档表达了相关特征。特征被绑定到特定文档上,以便特征可以在案件和文件两个层级进行追溯。案件本身是松散结构的文件集合,包含案件的主要方面:委托、阶段执行、重大决策和最终结果。具体的文件系统并非标准化,而是反映了依据案件类型、合伙人偏好以及具体案件实际进程而形成的合乎逻辑的组织方式。

Julio Pereyra - inline image

环境与任务定义

事务所的案件被视为一个持久化语料库,每项任务都针对整个文件系统运行。任务本身根据案件的简式规范进行枚举,基准事实则基于包含特定特征组合的案件或文档计算得出。案件的基础特征在运行时不会展示给 Agent,它们必须通过搜索与推理相结合的方式从非结构化文件系统中恢复这些特征。

尽管特征本身是结构化的,但它们在表达各种类型的搜索和推理任务时具有很大的灵活性。这些任务包括搜索先例、理解行业趋势,以及识别客户层面的偏好或结果。

Julio Pereyra - inline image

按照标准 LAB 形式,Agent 由 LLM 评判器根据量规进行评分,量规将基准事实细化为成功完成任务所必需的原子级标准。

当前表现

我们使用 标准 LAB 测试框架 以及两个强大的基础模型来衡量基线表现:GPT-5.6-sol 和 Opus-4.8。我们发现,两者在整体任务表现以及延迟有效性方面都表现不佳。两者都能解决一组共同的简单任务,以及一组各自独有的较难任务,但每项任务耗时五分钟或更长时间,且只能满足约一半的评分标准。

从对执行轨迹的回顾来看,我们预计成本和延迟都会随语料库规模的增大而上升,这对真正的企业级语料库构成了实际挑战,因为其规模可能比 C&H 高出多个数量级。

Julio Pereyra - inline image

失败在很大程度上源于无法全面搜索和理解语料库。模型大多能对其找到的内容进行正确推理,但往往无法找到所有相关信息。

这种失败模式在需要枚举大量相关案件、文件或信息条目的任务中尤为严重。随着成功完成任务所需的原子级要点数量增加,两个模型的完全通过率都下降到 0%。

Julio Pereyra - inline image

这不是搜索策略的失败。Agent 始终能够找到核心信息,满足约一半的标准。相反,这是不知道何时应该继续寻找更多信息的失败。这表明 Agent 没有构建出关于语料库内容的有效中间模型,因而无法判断搜索是否已经足够彻底。

要在企业知识层面成功完成任务,需要改进这一特定能力。

结论

法律工作需要理解问题与先前工作之间的关系:哪些先例与客户相关,市场标准又是什么样的。如今的 Agent 试图在每项任务上都从零推导这些知识。

C&H 表明,这种策略在企业知识规模下既成本高昂又效果薄弱。我们认为,提升 Agent 这一能力的一个有前景的方向,是让它们预先构建更丰富的语料库表示——索引、摘要、记忆——并在后续运行中分摊构建这些表示的成本。由于环境是持久化的,这些一次性的理解成本会在众多任务中得到回报。我们很快会分享更多相关进展。

我们为这篇文章创建的合成律师事务所数据已发布在我们的开源仓库中。当前版本的 C&H 仅涵盖律师事务所工作的一部分,其任务也仅仅是律师可能想向其机构知识提出的问题的一个子集。我们计划随着时间推移逐步扩展这两方面。

我们特别感谢以下贡献者对数据集和文章撰写的反馈:Dan Biderman (Engram)、Jessy Lin (Engram)、Mayee Chen (Engram)、Neel Guha (Columbia Law School / Engram)、Shizhe He (Engram)、Calvin Qi (Harvey)、Gabe Pereyra (Harvey)

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章