Мы открываем исходный код нашего следующего расширения LAB: синтетической юридической фирмы Calderwood & Harkness («C&H» или «фирма»). Созданная в сотрудничестве с @engramlab, фирма содержит рабочие материалы по более чем 250 клиентским делам, включая почти 10 000 файлов и более 100 миллионов токенов.
Параметр | Значение |
|---|---|
Клиенты | 46 |
Практики | 15 |
Дела | 266 |
Файлы | 9 288 |
Токены | 108M |
Задачи | 250 |
Оценка | LLM-судья по рубрикам для каждой задачи |
Датасет | https://github.com/harveyai/harvey-labs/tree/main/tasks/firm-knowledge |
Среда содержит 250 задач, охватывающих различные формы поиска информации и рассуждений. Каждая задача повторяет те типы задач на поиск и анализ, которые фирма может поставить перед своими системами управления документами, и задумана как стресс-тест возможностей агентов: контекст, необходимый для ответа на любой из этих вопросов, распределён по всему корпусу, часто нет ключевых слов, по которым можно вести grep-поиск, а при 100 миллионах токенов корпус слишком велик для исчерпывающего поиска.
В этом посте мы рассказываем, как устроены юридические фирмы, как мы создали синтетическую среду юридической фирмы, привязанную к этой структуре, и что показывают базовые прогоны о способности современных агентов работать с масштабными корпусами знаний.
Как устроена юридическая фирма
Юридические фирмы организуют свою работу через общий набор связей: клиенты, для которых они работают, и дела, которые они ведут для этих клиентов. Мы заложили в основу C&H эти ключевые отношения.

У фирмы 46 вымышленных клиентов — различные корпорации и частные лица, для которых она работает. Мы намеренно создали разнообразных клиентов, чтобы охватить широкий спектр задач: PE-фондам требуются иные юридические услуги, чем промышленным производителям.
Фирма работает с этими клиентами по разным направлениям практики. Эти направления представляют собой разные виды юридической экспертизы и охватывают типичные практики средних и крупных юридических фирм.
Фактическая работа фирмы выражается в клиентских делах. У клиента может быть много дел, и в делах могут участвовать юристы из разных направлений практики. Сейчас в файловой системе фирмы насчитывается 266 текущих или завершённых дел.
Эти три понятия задают масштаб C&H: для кого фирма работает, какую экспертизу она может применить и над какими конкретными проектами работает.
Создание датасета
Каждое клиентское дело начинается со спецификации, задающей структурные параметры фирмы: для какого клиента ведётся дело и каков общий контур проекта. Затем спецификация дополняется конкретным набором существенных фактов, которые должны содержаться в деле, чтобы на них можно было опереть конкретную задачу.
Это могут быть узкие факты — эскроу в 10% или двухлетний запрет на конкуренцию в конкретном соглашении — или структурные: иск был отклонён или урегулирован. Эти признаки позволяют нам определять и проверять эталонные ответы по коротким спецификациям, а не по большому неструктурированному корпусу. В целом дело можно описать примерно в 1 000 токенах, при этом оно будет содержать множество значимых для задачи признаков.
Затем наш конвейер синтетических данных превращает каждую спецификацию в файловую систему из 10–200 реалистичных документов (в зависимости от состояния, размера и типа дела), в которых отражены соответствующие признаки. Признаки привязаны к конкретным документам, что позволяет проследить их на уровне и дела, и файла. Сами дела представляют собой слабо структурированные наборы файлов, содержащие основные аспекты дела: поручение, выполнение этапов, ключевые решения и итоги. Конкретная файловая система не стандартизирована и отражает логичную организацию, зависящую от типа дела, предпочтений партнёра и того, как именно разворачивалось дело.

Среда и определение задач
Дела фирмы рассматриваются как постоянный корпус, и каждая задача выполняется по всей файловой системе. Сами задачи перечисляются на основе кратких спецификаций дел, а эталонные ответы вычисляются как дела или документы, содержащие определённое сочетание признаков. Лежащие в основе дела признаки не показываются агентам во время выполнения: они должны восстановить их из неструктурированной файловой системы с помощью комбинации поиска и рассуждений.
Хотя сами признаки структурированы, они дают гибкость при постановке различных типов задач на поиск и анализ. Среди них — поиск прецедентов, понимание отраслевых тенденций и выявление предпочтений или результатов на уровне клиентов.

В стандартном формате LAB агенты оцениваются LLM-судьями по рубрике, которая разворачивает эталонный ответ в атомарные критерии, необходимые для успешного выполнения задачи.
Текущие результаты
Мы измеряем базовую производительность с помощью стандартного стенда LAB, а также двух сильных фундаментальных моделей: GPT-5.6-sol и Opus-4.8. Мы обнаружили, что обе модели испытывают трудности как с общим выполнением задач, так и с эффективностью по задержке. Обе решают общий набор простых задач и уникальный набор более сложных, но тратят на каждую задачу пять и более минут и удовлетворяют лишь около половины всех критериев оценки.
Анализируя траектории, мы ожидаем, что и стоимость, и задержка будут расти с увеличением размера корпуса, что создаёт реальные проблемы для корпусов действительно корпоративного масштаба, которые могут превышать C&H на несколько порядков.

Неудачи во многом объясняются неспособностью агентов исчерпывающе искать и понимать корпус. Модели в основном верно рассуждают о том, что находят, но часто не могут найти всю релевантную информацию.
Этот тип сбоя особенно выражен в задачах, требующих перечисления большого набора релевантных дел, файлов или фрагментов информации. По мере увеличения числа атомарных элементов, необходимых для успешного выполнения задачи, обе модели регрессируют к 0% полного прохождения.

Это не провал поисковой стратегии. Агенты стабильно находят ключевую информацию и удовлетворяют примерно половину критериев. Это скорее неспособность понять, когда следует продолжать искать дополнительную информацию. Это говорит о том, что агенты не строят эффективную промежуточную модель содержимого корпуса, которая позволяла бы им понимать, когда поиск был достаточно исчерпывающим.
Для успешного выполнения задач на корпоративных базах знаний необходимо развивать именно эту способность.
Заключение
Юридическая работа требует понимания того, как задача соотносится с предыдущей работой: какой прецедент релевантен для клиента или как выглядит рыночный стандарт. Сегодняшние агенты пытаются извлекать эти знания с нуля при каждой задаче.
C&H показывает, что эта стратегия дорогостояща и слаба в масштабе корпоративных знаний. Мы считаем, что перспективное направление улучшения агентов в этом отношении — позволить им заранее строить более богатые представления корпуса: индексы, сводки, память — и амортизировать затраты на создание таких представлений на последующих запусках. Поскольку среда постоянна, эти разовые затраты на понимание окупаются на множестве задач. Скоро мы расскажем о нашей работе подробнее.
Синтетические данные юридической фирмы, созданные для этого поста, доступны в нашем репозитории с открытым исходным кодом. Текущая версия C&H покрывает лишь часть работы, выполняемой юридической фирмой, а её задачи представляют лишь подмножество вопросов, которые юристы могут захотеть задать своей институциональной базе знаний. Со временем мы планируем расширять и то, и другое.
Мы хотели бы особенно поблагодарить следующих участников за обратную связь по датасету и тексту: Dan Biderman (Engram), Jessy Lin (Engram), Mayee Chen (Engram), Neel Guha (Columbia Law School / Engram), Shizhe He (Engram), Calvin Qi (Harvey), Gabe Pereyra (Harvey)





