LAB: Conhecimento de Escritório de Advocacia

@ItsJulioPereyra
INGLÊS07 de ago. de 2026
240K
193
22
17
380

TL;DR

A Harvey AI disponibiliza em código aberto o Calderwood & Harkness, um ambiente sintético de escritório de advocacia com 108 milhões de tokens para avaliar agentes de IA em tarefas complexas de recuperação e raciocínio jurídico.

Estamos abrindo o código da nossa próxima expansão do LAB: um escritório de advocacia sintético, a Calderwood & Harkness (“C&H” ou “o escritório”). Construído em colaboração com @engramlab, o escritório contém materiais de trabalho de mais de 250 casos de clientes, totalizando quase 10.000 arquivos e mais de 100 milhões de tokens.

Especificação

Valor

Clientes

46

Áreas de Prática

15

Casos

266

Arquivos

9.288

Tokens

108M

Tarefas

250

Avaliação

Julgamento por LLM com rubricas por tarefa

Conjunto de dados

https://github.com/harveyai/harvey-labs/tree/main/tasks/firm-knowledge

O ambiente contém 250 tarefas que abrangem diversas formas de recuperação de conhecimento e raciocínio. Cada tarefa reflete o tipo de tarefas de recuperação e raciocínio que um escritório poderia exigir de seus sistemas de gerenciamento de documentos e é projetada para ser um teste de estresse das capacidades dos agentes — o contexto necessário para responder a qualquer uma dessas perguntas está distribuído, muitas vezes não há palavras-chave para buscar, e com 100 milhões de tokens o corpus é grande demais para uma busca exaustiva.

Neste post, descrevemos como os escritórios de advocacia são estruturados, como construímos um ambiente sintético e fundamentado de escritório de advocacia que espelha essa estrutura e o que as execuções de linha de base revelam sobre a capacidade dos agentes atuais de acessar corpora de conhecimento em escala.

Como um Escritório de Advocacia é Estruturado

Os escritórios de advocacia organizam seu trabalho a partir de um conjunto comum de relações: clientes para quem trabalham e os casos em que atuam para esses clientes. Fundamentamos a C&H nessas relações centrais.

Julio Pereyra - inline image

O escritório tem 46 clientes fictícios, representando diferentes empresas e pessoas físicas para quem trabalha. Definimos intencionalmente clientes diversos para obter uma ampla gama de trabalho — firmas de private equity (PE) exigem serviços jurídicos diferentes de fabricantes industriais.

O escritório atende esses clientes em diferentes áreas de prática. Essas áreas de prática representam diferentes tipos de expertise jurídica, abrangendo os grupos de prática comuns em escritórios de advocacia de médio e grande porte.

O trabalho efetivamente realizado pelo escritório é representado pelos casos dos clientes. Um cliente pode ter muitos casos, e os casos podem envolver advogados de múltiplas áreas de prática. Atualmente, o escritório tem 266 casos em andamento ou concluídos em seu sistema de arquivos.

Esses três conceitos definem o escopo da C&H: para quem ela trabalha, qual expertise pode aplicar e em quais projetos específicos está atuando.

Construindo o Conjunto de Dados

Cada caso de cliente começa com uma especificação que define os detalhes estruturais relevantes do escritório: para qual cliente é e qual é o formato geral do projeto. Em seguida, eles são enriquecidos com um conjunto concreto de fatos substantivos que o caso deve conter para fundamentar uma tarefa específica.

Esses fatos podem ser específicos — um depósito em garantia de 10% ou uma cláusula de não concorrência de dois anos em um acordo específico — ou estruturais: uma ação foi arquivada ou encerrada por acordo. Esses atributos nos permitem definir e revisar os ground truths a partir de especificações curtas, em vez de um corpus grande e não estruturado. No geral, um caso pode ser especificado em cerca de 1.000 tokens, carregando muitos atributos relevantes para as tarefas.

Nosso pipeline de dados sintéticos então converte cada especificação em um sistema de arquivos com 10 a 200 documentos realistas (dependendo do estado, tamanho e tipo do caso) que expressam os atributos relevantes. Os atributos são vinculados a documentos específicos para que possam ser rastreados tanto no nível do caso quanto no nível do arquivo. Os casos em si são coleções de arquivos com estrutura flexível que contêm os principais aspectos de um caso: contratação, execução de fases, decisões importantes e resultados finais. O sistema de arquivos exato não é padronizado e reflete a organização lógica baseada nos tipos de caso, na preferência dos sócios e em como cada caso específico se desenvolveu.

Julio Pereyra - inline image

Ambiente e Definição de Tarefas

Os casos do escritório são tratados como um corpus persistente, com cada tarefa executada contra o sistema de arquivos inteiro. As tarefas são enumeradas com base nas especificações resumidas dos casos, e os ground truths são calculados como casos ou documentos que contêm uma combinação específica de atributos. Os atributos subjacentes de um caso não são mostrados aos agentes em tempo de execução; eles precisam recuperá-los do sistema de arquivos não estruturado por meio de uma combinação de busca e raciocínio.

Embora os atributos em si sejam estruturados, eles permitem flexibilidade para expressar vários tipos de tarefas de busca e raciocínio. Isso inclui pesquisar precedentes, entender tendências do setor e identificar preferências ou resultados no nível do cliente.

Julio Pereyra - inline image

No formato padrão do LAB, os agentes são avaliados por juízes LLM com base em uma rubrica que desdobra o ground truth em critérios atômicos necessários para a conclusão bem-sucedida da tarefa.

Desempenho Atual

Medimos o desempenho de linha de base usando o harness padrão do LAB, além de dois modelos de fundação fortes: GPT-5.6-sol e Opus-4.8. Descobrimos que ambos têm dificuldades no desempenho geral das tarefas e também no desempenho em relação à latência. Ambos resolvem um conjunto comum de tarefas fáceis e um conjunto único de tarefas mais difíceis, mas levam cinco ou mais minutos por tarefa e atendem apenas a cerca de metade de todos os critérios de avaliação.

Ao revisar as trajetórias, esperamos que tanto o custo quanto a latência aumentem com o tamanho do corpus, o que representa problemas reais para corpora de escala empresarial real que podem exceder a C&H em múltiplas ordens de grandeza.

Julio Pereyra - inline image

As falhas são, em grande parte, explicáveis pela incapacidade de buscar e compreender o corpus de forma abrangente. Os modelos geralmente raciocinam corretamente sobre o que encontram, mas muitas vezes não conseguem encontrar todas as informações relevantes.

Esse modo de falha é particularmente grave em tarefas que exigem a enumeração de um grande conjunto de casos, arquivos ou informações relevantes. À medida que o número de pontos atômicos necessários para a conclusão bem-sucedida da tarefa aumenta, ambos os modelos regridem para 0% de aprovação total.

Julio Pereyra - inline image

Isso não é uma falha da estratégia de busca. Os agentes encontram consistentemente as informações centrais e atendem a cerca de metade dos critérios. É, em vez disso, uma falha em saber quando continuar procurando por informações adicionais. Isso sugere que os agentes não constroem um modelo intermediário eficaz do que o corpus contém, que lhes permita saber quando suas buscas foram suficientemente exaustivas.

Concluir tarefas com sucesso diante do conhecimento empresarial exige melhorar essa capacidade específica.

Conclusão

O trabalho jurídico exige compreender como um problema se relaciona ao trabalho anterior: qual precedente é relevante para um cliente ou como é o padrão de mercado. Os agentes atuais tentam obter esse conhecimento do zero em cada tarefa.

A C&H mostra que essa estratégia é cara e frágil em escala de conhecimento empresarial. Acreditamos que um caminho promissor para melhorar os agentes nessa capacidade é permitir que eles construam representações mais ricas do corpus antecipadamente — índices, resumos, memória — e amortizem o custo de construir essas representações ao longo das execuções subsequentes. Como o ambiente é persistente, esses custos únicos de compreensão se pagam em muitas tarefas. Em breve, compartilharemos mais sobre nosso trabalho aqui.

Os dados do escritório de advocacia sintético que criamos para este post estão disponíveis em nosso repositório de código aberto. A versão atual da C&H cobre apenas parte do trabalho realizado por um escritório de advocacia, e suas tarefas representam apenas um subconjunto das perguntas que os advogados podem querer fazer sobre seu conhecimento institucional. Pretendemos expandir ambos ao longo do tempo.

Gostaríamos de agradecer especialmente aos seguintes colaboradores por seus feedbacks sobre o conjunto de dados e o texto: Dan Biderman (Engram), Jessy Lin (Engram), Mayee Chen (Engram), Neel Guha (Columbia Law School / Engram), Shizhe He (Engram), Calvin Qi (Harvey), Gabe Pereyra (Harvey)

Salvar com um clique

Faça leitura profunda de artigos virais com IA no YouMind

Salve a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis em um único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais