LAB: Conhecimento de Escritório de Advocacia

240K
193
22
17
380

TL;DR

A Harvey AI disponibiliza em código aberto o Calderwood & Harkness, um ambiente sintético de escritório de advocacia com 108 milhões de tokens para avaliar agentes de IA em tarefas complexas de recuperação e raciocínio jurídico.

Estamos disponibilizando como código aberto a nossa próxima expansão do LAB: um escritório de advocacia sintético, Calderwood & Harkness (“C&H” ou “o escritório”). Construído em colaboração com @engramlab, o escritório contém produtos de trabalho de mais de 250 casos de clientes, totalizando quase 10.000 arquivos e mais de 100 milhões de tokens.

Especificação

Valor

Clientes

46

Áreas de atuação

15

Casos

266

Arquivos

9.288

Tokens

108M

Tarefas

250

Avaliação

Juiz de LLM com rubricas por tarefa

Conjunto de dados

https://github.com/harveyai/harvey-labs/tree/main/tasks/firm-knowledge

O ambiente contém 250 tarefas que abrangem várias formas de recuperação de conhecimento e raciocínio. Cada tarefa espelha o tipo de recuperação e raciocínio que um escritório poderia exigir de seus sistemas de gerenciamento de documentos e é projetada para ser um teste de estresse das capacidades dos agentes — o contexto necessário para responder a qualquer uma dessas perguntas está distribuído, muitas vezes não há palavras-chave para procurar, e com 100 milhões de tokens o corpus é grande demais para ser pesquisado de forma exaustiva.

Neste post, descrevemos como os escritórios de advocacia são estruturados, como construímos um ambiente de escritório de advocacia sintético e fundamentado que espelha essa estrutura, e o que as execuções de referência revelam sobre a capacidade dos agentes atuais de acessar corpora de conhecimento em escala.

Como um Escritório de Advocacia É Estruturado

Os escritórios de advocacia organizam seu trabalho por meio de um conjunto comum de relações: clientes para os quais trabalham e casos em que trabalham para esses clientes. Fundamentamos a C&H nessas relações centrais.

Julio Pereyra - inline image

O escritório tem 46 clientes fictícios, representando diferentes corporações e indivíduos para quem trabalha. Definimos intencionalmente clientes diversos para obter uma ampla gama de trabalho — empresas de private equity exigem serviços jurídicos diferentes dos fabricantes industriais.

O escritório trabalha para esses clientes em diferentes áreas de atuação. Essas áreas de atuação representam diferentes tipos de conhecimento jurídico especializado, abrangendo grupos de prática comuns em escritórios de advocacia de médio e grande porte.

O trabalho real realizado pelo escritório é representado por casos de clientes. Um cliente pode ter muitos casos, e os casos podem envolver advogados de múltiplas áreas de atuação. O escritório atualmente tem 266 casos em andamento ou concluídos em seu sistema de arquivos.

Esses três conceitos definem o escopo da C&H: para quem ela trabalha, qual conhecimento pode aplicar e em quais projetos específicos está trabalhando.

Construindo o Conjunto de Dados

Cada caso de cliente começa com uma especificação que define detalhes estruturais relevantes do escritório: para qual cliente é e qual é a forma geral do projeto. Em seguida, esses detalhes são enriquecidos por um conjunto concreto de fatos substanciais que o caso deve conter para fundamentar uma tarefa específica.

Esses podem ser fatos específicos — uma caução de 10% ou uma cláusula de não concorrência de dois anos em um contrato específico — ou estruturais: uma ação foi arquivada ou resolvida. Essas características nos permitem definir e revisar os ground truths a partir de especificações curtas, em vez de um corpus grande e não estruturado. No geral, um caso pode ser especificado em cerca de 1.000 tokens, carregando muitas características relevantes para a tarefa.

Nosso pipeline de dados sintéticos então transforma cada especificação em um sistema de arquivos de 10 a 200 documentos realistas (dependendo do estado, tamanho e tipo do caso) que expressam as características relevantes. As características são fixadas a documentos específicos para permitir o rastreamento tanto no nível do caso quanto no nível do arquivo. Os casos em si são coleções vagamente estruturadas de arquivos que contêm os principais aspectos de um caso: contratação, execução das fases, decisões principais e resultados finais. O sistema de arquivos exato não é padronizado e reflete a organização lógica baseada nos tipos de caso, na preferência dos sócios e em como cada caso específico se desenrolou.

Julio Pereyra - inline image

Ambiente e Definição de Tarefas

Os casos do escritório são tratados como um corpus persistente, com cada tarefa executada contra todo o sistema de arquivos. As tarefas em si são enumeradas com base nas especificações resumidas dos casos, com ground truths calculados como casos ou documentos que contêm uma combinação específica de características. As características subjacentes de um caso não são mostradas aos agentes em tempo de execução; eles precisam recuperá-las do sistema de arquivos não estruturado por meio de uma combinação de busca e raciocínio.

Embora as características em si sejam estruturadas, elas oferecem flexibilidade para expressar vários tipos de tarefas de busca e raciocínio. Isso inclui buscar precedentes, entender tendências do setor e identificar preferências ou resultados no nível do cliente.

Julio Pereyra - inline image

No formato padrão do LAB, os agentes são avaliados usando juízes de LLM com base em uma rubrica que desdobra o ground truth em critérios atômicos necessários para a conclusão bem-sucedida da tarefa.

Desempenho Atual

Medimos o desempenho de referência usando o harness padrão do LAB, bem como dois modelos de fundação fortes: GPT-5.6-sol e Opus-4.8. Descobrimos que ambos têm dificuldades tanto no desempenho geral das tarefas quanto no desempenho eficaz em relação à latência. Ambos resolvem um conjunto comum de tarefas fáceis e um conjunto único de tarefas mais difíceis, mas levam cinco ou mais minutos por tarefa e satisfazem apenas cerca de metade de todos os critérios de avaliação.

Ao revisar as trajetórias, esperaríamos que tanto o custo quanto a latência aumentem com o tamanho do corpus, o que representa problemas reais para corpora de verdadeira escala empresarial que podem exceder a C&H em múltiplas ordens de grandeza.

Julio Pereyra - inline image

As falhas são em grande parte explicadas pela incapacidade de buscar e compreender o corpus de forma abrangente. Os modelos, na maioria das vezes, raciocinam corretamente sobre o que encontram, mas frequentemente não conseguem encontrar todas as informações relevantes.

Esse modo de falha é particularmente grave em tarefas que exigem a enumeração de um grande conjunto de casos, arquivos ou informações relevantes. À medida que o número de pontos atômicos necessários para a conclusão bem-sucedida da tarefa aumenta, ambos os modelos regridem para 0% de aprovação total.

Julio Pereyra - inline image

Isso não é uma falha de estratégia de busca. Os agentes encontram consistentemente as informações principais e satisfazem cerca de metade dos critérios. Em vez disso, é uma falha em saber quando continuar procurando por informações adicionais. Isso sugere que os agentes não constroem um modelo intermediário eficaz do que o corpus contém, que lhes permita saber quando suas buscas foram suficientemente exaustivas.

A conclusão bem-sucedida de tarefas diante do conhecimento empresarial exige melhorar essa capacidade específica.

Conclusão

O trabalho jurídico exige compreender como um problema se relaciona com trabalhos anteriores: qual precedente é relevante para um cliente ou como é o padrão de mercado. Os agentes atuais tentam obter esse conhecimento do zero em cada tarefa.

A C&H mostra que essa estratégia é cara e fraca na escala de conhecimento empresarial. Acreditamos que um caminho promissor para melhorar os agentes nessa capacidade é permitir que eles construam representações mais ricas do corpus antecipadamente — índices, resumos, memória — e amortizem o custo de construir tais representações ao longo das execuções subsequentes. Como o ambiente é persistente, esses custos únicos de compreensão se pagam em muitas tarefas. Em breve compartilharemos mais sobre nosso trabalho aqui.

Os dados sintéticos do escritório de advocacia que criamos para este post estão disponíveis em nosso repositório de código aberto. A versão atual da C&H cobre apenas parte do trabalho realizado por um escritório de advocacia, e suas tarefas representam apenas um subconjunto das perguntas que os advogados podem querer fazer ao seu conhecimento institucional. Pretendemos expandir ambos ao longo do tempo.

Gostaríamos de agradecer especialmente aos seguintes colaboradores pelo feedback sobre o conjunto de dados e o texto: Dan Biderman (Engram), Jessy Lin (Engram), Mayee Chen (Engram), Neel Guha (Columbia Law School / Engram), Shizhe He (Engram), Calvin Qi (Harvey), Gabe Pereyra (Harvey)

Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais