LAB: 로펌 지식 (Law Firm Knowledge)

@ItsJulioPereyra
영어2026년 8월 07일
240K
193
22
17
380

TL;DR

Harvey AI가 1억 800만 개의 토큰을 포함한 합성 로펌 환경인 Calderwood & Harkness를 오픈 소스로 공개했습니다. 이는 복잡한 법률 검색 및 추론 작업에서 AI 에이전트의 성능을 벤치마킹하기 위해 설계되었습니다.

저희는 다음 LAB 확장판으로 합성 로펌인 Calderwood & Harkness("C&H" 또는 "이 로펌")을 오픈소스로 공개합니다. @engramlab과 협력하여 구축된 이 로펌에는 250건이 넘는 클라이언트 사건의 작업 산출물이 포함되어 있으며, 거의 10,000개의 파일과 1억 개 이상의 토큰으로 구성됩니다.

구분

클라이언트

46

전문 분야

15

사건

266

파일

9,288

토큰

108M

태스크

250

평가

태스크별 루브릭에 따른 LLM 심사

데이터셋

https://github.com/harveyai/harvey-labs/tree/main/tasks/firm-knowledge

이 환경에는 다양한 형태의 지식 검색과 추론을 아우르는 250개의 태스크가 포함되어 있습니다. 각 태스크는 로펌이 문서 관리 시스템에 요구할 수 있는 검색 및 추론 작업을 반영하며, 에이전트 역량에 대한 스트레스 테스트로 설계되었습니다. 이러한 질문 중 하나에 답하는 데 필요한 맥락은 여러 곳에 분산되어 있고, grep으로 찾을 수 있는 키워드가 없는 경우가 많으며, 1억 개의 토큰으로 구성된 말뭉치는 전체를 빠짐없이 검색하기에는 너무 큽니다.

이 글에서는 로펌이 어떻게 구조화되어 있는지, 그 구조를 반영하는 근거 기반의 합성 로펌 환경을 어떻게 구축했는지, 그리고 기준(baseline) 실행 결과가 현재 에이전트의 대규모 지식 말뭉치 접근 능력에 대해 무엇을 시사하는지 설명합니다.

로펌의 구조

로펌은 일련의 공통된 관계를 통해 업무를 조직합니다: 일하는 대상인 클라이언트와, 그 클라이언트를 위해 진행하는 사건(matter)이 바로 그것입니다. 저희는 C&H를 이러한 핵심 관계에 기반하여 구축했습니다.

Julio Pereyra - inline image

이 로펌에는 각기 다른 기업과 개인을 대표하는 46개의 가상 클라이언트가 있습니다. 저희는 의도적으로 다양한 클라이언트를 정의하여 폭넓은 업무 범위를 확보했습니다. PE(사모펀드) 회사는 산업 제조업체와는 다른 법률 서비스를 필요로 하기 때문입니다.

이 로펌은 다양한 전문 분야에 걸쳐 해당 클라이언트를 위해 일합니다. 이러한 전문 분야는 중견 및 대형 로펌의 일반적인 실무 그룹에 걸친 다양한 유형의 법률 전문성을 나타냅니다.

로펌이 수행하는 실제 업무는 클라이언트 사건으로 표현됩니다. 한 클라이언트는 여러 사건을 가질 수 있으며, 하나의 사건에는 여러 전문 분야의 변호사가 참여할 수 있습니다. 현재 이 로펌의 파일 시스템에는 진행 중이거나 완료된 266개의 사건이 있습니다.

이 세 가지 개념이 C&H의 범위를 정의합니다: 누구를 위해 일하는지, 어떤 전문성을 활용할 수 있는지, 어떤 구체적인 프로젝트를 진행 중인지입니다.

데이터셋 구축

각 클라이언트 사건은 로펌 구조와 관련된 세부 사항을 정의하는 명세(specification)에서 시작합니다: 어떤 클라이언트를 위한 것인지, 프로젝트의 전반적인 형태가 어떤지가 그것입니다. 이 명세는 특정 태스크를 뒷받침하기 위해 사건이 반드시 포함해야 하는 구체적인 실질 사실 세트로 보강됩니다.

이는 특정 계약서의 10% 에스크로 또는 2년간의 경업 금지 조항과 같은 세부 사실일 수도 있고, 소송이 기각되거나 합의되었다는 구조적 사실일 수도 있습니다. 이러한 특징 덕분에 방대하고 비정형화된 말뭉치 대신 짧은 명세만으로 ground truth를 정의하고 검토할 수 있습니다. 전반적으로 하나의 사건은 태스크와 관련된 많은 특징을 담으면서도 약 1,000개의 토큰으로 정의할 수 있습니다.

그런 다음 합성 데이터 파이프라인은 각 명세를 관련 특징을 표현하는 10~200개의 현실적인 문서(사건의 상태, 규모, 유형에 따라 다름)로 구성된 파일 시스템으로 렌더링합니다. 특징은 특정 문서에 고정되어 사건 수준과 파일 수준 모두에서 추적할 수 있습니다. 사건 자체는 수임(engagement), 단계별 실행, 주요 결정, 최종 결과 등 사건의 주요 측면을 담은 느슨하게 구조화된 파일 모음입니다. 파일 시스템의 정확한 구조는 표준화되어 있지 않으며, 사건 유형, 파트너의 선호도, 그리고 각 사건이 전개된 방식에 따른 논리적 구성을 반영합니다.

Julio Pereyra - inline image

환경 및 태스크 정의

로펌의 사건들은 영속적인 말뭉치로 취급되며, 모든 태스크는 전체 파일 시스템을 대상으로 실행됩니다. 태스크 자체는 사건의 간결한 명세를 바탕으로 도출되며, ground truth는 특정 특징 조합을 포함하는 사건 또는 문서로 계산됩니다. 사건의 기본 특징은 실행 시점에 에이전트에게 공개되지 않으며, 에이전트는 검색과 추론을 결합하여 비정형화된 파일 시스템에서 이를 찾아내야 합니다.

특징 자체는 구조화되어 있지만, 다양한 유형의 검색 및 추론 태스크를 유연하게 표현할 수 있습니다. 여기에는 판례 검색, 업계 동향 파악, 클라이언트 수준의 선호도나 결과 식별 등이 포함됩니다.

Julio Pereyra - inline image

표준 LAB 형식에 따라, 에이전트는 ground truth를 성공적인 태스크 완료에 필요한 개별 기준으로 세분화한 루브릭에 기반하여 LLM 심사자로부터 평가를 받습니다.

현재 성능

저희는 표준 LAB 하네스와 두 개의 강력한 파운데이션 모델인 GPT-5.6-sol 및 Opus-4.8을 사용하여 기준 성능을 측정했습니다. 두 모델 모두 전반적인 태스크 성능과 지연 시간 대비 효율성에서 어려움을 겪는 것으로 나타났습니다. 두 모델 모두 공통된 쉬운 태스크 세트를 해결하고 각자 고유한 더 어려운 태스크 세트도 해결하지만, 태스크당 5분 이상이 소요되며 전체 평가 기준의 약 절반만 충족합니다.

실행 궤적(trajectory)을 검토한 결과, 말뭉치 크기가 커질수록 비용과 지연 시간이 모두 증가할 것으로 예상됩니다. 이는 C&H보다 몇 자릿수 더 클 수 있는 실제 엔터프라이즈 규모의 말뭉치에 심각한 문제를 제기합니다.

Julio Pereyra - inline image

실패의 대부분은 말뭉치를 종합적으로 검색하고 이해하지 못하는 데서 비롯됩니다. 모델은 찾은 내용에 대해서는 대체로 올바르게 추론하지만, 관련 정보를 모두 찾아내지 못하는 경우가 많습니다.

이러한 실패 모드는 관련 사건, 파일 또는 정보 조각을 대량으로 열거해야 하는 태스크에서 특히 심각합니다. 성공적인 태스크 완료에 필요한 개별 포인트의 수가 증가할수록 두 모델 모두 전체 통과율이 0%로 떨어집니다.

Julio Pereyra - inline image

이는 검색 전략의 실패가 아닙니다. 에이전트는 핵심 정보를 꾸준히 찾아내며 기준의 약 절반을 충족합니다. 오히려 추가 정보를 계속 찾아야 할 때를 알지 못하는 것이 문제입니다. 이는 에이전트가 말뭉치에 무엇이 들어 있는지에 대한 효과적인 중간 모델을 구축하지 못하여, 검색이 충분히 철저해졌는지를 판단하지 못한다는 것을 시사합니다.

엔터프라이즈 지식을 대상으로 한 태스크를 성공적으로 완료하려면 이 특정 역량을 개선해야 합니다.

결론

법률 업무는 문제가 이전 업무와 어떻게 연결되는지에 대한 이해를 요구합니다: 어떤 판례가 클라이언트에게 관련이 있는지, 시장 표준이 어떤 모습인지 등이 그것입니다. 오늘날의 에이전트는 모든 태스크에서 그러한 지식을 처음부터 다시 도출하려고 시도합니다.

C&H는 이러한 전략이 엔터프라이즈 지식 규모에서 비용이 많이 들고 취약하다는 것을 보여줍니다. 저희는 이 역량에서 에이전트를 개선하는 유망한 방향은 에이전트가 색인, 요약, 메모리와 같은 말뭉치에 대한 더 풍부한 표현을 사전에 구축하고, 그러한 표현 구축 비용을 이후 실행들에 걸쳐 분산시키는 것이라고 생각합니다. 환경이 영속적이기 때문에 이러한 일회성 이해 비용은 많은 태스크에 걸쳐 성과를 거둡니다. 곧 이곳에서 저희 작업에 대해 더 자세한 내용을 공유하겠습니다.

이 글을 위해 만든 합성 로펌 데이터는 저희 오픈소스 저장소에서 확인할 수 있습니다. 현재 버전의 C&H는 로펌이 수행하는 업무의 일부만을 다루며, 그 태스크는 변호사들이 조직의 지식에 대해 묻고 싶어할 질문의 일부에 불과합니다. 저희는 시간이 지남에 따라 데이터와 태스크를 모두 계속 추가할 계획입니다.

이 글과 데이터셋에 대해 피드백을 주신 다음 기여자분들께 특별히 감사드립니다: Dan Biderman (Engram), Jessy Lin (Engram), Mayee Chen (Engram), Neel Guha (Columbia Law School / Engram), Shizhe He (Engram), Calvin Qi (Harvey), Gabe Pereyra (Harvey)

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기