LAB: Kiến thức Công ty Luật

@ItsJulioPereyra
TIẾNG ANH07 thg 8, 2026
240K
193
22
17
380

TL;DR

Harvey AI công bố mã nguồn mở Calderwood & Harkness, một môi trường công ty luật tổng hợp với 108 triệu token nhằm đánh giá các tác nhân AI trong các nhiệm vụ truy xuất và lập luận pháp lý phức tạp.

Chúng tôi đang mở mã nguồn bản mở rộng LAB tiếp theo: một công ty luật tổng hợp, Calderwood & Harkness ("C&H" hoặc "công ty"). Được xây dựng phối hợp với @engramlab, công ty chứa sản phẩm công việc từ hơn 250 vụ việc của khách hàng, bao gồm gần 10.000 tệp và hơn 100 triệu token.

Thông số

Giá trị

Khách hàng

46

Lĩnh vực hành nghề

15

Vụ việc

266

Tệp

9,288

Tokens

108M

Nhiệm vụ

250

Chấm điểm

LLM giám khảo chấm theo bộ tiêu chí cho từng nhiệm vụ

Bộ dữ liệu

https://github.com/harveyai/harvey-labs/tree/main/tasks/firm-knowledge

Môi trường chứa 250 nhiệm vụ trải dài trên nhiều dạng truy xuất tri thức và suy luận. Mỗi nhiệm vụ mô phỏng loại công việc truy xuất và suy luận mà một công ty luật có thể yêu cầu từ hệ thống quản lý tài liệu của họ, đồng thời được thiết kế như một bài kiểm tra áp lực cho năng lực của agent — bối cảnh cần thiết để trả lời bất kỳ câu hỏi nào trong số này đều nằm rải rác, thường không có từ khóa nào để grep, và ở mức 100 triệu token, kho ngữ liệu quá lớn để có thể tìm kiếm toàn diện.

Trong bài viết này, chúng tôi mô tả cách các công ty luật được cấu trúc, cách chúng tôi xây dựng một môi trường công ty luật tổng hợp có cơ sở thực tế phản ánh cấu trúc đó, và những gì các lần chạy baseline cho thấy về khả năng của các agent hiện tại trong việc truy cập các kho tri thức quy mô lớn.

Cách một Công ty Luật được Cấu trúc

Các công ty luật tổ chức công việc của họ thông qua một tập hợp các mối quan hệ chung: khách hàng mà họ phục vụ và các vụ việc họ xử lý cho những khách hàng đó. Chúng tôi đặt nền tảng C&H trên các mối quan hệ cốt lõi này.

Julio Pereyra - inline image

Công ty có 46 khách hàng hư cấu, đại diện cho các tập đoàn và cá nhân khác nhau mà công ty phục vụ. Chúng tôi có chủ đích xây dựng các khách hàng đa dạng để có được phạm vi công việc rộng — các công ty PE (private equity) cần các dịch vụ pháp lý khác với các nhà sản xuất công nghiệp.

Công ty phục vụ các khách hàng đó trên nhiều lĩnh vực hành nghề khác nhau. Các lĩnh vực hành nghề này đại diện cho các loại chuyên môn pháp lý khác nhau, trải rộng trên các nhóm hành nghề phổ biến tại các công ty luật vừa và lớn.

Công việc thực tế của công ty được thể hiện qua các vụ việc của khách hàng. Một khách hàng có thể có nhiều vụ việc và một vụ việc có thể liên quan đến luật sư từ nhiều lĩnh vực hành nghề. Công ty hiện có 266 vụ việc đang thực hiện hoặc đã hoàn thành trong hệ thống tệp của mình.

Ba khái niệm này xác định phạm vi hoạt động của C&H: công ty phục vụ ai, có thể huy động chuyên môn gì, và đang thực hiện những dự án cụ thể nào.

Xây dựng Bộ Dữ liệu

Mỗi vụ việc của khách hàng bắt đầu với một bản đặc tả xác định các chi tiết cấu trúc liên quan của công ty: phục vụ khách hàng nào và hình dạng tổng quát của dự án. Những bản đặc tả này sau đó được bổ sung bằng một tập hợp các sự kiện nội dung cụ thể mà vụ việc phải chứa để làm cơ sở cho một nhiệm vụ cụ thể.

Chúng có thể là các sự kiện hẹp — khoản ký quỹ (escrow) 10% hoặc điều khoản không cạnh tranh hai năm trong một thỏa thuận cụ thể — hoặc các sự kiện mang tính cấu trúc: một vụ kiện bị bác bỏ hoặc được dàn xếp. Các đặc điểm này cho phép chúng tôi định nghĩa và rà soát ground truth từ các bản đặc tả ngắn thay vì từ một kho ngữ liệu lớn, phi cấu trúc. Nhìn chung, một vụ việc có thể được đặc tả trong khoảng 1.000 token trong khi vẫn mang nhiều đặc điểm nổi bật liên quan đến nhiệm vụ.

Đường ống dữ liệu tổng hợp (synthetic data pipeline) của chúng tôi sau đó chuyển mỗi bản đặc tả thành một hệ thống tệp gồm 10-200 tài liệu thực tế (tùy thuộc vào trạng thái, quy mô và loại vụ việc) thể hiện các đặc điểm liên quan. Các đặc điểm được gắn vào các tài liệu cụ thể để có thể truy vết ở cả cấp độ vụ việc lẫn cấp độ tệp. Bản thân các vụ việc là những tập hợp tệp có cấu trúc linh hoạt, chứa các khía cạnh chính của một vụ việc: hợp đồng dịch vụ, triển khai các giai đoạn, các quyết định quan trọng và kết quả cuối cùng. Hệ thống tệp chính xác không được chuẩn hóa mà phản ánh cách tổ chức hợp lý dựa trên loại vụ việc, sở thích của luật sư phụ trách và cách thức vụ việc cụ thể diễn ra.

Julio Pereyra - inline image

Môi trường và Định nghĩa Nhiệm vụ

Các vụ việc của công ty được xem như một kho ngữ liệu cố định, với mọi nhiệm vụ chạy trên toàn bộ hệ thống tệp. Bản thân các nhiệm vụ được liệt kê dựa trên các bản đặc tả ngắn gọn của vụ việc, với ground truth được tính toán là các vụ việc hoặc tài liệu chứa một tập hợp đặc điểm cụ thể. Các đặc điểm nền tảng của một vụ việc không được hiển thị cho agent tại thời điểm chạy (run-time), chúng phải tự khôi phục từ hệ thống tệp phi cấu trúc thông qua sự kết hợp giữa tìm kiếm và suy luận.

Mặc dù bản thân các đặc điểm là có cấu trúc, chúng cho phép sự linh hoạt trong việc thể hiện nhiều loại nhiệm vụ tìm kiếm và suy luận khác nhau, bao gồm tìm kiếm tiền lệ pháp lý, hiểu xu hướng ngành và xác định các sở thích hoặc kết quả ở cấp độ khách hàng.

Julio Pereyra - inline image

Theo định dạng LAB chuẩn, các agent được chấm điểm bằng LLM giám khảo dựa trên một bộ tiêu chí (rubric) khai triển ground truth thành các tiêu chí nguyên tử cần thiết để hoàn thành nhiệm vụ thành công.

Hiệu suất Hiện tại

Chúng tôi đo lường hiệu suất baseline bằng bộ harness LAB chuẩn cùng với hai mô hình nền tảng mạnh: GPT-5.6-sol và Opus-4.8. Chúng tôi nhận thấy cả hai đều gặp khó khăn về hiệu suất tổng thể lẫn hiệu suất xét theo độ trễ. Cả hai đều giải được một tập hợp chung các nhiệm vụ dễ và một tập hợp riêng các nhiệm vụ khó hơn, nhưng mất năm phút hoặc hơn cho mỗi nhiệm vụ và chỉ đáp ứng khoảng một nửa tổng số tiêu chí chấm điểm.

Khi xem xét các trajectory, chúng tôi dự đoán cả chi phí lẫn độ trễ sẽ tăng theo quy mô kho ngữ liệu, điều này đặt ra vấn đề thực sự cho các kho ngữ liệu quy mô doanh nghiệp thực thụ — vốn có thể vượt C&H nhiều bậc độ lớn.

Julio Pereyra - inline image

Các thất bại chủ yếu có thể được giải thích bằng việc không thể tìm kiếm và hiểu kho ngữ liệu một cách toàn diện. Các mô hình hầu hết suy luận chính xác về những gì chúng tìm thấy, nhưng thường không tìm thấy đầy đủ mọi mẩu thông tin liên quan.

Kiểu thất bại này đặc biệt nghiêm trọng ở các nhiệm vụ yêu cầu liệt kê một tập hợp lớn các vụ việc, tệp hoặc mẩu thông tin liên quan. Khi số lượng điểm nguyên tử cần thiết để hoàn thành nhiệm vụ thành công tăng lên, cả hai mô hình đều tụt về 0% tỷ lệ đạt toàn bộ (all-pass).

Julio Pereyra - inline image

Đây không phải là thất bại của chiến lược tìm kiếm. Các agent luôn tìm thấy thông tin cốt lõi và đáp ứng khoảng một nửa số tiêu chí. Thay vào đó, đây là thất bại trong việc biết khi nào nên tiếp tục tìm kiếm thêm thông tin. Điều này cho thấy các agent không xây dựng được một mô hình trung gian hiệu quả về những gì kho ngữ liệu chứa đựng — mô hình cho phép chúng biết khi nào các tìm kiếm của mình đã đủ toàn diện.

Hoàn thành nhiệm vụ thành công trên kho tri thức doanh nghiệp đòi hỏi phải cải thiện khả năng cụ thể này.

Kết luận

Công việc pháp lý đòi hỏi sự hiểu biết về cách một vấn đề liên quan đến các công việc trước đó: tiền lệ nào phù hợp với khách hàng hoặc tiêu chuẩn thị trường trông như thế nào. Các agent ngày nay cố gắng suy ra kiến thức đó từ đầu trong mỗi nhiệm vụ.

C&H cho thấy chiến lược này tốn kém và yếu ở quy mô tri thức doanh nghiệp. Chúng tôi tin rằng một hướng đi đầy hứa hẹn để cải thiện năng lực này của agent là cho phép chúng xây dựng các biểu diễn phong phú hơn về kho ngữ liệu ngay từ đầu — chỉ mục, tóm tắt, bộ nhớ — và phân bổ chi phí xây dựng các biểu diễn đó qua các lần chạy tiếp theo. Vì môi trường là cố định, những chi phí tìm hiểu một lần này sẽ được đền đáp xứng đáng trên nhiều nhiệm vụ. Chúng tôi sẽ sớm chia sẻ thêm về công việc của mình tại đây.

Dữ liệu công ty luật tổng hợp mà chúng tôi tạo cho bài viết này có sẵn trong kho mã nguồn mở của chúng tôi. Phiên bản hiện tại của C&H chỉ bao phủ một phần công việc mà một công ty luật thực hiện, và các nhiệm vụ của nó chỉ đại diện cho một tập con các câu hỏi mà luật sư có thể muốn đặt ra cho kho tri thức tổ chức của họ. Chúng tôi dự định sẽ bổ sung cả hai theo thời gian.

Chúng tôi đặc biệt muốn cảm ơn các cộng tác viên sau đây vì phản hồi của họ về cả bộ dữ liệu lẫn bài viết: Dan Biderman (Engram), Jessy Lin (Engram), Mayee Chen (Engram), Neel Guha (Columbia Law School / Engram), Shizhe He (Engram), Calvin Qi (Harvey), Gabe Pereyra (Harvey)

Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral