LAB: ความรู้ด้านกฎหมายของสำนักงานกฎหมาย

@ItsJulioPereyra
อังกฤษ07 ส.ค. 2569
240K
193
22
17
380

TL;DR

Harvey AI เปิดตัว Calderwood & Harkness แบบโอเพนซอร์ส ซึ่งเป็นสภาพแวดล้อมสำนักงานกฎหมายสังเคราะห์ที่มีข้อมูล 108 ล้านโทเค็น เพื่อใช้เป็นเกณฑ์มาตรฐานสำหรับ AI agents ในการทำงานด้านการสืบค้นและการใช้เหตุผลทางกฎหมายที่ซับซ้อน

เรากำลังเปิดซอร์สการขยาย LAB ชุดถัดไปของเรา: สำนักงานกฎหมายสังเคราะห์ Calderwood & Harkness (“C&H” หรือ “สำนักงาน”) สร้างขึ้นร่วมกับ @engramlab โดยภายในสำนักงานมีผลงานจากคดีความของลูกค้ามากกว่า 250 คดี ประกอบด้วยไฟล์เกือบ 10,000 ไฟล์ และมากกว่า 100 ล้านโทเคน

รายการ

ค่า

ลูกค้า

46

สาขาการปฏิบัติงาน

15

คดีความ

266

ไฟล์

9,288

โทเคน

108M

งาน

250

การให้คะแนน

LLM เป็นผู้ตัดสินเทียบกับเกณฑ์การประเมินเฉพาะงาน

ชุดข้อมูล

https://github.com/harveyai/harvey-labs/tree/main/tasks/firm-knowledge

สภาพแวดล้อมประกอบด้วย 250 งานที่ครอบคลุมการดึงความรู้และการใช้เหตุผลในรูปแบบต่างๆ แต่ละงานเลียนแบบประเภทของงานสืบค้นและใช้เหตุผลที่สำนักงานกฎหมายอาจถามจากระบบจัดการเอกสารของตน และถูกออกแบบมาเพื่อทดสอบความสามารถของ agent อย่างเข้มข้น — บริบทที่ต้องใช้ในการตอบคำถามแต่ละข้อกระจายอยู่ทั่วไป มักไม่มีคีย์เวิร์ดให้ grep และด้วยขนาด 100 ล้านโทเคน คลังเอกสารจึงใหญ่เกินกว่าจะค้นหาได้อย่างครบถ้วน

ในบทความนี้ เราอธิบายว่าโครงสร้างของสำนักงานกฎหมายเป็นอย่างไร เราสร้างสภาพแวดล้อมสำนักงานกฎหมายสังเคราะห์ที่มีพื้นฐานจากโครงสร้างนั้นได้อย่างไร และการรัน baseline เผยให้เห็นอะไรเกี่ยวกับความสามารถของ agent ในปัจจุบันในการเข้าถึงคลังความรู้ขนาดใหญ่

โครงสร้างของสำนักงานกฎหมาย

สำนักงานกฎหมายจัดระเบียบงานผ่านความสัมพันธ์ชุดหนึ่งที่เหมือนกัน: ลูกค้าที่ตนทำงานให้ และคดีความที่ตนทำเพื่อลูกค้าเหล่านั้น เราสร้าง C&H บนพื้นฐานความสัมพันธ์หลักเหล่านี้

Julio Pereyra - inline image

สำนักงานมีลูกค้าสมมติ 46 ราย ซึ่งเป็นตัวแทนของบริษัทและบุคคลต่างๆ ที่สำนักงานทำงานให้ เราจงใจกำหนดให้ลูกค้ามีความหลากหลายเพื่อให้ได้งานหลากหลายประเภท — บริษัท PE ต้องการบริการทางกฎหมายที่แตกต่างจากผู้ผลิตภาคอุตสาหกรรม

สำนักงานทำงานให้ลูกค้าเหล่านั้นในหลายสาขาการปฏิบัติงานที่แตกต่างกัน สาขาเหล่านี้แทนความเชี่ยวชาญทางกฎหมายประเภทต่างๆ ครอบคลุมกลุ่มงานที่พบได้ทั่วไปในสำนักงานกฎหมายขนาดกลางและขนาดใหญ่

งานจริงที่สำนักงานทำปรากฏในรูปแบบของคดีความของลูกค้า ลูกค้าหนึ่งรายอาจมีหลายคดี และคดีหนึ่งอาจเกี่ยวข้องกับทนายจากหลายสาขาการปฏิบัติงาน ปัจจุบันสำนักงานมีคดีที่กำลังดำเนินการหรือเสร็จสิ้นแล้ว 266 คดีในระบบไฟล์

แนวคิดสามประการนี้กำหนดขอบเขตของ C&H: ทำงานให้ใคร มีความเชี่ยวชาญใดที่พร้อมนำมาใช้ และกำลังทำงานในโครงการเฉพาะอะไรบ้าง

การสร้างชุดข้อมูล

คดีของลูกค้าแต่ละคดีเริ่มจากข้อกำหนด (specification) ที่ระบุรายละเอียดเชิงโครงสร้างของสำนักงาน: คดีนี้เป็นของลูกค้ารายใด และโครงการมีรูปแบบโดยรวมอย่างไร จากนั้นข้อมูลเหล่านี้จะถูกเสริมด้วยชุดข้อเท็จจริงสำคัญที่คดีต้องมี เพื่อรองรับงานเฉพาะหนึ่งๆ

ข้อเท็จจริงเหล่านี้อาจเป็นข้อเท็จจริงเฉพาะเจาะจง — เช่น เงิน escrow 10% หรือข้อตกลงไม่แข่งขัน (non-compete) 2 ปีในสัญญาฉบับหนึ่ง — หรือเชิงโครงสร้าง เช่น คดีความถูกยกฟ้องหรือยุติลง คุณลักษณะเหล่านี้ทำให้เรากำหนดและตรวจสอบ ground truth จากข้อกำหนดสั้นๆ แทนที่จะต้องอ่านคลังเอกสารขนาดใหญ่ที่ไม่มีโครงสร้าง โดยรวมแล้ว คดีหนึ่งสามารถระบุได้ด้วยข้อกำหนดประมาณ 1,000 โทเคน ขณะที่ยังมีคุณลักษณะสำคัญของงานจำนวนมาก

จากนั้นไปป์ไลน์ข้อมูลสังเคราะห์ของเราจะแปลงข้อกำหนดแต่ละชุดให้เป็นระบบไฟล์ที่มีเอกสารสมจริง 10-200 ฉบับ (ขึ้นอยู่กับสถานะ ขนาด และประเภทของคดี) ซึ่งแสดงคุณลักษณะที่เกี่ยวข้องออกมา คุณลักษณะต่างๆ จะถูกผูกไว้กับเอกสารเฉพาะ เพื่อให้สามารถติดตามคุณลักษณะเหล่านั้นได้ทั้งในระดับคดีและระดับไฟล์ ตัวคดีเองเป็นกลุ่มไฟล์ที่จัดระเบียบแบบหลวมๆ ซึ่งเก็บองค์ประกอบหลักของคดี: การว่าจ้าง การดำเนินการตามขั้นตอน การตัดสินใจสำคัญ และผลลัพธ์สุดท้าย ระบบไฟล์แบบเจาะจงไม่ได้ถูกกำหนดให้เป็นมาตรฐาน แต่สะท้อนการจัดระเบียบตามตรรกะของประเภทคดี ความชอบของหุ้นส่วน และวิธีที่คดีแต่ละคดีดำเนินไป

Julio Pereyra - inline image

สภาพแวดล้อมและนิยามของงาน

คดีทั้งหมดของสำนักงานถือเป็นคลังเอกสารถาวร (persistent corpus) โดยทุกงานจะทำงานกับระบบไฟล์ทั้งหมด ตัวงานถูกกำหนดขึ้นโดยอ้างอิงจากข้อกำหนดแบบสั้นของคดี โดย ground truth คำนวณจากคดีหรือเอกสารที่มีส่วนผสมของคุณลักษณะเฉพาะ คุณลักษณะเบื้องหลังของคดีจะไม่แสดงให้ agent เห็นตอนรันไทม์ พวกเขาต้องค้นคืนจากระบบไฟล์ที่ไม่มีโครงสร้างผ่านการค้นหาและการใช้เหตุผลร่วมกัน

แม้ว่าคุณลักษณะเหล่านี้จะมีโครงสร้าง แต่ก็ให้ความยืดหยุ่นในการแสดงงานค้นหาและใช้เหตุผลหลายรูปแบบ เช่น การค้นหาตัวอย่างคำพิพากษาที่เป็นบรรทัดฐาน (precedent) การทำความเข้าใจแนวโน้มอุตสาหกรรม และการระบุความชอบหรือผลลัพธ์ในระดับลูกค้า

Julio Pereyra - inline image

ในรูปแบบ LAB มาตรฐาน agent จะถูกให้คะแนนโดย LLM ซึ่งทำหน้าที่เป็นผู้ตัดสินเทียบกับเกณฑ์การประเมิน (rubric) ที่ขยาย ground truth ออกเป็นเกณฑ์ย่อยที่จำเป็นต่อการทำงานให้สำเร็จ

ประสิทธิภาพในปัจจุบัน

เราวัดประสิทธิภาพ baseline โดยใช้ เครื่องมือ LAB มาตรฐาน รวมถึงโมเดลพื้นฐานที่แข็งแกร่งสองตัว: GPT-5.6-sol และ Opus-4.8 เราพบว่าทั้งสองตัวมีปัญหาเรื่องประสิทธิภาพโดยรวมและประสิทธิภาพที่สัมพันธ์กับ latency ทั้งคู่ทำชุดงานง่ายชุดเดียวกันได้สำเร็จ และทำชุดงานยากที่แตกต่างกันได้ แต่ใช้เวลาห้านาทีขึ้นไปต่องาน และผ่านเกณฑ์การให้คะแนนเพียงราวครึ่งหนึ่งเท่านั้น

จากการทบทวน trajectory เราคาดว่าต้นทุนและเวลาแฝงจะเพิ่มขึ้นตามขนาดคลังเอกสาร ซึ่งสร้างปัญหาจริงสำหรับคลังเอกสารระดับองค์กรที่อาจใหญ่กว่า C&H หลายลำดับขนาด

Julio Pereyra - inline image

ความล้มเหลวส่วนใหญ่สามารถอธิบายได้ด้วยความไม่สามารถค้นหาและทำความเข้าใจคลังเอกสารได้อย่างครอบคลุม โมเดลส่วนใหญ่ใช้เหตุผลกับสิ่งที่พบได้อย่างถูกต้อง แต่มักค้นหาข้อมูลที่เกี่ยวข้องไม่ครบทุกชิ้น

รูปแบบความล้มเหลวนี้รุนแรงเป็นพิเศษในงานที่ต้องระบุรายการคดี ไฟล์ หรือข้อมูลที่เกี่ยวข้องจำนวนมาก เมื่อจำนวนจุดย่อย (atomic points) ที่จำเป็นต่อการทำงานให้สำเร็จเพิ่มขึ้น โมเดลทั้งสองจะถดถอยลงจนอัตราการผ่านครบทุกเกณฑ์เป็น 0% (0% all-pass)

Julio Pereyra - inline image

นี่ไม่ใช่ความล้มเหลวของกลยุทธ์การค้นหา agent ค้นหาข้อมูลหลักได้อย่างสม่ำเสมอและผ่านเกณฑ์ประมาณครึ่งหนึ่ง แต่เป็นความล้มเหลวในการรู้ว่าเมื่อใดควรค้นหาข้อมูลเพิ่มเติม ซึ่งชี้ให้เห็นว่า agent ไม่ได้สร้างโมเดลระหว่างกลางที่มีประสิทธิภาพของสิ่งที่อยู่ในคลังเอกสาร ที่จะช่วยให้รู้ว่าการค้นหาของตนครอบคลุมเพียงพอหรือยัง

การจะทำงานให้สำเร็จกับคลังความรู้ระดับองค์กร จำเป็นต้องพัฒนาความสามารถเฉพาะด้านนี้

บทสรุป

งานด้านกฎหมายต้องอาศัยความเข้าใจว่าปัญหาหนึ่งเกี่ยวข้องกับงานก่อนหน้าอย่างไร: บรรทัดฐานใดที่เกี่ยวข้องกับลูกค้า หรือมาตรฐานตลาดเป็นอย่างไร agent ในปัจจุบันพยายามหาความรู้นั้นจากศูนย์ในทุกงาน

C&H แสดงให้เห็นว่ากลยุทธ์นี้มีต้นทุนสูงและอ่อนแอเมื่อต้องรับมือกับคลังความรู้ระดับองค์กร เราคิดว่าทิศทางที่น่าจะช่วยให้ agent พัฒนาความสามารถนี้ได้คือการให้พวกเขาสร้างตัวแทนของคลังเอกสารที่สมบูรณ์ยิ่งขึ้นล่วงหน้า — ดัชนี บทสรุป หน่วยความจำ — และเฉลี่ยต้นทุนการสร้างตัวแทนดังกล่าวไปตามการรันครั้งต่อๆ ไป เพราะสภาพแวดล้อมเป็นแบบถาวร ต้นทุนการทำความเข้าใจเพียงครั้งเดียวจึงให้ผลคุ้มค่ากับหลายๆ งาน เราจะแชร์เพิ่มเติมเกี่ยวกับงานของเราที่นี่เร็วๆ นี้

ข้อมูลสำนักงานกฎหมายสังเคราะห์ที่เราสร้างสำหรับบทความนี้เปิดให้ใช้งานในคลังโอเพนซอร์สของเรา C&H เวอร์ชันปัจจุบันครอบคลุมเพียงบางส่วนของงานที่สำนักงานกฎหมายทำ และงานในนั้นเป็นเพียงสับเซตของคำถามที่ทนายความอาจต้องการถามจากความรู้ภายในองค์กรของตน เราวางแผนจะเพิ่มเติมทั้งสองส่วนนี้ต่อไปเรื่อยๆ

เราขอขอบคุณผู้มีส่วนร่วมต่อไปนี้เป็นพิเศษสำหรับความคิดเห็นเกี่ยวกับทั้งชุดข้อมูลและบทความนี้: Dan Biderman (Engram), Jessy Lin (Engram), Mayee Chen (Engram), Neel Guha (Columbia Law School / Engram), Shizhe He (Engram), Calvin Qi (Harvey), Gabe Pereyra (Harvey)

บันทึกในคลิกเดียว

อ่านบทความไวรัลเชิงลึกด้วย AI ใน YouMind

บันทึกแหล่งที่มา ถามคำถามที่ตรงประเด็น สรุปข้อโต้แย้ง และเปลี่ยนบทความไวรัลให้เป็นโน้ตที่นำกลับมาใช้ได้ใน AI เวิร์กสเปซเดียว

สำรวจ YouMind
สำหรับครีเอเตอร์

เปลี่ยน Markdown ของคุณให้เป็นบทความ 𝕏 ที่สะอาดตา

เวลาคุณเผยแพร่งานเขียนยาวของตัวเอง การจัดรูปแบบรูปภาพ ตาราง และบล็อกโค้ดให้เข้ากับ 𝕏 นั้นน่าปวดหัว YouMind เปลี่ยนร่าง Markdown ทั้งฉบับให้เป็นบทความ 𝕏 ที่สะอาดตาและพร้อมโพสต์ทันที

ลอง Markdown เป็น 𝕏

แพตเทิร์นให้ถอดรหัสเพิ่มเติม

บทความไวรัลล่าสุด

สำรวจบทความไวรัลเพิ่มเติม