LAB: Hukuk Bürosu Bilgisi

@ItsJulioPereyra
İNGILIZCE07 Ağu 2026
240K
193
22
17
380

TL;DR

Harvey AI, yapay zeka ajanlarını karmaşık hukuki erişim ve muhakeme görevlerinde kıyaslamak için 108 milyon token içeren sentetik bir hukuk bürosu ortamı olan Calderwood & Harkness'ı açık kaynaklı hale getiriyor.

Bir sonraki LAB genişletmemizi açık kaynak olarak yayınlıyoruz: Calderwood & Harkness (“C&H” veya “büro”) adında sentetik bir hukuk bürosu. @engramlab ile birlikte inşa edilen büro, 250’den fazla müşteri işine ait iş ürünlerini içeriyor; bu da yaklaşık 10.000 dosyaya ve 100 milyondan fazla token’a karşılık geliyor.

Özellik

Değer

Müşteriler

46

Uzmanlık Alanları

15

İşler

266

Dosyalar

9.288

Tokenler

108M

Görevler

250

Değerlendirme

Görev başına rubriklere göre LLM değerlendirmesi

Veri Seti

https://github.com/harveyai/harvey-labs/tree/main/tasks/firm-knowledge

Ortam, çeşitli bilgi erişimi ve akıl yürütme biçimlerini kapsayan 250 görev içerir. Her görev, bir büronun belge yönetim sistemlerinden talep edebileceği türden erişim ve akıl yürütme görevlerini yansıtır ve ajan yetenekleri için bir stres testi olacak şekilde tasarlanmıştır — bu sorulardan herhangi birini yanıtlamak için gereken bağlam dağınıktır, çoğu zaman grep yapılacak anahtar kelime yoktur ve 100 milyon token ile derlem kapsamlı bir şekilde aranamayacak kadar büyüktür.

Bu yazıda, hukuk bürolarının nasıl yapılandığını, bu yapıyı yansıtan temellendirilmiş sentetik bir hukuk bürosu ortamını nasıl inşa ettiğimizi ve temel çalıştırmaların, günümüz ajanlarının ölçeklenmiş bilgi derlemlerine erişme yeteneği hakkında neler ortaya koyduğunu anlatıyoruz.

Bir Hukuk Bürosunun Yapısı

Hukuk büroları işlerini ortak bir ilişkiler kümesi üzerinden düzenler: çalıştıkları müşteriler ve bu müşteriler için yürütülen işler. C&H’yi bu temel ilişkilere dayandırdık.

Julio Pereyra - inline image

Büronun, çalıştığı farklı şirketleri ve bireyleri temsil eden 46 hayali müşterisi var. Geniş bir iş yelpazesi elde etmek için bilinçli olarak çeşitli müşteriler tanımladık — özel sermaye (PE) firmaları, endüstriyel üreticilerden farklı hukuki hizmetler gerektirir.

Büro, bu müşteriler için farklı uzmanlık alanlarında çalışır. Bu uzmanlık alanları, orta ve büyük ölçekli hukuk bürolarındaki yaygın çalışma gruplarını kapsayan farklı hukuki uzmanlık türlerini temsil eder.

Büronun yaptığı asıl iş, müşteri işleriyle temsil edilir. Bir müşterinin birden fazla işi olabilir ve işler birden fazla uzmanlık alanından avukatlar içerebilir. Büronun dosya sisteminde şu anda devam eden veya tamamlanmış 266 işi bulunuyor.

Bu üç kavram C&H’nin kapsamını belirler: kimin için çalışıyor, hangi uzmanlığı devreye sokabiliyor ve üzerinde çalıştığı belirli projeler nelerdir.

Veri Setinin Oluşturulması

Her müşteri işi, ilgili büro yapısal ayrıntılarını tanımlayan bir spesifikasyonla başlar: hangi müşteri için olduğu ve projenin genel şekli. Bunlar daha sonra, belirli bir görevi temellendirmek için işin içermesi gereken somut bir dizi maddi olguyla zenginleştirilir.

Bunlar dar kapsamlı olgular olabilir — belirli bir sözleşmedeki %10’luk emanet (escrow) şartı veya iki yıllık rekabet yasağı — ya da yapısal olgular: bir davanın reddedilmesi veya uzlaşmayla sonuçlanması. Bu özellikler, büyük ve yapılandırılmamış bir derlem yerine kısa spesifikasyonlardan doğruluk değerlerini (ground truth) tanımlamamıza ve gözden geçirmemize olanak tanır. Genel olarak, bir iş, görevle doğrudan ilgili birçok özelliği barındırarak yaklaşık 1.000 token ile tanımlanabilir.

Sentetik veri hattımız daha sonra her spesifikasyonu, ilgili özellikleri ifade eden 10-200 gerçekçi belgeden oluşan bir dosya sistemine dönüştürür (işin durumuna, boyutuna ve türüne bağlı olarak). Özellikler, hem iş hem de dosya düzeyinde izlenebilmesi için belirli belgelere sabitlenir. İşlerin kendileri, bir işin ana yönlerini içeren gevşek yapılandırılmış dosya koleksiyonlarıdır: işin üstlenilmesi (engagement), aşamaların yürütülmesi, önemli kararlar ve nihai sonuçlar. Dosya sistemi standartlaştırılmamıştır; iş türlerine, ortak tercihlerine ve her bir işin nasıl geliştiğine bağlı mantıklı bir organizasyonu yansıtır.

Julio Pereyra - inline image

Ortam ve Görev Tanımı

Büronun işleri, her görevin tüm dosya sistemine karşı çalıştırıldığı kalıcı bir derlem olarak ele alınır. Görevler, işlerin kısa spesifikasyonları üzerinden numaralandırılır; doğruluk değerleri, belirli bir özellik karışımına sahip işler veya belgeler olarak hesaplanır. Bir işin temel özellikleri ajanlara çalışma zamanında gösterilmez; bunları arama ve akıl yürütme yoluyla yapılandırılmamış dosya sisteminden çıkarmaları gerekir.

Özelliklerin kendileri yapılandırılmış olsa da, çeşitli arama ve akıl yürütme görevlerini ifade etmede esneklik sağlarlar. Bunlar arasında emsal arama, sektör trendlerini anlama ve müşteri düzeyindeki tercihleri veya sonuçları belirleme yer alır.

Julio Pereyra - inline image

Standart LAB biçiminde ajanlar, doğruluk değerini başarılı görev tamamlama için gereken atomik kriterlere ayrıştıran bir rubriğe göre LLM değerlendiricileri kullanılarak derecelendirilir.

Mevcut Performans

Temel performansı standart LAB altyapısı ve iki güçlü temel modelle ölçüyoruz: GPT-5.6-sol ve Opus-4.8. Her ikisinin de genel görev performansında ve gecikme etkinliğinde zorlandığını görüyoruz. Her ikisi de ortak bir dizi kolay görevi ve kendine özgü daha zor görevleri çözüyor, ancak görev başına beş veya daha fazla dakika sürüyor ve değerlendirme kriterlerinin yalnızca yaklaşık yarısını karşılıyor.

Yörüngeleri incelediğimizde, hem maliyetin hem de gecikmenin derlem boyutuyla artmasını bekleriz; bu, C&H’yi birkaç büyüklük sırası aşabilen gerçek kurumsal ölçekli derlemler için ciddi sorunlar oluşturur.

Julio Pereyra - inline image

Başarısızlıklar büyük ölçüde derlemi kapsamlı bir şekilde arama ve anlama eksikliğiyle açıklanabilir. Modeller çoğunlukla buldukları hakkında doğru akıl yürütüyor, ancak çoğu zaman ilgili bilgilerin tamamını bulmakta başarısız oluyor.

Bu başarısızlık modu, çok sayıda ilgili iş, dosya veya bilgi parçasının numaralandırılmasını gerektiren görevlerde özellikle şiddetlidir. Başarılı görev tamamlama için gereken atomik noktaların sayısı arttıkça, her iki model de tümünü geçme oranında %0’a geriler.

Julio Pereyra - inline image

Bu bir arama stratejisi başarısızlığı değil. Ajanlar tutarlı bir şekilde temel bilgiyi buluyor ve kriterlerin yaklaşık yarısını karşılıyor. Asıl sorun, ne zaman daha fazla bilgi aramaya devam etmeleri gerektiğini bilmemek. Bu, ajanların derlemin içeriğine dair, aramalarının ne zaman yeterince kapsamlı olduğunu bilmelerini sağlayacak etkili bir ara model oluşturmadıklarını gösteriyor.

Kurumsal bilgi söz konusu olduğunda başarılı görev tamamlama, bu özel yeteneğin geliştirilmesini gerektirir.

Sonuç

Hukuki işler, bir sorunun önceki işlerle nasıl ilişkili olduğunu anlamayı gerektirir: hangi emsal bir müşteri için uygundur veya piyasa standardı nasıldır. Günümüzün ajanları bu bilgiyi her görevde sıfırdan türetmeye çalışıyor.

C&H, bu stratejinin kurumsal bilgi ölçeğinde maliyetli ve zayıf olduğunu gösteriyor. Ajanları bu kapasitede geliştirmek için umut verici bir yön, onlara derlemin daha zengin temsillerini önceden oluşturma imkânı tanımak — dizinler, özetler, bellek — ve bu temsilleri oluşturmanın maliyetini sonraki çalıştırmalara yaymaktır. Ortam kalıcı olduğu için, bu tek seferlik anlama maliyetleri birçok görevde karşılığını verir. Yakında buradaki çalışmalarımız hakkında daha fazlasını paylaşacağız.

Bu yazı için oluşturduğumuz sentetik hukuk bürosu verileri açık kaynak depomuzda mevcuttur. C&H’nin mevcut sürümü, bir hukuk bürosunun yaptığı işlerin yalnızca bir bölümünü kapsıyor ve görevleri, avukatların kurumsal bilgilerine yöneltebilecekleri soruların yalnızca bir alt kümesini temsil ediyor. Zaman içinde ikisini de genişletmeyi planlıyoruz.

Özellikle hem veri seti hem de yazı hakkındaki geri bildirimleri için aşağıdaki katkıda bulunanlara teşekkür etmek isteriz: Dan Biderman (Engram), Jessy Lin (Engram), Mayee Chen (Engram), Neel Guha (Columbia Law School / Engram), Shizhe He (Engram), Calvin Qi (Harvey), Gabe Pereyra (Harvey)

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet