YouMind
Oturum aç

Jev abartılı mı? 4 gerçek kurumsal görevde test ettik.

@tonygentilcore
İNGILIZCE28 Eyl 2026
171K
336
35
12
874

TL;DR

Bu makale, Glean'deki dört kurumsal görevde tipli bir karar modeli olan Jev'i LLM'ler ve ince ayar yapılmış sınıflandırıcılarla karşılaştırarak değerlendiriyor. Jev'in yönlendirme ve alıntı değerlendirmesinde hız ve tutarlılık konusundaki güçlü yönlerini vurgularken, yeniden sıralama ve statik sınıflandırmadaki kısıtlamalarına dikkat çekiyor.

Yazarlar: @eddiedzhou, @mr_cheu, @MatZhao, @CosmicPegasis19, @manav_ai

Jev, tipli (typed) kararlar almak için tasarlanmış bir modeldir. Ona bağlamı ve sabit bir soru-seçenek kümesini gönderirsiniz; o da metin üretmek yerine size tercihleri, puanları ve olasılıkları döndürür. Tam anlamıyla bir “Sistem Bir” modeli!

Ancak sınıflandırma yeni bir kavram değil; yapılandırılmış çıktılar, küçük modeller veya logit'lerden olasılık okumak da öyle. Jev'e yönelik bölünmüş tepkilerin bir kısmını bu geçmiş açıklıyor...

Tony Gentilcore - inline image

Şüphecilerin haklı olduğu noktalar var ama Jev'in de bu ekosistemde kendine ait sağlam bir yeri bulunuyor. Konuyu daha iyi kavramak için çözüm uzayının tamamını masaya yatırmamız gerekiyor.

Alternatifler neler?

Bir sistemin bir etikete, puana ya da evet/hayır yanıtına ihtiyacı olduğunda önünde dört makul seçenek vardır:

Yaklaşım

Neden kullanılır?

Ödünleşim (Tradeoff)

Genel amaçlı bir LLM

Zero-shot çalışır, esnektir, argüman veya açıklama da üretebilir. Çıkarım zamanı hesaplama (reasoning) sayesinde tartışmasız biçimde “daha yüksek zekâ” sunar.

Küçük bir karar için otoregresif model gecikmesine ve maliyetine katlanmak

Açık kaynaklı bir zero-shot sınıflandırıcı

Ucuz, yerel ve kontrol edilebilir

Değişken kalite; model seçimi ve sunumu tamamen size aittir

İnce ayar yapılmış (fine-tuned) bir sınıflandırıcı

Etiketleri düzgün, istikrarlı ve yüksek hacimli görevler için genellikle en iyi seçenektir

Veri toplama, eğitim, dağıtım, veri kayması (drift) ve daha az esnek bir taksonomi

Jev

Temiz ve barındırılan bir API'nin arkasında zero-shot esnekliği

Göreve bağlı kalite, metin üretmemesi ve sağlayıcıya bağımlılık

Jev'in avantajı şu: Bir ekip, yeni bir eğitim seti toplamadan soruyu ve seçenekleri değiştirebilir; üstelik bir modeli düzgün şekilde sunmanın zahmetinden de kurtulur. Kimse buna burun kıvırmamalı. “Biz bunu kendimiz de kurabiliriz” cümlesi altyapı ürünlerinin çoğu için geçerlidir.

Açık kaynaklı yeniden üretimler, yenilik iddiasını dengede tutuyor. Qwen ve SGLang, DiffusionGemma ve vLLM ile Kev kullanılarak yapılan uygulamalar, API'nin veya model yapısının büyük bölümünü yeniden oluşturuyor.

Tony Gentilcore - inline image

n=764 üzerinde Jev için %85,7 ve Kev-8B için %79,6

Parallel'in harici testleri de Jev'in yeniden sıralama konusunda rekabetçi olduğunu gösterdi; ancak iki sınıflandırma görevinde yine uzmanlaşmış modeller kazandı.

Glean'de gördüklerimiz

Bu da bizi pratik bir soruya getiriyor: Jev'in zero-shot esnekliği ile barındırılan çıkarımı bir araya getiren yapısı, alternatifleri tam olarak ne zaman geride bırakıyor? Glean'de halihazırda bir temel performans değerimiz olan ve gerçek kurumsal kaliteyi karşılaştırabildiğimiz dört sınırlandırılmış kararı test ettik. Bu temellerin çoğu LLM tabanlı sistemler olduğundan, deneylerde maliyet ve gecikme açısından iki büyüklük mertebesinde iyileşme beklediğimizi biliyorduk. Sonuçlar, production ortamından belirgin şekilde kötüden hem daha hızlı hem de LLM tabanlı bir yönlendiriciden daha doğru olana kadar geniş bir yelpazeye yayıldı.

Sorgu sınıflandırma

Sorgu sınıflandırma, bir isteği alt sistemlerin kullandığı genel bir göreve eşler. İstek başına etiket alanı önceden biliniyor olsa da taksonomi, ince ayarlı bir sınıflandırıcının yeniden eğitilme hızından daha çabuk değişebileceği için bu, Jev için son derece doğal bir iş yüküdür.

Bu deneyde, LLM tabanlı olan production / temel tahminlerimizle Jev'in uyumunu ölçmeye odaklandık. Jev ile çevrimdışı iş hacminde büyük bir hız artışı bekliyorduk ve bunu gözlemledik; bu yüzden kalite için kolay bir vekil ölçüt olarak uyum oranını raporluyoruz. Ayrıca açık ağırlıklı bir karar modeli olan Laya'yı ve ince ayar yapılmış bir Laya versiyonunu da temel aldık. Bu ince ayar yerel olarak birkaç saat içinde çalıştırılabildi ve model bir geliştirici makinesinde sunulabilecek kadar küçük.

Deney

Genel Görev Uyumu

Perf

Jev zero-shot

%66,8

~

12 dk (4 eşzamanlılık

)

Temel Laya

%35,9

~

90 sn (yerel geliştirici makinesi)

İnce ayarlı Laya

%74,5

~

90 sn (yerel geliştirici makinesi)

Eğitim gerektirmeyen, kullanıma hazır pratik bir model olarak Jev açık ara Laya'yı geçiyor; ancak pek de şaşırtıcı olmayan bir şekilde ince ayar, özellikle performans rakamları düşünüldüğünde Laya'yı parlatıyor. Buradaki ödünleşim ise iyi etiketler elde etmek ve eğitimi kurmak için harcanan efor. Görev yeni olduğunda veya etiketleri sık değiştiğinde Jev muhtemelen daha cazip kalmaya devam edecek.

Model yönlendirme: Uzman aktarımı

Model yönlendirme, sorgu sınıflandırma ile yakından ilişkili bir problemdir. Burada model yönlendirmeyi, sistemimizin isteği hangi uzman / modelin ele alacağına karar verdiği bir "uzman aktarımı" olarak çerçevelendiriyoruz. Production temel sistemimiz şu anda bu kararı, aracın (harness) ajan döngüsü içinde doğrudan bir LLM'den istiyor. Bu durum, Jev'in üretici bir çağrıyı sınırlandırılmış bir kararla değiştirip değiştiremeyeceğini test etmek için doğal bir zemin sunsa da önemli bir teknik kısıtlama var: Aktarım yapılmadığında Jev kesinlikle yeni bir çağrı ekleyecektir. Oysa production temel sistemi, aktarım yapılmayan durumlarda araç çağrısı işine aynı ilk LLM çağrısıyla başlayabilir.

Tony Gentilcore - inline image

Yalnızca 3 uzmanın yer aldığı basitleştirilmiş bir production yönlendirme versiyonu kullandık, 751 karşılaştırılabilir altın standardı girdiyi güncellenmiş Jev yönlendiricisinden geçirdik ve seçtiği rotayı mevcut prompt tabanlı yönlendiricimizle (geleneksel bir LLM tarafından destekleniyor) karşılaştırdık; ardından doğruluğu altın etikete göre ölçtük.

Tony Gentilcore - inline image

Ayrıca mevcut yolun gerçekten bir uzman aktarım çağrısı yaptığı 40 girdiyi (daha küçük n) izole ettik ve aynı girdiler üzerinden çağrı gecikmesini karşılaştırdık.

Tony Gentilcore - inline image

Girdi başına medyan hızlanma 8,1× oldu. Bu, şimdiye kadarki en güçlü dahili Jev sonuçlarından biri: Bu sınırlandırılmış yönlendirme görevinde Jev hem daha doğru hem de önemli ölçüde daha hızlıydı. Farkın büyüklüğü, uzman yönlendirmesi yapılmayan isteklerde ödediğimiz “engelleme” vergisinin kabul edilebilir bir ödünleşim olabileceğine işaret ediyor. Bunun hâlâ çevrimdışı bir altın set karşılaştırması olduğunu ve gecikme örnekleminde yalnızca 40 pozitif aktarım bulunduğunu unutmayın; yani riske girip test etmemiz gereken çok şey var!

Yeniden sıralama

Glean'in kalbine yakın bir problem! Aşağıda production temel sistemimiz, Glean'in mevcut arama yığınının ürettiği sıradır. Bu deneyde Jev'den en fazla 50 sonucu yeniden sıralamasını istedik.

Jev'in tipli çıktıları aracılığıyla alakalılığı ifade etmenin dört yolunu denedik:

Formülasyon

Alakalılığı nasıl ifade eder?

Noktasal (Pointwise) Noul

Her sonuç için ayrı bir evet/hayır alakalılık sorusu sorar, ardından “evet” olasılığına göre sıralar.

Paylaşımlı durumlu Noul

Tüm aday setini paylaşılan bağlam olarak Jev'e gösterir, ardından her sonuç için aynı evet/hayır sorusunu sorar.

Puan

Jev'den her adaya sayısal bir alakalılık puanı vermesini ister.

Seçim

Tüm adayları tek bir kararda alternatif olarak ele alır, ardından ortaya çıkan olasılıklarına göre sıralar.

Bunu, kullanıcının tüm kanonik sonuçlara erişiminin olmadığı dahili bir değerlendirme setinde çalıştırdık; dolayısıyla mutlak sayılar production sıralamamızı yansıtmıyor, ancak göreceli rakamlar ilgi çekici.

Jev “Seçim” en güçlü formülasyondu. 4.855 yakalanmış arama sorgusundan oluşan eşleştirilmiş bir kontrol grubunda, production tabanlı eşitlik bozma devre dışı bırakıldığında sonuç şöyleydi:

Tony Gentilcore - inline image

Jev Choice, sorgu başına kabaca 0,00044 $ maliyet yarattı ve çevrimdışı testte p50'de 0,195 saniye sürdü. Ancak ortalama bir sorguda 41 adayın yaklaşık 37'sine aynı puanı verdi. Bu eşitlikleri çözmek için production sırasını kullanmak Recall@6'yı %40,2'den %44,3'e çıkardı ve bu da düzeltilmemiş sonucun, Jev'in puanlarının tek başına hak ettiğinden daha güçlü görünmesine neden oldu. Her zamanki gibi burada birçok uyarı var ama genel yön itibarıyla Jev ucuz ve verimli bir temel sistemdir; Glean'in production sıralayıcısının bir alternatifi değildir.

Atıf-destek değerlendirmesi

Atıf değerlendirmesi birbiriyle bağlantılı iki soru sorar: Kanıt gerektiren iddialar yeterli atıflara sahip mi (atıf duyarlılığı / recall) ve atıfta bulunulan kaynaklar gerçekten onlara atfedilen iddiaları destekliyor mu (atıf kesinliği / precision)? İlk bakışta, çıktı / etiket alanı sınırlandırılmış olduğundan (çoğu jüri senaryosuna benzer şekilde) bu, Jev için bariz bir uygunluk gibi görünüyor. Ancak rubrik karmaşıktır ve birden fazla iddianın ayrıştırılmasını gerektirebilir. Üstelik Jev, hata analizi için sıklıkla kullandığımız gerekçelendirmeyi üretmez; bu da hem kalite hem de kullanılabilirlik açısından bir miktar risk taşır.

Jev'i, yanıtı ve atıf kanıtlarını sabit tutarak 1.448 kelimelik gerçek bir production değerlendirme yanıtı üzerinde test ettik. Paylaşımlı kesinlik-duyarlılık geçişini, akıl yürütme kullanmadan ve xhigh akıl yürütme ile GPT-5.6 Luna ile karşılaştırdık. Varyansı azaltmak için her jüriyi üç kez çalıştırdık.

Jüri

Yanıt başına ölçülen orijinal süre

Yanıt başına ölçülen orijinal maliyet

Jev

6,6 sn

$

0,014

GPT-5.6 Luna, akıl yürütme yok

81,3–85,5 sn

$

0,030–

$

0,047

GPT-5.6 Luna,

xhigh

227,4–259,7 sn

$

0,047–

$

0,060

Zamanlamanın uçtan uca değil, yönsel olduğunu belirtelim: Jev ardışık istemci duvar saati süresini bildirirken, Luna satırları model çağrısı sürelerini toplar. Maliyetlere gözlemlenen önbellekleme dahildir.

Aynı 28 paragrafta tutarlılığı da karşılaştırdık. Değişen bir öğe, jürinin aynı girdiyle yapılan üç çalıştırmadan en az birinde, bir paragrafın yeterli atıf kapsamına sahip olup olmadığına dair kararını değiştirmesi anlamına gelir. İkili anlaşmazlık, her jüri için 84 karşılaştırma olacak şekilde üç çalışma çifti boyunca her paragrafı sayar.

Jüri

Duyarlılık kararı değişen paragraflar

İkili duyarlılık anlaşmazlıkları

Jev

28'de 1 (%3,6)

84'te 2 (%2,4)

GPT-5.6 Luna, akıl yürütme yok

28'de 7 (%25,0)

84'te 15 (%17,9)

GPT-5.6 Luna,

xhigh

28'de 5 (%17,9)

84'te 10 (%11,9)

Jev'in tek değişikliği, bir paragrafın atıf gerektirip gerektirmediği konusundaydı; ham duyarlılık kategorisi değişmedi. Dolayısıyla Jev'in paragraf düzeyindeki atıf kapsamı kararları, her iki Luna yapılandırmasından da daha tekrarlanabilirdi.

Bunun Jev'i daha doğru bir jüri yaptığı sonucuna varmıyoruz (sistemler farklı destek kriterleri ve puanlama paydaları uyguladı ve bağımsız insan etiketlemesi yapacak vaktimiz olmadı). Ancak xhigh akıl yürütme ile bile (Luna'nın model süresini kabaca üçe katladı) Jev'den daha az tutarlı kaldı. Sonuç, dar kapsamlı bir atıf politikasını uygulamak için Jev'in hızlı, ucuz ve nispeten tekrarlanabilir bir yol olduğunu destekliyor.

Deney Çıkarımları ve Pratik Rehber

Bazı durumlarda Jev, hem geleneksel LLM'lere hem de ince ayarlı sınıflandırıcılara karşı düşük sürtünmeli bir alternatif olarak parlıyor. Temel sistem güçlü olduğunda (yeniden sıralama) veya daha küçük bir modele ince ayar yapmak kolay olduğunda (sorgu sınıflandırma) bu avantaj zayıflıyor. Bazı görevlerde (model yönlendirme) daha güçlü bir kaliteye, ayrıca daha iyi tutarlılık ve istikrara (atıf jürisi) dair işaretler var. En kritik iş yüklerimizden bazılarında, geleneksel LLM'lere karşı beklenen maliyet ve gecikme kazanımlarını sağlıyor.

Yukarıdaki sonuçlar iyi yönsel ipuçları veriyor ve Glean'de Jev konusunda oldukça heyecanlıyız. Birkaç adım daha attıktan sonra (başlıca veri ikameti ve garantiler gibi operasyonel hazırlıklar) Jev'i bu kullanım senaryolarından bazılarına entegre etmeyi planlıyoruz. Ayrıca Jev, bu haftaki dahili hackathon'umuzda büyük bir rol oynayacak ve daha fazla sonucu paylaşmak için sabırsızlanıyoruz!

Sonuç olarak birkaç genel tavsiye: Çıktı önceden listelenebiliyorsa Jev'i benchmark'a alın. Görev ve etiketler sabitse ve hacim yüksekse, ince ayarlı bir sınıflandırıcıyı da benchmark'a ekleyin. Çağrının bir sorgu, açıklama veya başka bir dinamik metin üretmesi gerekiyorsa, üretici bir modeli döngüde tutun. Araç çağrısı bunun iyi bir örneğidir: Jev bir aracı seçmenize yardımcı olabilir, ancak çoğu Glean aracı hâlâ dinamik olarak üretilmiş argümanlara (arama sorguları gibi) ihtiyaç duyar.

Jev, sınıflandırıcıların zaten var olduğu gerçeğini değiştirmiyor. İyi bir zero-shot sınıflandırıcıyı kullanmayı çok daha kolay hale getiriyor. Her yapay zekâ sistemi için yeni bir temel oluşturmasa bile bu, gayet sağlam bir ürün.

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet