Yazarlar: @eddiedzhou, @mr_cheu, @MatZhao, @CosmicPegasis19, @manav_ai
Jev, tipli (typed) kararlar almak için tasarlanmış bir modeldir. Ona bağlamı ve sabit bir soru-seçenek kümesini gönderirsiniz; o da metin üretmek yerine size tercihleri, puanları ve olasılıkları döndürür. Tam anlamıyla bir “Sistem Bir” modeli!
Ancak sınıflandırma yeni bir kavram değil; yapılandırılmış çıktılar, küçük modeller veya logit'lerden olasılık okumak da öyle. Jev'e yönelik bölünmüş tepkilerin bir kısmını bu geçmiş açıklıyor...

Şüphecilerin haklı olduğu noktalar var ama Jev'in de bu ekosistemde kendine ait sağlam bir yeri bulunuyor. Konuyu daha iyi kavramak için çözüm uzayının tamamını masaya yatırmamız gerekiyor.
Alternatifler neler?
Bir sistemin bir etikete, puana ya da evet/hayır yanıtına ihtiyacı olduğunda önünde dört makul seçenek vardır:
Yaklaşım
Neden kullanılır?
Ödünleşim (Tradeoff)
Genel amaçlı bir LLM
Zero-shot çalışır, esnektir, argüman veya açıklama da üretebilir. Çıkarım zamanı hesaplama (reasoning) sayesinde tartışmasız biçimde “daha yüksek zekâ” sunar.
Küçük bir karar için otoregresif model gecikmesine ve maliyetine katlanmak
Açık kaynaklı bir zero-shot sınıflandırıcı
Ucuz, yerel ve kontrol edilebilir
Değişken kalite; model seçimi ve sunumu tamamen size aittir
İnce ayar yapılmış (fine-tuned) bir sınıflandırıcı
Etiketleri düzgün, istikrarlı ve yüksek hacimli görevler için genellikle en iyi seçenektir
Veri toplama, eğitim, dağıtım, veri kayması (drift) ve daha az esnek bir taksonomi
Jev
Temiz ve barındırılan bir API'nin arkasında zero-shot esnekliği
Göreve bağlı kalite, metin üretmemesi ve sağlayıcıya bağımlılık
Jev'in avantajı şu: Bir ekip, yeni bir eğitim seti toplamadan soruyu ve seçenekleri değiştirebilir; üstelik bir modeli düzgün şekilde sunmanın zahmetinden de kurtulur. Kimse buna burun kıvırmamalı. “Biz bunu kendimiz de kurabiliriz” cümlesi altyapı ürünlerinin çoğu için geçerlidir.
Açık kaynaklı yeniden üretimler, yenilik iddiasını dengede tutuyor. Qwen ve SGLang, DiffusionGemma ve vLLM ile Kev kullanılarak yapılan uygulamalar, API'nin veya model yapısının büyük bölümünü yeniden oluşturuyor.

n=764 üzerinde Jev için %85,7 ve Kev-8B için %79,6
Parallel'in harici testleri de Jev'in yeniden sıralama konusunda rekabetçi olduğunu gösterdi; ancak iki sınıflandırma görevinde yine uzmanlaşmış modeller kazandı.
Glean'de gördüklerimiz
Bu da bizi pratik bir soruya getiriyor: Jev'in zero-shot esnekliği ile barındırılan çıkarımı bir araya getiren yapısı, alternatifleri tam olarak ne zaman geride bırakıyor? Glean'de halihazırda bir temel performans değerimiz olan ve gerçek kurumsal kaliteyi karşılaştırabildiğimiz dört sınırlandırılmış kararı test ettik. Bu temellerin çoğu LLM tabanlı sistemler olduğundan, deneylerde maliyet ve gecikme açısından iki büyüklük mertebesinde iyileşme beklediğimizi biliyorduk. Sonuçlar, production ortamından belirgin şekilde kötüden hem daha hızlı hem de LLM tabanlı bir yönlendiriciden daha doğru olana kadar geniş bir yelpazeye yayıldı.
Sorgu sınıflandırma
Sorgu sınıflandırma, bir isteği alt sistemlerin kullandığı genel bir göreve eşler. İstek başına etiket alanı önceden biliniyor olsa da taksonomi, ince ayarlı bir sınıflandırıcının yeniden eğitilme hızından daha çabuk değişebileceği için bu, Jev için son derece doğal bir iş yüküdür.
Bu deneyde, LLM tabanlı olan production / temel tahminlerimizle Jev'in uyumunu ölçmeye odaklandık. Jev ile çevrimdışı iş hacminde büyük bir hız artışı bekliyorduk ve bunu gözlemledik; bu yüzden kalite için kolay bir vekil ölçüt olarak uyum oranını raporluyoruz. Ayrıca açık ağırlıklı bir karar modeli olan Laya'yı ve ince ayar yapılmış bir Laya versiyonunu da temel aldık. Bu ince ayar yerel olarak birkaç saat içinde çalıştırılabildi ve model bir geliştirici makinesinde sunulabilecek kadar küçük.
Deney
Genel Görev Uyumu
Perf
Jev zero-shot
%66,8
~
12 dk (4 eşzamanlılık
)
Temel Laya
%35,9
~
90 sn (yerel geliştirici makinesi)
İnce ayarlı Laya
%74,5
~
90 sn (yerel geliştirici makinesi)
Eğitim gerektirmeyen, kullanıma hazır pratik bir model olarak Jev açık ara Laya'yı geçiyor; ancak pek de şaşırtıcı olmayan bir şekilde ince ayar, özellikle performans rakamları düşünüldüğünde Laya'yı parlatıyor. Buradaki ödünleşim ise iyi etiketler elde etmek ve eğitimi kurmak için harcanan efor. Görev yeni olduğunda veya etiketleri sık değiştiğinde Jev muhtemelen daha cazip kalmaya devam edecek.
Model yönlendirme: Uzman aktarımı
Model yönlendirme, sorgu sınıflandırma ile yakından ilişkili bir problemdir. Burada model yönlendirmeyi, sistemimizin isteği hangi uzman / modelin ele alacağına karar verdiği bir "uzman aktarımı" olarak çerçevelendiriyoruz. Production temel sistemimiz şu anda bu kararı, aracın (harness) ajan döngüsü içinde doğrudan bir LLM'den istiyor. Bu durum, Jev'in üretici bir çağrıyı sınırlandırılmış bir kararla değiştirip değiştiremeyeceğini test etmek için doğal bir zemin sunsa da önemli bir teknik kısıtlama var: Aktarım yapılmadığında Jev kesinlikle yeni bir çağrı ekleyecektir. Oysa production temel sistemi, aktarım yapılmayan durumlarda araç çağrısı işine aynı ilk LLM çağrısıyla başlayabilir.

Yalnızca 3 uzmanın yer aldığı basitleştirilmiş bir production yönlendirme versiyonu kullandık, 751 karşılaştırılabilir altın standardı girdiyi güncellenmiş Jev yönlendiricisinden geçirdik ve seçtiği rotayı mevcut prompt tabanlı yönlendiricimizle (geleneksel bir LLM tarafından destekleniyor) karşılaştırdık; ardından doğruluğu altın etikete göre ölçtük.

Ayrıca mevcut yolun gerçekten bir uzman aktarım çağrısı yaptığı 40 girdiyi (daha küçük n) izole ettik ve aynı girdiler üzerinden çağrı gecikmesini karşılaştırdık.

Girdi başına medyan hızlanma 8,1× oldu. Bu, şimdiye kadarki en güçlü dahili Jev sonuçlarından biri: Bu sınırlandırılmış yönlendirme görevinde Jev hem daha doğru hem de önemli ölçüde daha hızlıydı. Farkın büyüklüğü, uzman yönlendirmesi yapılmayan isteklerde ödediğimiz “engelleme” vergisinin kabul edilebilir bir ödünleşim olabileceğine işaret ediyor. Bunun hâlâ çevrimdışı bir altın set karşılaştırması olduğunu ve gecikme örnekleminde yalnızca 40 pozitif aktarım bulunduğunu unutmayın; yani riske girip test etmemiz gereken çok şey var!
Yeniden sıralama
Glean'in kalbine yakın bir problem! Aşağıda production temel sistemimiz, Glean'in mevcut arama yığınının ürettiği sıradır. Bu deneyde Jev'den en fazla 50 sonucu yeniden sıralamasını istedik.
Jev'in tipli çıktıları aracılığıyla alakalılığı ifade etmenin dört yolunu denedik:
Formülasyon
Alakalılığı nasıl ifade eder?
Noktasal (Pointwise) Noul
Her sonuç için ayrı bir evet/hayır alakalılık sorusu sorar, ardından “evet” olasılığına göre sıralar.
Paylaşımlı durumlu Noul
Tüm aday setini paylaşılan bağlam olarak Jev'e gösterir, ardından her sonuç için aynı evet/hayır sorusunu sorar.
Puan
Jev'den her adaya sayısal bir alakalılık puanı vermesini ister.
Seçim
Tüm adayları tek bir kararda alternatif olarak ele alır, ardından ortaya çıkan olasılıklarına göre sıralar.
Bunu, kullanıcının tüm kanonik sonuçlara erişiminin olmadığı dahili bir değerlendirme setinde çalıştırdık; dolayısıyla mutlak sayılar production sıralamamızı yansıtmıyor, ancak göreceli rakamlar ilgi çekici.
Jev “Seçim” en güçlü formülasyondu. 4.855 yakalanmış arama sorgusundan oluşan eşleştirilmiş bir kontrol grubunda, production tabanlı eşitlik bozma devre dışı bırakıldığında sonuç şöyleydi:

Jev Choice, sorgu başına kabaca 0,00044 $ maliyet yarattı ve çevrimdışı testte p50'de 0,195 saniye sürdü. Ancak ortalama bir sorguda 41 adayın yaklaşık 37'sine aynı puanı verdi. Bu eşitlikleri çözmek için production sırasını kullanmak Recall@6'yı %40,2'den %44,3'e çıkardı ve bu da düzeltilmemiş sonucun, Jev'in puanlarının tek başına hak ettiğinden daha güçlü görünmesine neden oldu. Her zamanki gibi burada birçok uyarı var ama genel yön itibarıyla Jev ucuz ve verimli bir temel sistemdir; Glean'in production sıralayıcısının bir alternatifi değildir.
Atıf-destek değerlendirmesi
Atıf değerlendirmesi birbiriyle bağlantılı iki soru sorar: Kanıt gerektiren iddialar yeterli atıflara sahip mi (atıf duyarlılığı / recall) ve atıfta bulunulan kaynaklar gerçekten onlara atfedilen iddiaları destekliyor mu (atıf kesinliği / precision)? İlk bakışta, çıktı / etiket alanı sınırlandırılmış olduğundan (çoğu jüri senaryosuna benzer şekilde) bu, Jev için bariz bir uygunluk gibi görünüyor. Ancak rubrik karmaşıktır ve birden fazla iddianın ayrıştırılmasını gerektirebilir. Üstelik Jev, hata analizi için sıklıkla kullandığımız gerekçelendirmeyi üretmez; bu da hem kalite hem de kullanılabilirlik açısından bir miktar risk taşır.
Jev'i, yanıtı ve atıf kanıtlarını sabit tutarak 1.448 kelimelik gerçek bir production değerlendirme yanıtı üzerinde test ettik. Paylaşımlı kesinlik-duyarlılık geçişini, akıl yürütme kullanmadan ve xhigh akıl yürütme ile GPT-5.6 Luna ile karşılaştırdık. Varyansı azaltmak için her jüriyi üç kez çalıştırdık.
Jüri
Yanıt başına ölçülen orijinal süre
Yanıt başına ölçülen orijinal maliyet
Jev
6,6 sn
$
0,014
GPT-5.6 Luna, akıl yürütme yok
81,3–85,5 sn
$
0,030–
$
0,047
GPT-5.6 Luna,
xhigh
227,4–259,7 sn
$
0,047–
$
0,060
Zamanlamanın uçtan uca değil, yönsel olduğunu belirtelim: Jev ardışık istemci duvar saati süresini bildirirken, Luna satırları model çağrısı sürelerini toplar. Maliyetlere gözlemlenen önbellekleme dahildir.
Aynı 28 paragrafta tutarlılığı da karşılaştırdık. Değişen bir öğe, jürinin aynı girdiyle yapılan üç çalıştırmadan en az birinde, bir paragrafın yeterli atıf kapsamına sahip olup olmadığına dair kararını değiştirmesi anlamına gelir. İkili anlaşmazlık, her jüri için 84 karşılaştırma olacak şekilde üç çalışma çifti boyunca her paragrafı sayar.
Jüri
Duyarlılık kararı değişen paragraflar
İkili duyarlılık anlaşmazlıkları
Jev
28'de 1 (%3,6)
84'te 2 (%2,4)
GPT-5.6 Luna, akıl yürütme yok
28'de 7 (%25,0)
84'te 15 (%17,9)
GPT-5.6 Luna,
xhigh
28'de 5 (%17,9)
84'te 10 (%11,9)
Jev'in tek değişikliği, bir paragrafın atıf gerektirip gerektirmediği konusundaydı; ham duyarlılık kategorisi değişmedi. Dolayısıyla Jev'in paragraf düzeyindeki atıf kapsamı kararları, her iki Luna yapılandırmasından da daha tekrarlanabilirdi.
Bunun Jev'i daha doğru bir jüri yaptığı sonucuna varmıyoruz (sistemler farklı destek kriterleri ve puanlama paydaları uyguladı ve bağımsız insan etiketlemesi yapacak vaktimiz olmadı). Ancak xhigh akıl yürütme ile bile (Luna'nın model süresini kabaca üçe katladı) Jev'den daha az tutarlı kaldı. Sonuç, dar kapsamlı bir atıf politikasını uygulamak için Jev'in hızlı, ucuz ve nispeten tekrarlanabilir bir yol olduğunu destekliyor.
Deney Çıkarımları ve Pratik Rehber
Bazı durumlarda Jev, hem geleneksel LLM'lere hem de ince ayarlı sınıflandırıcılara karşı düşük sürtünmeli bir alternatif olarak parlıyor. Temel sistem güçlü olduğunda (yeniden sıralama) veya daha küçük bir modele ince ayar yapmak kolay olduğunda (sorgu sınıflandırma) bu avantaj zayıflıyor. Bazı görevlerde (model yönlendirme) daha güçlü bir kaliteye, ayrıca daha iyi tutarlılık ve istikrara (atıf jürisi) dair işaretler var. En kritik iş yüklerimizden bazılarında, geleneksel LLM'lere karşı beklenen maliyet ve gecikme kazanımlarını sağlıyor.
Yukarıdaki sonuçlar iyi yönsel ipuçları veriyor ve Glean'de Jev konusunda oldukça heyecanlıyız. Birkaç adım daha attıktan sonra (başlıca veri ikameti ve garantiler gibi operasyonel hazırlıklar) Jev'i bu kullanım senaryolarından bazılarına entegre etmeyi planlıyoruz. Ayrıca Jev, bu haftaki dahili hackathon'umuzda büyük bir rol oynayacak ve daha fazla sonucu paylaşmak için sabırsızlanıyoruz!
Sonuç olarak birkaç genel tavsiye: Çıktı önceden listelenebiliyorsa Jev'i benchmark'a alın. Görev ve etiketler sabitse ve hacim yüksekse, ince ayarlı bir sınıflandırıcıyı da benchmark'a ekleyin. Çağrının bir sorgu, açıklama veya başka bir dinamik metin üretmesi gerekiyorsa, üretici bir modeli döngüde tutun. Araç çağrısı bunun iyi bir örneğidir: Jev bir aracı seçmenize yardımcı olabilir, ancak çoğu Glean aracı hâlâ dinamik olarak üretilmiş argümanlara (arama sorguları gibi) ihtiyaç duyar.
Jev, sınıflandırıcıların zaten var olduğu gerçeğini değiştirmiyor. İyi bir zero-shot sınıflandırıcıyı kullanmayı çok daha kolay hale getiriyor. Her yapay zekâ sistemi için yeni bir temel oluşturmasa bile bu, gayet sağlam bir ürün.





