YouMind
Oturum aç

Jev, Ajanlar için tasarlanmadı

@kylejeong
İNGILIZCE21 Eyl 2026
126K
173
21
5
324

TL;DR

Jev, genel amaçlı ajanlardan farklı olarak hızlı ve yapılandırılmış kararlar için özel olarak geliştirilmiş bir yapay zeka modelidir. Bu makale, Jev'in mimarisini, maliyet avantajlarını ve Stagehand gibi yazılım iş akışlarına pratik entegrasyonunu açıklamaktadır.

Geçtiğimiz hafta boyunca mağarada yaşamadıysan, @typesafeai hesabındaki Jev’i görmüşsündür.

https://x.com/CompleteSkeptic/status/2099925682726002904

Modellerini şu şekilde tanımlıyorlar:

Yazılımın doğrudan kullanabileceği hızlı ve yapılandırılmış kararları almak üzere tasarlanmış bir AI modeli sınıfı. Bir System One modeli

state değerlendirmesini yapar ve tipli cevaplar ile olasılıkları döndürür.

TypeSafe’in benchmarklarına göre Jev, LLM’lerden 20-200 kat daha hızlı ve 40-400 kat daha ucuz.

Peki bu neden önemli? Daha önce sınıflandırıcılar (telefonundaki otomatik düzeltme, Gmail filtreleme vb.) eğittik ama Twitter’daki söylentilere göre Jev bambaşka bir şey.

Bu makalede, Jev’in ne olduğunu, neden var olduğunu ve üretim sistemlerine nasıl entegre edilebileceğini anlatmaya çalışacağım.

Jev tam olarak nedir?

“Jev’i, frontier-intelligence fonksiyon çağrısı gibi düşünün: Yapılandırılmamış state girer, tipli olasılıksal kararlar çıkar.” - TypeSafe

Jev 3 temel bileşen sunar: Choice, Score ve Noul.

  • Choice, seçilen opsiyonu, her opsiyon için olasılığı ve güven düzeyini içeren cevabı döndüren, tanımlı bir kümeden (maksimum 255) tek bir seçenek seçen soru tipidir.
  • Score, içeriği sıralı ve betimleyici seviyelere karşı puanlayan; cevabında bir skor, her seviye için olasılık ve güven düzeyi bulunan bir primitiftir.
  • Noul ise modele evet/hayır sorusunu değerlendirip, cevabın "evet" olma olasılığını döndürmesini söyler.

İşte müşteri desteği kullanım senaryosu için örnek bir girdi ve çıktı:

json
1// Girdi
2{
3 "model": "jev-latest",
4 "state": "Merhaba, aylık aboneliğim için iki kez ücretlendirildim. Ek ücretin iadesini yapabilir misiniz? Hesabım gayet iyi çalışıyor.",
5 "questions": {
6 "department": {
7 "type": "choice",
8 "instructions": "Bu mesajla hangi ekip ilgilenmeli?",
9 "criteria": {
10 "billing": "Ücretler, ödemeler, abonelikler ve iadeler",
11 "technical": "Hatalar, buglar ve bozuk özellikler",
12 "account": "Giriş, şifreler ve hesap erişimi"
13 }
14 },
15 "requests_refund": {
16 "type": "noul",
17 "instructions": "Müşteri açıkça para iadesi talep ediyor mu?"
18 },
19 "frustration": {
20 "type": "score",
21 "instructions": "Müşteri ne kadar sinirli görünüyor?",
22 "criteria": [
23 "Sakin: Sorunu sinirlilik belirtmeden kibarca açıklıyor",
24 "Sinirli: Rahatsızlık veya memnuniyetsizlik ifade ediyor",
25 "Çok Sinirli: Güçlü öfke ifade ediyor veya ayrılma tehdidinde bulunuyor"
26 ]
27 }
28 }
29}
30// Çıktı
31{
32 "model": "jev-1.13.0",
33 "answers": {
34 "department": {
35 "type": "choice",
36 "choice": "billing",
37 "confidence": 1,
38 "probabilities": {
39 "technical": 0,
40 "account": 0,
41 "billing": 1
42 }
43 },
44 "requests_refund": {
45 "type": "noul",
46 "noul": 0.99
47 },
48 "frustration": {
49 "type": "score",
50 "score": 0,
51 "legend": {
52 "0": "Sakin: Sorunu sinirlilik belirtmeden kibarca açıklıyor",
53 "1": "Sinirli: Rahatsızlık veya memnuniyetsizlik ifade ediyor",
54 "2": "Çok Sinirli: Güçlü öfke ifade ediyor veya ayrılma tehdidinde bulunuyor"
55 },
56 "confidence": 1,
57 "probabilities": {
58 "0": 1,
59 "1": 0,
60 "2": 0
61 }
62 }
63 },
64 "usage": {
65 "input_tokens": 442,
66 "output_tokens": 72
67 },
68 "request_id": "playground_12bbfa4198be5ca4de9818a45c0906a2055",
69 "evaluation_time_ms": 163.01120699790772
70}

State ve questions'ın çıktılar için birlikte nasıl çalıştığını daha iyi anlamak adına dashboard onboarding sürecini incelemeni öneririm.

Bu sadece bir sınıflandırıcı değil mi?

Evet ve hayır. Daha çok bir LLM ile sınıflandırıcının çocuğu gibi düşünebilirsin.

Geleneksel sınıflandırıcılar, yüksek hacimli ve sabit taksonomi görevleri için iyidir. Örneğin LeNet-5'in bir görseldeki rakamı tanıması gibi. Ancak sınıflandırıcılar genellikle aşırı özelleşmiş ve alan bazlıdır. LLM'ler dizi üretmede iyidir. Esneklerdir ve çalışma zamanında tanımlanan açık uçlu görevler için harikadırlar, ancak sınıflandırıcılara kıyasla daha yavaş, daha pahalı ve daha az öngörülebilirdirler.

Jev, bir LLM'in doğal dil esnekliğini, bir sınıflandırıcının kısıtlı ve olasılıksal çıktısıyla birleştiren "sınıflandırma için temel model"dir. Yeni bir model eğitmek zorunda kalmadan çeşitli görevleri tamamlayabilirken, farklı alanlarda (kod, metin, loglar, UI durumları, olaylar vb.) uzmanlığı da koruyabilirsiniz. Jev ayrıca çıktıyı paralel olarak üretebilir; bu da onu yalnızca sıralı üretime dayalı olan bir LLM'den çok daha hızlı kılar.

TL;DR: Gerçekten akıllı, genelleştirilebilir bir sınıflandırıcı.

Jev neden var?

TypeSafe'in CEO'su ve kurucu ortağı Diogo Almeida, OpenAI'da RLHF (insan geri bildirimiyle pekiştirmeli öğrenme) ve ChatGPT ürününün oluşturulmasına yardımcı olmak için zaman geçirdi. RLHF, LLM'lerin talimatları ve promptları takip etmede çok iyi hale gelmesini sağladı; bu da onların otoregresif doğasıyla örtüşüyor.

Daha sonra OpenAI'dan ayrılan Diogo, agent'lar yerine AI destekli yazılımı mümkün kılmak için farklı bir model sınıfı eğitmek amacıyla TypeSafe'i kurdu. Jev, RLCD (kalibre edilmiş kararlardan pekiştirmeli öğrenme) ile eğitiliyor; bu terim, modelin cevaplar yerine güven ve olasılık üretmede çok iyi olması için eğitildiğinin araştırma diliyle ifadesidir.

TypeSafe, yazılımın zeki olması gerektiğine inanıyor. Agent'lar, yazılımın tarihsel çalışma şekline doğal olarak nüfuz etmiyor ve insan döngüde (human-in-the-loop) kaldığında hem zeki hem de otonom yazılım yapmak zorlaşıyor. Jev, yazılım sistemleri içinde bestelenebilir, güvenilir bir primitif olarak zekanın bir adımıdır.

Bu tamamen yeni bir fikir değil; araştırmacılar 2017 yılında güçlü tahmin doğruluğunun güvenilir güven tahminleri anlamına gelmediğini buldular (yani LLM'ler burada mükemmel bir çözüm değil).

RLHF yerine neden RLCD?

RLHF'nin sorunu, insanların istediğinin her zaman nesnel olarak doğru olmamasıdır. Belirli bir formattaki belirli bir cevabı tercih etmemiz, modelleri daha zeki yapmaz; sadece onlarla çalışmayı daha keyifli hale getirir.

Ayrıca mod çökmesi (mode collapse) sorununu da beraberinde getirir. RLHF, bazen birden fazla yolun "doğru" olabileceği durumlarda LLM'leri tek bir cevaba yakınsatır.

“Bir çıktı, bir kişi için ikna edici olabilir ancak gözetimsiz otomasyon için yeterince güvenilir olmayabilir. İnsan tercihi ve makine güvenilirliği farklı optimizasyon hedefleridir.”

Kyle Jeong - inline image

Jev Dokümanlarında Mod Çökmesi

Jev, agent'lar inşa etmek için tasarlanmadı

Zaman çizelgenizde gördüğünüzün aksine, Jev bağımsız bir agent olarak pek iyi değildir. Hem sadece Jev'i hem de LLM + Jev kombinasyonunu kullanarak versiyonlarını inşa etmeyi denedik.

https://x.com/kylejeong/status/2100622054945095934

Dürüst olmak gerekirse, Jev agent'ları havalı demolar için harika. Jev'i kullanarak yıldırım hızında agent görevlerini yapan tonlarca demo var. Ama en iyi demolar bile üretim ortamına (production) deploy edilmeye hazır değil.

Jev gibi bir model, AI destekli yazılım içindir; deterministik kodla oluşturulan kararlar almanıza yardımcı olabilir. Akıl yürütme veya üretken yetenekler olmadan, onu bağımsız bir agent olarak kullanmak saf cehalet olur.

Kyle Jeong - inline image

AI Destekli Yazılım

Jev'i bağımsız bir bilgisayar kullanımı agent'ı olarak bırakmak yerine, müşteri desteği yönlendirmesi, fatura işleme, güvenlik uyarıları ve triyajı veya bir agent izleyicisi olarak kullanılmalıdır.

Rakamlar

İlk modelleri Jev 1.13.0, giriş tokenları için $42/btok (veya $0.042/mtok) ve çıkış tokenları için $0 maliyetindedir. Referans olarak, Fable 5.1 giriş için $10/mtok'dur ki bu da $10,000 / Btok eder. Tipik kurumsal iş yüklerinde giriş-çıkış token oranı 3:1 veya 4:1'dir, bu nedenle Fable ~$20,000/Btok'a çıkar ($50/mtok çıkışla).

Bağlam penceresi istek başına 64k tokendir; state + en uzun soru 32k token'a sığmalıdır.

Ancak dahili benchmarklarında, OpenAI, Anthropic ve Deepseek'ten (çıkarım için Fireworks üzerinden) tüm modelleri doğruluk/maliyet ve doğruluk/hız açısından geride bırakıyorlar.

Kyle Jeong - inline image

Doğruluk/Maliyet

Yeterince konuştuk, nasıl kullanırım?

Şu anda üzerinde çalıştığın her ne olursa olsun, Jev hakkında yeterli bilgiye sahip olduğuna ve birkaç kullanım senaryosu düşündüğüne eminim. (Değilse, TypeSafe tarafından önerilen kullanım senaryoları listesi burada).

Onu nasıl kullanacağın konusunda yaratıcılığını kısıtlamak yerine, Jev'i framework'ümüz Stagehand'e nasıl entegre ettiğimizi göstereceğim.

Son 2 yıldır Stagehand, AI ve Agent'ların uzak tarayıcıyı kontrol etmesi için bir framework olarak evrimleşti. Agent'lar yeterince iyi olmadan önce, geliştiricilerin web'i otomatikleştirmek için kendi kendini iyileştiren scriptler yazmasına yardımcı olmak amacıyla Act (bir eylemi tamamlama), Extract (yapılandırılmış veri çekme) ve Observe (sayfadaki potansiyel eylemleri keşfetme) gibi AI primitiflerini oluşturduk.

Playwright (veya diğer eski framework'ler) kullanıp eylemlerde selector sağlamak için DOM'u elle parse etmek yerine, Stagehand A/E/O otomasyonlar oluşturmak için doğal dili kullanmanıza olanak tanır.

typescript
1// Playwright
2await page.click('button[type="submit"]');
3
4// Stagehand
5stagehand.act("gönder butonuna tıkla")

Bu durum, ilk kez script yazarken (geliştirme hızı çok daha fazladır) faydalıdır, ancak özellikle script bakımı için çok işe yarar. Bir web sitesi değişir ve DOM selector'ları güncellenirse, Playwright script'lerinin yeni sayfaya uyacak şekilde yeniden yazılması gerekir. Stagehand, selector'ları ve eylemleri çalışma zamanında seçer ve "kendi kendini iyileştirir".

Buraya doğru gittiğimizi biraz hissedebilirsin. Jev bu primitiflere son derece iyi uyum sağlar. Başlangıçta ne yapılacağına karar vermek için bir LLM kullanıyorduk (sayfanın görünümü ve hedef hakkında bağlam verilerek). Jev ile, hangi selector'larla etkileşime geçileceğine karar vermek için Choice'u kullanabiliyoruz.

Akışı konuşmak için özellikle Act'i kullanalım. Normalde, hibrit bir a11y-ağacı kullanarak sayfanın özlü bir temsilini LLM'e verirdik. Jev ile, öncelikle a11y ağacındaki düğümleri etkileşime açık (zengin metin editörleri dahil) veya kapalı olarak işaretleriz.

stagehand.act çağrıldığında:

  • Jev, talimatı bir eyleme (click, fill veya scroll gibi) sınıflandırır
  • Stagehand argümanları parse eder ve o eylem için aday listesini oluşturur (yakındaki sayfa bağlamını içerir)
  • Jev, 0.7 kabul eşiğiyle "hangi aday en iyisi" ve "herhangi bir aday eşleşiyor mu" sorularını yanıtlar
  • Eğer aday eylem kabul edilirse, Stagehand yürütmeyi üstlenir
  • Eylem kabul edilmezse, Stagehand bir LLM'e geri döner
Kyle Jeong - inline image

Act Akışı

Erken testlerde, Act medyan gecikmesi 1.97 saniyeden 0.46 saniyeye düşüyor; bu yaklaşık 4.3× daha hızlı (veya %77 daha az süre) demek. Tam PR stack'ine buradan göz atabilirsiniz.

Bilgisayar kullanımı söz konusu olduğunda, Jev pastanın bir parçasıdır ama bağımsız bir çözüm değildir. Artık agent'ların kullanabileceği daha deterministik yazılım araçları inşa edebiliyoruz.

Kyle Jeong - inline image

Jev Ne Zaman Kullanılır

Gerçek dünyada AI'ı yaygınlaştırmak

Jev, üretim kalitesinde (production grade) bilgisayar kullanımı agent'ları inşa edecek mi? Hayır. Bulmacanın faydalı bir parçası mı? Bence öyle olacak.

Jev öncesinde mantıklı olmayan bir bolluk fikrin olduğu hissi var. Anlık arama, akıllı kopyala-yapıştır ve daha basit ama son derece faydalı araçlar inşa eden insanlar gördüm.

AI, senkronize veya asenkronize bir tür sohbet arayüzü versiyonuna hapsedilmemeli. Jev gibi modellerle, sohbet giriş kutusu olmadan tahmin modellerini içeren yazılımlar inşa edebiliriz. Sınıflandırıcılar uzun süredir mevcut olsa da, hiç bu kadar faydalı hissettirmemişlerdi. Belki de ihtiyacımız olan tek şey ilhamdı.

-> Kyle

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet