YouMind
Oturum aç

Jev Modeli Açıklaması: Hızlı ve Uygun Maliyetli Kararlar İçin Yeni Bir Yapay Zeka

123K
237
32
17
355

TL;DR

Jev, TypeSafe AI tarafından geliştirilen ve sınıflandırma ile puanlama gibi yargılama görevlerine özel olarak tasarlanmış yeni bir yapay zeka modelidir. Ajan iş akışları için LLM'lere göre daha hızlı ve ekonomik alternatifler sunar.

Merhaba arkadaşlar, ben Jin Chenma.

Sizlere bir soruyla başlamak istiyorum: İşledikleri içerik türlerine göre, genellikle karşılaştığımız büyük yapay zeka modellerinin ortak kategorileri nelerdir?

Çoğu kişi metin, görsel, ses ve video ile aşinadır. Son birkaç yılda çeşitli sağlayıcılar bu alanlarda sürekli rekabet edip geliştirmeler yaparak yetenekleri güçlendirdi ve rekabeti kızıştırdı.

Bu kadar çok güncellemeyi gördükten sonra aklımdan şu soru geçmeye devam etti: Mevcut modelleri daha güçlü hale getirmek dışında, yeni model formları ortaya çıkacak mı?

Son zamanlarda Jev adında bir model viral oldu. İlk başta şöyle düşündüm: Bu da başka bir şirketin yayınladığı yeni bir büyük dil modeli mi?

Ancak derinlemesine incelediğimde, bu modelin gerçekten etkileyici olduğunu fark ettim.

Arkasındaki TypeSafe AI, yazılımdaki yargılama görevleri için özel olarak tasarlanmış "System One Models" (Birinci Sistem Modelleri) adı verilen bir model sınıfını önerdi. Jev, onların ilk genel erişime açık modeli.

Önceki kategoriler (metin, görsel, ses, video) içerik türüne göre ayrılmıştı; bu sefer bakış açısını değiştirdiler: "Yargıda bulunmayı" bağımsız bir görev olarak ele alıp buna göre bir model tasarladılar.

Bence bu yön, yapay zeka modellerinin gelecekteki gelişimi ve iş bölümü üzerinde derin bir etkiye sahip olabilir.

Bu makalede, Jev'in ne olduğunu, standart LLM'lerden nasıl farklı olduğunu, nerede kullanılabileceğini ve nasıl başlanacağını net bir şekilde açıklayacağım.

QR Kod Analojisiyle Başlangıç

Jev'i nasıl anlamalıyız? Bir QR kodu oluşturmak istediğinizi hayal edin.

Normalde bir QR kod üretme aracı kullanırsınız. Ama diyelim ki her şeyi çizebilen bir sanatçı tuttunuz ve ondan QR kodu piksel piksel çizmesini istediniz.

Elbette bu sanatçı yetenekli ve bunu yapabilir. Ancak QR kodu oluşturmak için özel araçlar var. Sizin ihtiyacınız sadece çalışan bir QR kodu, yanında manzara resmi değil.

金尘马 - inline image

Benzer şekilde, Jev'i Büyük Dil Modelleri (LLM) ile kıyaslayalım:

LLM'ler makale yazar, kod yazar ve karmaşık problemleri tartışır. Bir LLM'den bir yorumu okuyup kullanıcının duygusunu yargılamasını isterseniz, bunu kesinlikle yapabilir.

Ama eğer görev yalnızca bir seçim veya puanlama gerektiriyorsa şunu düşünün: Böyle görevler için özel olarak tasarlanmış, daha hızlı, daha ucuz ve programatik olarak erişilebilir bir model yaratabilir miyiz?

Tam olarak Jev'in yaptığı şey budur.

Serbest metin üretiminden vazgeçerek, cevap kapsamı net olan yargılara odaklanır. Örneğin, size dört seçenek verildiğinde—"Memnun", "Memnun Değil", "Karışık", "Belirsiz"—birini seçer ve her seçenek için olasılıkları sunar.

Tıpkı QR kodların özel araçları olduğu gibi, sadece seçim ve puanlama gerektiren görevler de uzmanlaşmış modeller tarafından ele alınabilir. Resmi tanıtımlara göre, Jev'in bu yargılama görevleri için optimizasyonu yanıt süresini ve çağrı maliyetlerini azaltıyor.

Örneğin, günlük devasa e-ticaret yorumlarını filtrelemek, duygu, aciliyet ve ele alma yöntemlerini yargılamayı gerektirir. Daha hızlı ve ucuz yargılar, genel bekleme sürelerini ve maliyetleri azaltır. Programlar sonuçları alır ve sınıflandırma veya insan müdahalesine yönlendirme işlemine devam eder.

Jev'in Kökeni

Jev'i kim yarattı? Neden sadece yargılama için bir model inşa edildi?

Jev, OpenAI'da sohbet modeli araştırmaları üzerinde çalışmış olan Diogo Almeida tarafından kurulan TypeSafe AI'dan geliyor.

Almeida, şu probleme odaklandı: Yapay zeka sohbette harika ama neden bu yetenekleri otomatik görevler için yazılıma entegre etmek kolay değil?

Yazılım, açık kuralları uygulamakta ustadır. A koşulu sağlanıyorsa B eylemini yapın. Ancak gerçek dünyadaki birçok yargı, kurallarla önceden tanımlanması zordur.

Yorumları okumak gibi. Hangi ifadeler şikayet? Hangileri şaka? Hangileri pozitif görünüp gizli eleştiri barındırıyor? Kullanıcı konuşma kalıplarının tamamını birkaç kuralla kapsaması zor.

TypeSafe, semantik yargıyı çağrılabilir bir bileşen haline getirmek istiyor. Bir program metni anlamak veya sonraki adımı seçmek gerektiğinde, bu küçük görevi modele devrediyor, sonucu alıyor ve yürütmeye devam ediyor.

Bu modellere Hızlı ve Yavaş Düşünme kitabındaki kavramdan ödünç alarak System One (Birinci Sistem) diyorlar. Hızlı, sezgisel yargılama kısmı olarak düşünün.

Jev ismi, ekonomist Jevons'tan geliyor. Ekibin beklentisi oldukça basit: Akıllı çağrıların maliyeti ne kadar düşük olursa, insanlar onu o kadar çok yerde kullanır.

Daha önce tek bir AI çağrısı için fazla pahalı hissedilen bazı adımlar vardı. Eğer yargılama yeterince hızlı ve ucuzsa, bunları yeniden değerlendirmek mantıklı hale gelir.

Jev, LLM'lerden Nasıl Farklı?

Yazılımın AI yargısı için çağrıları daha ucuz ve kolay hale getirmek iyi bir başlangıç noktası. Ancak mevcut LLM'ler de yargıda bulunup yapılandırılmış sonuçlar döndürebilir. Neden Jev'i inşa ettiniz?

Önce, LLM'lerin yargı sonuçlarını programlara nasıl sunduğunu görelim.

LLM'ler yapılandırılmış çıktıyı destekler, yani cevaplar önceden tanımlanmış alanlara yerleşir. Örneğin, biri duygu, biri aciliyet, biri ele alma yöntemi için. Program her konumun neyi temsil ettiğini bilir.

JSON'u biliyor olabilirsiniz, yapılandırılmış veri için yaygın bir format. Geliştiriciler, LLM çıktılarını belirli formatları takip edecek şekilde kısıtlayabilir.

Yani, sadece nihai çıktının metin mi yoksa JSON mu olduğuna bakmak, Jev ile LLM'ler arasındaki ana farkı ortaya koymaz.

Fark, modelin sonucu nasıl ürettiğinde yatıyor.

Standart üretken LLM'ler tipik olarak cevapları token token (parça parça) üretir. Tokenlar, modelin işlediği küçük metin parçalarıdır. Sabit formatlı veri talep etseniz bile, genellikle sonucu adım adım üretir.

Jev, yargılama görevleri için özel bir çıktı yöntemi kullanır ve birden fazla yargıyı ve olasılığı paralel olarak sağlar. Aynı yorum hakkında birkaç soru sorabilir ve tüm sonuçları tek bir istekte alabilirsiniz.

Bu çıktı farkı, daha önce bahsettiğimiz hız ve maliyetle ilgilidir. Günlük devasa verileri işleyen yazılımlar, küçük adımlarda bile önemli maliyetler yaratır. Araçları çağıran ve sürekli görevleri yürüten ajanlar (Agents), sonraki adımı tekrar tekrar belirlemek zorundadır. Yanıt hızı ve çağrı maliyeti, doğrudan yazılım tasarımını, operasyonel giderleri ve kullanıcı deneyimini etkiler. Eskiden yavaşlık veya yüksek maliyet nedeniyle atlanan bazı adımlar artık AI yargısını içerebilir.

Bir de çıktı kararlılığı var. Bir dizi seçenek tanımlıyoruz ve model, bu kapsam içinde sonuç döndürüyor, bu da aşağı akıştaki program işlemlerini kolaylaştırıyor.

Jev'in Üç Yeni Özelliği

Jev'in özü üç yeni özellikte yatıyor. Tasarım mantıkları ilginç ve incelenmeye değer.

Kısaca, Choice (Seçim) verilen seçeneklerden seçim yapar; Score (Puan) kriterlere göre derecelendirme verir; Noul ise bir ifadenin doğru olma olasılığını yargılar.

Burada, bu özellikleri pratik bir örnekle göstermek için resmi Playground'u kullanacağım.

E-ticaret yorum işleme senaryosunu kullanalım. Diyelim ki günlük müşteri incelemeleri alan bir çevrimiçi mağaza işletiyorsunuz. Memnuniyeti ölçmeniz, takibi gereken sorunları belirlemeniz, ele alma yöntemlerini tespit etmeniz ve acil durumları önceliklendirmeniz gerekiyor.

Bu yorumu Jev'e göndereceğiz:

"Ürün iyi ama kargo on gün sürdü ve müşteri hizmetleri yanıt vermedi."

Bu yorumu yargılamak için üç özelliği kullanacağız ve sonuçları göreceğiz.

Choice: Seçimler Yapma

İlk olarak şunu sorun: Genel duygu nedir?

Sağlanan seçenekler: Memnun, Memnun Değil, Karışık, Belirsiz.

Sonuç: "Karışık."

Bu anlaşılması kolay. Kullanıcı ürünü övüyor ama lojistik ve servisten şikayet ediyor. Sadece "Memnun" veya "Memnun Değil" seçmek anlamın bir kısmını kaybeder.

Benzer şekilde şunu da sorabiliriz: Bu yorum bir sonraki adımda nasıl ele alınmalı?

Seçenekler: "İnsana aktar", "Otomatik yanıt ver", "Yanıt gerekmiyor". Kural eklendi: Çözülmemiş servis şikayetleri insan takibi gerektirir.

Sonuç: "İnsana aktar."

Dikkat edin, çoktan seçmeli sorunun içeriği değişebilir. Duygu, departman, sonraki eylem—hepsi bu şekilde çerçevelenebilir. Seçenekleri biz sağlıyoruz; Jev materyale ve gereksinimlere dayanarak yargıda bulunuyor.

金尘马 - inline image

Score: Derecelendirme Verme

Sonra şunu sorun: Bu yorum ne kadar acil? Ne kadar hızlı takip etmeliyiz?

Puanlamadan önce standartları tanımlayın. Burada üç seviye belirlendi:

  • 0: Genel inceleme veya basit sorgulama, çözülmemiş şikayet yok.
  • 1: Çözülmemiş lojistik veya servis şikayeti, ancak güvenlik sorunu, büyük kayıp veya sıkı teslim tarihi yok.
  • 2: Açık güvenlik sorunları, büyük kayıplar veya sıkı teslim tarihleri.

Jev 1 döndürüyor, bu da bu standarda göre orta düzeyde aciliyet olduğunu gösteriyor.

Puanlar, sağladığınız standartlara büyük ölçüde bağlıdır. Yanıt kalitesini veya alakayı değerlendirmeye geçebilirsiniz, ancak neyin iyi veya kötü olduğunu tanımlamanız gerekir.

Ayrıca tam sayılar yerine seviyeler arasında kesirli puanlar da döndürebilir.

金尘马 - inline image

Noul: İfade Doğruluğunu Yargılama

Son olarak, ona bir ifade verin:

"Kullanıcı yorumda açıkça para iadesi talep etti."

Bu tür, ifadenin doğru olma olasılığını temsil eden 0 ile 1 arasında bir olasılık döndürür.

Sonuç: 0.03 (%3).

Kullanıcı mutsuz ama açıkça para iadesi istemedi. Yani model, "açık para iadesi talebi"ne düşük bir olasılık veriyor.

金尘马 - inline image

Tüm dönen sonuçlara birlikte bakmak tabloyu netleştiriyor:

金尘马 - inline image

Bu dört soru birlikte gönderildi ve tüm sonuçlar aynı anda alındı. API, model değerlendirme süresinin yaklaşık 85 milisaniye olduğunu bildirdi.

Şimdi, programın kullanılabilir bilgisi var: Duygu kategorisi, yönlendirme hedefi, öncelik seviyesi, para iadesi niyeti. İşlem bu sonuçlara dayanarak devam edebilir.

Jev Nerede Kullanılabilir?

Bir yorumu işledik. Günlük hacmi devasa olan bir e-ticaret platformunda bu kullanım daha da genişliyor.

Birincisi, istatistikler.

Hangi kullanıcılar memnun? Kim lojistikten şikayet ediyor? Hangi sorunlar müşteri hizmetleri gerektiriyor? Model anlamı yargılıyor; program sayıları topluyor ve kategorileri görüntülüyor.

İkincisi, daha derin işlem gerektiren şeylere karar vermek için ön filtreleme.

Genel incelemeler istatistiğe gider. Yanıt gerektirmeyen öğeler bireysel yanıtları atlar. Çözülmemiş sorunlar insanlara gider. LLM üretimi için uygun otomatik yanıtlar, bağlamla birlikte daha büyük modellere geçirilir.

Daha önce, pahalı genel bir LLM'nin her şeyi önce taraması yüksek başlangıç maliyetleri yaratıyordu. Şimdi, Jev ön ekranlamayı hallediyor, derin işlemeyi LLM'lere bırakıyor.

Anahtar kelime filtrelemesi işe yarar mı?

Kısmen, ama anahtar kelimeler bağlamı kaçırır.

Örnek:

"Kalite gerçekten harika, bir gün sonra dağıldı."

"Harika kalite" eşleşmesi bunu pozitif olarak yanlış sınıflandırır. Tüm cümleyi okuduğunuzda ironi ortaya çıkar.

Jev yine doğal dil girdisini alır ve tam anlamı anlar. Uzmanlaşması görev türü ve çıktı formatındadır, sadece anahtar kelime eşleşmesinde değil.

Sonuçları eyleme dönüştürmek dış programlar gerektirir.

"İnsana aktar" dönerse, program manuel inceleme için sıraya koyar. "Otomatik yanıt ver" dönerse, program yanıt üretmek için LLM'yi çağırır. Eylemler, iş akışı kuralları ve araçlar tarafından yürütülür.

Ajanlarda (Agents), model çağrılarını, araçları ve iş akışlarını organize eden bu dış sisteme genellikle Harness (Koşum/İskelet) denir. Jev, Harness içindeki yargılama pozisyonlarına uyum sağlar ve sonraki adımları seçmeye yardımcı olur.

Bu nedenle, Jev ve LLM'lerin birbirini tamamlayıcı olduğunu, karşılıklı dışlayıcı olmadığını düşünüyorum.

Spesifik olarak, sınıflandırma ve puanlama için LLM'leri Jev ile değiştirin. Daha sonra, metin yazımı, kod veya karmaşık çok adımlı akıl yürütme için LLM'lere güvenin.

Böylece, bir sistem farklı aşamalarda farklı modelleri kullanabilir ve yetenekleri organik olarak birleştirebilir.

金尘马 - inline image

Jev'i Nasıl Deneyimlersiniz?

En doğrudan yol TypeSafe Playground adresini açmaktır.

Giriş yapın, analiz edilecek metni State (yargılama için materyal) kısmına koyun. Soruları Questions kısmında ayarlayın, yargılama türünü seçin, seçenekleri veya puanlama kriterlerini doldurun ve sonuçları görmek için Run'a tıklayın.

Önceki yorumu deneyin veya gözlemlemek için pozitif bir inceleme ile değiştirin.

Yazılımınıza entegre etmek için API'yi kullanın.

API, bir yazılımın diğerine yetenek sunmasına izin verir. Konsoldan bir API Key alın. Programınız bu kimlik bilgisiyle materyalleri ve soruları gönderir, sonuçları alır ve sonraki mantığı yürütür.

Resmi SDK'lar da sağlanmaktadır, geliştirici kolaylığı için yaygın arayüz fonksiyonlarını sarar.

Fiyatlandırma: Milyon giriş tokenı başına $0.042, çıktı ücretsiz. Giriş; materyalleri, soruları ve kriterleri içerir. Yüksek hacimli yorum filtreleme, mevcut akışlarda bu çağrı başına ödeme modelini kullanabilir.

Uzmanlaşmış Yargılama Modellerinin Geleceği

Jev'i araştırdıktan sonra etkilendim: Bunu çoktan birinin yapması gerekiyordu ama kimse yapmadı.

Bu yaklaşımın doğru olduğunu düşünüyorum. Herkes büyük model performansını artırmak için yarışırken, TypeSafe AI yeni bir pist açtı; yapılandırılmış veri, probabilistik yargılama, seçim ve karar senaryoları için özelleştirilmiş modeller yarattı.

Maliyet ve hız avantajları Ajanlar (Agents) için dostane. Bazı bağlamlarda büyük modellerin yavaşça veri döndürmesini beklemek verimsizdir.

Diğer sağlayıcıların da bu trendi takip ederek, Ajan yargılama aşamaları için uzmanlaşmış modeller inşa edeceğini düşünüyorum.

Bir Ajan, hızlı yargılama için modellere, karmaşık düşünme/yazma/kod için diğerlerine, ayrıca görsel/ses/video modellerine sahip olabilir ve hepsi birlikte çalışabilir.

Yargılama yeterince hızlı ve ucuz olduğunda, çağrının değmez görüldüğü daha fazla yere AI'yı yerleştirebiliriz. Benim için Jev'in yönündeki en heyecan verici kısım bu.

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet