YouMind
Увійти

Модель Jev: новий ШІ для швидких і дешевих рішень

@jinchenma_ai
СПРОЩЕНА КИТАЙСЬКА20 вер. 2026 р.
123K
237
32
17
355

Коротко

Jev — це нова модель ШІ від TypeSafe AI, розроблена спеціально для завдань оцінювання, таких як класифікація та балування, що пропонує швидші та дешевші альтернативи LLM для робочих процесів агентів.

Привіт, друзі! Я Цзінь Ченьма.

Почну з запитання: які типи великих AI-моделей ми зазвичай зустрічаємо, якщо говорити про контент, який вони обробляють?

Більшість людей знайомі з текстом, зображеннями, аудіо та відео. За останні кілька років різні розробники постійно конкурували та вдосконалювали ці напрямки, роблячи можливості потужнішими, а конкуренцію — жорсткішою.

Побачивши стільки оновлень, я не переставав думати: чи окрім посилення існуючих моделей, з’являться нові формати моделей?

Нещодавно модель під назвою Jev стала вірусною. Спочатку я подумав: «Це ще одна компанія випустила нову велику мовну модель?»

Але після глибшого занурення я виявив, що ця модель справді вражає.

За нею стоїть TypeSafe AI, яка запропонувала клас моделей під назвою System One Models, спеціально розроблених для завдань прийняття рішень у програмному забезпеченні. Jev — їхня перша публічна модель.

Попередні категорії (текст, зображення, аудіо, відео) були розділені за типом контенту; цього разу вони змінили кут зору: виділили «прийняття рішень» як окреме завдання та побудували навколо нього модель.

Я вважаю, що цей напрямок може мати глибокий вплив на майбутній розвиток і розподіл ролей у сфері AI-моделей.

У цій статті я поясню, що таке Jev, чим він відрізняється від стандартних LLM, де його можна використовувати та як почати роботу.

Почнемо з аналогії QR-коду

Як зрозуміти Jev? Уявіть, що вам потрібно згенерувати QR-код.

Зазвичай ви скористалися б інструментом для генерації QR-кодів. Але припустимо, ви найняли художника, який вміє малювати будь-що, і попросили його намалювати QR-код піксель за пікселем.

Звісно, цей художник досвідчений і впорається. Але для генерації QR-кодів є спеціалізовані інструменти. Вам потрібен просто функціональний QR-код, а не пейзажний живопис разом із ним.

金尘马 - inline image

Так само, порівнюючи Jev з Великими Мовними Моделлями (LLM):

LLM можуть писати статті, код і обговорювати складні проблеми. Якщо попросити LLM прочитати коментар і визначити настрої користувача, вона точно зможе це зробити.

Але якщо завдання вимагає лише вибору або оцінки, подумайте: чи можемо ми створити швидшу, дешевшу та програмно доступну модель саме для таких завдань?

Саме це й робить Jev.

Він відмовляється від вільної генерації тексту, щоб спеціалізуватися на рішеннях із чітко визначеними варіантами відповіді. Наприклад, якщо ви надасте чотири варіанти — «Задоволений», «Незадоволений», «Змішаний», «Невизначено» — він обере один і надасть ймовірності для кожного варіанту.

Так само, як для QR-кодів є спеціальні інструменти, завдання, що вимагають лише вибору та оцінок, можуть виконуватися спеціалізованими моделями. Згідно з офіційними даними, оптимізація Jev для цих завдань прийняття рішень зменшує час відповіді та вартість викликів.

Наприклад, щоденна фільтрація масиву коментарів електронної комерції вимагає оцінки настроїв, терміновості та способів обробки. Швидші та дешевші рішення зменшують загальний час очікування та витрати. Програми отримують результати та продовжують класифікацію або передачу людині.

Походження Jev

Хто створив Jev? Навіщо будувати модель виключно для прийняття рішень?

Jev походить від TypeSafe AI, заснованої Діого Алмейдою, який раніше працював над дослідженнями чат-моделей в OpenAI.

Він зосередився на проблемі: AI чудово спілкується, але чому ці можливості так важко інтегрувати в програмне забезпечення для автоматизованих завдань?

Програмне забезпечення добре виконує явні правила. Якщо умова А виконана, зроби дію Б. Але багато реальних рішень важко попередньо визначити правилами.

Як читання коментарів. Які висловлювання є скаргами? Які жартами? Які здаються позитивними, але містять приховану критику? Важко охопити всі стилі мовлення користувачів кількома правилами.

TypeSafe хоче перетворити семантичне судження на викликаємий компонент. Коли програмі потрібно зрозуміти текст або обрати наступний крок, вона делегує це маленьке завдання моделі, отримує результат і продовжує виконання.

Вони називають ці моделі System One, запозичивши концепцію з книги Thinking, Fast and Slow («Думай повільно... Вирішуй швидко»). Уявіть це як частину швидкого, інтуїтивного судження.

Назва Jev походить від імені економіста Джевонса. Очікування команди прості: чим нижча вартість інтелектуальних викликів, тим більше місць люди будуть їх використовувати.

Деякі кроки раніше здавалися занадто дорогими для одного виклику AI. Якщо судження буде достатньо швидким і дешевим, варто переглянути підходи.

Чим Jev відрізняється від LLM?

Зробити виклики AI для прийняття рішень у програмному забезпеченні дешевшими та простішими — гарна стартова точка. Але існуючі LLM також можуть судити та повертати структуровані результати. Навіщо створювати Jev?

Спершу давайте подивимось, як LLM надають результати суджень програмам.

LLM підтримують структурований вивід, тобто відповіді вписуються в попередньо визначені слоти. Наприклад, один слот для настроїв, інший для терміновості, третій для способу обробки. Програма знає, що означає кожна позиція.

Ви можете знати JSON, поширений формат структурованих даних. Розробники можуть обмежити вивід LLM дотриманням конкретних форматів.

Отже, якщо дивитися лише на те, чи є кінцевий вивід текстом чи JSON, це не розкриває головної відмінності між Jev та LLM.

Різниця полягає в тому, як модель генерує результат.

Стандартні генеративні LLM зазвичай виробляють відповіді токен за токеном. Токени — це маленькі фрагменти тексту, які обробляє модель. Навіть якщо ви запитуєте дані фіксованого формату, вона зазвичай генерує результат покроково.

Jev використовує спеціалізований метод виводу для завдань судження, надаючи кілька суджень та ймовірностей паралельно. Ви можете поставити кілька запитань щодо одного коментаря та отримати всі результати в одному запиті.

Ця різниця у виводі пов’язана зі швидкістю та вартістю, згаданими раніше. Програмне забезпечення, що обробляє величезні масиви даних щодня, несе значні витрати навіть на малих кроках. Агенти, які викликають інструменти та виконують послідовні завдання, повинні repeatedly вирішувати наступний крок. Швидкість відповіді та вартість виклику безпосередньо впливають на архітектуру ПЗ, операційні витрати та досвід користувача. Деякі кроки, які раніше пропускали через повільність або високу вартість, тепер можуть включати AI-судження.

Також існує стабільність виводу. Ми визначаємо набір варіантів, і модель повертає результати в межах цього діапазону, що спрощує обробку для наступних програм.

Три нові особливості Jev

Ядро Jev полягає в трьох нових функціях. Логіка їхнього дизайну цікава та заслуговує на увагу.

Коротко: Choice робить вибір із заданих варіантів; Score присвоює рейтинги на основі критеріїв; Noul оцінює ймовірність того, що твердження є правдивим.

Тут я використаю офіційний Playground, щоб продемонструвати ці функції на практичному прикладі.

Давайте використаємо обробку коментарів електронної комерції. Припустимо, ви керуєте онлайн-магазином, який щодня отримує відгуки клієнтів. Вам потрібно оцінити задоволеність, ідентифікувати проблеми, що потребують подальших дій, визначити способи обробки та пріоритетизувати термінові випадки.

Ми надішлемо цей коментар до Jev:

"Товар хороший, але доставка зайняла десять днів, а служба підтримки не відповіла."

Ми використаємо три функції, щоб оцінити цей коментар, і подивимось на результати.

Choice: Робимо вибір

Спершу запитайте: Який загальний настрій?

Надані варіанти: Задоволений, Незадоволений, Змішаний, Невизначено.

Результат: "Змішаний".

Це легко зрозуміти. Користувач хвалить товар, але скаржиться на логістику та сервіс. Вибір лише "Задоволений" або "Незадоволений" втрачає частину сенсу.

Подібним чином ми можемо запитати: Як слід обробити цей коментар далі?

Варіанти: "Передати людині", "Авто-відповідь", "Відповідь не потрібна". Додано правило: Нерозв’язані скарги на сервіс потребують людської участі.

Результат: "Передати людині".

Зверніть увагу, зміст тестового питання може варіюватися. Настрій, відділ, наступна дія — все це можна оформити таким чином. Варіанти надаємо ми; Jev судить на основі матеріалу та вимог.

金尘马 - inline image

Score: Присвоєння рейтингів

Далі запитайте: Наскільки терміновий цей коментар? Як швидко ми повинні відреагувати?

Перед оцінкою визначте стандарти. Тут встановлено три рівні:

  • 0: Загальний відгук або простий запит, без невирішених скарг.
  • 1: Невирішена скарга на логістику або сервіс, але без проблем безпеки, великих втрат чи жорстких дедлайнів.
  • 2: Явні проблеми безпеки, великі втрати або жорсткі дедлайни.

Jev повертає 1, вказуючи на середню терміновість згідно з цим стандартом.

Оцінки сильно залежать від наданих вами стандартів. Ви можете перейти до оцінки якості відповіді або релевантності, але ви повинні визначити, що є хорошим, а що поганим.

Він також може повертати дробові оцінки між рівнями, а не тільки цілі числа.

金尘马 - inline image

Noul: Судження правдивості тверджень

Нарешті, дайте йому твердження:

"Користувач явно попросив повернення коштів у коментарі."

Цей тип повертає ймовірність від 0 до 1, що представляє ймовірність того, що твердження є правдивим.

Результат: 0.03 (3%).

Користувач незадоволений, але явно не просив повернення коштів. Тому модель дає низьку ймовірність "явного запиту на повернення".

金尘马 - inline image

Розгляд усіх повернутих результатів разом прояснює картину:

金尘马 - inline image

Ці чотири запитання були надіслані разом, давши всі результати одразу. API повідомив про час оцінки моделі приблизно 85 мілісекунд.

Тепер програма має корисну інформацію: категорію настрою, ціль маршрутизації, рівень пріоритету, намір повернення. Обробку можна продовжити на основі цих результатів.

Для чого можна використовувати Jev?

Ми обробили один коментар. На платформі електронної комерції з величезним добовим обсягом це використання розширюється.

По-перше, статистика.

Які користувачі задоволені? Хто скаржиться на логістику? Які проблеми потребують служби підтримки? Модель судить про зміст; програма агрегує підрахунки та відображає категорії.

По-друге, первинна фільтрація, щоб визначити, що потребує глибшої обробки.

Загальні відгуки йдуть у статистику. Елементи, що не потребують відповіді, пропускають індивідуальні репліки. Невирішені проблеми передаються людям. Авто-відповіді, придатні для генерації LLM, передаються більшим моделям із контекстом.

Раніше наявність дорогої загальної LLM для скринінгу всього несла високі початкові витрати. Тепер Jev бере на себе фронт-енд скринінг, залишаючи глибоку обробку для LLM.

Чи може працювати фільтрація за ключовими словами?

Частково, але ключові слова пропускають контекст.

Приклад:

"Якість просто супер, розвалилася через день."

Збіг "якість супер" помилково класифікує це як позитив. Читання всього речення виявляє сарказм.

Jev все одно приймає природну мову на вході та розуміє повний зміст. Його спеціалізація — у типі завдання та форматі виводу, а не просто у зіставленні ключових слів.

Щоб перетворити результати на дії, потрібні зовнішні програми.

Повернення "передати людині" ставить програму в чергу для ручного перегляду. Повернення "авто-відповідь" змушує програму викликати LLM для генерації відповіді. Дії виконуються правилами робочого процесу та інструментами.

В Агентах ця зовнішня система, що організовує виклики моделей, інструменти та робочі процеси, часто називається Harness (Каркас/Оболонка). Jev вписується в позиції прийняття рішень всередині Harness, допомагаючи обрати наступні кроки.

Тому я вважаю, що Jev та LLM взаємодоповнювальні, а не взаємовиключні.

Конкретніше: замінюйте LLM на Jev для класифікації та оцінювання. Пізніше, для написання копірайтингу, коду або складного багатокрокового міркування, покладайтеся на LLM.

Таким чином, система може використовувати різні моделі для різних етапів, органічно поєднуючи можливості.

金尘马 - inline image

Як спробувати Jev?

Найпряміший спосіб — відкрити TypeSafe Playground.

Увійдіть, розмістіть текст для аналізу в State (матеріал для судження). Налаштуйте запитання в Questions, оберіть тип судження, заповніть варіанти або критерії оцінювання, натисніть Run, щоб побачити результати.

Спробуйте попередній коментар або замініть його позитивним відгуком, щоб спостерігати зміни.

Щоб інтегрувати в ваше ПЗ, використовуйте API.

API дозволяє одному програмному забезпеченню надавати можливості іншому. Отримайте API Key з консолі. Ваша програма надсилає матеріали та запитання з цим обліковими даними, отримує результати та виконує подальшу логіку.

Також надаються офіційні SDK, які обгортають загальні функції інтерфейсу для зручності розробників.

Ціноутворення: $0.042 за мільйон вхідних токенів, вихідні дані безкоштовні. Вхідні дані включають матеріали, запитання та критерії. Для фільтрації великої кількості коментарів можна використовувати цю модель оплати за виклик у існуючих потоках.

Майбутнє спеціалізованих моделей судження

Після дослідження Jev я був вражений: хтось мав зробити це давно, але ніхто не зробив.

Я думаю, що цей підхід правильний. Поки всі змагаються за підвищення продуктивності великих моделей, TypeSafe AI відкрила нову нішу, створюючи кастомізовані моделі для сценаріїв структурованих даних, ймовірнісного судження, вибору та прийняття рішень.

Переваги у вартості та швидкості дружні до Агентів. Очікування повільної відповіді від великих моделей неефективне в деяких контекстах.

Я вважаю, що інші постачальники, ймовірно, підуть за цією тенденцією, будуючи спеціалізовані моделі для етапів прийняття рішень в Агентах.

Агент може мати моделі для швидкого судження, інші для складного мислення/письма/коду, плюс моделі для зображень/аудіо/відео, працюючи разом.

Коли судження достатньо швидке та дешеве, ми можемо розмістити AI у більшій кількості місць, які раніше вважалися недоцільними для виклику. Для мене це найцікавіша частина напрямку Jev.

Збереження в один клік

Використовуйте YouMind для AI-глибокого читання віральних статей

Зберігайте джерела, ставте цілеспрямовані запитання, підсумовуйте аргументи та перетворюйте віральні статті на корисні нотатки в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей