Если вы не жили в пещере всю последнюю неделю, то наверняка видели Джива (Jev) от @typesafeai.
https://x.com/CompleteSkeptic/status/2099925682726002904
Они описывают свои модели так:
класс AI-моделей, созданных для принятия быстрых структурированных решений, которые программное обеспечение может использовать напрямую. Модель System One оценивает
состояние и возвращает типизированные ответы и вероятности.
Согласно бенчмаркам TypeSafe, Jev работает в 20–200 раз быстрее и стоит в 40–400 раз дешевле, чем LLM.
Но почему это вообще важно? Мы уже обучали классификаторы раньше (автокоррекция на телефоне, фильтрация в Gmail и т. д.), но, судя по Twitter, Jev — это нечто особенное.
В этой статье я хочу рассказать вам, что такое Jev, зачем он нужен и как можно внедрить его в ваши производственные системы.
Так что же такое Jev?
Jev предоставляет три примитива: Choice, Score и Noul.
- Choice — это тип вопроса, который выбирает один вариант из заданного набора (максимум 255 вариантов). Ответ включает выбранный вариант, вероятность для каждого варианта и уровень уверенности.
- Score оценивает контент по упорядоченным описательным уровням. Ответ включает оценку, вероятность для каждого уровня и уровень уверенности.
- Noul просит модель оценить вопрос с ответом «да/нет» и вернуть вероятность того, что ответ будет «да».
Вот пример входных и выходных данных для кейса службы поддержки клиентов:
1// Входные данные2{3 "model": "jev-latest",4 "state": "Hi, I was charged twice for my monthly subscription. Could you refund the extra charge? My account is working fine.",5 "questions": {6 "department": {7 "type": "choice",8 "instructions": "Which team should handle this message?",9 "criteria": {10 "billing": "Charges, payments, subscriptions, and refunds",11 "technical": "Bugs, errors, and broken features",12 "account": "Login, passwords, and account access"13 }14 },15 "requests_refund": {16 "type": "noul",17 "instructions": "Is the customer explicitly requesting a refund?"18 },19 "frustration": {20 "type": "score",21 "instructions": "How frustrated does the customer sound?",22 "criteria": [23 "Calm: politely describes the issue without expressing frustration",24 "Frustrated: expresses annoyance or dissatisfaction",25 "Very frustrated: expresses strong anger or threatens to leave"26 ]27 }28 }29}30// Выходные данные31{32 "model": "jev-1.13.0",33 "answers": {34 "department": {35 "type": "choice",36 "choice": "billing",37 "confidence": 1,38 "probabilities": {39 "technical": 0,40 "account": 0,41 "billing": 142 }43 },44 "requests_refund": {45 "type": "noul",46 "noul": 0.9947 },48 "frustration": {49 "type": "score",50 "score": 0,51 "legend": {52 "0": "Calm: politely describes the issue without expressing frustration",53 "1": "Frustrated: expresses annoyance or dissatisfaction",54 "2": "Very frustrated: expresses strong anger or threatens to leave"55 },56 "confidence": 1,57 "probabilities": {58 "0": 1,59 "1": 0,60 "2": 061 }62 }63 },64 "usage": {65 "input_tokens": 442,66 "output_tokens": 7267 },68 "request_id": "playground_12bbfa4198be5ca4de9818a45c0906a2055",69 "evaluation_time_ms": 163.0112069979077270}
Я рекомендую пройти процесс онбординга через их панель управления, чтобы лучше понять, как состояния и вопросы работают вместе для формирования результатов.
Разве это не просто классификатор?
Ну да и нет. Это скорее похоже на ребенка, рожденного от союза LLM и классификатора.
Традиционные классификаторы хороши для задач с большим объемом данных и фиксированной таксономией. Вспомните LeNet-5, способный определять цифру на изображении. Однако классификаторы обычно узкоспециализированы и привязаны к конкретной предметной области. LLM хороши в генерации последовательностей. Они гибки и отлично подходят для открытых задач, определяемых во время выполнения, но они также медленнее (чем классификатор), дороже и менее предсказуемы.
Jev — это «фундаментальная модель для классификации», сочетающая гибкость естественного языка LLM с ограниченными вероятностными выводами классификатора. Вы можете решать широкий спектр задач без необходимости обучать новую модель, сохраняя при этом экспертизу в различных доменах (код, текст, логи, состояния UI, события и т. д.). Jev также может генерировать вывод параллельно, что делает его намного быстрее, чем LLM, ограниченный последовательной генерацией.
Коротко: это очень умный обобщаемый классификатор.
Зачем существует Jev?
Генеральный директор и сооснователь TypeSafe Diogo Almeida работал в OpenAI над созданием RLHF (обучение с подкреплением на основе обратной связи от человека) и продукта ChatGPT. RLHF позволило нам обучать LLM быть действительно хорошими в следовании инструкциям и промптам, что соответствует их авторегрессионной природе.
Затем он ушел из OpenAI, чтобы основать TypeSafe и обучить другой класс моделей для создания ПО на базе AI, а не агентов. Jev обучается с помощью RLCD (обучение с подкреплением на основе калиброванных решений), что научным языком означает обучение модели выдавать надежные оценки уверенности и вероятности, а не просто ответы.
TypeSafe верит, что программное обеспечение должно быть интеллектуальным. Агенты естественно не интегрируются в исторически сложившиеся принципы работы ПО, а участие человека в цикле затрудняет создание интеллектуального И автономного программного обеспечения. Jev — это шаг к интеллекту как к композируемому, надежному примитиву внутри программных систем.
Это не совсем новая идея: исследователи в 2017 году обнаружили, что высокая точность предсказания не означает надежности оценок уверенности (так что LLM здесь не являются идеальным решением).
Почему RLCD вместо RLHF?
Проблема RLHF заключается в том, что то, что хотят люди, не всегда объективно верно. Только потому, что мы предпочитаем определенный ответ в определенном формате, это не делает модели более интеллектуальными, а лишь более удобными в использовании.
Это также приводит к коллапсу мод. RLHF заставляет LLM сходиться к единственному ответу, хотя иногда несколько траекторий могут быть «правильными».

Коллапс мод согласно документации Jev
Jev НЕ предназначен для создания агентов
Вопреки тому, что вы видите в своей ленте новостей, Jev не очень хорош как автономный агент. Мы пытались создать его версии, как только Jev, так и комбинацию LLM + Jev.
https://x.com/kylejeong/status/2100622054945095934
Честно говоря, агенты на базе Jev делают крутые демоверсии. Их было много, использующих Jev для выполнения задач агента молниеносно быстро. Но даже лучшие демоверсии еще не готовы к развертыванию в продакшене.
Такая модель, как Jev, предназначена для ПО на базе AI; она может помочь вам принимать решения, встроенные в детерминированный код. Без возможностей рассуждения или генерации использование его как автономного агента — это чистое невежество.

ПО на базе AI
Вместо того чтобы делать из Jev автономного агента для использования компьютера, его следует применять в маршрутизации обращений в службу поддержки, обработке счетов, мониторинге и триажинге предупреждений безопасности или в качестве монитора агентов.
Цифры
Их первая модель Jev 1.13.0 стоит $42 за миллиард токенов (или $0.042 за миллион токенов) на вход и $0 за выходные токены. Для сравнения, Fable 5.1 стоит $10 за миллион токенов на вход, что составляет $10,000 за миллиард токенов. Типичные корпоративные нагрузки имеют соотношение входных и выходных токенов 3:1 или 4:1, поэтому стоимость Fable возрастает примерно до ~$20,000 за миллиард токенов (при стоимости выхода $50 за миллион токенов).
Контекстное окно составляет 64k токенов на запрос, где состояние + самый длинный вопрос должны помещаться в 32k токенов.
Однако в их внутренних бенчмарках они превосходят все модели от OpenAI, Anthropic и Deepseek (через Fireworks для инференса) по соотношению точности к стоимости и точности к скорости.

точность/стоимость
Хватит болтать, как мне это использовать?
У вас теперь должно быть достаточно понимания Jev, чтобы придумать несколько вариантов использования для того, над чем вы сейчас работаете. (Если нет, вот список вариантов использования, рекомендованных TypeSafe).
Вместо того чтобы ограничивать вашу креативность в том, как вы должны это использовать, я покажу вам, как мы внедрили Jev в наш фреймворк Stagehand.
Последние 2 года Stagehand развивался как фреймворк для AI и агентов для управления удаленным браузером. До того как агенты стали достаточно хороши, мы создали AI-примитивы Act (выполнить действие), Extract (извлечь структурированные данные) и Observe (обнаружить потенциальные действия на странице), чтобы помочь разработчикам писать самоисправляющиеся скрипты для автоматизации веба.
Вместо использования Playwright (или других легаси-фреймворков) и необходимости вручную парсить DOM для предоставления селекторов в действиях, Stagehand A/E/O позволяет использовать естественный язык для построения автоматизаций.
1// Playwright2await page.click('button[type="submit"]');34// Stagehand5stagehand.act("click the submit button")
Это полезно при написании скриптов впервые (скорость разработки значительно выше), но особенно полезно для обслуживания скриптов. Если сайт меняется и селекторы DOM обновляются, то скрипты Playwright нужно переписывать под новую страницу. Stagehand выбирает селекторы и действия во время выполнения, и они являются «самоисправляющимися».
Вы можете представить, куда мы клоним. Jev идеально вписывается в эти примитивы. Изначально мы использовали LLM (с контекстом о том, как выглядит страница, и целью), чтобы решить, что делать. С Jev мы можем использовать Choice для выбора взаимодействующих селекторов.
Давайте возьмем Act, чтобы разобрать поток выполнения. Обычно мы давали бы LLM лаконичное представление страницы, используя гибридное дерево доступности (a11y-tree). С Jev мы сначала помечаем узлы в дереве доступности как интерактивные (включая редакторы богатого текста) или нет.
Когда stagehand.act вызывается:
- Jev классифицирует инструкцию в действие (например, click, fill или scroll)
- Stagehand анализирует аргументы и строит список кандидатов для этого действия (включая контекст близлежащей страницы)
- Jev отвечает «какой кандидат лучший» и «соответствует ли какой-либо кандидат», с порогом приемлемости 0.7
- Если кандидатское действие принимается, Stagehand обрабатывает выполнение
- Если действие не принимается, Stagehand возвращается к использованию LLM

Поток выполнения Act
На ранних этапах тестирования медианная задержка Act снизилась с 1.97 секунды до 0.46 секунды, что примерно в 4.3 раза быстрее (или на 77% меньше времени). Посмотрите полный стек PR.
При использовании компьютера Jev является частью головоломки, но не самостоятельным решением. Теперь мы можем создавать более детерминированные инструменты ПО, которые могут использовать агенты.

Когда использовать Jev
Распространение AI в реальном мире
Создаст ли Jev агентов для использования компьютера промышленного уровня? Нет. Является ли он полезной частью головоломки? Думаю, да.
Кажется, есть множество идей, которые не имели смысла до появления Jev. Я видел, как люди создают мгновенный поиск, умную копипасту и другие простые, но чрезвычайно полезные инструменты.
AI не должен быть ограничен какой-то версией интерфейса чата, синхронного или асинхронного. С моделями вроде Jev мы можем создавать ПО, которое интегрирует модели предсказания без чат-боксов ввода. Хотя классификаторы доступны уже давно, они никогда не казались столь полезными. Возможно, все, что нам нужно было, — это вдохновение.
-> Kyle





