Привет, друзья! Меня зовут Цзинь Чэньма.
Начну с вопроса: какие основные типы больших ИИ-моделей мы обычно встречаем, если судить по обрабатываемому ими контенту?
Большинству знакомы текстовые, графические, аудио- и видеомодели. За последние годы различные вендоры активно конкурировали и совершенствовали эти направления, делая возможности моделей мощнее, а конкуренцию — жестче.
После стольких обновлений я не переставал задаваться вопросом: помимо усиления существующих моделей, появятся ли новые форматы?
Недавно модель под названием Jev стала вирусной. Поначалу я подумал: «Это просто еще одна компания выпустила новую большую языковую модель?»
Но, копнув глубже, я понял, что эта модель действительно впечатляет.
За ней стоит TypeSafe AI, которая предложила класс моделей System One Models, специально разработанных для задач принятия решений в программном обеспечении. Jev — их первая публичная модель.
Если предыдущие категории (текст, изображение, аудио, видео) делились по типу контента, то на этот раз подход изменился: принятие решений выделили как отдельную задачу и создали модель вокруг нее.
Я считаю, что это направление может оказать глубокое влияние на будущее развитие и разделение труда в сфере ИИ-моделей.
В этой статье я подробно объясню, что такое Jev, чем он отличается от стандартных LLM, где его можно применить и как начать работу.
Начнем с аналогии с QR-кодом
Как понять суть Jev? Представьте, что вам нужно сгенерировать QR-код.
Обычно вы используете специальный генератор QR-кодов. Но представьте, что вы наняли художника, который умеет рисовать всё что угодно, и попросили его нарисовать QR-код попиксельно.
Конечно, художник талантлив и справится. Но для создания QR-кода есть специализированные инструменты. Вам нужен рабочий код, а не пейзажная картина в придачу.

Точно так же, сравнивая Jev с большими языковыми моделями (LLM):
LLM могут писать статьи, код и обсуждать сложные проблемы. Если попросить LLM прочитать комментарий и определить настроение пользователя, она, безусловно, справится.
Но если задача требует лишь выбора или выставления оценки, задумайтесь: можем ли мы создать более быструю, дешевую и доступную для программирования модель именно для таких задач?
Именно этим занимается Jev.
Он отказывается от свободной генерации текста, чтобы специализироваться на решениях с четко очерченным кругом возможных ответов. Например, если вы предложите четыре варианта — «Доволен», «Недоволен», «Смешанное мнение», «Неопределенно» — он выберет один из них и укажет вероятность каждого варианта.
Так же, как для QR-кодов есть специальные инструменты, задачи, требующие только выбора и оценки, могут решаться специализированными моделями. Согласно официальным данным, оптимизация Jev для этих задач снижает время ответа и стоимость вызовов.
Например, ежедневная фильтрация огромного количества отзывов в электронной коммерции требует оценки настроения, срочности и методов обработки. Более быстрые и дешевые решения сокращают общее время ожидания и затраты. Программа получает результаты и продолжает классификацию или передачу дела человеку.
Происхождение Jev
Кто создал Jev? Зачем строить модель исключительно для принятия решений?
Jev создан компанией TypeSafe AI, основанной Диого Алмейдой, который ранее занимался исследованиями чат-моделей в OpenAI.
Он сосредоточился на проблеме: ИИ отлично общается, но почему его возможности так сложно интегрировать в программное обеспечение для автоматизации задач?
Программное обеспечение превосходно выполняет явные правила. Если выполнено условие А, сделай действие Б. Но многие реальные решения сложно заранее описать правилами.
Как чтение комментариев. Какие выражения являются жалобами? Какие шутками? Какие кажутся позитивными, но содержат скрытую критику? Трудно покрыть все речевые обороты пользователей несколькими правилами.
TypeSafe хочет сделать семантическое решение вызываемым компонентом. Когда программе нужно понять текст или выбрать следующий шаг, она делегирует эту небольшую задачу модели, получает результат и продолжает выполнение.
Они называют эти модели System One, заимствуя концепцию из книги Даниэля Канемана «Думай медленно… решай быстро». Представьте себе часть быстрого, интуитивного суждения.
Имя Jev происходит от имени экономиста Джевонса. Ожидания команды просты: чем ниже стоимость интеллектуальных вызовов, тем больше мест, где люди будут их использовать.
Некоторые шаги раньше казались слишком дорогими для одного вызова ИИ. Если решение принимается быстро и дешево, становится целесообразно пересмотреть архитектуру.
Чем Jev отличается от LLM?
Упрощение и удешевление вызовов ИИ для принятия решений в ПО — хорошая отправная точка. Но существующие LLM тоже могут принимать решения и возвращать структурированные результаты. Зачем создавать Jev?
Сначала посмотрим, как LLM предоставляют результаты решений программам.
LLM поддерживают структурированный вывод, то есть ответы помещаются в предопределенные слоты. Например, один слот для настроения, другой для срочности, третий для метода обработки. Программа знает, что означает каждая позиция.
Вы можете знать JSON — распространенный формат структурированных данных. Разработчики могут ограничивать вывод LLM, требуя соблюдения конкретных форматов.
Поэтому, если смотреть только на то, является ли конечный вывод текстом или JSON, основное различие между Jev и LLM не очевидно.
Различие заключается в том, КАК модель генерирует результат.
Стандартные генеративные LLM обычно создают ответы токен за токеном. Токены — это маленькие фрагменты текста, обрабатываемые моделью. Даже если вы запрашиваете данные фиксированного формата, результат обычно генерируется пошагово.
Jev использует специализированный метод вывода для задач принятия решений, предоставляя несколько суждений и вероятностей параллельно. Вы можете задать несколько вопросов об одном комментарии и получить все результаты одним запросом.
Эта разница в выводе связана со скоростью и стоимостью, упомянутыми выше. Программы, обрабатывающие огромные объемы данных ежедневно, несут значительные расходы даже на небольших шагах. Агенты, которые вызывают инструменты и выполняют непрерывные задачи, должны постоянно решать, какой шаг будет следующим. Скорость ответа и стоимость вызова напрямую влияют на проектирование ПО, операционные расходы и пользовательский опыт. Некоторые шаги, которые раньше пропускали из-за медлительности или высокой стоимости, теперь могут включать оценку ИИ.
Есть также стабильность вывода. Мы определяем набор вариантов, и модель возвращает результаты в этом диапазоне, что облегчает обработку для последующих программ.
Три новые функции Jev
Суть Jev заключается в трех новых функциях. Логика их дизайна интересна и заслуживает изучения.
Кратко: Choice делает выбор из предложенных вариантов; Score присваивает рейтинги на основе критериев; Noul оценивает вероятность истинности утверждения.
Здесь я продемонстрирую эти функции на практическом примере, используя официальный Playground.
Давайте возьмем обработку отзывов в электронной коммерции. Предположим, вы управляете интернет-магазином, получающим ежедневные отзывы клиентов. Вам нужно оценить удовлетворенность, выявить проблемы, требующие последующих действий, определить методы обработки и расставить приоритеты для срочных случаев.
Мы отправим этот комментарий в Jev:
"Товар хороший, но доставка заняла десять дней, а служба поддержки не ответила."
Мы используем три функции для оценки этого комментария и посмотрим на результаты.
Choice: Выбор вариантов
Сначала спросим: Каково общее настроение?
Предложенные варианты: Доволен, Недоволен, Смешанное мнение, Неопределенно.
Результат: "Смешанное мнение".
Это легко понять. Пользователь хвалит товар, но жалуется на логистику и сервис. Выбор только "Доволен" или "Недоволен" потеряет часть смысла.
Аналогично, мы можем спросить: Как следует обработать этот комментарий дальше?
Варианты: "Передать человеку", "Автоответ", "Ответ не требуется". Добавлено правило: Неразрешенные жалобы на обслуживание требуют вмешательства человека.
Результат: "Передать человеку".
Обратите внимание, содержание вопроса с множественным выбором может варьироваться. Настроение, отдел, следующее действие — всё это можно оформить таким образом. Варианты предоставляем мы; Jev принимает решение на основе материала и требований.

Score: Присвоение оценок
Затем спросим: Насколько срочен этот комментарий? Как быстро нужно реагировать?
Перед оценкой определим стандарты. Здесь установлены три уровня:
- 0: Обычный отзыв или простой запрос, без неразрешенных жалоб.
- 1: Неразрешенная жалоба на логистику или сервис, но без проблем безопасности, крупных потерь или жестких сроков.
- 2: Явные проблемы безопасности, крупные потери или жесткие сроки.
Jev возвращает 1, указывая на среднюю срочность согласно этому стандарту.
Оценки сильно зависят от предоставленных вами стандартов. Вы можете переключиться на оценку качества ответа или релевантности, но вы должны определить, что считается хорошим, а что плохим.
Модель также может возвращать дробные оценки между уровнями, а не только целые числа.

Noul: Оценка истинности утверждений
Наконец, дадим ей утверждение:
"Пользователь явно запросил возврат средств в комментарии."
Этот тип возвращает вероятность от 0 до 1, представляющую likelihood (вероятность) того, что утверждение верно.
Результат: 0.03 (3%).
Пользователь недоволен, но явно не просил возврата денег. Поэтому модель дает низкую вероятность "явного запроса возврата".

Рассмотрев все возвращенные результаты вместе, мы получаем четкую картину:

Эти четыре вопроса были отправлены вместе, дав все результаты сразу. API сообщило о времени оценки модели примерно в 85 миллисекунд.
Теперь у программы есть полезная информация: категория настроения, целевой маршрут, уровень приоритета, намерение возврата. Обработка может продолжаться на основе этих результатов.
Для чего можно использовать Jev?
Мы обработали один комментарий. На платформе электронной коммерции с огромным ежедневным объемом такое использование расширяется.
Во-первых, статистика.
Какие пользователи довольны? Кто жалуется на логистику? Какие проблемы требуют службы поддержки? Модель оценивает смысл; программа агрегирует подсчеты и отображает категории.
Во-вторых, первичная фильтрация для определения того, что требует более глубокой обработки.
Обычные отзывы идут в статистику. Пункты, не требующие ответа, пропускают индивидуальные ответы. Неразрешенные проблемы передаются людям. Автоответы, подходящие для генерации LLM, передаются более крупным моделям с контекстом.
Ранее наличие дорогой универсальной LLM для первоначального скрининга всего приводило к высоким начальным затратам. Теперь Jev берет на себя фронтенд-скрининг, оставляя глубокую обработку для LLM.
Может ли работать фильтрация по ключевым словам?
Частично, но ключевые слова упускают контекст.
Пример:
"Качество просто отличное, развалилось через день."
Совпадение со словом "отличное" ошибочно классифицирует это как положительный отзыв. Чтение всего предложения выявляет сарказм.
Jev по-прежнему принимает естественный язык и понимает полный смысл. Его специализация заключается в типе задачи и формате вывода, а не просто в совпадении ключевых слов.
Преобразование результатов в действия требует внешних программ.
Вернуть "передать человеку" — программа ставит в очередь на ручную проверку. Вернуть "автоответ" — программа вызывает LLM для генерации ответа. Действия выполняются правилами рабочего процесса и инструментами.
В агентах эта внешняя система, организующая вызовы моделей, инструменты и рабочие процессы, часто называется Harness (каркас/оболочка). Jev вписывается в позиции принятия решений внутри Harness, помогая выбирать следующие шаги.
Поэтому я считаю, что Jev и LLM дополняют друг друга, а не исключают.
Конкретно: замените LLM на Jev для классификации и оценки. Позже, для написания копирайтинга, кода или сложного многошагового рассуждения, полагайтесь на LLM.
Таким образом, система может использовать разные модели для разных этапов, органично сочетая возможности.

Как попробовать Jev?
Самый прямой способ — открыть TypeSafe Playground.
Войдите, поместите анализируемый текст в State (материал для оценки). Установите вопросы в Questions, выберите тип оценки, заполните варианты или критерии оценки, нажмите Run, чтобы увидеть результаты.
Попробуйте предыдущий комментарий или замените его положительным отзывом, чтобы наблюдать изменения.
Чтобы интегрировать в ваше ПО, используйте API.
API позволяет одному программному обеспечению предоставлять возможности другому. Получите API Key из консоли. Ваша программа отправляет материалы и вопросы с этими учетными данными, получает результаты и выполняет последующую логику.
Также предоставляются официальные SDK, упаковывающие общие функции интерфейса для удобства разработчиков.
Цены: $0.042 за миллион входных токенов, вывод бесплатный. Вход включает материалы, вопросы и критерии. Для высокообъемной фильтрации комментариев можно использовать эту модель оплаты за вызов в существующих потоках.
Будущее специализированных моделей принятия решений
Изучив Jev, я был впечатлен: кто-то должен был сделать это давно, но никто не сделал.
Я думаю, что этот подход правильный. Пока все гонятся за повышением производительности больших моделей, TypeSafe AI открыла новую нишу, создав кастомизированные модели для структурированных данных, вероятностных суждений, выбора и принятия решений.
Выгоды по стоимости и скорости благоприятны для агентов. Ожидание медленного возврата данных от больших моделей неэффективно в некоторых контекстах.
Я верю, что другие вендоры, вероятно, последуют этому тренду, строя специализированные модели для этапов принятия решений агентами.
У агента могут быть модели для быстрых суждений, другие — для сложных размышлений, письма или кода, плюс модели для изображений/аудио/видео, работающие вместе.
Когда суждения становятся достаточно быстрыми и дешевыми, мы можем разместить ИИ во многих местах, которые ранее считались не стоящими вызова. Для меня это самая захватывающая часть направления развития Jev.





