Как мы создали Hermes для поддержки всей команды

@JacquelineSYC19
АНГЛИЙСКИЙ16 сент. 2026 г.
153K
863
74
76
2.0K

Суть

Artie Labs рассказывает о внедрении Hermes — открытой платформы для ИИ-агентов — в команде из 17 человек. Они объясняют, как настроили профили агентов под конкретные роли, управляли расходами через единый сервер и реализовали ночные процедуры «сновидений» для оптимизации памяти.

На момент написания этой статьи в команде Artie 17 человек. Каждый из нас работает бок о бок с Hermes — открытым фреймворком для ИИ-агентов от @NousResearch. Он запущен на одном физическом сервере в Германии, имеет разный характер для каждой команды и «видит сны» по ночам.

Вот как всё сложилось.

Началось всё с контакта в WhatsApp одного инженера

Несколько месяцев назад один из наших инженеров (Ани, @anirudhsriramzz) использовал Hermes для личных задач. Это была просто персональная настройка, и он общался с ним через WhatsApp.

Примерно в то же время Робин, наш технический директор, вернулся с хакатона, где друг показал ему целый набор агентов, выполняющих рабочие задачи. Вопрос, который он задал себе, был прост: как сделать это доступным для всех в Artie, а не только для инженеров?

Сначала мы посмотрели на OpenClaw. Он хорош. Но было легко заметить, как агент начинает делать что-то, чего никто не просил, а нам нужны были механизмы безопасности до масштабирования. Поэтому мы выбрали Hermes и начали думать о том, какими должны быть эти ограничения.

Мозг с шорами

Мы рассуждаем так: каждая лаборатория выпустила свой «мозг». Можно спросить его о чем угодно, и он ответит. Задай тот же вопрос пять раз, и ты получишь пять ответов, все правдоподобные, но разные по форме.

Для чата это нормально. Но это проблема, когда нужно, чтобы мозг выполнял конкретную работу. Если инженер по продажам запрашивает оценку рисков по 25 открытым сделкам, ему нужен одинаковый формат каждый раз, чтобы можно было действовать, сравнивать данные по неделям и доверять системе.

Скачки носят шоры, чтобы они бежали по треку, а не отвлекались на толпу. Навыки и инструменты — это те самые шоры. Фреймворк (harness) — это то, как вы их надеваете. Hermes, Codex, Claude Code и другие — все они представляют собой вариации одной идеи: способ определить, что модели разрешено делать и как должен выглядеть её вывод.

Как только мы стали думать об этом так, проект перестал быть «настройкой чат-бота» и превратился в «создание шор для каждой задачи в Artie».

Сервер за $60 в Германии управляет всем этим

Робин и Ани настроили первый экземпляр Hermes примерно за три часа одних выходных. Мы арендовали самый дешевый тариф на Railway, запустили Hermes с одним профилем по умолчанию и дали его в руки инженерной команде.

В течение пяти дней мы постоянно упарывались в лимиты использования Railway. Каждое предупреждение было сигналом к апгрейду. Это стал первым реальным уроком: как только команда действительно начинает использовать агента, счет перестает выглядеть как побочный проект.

Наша производственная инфраструктура работает на AWS и останется там. Но это была внутренняя песочница для агентов, а не клиентская инфраструктура, и мы хотели посмотреть, насколько дешево мы сможем это сделать. Мы нашли Hetzner (@Hetzner_Online), немецкую хостинговую компанию, и купили физический сервер за $60 в год. Сегодня все экземпляры Hermes в Artie работают на этой машине.

Мы небольшая, но проворная компания. Главный вопрос внедрения ИИ в Artie звучал так: как сделать команду максимально AI-native, не сжигая деньги? Сервер Hetzner стал первым ответом.

Чего мы на самом деле хотели

Имея машину, способную выдержать нагрузку, мы сели и определились с назначением Hermes. Две цели.

У каждого есть помощник. Инженеры, продажи, операционное управление, маркетинг, дизайн. Младшая версия тебя самого, которая помогает делать больше, а не заменяет тебя. Страх в индустрии заключается в том, что агенты заберут работу. Наш опыт противоположен: когда у каждого есть такой помощник, все начинают выпускать продукты быстрее и берутся за задачи, которые раньше были им не по зубам.

Человек всегда находится в контуре управления. Hermes может делать всё, что ему поручено. Прежде чем что-либо попадет в продакшн, в документацию или перед глазами клиента, это проверяет человек.

Люди специализируются, поэтому и агенты должны

Никто в команде из 17 человек не хорош только в одном. Но у каждого есть своя сильная сторона («спайк»). Мы нанимаем людей ради этих сильных сторон.

Поэтому мы задались вопросом: почему наши агенты должны быть другими? Младший инженер, пишущий маркетинговые тексты, — это пустая трата ресурсов. Младший маркетолог, лезущий в кодовую базу, — еще хуже. Мы смоделировали агентов так же, как думаем о людях: каждому дали свою область ответственности, личность и доступ к инструментам, необходимым в этой области.

Это дало нам семейство профилей Hermes, по одному на каждую команду.

Hermes Plan и Hermes Code принадлежат инженерии. Plan предназначен для техлида: решить, будем ли мы делать A, затем B, или A и B параллельно, а C позже, и записать это. Plan распределяет работу на доске Kanban. Code подхватывает задачи и выполняет их в фоне в нашей существующей кодовой базе, открывает PR и ждет. Человек проверяет PR, и только после этого он мержится в master. Завершение одной задачи запускает следующую в плане.

Непредвиденный побочный эффект: теперь большая часть времени инженеров уходит на планирование. Исторически люди жили в коде и исполнении. Теперь они живут в системном дизайне и ревью, а Hermes Code берет на себя середину.

Hermes Sales готовится перед звонком для выявления потребностей (discovery call). Он изучает потенциального клиента, определяет его текущий технологический стек и собирает актуальный контекст по сделке. Поскольку у него также есть доступ к нашей документации и инженерным знаниям, он может пойти дальше: если клиент говорит, что переносит данные с помощью определенного инструмента, Hermes может сказать менеджеру по продажам, где этот инструмент обычно дает сбои, например, при дрейфе схемы данных, еще до начала звонка.

Hermes Design и Hermes Code вместе позволяют отделу маркетинга проектировать, создавать и публиковать лендинги без привлечения инженера. Наш маркетинговый сайт построен на Next.js, и мы больше не используем CMS. Дизайн работает внутри существующей системы компонентов, проверяет, существует ли компонент, прежде чем изобретать новый, и передает задачу на реализацию в Code.

Hermes BizOps занимается регулярной операционной работой: обзором воронки продаж, сверкой данных, обновлением трекеров, поиском исключений, требующих человеческого вмешательства.

И есть профиль по умолчанию для всего остального, что не вписывается в рамки.

Большинство из нас общается с ними через Slack. Некоторые используют десктопную версию Hermes. В любом случае, весь процесс сместился от реактивного к проактивному: агенты уже имеют доступ к кодовой базе, документации, CRM и интернету, поэтому они могут отвечать на основе всей информации, вместо того чтобы ждать, пока им скормят контекст.

Навыки, версионируемые как код, с первого дня

Профили — это личности. Навыки делают их компетентными.

Навык — это переиспользуемая процедура для реального класса задач: что проверять первым, какие источники являются авторитетными, как выглядит результат и как его верифицировать. Мы написали свои навыки с первой недели и поместили их в Git-репозиторий. Каждый Hermes читает оттуда. Когда навык меняется, это коммит с историей, который подхватывают все профили.

Мы сознательно старались не писать слишком много навыков. Есть миллион способов заставить ИИ работать на вас, и большинство источников в интернете скажут вам построить автономную фабрику агентов, работающую 24/7. Если бы у вас были бесконечные токены, конечно. Но у нас нет. Агент, перебирающий сотни навыков, чтобы выбрать нужный, тратит токены на сам выбор. Поэтому мы вырезали всё, что явно не стоило своих затрат, и продолжаем сокращать.

Правило, к которому мы пришли: если ценность очевидна, затраты оправданы. Если ценность размыта, функция не создается.

Hermes видит сны

У Hermes есть система cron. Вы можете дать ему задачу и периодичность, и он будет выполнять ее самостоятельно.

Вдохновившись работами Anthropic над памятью агентов, мы использовали эту систему, чтобы скопировать то, что делают люди. Во время фазы быстрого сна ваш мозг сортирует события дня. Некоторые вещи переходят в долгосрочную память. Другие забываются. Год, когда вы переезжали и постоянно путешествовали, запоминается, потому что ничего не повторялось.

Так что каждую ночь, когда никто не использует систему, каждый Hermes «видит сны». Он анализирует, что сделал за день, решает, что было полезно, а что нет, переводит полезные части в память и удаляет остальное. Затем он отправляет нашему инженеру отчет. В отчете говорится что-то вроде: «Я сделал это неправильно, я ошибся там, я исправил это, сохранил исправление и забыл привычку, которая вызвала ошибку».

За несколько недель каждый профиль становится более категоричным в отношении того, что он должен и не должен делать для своей команды. Мы не программировали эти мнения. Они появились благодаря «сновидениям».

Почему мы используем собственный фреймворк

Люди спрашивают, почему мы просто не используем Cursor, Codex или Claude Code.

Мы могли бы, и технически мы могли бы перенести нагрузки завтра же. Но поскольку мы сами управляем и поддерживаем Hermes, модель под капотом может быть любой. Если одна лаборатория повысит цены на следующей неделе, мы переключимся. Наши профили сейчас достаточно стабильны, чтобы замена модели не ломала их. В понедельник мы можем работать на модели Anthropic; если цены изменятся, к пятнице мы можем перейти на OpenAI.

Вторая причина — функциональность. Если Cursor не поддерживает нужную вам аутентификацию или постоянно делает одну и ту же ошибку в вашей кодовой базе, вы создаете тикет и ждете. Когда Hermes нуждается в чем-то, мы это строим. Hermes является частью Artie, интегрирован в наши системы так же, как любой внутренний инструмент, а не что-то, что мы прилепили сверху и надеемся, что оно продолжит работать.

Инженерия ИИ сейчас дорога, потому что экономика токенов еще не стабилизировалась. Однажды запуск таких вещей станет почти бесплатным. До тех пор владение собственным фреймворком — это способ держать расходы под контролем.

Где мы находимся сегодня и что дальше

Hermes достиг примерно 85–90% готовности. Он выполняет реальную работу каждый день. Первый вариант не всегда лучший.

Поэтому мы инвестируем в оценки (evals). Каждый раз, когда Hermes получает вопрос и формирует ответ, мы хотим знать, что заняло время, какие навыки были вызваны, какие инструменты дали сбой и почему. Мы самостоятельно размещаем Arize Phoenix, открытый исходный код, чтобы получить это, не покупая другой инструмент. Трассировки из Hermes попадают в Phoenix, и Phoenix говорит нам: эта задача вызвала пять навыков и два инструмента, этот инструмент работал дольше всего, этот дал сбой, вот почему.

Под этим уровнем мы передаем телеметрию в Datadog: потраченные токены, процент успеха по задачам, оповещения дежурным, если Hermes упадет или хранилище памяти заполнится. Каждая задача выполняется в песочнице, и мы создали собственную систему очистки, которая ежедневно очищает песочницы.

Суть всего этого в том, что нам больше не нужно гадать, улучшился ли Hermes после изменений. Мы меняем навык, получаем отчет. Если стало лучше, оставляем. Если хуже — откатываем.

Мы также включили документацию непосредственно в сервер Hermes: что находится в вашей конфигурации, что вам разрешено делать, что означают данные. Любой Hermes может прочитать это. Это означает, что мы могли бы запустить Hermes, единственной задачей которого было бы чтение данных оценок и улучшение других профилей.

Это по сути Hermes Coach. Он тренирует Hermes.

Семнадцать человек, один немецкий сервер, семейство агентов, которые засыпают каждую ночь и просыпаются чуть умнее. Мы построили это, потому что мы маленькая команда, которая хотела выпускать продукты так, будто мы большие.

Сохранение в один клик

Используйте YouMind для глубокого чтения вирусных статей с помощью ИИ

Сохраняйте источники, задавайте точные вопросы, обобщайте аргументы и превращайте вирусные статьи в полезные заметки в одном рабочем пространстве ИИ.

Исследовать YouMind
Для авторов

Превратите ваш Markdown в аккуратную статью для 𝕏

Когда вы публикуете длинные тексты, изображения, таблицы и блоки кода, форматирование в 𝕏 становится мучением. YouMind превращает полный черновик в Markdown в чистую статью, готовую к публикации в 𝕏.

Попробовать Markdown для 𝕏

Другие паттерны для анализа

Недавние виральные статьи

Смотреть другие виральные статьи