Como construímos o Hermes para apoiar toda a nossa equipe

@JacquelineSYC19
INGLÊS16 de set. de 2026
153K
863
74
76
2.0K

TL;DR

A Artie Labs detalha sua implantação do Hermes, um harness de agente de IA open-source, em toda a sua equipe de 17 pessoas. Eles explicam como personalizaram perfis de agentes para funções específicas, gerenciaram custos por meio de um único servidor e implementaram rotinas noturnas de 'sonho' para otimização de memória.

No momento da escrita, a Artie é uma equipe de 17 pessoas. Todos nós trabalhamos lado a lado com o Hermes, um harness de agente de IA open-source da @NousResearch. Ele roda em uma única máquina física na Alemanha, tem uma personalidade diferente para cada equipe e "sonha" à noite.

É assim que as coisas chegaram a esse ponto.

Começou como um contato de WhatsApp de um engenheiro

Há alguns meses, um dos nossos engenheiros (Ani, @anirudhsriramzz) estava rodando o Hermes para uso pessoal. Era apenas uma configuração individual, e ele conversava com ele pelo WhatsApp.

Mais ou menos na mesma época, Robin, nosso CTO, voltou de um hackathon onde um amigo lhe mostrou uma lista completa de agentes executando seu trabalho. A pergunta que ele trouxe foi simples: como tornamos isso acessível a todos na Artie, e não apenas aos engenheiros?

Primeiro, olhamos para o OpenClaw. É bom. Mas era fácil ver um agente se desviar e fazer algo que ninguém pediu, e queríamos guardrails antes de querer escala. Então escolhemos o Hermes e começamos a pensar sobre quais deveriam ser esses guardrails.

Um cérebro com antolhos

A forma como pensamos nisso: todo laboratório lançou um cérebro. Você pode perguntar qualquer coisa a ele e ele responderá. Pergunte a mesma coisa cinco vezes e você obterá cinco respostas, todas plausíveis, todas moldadas de maneira diferente.

Isso é ótimo para uma janela de chat. É um problema quando você quer que o cérebro faça um trabalho. Se um engenheiro de vendas pede uma análise de risco sobre 25 threads abertas de clientes, eles precisam do mesmo formato toda vez para poder agir, comparar semanas e confiar no sistema.

Cavalos de corrida usam antolhos para correr na pista em vez de olhar para a multidão. Skills e ferramentas são os antolhos. O harness é como você os prende. Hermes, Codex, Claude Code e outros são todas versões da mesma ideia: uma maneira de decidir o que o modelo tem permissão para fazer e como sua saída deve parecer.

Uma vez que pensamos nisso dessa forma, o projeto deixou de ser 'configurar um chatbot' e passou a ser 'construir os antolhos para cada trabalho na Artie'.

Um servidor de $60 na Alemanha roda tudo isso

Robin e Ani configuraram o primeiro Hermes em cerca de três horas em um fim de semana. Alugamos o plano mais barato no Railway, iniciamos o Hermes com um perfil padrão e deixamos a equipe de engenharia trabalhar.

Em cinco dias, estávamos atingindo repetidamente os limites de uso do Railway. Cada alerta era um sinal para atualizar o plano. Essa foi a primeira lição real: no momento em que uma equipe realmente adota um agente, a conta deixa de parecer um projeto paralelo.

Nossa infraestrutura de produção roda na AWS e permanece lá. Mas este era um sandbox interno para agentes, não a infraestrutura de clientes, e queríamos ver quão barato podíamos torná-lo. Encontramos a Hetzner (@Hetzner_Online), uma empresa de hospedagem alemã, e compramos uma máquina física por $60 ao ano. Todo Hermes na Artie roda nessa máquina hoje.

Somos uma empresa ágil. A grande questão sobre IA na Artie sempre foi: como tornar a equipe o mais nativa em IA possível sem gastar dinheiro à toa? A máquina da Hetzner foi a primeira resposta.

O que realmente queríamos

Com uma máquina capaz de suportar a carga, sentamos e decidimos para que servia o Hermes. Dois objetivos.

Todos ganham um assistente. Engenheiros, vendas, operações, marketing, design. Uma versão júnior de si mesmo que ajuda você a fazer mais, em vez de algo que te substitui. O medo na indústria é que os agentes tomem o emprego. Nossa experiência é o oposto: quando todos têm um, todos entregam mais rápido e assumem trabalhos que não conseguiam antes.

Um humano está sempre no loop. O Hermes pode fazer tudo o que for instruído a fazer. Antes que qualquer coisa chegue à produção, aos docs ou na frente de um cliente, uma pessoa revisa.

Pessoas têm picos de desempenho, então agentes também devem ter

Ninguém em uma equipe de 17 pessoas é bom em apenas uma coisa. Mas todos têm um pico de habilidade em algum lugar. Contratamos pelo pico.

Então perguntamos por que nossos agentes deveriam ser diferentes. Um engenheiro júnior trabalhando em copy de marketing é um desperdício. Um profissional de marketing júnior no codebase é pior. Modelamos os agentes da forma como pensamos sobre as pessoas: damos a cada um um domínio, uma personalidade e acesso às coisas que aquele domínio precisa.

Isso nos deu uma família de perfis Hermes, um por equipe.

Hermes Plan e Hermes Code pertencem à engenharia. Plan é para o tech lead: descobrir se fazemos A depois B, ou A e B em paralelo e C depois, e escrever isso. Plan distribui o trabalho para um quadro Kanban. Code pega os tickets e executa em segundo plano contra nosso codebase existente, abre PRs e espera. Um humano revisa o PR, e só então ele é mesclado ao master. A conclusão de uma tarefa inicia a próxima no plano.

O efeito colateral que ninguém previu: a maior parte do tempo da engenharia agora é gasto no planejamento. Historicamente, as pessoas viviam no código e na execução. Agora vivem no design do sistema e na revisão, e o Hermes Code cuida do meio.

Hermes Sales se prepara antes de uma call de descoberta. Ele pesquisa o prospect, descobre sua stack existente e puxa o contexto atual do negócio. Como também tem nossos docs e conhecimento de engenharia, pode ir além: se um prospect diz que está movendo dados com uma ferramenta específica, o Hermes pode dizer ao vendedor onde essa ferramenta tende a quebrar, digamos, em drift de schema, antes mesmo da call começar.

Hermes Design e Hermes Code juntos permitem que o marketing projete, construa e lance landing pages sem envolver um engenheiro. Nosso site de marketing usa Next.js e não usamos mais um CMS. Design trabalha dentro do sistema de componentes existente, verifica se um componente já existe antes de inventar um novo e passa para Code para implementação.

Hermes BizOps lida com o trabalho operacional recorrente: revisões de pipeline, reconciliação, atualizações de tracker, encontrando exceções que precisam de um humano.

E há um perfil padrão para tudo o que não se encaixa.

A maioria de nós fala com esses agentes através do Slack. Alguns usam o Hermes desktop. De qualquer forma, tudo mudou de reativo para proativo: os agentes já têm o codebase, os docs, o CRM e a internet, então podem responder de todos os lugares em vez de esperar receber contexto.

Skills, versionadas como código, desde o primeiro dia

Os perfis são personalidades. As skills são o que os torna competentes.

Uma skill é um procedimento reutilizável para uma classe real de trabalho: o que verificar primeiro, quais fontes são autoritativas, como é a saída, como verificá-la. Escrevemos as nossas próprias desde a primeira semana e as colocamos em um repositório Git. Todo Hermes lê de lá. Quando uma skill muda, é um commit, com histórico, que todos os perfis capturam.

Fomos deliberados em não escrever demais. Há um milhão de maneiras de fazer a IA funcionar para você e a maior parte da internet dirá para construir uma fábrica autônoma de agentes 24/7. Se você tivesse tokens infinitos, claro. Não temos. Um agente folheando centenas de skills para decidir qual usar queima tokens na decisão. Então cortamos tudo o que não era obviamente valioso para seu custo, e continuamos cortando.

A regra que estabelecemos: se o valor é óbvio, o custo é justificado. Se o valor é vago, não é construído.

Hermes sonha

O Hermes tem um sistema cron. Você pode dar a ele uma tarefa e uma cadência e ele roda sozinho.

Inspirados pelo trabalho da Anthropic sobre memória de agentes, usamos isso para copiar algo que humanos fazem. Durante o sono REM, seu cérebro organiza o dia. Algumas coisas são promovidas para a memória de longo prazo. Outras são descartadas. Um ano em que você mudou de cidade e viajou constantemente é memorável porque nada se repetiu.

Então, toda noite, quando ninguém está usando, cada Hermes sonha. Ele revisa o que fez naquele dia, decide o que foi útil e o que não foi, promove as partes úteis para a memória e rebaixa o resto. Depois envia um relatório para nosso engenheiro. O relatório diz coisas como: fiz isso errado, fiz aquilo errado, corrigi, armazenei a correção e esqueci o hábito que causou isso.

Ao longo das semanas, cada perfil fica mais opinativo sobre o que deve e não deve fazer para sua equipe. Não programamos essas opiniões. Elas vieram dos sonhos.

Por que rodamos nosso próprio harness

As pessoas perguntam por que não usamos apenas Cursor, Codex ou Claude Code.

Poderíamos, e tecnicamente poderíamos mover as cargas de trabalho amanhã. Mas porque operamos e gerenciamos o Hermes nós mesmos, o modelo subjacente pode ser de qualquer um. Se um laboratório aumentar os preços na próxima semana, mudamos. Nossos perfis estão estáveis o suficiente agora que trocar o modelo não os quebra. Na segunda-feira podemos estar em um modelo da Anthropic; se o preço mudar, podemos estar na OpenAI na sexta-feira.

A segunda razão são os recursos. Se o Cursor não suporta a autenticação que você precisa, ou continua cometendo o mesmo erro no seu codebase, você abre um ticket e espera. Quando o Hermes precisa de algo, nós construímos. O Hermes é parte da Artie, conectado aos nossos sistemas como qualquer ferramenta interna, em vez de algo que anexamos e torcemos para continuar funcionando.

Engenharia de IA é cara agora porque a economia de tokens ainda não se estabilizou. Um dia, rodar essas coisas será quase gratuito. Até lá, possuir o harness é como mantemos o controle da conta.

Onde estamos hoje e o que vem a seguir

O Hermes está talvez 85 a 90 por cento do caminho. Ele faz trabalho real todos os dias. A primeira tentativa nem sempre é a melhor.

Então estamos investindo em evals. Toda vez que o Hermes recebe uma pergunta e produz uma resposta, queremos saber o que levou tempo, quais skills chamou, quais ferramentas falharam e por quê. Estamos auto-hospedando o Arize Phoenix, que é open source, então obtemos isso sem comprar outra ferramenta. Traces do Hermes vão para o Phoenix, e o Phoenix nos diz: esta tarefa chamou cinco skills e duas ferramentas, esta ferramenta levou mais tempo, esta falhou, aqui está o motivo.

Por baixo disso, rodamos telemetria através do Datadog: tokens gastos, taxa de sucesso por tarefa, alertas para o on-call se um Hermes cair ou o armazenamento de memória encher. Cada tarefa roda em um sandbox, e construímos nosso próprio sistema de poda que limpa os sandboxes diariamente.

O ponto de tudo isso é que não precisamos mais adivinhar se uma mudança tornou o Hermes melhor. Mudamos uma skill, recebemos um relatório. Se for melhor, fica. Se for pior, revertimos.

Também escrevemos documentação diretamente no servidor Hermes: o que está na sua configuração, o que você tem permissão para fazer, o que os dados significam. Qualquer Hermes pode ler isso. O que significa que poderíamos iniciar um Hermes cujo único trabalho é ler os dados de avaliação e melhorar os outros perfis.

É basicamente o Hermes Coach. Ele treina o Hermes.

Dezessete pessoas, um servidor alemão, uma família de agentes que vão dormir toda noite e acordam um pouco mais afiados. Construímos isso porque somos pequenos e queríamos entregar como se não fôssemos.

Salvar com um clique

Faça leitura profunda de artigos virais com IA no YouMind

Salve a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis em um único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais