我们如何构建 Hermes 以支持整个团队

@JacquelineSYC19
英语2026年9月16日
153K
863
74
76
2.0K

TL;DR

Artie Labs 详细介绍了他们在 17 人团队中部署开源 AI Agent 框架 Hermes 的过程。他们解释了如何为特定角色定制 Agent 配置文件,通过单台服务器管理成本,并实施夜间“做梦”例程以优化记忆。

在撰写本文时,Artie 是一个由 17 人组成的团队。我们每个人都与 Hermes 并肩工作——这是来自 @NousResearch 的一款开源 AI Agent 框架。它运行在德国的一台物理服务器上,为每个团队配备不同的个性,并在夜间“做梦”。

这就是它演变成今天模样的过程。

起初,它只是某位工程师的 WhatsApp 联系人

几个月前,我们的一位工程师(Ani,@anirudhsriramzz)为自己部署了 Hermes。那只是一个个人配置,他通过 WhatsApp 与它交流。

差不多同一时间,我们的 CTO Robin 参加完一场黑客松回来,一位朋友向他展示了一整套正在执行工作的 Agents。他带回来的问题很简单:如何让 Artie 的每个人都能用上这种能力,而不仅仅是工程师?

我们首先考察了 OpenClaw。它很不错。但很容易看到 Agent 偏离轨道去做没人要求的事情,所以在追求规模化之前,我们先想要护栏机制。于是我们选择了 Hermes,并开始思考这些护栏应该是什么样子的。

戴着“眼罩”的大脑

我们的思路是这样的:每家实验室都发布了一个大脑。你可以问它任何问题,它都会回答。同样的问题问五遍,你会得到五个答案,看似合理,却各不相同。

对于聊天窗口来说,这没问题。但当你要让大脑去干活时,这就成了问题。如果销售工程师需要评估 25 个未关闭的客户线索的风险,他们每次都需要相同的格式,以便采取行动、对比周度数据并信任结果。

赛马戴眼罩是为了专注于赛道而不是看观众。技能和工具就是眼罩。框架则是固定眼罩的方式。Hermes、Codex、Claude Code 以及其他产品都是同一理念的不同版本:一种决定模型允许做什么以及输出应呈现何种形式的方法。

一旦我们以这种方式思考,项目就不再是“搭建一个聊天机器人”,而是“为 Artie 的每项工作打造眼罩”。

一台位于德国的 60 美元服务器支撑着一切

Robin 和 Ani 在一个周末的大约三小时内搭建了第一个 Hermes。我们在 Railway 上租用了最便宜的套餐,启动了一个默认配置的 Hermes,然后让工程团队开始使用。

不到五天,我们就反复触及 Railway 的使用限额。每一次警报都在催促我们升级。这是第一个真正的教训:一旦团队真正采用某个 Agent,账单就不再像是一个副业项目的开销了。

我们的生产基础设施运行在 AWS 上并将继续如此。但这只是用于 Agent 的内部沙箱,而非客户基础设施,我们想看看能把成本压到多低。我们找到了 Hetzner (@Hetzner_Online),一家德国托管公司,并以每年 60 美元的价格购买了一台物理机。如今,Artie 所有的 Hermes 实例都运行在这台机器上。

我们是一家精打细算的公司。关于 Artie 的 AI 战略,核心问题一直是:如何在不烧钱的前提下,让团队尽可能具备 AI 原生能力?Hetzner 服务器就是第一个答案。

我们真正想要的是什么

有了能承担负载的机器后,我们坐下来确定了 Hermes 的目标。主要有两点。

每个人都有一个助手。 无论是工程、销售、运营、市场还是设计。它是一个年轻版的你,帮助你做得更多,而不是取代你的东西。行业内的担忧是 Agent 会抢走工作。我们的经验恰恰相反:当每个人都有助手时,大家交付得更快,并能承接以前无法处理的工作。

人类始终在回路中。 Hermes 可以执行任何被指示的任务。但在任何东西进入生产环境、文档或客户面前之前,必须有人类进行审核。

人有专长,Agent 也应该有

在一个 17 人的团队里,没有人只擅长一件事。但每个人都有自己的高光领域。我们招聘看重的是这种专长。

所以我们不禁要问,为什么我们的 Agent 不能这样?让初级工程师去写营销文案是一种浪费。让初级 marketer 去改代码库更糟糕。我们按照对人的看法来建模 Agent:给每个 Agent 分配一个领域、一种个性,并赋予该领域所需的访问权限。

由此,我们形成了一系列 Hermes 配置文件,每个团队对应一个。

Hermes Plan 和 Hermes Code 属于工程团队。Plan 供技术负责人使用:确定是先做 A 再做 B,还是并行做 A 和 B 稍后做 C,并将其记录下来。Plan 将任务分发到 Kanban 看板。Code 领取工单,在后台针对现有代码库执行,创建 PR 并等待。人类审核 PR,只有通过后才会合并到 master。一项任务的完成会触发计划中的下一项任务。

一个意想不到的副作用是:现在工程团队的大部分时间都花在规划上。过去人们沉浸在代码和执行中。现在他们专注于系统设计和审核,而 Hermes Code 处理中间环节。

Hermes Sales 在发现电话前做准备。它研究潜在客户,弄清楚他们现有的技术栈,并提取当前的交易背景信息。因为它也拥有我们的文档和工程知识,所以能更进一步:如果潜在客户告诉我们他们正在使用特定工具迁移数据,Hermes 可以在通话开始前就告诉销售代表该工具通常在哪些地方容易出问题,比如模式漂移(schema drift)。

Hermes Design 和 Hermes Code 联手让市场团队无需拉入工程师即可设计、构建和发布落地页。我们的营销网站基于 Next.js,不再使用 CMS。Design 在现有组件系统内工作,在发明新组件前先检查是否已有现成组件,然后将实现工作移交给 Code。

Hermes BizOps 处理重复性的运营工作:管道审查、对账、跟踪器更新,以及找出需要人工介入的异常情况。

此外,还有一个默认配置文件用于处理那些不属于上述类别的事务。

我们大多数人通过 Slack 与这些 Agent 交互。有些人使用 Hermes 桌面版。无论哪种方式,整个流程已从被动响应转变为主动出击:Agents 已经掌握了代码库、文档、CRM 和互联网信息,因此它们可以从各处获取答案,而不必等待上下文输入。

从第一天起,技能就像代码一样进行版本控制

配置文件定义了个性。技能则赋予了它们专业能力。

技能是针对一类实际工作的可复用流程:先检查什么,哪些来源具有权威性,输出长什么样,以及如何验证。我们从第一周就开始编写自己的技能,并将它们放入 Git 仓库。每个 Hermes 都从中读取。当技能发生变化时,这是一次带有历史记录的提交,所有配置文件都会同步更新。

我们刻意避免编写过多的技能。让 AI 为你服务的方法有无数种,互联网上的大多数声音都会建议你建立一个全天候自主运行的 Agent 工厂。如果你有无限的 Token,那当然可以。但我们没有。一个 Agent 翻阅数百个技能来决定使用哪一个,会在决策过程中消耗大量 Token。因此,我们砍掉了所有显然不值得其成本的东西,并且持续精简。

我们最终确立的规则是:如果价值显而易见,那么成本就是合理的。如果价值模糊不清,那就不要构建。

Hermes 会做梦

Hermes 拥有一套 Cron 系统。你可以给它分配任务和频率,它会自行运行。

受 Anthropic 关于 Agent 记忆研究的启发,我们利用这一功能模仿了人类的行为。在快速眼动睡眠期间,你的大脑会对白天发生的事情进行分类整理。有些内容会被提升到长期记忆中,有些则被丢弃。那一年如果你频繁搬家和旅行,之所以令人难忘,是因为没有重复发生的事。

因此,每晚当无人使用时,每个 Hermes 都会“做梦”。它回顾当天所做的一切,判断哪些是有用的,哪些不是,将有用的部分存入记忆,淡化其余部分。然后,它会向我们的工程师发送一份报告。报告中写道:我这样做错了,那样做错了,我已经纠正了错误,存储了修正方案,并遗忘了导致错误的习惯。

几周下来,每个配置文件对其团队应该做什么和不应该做什么变得越来越有主见。我们没有编程设定这些观点,它们源自“做梦”的过程。

为什么我们要自己运行框架

人们常问为什么不直接使用 Cursor、Codex 或 Claude Code。

我们可以用,而且技术上明天就能迁移工作负载。但因为是我们自己运行和操作 Hermes,底层的模型可以是任何家的。如果下周某家实验室涨价,我们就切换。目前我们的配置文件足够稳定,更换模型不会破坏它们。周一我们可能还在用 Anthropic 的模型;如果价格变动,周五我们可能就已经切换到 OpenAI 了。

第二个原因是功能定制。如果 Cursor 不支持你需要的身份验证,或者在你的代码库中不断犯同样的错误,你得提工单并等待。当 Hermes 需要什么时,我们自己构建。Hermes 是 Artie 的一部分,像任何内部工具一样深度集成在我们的系统中,而不是我们外挂上去并祈祷它能一直正常工作的东西。

目前的 AI 工程很昂贵,因为 Token 经济学尚未稳定。总有一天,运行这些东西的成本会接近于零。在那之前,掌控框架是我们保持对账单控制权的方式。

现状与未来

Hermes 大概完成了 85% 到 90%。它每天都在做实际工作。第一次尝试并不总是最好的。

因此,我们正在投入资源建立评估体系(Evals)。每当 Hermes 收到问题并生成答案时,我们都想知道耗时在哪里,调用了哪些技能,哪些工具失败了以及原因。我们自托管了 Arize Phoenix,这是一个开源项目,让我们无需购买额外工具即可获得这些数据。Hermes 的追踪数据流入 Phoenix,Phoenix 会告诉我们:这个任务调用了五个技能和两个工具,这个工具耗时最长,那个失败了,原因是……

在此之下,我们通过 Datadog 运行遥测监控:Token 消耗量、每个任务的成功率,以及当 Hermes 宕机或内存存储填满时向值班人员发出的警报。每个任务都在沙箱中运行,我们构建了自定义清理系统,每天清除沙箱。

这一切的意义在于,我们不再需要猜测某项更改是否让 Hermes 变得更好。我们修改一个技能,获得一份报告。如果变好了,就保留。如果变差了,就回滚。

我们还把文档直接写进了 Hermes 服务器本身:你的配置里有什么,你被允许做什么,数据意味着什么。任何 Hermes 都可以阅读它。这意味着我们可以启动一个专门负责阅读评估数据并改进其他配置文件的 Hermes。

这基本上就是 Hermes Coach。它在指导 Hermes。

十七个人,一台德国服务器,一群每晚入睡、醒来时变得更敏锐的 Agents。我们构建它,是因为我们规模小,却希望拥有大公司的交付能力。

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章