目前大多数 AI 智能体框架主要是作为大型语言模型之上的应用程序运行。它们能够进行推理、调用工具并在会话中维护上下文,但通常缺乏健壮的、原生的机制来实现长期的结构化持久化、工作负载隔离、自主扩展自身能力,以及在多个组件之间进行长时间可靠的协调。
由 Nous Research 开发的 Hermes Agent,实现了多项架构特性,使其与许多其他智能体框架区分开来。这些特性包括:跨会话的持久记忆支持、通过配置文件运行多个隔离执行上下文的能力、基于看板的结构化任务编排系统、允许智能体根据自身活动创建并存储可复用流程的机制,以及将智能体连接到 27 多个通信平台的消息网关。
本文从 个人 AI 操作系统 的视角来审视 Hermes。目标是基于公开文档和可观察到的行为,对其核心架构层、这些层在实际中如何交互,以及截至 2026 年 6 月该系统现实能提供什么,给出详细且诚实的分析。
1. Hermes 的核心层
为了更好地理解 Hermes 的结构,我们可以将其组件映射到传统操作系统的概念。

1.1 记忆架构
Hermes 维护了多个不同的记忆层,而不是试图将所有相关信息都塞进一个上下文窗口中。主要类型包括:
- 会话记忆:在特定任务或对话期间活跃的上下文。这种记忆通常是短暂的,与当前会话绑定。
- 长期记忆:对事实、见解、用户偏好和积累的知识的持久存储,能跨会话和系统重启存活。通过可配置的限制来防止无限制增长:
1memory:2 memory_enabled: true3 user_profile_enabled: true4 memory_char_limit: 2200 # ~800 个 token5 user_char_limit: 1375 # ~500 个 token
- 技能记忆:存储结构化的、可复用的流程(技能),这些流程是智能体基于过去成功的工作创建或优化的。以纯 Markdown 文件形式存储在 ~/.hermes/skills/ 目录下。
- 会话回顾:基于 FTS5 全文搜索并结合 LLM 摘要,覆盖整个对话历史。可以查询任意过往会话:
提醒我上个月讨论过的所有商业创意。 我们 3 周前做的竞品分析是什么?
多层记忆方法是让 Hermes 更像一个持久系统而非典型对话智能体的基础要素之一。
外部记忆提供商:
对于需要超越内置记忆的更深入智能的用例,Hermes 支持 8 个外部记忆提供商的插件:
- Mem0 — 知识图谱 + 语义检索。每次仅加载相关条目。相比朴素的全部注入,token 消耗减少 72%。
- Honcho — 双人辩证记忆。分别构建 USER 和 AI 的观察记录。可在处理 PII 敏感环境时自托管。
- Hindsight、Holographic、RetainDB、ByteRover、Supermemory、OpenViking — 其他具有不同架构的提供商。
1hermes memory setup2# 交互式选择器,选择提供商3hermes memory status4# 验证当前激活的提供商
1.2 配置文件作为隔离执行环境
Hermes 中的配置文件允许用户在同一个机器上创建并运行多个独立的智能体实例。每个配置文件都维护自己的:
- 配置和模型选择
- 记忆存储(包括会话记忆和长期记忆)
- 已安装的技能集
- 网关连接及关联的凭据
- 会话历史
- Telegram 机器人令牌
- 定时任务
- 状态数据库
1hermes profile create researcher2hermes profile create ops3hermes profile create content-lead
每个配置文件都会成为一条独立的命令:
1researcher setup # 配置模型和 API 密钥2researcher chat # 启动一个会话3researcher gateway start # 连接到 Telegram
配置文件示例配置:
1researcher:2→ soul.md: 仅深度研究。事实和数据。3→ model: gpt-5.5(更便宜,高吞吐量)4→ tools: 网页搜索、firecrawl、browser-use56ops:7→ soul.md: 管理任务。日历、邮件分类。8 发送任何内容前先请求批准。9→ model: gpt-5.5(日常任务)10→ tools: 邮件、日历、notion1112content-lead:13→ soul.md: 生产内容。匹配我的风格。14→ model: claude-sonnet-4(强写作能力)15→ tools: X 搜索、网页搜索、分析工具
配置文件分发:
配置文件可以通过 git 共享。一个可用的研究智能体可以分发给任何人:
1cd ~/.hermes/profiles/researcher2git init && git add . && git commit -m "initial"3git push origin main
任何人都可以安装它:
1hermes profile install github.com/you/researcher
他们填入自己的 API 密钥。技能、soul.md 和工作流会迁移过来。记忆和会话则保留在各自的机器上。
配置文件隔离在很多实际场景中是有用的。然而,不应将其理解为能提供与传统操作系统中进程隔离同等级别的安全或健壮性保证。
1.3 看板作为编排和状态管理层
看板系统是 Hermes 中主要的协调和状态管理层。它负责多个重要功能:
- 创建和跟踪任务
- 管理任务之间的依赖关系
- 处理状态转换
- 当一个任务或配置文件将工作移交给另一个时,促进上下文转移
- 记录每次任务尝试的执行历史和结果
状态: 分流 → 待办 → 就绪 → 运行中 → 已阻塞 → 已完成 → 已归档
调度器每 60 秒运行一次,自动将任务分配给可用的工作器,跟踪心跳信号,检测僵尸进程,并管理重试预算。
1hermes kanban list # 查看看板2hermes kanban swarm # 启动完整的多智能体系统:3 # 根编排器 + 并行工作器4 # + 门控验证器 + 门控合成器5 # + 共享黑板
早晨工作流示例:
1/目标 这是我今天的待办事项清单:231. 研究 X 上 trending 的 AI 话题42. 基于发现草拟 2 篇文章53. 检查收件箱并标记紧急邮件64. 拉取过去 24 小时内竞争对手的帖子75. 更新 Notion 中的内容日历89将每个任务添加到看板分流中。10尽可能分配给子智能体。11所有任务完成后通过 Telegram 给我发送总结。
其中一个特别重要的特性是“已阻塞”状态。当一个任务进入此状态时,执行会暂停,直到人类提供输入或解除阻塞。这种设计使得人类监督成为工作流中结构化且原生的一部分,而非外部或临时干预。
通过将任务视为具有保留上下文和历史的“一等对象”,看板层有助于减少在多智能体或多步骤工作流中常见的交接信息损失。
1.4 定时任务——调度器
定时任务是用纯英文编写的、基于时间的自主任务。无需 crontab 语法。
这一层将 Hermes 从反应式工具转变为主动式系统。有用的信息在你询问之前就会送达。
生产环境定时任务示例:
1每天早上 8 点:2给我发一个值得在 X 上回应的 AI 故事。34每 3 小时:5扫描 X 上我领域内的新鲜帖子,适合引用转发的那种。67每天晚上 9 点:8检查竞争对手今天是否发布了任何异常内容。910每周一早上 9 点:11审计我的内容面板。标记停留超过 7 天的创意。1213每周五下午 6 点:14总结本周发布的内容、15哪些表现好、哪些不好及原因。
定时任务可以针对特定的 Telegram 话题、特定的配置文件以及特定的交付平台(Telegram、Discord、Slack、电子邮件)。
网页仪表盘提供了完整的定时任务管理界面:创建、编辑、暂停、恢复、手动触发、查看上次运行时间和下次运行时间。
用操作系统的术语来说,定时任务就是调度守护进程。它们确保系统按可预测的节奏工作,无需人工启动。
1.5 /goal——持久目标(Ralph 循环)
普通提示要求 Hermes 给出一次回应。/goal 则给 Hermes 一个目标,让它跨多轮次朝着目标努力,直到一个评判模型判定目标达成。
架构如下:
- 智能体向目标执行一轮
- 评判模型评估:完成还是继续?
- 如果继续:智能体再运行一轮
- 如果完成:目标结束,交付结果
- 默认 max_turns:20。可根据任务类型配置。
- /goal resume 重置轮次计数器并继续
1hermes config set goals.max_turns 20 # 研究、内容2hermes config set goals.max_turns 50 # 代码、多步骤构建
结构化的 /goal 模板:
1/goal [成果]2使用 [来源]3约束条件: [约束条件]4可交付成果: [可交付成果]
示例:
1/goal 决定本周我应该发布的最强内容创意。2使用 X 上我领域内的 trending 帖子、竞品分析、3我过去 30 天的帖子表现。4约束条件:避免重复角度,5不使用通用的 AI 炒作框架。6可交付成果:一个最终的创意,包括标题、钩子、7所需的素材证明以及草稿大纲。
快捷技巧——让 Hermes 自己写 /goal:
1我想用 /goal,但我不想有一个模糊的目标。2只问我你需要的那些问题。3然后把我的回答转化为最强的4/goal 命令。包括确切的结果、上下文、5来源、约束条件、可交付成果,6以及你应该在何时停止。
每个 /goal 也会自动变成一张看板卡片,使进度在看板上可见。
核心命令:
1/goal [描述] # 开始自主执行2/goal status # 检查正在运行的内容3/goal pause # 暂停,不丢失上下文4/goal resume # 暂停后继续5/goal clear # 结束当前目标6/subgoal [文本] # 在中间添加条件7/undo [N] # 撤回最近 N 轮(v0.16.0 新增)
1.6 技能创建机制
Hermes 包含允许智能体根据自身活动创建并存储可复用流程(技能)的功能。当智能体成功完成某些类型的工作时,它可以识别模式、将其形式化,并保存下来供将来使用。
技能以纯 Markdown 文件形式存储在 ~/.hermes/skills/ 目录下。它们是透明的、可读的、可编辑的。没有黑箱。
示例——一个内容创作技能:
1将此保存为一个名为 "content-post" 的技能:23# 内容发布工作流451. 通过 X 搜索检查 AI 智能体领域的热门话题62. 与我过去 14 天的帖子交叉引用(避免重复)73. 基于参与模式选择最强的切入点84. 用我的风格起草:9 - 全大写钩子10 - 用箭头 → 表示功能列表11 - 不使用破折号、副词、铺垫125. 给草稿打分:13 - 钩子:能阻止用户滚动吗?(1-10)14 - 收藏价值:有人会保存它吗?(1-10)15 - 凭据:每个说法都有数字支撑吗?(1-10)166. 如果任何分数低于 7,重写该部分177. 将最终草稿发送到 Telegram 等待批准
查看所有技能:
1hermes skills2# 或3hermes dashboard # → 技能标签页
Hermes 内置了 60 多种工具,涵盖终端、网页、浏览器、视觉、图像生成、TTS 和代码执行。技能构建在这些工具之上,形成完整的工作流。
在 v0.16.0 中,默认技能集被精简为你实际需要的——开箱即用更精简,噪音更少。NVIDIA 技能加入了受信任的技能中心,将官方的 CUDA-X、Omniverse、NeMo 和 TensorRT-LLM 技能引入目录。
复合效应:
拥有 20 多个自创技能的智能体,完成类似未来任务的速度比全新实例大约快 40%(根据 Nous Research 的观察)。这种复合效应是 Hermes 的核心差异化优势。
在实践中,技能创建的成熟度、可靠性和自主程度差异很大。在许多情况下,尤其是在早期使用或处理复杂任务时,人工审查和整理创建的技能仍然是获得高质量结果的重要环节。
1.7 自主策展器——垃圾回收器
随着技能在数周和数月的使用中积累,冗余、过时的流程和膨胀成为真正的问题。自主策展器解决了这个问题。
策展器是一个后台进程,按可配置的调度运行(默认:7 天周期)。它:
- 识别冗余或重叠的技能
- 修剪不再相关的技能
- 压缩和合并相关的流程
- 优化技能库以提高检索效率
- 修订技能描述以提高可搜索性
用操作系统的术语来说,策展器充当垃圾回收器和碎片整理工具。它防止技能文件系统随时间退化。
这一点尤其重要,因为工具搜索(下文会提到)依赖技能的名称和描述进行检索。维护不善的描述会降低搜索准确性。
根据 NVIDIA NemoTron Labs 直播,Nous Research 的 Karan 确认:“Hermes 策展器是一个自主后台功能,持续管理、清理、优化、修订、改进和压缩你的技能库。”
1.8 工具搜索——动态链接器
当你连接 15 个以上的 MCP 服务器时,它们的工具模式会在每一轮占用上下文窗口空间——即使大多数工具与当前任务无关。
工具搜索用 3 个轻量级桥梁工具替换所有 MCP/插件模式:
- tool_search——通过名称和描述找到正确的工具(BM25 检索)
- tool_describe——按需加载其完整模式
- tool_call——执行它
每个桥梁工具大约消耗 300 个 token,而完整的模式数组消耗数千个。
1tools:2 tool_search:3 enabled: auto # 默认,当上下文使用率达到 10% 时启用
三种模式:auto(推荐)、on(始终激活)、off(禁用)。
在 Opus 4 上,启用 Tool Search 后准确率从 49% 提升到 74%(Anthropic 自己的测试)。
核心 Hermes 工具(终端、记忆、浏览器、网页搜索)永远不会被延迟加载。它们会在每一轮保持加载。
用操作系统的术语来说,工具搜索充当动态链接器。它不会在启动时加载所有共享库,而是在运行进程需要时按需加载。这为实际工作保留了内存(上下文窗口)。
1.9 网关——网络栈
网关是让 Hermes 可以从任何地方访问的层。一个网关进程同时将智能体连接到 27 多个消息平台:
Telegram、Discord、Slack、WhatsApp、Signal、SMS、Email、Matrix、Mattermost、Microsoft Teams、Teams Meetings、Google Chat、LINE、DingTalk、飞书/Lark、企业微信、微信、QQ、元宝、BlueBubbles (iMessage)、SimpleX、ntfy、Open WebUI、Home Assistant、MS Graph Webhooks,以及更多。
1hermes gateway start
网关作为一个进程运行。批准按钮在 Telegram 和 Slack 中原生支持——智能体可以在执行敏感操作前请求人工确认。
SSEP——结构化流事件协议(v0.16.0+):
智能体不再流式传输原始文本并期望平台能渲染它。而是:
- 智能体仅发出类型化事件:MessageChunk、MessageStop、ToolCallChunk、ToolCallFinished、Commentary、LongToolHint、GatewayNotice
- 网关路由器将每个事件路由到正确的平台适配器
- 每个适配器渲染它能处理的,静默丢弃它不能处理的
Telegram 获得 MarkdownV2 格式的动画草稿。iMessage 丢弃用户不需要看到的工具外框。每个事件是不可变的。每个流的顺序得到保留。
用操作系统的术语来说,网关是网络栈,SSEP 是显示服务器/合成器。智能体生成通用输出格式;渲染层根据显示设备调整它。
远程访问:
桌面应用可以连接到另一台机器上运行的 Hermes 后端(VPS、家庭服务器、通过 Tailscale 连接):
1hermes dashboard --host 0.0.0.02# 通过认证网关设置用户名和密码3# 桌面应用通过 URL + 凭据连接
一个智能体在 VPS 上运行。通过笔记本电脑上的桌面应用、通过 SSH 的 CLI 以及手机上的 Telegram 进行管理。所有这些都访问同一套记忆、技能和会话。
1.10 语音模式——I/O 层
语音模式在 CLI 和所有消息平台上提供语音输入和输出。
1/voice on # 语音到语音模式2/voice tts # 始终用语音回复3/voice off # 回到文本模式
五家语音转文本提供商:
- Local faster-whisper(免费,在设备上运行)
- Groq
- OpenAI Whisper
- Mistral Voxtral
- xAI Grok STT
五家文本转语音提供商:
- Edge TTS(免费,默认)
- ElevenLabs
- OpenAI
- NeuTTS(本地,免费)
- MiniMax
适用于 Telegram 语音消息、Discord 语音频道(与智能体进行实时语音对话)、WhatsApp、Signal、Slack 和 CLI。
用操作系统的术语来说,语音模式就是 I/O 层——提供文本之外的替代输入/输出方法。
1.11 安全层
Hermes 为生产部署提供了多重安全原语:
第 1 层— Bitwarden 秘密管理器(凭据管理)
1hermes secrets bitwarden setup # 向导:安装 bws,提示输入令牌2hermes secrets bitwarden status # 验证连接3hermes secrets bitwarden sync # 试运行:查看将要应用的内容
.env 中只有一个引导令牌。所有真实凭据都存储在 Bitwarden 中。每个 Hermes 实例在启动时拉取秘密。在 web 应用中轮换一次密钥——每个实例在下次重启时都会获取到。免费层级。
第 2 层— iron-proxy 出口防火墙(凭据保护)
1hermes egress install # 下载 iron-proxy 二进制文件,SHA-256 验证2hermes egress setup # 交互式向导3hermes egress start # 启动托管的代理守护进程
Hermes 不是将真实凭据注入沙箱,而是给智能体不透明的代理令牌。iron-proxy 在网络边界拦截,替换为真实凭据,转发请求。沙箱永远不会持有实际密钥。
第 3 层— 提示件防御
防止 Brainworm 类的提示注入攻击。智能体检测并拒绝通过处理文档、网页或工具输出中的恶意内容来覆盖其指令的尝试。
v0.16.0 新增:CVE-2026-48710 Starlette 锁定、SSRF 出站加固以及子进程凭据剥离。仅此版本就关闭了 16 个安全相关的问题。
第 4 层— OpenShell(企业级,通过 NVIDIA 合作)
对于企业部署,Hermes 集成了 NVIDIA OpenShell 和 Microsoft 安全原语。OpenShell 提供:
- 每用户策略门控制智能体可以访问的内容
- 出口时的令牌屏蔽(智能体永远看不到真实凭据)
- 无需重启即可热替换策略
- 管理员可观察性和审计追踪
根据 NVIDIA NemoTron Labs 直播,Nous Research 的 Karan 说:“即便你变得再聪明,你也无法通过那个特定的网关,我也绝不允许你使用你制作的技能,因为我不会以我想要的方式监督你。”
1.12 可扩展性——技能中心和 MCP 目录
技能中心([agentskills.io](//agentskills.io)): 社区贡献的技能。通过仪表盘或 CLI 直接在中心浏览、搜索、安装。
MCP 目录: 由 Nous Research 策展。每个条目通过合并的 PR 加入。目录中有 19,932 个技能。
1hermes mcp # 交互式选择器
NVIDIA 技能: 官方 NVIDIA 智能体技能已集成到技能中心。CUDA-X 库、Omniverse 工作流、NeMo 训练和推理、TensorRT-LLM 优化、CUDA-Q 量子编程。每日从 NVIDIA 产品仓库同步。
用操作系统的术语来说,技能中心和 MCP 目录充当包管理器。用户可以发现、安装和管理能力,而无需从头构建。
1.13 界面层
Hermes 可以通过多种界面访问和管理:
CLI(命令行界面): 完全功能对等。每个命令、每个工具、每个配置选项都可用。最强大的界面。
1hermes # 启动一个会话2hermes chat # 同上3hermes doctor # 诊断检查4hermes dump # 完整系统状态,用于调试5hermes status # 可视化概览
TUI(文本用户界面): 具有面板和导航的丰富终端界面。介于 CLI 的强大和视觉反馈之间。
桌面应用(v0.16.0——“Surface 版本”): 适用于 macOS、Windows 和 Linux 的原生 Electron 应用。在一周内通过 100 个 PR 和 159 个提交构建而成。首次在 Jensen 的 GTC 主题演讲中演示。
- 并排预览面板
- 内置文件浏览器
- 将文件直接拖放到聊天中
- 集成语音模式
- 状态栏中的内联模型选择器(支持模糊搜索)
- 并发多配置文件会话
- 模型、API 密钥、工具的设置界面
- 配置文件管理
- 工件查看器(Hermes 创建的每个文件)
- 应用内自动更新
- 完整的简体中文翻译
- 与 CLI 共享相同的 HERMES_HOME 目录——会话无缝迁移
下载:hermes-agent.nousresearch.com/desktop
如果已安装 Hermes:
1hermes desktop
网页仪表盘:
1hermes dashboard # 打开 localhost:9119
- 模型、定时任务、技能、配置文件、看板
- 完整的基于浏览器的管理面板:MCP 目录、消息通道、凭据、webhook、记忆管理
- 可插拔的身份验证:OIDC 或用户名/密码登录
- 完全可通过主题(YAML)和插件(JS + Python)扩展
- 默认情况下,数据不会离开本地主机
消息平台: 通过网关连接的 27 多个平台(在第 1.9 节中已介绍)。
2. 复合效应
Hermes 的复合特性是其最独特的属性,也是它更像操作系统而非典型智能体的主要原因。
第 1 天: Hermes 对你一无所知。每个任务都需要完整的指令。你解释你的工作流、你的偏好、你的工具。智能体是一张白纸。
第 2 周: Hermes 已经积累了关于你的项目、偏好和工作风格的记忆。它不再问你已经回答过的问题。原本需要 10 条消息的任务,现在只需 3 条。
第1个月:Hermes 已根据完成的工作创建了 15-20 个技能。你的内容工作流、你的研究流程、你的收件箱分类方法——每一个都被编码为可重复使用的程序。原本需要代理 20 轮才能完成的任务,现在只需 5 轮。
第3个月:拥有 40 多个技能和深度记忆后,代理的运行水平已无法通过切换到更好的模型并清空上下文来复制。积累的技能、记忆和学习到的偏好创造了一种复利优势,随着每次会话不断增长。
数学原理:拥有 20 个以上自创技能的代理,完成类似未来任务的速度比新实例快约 40%。这种改进会持续累积——每完成一个任务都可能创建或优化一个技能,从而加速未来的工作。
这在实践中意味着什么:
来自 Nous Research 的 Johnny 在 NVIDIA NemoTron Labs 直播中描述了他的实际工作流:"每天早上我会启动一个规划会话。每次规划会话我都会得到一个带日期键的文件,里面列出我想做的事情。这个技能会回顾过去一周,告诉我哪些方面做得不够,或者有没有我说过紧急但还没处理的事情。晚上 11 点,一个 cron 任务会触发并问我:你今天做了你想做的事吗?"
这是一个通过使用而进化的系统。早间规划技能、日期键归档系统、每周回顾——这些都不是预先构建的。它们从 Johnny 的使用模式中涌现出来,并成为了永久性的基础设施。
训练第一个 Hermes 模型的 Karan 将其用于 ML 消融实验:"我真的很讨厌做消融实验。它繁琐、耗时。但必须得做。这就是做科学的方法。现在 Hermes 来做这件事了。我不必再亲自动手。"
这种复利效应是将 Hermes 视为基础设施而非应用的核心论点。应用在第 90 天提供的价值与第 1 天相同。而基础设施会随着投入持续改进。
3. Token 经济——实际成本
将 Hermes 作为个人操作系统运行有具体的成本。理解这些成本对于可持续使用至关重要。
代理运行时:Hermes 本身是免费开源的(MIT 许可证)。成本来自模型推理和基础设施。
基础设施选项:

最低 VPS 规格:2 vCPU,2GB RAM(轻量使用)。
推荐:4 vCPU,8GB RAM(重度使用)。无需 GPU——Hermes 调用 API,而非直接调用模型。
模型提供商选项:

X API 成本(自 2026 年 2 月起按使用量付费):

替代方案:OpenTweet MCP,每月 5.99 美元固定费用。
实际的月度预算:
以下 Token 估算是基于典型会话模式的近似值。实际消耗取决于模型、任务复杂度、工具输出量和配置。使用 Hermes 内的 /usage 命令来测量你的实际数据。
运行本文描述的全套内容系统(5 个每日 cron 任务、每天 2 次带 /goal 的内容会话、每日子代理研究、看板追踪)每月大约消耗 1000-1100 万个 Token。以下是你根据模型策略所需支付的费用:

在 GPT-5.5 上每月花费 27 美元的系统,在 Claude Opus 上每月花费 250 美元。对于相同的 cron 任务、相同的 /goals、相同的子代理,成本相差 10 倍。
为什么这很重要:Hermes 与模型无关。你可以为每个配置文件、每个任务选择模型。扫描 X 寻找热门帖子的常规 cron 任务不需要 Opus 级别的推理能力。一个 $0 的 GPT-5.5 调用就能完成同样的工作。把昂贵的模型留到每天只需要一次推理质量或深度推理真正带来差异的 /goal 上。
最便宜的完整路径:

这是一个 24/7 全天候运行的自主代理,拥有 5 个每日 cron 任务、持久记忆、自我改进的技能、看板任务追踪以及从手机访问 Telegram 的能力。
对比:一个能完成同样工作的虚拟助理每月费用为 500-2000 美元。一个内容机构每月费用为 3000-8000 美元。
关于 Nous Portal 的说明:Plus 层级(每月 20 美元,含 22 美元积分)适用于轻量使用(1-2 个 cron 任务,每天几次会话)。对于本文描述的全套内容系统,Super 层级(每月 100 美元,含 110 美元积分)或自带密钥更为实际。
Token 优化(6 种降低成本的方法):
- 紧凑文件读取器——每次读取文件减少 14% 的 Token(最新版本已自动启用)
- 提示缓存——多轮会话减少约 75% 的 Token(仅限 Anthropic 模型)
- /compress——总结会话历史,消除冗余
- 工具搜索——按需加载架构,而非预加载
- 子代理委派——每个子代理运行在自己的上下文中,只返回摘要
- 基于检索的记忆——相比简单的全部注入,减少 72% 的 Token
最快获得一个可工作代理的路径:
1hermes setup --portal
一次 OAuth 即可覆盖模型 + 网页搜索 + 图像生成 + TTS + 云端浏览器。无需单独的 API 密钥。
4. 各层如何串联在一起
这些层在堆叠时会产生复利效应。以下是一个端到端运行的链:
1早上 8:00 — Cron 任务触发。23内容主管配置文件被唤醒,4启动一个带结构的 /goal:56"使用 X 热门数据和我过去 14 天的帖子,7找出今天最强的 3 个内容角度。"89它生成了 3 个子代理:10→ 子代理 1 扫描 X 的热门帖子11→ 子代理 2 拉取近期帖子的表现数据12→ 子代理 3 检查竞争对手账户1314工具搜索仅加载每个子代理所需的工具。15提示缓存保持系统提示成本低廉。16每个子代理在自己的上下文中运行(委派)。1718所有三个任务都变成了看板卡片。19调度器并行追踪它们。2021子代理完成后。内容主管运行22内容发布技能来草拟 2 篇帖子。2324草稿落入 Telegram 的 Content 话题25等待批准。2627用户点击批准其中一篇。拒绝另一篇。28批准的帖子通过 xurl 发布。293010 分钟后,竞争对手发布了31对同一话题的回应。32一个 webhook 被触发。33Hermes 起草了一个后续角度34并发送到 React 话题。3536所有内容都在仪表板上可见。37运行了什么、发布了什么、等待中什么。3839晚上 11 点,每日回顾 cron 触发。40会话搜索拉取当天的工作。41摘要发送到 Telegram。
一天。九个架构层触发。两篇帖子发布。零人工研究。总 API 成本:约 2-4 美元。
5. 关键特性
持久性
Hermes 通过其记忆系统明确设计为跨会话保留信息。这使得积累的上下文和创建的技能能够随时间持续存在,而不是在每次会话或重启后丢失。
隔离与协作
配置文件和看板的结合使 Hermes 能够同时支持隔离和结构化协作。配置文件为不同工作负载提供了分离,而看板则在需要协作时实现受控交接和上下文传输。
自我改进机制
技能创建功能的存在为 Hermes 提供了结构性自我改进的途径。与仅依赖提示工程或手动工具定义的系统不同,Hermes 可以根据使用模式扩展自身能力。自主策展人确保技能库随时间保持整洁和高效。
人类监督作为原生功能
通过看板中的"阻塞"任务状态以及 Telegram 和 Slack 中的批准按钮,人类干预被实现为一等概念。这使得系统能够干净地暂停执行、保留上下文,并在收到所需输入后智能地恢复。
6. 实际考量
当将 Hermes 作为基础设施而非简单对话工具使用时,有几个实际因素变得重要:
- 系统的长期价值在很大程度上取决于记忆和创建的技能如何随时间管理、策展和维护。自主策展人有所帮助,但定期的人工审查可以提高质量。
- 配置文件隔离很有用,但需要刻意配置。它不是自动的,也无法提供与传统进程隔离相同的保证。
- 自主创建的技能的质量和实用性可能会有很大差异。在许多情况下,尤其是在早期,人工审查可以改善结果。
- 资源消耗,特别是模型上下文窗口和推理成本,应主动监控。定期使用 /usage 和 /compress。对于重型 MCP 设置,启用工具搜索。
- 整体系统的有效性高度依赖于深思熟虑的配置和持续管理,而不是仅仅通过运行软件就自动涌现。
- 在投入重度使用模式之前,应理解 Token 经济学。从每月 20 美元的 Nous Portal Plus 开始,然后根据需求扩展。
Token 感知配置
将 Hermes 作为带有多个配置文件和 cron 任务的全功能操作系统运行时,每次会话启动都会消耗 Token(系统提示 + 记忆 + 技能索引)。如果不进行优化,成本可能会比预期增长得更快。
为合适的任务使用合适的模型:
并非每个任务都需要最强的模型。将模型与任务类型匹配是最大的成本杠杆。
1内容主管配置文件:2→ 模型:claude-sonnet-4(强写作能力,中等成本)34研究员配置文件:5→ 模型:gpt-5.5(更便宜,通过 Codex 处理高容量,成本为 $0)67运营配置文件:8→ 模型:gpt-5.5(常规任务,成本效益高)910代码审查配置文件:11→ 模型:claude-opus-4-8(仅用于复杂推理)
将前沿模型(Opus、GPT-5.5)用于复杂的 /goal。将更便宜的模型用于日常 cron 任务和常规分类。一次切换就能将你的月度账单减半。
为轻量配置文件降低记忆限制:
默认记忆注入为每轮 2200 个字符(约 800 Token)。在一个 50 轮的 /goal 会话中,这意味着 40K Token 花费在重复记忆上。对于不需要深厚个人背景的配置文件:
1hermes config set memory.memory_char_limit 10002hermes config set memory.user_char_limit 500
设置现实的 max_turns:
1# 研究和内容(更短,更聚焦)2hermes config set goals.max_turns 2034# 代码任务(更长,需要更多迭代)5hermes config set goals.max_turns 50
在 Opus 上运行 50 轮每次会话可能花费 5-12 美元。按配置文件设置 max_turns,而不是全局设置。研究配置文件很少需要超过 20 轮。
启用全部 6 种 Token 优化:
1tools:2 tool_search:3 enabled: auto # 按需加载架构45memory:6 memory_char_limit: 2200 # 如果不需要则降低7 user_char_limit: 1375 # 如果不需要则降低
此外:提示缓存(Anthropic 自动启用)、/compress 用于长会话、子代理委派用于并行工作。
为辅助任务使用便宜的辅助模型:
Hermes 将压缩、视觉、网页摘要、批准评分、工具路由和会话标题卸载到辅助模型。每个槽位可独立配置。为这些任务使用便宜的快速模型,同时将昂贵的模型用于主要工作:
1hermes model2# 设置主模型:claude-sonnet-4(质量)3# 设置辅助模型:一个快速的便宜模型(压缩、路由)
这意味着 /compress 和自动压缩运行在便宜的 Token 上,而不是在你的主模型定价上。
调整压缩阈值:
1compression:2 threshold: 0.50 # 默认:在上下文窗口的 50% 处压缩
将其降低到 0.30-0.40 以获得更激进的压缩。会话保持更轻量,在压缩器触发之前积累的 Token 更少。
无损上下文管理(LCM):
1context:2 engine: "lcm" # 插件,替换默认的有损压缩
默认压缩器是有损的——它会总结并丢弃较旧的上下文。LCM 是一个插件替代方案,它在无损的情况下保留所有上下文,同时仍优化 Token 使用。可通过 hermes plugins → Context Engine 获取。
使用 /usage 进行监控:
1/usage
定期运行此命令。比较各会话之间的 Token 计数。如果某个 cron 任务消耗的 Token 超出预期,简化其提示或将其切换到更便宜的模型。
按设置复杂度的成本规模:
这些是估算范围。在 Hermes 中运行 /usage 以与实际数字对比。

最便宜的路径:通过 Codex 在 GPT-5.5 上运行所有内容(每月 20 美元 ChatGPT 订阅,推理包含在内)。将 Claude 或 Opus 保留给那些推理质量在你输出中能带来可衡量差异的会话。
7. 当前限制(截至 2026 年 6 月)
Hermes 拥有若干有意义的架构优势,但它仍然是一个不断发展的系统,而非完全成熟的个人操作系统:
- 原生桌面应用显著改善了可访问性,但在所有工具交互方面尚未提供与 CLI/TUI 完全的功能对等,特别是复杂的浏览器自动化和某些本地集成。
- 运行大量并发代理或非常长时间运行的工作流可能会对模型上下文窗口和推理资源造成巨大压力。通常需要谨慎的资源管理。
- 配置文件隔离对许多用例是实用且功能性的,但它并不提供与传统操作系统中进程隔离相同级别的健壮性或故障隔离。
- 自主技能创建是一个有前途的方向,但其成熟度和可靠性仍然参差不齐。高质量、可重复使用的技能通常仍需要人工策展,特别是对于复杂或高风险的任務。
- 长会话期间的自动压缩可能导致上下文丢失。自主策展人和会话回想是部分解决方案。在窗口生命周期内将完整线程保留在上下文中可以防止静默漂移,但会限制会话长度。
- 某些高级工具集成在通过 CLI/TUI 使用时可能比通过桌面应用或消息界面使用时更稳定。
- SSEP 网关协议是新的(v0.16.0)。对于不太常见的消息平台,可能存在按平台渲染的边缘情况。
这些限制主要与实现的成熟度有关,而非根本性的架构缺陷。该项目仍在积极开发中。仅 v0.16.0 "Surface Release" 就包含了 874 次提交、542 个合并的 PR 以及来自 170 位社区成员的贡献。之前的 v0.15.0 "Velocity Release" 包含了 1302 次提交、747 个合并的 PR 和 321 位贡献者。
8. Hermes 与其他代理框架的对比
评估 Hermes 时最常见的问题:它与 Claude Code、OpenClaw 和 CrewAI 相比如何?答案是它们解决不同的问题,并基于不同的理念构建。


有效的思维模型(来自同时使用这三种工具的建设者):
Claude Code 是你桌上的日常驱动工具。最好的纯编码代理。如果任务是"写代码、重构代码、调试代码、理解代码库",Claude Code 胜出。
Hermes Agent 是你 24/7 全天候的基础设施。它在您睡觉时运行,通过配置文件管理多个工作负载,通过技能和记忆产生复利,并通过 Telegram 从任何地方联系您。
OpenClaw 是你聊天优先的助手。最大的市场、最简单的托管服务(每月 3 美元)、最强的非技术用户体验。
CrewAI 是你的编排框架。当您需要在 Python 中定义多个专业代理在定义的工作流上协作时使用。它不是一个独立的代理——而是一个构建多代理系统的框架。
一个说明差异的基准测试:
一项独立测试将相同的 18 个提示分别输入给 Claude Code(Opus 4.7)、OpenClaw(Sonnet 4.6)和 Hermes Agent。Hermes 赢得了 18 个中的 14 个。它输掉的 4 个是原始编码任务,在这些任务中 Claude Code 的代码库理解能力无与伦比。它赢得的 14 个是那些记忆和先前会话的上下文发挥了作用的任务。
结论:当历史记录重要时 Hermes 胜出。当代码深度重要时 Claude Code 胜出。它们是互补的,而非竞争的。
Hermes 提供了 hermes claw migrate——一个从 OpenClaw 迁移的内置命令。当一个产品为特定竞争对手提供命名的迁移命令时,其定位是明确的。
9. 从这里开始
如果你阅读了整篇文章并想开始使用,这里有三种路径,取决于你的情况。
路径 1——我有 15 分钟(最快获得第一个结果):
1# 安装2curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/scripts/install.sh | bash34# 一键设置(模型 + 工具 + 网关)5hermes setup --portal67# 连接 Telegram8# 向 @BotFather 发送消息 → /newbot → 复制 token9# 当 hermes setup 要求时粘贴 token1011# 设置你的第一个 cron 任务12hermes chat13> "每天早上 8 点向我发送一份14 AI 热门新闻摘要到 Telegram"1516# 完成。明天早上你将收到一份简报17# 无需打开浏览器。
路径 2——我有一个晚上(完整的个人设置):
- 安装 Hermes 并运行 hermes setup --portal
- 连接 Telegram(BotFather → token → 粘贴)
- 创建你的第一个配置文件:hermes profile create work
- 编写一个 soul.md 文件,定义代理应该如何表现
- 设置 3 个 cron 任务(早间简报、竞争对手检查、每日回顾)
- 使用结构化模板运行你的第一个 /goal:
1/goal [目标结果] 使用 [来源]2约束条件:[约束条件]3交付物:[交付物]
- 打开仪表板:hermes dashboard
- 一周后审查技能。删除弱的。优化强的。
路径 3——我想要完整的操作系统(周末项目):
- 启动一个 Hetzner CX22 VPS(约每月 7 美元)
- 通过 SSH 在 VPS 上安装 Hermes
- 运行 hermes setup --portal
- 连接 Telegram 网关:hermes gateway start
- 创建 3-4 个配置文件(内容、研究、运营、代码)
- 为每个配置文件编写 soul.md
- 按配置文件设置 cron 任务
- 配置看板以实现跨配置文件任务追踪
- 在笔记本电脑上安装桌面应用
- 通过认证网关将桌面连接到远程后端
- 在 config.yaml 中启用工具搜索
- 为 Token 优化降低记忆字符限制
- 设置 Bitwarden Secrets Manager 用于凭据管理
- 运行一周。审查技能、记忆和 Token 使用情况。
- 迭代。系统从这里开始复利积累。
如果感到不知所措,优先级顺序:从 cron 任务(10hack 文章中的第 3 点)、/goal 结构(第 4 点)和技能(第 8 点)开始。这三个设置会在一夜之间改变 Hermes 的使用感受。
结论
Hermes Agent 代表了当前开源代理框架中在架构上较为雄心勃勃的尝试之一,旨在超越简单的对话或工具调用界面。其持久记忆、基于配置文件的隔离、通过看板实现的结构化任务编排、纯英语 cron 调度、持久的 /goal 目标、动态工具加载、多平台网关访问、语音交互、生产级安全原语以及创建可重用程序的机制,使其具有更接近个人操作系统概念的特性,而非当今大多数其他可用系统。
来自 Nous Research 的 Karan 训练了第一批 Hermes 模型,他简单描述道:"Hermes Agent 是一种能力,让你意识到你电脑上发生的一切都是文本输入或文本输出。Hermes Agent 让你可以通过你电脑上的所有集成来实现这一点。它可以使用你的浏览器、你的应用、你在电脑上做的一切。它是一个通用的自动化工具,是计算机操作和数字操作的通用模拟器。"
同时,保持现实的期望也很重要。Hermes 还不是一个完全成熟的个人 AI 操作系统。其架构方向很有前途,但现实世界的有效性仍然在很大程度上依赖于精心的配置、持续的管理以及对功能成熟度的诚实评估。
当作为基础设施精心使用时,Hermes 可以成为构建长期、不断演变的 AI 辅助工作流的基础,这些工作流会随时间推移在能力上产生复利。有意义的区别在于如何有意识地理解和利用该系统的能力和局限性。
代理已就绪。技术栈已就绪。价值随使用而增长。
相关文章
- HERMES AGENT:完整指南 — 安装、模型、仪表板、用例、安全
- 完整的 Hermes /goal 剧本 — 21 个工作流
- Hermes /goal — 完整指南
- 如何让 Hermes + xurl 真正作为一个系统工作
- Hermes x Bitwarden — 安全栈
- 10 个 Hermes Agent 设置
扩展版本和其他 Hermes 内容在 Substack 上:https://substack.com/@yanxbt
本文基于公开的 Hermes Agent 文档(v0.16.0 "The Surface Release")、NVIDIA NemoTron Labs 直播以及截至 2026 年 6 月观察到的系统行为。





