在过去的 3 年里,我花了超过 2000 个小时用 AI 编程,并且亲自采访了 Agentic Engineering 领域里一些最高产的人。
下面是我目前在 2026 年第三季度使用的完整 Agentic Engineering 设置。
界面
这里指的是你与 Agent 交互的 UI / CLI。我的主要界面是 bb。
它是开源的,完全免费,并且允许你在一个 GUI 中使用任何订阅、任何 Agent、任何模型。Codex、Claude Code、Pi、Cursor CLI、OpenCode、Grok Build、Hermes,所有这些都可以在同一个 UI 里运行。
像 Codex 或 Cursor 这类应用的问题在于,它们只允许使用自己的模型和自己的订阅。我们的目标是花最少的钱获得最多的 Token。
你在 Codex 或 Cursor 应用中喜欢的所有功能,bb 里都有,而且它每周都在改进(此外,它是完全开源且 100% 免费使用的)。
我经常使用的另一个工具是 cmux。
当你启动一个新的 cmux 工作区时,你可以像在 tmux 中一样分割屏幕(这也是名字相似的原因),在每个窗格中启动不同的终端,并且内置了一个浏览器。
cmux 的不足之处在于,当你有很多 Agent 和工作区时,左侧边栏并不是合适的交互方式。处理少量任务还行,但对于大规模的严肃 Agentic Engineering 工作来说,它并不是最佳选择。
我使用 Ghostty 作为我的终端,因为它非常快且是原生的。
在 Ghostty 内部,你可以运行 Herdr,它基本上就是 Agent 版的 tmux,一个 Agent 的后端运行时。非常轻量,非常简洁,运行在终端中,当一个 Agent 完成时,它的状态会显示在左侧:完成、空闲、阻塞、运行中。
跟踪 AI Agent 的状态是至关重要的。我预测在 3 到 6 个月内,这种“Agent 状态跟踪”会变得越来越重要,因为你将不会只和一个 Agent 对话。你会和一个管理着许多工作 Agent 的管理 Agent 对话。
最后一个要提的界面是我自己开发的 Corral。
与在 Agent 完成后随机切换不同(在 Herdr 中没有真正的顺序),Corral 中每个 Agent 都有优先级。就像任务有不同的优先级/重要级别一样。当一个 P1 级别的 Agent 完成时,它会排到最前面。你绝不应该在 P1 Agent 运行完成后去响应一个 P4 Agent。(是的……我确实需要把 Corral 开源。还没顾上。)
模型与订阅
你想要花最少的钱获得最多的 Token。这应该是每个 Agentic Engineer 的主要目标之一(在完成任务之后)。
目前有 4 个主要的订阅方案,是的……这在两个月后可能完全不同。
目前性价比最高的方案是 OpenCode Go。它只要 10 美元,就能让你使用 Kimi K3、Grok 4.6、GLM 5.3、DeepSeek V4 Pro 以及许多其他模型……但它没有最好的模型,比如 Fable 5 和 GPT-5.6 Sol(而且使用限制也比较小)。
所以,如果你预算稍微多一点,可以这样做:
- 30 美元——购买 OpenCode Go + ChatGPT Plus(20 美元)
- 50 美元——在此基础上增加 20 美元的 Claude Code 订阅。
- 70 美元——增加 Cursor 的 20 美元月付方案,这样你就拥有了所有订阅方案中的最低层级。
- 110 美元——OpenCode + 一个大型方案。ChatGPT 的 100 美元方案比 Claude 更划算。事实就是如此。OpenAI 拥有更多算力,他们愿意为此提供更多补贴。
- 210 美元——两个 100 美元方案都买。
- 如果你真的很认真(像我一样),那就把所有 200 美元的方案(Codex、Claude、Cursor)都买下来,因为它们是 20 倍用量,这些方案能给你最好的性价比。
顺便说一句……Cursor 的方案被严重低估了。由于 SpaceX 的收购,Cursor(也就是 Grok)将会成为一个很棒的订阅。SpaceXAI 拥有海量算力,所以他们可以玩补贴游戏。而且——我认为——Cursor/Grok 方案为你提供了 Cursor 和 Grok Bot 的独立限额,这简直太棒了。
Grok Bot 正迅速成为人们与 Agent 交互的新方式,所以拥有 Cursor 订阅从未像现在这样重要(不是广告哈,这是事实)。而且,新模型——Grok 4.7——也即将到来。
无论如何,不要按 API 定价付费。这是最不划算的方案。直接买订阅就好。
云端 Agent
很明显,云端 Agent 是未来。Cursor、Amp、Devin、Codex……所有这些公司都在全力押注云端 Agent。
云端 Agent 是未来的证据见下图。
[此处为图片]
这是 Cursor 内部来自云端 Agent 的合并 PR 占比:今年年初大约为 10-15%,现在接近 60%。而且这是已合并的 PR,是实际被使用的代码。很快这个比例将达到 70%,然后是 80%,接着是 90%。
在本地机器上运行所有 Agent 的问题在于,它不具备可扩展性。你无法同时运行数百个 Agent。只要有几个 Agent 决定同时运行你的整个测试套件,你的电脑就会开始发出奇怪的噪音(即使是我那台 7000 美元的 MacBook Pro 也会吃力)。
云端 Agent 为你提供隔离的环境、持久的会话、可靠的互联网和电力访问。如果你合上笔记本电脑,会话就会丢失。如果断网几分钟,那些“马具”也无法自行恢复。
现有云端 Agent 解决方案的问题在于极端的生态系统锁定。设置环境和所有密钥需要花费大量时间,然后你就被锁定了:你的会话在那里,你使用他们的定价,并且你把所有数据都交给了他们。即使他们不拿这些数据训练模型,也有无数其他方式可以利用你的数据。
解决方案是拥有你自己的服务器。多亏了 AI,这只需要大约 10 分钟就能设置好(真的)。只需买一台 VPS,在上面运行 Herdr,然后通过 SSH 连接进去。
Herdr 为你提供持久的 Agent 会话,而 SSH 让你可以从手机、笔记本电脑等任何设备连接。你实际上只需花几美元就能实现云端 Agent 80/20 的功能,而且没有锁定。
构建你自己的云端环境
我使用 Hostinger 来托管我的 VPS,一个 KVM2 方案就足够了。我想强调的主要是……你不需要成为 VPS、DevOps、Linux 等方面的专家。完全不需要。
直接用简单的英语和你的 Agent 对话!!!
在即将发布的视频中,我会现场完成整个设置。一个 cmux 工作区,左侧窗格是一个编程 Agent(运行 Grok 4.6 的 Cursor CLI),右侧是一个空的终端窗格。
我的 cmux 技能让 Agent 能够找到另一个窗格并在其中运行命令。我自己 SSH 进了新的 VPS,然后告诉 Agent:“了解那台服务器的一切,并设置好开发环境。Herdr、Node.js、Python 3、Git”。
它在几秒钟内分析了 VPS,安装了所有东西,启动了 Herdr,然后安装了 Pi Agent,在我的 MacBook 上找到了一个 OpenRouter 密钥,并自己完成了整个设置。几个简短的提示之后,我就让 Pi 运行着 GPT-5.6 Sol,另一个会话运行着 Fable,两者都在云端,在我自己的 VPS 上,拥有完全的 root 访问权限。
如果我的电脑或 Wi-Fi 出了问题……如果我的 MacBook 爆炸了,那些 Agent 会继续运行。完整的操作指南在视频里。链接到我的 YouTube 频道。
还有一个提速技巧……我用 SuperWhisper 进行语音输入。读这篇文章的大多数人可能打字速度是每分钟 40 或 50 个单词。那太慢了。
但是!你可以以每分钟 250+ 个单词的速度说话。一个语音 AI 工具(比如 Superwhisper、Glaido、Whispr Flow)能让你发送提示的速度立刻快 3-4 倍。用上一个。别犯傻。
马具(Harness)
第一个要提的马具是 Pi Agent,它是 GOAT(史上最佳)。
最精简的马具:只有 4 个工具,始终在 YOLO 模式下运行,支持任何模型、任何提供商。非常优雅,超级可配置,这也是为什么这么多人在 Pi 之上进行构建。它是开源的,完全免费,只需访问 pi.dev 获取它。这是必须的。它是我在 VPS 上安装的第一个马具。
Cursor CLI。 非常被低估,因为你可以使用所有模型:Grok、GPT 模型、Anthropic 模型、Kimi。你可以标记技能,还可以预先发送消息。整体来说是个很棒的马具。
下一类马具,我喜欢称之为“自我改进型”马具。
最流行的两个是 Hermes Agent 和 Prime Agent。这适用于你不知道自己在做什么的情况。如果一个任务有很多不确定性,需要大量摸索,那就使用自我改进型马具,因为它会创建技能,并随着时间的推移与你一起改进。
最后,经典款:Claude Code 和 Codex。我给它们设置了别名。很多人每天都输入 claude --dangerously-skip-permissions。极其缓慢,极其低效。我输入 cc 就能启动跳过权限的 Claude Code;输入 cx 就能以 YOLO 模式启动 Codex。
你必须为经常运行的冗长命令创建全局别名。这是 Agentic Engineering 的法则之一:如何在相同的时间内完成更多工作?
技能
我的技能仓库上个月火了。(见 github.com/davidondrej/skills)它也是完全免费、开源的。
与 Agentic Engineering 最相关的技能是:
(1) /total-review
- 它会运行另外两个技能:/gpt-review 和 /fable-review,这两个技能会分别用 GPT-5.6 Sol 和 Fable 5 审查你刚刚做的代码更改,然后去重合并成一个列表,只列出真正重要的问题。这就像让你所有最聪明的朋友审查你的工作申请,而他们只给你最大的问题。在中等规模到大规模的更改上运行它,特别是如果代码是由不同的模型构建的。如果是 Grok 4.6 做的工作,你需要一个完全不同的模型来审查。
重要提示:任何你经常重复的事情都应该变成一个预设。
如果是单一步骤,使用文本替换。我把它们做成 Raycast 片段。“用简单的英语简短回答。”“把你之前的回答变得更简单、更短。”“暂存所有文件,写一个清晰的提交信息,推送到 GitHub。”
如果是多步骤的工作流,把它变成一个技能。
(2) /ask-then-build
- 我每天在开始构建之前都会使用这个技能。与其说“让这个支持 Windows”然后让模型默默地做出你以后可能会后悔的重要架构决策,不如让它带你逐一审视主要决策,并提供选项。AI 模型擅长编码,擅长实现。但它们没有品味。它们没有良好的判断力。作为人类,你需要掌控这一点。
(3) /deepapi
- 这个技能用于任何深度研究、任何数据抓取、任何网络相关的工作。Codex 和 Claude Code 带有基本的网络搜索,但没有数据抓取,没有深度研究,而且很容易被屏蔽。运行 8 次快速网络搜索并给出前 3 个选项,抓取 Twitter,抓取 GitHub,找到 3 种联系某人的方式。我团队里的每个人都在用。必备技能。
(4) 护栏与推送锁定
- 这比较枯燥,但绝对必要,而且你只需要设置一次。全局 Agent 护栏是一个工具调用前的钩子,确保你的 Agent 永远不会擦除你的磁盘,永远不会覆盖 Git 历史,永远不会触碰你的密码管理器。还有推送锁定,用于当你并行运行 15 个以上 Agent 时:在整个系统上设置一个操作系统级别的内核锁。合并、验证、推送、CI、部署、健康检查。
不要安装我所有的技能。只拿你需要的。
工作树(Worktrees)
工作树基本上是将你的主仓库副本复制到一个单独的文件夹中,并在那里创建一个新的 Git 分支,这样 Agent 就可以完全隔离地并行工作。
对于小型项目来说,这完全是杀鸡用牛刀。坚持使用单个分支,工作得更快。
对于中大型项目,当你始终同时运行 20-30 个以上 Agent 时,就无法避免使用工作树了。没有工作树,Agent 之间会发生冲突,互相撤销对方的更改,互相争斗。BB 的另一个好处是:它内置了工作树功能。它会记住,在我的大型仓库中,我总是希望基于 origin/main 创建一个新的工作树。
其他 Agentic Engineering 技巧
知道何时使用哪个模型。
- 制定计划或启动新项目?用 Fable。它最具天才的火花。修复一个深层次的严重 Bug?用 GPT-5.6 Sol,最大推理努力。日常聊天?用 Grok 4.6(高模式)。智能几乎相同,但便宜 2 倍,速度快 2 倍。前端?用 Kimi K3。
- 当一个重要的新模型发布时,留出一天时间,只使用那个模型。不要听 Twitter 上的言论。自己试试。
知道何时进行审查。
- 我不会对每个更改都运行 total review。一个小的前端调整会直接上线。
- 并且永远不要进行递归审查。如果你告诉一个模型“找出 5 个最大的问题”,即使代码库完美无缺,它也会找出 5 个问题。这些模型会凭空想象出 Bug。
预先发送。
- 通常我知道 Agent 下一步会做什么,所以我提前排好消息队列:“执行计划”、“对此运行 Fable 审查”、“现在修复那些问题”。
- 有时是 2 条消息,有时是 6 条。
- 永远不要使用不允许你预先发送消息的马具。
子 Agent 被过度使用了。
- 很多人只是用它们来消耗限额。我在自己能掌控的时候才使用它们。我想选择哪个模型在子 Agent 中运行,因为我知道我有什么订阅和限额。
- 未来是一个管理 Agent 启动工作 Agent,但你仍然需要设计那个系统:规则、权限、启动子 Agent 的条件。我不想让 Anthropic 或 OpenAI 的某个人替我做决定。
ADR(架构决策记录)。
- 这是你将决策放入代码库的方式。/docs/adr 是我在任何项目中首先创建的文件夹之一。
- 每个核心架构决策都会有一个简短的文件:决定了什么、为什么、以及当时项目的状态。有些东西可以从代码中读取,但不是全部。
- 那些无法从代码中读取的东西应该被记录下来,这样未来的 Agent 和人类就能立刻理解为什么它是这样构建的。
测试。
- 当前的模型会用测试膨胀你的仓库:单元测试、集成测试、数据库测试,即使在那些毫无意义的最小仓库上也是如此。
- 如果你告诉模型添加测试,它会添加多得离谱的测试。如果你告诉它“不要添加测试”,它仍然会添加一些,这样你就能得到恰到好处的测试量。
生产数据库访问。
- 任何有真实用户的产品都需要这样做……创建一个只读的 Postgres 角色,并把它给你的 Agent。
- 不要给他们写权限。只需要一次不可逆的更改,你就会后悔。
- 但完全没有访问权限也是个错误。有了只读权限,你可以对每个功能进行现实检查。这个在生产环境中真的会发生吗?人们真的在用这个吗?我真希望我能早点这么做。
跟踪你的 Agentic 生产力。
- 我们刚刚在 Vectal Labs 下发布了一个新的开源仓库,叫做 agentic-productivity。它会跟踪你的提交、你的 Agent 会话以及你的用户提示。
- 每个指标单独来看都不好,但将这三个结合起来并观察长期趋势,你就能看到自己是否真的在成为一个更好的 Agentic Engineer。
以上就是目前的设置。一个月后,它可能又会不同。这东西一直在变。
作者:David Ondrej(为 YouTube 录制口述,后改写为文章格式)





