Agentic Engineering 設定指南(累積超過 2,000 小時實戰經驗)

@DavidOndrej1
英語2026年8月31日
270K
1.4K
121
46
3.9K

TL;DR

深入剖析專業 AI 程式開發堆疊,詳細介紹如何運用雲端 Agent、VPS 環境與自訂技能,實現複雜軟體開發任務的自動化。

在過去三年裡,我花了超過 2,000 個小時用 AI 寫程式,也親自訪談過一些在 Agentic Engineering 領域最高產的人。

以下是我目前在 2026 年第三季的完整 Agentic Engineering 配置。

介面

這是指你與 Agent 互動的 UI / CLI。我的主要介面是 bb

它是開源的,完全免費,而且讓你在單一 GUI 中使用任何訂閱、任何 Agent、任何模型。Codex、Claude Code、Pi、Cursor CLI、OpenCode、Grok Build、Hermes,全都在同一個 UI 裡。

像 Codex 或 Cursor 這類應用的問題在於,它們只允許使用自己的模型和自己的訂閱。目標是用最少的錢獲得最多的 token。

所有你喜歡的 Codex 或 Cursor 應用功能都在 bb 裡,而且它每週都在改進(而且它是完全開源、100% 免費使用的)。

另一個我經常用的是 cmux

當你啟動一個新的 cmux 工作區時,你可以像在 tmux 裡一樣分割畫面(這也是名字相似的原因),在每個窗格中啟動不同的終端機,而且還有內建的瀏覽器。

cmux 的缺點是當你有很多 Agent 和工作區時。左側邊欄真的不是正確的基礎架構。對於少量任務還行,但對於大規模的嚴肅 Agentic Engineering 工作來說,它不是最好的。

我使用 Ghostty 作為我的終端機,因為它非常快速且是原生的。

在 Ghostty 裡面,你可以執行 Herdr,它基本上就是 tmux,但是給 Agent 用的,一個 Agent 的後端運行環境。非常精簡、非常輕量,活在終端機裡,當 Agent 完成時,它的狀態會顯示在左側:完成、閒置、阻塞、運行中。

追蹤 AI Agent 的狀態是至關重要的。我的預測是,在 3 到 6 個月內,這種「Agent 狀態追蹤」會變得越來越重要,因為你將不會只跟單一 Agent 對話。你會跟一個管理許多工作 Agent 的管理 Agent 對話。

最後一個我必須提到的介面是 Corral,這是我自己開發的。

與其當 Agent 完成時隨機切換(在 Herdr 裡沒有真正的順序),每個 Agent 都有一個優先級。就像任務有不同的優先級/重要性等級一樣。當一個 P1 Agent 完成時,他會跑到最上面。你絕對不應該在 P1 Agent 完成運行時去回應一個 P4 Agent。(是的……我確實需要把 Corral 開源。只是還沒時間做。)

模型與訂閱

你想要用最少的錢獲得最多的 token。這應該是每個 Agentic Engineer 的主要目標之一(在把事情搞定之後)。

目前有 4 個主要的訂閱方案,而且是的……兩個月後這可能完全不一樣。

目前最划算的選擇是 OpenCode Go。它只要 10 美元,而且給你 Kimi K3、Grok 4.6、GLM 5.3、DeepSeek V4 Pro 以及許多其他模型……但它沒有最好的模型,像是 Fable 5 和 GPT-5.6 Sol(而且使用限制相當小)。

所以,如果你預算多一點,你應該這樣做:

  • 30 美元——買 OpenCode Go + ChatGPT Plus(20 美元)
  • 50 美元——再加上 20 美元的 Claude Code 訂閱。
  • 70 美元——再加上 Cursor 每月 20 美元,這樣你就有了所有訂閱的最低階方案。
  • 110 美元——OpenCode + 其中一個大方案。ChatGPT 的 100 美元方案會比 Claude 更划算。事實就是如此。OpenAI 有更多的運算資源,他們更願意補貼。
  • 210 美元——兩個 100 美元方案都買。
  • 如果你真的很認真(像我一樣),就買所有 200 美元的方案(Codex、Claude、Cursor),因為這些方案有 20 倍的使用量,而且給你最划算的 deal。

順帶一提……Cursor 的方案被嚴重低估了。Cursor,也就是 Grok,因為 SpaceX 的收購將會變成一個很棒的訂閱。SpaceXAI 有大量的運算資源,所以他們可以玩補貼的遊戲。而且——我認為——Cursor/Grok 方案給你 Cursor 和 Grok Bot 各自獨立的使用限制,這簡直太棒了。

Grok Bot 正迅速成為人們與 Agent 互動的新方式,所以擁有 Cursor 訂閱從未如此重要(不是贊助啦,但這是事實)。再加上,新模型——Grok 4.7——就快來了。

無論如何,不要使用 API 定價。這是最差的選擇。直接買訂閱就對了。

雲端 Agent

很明顯雲端 Agent 是未來趨勢。Cursor、Amp、Devin、Codex……所有這些公司都把一切押注在雲端 Agent 上。

雲端 Agent 是未來趨勢的證據在下面的圖表中。

[圖片在此]

這是 Cursor 內部來自雲端 Agent 的合併 PR 比例:今年初大約是 10-15%,現在接近 60%。而且這是已經合併的 PR,是實際會被使用的東西。很快這會變成 70%,然後 80%,然後 90%。

把所有 Agent 都放在本地端機器上運行的問題在於,它無法擴展。你無法同時運行數百個 Agent。只要幾個 Agent 決定同時運行你的整個測試套件,你的電腦就會開始發出奇怪的聲音(即使是我的 7,000 美元 MacBook Pro 也很吃力)。

雲端 Agent 給你隔離的環境、持久的 session、穩定的網路和電力存取。如果你闔上筆電,你就會失去你的 session。網路斷線幾分鐘,這些 harness 就無法自行恢復。

現有雲端 Agent 解決方案的問題在於極度的生態系統鎖定。設定環境和你所有的密碼要花很多時間,然後你就被鎖住了:你的 session 在那裡,你使用他們的定價,你把所有資料都交給他們。即使他們不用這些資料來訓練模型,還是有很多其他方式可以使用你的資料。

解決方案是擁有你自己的伺服器。而且多虧了 AI,這只需要大約 10 分鐘就能設定好(真的)。只要弄一台 VPS,在上面跑 Herdr,然後用 SSH 連進去。

Herdr 給你持久的 Agent session,而 SSH 讓你可以從你的手機、筆電、任何裝置連線。你基本上可以用幾塊錢就達到雲端 Agent 的 80/20 效果,而且沒有鎖定問題。

建立你自己的雲端環境

我使用 Hostinger 來管理我的 VPS,而 KVM2 方案就夠了。我想強調的重點是……你不需要是 VPS、DevOps、Linux 的專家,完全不需要。

只要用簡單的英文跟你的 Agent 對話就好了!!!

在接下來的影片中,我會現場直播設定整個過程。一個 cmux 工作區,左邊窗格有一個寫程式用的 Agent(執行 Grok 4.6 的 Cursor CLI),右邊是一個空的終端機窗格。

我的 cmux 技能讓 Agent 可以找到另一個窗格並在其中執行指令。我自己 SSH 進全新的 VPS,然後告訴 Agent:「了解那台伺服器的一切,並設定開發環境。Herdr、Node.js、Python 3、Git」。

它在幾秒鐘內分析了 VPS,安裝了所有東西,啟動了 Herdr,然後安裝了 Pi Agent,在我的 MacBook 上找到了一個 OpenRouter 金鑰,並自己完成了整個設定。經過幾個簡短的提示之後,我就讓 Pi 運行著 GPT-5.6 Sol,另一個 session 運行著 Fable,兩者都在雲端、在我自己的 VPS 上,擁有完整的 root 權限。

如果我的電腦或 Wi-Fi 出了什麼事……如果我的 MacBook 爆炸了,那些 Agent 會繼續運行。完整的逐步解說在影片中。這裡連結到我的 YouTube。

還有一個加快速度的方法……我用 SuperWhisper 來口述。你們大多數人閱讀這篇文章時,打字速度大概是每分鐘 40 或 50 個字。這非常慢。

但是!你可以用每分鐘超過 250 個字的速度說話。一個語音 AI 工具(像是 Superwhisper、Glaido、Whispr Flow)可以讓你發送提示的速度立刻快 3 到 4 倍。用一個吧。別傻了。

Harness

第一個要提到的 Harness 是 Pi Agent,史上最強。

市面上最精簡的 Harness:只有 4 個工具,永遠以 YOLO 模式運行,支援任何模型、任何供應商。非常優雅,高度可配置,這就是為什麼這麼多人在 Pi 的基礎上進行開發。它是開源的,完全免費,只要去 pi.dev 下載就好。沒得商量。這是我第一個放到 VPS 上的 Harness。

Cursor CLI。 非常被低估,因為你可以使用所有模型:Grok、GPT 模型、Anthropic 模型、Kimi。你可以標記技能,也可以預先發送訊息。整體來說是很棒的 Harness。

下一類 Harness 是我所謂的「自我改進」型 Harness。

最受歡迎的兩個是 Hermes Agent 和 Prime Agent。這是在你不知道自己在做什麼的時候用的。如果一個任務有很多不確定性,需要很多摸索,就使用自我改進型 Harness,因為它會隨著時間創造技能並與你一起進步。

最後,經典款:Claude Code 和 Codex。我把它們設成了別名。很多人每天都要打 claude --dangerously-skip-permissions。極度緩慢,極度沒效率。我打 cc 就會啟動跳過權限檢查的 Claude Code;cx 則以 YOLO 模式啟動 Codex。

你必須為你經常執行的長指令建立全域別名。這是 Agentic Engineering 的法則之一:如何在相同的時間內完成更多事情?

技能

我的技能 repo 上個月爆紅。(請見 github.com/davidondrej/skills)它也是完全免費、開源的,等等。

與 Agentic Engineering 最相關的技能是:

(1) /total-review

  • 它會執行另外兩個技能:/gpt-review 和 /fable-review,這兩個技能會分別用 GPT-5.6 Sol 和 Fable 5 審查你剛才做的程式碼變更,然後將兩個清單去重,合併成一個真正重要的問題清單。這就像請你所有最聰明的朋友來審查你的求職申請,而他們只給你最大的問題。在中等到大型的變更上執行它,特別是如果是由不同的模型建構的。如果是 Grok 4.6 做的工作,你會希望用一個完全不同的模型來審查它。

重要:任何你經常重複的事情都應該變成一個預設設定。

如果是單一步驟,使用文字替換。我把它們設為 Raycast 片段。「用簡單的英文簡短回答。」「把你之前的回答變得更簡單、更短。」「暫存所有檔案,寫一個清晰的 commit,推送到 GitHub。」

如果是多步驟的工作流程,就把它變成一個技能。

(2) /ask-then-build

  • 我每天都會用這個技能,在任何建構開始之前。與其直接說「讓這個支援 Windows」,然後讓模型默默地做出你可能會後悔的重要架構決策,它會一次一個地引導你完成主要的決策,並提供選項。AI 模型很擅長寫程式,很擅長實作。但它們沒有品味。它們沒有良好的判斷力。你,作為人類,需要主導這部分。

(3) /deepapi

  • 這個技能我用於任何深度研究、任何爬蟲、任何網路相關的工作。Codex 和 Claude Code 附帶基本的網路搜尋,但沒有爬蟲功能,沒有深度研究,而且很容易被擋。執行 8 次快速網路搜尋,給我前 3 個選項,爬取 Twitter,爬取 GitHub,找到 3 種聯繫某人的方式。我團隊裡的每個人都用它。必備。

(4) 護欄與推送鎖定

  • 比較無聊,但絕對必要,而且你只需要設定一次。全域 Agent 護欄是一個在工具呼叫前的鉤子,確保你的 Agent 永遠不會清除你的磁碟、永遠不會覆寫 Git 歷史、永遠不會碰你的密碼管理器。還有推送鎖定,用於當你同時運行 15 個以上的 Agent 時:在整個系統上設定一個 OS 級別的核心鎖定。合併、驗證、推送、CI、部署、健康檢查。

不要安裝我所有的技能。只拿你需要的就好。

Worktrees

Worktree 基本上是你主要 checkout 的一個副本,放在一個單獨的資料夾中,並在那裡建立一個新的 Git 分支,這樣 Agent 就可以在完全隔離的環境中並行工作。

在小型專案上,這完全是殺雞用牛刀。留在單一分支上,加快速度。

在中等到大型的專案上,當你隨時運行 20-30 個以上的 Agent 時,就無法避免它了。沒有 worktrees,Agent 會互相衝突、撤銷彼此的變更、互相打架。BB 的另一個好處是:它有內建的 worktrees。它會記住,在我的大型 repo 上,我總是想要一個基於 origin/main 的新 worktree。

其他 Agentic Engineering 技巧

知道何時使用哪個模型。

  • 正在設計計畫或啟動新專案?用 Fable。它擁有最多的天才火花。正在修復一個深層、嚴重的錯誤?用 GPT-5.6 Sol,最大推理努力。預設對話?用高模式的 Grok 4.6。智慧程度幾乎相同,但便宜 2 倍且快 2 倍。前端?用 Kimi K3。
  • 當一個重要的新模型發佈時,撥出一整天的時間只使用那個模型。不要聽 Twitter 上的說法。自己試試看。

知道何時進行審查。

  • 我不會在每次變更上都執行 total review。一個小小的前端調整會直接上線。
  • 而且絕對不要做遞迴審查。如果你告訴一個模型「找出 5 個最大的問題」,即使程式碼庫完全沒問題,它也會找出 5 個問題。這些模型會發明出虛構的錯誤。

預先發送。

  • 通常我知道 Agent 下一步要做什麼,所以我會提前排隊發送訊息:「執行這個計畫」、「對此執行 Fable 審查」、「現在修復那些東西」。
  • 有時候是 2 則訊息,有時候是 6 則。
  • 絕對不要使用不允許你預先發送訊息的 Harness。

子 Agent 被過度使用了。

  • 很多人只是浪費他們的使用限制在上面。當我能掌控時我才會使用它們。我想選擇哪個模型在子 Agent 中運行,因為我知道我有什麼訂閱和使用限制。
  • 未來是一個管理 Agent 啟動工作 Agent,但你仍然需要設計那個系統:規則、權限、啟動子 Agent 的條件。我不想讓 Anthropic 或 OpenAI 的某個人來幫我決定。

ADRs。

  • 這就是你如何將決策放入程式碼庫的方法。/docs/adr 是我在任何專案中最早建立的資料夾之一。
  • 每個核心架構決策都會有一個簡短的檔案:決定了什麼、為什麼、以及當時專案的狀態。有些事情可以從程式碼中讀取,但不是所有事情。
  • 那些無法讀取的事情應該被記錄下來,這樣未來的 Agent 和人類就能立刻理解為什麼要這樣建構。

測試。

  • 目前的模型會用測試來膨脹你的 repo:單元測試、整合測試、資料庫測試,即使在最不合理的小型 repo 上也是如此。
  • 如果你告訴模型要加入測試,它會加入一個荒謬的數量。如果你告訴它「不要加入測試」,它還是會加入一些,然後你就會得到一個合理的數量。

生產環境資料庫存取。

  • 任何有實際用戶的產品都需要這樣做……建立一個唯讀的 Postgres 角色,並把這個權限給你的 Agent。
  • 不要給它們寫入權限。只要一個不可逆的變更,你就會後悔。
  • 但完全沒有存取權限也是個錯誤。有了唯讀權限,你可以對每個功能進行現實檢查。這個功能在生產環境中真的會發生嗎?人們真的在使用這個功能嗎?我真希望我早點這麼做。

追蹤你的 Agentic 生產力。

  • 我們剛剛在 Vectal Labs 下發佈了一個新的開源 repo,叫做 agentic-productivity。它會追蹤你的 commit、你的 Agent session 以及你的使用者提示。
  • 單獨來看,每個都是糟糕的指標,但將這 3 個結合起來,並觀察長期趨勢,你就可以看到你是否真的成為一個更好的 Agentic Engineer。

這就是目前的配置。一個月後,它很可能會不一樣。這東西一直在變。

作者:David Ondrej(為 YouTube 口述,之後改寫為文章格式)

一鍵儲存

使用 YouMind AI 深度閱讀爆款文章

保存原文、追問細節、總結觀點,並在一個 AI 工作空間裡把爆款文章沉澱成可複用筆記。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章