YouMind
登入

Grok Bot + Opus 5.5:打造終極 Agent Harness 的 10 個步驟

@0xMorlex
英語2026年10月08日
102K
664
64
31
1.2K

TL;DR

一份全面的教學指南,教你如何利用 Grok Bot 與 Claude Opus 5.5 的新整合功能,建立強大的自主 AI Agent 系統以實現商業自動化。

到目前為止,你用過的每一個 Agent 都是一整套打包好的。外殼(電腦、登入資訊、記憶、例行任務)和驅動它的大腦,都是由同一家公司打造並綁在一起販售的。

10 月 7 日,Grok Bot 把它們拆開了:

https://x.com/elonmusk/status/2107724314451878104

從現在起,SpaceX 會把每一項任務導向最強的後端模型——而名單上的第一個就是 Claude Opus 5.5。SpaceX 留下了外殼,大腦則換成了 Anthropic 的。

這個組合是目前為止最強的產品版本:一個擁有自己電腦、能在你睡覺時工作的 Agent,由在多步驟 Agent 工作獨立基準測試中領先的模型所驅動。

這是 10 步驟教學

從理解這次變動開始,到實際跑起一組由 Opus 驅動的專家團隊——它們會把工作互相交接,只在需要真人判斷的時候才把你拉進來。

01. 搞懂剛剛發生了什麼事

一切始於一篇貼文。美國時間 10 月 6 日深夜,Musk 在 X 上表示 SpaceX 會針對不同任務使用最強的後端模型,並點名了 Claude Opus 5.5、Midjourney 和 Suno。他的結語是:「哪個最有可能給你最好的結果,就用哪個。」

幾小時後,Grok Bot 團隊的 Lauren(@poteto)把這件事說得更具體:所有 bot 都會由 Opus 5.5 驅動,而且它們能生成運行 Cursor 模型的雲端 Agent。9to5Mac 也在 10 月 7 日即時報導了這項消息。

https://x.com/claudeai/status/2107894039626277339

為什麼要用對手的模型?因為在 Agent 真正要做的工作上,差距太大了。Artificial Analysis 用同一套外殼測試了兩家實驗室:

Morlex - inline image

有一點要注意:那是 Grok 4.6,不是 9 月的 Grok 4.7,而且兩者測試時間相差一個月。但 Terminal-Bench 的分數能預測你是否可以把一份「工作」而不是一個「問題」丟給模型——而在這方面,差距將近 3 倍。

https://x.com/zhuokaiz/status/2102825912471527738

X 上的反應比媒體還快:

10 月 7 日,Grok Bot 把它們拆開了,將任務導向最強的後端模型——而名單上的第一個就是 Claude Opus 5.5。SpaceX 留下了外殼,大腦則換成了 Anthropic 的。

誰

說了什麼

Theo - t3.gg (@theo)

「各位壞消息:Grok Bot 其實真的很好用」——440 萬次觀看,發布於新聞曝光前幾小時。Lauren 隔天回覆說它剛變得更好用了。

Lauren (@poteto)

引用轉發 Musk 的貼文,宣布 Grok Bot 即將升級。

Iorel (@Iorel_X)

把這件事解讀為 Grok Bot 向外開放其他模型,而不是死守自家的那一個。

02. 安裝它,認識你的「主管」

Grok Bot 是一個 App,不是瀏覽器分頁。它可以在 Mac、iPhone 和 iPad 上運行。你可以用 Grok 或 Cursor 帳號登入——它不單獨販售,而是與大多數 SuperGrok 和付費 Cursor 方案綁在一起。

你看到的介面比較像通訊軟體,而不是聊天機器人:左邊是有名字的 bot,右邊是對話。每個 bot 在雲端都有自己的電腦。

Morlex - inline image

你不需要切換任何設定就能用到 Opus 5.5。根據 Grok Bot 團隊的說法,它是每個 bot 的預設模型,也不需要另外訂閱 Claude。

先從一個通用型 bot 開始——就叫它「主管」。當你還不知道該把任務交給哪位專家時,就找它。

給它一件真正的差事,而且是三十秒內就能確認結果的那種。接下來每一步都是關於把更大的工作交給它——所以先從你能驗證的事情開始。

03. 為更強的大腦寫一份職責說明書

提示詞是請求;bot 是角色——它會持續存在、累積記憶,並負責某個領域。所以用職位來命名它:收件匣管理員、研究主管、業務開發。

Morlex - inline image

然後像帶新人一樣交代清楚:它負責什麼、做到什麼程度算好、以及在哪裡必須停下來問你。

以下是 Opus 5.5 帶來的改變。過去為舊版預設模型寫的職責說明書都很保守——鏈條短、頻繁回報——因為模型走幾步就會卡住。現在有了一個在多步驟工作上分數高出近 3 倍的大腦,你可以把整件工作交出去,而不只是第一步。

Opus 5.5 也支援 100 萬 token 的上下文窗口,API 上最多可輸出 128K token。Grok Bot 實際開放了多少並沒有公布——但重點是,現在可以處理更長的工作了。

python
1職責說明書提示詞 —— 專為 Opus 5.5 設計
2你是我的研究主管。
3
4// 你負責什麼
5拿到一個主題後,從頭到尾完成整件工作:找到第一手資料、
6打開你引用的每一個網頁、至少在兩個來源之間交叉比對數字,
7並草擬一份 1,500 字的簡報。
8
9// 怎樣才算做好
10每個數字旁邊都要附上連結。來源互相矛盾時要標記出來,
11而不是取平均值。草稿要放進我的 Drive 資料夾,不要放在聊天室。
12
13// 你在哪裡必須停下來
14絕對不能發布。絕對不能寄信給任何人。只能寫草稿。
15如果兩個來源說法不一而你無法解決,就先擱置並問我。

原則是:更聰明的大腦可以接手更多步驟,但不能擁有更大權限。「你在哪裡必須停下來」這段規定,要和以前一樣嚴格。

04. 串接工具一次就好——並畫出資料界線

Morlex - inline image

Grok Bot 內建外掛面板,支援一鍵串接:Notion、Slack、Google Drive、AWS Agents、AWS SageMaker、Browserbase、Composio 和 Context7,還有自訂選項。

串接是帳號層級的。只要連上一次 Gmail,你建立的每個 bot 都能用。你的第五個 bot 幾秒內就能開始幹活。

新的部分是:你的資料現在有了第二個去處。當 bot 用 Opus 5.5 思考時,它讀取的內容會在那一步傳給 Anthropic。Tom 在 Musk 貼文下提出的退出(opt-out)問題目前還沒有答案,SpaceXAI 也沒有公布哪些資料會被分享的條款。

你無法選擇模型在哪裡運行,但你可以決定 bot 能碰什麼。把這段加進每份職責說明書:

python
1// 資料界線 —— 加進每份職責說明書
2不要開啟、讀取或摘要以下內容:
3 - 我 Drive 中 /Legal 或 /Finance 資料夾裡的任何東西
4 - 來自我的律師、會計師或銀行的信件
5 - 任何包含密碼、助記詞或 2FA 驗證碼的訊息
6
7如果某項任務需要用到這些,先停下來問我。
8處理文件時,只使用該任務需要的部分。

只串接你真正需要的,其他的別動。在測試階段,每一次串接都會被所有 bot 存取——而現在還會跨到不只一家公司。

05. 交出登入狀態,絕不交出密碼

真實企業內部的多數軟體沒有 API,也沒有 MCP server。這就是 Grok Bot 依然能搞定它們的機制。

bot 會操作自己的雲端瀏覽器,直到撞上登入牆。這時它會把畫面交給你。你登入、按下完成,bot 就會在同一個瀏覽器 session 中斷的地方繼續。

bot 拿到的是 session,不是機密。你永遠不需要在聊天室裡輸入帳密——現在既然有第三方模型參與其中,這件事比以往更重要。貼進對話裡的密碼,是模型會讀到的文字;但在移交畫面上完成的登入,則不會。

一定要堅持的原則:如果有任何工具要求你把密碼貼進訊息裡,那就是錯誤的做法。

06. 示範一次,然後變成例行任務

你可以透過親自做一遍讓 bot 看著學,來教會它一套工作流程。它會記住步驟,下次自己執行。

Morlex - inline image

最適合第一次錄製的任務,要具備重複性、跨工具且穩定:你每週都會做、橫跨兩個以上 App、步驟幾乎不變的事。用講的很麻煩,但示範只要四十秒。

接著給這個例行任務一個觸發條件。有兩種方式,都用白話設定——不用節點畫布,也不用工作流程編輯器:

python
1// 排程 —— 晨間簡報
2每個工作日早上 7 點,檢查我的行事曆、收件匣,
3以及 Slack 的 #launches 頻道。給我一份簡短報告:今天有什麼事、
4哪些需要回覆、昨晚有什麼變動。
5
6// 觸發條件 —— 來信攔截器
7只要收到不在聯絡人清單中的網域寄來的信,
8而且內容提到價格,就套用範本擬一封回信並先擱置。
9
10// 建立最多例行任務的快捷指令
11每週執行一次。
12 ^ 在你剛完成一項滿意的任務後直接這樣說。

Opus 5.5 的價值就在這裡:當網站改版或輸入格式稍有不同時,例行任務就會失敗。在多步驟工作上更強的模型,更有機會在頁面變動時自行恢復,而不是悄悄出錯。

07. 聘請能生成 Cursor Agent 的專家

同時運行多個 bot,各自負責一個領域。分開的 bot 代表獨立的記憶、獨立的上下文,以及出錯時方便追查的乾淨對話串。SpaceXAI 表示,他們自己的團隊就跑了負責業務開發、行銷、辦公室營運和修 bug 的 bot。

按領域拆分,而不是按任務大小。一個只專注在收據的費用管理員,會越來越懂你的收據。

新加入的這一層,是 Grok Bot 團隊公告中比較低調的部分:bot 可以生成運行任何 Cursor 模型的雲端 Agent。這也符合所有權佈局——SpaceX 在 8 月以 600 億美元收購了 Cursor。

於是,寫程式的 bot 變成了管理者。由 Opus 驅動的 bot 負責規劃工作和掌握上下文,Cursor Agents 平行處理繁重的工作,最後再由 bot 審核結果。

python
1// Repo Maintainer —— 管理 Agent 的 bot
2你是我的 Repo Maintainer。
3
4當 GitHub 上的 issue 被標記為 "bug" 時:
51. 在你的電腦上重現它,並寫一個會失敗的測試。
62. 生成一個 Cursor 雲端 Agent,在新分支上修復它。
73. 對結果執行完整測試套件。
84. 開一個 draft PR,附上測試、修正內容和 3 行摘要。
9
10絕對不能合併。絕對不能推送到 main。
11如果修正涉及 auth、計費或 migration,先擱置等我處理。

X 上的使用者在公告前就已經在做類似的事了——9 月底就有人發文分享如何從 Grok Bot 生成 Cursor 雲端 Agent

https://x.com/mikepat711/status/2103551603102126149

08. 把它們拉進群組

bot 之間可以互相傳訊息,並在討論串中共享上下文。把幾個 bot 放進同一個群組,它們會自行協調——交接工作、分配責任,只在需要判斷時才把你拉進來。

SpaceXAI 自己的例子:一個工程 bot 重現 bug、開 ticket,再交給第二個 bot 除錯。一個 bot 判斷另一個更適合、並把工作交出去——這是任何單人對話工具都做不到的事。

從 9 月底開始,團隊也可以發布共享 bot,讓同事在 App 內或 Slack 中使用。

訣竅是給群組一個目標,而不是一份待辦清單。待辦清單代表你已經把工作拆解完了;目標則讓它們自己分工——而拆解正是 Opus 5.5 最擅長的多步驟推理。

python
1// 給目標,不是給任務
2目標:在週五下午 5 點前發布 10 月電子報。
3
4研究主管負責事實與來源。
5收件匣管理員負責訂閱者回覆。
6主管負責時程,並告訴我哪些地方卡住了。
7
8你們自己分工。任何對外公開的東西都先擱置等我處理。

09. 畫出核准界線

Grok Bot 的前提是:bot 會從頭到尾完成工作,只有在需要你核准時才回來找你。這意味著定義「需要核准」的責任落在你身上——因為 bot 的預設標準可能跟你想的不一樣。

Morlex - inline image

有效的界線不在於任務大小,而在於可逆性。bot 能復原的事,就讓它自己做完;任何外界會看到、會動到錢、或無法收回的事,都要先擱置等你處理。

這一點現在比以前更重要,而不是更不重要。更強的大腦會在碰到你的界線之前推進得更遠——所以界線必須寫得清清楚楚。

python
1// 這些一律自己做完
2草擬 · 歸檔 · 標記 · 摘要 · 研究 · 準備 · 核對
3 全都是可逆的。不要問,直接做並記錄下來。
4
5// 這些一律先擱置等我處理
6寄任何東西給公司外部的人
7花錢、轉帳或承諾價格
8發布任何公開內容
9刪除任何不是明顯垃圾的東西
10同意任何條款或註冊任何服務
11
12// 不確定的時候
13如果你無法在一分鐘內復原,就先擱置並問我。

每個 bot 都該追求的狀態:36 份草稿排隊等著,0 封已寄出。所有可逆步驟都完成了,在第一個不可逆的動作前硬生生停下來。

10. 盯緊成本,每週檢視

Opus 5.5 不是便宜的大腦。在 API 上,它的定價遠高於 Grok:

Morlex - inline image

以一個小任務為例——輸入 30K token、輸出 8K token——大約是 28 美分對上 11 美分。但在超長上下文的情況下順序會反過來,因為 Grok 超過 200K token 後費率會翻倍,而 Opus 維持不變。

在 Grok Bot 裡你不是按 token 付費——它包含在你的方案中。真正的疑問,也就是 Adam Hincu 在 X 上提出的:由 Opus 驅動的任務是否會更快燒完方案額度?SpaceXAI 還沒回應。所以在加入例行任務之前,先觀察第一週的使用量。

Morlex - inline image

而且不是所有公布的東西都上線了。Midjourney 和 Suno 還沒有日期,至少有一位使用者的 bot 表示第一天還不能用 Suno。先把基礎建立在 Opus 5.5 上——這是確定的。其他的再等等。

接著在行事曆上每週保留十五分鐘,讓 bot 自我報告:

python
1列出你這週執行的每一個例行任務。針對每一個:
2
3 - 觸發了幾次
4 - 產出了什麼
5 - 有哪些跳過、失敗或只能猜測的地方
6 - 有哪些你先擱置等我處理,但我一直沒回覆的
7
8然後告訴我哪一個最沒用,以及為什麼。
9如果你分不清某個步驟是哪個模型處理的,也要說。

每個例行任務都要人工抽查一份產出。讓 bot 自己評分自己的工作,會有跟你一樣的盲點。

結論:外殼才是產品

三年來,大家的問題一直是哪個模型最強。這週,市場上最激進的模型建造商回答了另一個問題:哪個外殼最強——然後把對手的大腦裝了進去。

這就是轉變。外殼掌握了電腦、登入資訊、記憶和例行任務。底層的大腦是可替換的,而目前做 Agent 工作最強的,就是 Opus 5.5。

你的工作沒有變。你要決定委派什麼、bot 的權限到哪裡為止、以及它能碰哪些資料。把這三件事都寫進職責說明書——然後讓市場上最強大腦去點擊操作。

一鍵儲存

使用 YouMind AI 深度閱讀爆款文章

保存原文、追問細節、總結觀點,並在一個 AI 工作空間裡把爆款文章沉澱成可複用筆記。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章