YouMind
登录

Grok Bot + Opus 5.5:10 步打造终极 Agent Harness

@0xMorlex
英语2026年10月08日
102K
664
64
31
1.2K

TL;DR

本教程全面讲解如何利用 Grok Bot 与 Claude Opus 5.5 的新集成,构建强大的自主 AI Agent 系统,实现业务自动化。

到目前为止,你用过的每一个 agent 都是打包交付的。运行环境——电脑、登录凭证、记忆、常规任务——以及驱动它的"大脑",都由同一家公司打造并捆绑销售。

10 月 7 日,Grok Bot 把它们拆开了:

https://x.com/elonmusk/status/2107724314451878104

从现在起,SpaceX 会把每项任务路由给最合适的后端模型——而名单上的第一个名字就是 Claude Opus 5.5。SpaceX 留下了运行环境,大脑则换成了 Anthropic 的。

这套组合是目前最强的产品形态:一个拥有自己专属电脑、能在你睡觉时干活的 agent,背后驱动的正是独立多步骤 agentic 评测中排名第一的模型。

这是一份 10 步教程

从理解这次变化开始,到跑起一支由 Opus 驱动的专家团队——它们会互相交接工作,只在需要人类拍板时才把你拉进来。

01. 搞清楚到底发生了什么

一切始于一条帖子。美国时间 10 月 6 日晚,Musk 在 X 上表示,SpaceX 将为每项任务选用最合适的后端模型,并点名了 Claude Opus 5.5、Midjourney 和 Suno。他的结语是:"什么最可能给你最好的结果,就用什么。"

几小时后,Grok Bot 团队的 Lauren(@poteto)把这件事落到了实处:所有 bot 都将由 Opus 5.5 驱动,并且可以生成运行 Cursor 模型的云端 agent。9to5Mac 在 10 月 7 日报道该功能已上线。

https://x.com/claudeai/status/2107894039626277339

为什么要用对手的模型?因为在 agent 真正要干的活上,差距太大了。Artificial Analysis 在同一套运行环境下测试了两家实验室:

Morlex - inline image

有一点需要注意:这里测的是 Grok 4.6,而不是 9 月的 Grok 4.7,两次测试相隔一个月。但 Terminal-Bench 这个分数能预测你能不能把一份"工作"而不只是一个"问题"交给模型——在这个维度上,差距接近 3 倍。

https://x.com/zhuokaiz/status/2102825912471527738

X 上的反应比媒体还快:

10 月 7 日,Grok Bot 把它们拆开了k to the best back-end model - and the first name on the list is Claude Opus 5.5. SpaceX kept the harness. The brain is now Anthropic's.

谁

说了什么

Theo - t3.gg (@theo)

"坏消息兄弟们:Grok Bot 其实真的很好用"——440 万次观看,发于消息公布前几小时。Lauren 第二天回复说,它刚刚变得更好用了。

Lauren (@poteto)

引用转发了 Musk 的帖子,宣布 Grok Bot 即将升级。

Iorel (@Iorel_X)

将其解读为 Grok Bot 向外部模型开放,不再绑定在单一模型上。

02. 安装应用,认识你的"主管"

Grok Bot 是一个 App,不是浏览器标签页。它支持 Mac、iPhone 和 iPad。你可以用 Grok 或 Cursor 账号登录——它不单独售卖,而是与大多数 SuperGrok 和付费 Cursor 套餐捆绑提供。

打开后,你会觉得它更像聊天客户端而不是 chatbot:左侧是命名好的 bot,右侧是对话窗口。每个 bot 都在云端拥有一台自己的电脑。

Morlex - inline image

你不需要切换任何设置就能用上 Opus 5.5。据 Grok Bot 团队介绍,它是所有 bot 的默认模型,也不需要额外订阅 Claude。

先从一个通用型 bot 开始——就叫它"主管"(Chief)。当你还不知道某项任务该交给哪位专家时,就找它。

给它派一件真实的差事,要求结果能在 30 秒内验证。接下来的每一步都是在让它接手更大的活儿——所以先从你能亲自核实的任务开始。

03. 为更强的大脑写一份"岗位说明书"

提示词是请求,而 bot 是角色——它会持续存在、积累记忆,并负责某个领域。所以按岗位给它命名:收件箱管理员、研究负责人、外联销售。

Morlex - inline image

然后像带新员工一样给它做入职说明:它负责什么、做到什么程度算好、哪些地方必须停下来问你。

换成 Opus 5.5 之后有什么变化?以前为默认模型写的说明书都很保守——链路短、频繁汇报——因为那个模型走几步就会卡住。现在有了在多步骤任务上得分高出近 3 倍的大脑,你可以把整件事交出去,而不只是第一步。

Opus 5.5 还支持 100 万 token 上下文窗口,API 最多可输出 12.8 万 token。Grok Bot 具体开放了多少还没公布——但重点是,更长的任务现在跑得动了。

python
1岗位说明书提示词 —— 专为 Opus 5.5 设计
2你是我的研究负责人。
3
4// 你负责什么
5给定一个主题,从头到尾跑完整项工作:找到一手资料,
6打开你引用的每一个页面,至少在两个来源之间交叉核对数据,
7并起草一份 1500 字的简报。
8
9// 怎样才算做好
10每个数字旁边都要附上链接。来源有冲突时要标出来,而不是取平均值。
11草稿放到我的 Drive 文件夹里,不要发在聊天窗口。
12
13// 哪里必须停下
14绝对不许发布。绝对不许给任何人发邮件。只写草稿。
15如果两个来源说法不一且你无法判断,先搁置,来问我。

原则是:大脑越聪明,能接的步骤越多,但权限不会变大。"哪里必须停下"这一段要和以前一样严格。

04. 一次接通工具,划清数据红线

Morlex - inline image

Grok Bot 自带插件面板,支持一键连接:Notion、Slack、Google Drive、AWS Agents、AWS SageMaker、Browserbase、Composio 和 Context7,也支持自定义接入。

连接是账号级别的。只要接通一次 Gmail,你创建的所有 bot 都能用。第五个 bot 几秒钟就能进入工作状态。

新变化在于:你的数据现在有了第二个去向。当 bot 用 Opus 5.5 思考时,它读取的内容会在这一步发给 Anthropic。Tom 在 Musk 帖子下问的"如何退出"还没有答案,SpaceXAI 也没有公布数据共享条款。

你没法选择模型在哪里运行,但可以选择 bot 能碰什么。把这段加进每份说明书里:

python
1// 数据红线 —— 加到每份说明书里
2不要打开、读取或总结以下内容:
3 - 我 Drive 里 /Legal 或 /Finance 文件夹中的任何东西
4 - 来自我的律师、会计或银行的邮件
5 - 包含密码、助记词或 2FA 验证码的任何消息
6
7如果任务需要用到这些,先停下来问我。
8处理文档时,只用任务必需的部分。

只连你真正需要的,其余别动。在 beta 阶段,每一次连接都会对所有 bot 开放——而现在,这还意味着不止一家公司能看到。

05. 交出登录态,绝不交出密码

真实公司里的大多数软件既没有 API,也没有 MCP server。这就是 Grok Bot 依然能让它们跑起来的机制。

bot 会在自己的云端浏览器里操作,直到撞上登录墙。这时它会把屏幕交给你。你登录、点完成,bot 就会在同一个浏览器会话里接着刚才的地方继续干。

bot 拿到的是会话,不是密钥。你永远不需要在聊天框里输入凭证——现在既然有第三方模型参与,这一点比以往任何时候都重要。粘贴到对话里的密码,是模型会读到的文本;而在移交的屏幕上完成的登录,则不是。

必须坚持的原则:如果有任何工具让你把密码粘贴到消息里,那就是错误路径。

06. 演示一遍,然后变成常规任务

你可以让 bot 看着你操作一遍,从而教会它一套工作流。它会记住步骤,下次自己执行。

Morlex - inline image

最适合录制的第一条流程应该是:周期性、跨工具、且稳定的——比如你每周都要做、横跨两三个应用、步骤几乎不变的事。用嘴描述很麻烦,演示只要 40 秒。

然后给这条常规任务一个触发理由。两种方式,都用大白话设置——不用拖节点画布,也不用工作流搭建器:

python
1// 定时任务 —— 晨间简报
2每个工作日早上 7 点,查看我的日历、收件箱和
3Slack 的 #launches 频道。给我一份简短的晨报:今天有什么安排,
4哪些需要回复,昨晚发生了什么变化。
5
6// 触发任务 —— 来信拦截器
7只要收到一封来自非联系人域名的邮件,
8且内容提到价格,就按模板起草回复并暂存。
9
10// 创建常规任务的快捷方式
11每周执行一次。
12 ^ 在你刚跑完一个满意的任务后直接这么说就行。

这正是 Opus 5.5 值回票价的地方:当网站改版或输入稍有变化时,常规任务很容易断掉。一个多步骤能力更强的模型,更可能在页面变化后自行恢复,而不是悄悄失败。

07. 招募能生成 Cursor agent 的专家

同时跑几个 bot,每个负责一个领域。分开意味着独立的记忆、独立的上下文,以及出问题时一条清晰的排查线索。SpaceXAI 表示,他们自己的团队就在用 bot 跑销售外联、营销、行政运营和 bug 修复。

按领域拆分,而不是按任务大小拆分。一个只盯着报销单的"费用管理员",很快就会成为处理你报销单的高手。

Grok Bot 团队公告里另一半 quieter 的新能力是:bot 可以生成运行任意 Cursor 模型的云端 agent。这和所有权版图完全吻合——SpaceX 在 8 月以 600 亿美元收购了 Cursor。

于是,编程 bot 变成了管理者。由 Opus 驱动的 bot 负责规划任务和维持上下文,Cursor agents 并行干重活,最后再由 bot 审核返回的结果。

python
1// 仓库维护员 —— 一个管理 agent 的 bot
2你是我的仓库维护员。
3
4当 GitHub 上的 issue 被打上 "bug" 标签时:
51. 在你的电脑上复现它,并写一个会失败的测试。
62. 生成一个 Cursor 云端 agent,在新分支上修复它。
73. 对修复结果跑一遍完整测试套件。
84. 开一个 draft PR,附上测试、修复代码和 3 行摘要。
9
10绝对不许合并。绝对不许推送到 main。
11如果修复涉及认证、计费或数据库迁移,先搁置等我处理。

其实在公告之前,X 上的用户就已经在这么玩了——9 月底就有人发帖说从 Grok Bot 启动 Cursor 云端 agent。

https://x.com/mikepat711/status/2103551603102126149

08. 把它们拉进群聊

bot 之间可以互发消息,并在话题串里共享上下文。把几个 bot 拉进同一个群聊,它们会自行协作——交接工作、分配职责,只在需要判断时才把你拉进来。

SpaceXAI 自己举的例子是:一个工程 bot 复现 bug、提交工单,再交给第二个 bot 去调试。一个 bot 判断另一个更合适并把任务交出去——这是任何单聊工具都做不到的。

从 9 月底开始,团队还可以发布共享 bot,同事能在 App 或 Slack 里直接使用。

诀窍是给群组一个目标,而不是一份任务清单。任务清单意味着你已经替它们拆解完了。给出目标,让它们自己分工——而拆解正是 Opus 5.5 最擅长的多步骤推理。

python
1// 给目标,不给任务
2目标:在周五下午 5 点前发布 10 月 newsletter。
3
4研究负责人负责事实与来源。
5收件箱管理员负责订阅者回复。
6主管负责进度把控,并告诉我哪里卡住了。
7
8你们自己分工。任何对外发布的内容先搁置等我确认。

09. 划清审批红线

Grok Bot 的前提是:bot 会把工作从头到尾做完,只在需要你审批时才回来找你。这就把定义"需要审批"的责任交给了你——因为 bot 的默认标准未必和你一致。

Morlex - inline image

有效的红线不在于任务大小,而在于是否可逆。bot 能撤销的事,就让它自己做完;任何会被外界看到、涉及资金流动、或无法撤回的操作,都要先搁置等你处理。

现在这一点比以前更重要,而不是更不重要。更强的大脑会在撞上你的红线之前走得更远——所以红线必须写得明明白白。

python
1// 这些事永远自己做
2起草 · 归档 · 打标签 · 总结 · 调研 · 准备 · 对账
3 全都是可逆的。别问,直接做并记录。
4
5// 这些事永远先搁置等我
6向公司外部的人发送任何内容
7花钱、转账或承诺价格
8公开发布任何内容
9删除任何不是明显垃圾的东西
10接受任何条款或注册任何服务
11
12// 拿不准的时候
13如果你没法在一分钟内撤销,就先搁置,来问我。

每个 bot 都应该追求的状态是:排队 36 份草稿,发出 0 份。所有可逆步骤都做完,在第一个不可逆步骤前硬刹车。

10. 盯紧成本,每周复盘

Opus 5.5 这个大脑可不便宜。在 API 上,它的定价远高于 Grok:

Morlex - inline image

一个小任务——输入 3 万 token、输出 8 千 token——大概是 28 美分对 11 美分。但在超长上下文场景下顺序会反转,因为 Grok 超过 20 万 token 后费率翻倍,而 Opus 保持不变。

在 Grok Bot 里你不是按 token 付费——它包含在你的套餐里。悬而未决的问题,也就是 Adam Hincu 在 X 上问的那个:Opus 驱动的任务会不会更快烧完套餐额度?SpaceXAI 还没回应。所以在增加常规任务之前,先观察一周的用量。

Morlex - inline image

而且并非所有宣布的功能都已上线。Midjourney 和 Suno 还没有时间表,至少有一位用户的 bot 在第一天表示 Suno 不可用。先把东西建在 Opus 5.5 上——这是确定的。其他的再等等。

然后每周在日历上留出 15 分钟,让 bot 们自我汇报:

python
1列出你这周跑过的每一条常规任务。针对每条:
2
3 - 触发了多少次
4 - 产出了什么
5 - 有哪些被跳过、失败或只能靠猜
6 - 有哪些你搁置等我处理但我一直没回复的
7
8然后告诉我哪一条最没用,为什么。
9如果你分不清某一步是哪个模型处理的,也要说出来。

每条常规任务手动抽查一个产出。让 bot 给自己的作业打分,盲区和你自己改是一样的。

结论:运行环境才是产品

过去三年,大家争论的都是哪个模型最好。而这周,市场上最激进的模型厂商回答了另一个问题:哪个运行环境最好——然后把对手的大脑装了进去。

这就是转变所在。运行环境掌控着电脑、登录凭证、记忆和常规任务。底层的大脑是可替换的,而就目前而言,做 agent 任务最强的大脑是 Opus 5.5。

你的工作没变。你要决定委派什么、bot 的权限边界在哪、以及它能碰哪些数据。把这三点都写进说明书里——然后让市场上最强的大脑去点鼠标吧。

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章