到目前为止,你用过的每一个 agent 都是打包交付的。运行环境——电脑、登录凭证、记忆、常规任务——以及驱动它的"大脑",都由同一家公司打造并捆绑销售。
10 月 7 日,Grok Bot 把它们拆开了:
https://x.com/elonmusk/status/2107724314451878104
从现在起,SpaceX 会把每项任务路由给最合适的后端模型——而名单上的第一个名字就是 Claude Opus 5.5。SpaceX 留下了运行环境,大脑则换成了 Anthropic 的。
这套组合是目前最强的产品形态:一个拥有自己专属电脑、能在你睡觉时干活的 agent,背后驱动的正是独立多步骤 agentic 评测中排名第一的模型。
这是一份 10 步教程
从理解这次变化开始,到跑起一支由 Opus 驱动的专家团队——它们会互相交接工作,只在需要人类拍板时才把你拉进来。
01. 搞清楚到底发生了什么
一切始于一条帖子。美国时间 10 月 6 日晚,Musk 在 X 上表示,SpaceX 将为每项任务选用最合适的后端模型,并点名了 Claude Opus 5.5、Midjourney 和 Suno。他的结语是:"什么最可能给你最好的结果,就用什么。"
几小时后,Grok Bot 团队的 Lauren(@poteto)把这件事落到了实处:所有 bot 都将由 Opus 5.5 驱动,并且可以生成运行 Cursor 模型的云端 agent。9to5Mac 在 10 月 7 日报道该功能已上线。
https://x.com/claudeai/status/2107894039626277339
为什么要用对手的模型?因为在 agent 真正要干的活上,差距太大了。Artificial Analysis 在同一套运行环境下测试了两家实验室:

有一点需要注意:这里测的是 Grok 4.6,而不是 9 月的 Grok 4.7,两次测试相隔一个月。但 Terminal-Bench 这个分数能预测你能不能把一份"工作"而不只是一个"问题"交给模型——在这个维度上,差距接近 3 倍。
https://x.com/zhuokaiz/status/2102825912471527738
X 上的反应比媒体还快:
10 月 7 日,Grok Bot 把它们拆开了k to the best back-end model - and the first name on the list is Claude Opus 5.5. SpaceX kept the harness. The brain is now Anthropic's.
谁
说了什么
Theo - t3.gg (@theo)
"坏消息兄弟们:Grok Bot 其实真的很好用"——440 万次观看,发于消息公布前几小时。Lauren 第二天回复说,它刚刚变得更好用了。
Lauren (@poteto)
引用转发了 Musk 的帖子,宣布 Grok Bot 即将升级。
Iorel (@Iorel_X)
将其解读为 Grok Bot 向外部模型开放,不再绑定在单一模型上。
02. 安装应用,认识你的"主管"
Grok Bot 是一个 App,不是浏览器标签页。它支持 Mac、iPhone 和 iPad。你可以用 Grok 或 Cursor 账号登录——它不单独售卖,而是与大多数 SuperGrok 和付费 Cursor 套餐捆绑提供。
打开后,你会觉得它更像聊天客户端而不是 chatbot:左侧是命名好的 bot,右侧是对话窗口。每个 bot 都在云端拥有一台自己的电脑。

你不需要切换任何设置就能用上 Opus 5.5。据 Grok Bot 团队介绍,它是所有 bot 的默认模型,也不需要额外订阅 Claude。
先从一个通用型 bot 开始——就叫它"主管"(Chief)。当你还不知道某项任务该交给哪位专家时,就找它。
给它派一件真实的差事,要求结果能在 30 秒内验证。接下来的每一步都是在让它接手更大的活儿——所以先从你能亲自核实的任务开始。
03. 为更强的大脑写一份"岗位说明书"
提示词是请求,而 bot 是角色——它会持续存在、积累记忆,并负责某个领域。所以按岗位给它命名:收件箱管理员、研究负责人、外联销售。

然后像带新员工一样给它做入职说明:它负责什么、做到什么程度算好、哪些地方必须停下来问你。
换成 Opus 5.5 之后有什么变化?以前为默认模型写的说明书都很保守——链路短、频繁汇报——因为那个模型走几步就会卡住。现在有了在多步骤任务上得分高出近 3 倍的大脑,你可以把整件事交出去,而不只是第一步。
Opus 5.5 还支持 100 万 token 上下文窗口,API 最多可输出 12.8 万 token。Grok Bot 具体开放了多少还没公布——但重点是,更长的任务现在跑得动了。
1岗位说明书提示词 —— 专为 Opus 5.5 设计2你是我的研究负责人。34// 你负责什么5给定一个主题,从头到尾跑完整项工作:找到一手资料,6打开你引用的每一个页面,至少在两个来源之间交叉核对数据,7并起草一份 1500 字的简报。89// 怎样才算做好10每个数字旁边都要附上链接。来源有冲突时要标出来,而不是取平均值。11草稿放到我的 Drive 文件夹里,不要发在聊天窗口。1213// 哪里必须停下14绝对不许发布。绝对不许给任何人发邮件。只写草稿。15如果两个来源说法不一且你无法判断,先搁置,来问我。
原则是:大脑越聪明,能接的步骤越多,但权限不会变大。"哪里必须停下"这一段要和以前一样严格。
04. 一次接通工具,划清数据红线

Grok Bot 自带插件面板,支持一键连接:Notion、Slack、Google Drive、AWS Agents、AWS SageMaker、Browserbase、Composio 和 Context7,也支持自定义接入。
连接是账号级别的。只要接通一次 Gmail,你创建的所有 bot 都能用。第五个 bot 几秒钟就能进入工作状态。
新变化在于:你的数据现在有了第二个去向。当 bot 用 Opus 5.5 思考时,它读取的内容会在这一步发给 Anthropic。Tom 在 Musk 帖子下问的"如何退出"还没有答案,SpaceXAI 也没有公布数据共享条款。
你没法选择模型在哪里运行,但可以选择 bot 能碰什么。把这段加进每份说明书里:
1// 数据红线 —— 加到每份说明书里2不要打开、读取或总结以下内容:3 - 我 Drive 里 /Legal 或 /Finance 文件夹中的任何东西4 - 来自我的律师、会计或银行的邮件5 - 包含密码、助记词或 2FA 验证码的任何消息67如果任务需要用到这些,先停下来问我。8处理文档时,只用任务必需的部分。
只连你真正需要的,其余别动。在 beta 阶段,每一次连接都会对所有 bot 开放——而现在,这还意味着不止一家公司能看到。
05. 交出登录态,绝不交出密码
真实公司里的大多数软件既没有 API,也没有 MCP server。这就是 Grok Bot 依然能让它们跑起来的机制。
bot 会在自己的云端浏览器里操作,直到撞上登录墙。这时它会把屏幕交给你。你登录、点完成,bot 就会在同一个浏览器会话里接着刚才的地方继续干。
bot 拿到的是会话,不是密钥。你永远不需要在聊天框里输入凭证——现在既然有第三方模型参与,这一点比以往任何时候都重要。粘贴到对话里的密码,是模型会读到的文本;而在移交的屏幕上完成的登录,则不是。
必须坚持的原则:如果有任何工具让你把密码粘贴到消息里,那就是错误路径。
06. 演示一遍,然后变成常规任务
你可以让 bot 看着你操作一遍,从而教会它一套工作流。它会记住步骤,下次自己执行。

最适合录制的第一条流程应该是:周期性、跨工具、且稳定的——比如你每周都要做、横跨两三个应用、步骤几乎不变的事。用嘴描述很麻烦,演示只要 40 秒。
然后给这条常规任务一个触发理由。两种方式,都用大白话设置——不用拖节点画布,也不用工作流搭建器:
1// 定时任务 —— 晨间简报2每个工作日早上 7 点,查看我的日历、收件箱和3Slack 的 #launches 频道。给我一份简短的晨报:今天有什么安排,4哪些需要回复,昨晚发生了什么变化。56// 触发任务 —— 来信拦截器7只要收到一封来自非联系人域名的邮件,8且内容提到价格,就按模板起草回复并暂存。910// 创建常规任务的快捷方式11每周执行一次。12 ^ 在你刚跑完一个满意的任务后直接这么说就行。
这正是 Opus 5.5 值回票价的地方:当网站改版或输入稍有变化时,常规任务很容易断掉。一个多步骤能力更强的模型,更可能在页面变化后自行恢复,而不是悄悄失败。
07. 招募能生成 Cursor agent 的专家
同时跑几个 bot,每个负责一个领域。分开意味着独立的记忆、独立的上下文,以及出问题时一条清晰的排查线索。SpaceXAI 表示,他们自己的团队就在用 bot 跑销售外联、营销、行政运营和 bug 修复。
按领域拆分,而不是按任务大小拆分。一个只盯着报销单的"费用管理员",很快就会成为处理你报销单的高手。
Grok Bot 团队公告里另一半 quieter 的新能力是:bot 可以生成运行任意 Cursor 模型的云端 agent。这和所有权版图完全吻合——SpaceX 在 8 月以 600 亿美元收购了 Cursor。
于是,编程 bot 变成了管理者。由 Opus 驱动的 bot 负责规划任务和维持上下文,Cursor agents 并行干重活,最后再由 bot 审核返回的结果。
1// 仓库维护员 —— 一个管理 agent 的 bot2你是我的仓库维护员。34当 GitHub 上的 issue 被打上 "bug" 标签时:51. 在你的电脑上复现它,并写一个会失败的测试。62. 生成一个 Cursor 云端 agent,在新分支上修复它。73. 对修复结果跑一遍完整测试套件。84. 开一个 draft PR,附上测试、修复代码和 3 行摘要。910绝对不许合并。绝对不许推送到 main。11如果修复涉及认证、计费或数据库迁移,先搁置等我处理。
其实在公告之前,X 上的用户就已经在这么玩了——9 月底就有人发帖说从 Grok Bot 启动 Cursor 云端 agent。
https://x.com/mikepat711/status/2103551603102126149
08. 把它们拉进群聊
bot 之间可以互发消息,并在话题串里共享上下文。把几个 bot 拉进同一个群聊,它们会自行协作——交接工作、分配职责,只在需要判断时才把你拉进来。
SpaceXAI 自己举的例子是:一个工程 bot 复现 bug、提交工单,再交给第二个 bot 去调试。一个 bot 判断另一个更合适并把任务交出去——这是任何单聊工具都做不到的。
从 9 月底开始,团队还可以发布共享 bot,同事能在 App 或 Slack 里直接使用。
诀窍是给群组一个目标,而不是一份任务清单。任务清单意味着你已经替它们拆解完了。给出目标,让它们自己分工——而拆解正是 Opus 5.5 最擅长的多步骤推理。
1// 给目标,不给任务2目标:在周五下午 5 点前发布 10 月 newsletter。34研究负责人负责事实与来源。5收件箱管理员负责订阅者回复。6主管负责进度把控,并告诉我哪里卡住了。78你们自己分工。任何对外发布的内容先搁置等我确认。
09. 划清审批红线
Grok Bot 的前提是:bot 会把工作从头到尾做完,只在需要你审批时才回来找你。这就把定义"需要审批"的责任交给了你——因为 bot 的默认标准未必和你一致。

有效的红线不在于任务大小,而在于是否可逆。bot 能撤销的事,就让它自己做完;任何会被外界看到、涉及资金流动、或无法撤回的操作,都要先搁置等你处理。
现在这一点比以前更重要,而不是更不重要。更强的大脑会在撞上你的红线之前走得更远——所以红线必须写得明明白白。
1// 这些事永远自己做2起草 · 归档 · 打标签 · 总结 · 调研 · 准备 · 对账3 全都是可逆的。别问,直接做并记录。45// 这些事永远先搁置等我6向公司外部的人发送任何内容7花钱、转账或承诺价格8公开发布任何内容9删除任何不是明显垃圾的东西10接受任何条款或注册任何服务1112// 拿不准的时候13如果你没法在一分钟内撤销,就先搁置,来问我。
每个 bot 都应该追求的状态是:排队 36 份草稿,发出 0 份。所有可逆步骤都做完,在第一个不可逆步骤前硬刹车。
10. 盯紧成本,每周复盘
Opus 5.5 这个大脑可不便宜。在 API 上,它的定价远高于 Grok:

一个小任务——输入 3 万 token、输出 8 千 token——大概是 28 美分对 11 美分。但在超长上下文场景下顺序会反转,因为 Grok 超过 20 万 token 后费率翻倍,而 Opus 保持不变。
在 Grok Bot 里你不是按 token 付费——它包含在你的套餐里。悬而未决的问题,也就是 Adam Hincu 在 X 上问的那个:Opus 驱动的任务会不会更快烧完套餐额度?SpaceXAI 还没回应。所以在增加常规任务之前,先观察一周的用量。

而且并非所有宣布的功能都已上线。Midjourney 和 Suno 还没有时间表,至少有一位用户的 bot 在第一天表示 Suno 不可用。先把东西建在 Opus 5.5 上——这是确定的。其他的再等等。
然后每周在日历上留出 15 分钟,让 bot 们自我汇报:
1列出你这周跑过的每一条常规任务。针对每条:23 - 触发了多少次4 - 产出了什么5 - 有哪些被跳过、失败或只能靠猜6 - 有哪些你搁置等我处理但我一直没回复的78然后告诉我哪一条最没用,为什么。9如果你分不清某一步是哪个模型处理的,也要说出来。
每条常规任务手动抽查一个产出。让 bot 给自己的作业打分,盲区和你自己改是一样的。
结论:运行环境才是产品
过去三年,大家争论的都是哪个模型最好。而这周,市场上最激进的模型厂商回答了另一个问题:哪个运行环境最好——然后把对手的大脑装了进去。
这就是转变所在。运行环境掌控着电脑、登录凭证、记忆和常规任务。底层的大脑是可替换的,而就目前而言,做 agent 任务最强的大脑是 Opus 5.5。
你的工作没变。你要决定委派什么、bot 的权限边界在哪、以及它能碰哪些数据。把这三点都写进说明书里——然后让市场上最强的大脑去点鼠标吧。





