これまで使ってきたエージェントは、すべて 1 つのパッケージとして提供されてきた。ハーネス(コンピューター、ログイン情報、メモリ、ルーティン)と、それを動かす頭脳は同じ企業が作り、セットで販売されていた。
10 月 7 日、Grok Bot はこれを分離した:
https://x.com/elonmusk/status/2107724314451878104
今後は、SpaceX がすべてのタスクを最適なバックエンドモデルに振り分ける。そしてリストの筆頭にあるのが Claude Opus 5.5 だ。ハーネスは SpaceX が保持し、頭脳は Anthropic のものになった。
この組み合わせは、現時点で最も強力なプロダクトの形だ。自分専用のコンピューターを持ち、あなたが寝ている間も働くエージェントを、マルチステップのエージェント作業に関する独立ベンチマークで首位を走るモデルが駆動する。
これが 10 ステップのチュートリアルだ
何が変わったのかを理解するところから始め、Opus を搭載したスペシャリストたちが互いに作業を引き継ぎ合うチームを動かし、人間の判断が必要なときだけあなたを呼び出す仕組みを作る。
01. 何が起きたのかを理解する
きっかけは 1 つの投稿だった。米国時間の 10 月 6 日深夜、Musk は X で「SpaceX はあらゆるタスクに最適なバックエンドモデルを使う」と宣言し、Claude Opus 5.5、Midjourney、Suno の名を挙げた。締めくくりの言葉はこうだ。「最も良い結果を出せるものを選ぶ」。
数時間後、Grok Bot チームの Lauren(@poteto)が具体的な内容を明かした。すべてのボットが Opus 5.5 で駆動され、Cursor のモデルを実行するクラウドエージェントを生成できるようになるという。9to5Mac も 10 月 7 日時点で稼働中だと報じた。
https://x.com/claudeai/status/2107894039626277339
なぜ競合のモデルなのか? エージェントが実際にこなす作業において、その差は大きいからだ。Artificial Analysis は両方のラボを同じハーネスで測定した。

注意点がある。これは 9 月の Grok 4.7 ではなく Grok 4.6 のデータであり、測定時期には 1 か月のズレがある。しかし Terminal-Bench のスコアこそ、「質問」ではなく「仕事」をモデルに丸投げできるかどうかを予測する指標であり、そこでの差は約 3 倍にもなる。
https://x.com/zhuokaiz/status/2102825912471527738
メディアより先に、X 上で反応が広がった。
10 月 7 日、Grok Bot はこれらを分離した。 最適なバックエンドモデルへ振り分けられ、リストの筆頭は Claude Opus 5.5 だ。ハーネスは SpaceX が保持し、頭脳は Anthropic のものになった。
誰が
何を言ったか
Theo - t3.gg(@theo)
「みんな、悪い知らせだ。Grok Bot は実はかなり優秀だよ」——ニュースが出る数時間前に投稿され、440 万回表示された。翌日、Lauren は「さらに良くなったばかりだ」と返信している。
Lauren(@poteto)
Musk の投稿を引用し、Grok Bot がアップグレードされることを発表した。
Iorel(@Iorel_X)
1 つのモデルに縛られず、外部モデルへと開かれた出来事として紹介した。
02. インストールして「Chief」に出会う
Grok Bot はブラウザのタブではなくアプリだ。Mac、iPhone、iPad で動作する。Grok または Cursor のアカウントでサインインする。単体販売はされておらず、ほとんどの SuperGrok および有料 Cursor プランにバンドルされている。
起動すると、チャットボットというよりメッセージングクライアントに近い画面が広がる。左側に名前付きのボット、右側に会話スレッド。各ボットにはクラウド上に専用のコンピューターが割り当てられる。

Opus 5.5 を使うために設定を切り替える必要はない。Grok Bot チームによれば、すべてのボットのデフォルトになっている。別途 Claude のサブスクリプションを契約する必要もない。
まずは汎用ボットを 1 つ作ろう。ここでは「Chief(責任者)」と呼ぶ。どのスペシャリストに任せるべきかまだ分からないときに、最初に話しかける相手だ。
30 秒で結果を確認できる、実際のちょっとした用事を任せてみよう。ここからのステップは、より大きな仕事を信頼して任せていく過程なので、まずは自分で検証できるタスクから始めること。
03. より強力な頭脳のための「憲章」を書く
プロンプトはリクエストだ。しかしボットは「役割」である。持続的に存在し、記憶を蓄積し、特定の領域を受け持つ。だから「受信トレイマネージャー」「リサーチャー」「営業アウトバウンド」のように、職務名をつけよう。

次に、新入社員に指示を出すようにブリーフィングを行う。何を担当するのか、ゴールの基準は何か、どこで止まって確認すべきか。
Opus 5.5 で何が変わるのか。以前のデフォルト向けに書かれた憲章は防御的だった。数ステップでモデルが止まってしまうため、短い手順と頻繁な確認が必要だったのだ。マルチステップ作業のスコアが約 3 倍高い頭脳なら、最初の 1 ステップだけでなく、仕事全体を任せられる。
Opus 5.5 は 100 万トークンのコンテキストウィンドウと、API 上で最大 12.8 万トークンの出力をサポートする。Grok Bot がそのうちどれくらいを開放しているかは公表されていないが、より長い作業を任せられるようになったことが重要だ。
1Opus 5.5 向けに設計した憲章プロンプト2あなたは私のリサーチリードです。34// 担当範囲5テーマを与えたら、最初から最後まで一貫して実行してください。一次資料を探し、6引用するページをすべて開き、少なくとも 2 つのソースで数字を突き合わせ、71,500 語のブリーフを作成します。89// ゴールの基準10すべての数字の横にリンクを添えてください。矛盾するソースは平均化せず、11フラグを立てます。ドラフトはチャットではなく、私の Drive フォルダに保存します。1213// 停止条件14絶対に公開しないでください。誰にもメールを送らないでください。作成するのはドラフトのみです。152 つのソースが食い違い、解決できない場合は保留にして私に確認してください。
ルールはこうだ。頭脳が賢くなっても増えるのは「手順の数」であって「権限」ではない。「停止条件」のブロックは、これまでと同じくらい厳格に保つこと。
04. ツールは一度だけ接続し、データの境界線を引く

Grok Bot にはワンクリックで接続できるプラグインパネルが用意されている。Notion、Slack、Google Drive、AWS Agents、AWS SageMaker、Browserbase、Composio、Context7 に加え、カスタム連携も可能だ。
接続はアカウント単位で行われる。Gmail を一度接続すれば、作成するすべてのボットがそれを使える。5 つ目のボットでも、数秒で実戦投入できる。
新しい点は、あなたのデータに向かう先が 2 つになったことだ。ボットが Opus 5.5 で思考するとき、読み込んだ内容はそのステップのために Anthropic へ送信される。Musk の投稿に対する Tom のオプトアウトに関する質問にはまだ回答がなく、SpaceXAI も何が共有されるかの規約を公表していない。
モデルがどこで実行されるかは選べない。しかし、ボットが何に触れるかは選べる。すべての憲章にこれを追加しよう。
1// データの境界線 — すべての憲章に追加すること2以下を開いたり、読んだり、要約したりしないでください:3 - 私の /Legal または /Finance Drive フォルダ内のもの4 - 弁護士、会計士、銀行からのメール5 - パスワード、シードフレーズ、2FA コードを含むメッセージ67タスクにこれらが必要な場合は、まず止まって私に確認してください。8ドキュメントを扱うときは、タスクに必要な部分だけを使用してください。
本当に必要なものだけを接続し、それ以外には触れないこと。ベータ期間中は、すべての接続がすべてのボットからアクセス可能になり、しかも 1 社以上の企業にまたがる。
05. パスワードではなく、ログインセッションを渡す
実際の企業内で使われているソフトウェアの多くには API も MCP サーバーもない。それでも Grok Bot が対応できる仕組みがこれだ。
ボットは自分専用のクラウドブラウザを操作し、ログイン画面に行き当たるとあなたに画面を渡す。あなたがサインインして完了ボタンを押すと、ボットは同じブラウザセッションの続きから作業を再開する。
ボットが受け取るのは秘密情報ではなく「セッション」だ。チャットに認証情報を入力することはなく、サードパーティのモデルが介在する今、これはかつてないほど重要になる。会話に貼り付けたパスワードはモデルが読むテキストだが、引き継いだ画面上で行ったログインはそうならない。
徹底すべきルール:もしツールがメッセージにパスワードを貼り付けるよう求めてきたら、それは間違った方法だ。
06. 一度見せて、あとはルーティンにする
ボットが見ている前で一度ワークフローを実行すれば、それを教えられる。手順が保存され、次からは自動で実行してくれる。

最初に記録するのに最適なのは、定期的で、複数ツールにまたがり、手順が安定しているものだ。週に 1 回やり、2 つ以上のアプリを使い、手順がほとんど変わらない作業。言葉で説明するのは面倒でも、見せるだけなら 40 秒で済む。
次に、ルーティンを起動するトリガーを設定する。どちらも自然言語で指定でき、ノードキャンバスやワークフロービルダーは不要だ。
1// スケジュール — 朝のブリーフ2平日の毎朝 7 時に、カレンダー、受信トレイ、Slack の #launches チャンネルを確認してください。3今日の予定、返信が必要な件、夜間に変わった点をまとめた短いブリーフを 1 つ作成します。45// トリガー — 問い合わせキャッチャー6連絡先にないドメインからメールが届き、料金について言及されていたら、7テンプレートから返信案を作成して保留してください。89// ほとんどのルーティンを作るショートカット10これを毎週実行してください。11 ^ 気に入ったタスクの直後にこう言うだけでいい。
Opus 5.5 が真価を発揮するのはここだ。サイトのレイアウトが変わったり、入力内容が少し違ったりすると、ルーティンは壊れる。マルチステップ作業に強いモデルほど、 silently 失敗するのではなく、変化したページから自力で復旧できる可能性が高い。
07. Cursor エージェントを生み出すスペシャリストを雇う
複数のボットを並行して動かし、それぞれに 1 つの領域を担当させる。ボットを分ければ、メモリもコンテキストも分離され、問題が起きたときに確認すべきスレッドも明確になる。SpaceXAI によると、同社のチームも営業アウトリーチ、マーケティング、オフィス業務、バグ修正用にボットを運用しているという。
タスクの大きさではなく、領域で分割すること。領収書だけを考える経費マネージャーは、あなたの領収書処理のエキスパートになっていく。
Grok Bot チームの発表で目立たなかったもう半分が、新しいレイヤーだ。ボットは Cursor の任意のモデルを実行するクラウドエージェントを生成できる。これは所有関係とも一致する。SpaceX は 8 月に 600 億ドルの取引で Cursor を買収している。
つまり、コーディング用ボットがマネージャーになるわけだ。Opus を搭載したボットが計画を立ててコンテキストを保持し、Cursor エージェントが並列で力仕事をこなす。戻ってきた成果物はボットがレビューする。
1// Repo メンテナー — エージェントを管理するボット2あなたは私の Repo メンテナーです。34GitHub で issue に "bug" ラベルがついたら:51. あなたのコンピューターで再現し、失敗するテストを書いてください。62. Cursor クラウドエージェントを生成し、新しいブランチで修正させます。73. 結果に対してテストスイートをすべて実行してください。84. テスト、修正内容、3 行の要約を含むドラフト PR を作成してください。910絶対にマージしないでください。main にプッシュしないでください。11修正が認証、課金、マイグレーションに関わる場合は、保留にして私に回してください。
発表前から、X のユーザーたちはすでにこれに近いことを実践していた。9 月下旬には Grok Bot から Cursor クラウドエージェントを起動する様子が投稿されている。
https://x.com/mikepat711/status/2103551603102126149
08. グループチャットに入れる
ボット同士はメッセージを送り合い、スレッドでコンテキストを共有できる。複数のボットを 1 つのグループチャットに入れると、自ら連携し始める。作業を引き継ぎ、担当を割り振り、判断が必要なときだけあなたを呼ぶ。
SpaceXAI 自身の例では、エンジニアリング用ボットがバグを再現してチケットを作成し、デバッグ用に別のボットへ引き継ぐ。あるボットが「別のボットのほうが適している」と判断して担当を渡す。これは 1 対 1 チャットのツールにはできないことだ。
9 月下旬以降、チームは共有ボットを公開できるようになり、同僚がアプリ内や Slack から使えるようになった。
コツは、グループに「タスクリスト」ではなく「目的」を与えることだ。タスクリストを渡すということは、あなたがすでに分解作業を終えているということ。目的を与えれば、彼ら自身で作業を分割できる。そしてこの分解こそ、Opus 5.5 が最も得意とするマルチステップ推論なのだ。
1// タスクではなく目的2目標:金曜日の午後 5 時までに 10 月のニュースレターを配信する。34リサーチリードが事実とソースを担当。5受信トレイマネージャーが購読者からの返信を担当。6Chief がスケジュールを管理し、停滞している事項を私に報告。78作業の分担は yourselves で決めてください。公開に関わるものはすべて保留にして私に回すこと。
09. 承認ラインを引く
Grok Bot の前提は、ボットが最初から最後まで仕事を終わらせ、承認が必要なときだけ戻ってくるというものだ。つまり「承認が必要」の定義はあなたに委ねられる。ボットのデフォルトがあなたの感覚と一致するとは限らないからだ。

機能するラインは、タスクの規模では決まらない。「巻き戻せるかどうか」で決まる。ボットが元に戻せることは、すべて単独で完遂させる。外部に見えるもの、お金が動くもの、取り消せないものは、保留にしてあなたに回す。
これは以前より重要になっている。頭脳が強力になればなるほど、あなたが引いたラインに到達するまで深く進んでしまうからだ。だからこそ、ラインは明示的にしなければならない。
1// 常に単独で完遂するもの2ドラフト作成 · ファイル整理 · タグ付け · 要約 · リサーチ · 準備 · 照合3 すべて巻き戻せる作業。聞かずに実行し、ログに残すこと。45// 常に保留にして私に回すもの6社外の人物への送信7支払い、送金、価格の確定8公開物の発信9明らかなゴミ以外の削除10利用規約への同意や新規登録1112// 迷ったとき131 分以内で元に戻せないなら、保留にして私に確認してください。
すべてのボットで目指すべき姿は「36 件のドラフトが待機中で、送信済み 0 件」。巻き戻せる手順はすべて実行し、最初の不可逆な手順で完全に停止すること。
10. コストを監視し、週次でレビューする
Opus 5.5 は安価な頭脳ではない。API 価格は Grok を大きく上回る。

小規模なジョブ(入力 3 万トークン、出力 8,000 トークン)の場合、およそ 28 セントに対し 11 セントとなる。非常に長いコンテキストでは順序が逆転する。Grok は 20 万トークンを超えると料金が倍になるが、Opus は一定のままだからだ。
Grok Bot ではトークン単位の課金ではなく、プランに含まれている。Adam Hincu が X で問いかけた未解決の疑問は、Opus を使ったジョブがプランの上限を早く消費してしまうかどうかだ。SpaceXAI はまだ回答していない。だからルーティンを追加する前に、最初の 1 週間は使用量を観察しよう。

発表されたすべてがすでに稼働しているわけではない。Midjourney と Suno には日程がなく、少なくとも 1 人のユーザーのボットは初日に「Suno は利用できない」と答えたという。確実な Opus 5.5 の上に構築を進め、残りは待とう。
そして、週に 15 分をカレンダーに確保し、ボット自身に報告させよう。
1今週実行したすべてのルーティンをリストアップしてください。それぞれについて:23 - 起動された回数4 - 生み出した成果物5 - スキップ、失敗、または推測せざるを得なかった点6 - 私宛に保留したが、私が回答しなかったもの78次に、どれが最も役に立たなかったか、その理由を教えてください。9どのモデルがどのステップを処理したか分からない場合は、そう言ってください。
ルーティンごとに 1 つの出力を手作業で抜き打ちチェックすること。自分の成果物を自己評価するボットには、あなたと同じ盲点がある。
結論:ハーネスこそがプロダクトである
この 3 年間、問われてきたのは「どのモデルが最高か」だった。今週、市場で最も攻撃的なモデル開発企業が答えたのは別の問いだ。「どのハーネスが最高か」——そしてそこに競合の頭脳を組み込んだのである。
これこそがパラダイムシフトだ。ハーネスがコンピューター、ログイン情報、メモリ、ルーティンを支配する。その下で頭脳は交換可能であり、現時点でエージェント作業に最適な頭脳は Opus 5.5 だ。
あなたのやるべきことは変わらない。何を委任するか、ボットの権限がどこで終わるか、どのデータに触れさせるかを決めることだ。この 3 つを憲章に書き込み、市場で最も強力な頭脳にクリック作業を任せよう。





