YouMind
ログイン

OpenAI Dots: ドリフトを防ぐ4席エージェントチームの構築方法(完全ガイド)

@fleyta88
英語2026年10月01日
126K
90
5
10
150

TL;DR

本ガイドでは、4席ロールシステム(Lookout、Maker、Skeptic、Runner)を活用し、権限階層付きの厳格な5ステップチェックポイントを適用することで、OpenAI Dots エージェントのタスクドリフトを防止する方法を解説します。

タスク 5 つで 8.6%。10 個で 19.7%。

これは OpenAI 自身が公開した dots のシステムカードに記載されている数字だ。タスクを 5 つ繋げると、実行の 8.6% が境界逸脱の問題でフラグ付けされる。10 個繋げると、その割合は倍以上に跳ね上がる。

ローンチ当日、みんなぬいぐるみのマスコットの写真を投稿していた。だがこの数字について触れた人はほとんどいなかった。

dots のガイドの大半は「すべてを繋げてエージェントに走らせろ」と言う。この記事が扱うのは「どこでチェーンを切るか」だ。そうすることで、エージェントはあなたが与えた仕事の範囲から逸脱することなく、一週間働き続けることができる。

dot は 1 つ、席は 4 つ、権限の梯子、そして 5 ステップごとのチェックポイント。

要約:アプリを 1 つでも連携させる前に仕事を定義しろ。dot に 4 つの席を与え、一度に 1 つだけ座らせる。チェックポイントなしで 5 ステップ以上チェーンを走らせるな。承認作業は 1 日 5 件以下に抑えろ。プロンプトはセクション 6〜8 に、計算式はセクション 3 と 8 にある。

1. まずは数字から

text
1リリース日 2026 年 9 月 29 日
2モデル GPT-6 Astra
3連携可能なアプリ数 4,000 以上
4最初の dot Pro および Business Premium に含まれる
5Pro プラン 月額 $100 / $200 / $500
6Business Premium ユーザーあたり月額 $125、年払いなら $100
7dot とのチャット ChatGPT の制限にはカウントされない
8Codex や Work で開始するタスク 通常どおり制限にカウントされる
9利用場所 ChatGPT デスクトップ、Web、モバイル、Slack、Teams
10SMS 「近日公開予定」
11
12システムカードより
13境界逸脱フラグ、5 タスクチェーン 8.6%
14境界逸脱フラグ、10 タスクチェーン 19.7%
15間接的インジェクション、内部テスト 99.79% を防御
16外部レッドチーム、1,810 回の攻撃 8.5% が突破
17誤解を招く情報のタスク 151 件中 0 件が不適切

上のブロックはすでに多くの人が投稿している。本当にあなたの設定方法を変えるべきなのは、下のブロックだ。

2. dot とは何か(1 画面で)

dot は、あなたに属する常時稼働のエージェントだ。ChatGPT のチャットとは次の 4 点で異なる。

text
1モデル GPT-6 Astra であり、見栄えの良い UI の裏にある軽量モデルではない
2専用マシン 独自のブラウザを持つクラウドマシンで、ノート PC の電源がオフでも動く
3メッセージ間に 連携アプリ内で「先回りリサーチ」を行う(読み取り専用)
4動作する メッセージの送信、アプリ内コンテンツの変更、PC の操作はできない
5単一のアイデンティティ ChatGPT、Slack、Teams を通じて同じ dot とメモリを共有する

そして、何よりも頻繁に使う 2 つのコントロール機能がある。

text
1カスタムルール アクションを許可する、承認を求める、またはブロックする
2自動レビュー アカウントへのアクセスやデータ共有につながる可能性のあるアクションをチェックする

OpenAI はローンチ記事の最後をこう結んでいる。「dots は依然としてミスを起こす可能性があるため、重要な作業は必ず確認してください」。以下はすべて、その確認作業を「実際にやれるほど短くする」ためのものだ。

3. 誰も投稿しなかった数字

システムカードの 2 つの数字を使って、少し計算してみた。

チェーン内の各ステップが同じ小さな独立確率で範囲外に出ると仮定すれば、単純な計算で 5 ステップから 10 ステップへの変換ができる。

text
15 ステップチェーンのフラグ率 8.6%
2そこから逆算した 1 ステップあたりの確率 1 - (1 - 0.086)^(1/5) = 1.78%
3
4ステップが独立だと仮定した場合の 10 ステップ 1 - (1 - 0.0178)^10 = 16.5%
5実際の 10 ステップ(システムカードの測定値) 19.7%

実測値は、独立仮定での計算値より高い。

私の解釈はこうだ。エラーは蓄積する。わずかにズレたステップが、次のステップに少し歪んだ前提を渡し、次のステップはその上にさらに積み上げる。つまり、リスクはチェーンの長さ以上に速く膨らむのだ。

たった 2 つの数字であり、OpenAI はフラグ付けされた問題の内容を公表していないので、あくまで大まかなシグナルとして受け取ってほしい。それでも、設計の軸にするには十分だ。

text
1本ガイドの基本ルール
2チェックポイント間のステップ数は絶対に 5 以下にする

4. 4 つの席、1 つの dot

「あなたは私のアシスタントです」と指示された dot は、いかにもアシスタントらしい成果物を出す。親切で、曖昧で、少し長すぎる。「今あなたは SKEPTIC(懐疑者)であり、SKEPTIC は失敗するものだけを見つける」と指示された dot は、実際に使えるものを生み出す。

そこで dot には 4 つの席を用意する。一度に 1 つの席に座り、返信の冒頭でどの席にいるかを宣言させる。

text
1LOOKOUT 連携アプリを読み取り、変更点を報告する。書き込みは一切しない
2MAKER 専用マシンで作業し、成果物そのものを渡す
3SKEPTIC 成果物を要件と照合し、不合格な点をリストアップする
4RUNNER 承認済みの作業を適切な場所に移動する。外部に出る前に必ず確認を求める

これらは 4 つのエージェントではなく、1 つのエージェントの 4 つのモードだ。メモリは 1 つ、ルールブックも 1 つ、担当する狭い仕事が 4 つあるだけである。

fleyta - inline image

5. 重要な順に行うセットアップ

text
11 PC で ChatGPT を開く 最初の dot はデスクトップ版または Web 版で作成する
2 モバイルからは対話できるが作成はできない
32 サイドバーで dots を探す 表示されない場合はプラン違い、未対応地域、
4 または管理者が無効にしている
53 名前をつける 短く、小文字で、スペースなし
6 朝 7 時に Slack で入力することになる
74 職務記述書を貼り付ける セクション 6 の内容。何よりも先にやる
85 ソースを連携する dot が職務内容を復唱して確認してから行う
96 Slack や Teams に追加する 目的を理解させてから

ステップ 4 の後にステップ 5 を持ってくるのを間違える人が多い。40 個のアプリと連携していながら職務記述書がないエージェントは、情報だけは豊富で、何も役に立つものを生み出さない。

6. 職務記述書

これを最初のメッセージとして貼り付ける。括弧の中身だけを差し替えること。

text
1あなたは私の常駐オペレーションエージェントです。このメッセージを、Slack やスマートフォンから
2開始するものを含むすべてのタスクにおける職務記述書として扱ってください。
3
4私について
5私は [会社名またはプロジェクト名] の [役職] です。私の 1 週間は主に [1 文で説明] です。
6
7あなたの責任範囲(活動ではなく成果)
81. [成果 1]
92. [成果 2]
103. [成果 3]
11
12席(SEATS)
13あなたは一度に 1 つの席に座り、すべての返信の冒頭でその名前を宣言します:
14LOOKOUT、MAKER、SKEPTIC、RUNNER。
15- LOOKOUT は読み取りと報告のみを行います。
16- MAKER は成果物の説明ではなく、成果物そのものを提示します。
17- SKEPTIC は MAKER の成果物をこの要件と照合し、不合格な点をリストアップします。
18- RUNNER は承認済みの作業のみを移動させ、外部に出る前に必ず確認を求めます。
19
20チェーンのルール
21連続して 5 ステップ以上実行しないでください。5 ステップ目で停止し、SKEPTIC に切り替え、
22チェックポイントを実行し、PASS を得るまで待機してから続行してください。
23
24私への伝え方
25- まず結論。次に、私が決断すべき事項を最大 3 つ。
26- ブロックされた場合:試したことと必要なものを 2 行で。
27- スコープ内か不明な場合:まず読み取り、質問を 1 つだけすること。勝手に動かないこと。
28
294 つの席、3 つの成果、チェーンのルールをあなた自身の言葉で復唱して確認してください。
30その後、待機してください。

最後の一文を省略してはいけない。dot が「週次レポートの作成」を「その週についてのレポートを書く」と復唱したら、1 週間分の間違ったレポートを受け取る代わりに、1 通のメッセージでズレに気づける。

7. 承認予算付きの権限の梯子

カスタムルールには「許可」「承認必須」「ブロック」の 3 段階がある。多くの人は禁止事項の壁を作り上げ、1 日 40 件も承認する羽目になり、最終的に中身を読まずに承認するようになる。

まずは「許可」の段を書け。下の方は寛大に、上に行くほど厳格に。

text
1許可(ALLOW)
2- 連携済みソース内のあらゆる情報の読み取り。
3- 公開 Web の閲覧、専用マシンの使用、コードの実行。
4- 自分のワークスペースおよび [名前] Space でのドラフト作成と書き換え。
5
6事前確認(ASK FIRST)
7- 人に向けたあらゆるメッセージ:メール、DM、チャンネル投稿、招待、コメント。
8- 自分が作成していないファイルへの変更。
9- リポジトリでのあらゆる操作(プルリクエストの作成を含む)。
10- 購入、サブスクリプション登録、フォーム送信。
11
12ブロック(BLOCK)
13- パスワード、2FA、請求、決済設定。
14- あらゆる削除。
15- 私の名前での公開投稿。
16- タスクの要件に記載されていない人物への連絡。
17
18空白地帯(GAPS)
19ルールでカバーされていないものはすべて「事前確認」とみなす。
20どのルールが不明確だったかを報告すること。空白地帯を独断で行動側に解決してはならない。

次に、自分自身に予算を設定する。以下は、リサーチ、ドラフト作成、週次ダイジェストを担当する dot の 1 週間の例だ。内訳は実測値ではなく私の推計である。

text
11 週間の例、合計 420 アクション 上記の梯子 「すべて確認」方式
2読み取りと Web 300 許可 確認
3ワークスペースでのドラフト 80 許可 確認
4人へのメッセージ 28 確認 確認
5リポジトリとファイルの変更 8 確認 確認
6ブロックされた試み 4 ブロック 確認
7クリックする承認回数 週 36 回 週 420 回
8営業日あたり 約 7 回 約 84 回

1 日 84 件の承認をちゃんと読む人間はいない。7 件なら読める。これが梯子の本当の役割だ。承認件数を「実際に中身を確認できる数」に抑えるのである。

私の目標は 1 日 5 件未満。2 週間続けてこれを超えたら、定期的なアクションを 1 つ下の段に下げるか、ソースを絞り込むこと。

8. 5 ステップごとのチェックポイント

ここで 19.7% という数字が効いてくる。

長い仕事は 1 つのチェーンとして走らせてはいけない。最大 5 ステップの「区間(レッグ)」に分けて実行し、各区間の終わりに SKEPTIC を挟む。

text
1チェックポイント(SKEPTIC、各区間の終了時)
2
3以下の 5 つにそれぞれ 1 行で回答せよ:
41. この区間は要件どおりのことを実行したか、それとも手近な別のことをしたか?
52. 要件に記載のないソースや人物にアクセスしたステップはあるか?
63. すべての数値は、あなたが計算したものか、参照元へのリンクが付いているか?
74. 根拠を示せない主張はあるか?あればリストアップせよ。
85. 私がこの区間を承認して、それが間違っていた場合、何が壊れるか?
9
10判定:
11PASS 次の区間へ進む
12HOLD 停止し、まず項目 2、4、5 を提示する

セクション 3 と同じ概算をやってみよう。SKEPTIC がチェックポイントで 5 つのうち 4 つの問題を発見すると仮定する。これは実測値ではなく、私の仮定だ。

text
1チェックポイントなしの 10 ステップチェーン 19.7% がフラグ(システムカード)
2
3チェックポイント付きの 5 ステップ区間 × 2
4 区間あたりのフラグ率 8.6%
5 チェックポイント通過後の残存率 8.6% x 0.2 = 1.7%
6 全区間を通じた合計 1 - (1 - 0.017)^2 = 3.4%

SKEPTIC が半分しか捕捉できなかったとしても、2 区間に分ければ 19.7% ではなく 8.6% 付近に収まる。「チェーンを切る」ことが大部分の効果を担い、捕捉率が残りを受け持つ。

fleyta - inline image

9. 成果物の着地点を用意する

チャットのスレッドに埋もれた作業は、二度と見つからない。dots は ChatGPT の Spaces と Pages に接続でき、あなたもチームも dot も同じ場所で作業できる。

Space は 1 つ、ページは 4 つ。

text
100 index 実行ごとに 1 行:日付、使用した席、成果物、判定
201 inbox LOOKOUT の発見事項、新しいものが上、日付付き
302 review MAKER の成果物と、それぞれの下部に SKEPTIC のチェックポイント結果
403 shipped あなたが承認したもの、承認日付き

この構成図を dot に一度伝えるだけでいい。2 週間も経てば、index ページがこの仕組み全体で最も役立つ存在になる。常時稼働エージェントがあなたの 1 週間で何をしたかを示す、唯一の読みやすい記録だからだ。

10. 最初の本番実行

役に立ち、繰り返され、失敗してもやり直すコストが安いものから始める。金曜日のダイジェストは 4 つの席すべてを使い、安全に失敗できる。

text
1常駐タスク。毎週金曜日 16:00、および私が「ダイジェストを実行して」と言ったとき。
2
3区間 1(最大 5 ステップ)
4LOOKOUT [カレンダー]、[メール]、[リポジトリ]:月曜日に参加した人が知るべき、
5 今週の変更点。箇条書き最大 5 件、各項目は「判断が必要」または
6 「対応不要」で終わること。
7MAKER その箇条書きのみを基に:SHIPPED、MOVED、WAITING に分類。
8 各セクション最大 120 語、SHIPPED の全項目にリンクを付与。
9SKEPTIC チェックポイント。リンクのない SHIPPED は WAITING に移動させる。
10
11区間 2(PASS の場合のみ)
12RUNNER 02 review に「Week of [日付]」として保存し、00 index に 1 行追加。
13 誰にも送信しない。
14
15その後、チェックポイント項目 5 の回答だけを私にメッセージで送ること。他は不要。

11. Dots と Grok Bot の比較

カテゴリは同じだが、デフォルトの構造が違う。

text
1 DOTS GROK BOT
2デフォルト構造 1 エージェント、複数席 複数の名前付きボット
3メモリ 1 つ、全席で共有 ボットごとに 1 つ
4利用場所 ChatGPT、Slack、Teams 専用アプリとチャット
5適した用途 1 人の 1 週間、1 つのルールブック 決して混ざらない別々の仕事

仕事同士がコンテキストを共有するなら(受信トレイ → ダイジェスト → 月曜の計画)、4 席を持つ 1 つの dot の方がシンプルだ。互いに干渉すべきでない場合(クライアント A とクライアント B)は、別々のボットの方が境界線が明確になる。

12. ガードレール

text
1チェーンが 5 ステップを超える -> 停止、チェックポイント、PASS を待つ
2ルールの空白地帯 -> 事前確認、不明確なルールを指摘する
3人へのあらゆるメッセージ -> 常に事前確認
4パスワード、請求、削除、公開 -> ブロック
5タスク中のログインや CAPTCHA -> dot のマシンから引き継ぐ
61 日 5 件以上の承認が 2 週間続く -> 段を下げるかソースを絞る
7SKEPTIC が褒め言葉を書く -> 成果物ではなくチェックポイントを書き直す

すべてのガードレールは、不確実性を「行動」ではなく「あなた」に向けるためにある。

13. まだ検証していないこと

ドリフトの計算。1 つのシステムカードからの 2 つの数字は大まかなシグナルであり、証明されたモデルではない。OpenAI はフラグ付けされた境界問題の内容を公表していないため、その深刻度は分からない。

SKEPTIC の捕捉率。5 つのうち 4 つというのは、計算の形を示すための仮定だ。dot が自分の成果物を自分でチェックするのは独立したレビュアーではないため、実際の捕捉率はもっと低い可能性がある。

1 週間の例。420 アクションとその内訳は、リサーチ・ドラフト作成型 dot に対する私の推計であり、実際のアカウントのログではない。

2 つ目以降の dot の料金。OpenAI は dot の追加や速度・月間作業量のスケーリングが可能になると述べているが、まだ料金は発表されていない。

14. プレイブック

アプリを 1 つでも連携させる前に、仕事を定義しろ。

1 つのエージェント、4 つの席、一度に 1 つの席。

チェーンは 5 ステップで切れ。チェックポイントを挟んでから続行する。

まずは許可リストを書け。空白地帯は「事前確認」に回す。

承認は 1 日 5 件以下に保て。さもないと確認作業は形骸化する。

成果物の着地点を用意し、金曜日に index を読め。

fleyta - inline image

要するに

dots は、多くの人にとって「寝ている間も走らせておく」初めてのエージェントになる。これにより、問いは「タスクをこなせるか」から「誰かが確認するまでにどこまで暴走するか」へと変わる。

OpenAI 自身のシステムカードがその答えのヒントを出している。チェーンを倍にすれば、フラグは倍以上になる。

だから、より長いチェーンを作ってはいけない。より短い区間を作り、それぞれの最後に SKEPTIC を配置し、本当に聞く価値のあることだけを尋ねてくる梯子を組むのだ。

5 ステップ進んだら確認する。それだけのことだ。

ローンチの詳細は OpenAI の dots 発表に基づく。システムカードの数値は The New Stack の報道による。プラン料金は 2026 年 10 月 1 日時点のローンチ報道に基づくものであり、変更される可能性がある。

ワンクリック保存

YouMindでバイラル記事をAI深読み

ソースを保存し、的を絞った質問をし、主張を要約して、バイラル記事を再利用できるノートに変えます。すべてを1つのAIワークスペースで行えます。

YouMindを探索
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る