タスク 5 つで 8.6%。10 個で 19.7%。
これは OpenAI 自身が公開した dots のシステムカードに記載されている数字だ。タスクを 5 つ繋げると、実行の 8.6% が境界逸脱の問題でフラグ付けされる。10 個繋げると、その割合は倍以上に跳ね上がる。
ローンチ当日、みんなぬいぐるみのマスコットの写真を投稿していた。だがこの数字について触れた人はほとんどいなかった。
dots のガイドの大半は「すべてを繋げてエージェントに走らせろ」と言う。この記事が扱うのは「どこでチェーンを切るか」だ。そうすることで、エージェントはあなたが与えた仕事の範囲から逸脱することなく、一週間働き続けることができる。
dot は 1 つ、席は 4 つ、権限の梯子、そして 5 ステップごとのチェックポイント。
要約:アプリを 1 つでも連携させる前に仕事を定義しろ。dot に 4 つの席を与え、一度に 1 つだけ座らせる。チェックポイントなしで 5 ステップ以上チェーンを走らせるな。承認作業は 1 日 5 件以下に抑えろ。プロンプトはセクション 6〜8 に、計算式はセクション 3 と 8 にある。
1. まずは数字から
1リリース日 2026 年 9 月 29 日2モデル GPT-6 Astra3連携可能なアプリ数 4,000 以上4最初の dot Pro および Business Premium に含まれる5Pro プラン 月額 $100 / $200 / $5006Business Premium ユーザーあたり月額 $125、年払いなら $1007dot とのチャット ChatGPT の制限にはカウントされない8Codex や Work で開始するタスク 通常どおり制限にカウントされる9利用場所 ChatGPT デスクトップ、Web、モバイル、Slack、Teams10SMS 「近日公開予定」1112システムカードより13境界逸脱フラグ、5 タスクチェーン 8.6%14境界逸脱フラグ、10 タスクチェーン 19.7%15間接的インジェクション、内部テスト 99.79% を防御16外部レッドチーム、1,810 回の攻撃 8.5% が突破17誤解を招く情報のタスク 151 件中 0 件が不適切
上のブロックはすでに多くの人が投稿している。本当にあなたの設定方法を変えるべきなのは、下のブロックだ。
2. dot とは何か(1 画面で)
dot は、あなたに属する常時稼働のエージェントだ。ChatGPT のチャットとは次の 4 点で異なる。
1モデル GPT-6 Astra であり、見栄えの良い UI の裏にある軽量モデルではない2専用マシン 独自のブラウザを持つクラウドマシンで、ノート PC の電源がオフでも動く3メッセージ間に 連携アプリ内で「先回りリサーチ」を行う(読み取り専用)4動作する メッセージの送信、アプリ内コンテンツの変更、PC の操作はできない5単一のアイデンティティ ChatGPT、Slack、Teams を通じて同じ dot とメモリを共有する
そして、何よりも頻繁に使う 2 つのコントロール機能がある。
1カスタムルール アクションを許可する、承認を求める、またはブロックする2自動レビュー アカウントへのアクセスやデータ共有につながる可能性のあるアクションをチェックする
OpenAI はローンチ記事の最後をこう結んでいる。「dots は依然としてミスを起こす可能性があるため、重要な作業は必ず確認してください」。以下はすべて、その確認作業を「実際にやれるほど短くする」ためのものだ。
3. 誰も投稿しなかった数字
システムカードの 2 つの数字を使って、少し計算してみた。
チェーン内の各ステップが同じ小さな独立確率で範囲外に出ると仮定すれば、単純な計算で 5 ステップから 10 ステップへの変換ができる。
15 ステップチェーンのフラグ率 8.6%2そこから逆算した 1 ステップあたりの確率 1 - (1 - 0.086)^(1/5) = 1.78%34ステップが独立だと仮定した場合の 10 ステップ 1 - (1 - 0.0178)^10 = 16.5%5実際の 10 ステップ(システムカードの測定値) 19.7%
実測値は、独立仮定での計算値より高い。
私の解釈はこうだ。エラーは蓄積する。わずかにズレたステップが、次のステップに少し歪んだ前提を渡し、次のステップはその上にさらに積み上げる。つまり、リスクはチェーンの長さ以上に速く膨らむのだ。
たった 2 つの数字であり、OpenAI はフラグ付けされた問題の内容を公表していないので、あくまで大まかなシグナルとして受け取ってほしい。それでも、設計の軸にするには十分だ。
1本ガイドの基本ルール2チェックポイント間のステップ数は絶対に 5 以下にする
4. 4 つの席、1 つの dot
「あなたは私のアシスタントです」と指示された dot は、いかにもアシスタントらしい成果物を出す。親切で、曖昧で、少し長すぎる。「今あなたは SKEPTIC(懐疑者)であり、SKEPTIC は失敗するものだけを見つける」と指示された dot は、実際に使えるものを生み出す。
そこで dot には 4 つの席を用意する。一度に 1 つの席に座り、返信の冒頭でどの席にいるかを宣言させる。
1LOOKOUT 連携アプリを読み取り、変更点を報告する。書き込みは一切しない2MAKER 専用マシンで作業し、成果物そのものを渡す3SKEPTIC 成果物を要件と照合し、不合格な点をリストアップする4RUNNER 承認済みの作業を適切な場所に移動する。外部に出る前に必ず確認を求める
これらは 4 つのエージェントではなく、1 つのエージェントの 4 つのモードだ。メモリは 1 つ、ルールブックも 1 つ、担当する狭い仕事が 4 つあるだけである。

5. 重要な順に行うセットアップ
11 PC で ChatGPT を開く 最初の dot はデスクトップ版または Web 版で作成する2 モバイルからは対話できるが作成はできない32 サイドバーで dots を探す 表示されない場合はプラン違い、未対応地域、4 または管理者が無効にしている53 名前をつける 短く、小文字で、スペースなし6 朝 7 時に Slack で入力することになる74 職務記述書を貼り付ける セクション 6 の内容。何よりも先にやる85 ソースを連携する dot が職務内容を復唱して確認してから行う96 Slack や Teams に追加する 目的を理解させてから
ステップ 4 の後にステップ 5 を持ってくるのを間違える人が多い。40 個のアプリと連携していながら職務記述書がないエージェントは、情報だけは豊富で、何も役に立つものを生み出さない。
6. 職務記述書
これを最初のメッセージとして貼り付ける。括弧の中身だけを差し替えること。
1あなたは私の常駐オペレーションエージェントです。このメッセージを、Slack やスマートフォンから2開始するものを含むすべてのタスクにおける職務記述書として扱ってください。34私について5私は [会社名またはプロジェクト名] の [役職] です。私の 1 週間は主に [1 文で説明] です。67あなたの責任範囲(活動ではなく成果)81. [成果 1]92. [成果 2]103. [成果 3]1112席(SEATS)13あなたは一度に 1 つの席に座り、すべての返信の冒頭でその名前を宣言します:14LOOKOUT、MAKER、SKEPTIC、RUNNER。15- LOOKOUT は読み取りと報告のみを行います。16- MAKER は成果物の説明ではなく、成果物そのものを提示します。17- SKEPTIC は MAKER の成果物をこの要件と照合し、不合格な点をリストアップします。18- RUNNER は承認済みの作業のみを移動させ、外部に出る前に必ず確認を求めます。1920チェーンのルール21連続して 5 ステップ以上実行しないでください。5 ステップ目で停止し、SKEPTIC に切り替え、22チェックポイントを実行し、PASS を得るまで待機してから続行してください。2324私への伝え方25- まず結論。次に、私が決断すべき事項を最大 3 つ。26- ブロックされた場合:試したことと必要なものを 2 行で。27- スコープ内か不明な場合:まず読み取り、質問を 1 つだけすること。勝手に動かないこと。28294 つの席、3 つの成果、チェーンのルールをあなた自身の言葉で復唱して確認してください。30その後、待機してください。
最後の一文を省略してはいけない。dot が「週次レポートの作成」を「その週についてのレポートを書く」と復唱したら、1 週間分の間違ったレポートを受け取る代わりに、1 通のメッセージでズレに気づける。
7. 承認予算付きの権限の梯子
カスタムルールには「許可」「承認必須」「ブロック」の 3 段階がある。多くの人は禁止事項の壁を作り上げ、1 日 40 件も承認する羽目になり、最終的に中身を読まずに承認するようになる。
まずは「許可」の段を書け。下の方は寛大に、上に行くほど厳格に。
1許可(ALLOW)2- 連携済みソース内のあらゆる情報の読み取り。3- 公開 Web の閲覧、専用マシンの使用、コードの実行。4- 自分のワークスペースおよび [名前] Space でのドラフト作成と書き換え。56事前確認(ASK FIRST)7- 人に向けたあらゆるメッセージ:メール、DM、チャンネル投稿、招待、コメント。8- 自分が作成していないファイルへの変更。9- リポジトリでのあらゆる操作(プルリクエストの作成を含む)。10- 購入、サブスクリプション登録、フォーム送信。1112ブロック(BLOCK)13- パスワード、2FA、請求、決済設定。14- あらゆる削除。15- 私の名前での公開投稿。16- タスクの要件に記載されていない人物への連絡。1718空白地帯(GAPS)19ルールでカバーされていないものはすべて「事前確認」とみなす。20どのルールが不明確だったかを報告すること。空白地帯を独断で行動側に解決してはならない。
次に、自分自身に予算を設定する。以下は、リサーチ、ドラフト作成、週次ダイジェストを担当する dot の 1 週間の例だ。内訳は実測値ではなく私の推計である。
11 週間の例、合計 420 アクション 上記の梯子 「すべて確認」方式2読み取りと Web 300 許可 確認3ワークスペースでのドラフト 80 許可 確認4人へのメッセージ 28 確認 確認5リポジトリとファイルの変更 8 確認 確認6ブロックされた試み 4 ブロック 確認7クリックする承認回数 週 36 回 週 420 回8営業日あたり 約 7 回 約 84 回
1 日 84 件の承認をちゃんと読む人間はいない。7 件なら読める。これが梯子の本当の役割だ。承認件数を「実際に中身を確認できる数」に抑えるのである。
私の目標は 1 日 5 件未満。2 週間続けてこれを超えたら、定期的なアクションを 1 つ下の段に下げるか、ソースを絞り込むこと。
8. 5 ステップごとのチェックポイント
ここで 19.7% という数字が効いてくる。
長い仕事は 1 つのチェーンとして走らせてはいけない。最大 5 ステップの「区間(レッグ)」に分けて実行し、各区間の終わりに SKEPTIC を挟む。
1チェックポイント(SKEPTIC、各区間の終了時)23以下の 5 つにそれぞれ 1 行で回答せよ:41. この区間は要件どおりのことを実行したか、それとも手近な別のことをしたか?52. 要件に記載のないソースや人物にアクセスしたステップはあるか?63. すべての数値は、あなたが計算したものか、参照元へのリンクが付いているか?74. 根拠を示せない主張はあるか?あればリストアップせよ。85. 私がこの区間を承認して、それが間違っていた場合、何が壊れるか?910判定:11PASS 次の区間へ進む12HOLD 停止し、まず項目 2、4、5 を提示する
セクション 3 と同じ概算をやってみよう。SKEPTIC がチェックポイントで 5 つのうち 4 つの問題を発見すると仮定する。これは実測値ではなく、私の仮定だ。
1チェックポイントなしの 10 ステップチェーン 19.7% がフラグ(システムカード)23チェックポイント付きの 5 ステップ区間 × 24 区間あたりのフラグ率 8.6%5 チェックポイント通過後の残存率 8.6% x 0.2 = 1.7%6 全区間を通じた合計 1 - (1 - 0.017)^2 = 3.4%
SKEPTIC が半分しか捕捉できなかったとしても、2 区間に分ければ 19.7% ではなく 8.6% 付近に収まる。「チェーンを切る」ことが大部分の効果を担い、捕捉率が残りを受け持つ。

9. 成果物の着地点を用意する
チャットのスレッドに埋もれた作業は、二度と見つからない。dots は ChatGPT の Spaces と Pages に接続でき、あなたもチームも dot も同じ場所で作業できる。
Space は 1 つ、ページは 4 つ。
100 index 実行ごとに 1 行:日付、使用した席、成果物、判定201 inbox LOOKOUT の発見事項、新しいものが上、日付付き302 review MAKER の成果物と、それぞれの下部に SKEPTIC のチェックポイント結果403 shipped あなたが承認したもの、承認日付き
この構成図を dot に一度伝えるだけでいい。2 週間も経てば、index ページがこの仕組み全体で最も役立つ存在になる。常時稼働エージェントがあなたの 1 週間で何をしたかを示す、唯一の読みやすい記録だからだ。
10. 最初の本番実行
役に立ち、繰り返され、失敗してもやり直すコストが安いものから始める。金曜日のダイジェストは 4 つの席すべてを使い、安全に失敗できる。
1常駐タスク。毎週金曜日 16:00、および私が「ダイジェストを実行して」と言ったとき。23区間 1(最大 5 ステップ)4LOOKOUT [カレンダー]、[メール]、[リポジトリ]:月曜日に参加した人が知るべき、5 今週の変更点。箇条書き最大 5 件、各項目は「判断が必要」または6 「対応不要」で終わること。7MAKER その箇条書きのみを基に:SHIPPED、MOVED、WAITING に分類。8 各セクション最大 120 語、SHIPPED の全項目にリンクを付与。9SKEPTIC チェックポイント。リンクのない SHIPPED は WAITING に移動させる。1011区間 2(PASS の場合のみ)12RUNNER 02 review に「Week of [日付]」として保存し、00 index に 1 行追加。13 誰にも送信しない。1415その後、チェックポイント項目 5 の回答だけを私にメッセージで送ること。他は不要。
11. Dots と Grok Bot の比較
カテゴリは同じだが、デフォルトの構造が違う。
1 DOTS GROK BOT2デフォルト構造 1 エージェント、複数席 複数の名前付きボット3メモリ 1 つ、全席で共有 ボットごとに 1 つ4利用場所 ChatGPT、Slack、Teams 専用アプリとチャット5適した用途 1 人の 1 週間、1 つのルールブック 決して混ざらない別々の仕事
仕事同士がコンテキストを共有するなら(受信トレイ → ダイジェスト → 月曜の計画)、4 席を持つ 1 つの dot の方がシンプルだ。互いに干渉すべきでない場合(クライアント A とクライアント B)は、別々のボットの方が境界線が明確になる。
12. ガードレール
1チェーンが 5 ステップを超える -> 停止、チェックポイント、PASS を待つ2ルールの空白地帯 -> 事前確認、不明確なルールを指摘する3人へのあらゆるメッセージ -> 常に事前確認4パスワード、請求、削除、公開 -> ブロック5タスク中のログインや CAPTCHA -> dot のマシンから引き継ぐ61 日 5 件以上の承認が 2 週間続く -> 段を下げるかソースを絞る7SKEPTIC が褒め言葉を書く -> 成果物ではなくチェックポイントを書き直す
すべてのガードレールは、不確実性を「行動」ではなく「あなた」に向けるためにある。
13. まだ検証していないこと
ドリフトの計算。1 つのシステムカードからの 2 つの数字は大まかなシグナルであり、証明されたモデルではない。OpenAI はフラグ付けされた境界問題の内容を公表していないため、その深刻度は分からない。
SKEPTIC の捕捉率。5 つのうち 4 つというのは、計算の形を示すための仮定だ。dot が自分の成果物を自分でチェックするのは独立したレビュアーではないため、実際の捕捉率はもっと低い可能性がある。
1 週間の例。420 アクションとその内訳は、リサーチ・ドラフト作成型 dot に対する私の推計であり、実際のアカウントのログではない。
2 つ目以降の dot の料金。OpenAI は dot の追加や速度・月間作業量のスケーリングが可能になると述べているが、まだ料金は発表されていない。
14. プレイブック
アプリを 1 つでも連携させる前に、仕事を定義しろ。
1 つのエージェント、4 つの席、一度に 1 つの席。
チェーンは 5 ステップで切れ。チェックポイントを挟んでから続行する。
まずは許可リストを書け。空白地帯は「事前確認」に回す。
承認は 1 日 5 件以下に保て。さもないと確認作業は形骸化する。
成果物の着地点を用意し、金曜日に index を読め。

要するに
dots は、多くの人にとって「寝ている間も走らせておく」初めてのエージェントになる。これにより、問いは「タスクをこなせるか」から「誰かが確認するまでにどこまで暴走するか」へと変わる。
OpenAI 自身のシステムカードがその答えのヒントを出している。チェーンを倍にすれば、フラグは倍以上になる。
だから、より長いチェーンを作ってはいけない。より短い区間を作り、それぞれの最後に SKEPTIC を配置し、本当に聞く価値のあることだけを尋ねてくる梯子を組むのだ。
5 ステップ進んだら確認する。それだけのことだ。
ローンチの詳細は OpenAI の dots 発表に基づく。システムカードの数値は The New Stack の報道による。プラン料金は 2026 年 10 月 1 日時点のローンチ報道に基づくものであり、変更される可能性がある。





