YouMind
登入

OpenAI Dots:如何建立能防止任務漂移的 4 席位 Agent 團隊(完整指南)

@fleyta88
英語2026年10月01日
126K
90
5
10
150

TL;DR

本指南說明如何配置 OpenAI Dots Agents,利用四席位角色系統(觀察者、執行者、質疑者、推進者)以及嚴格的五步驟檢查點與權限階梯,來防止任務漂移。

5 個任務時是 8.6%,10 個任務時是 19.7%。

這組數據出自 OpenAI 官方針對 dots 發布的系統卡(system card)。把 5 個任務串在一起,就有 8.6% 的執行會因為越界問題被標記;串到 10 個,這個比例直接翻倍還多。

上線那天,所有人都在曬那些絨毛吉祥物,卻幾乎沒人注意到這行字。

多數 dots 指南都教你把所有東西串起來,然後放手讓 Agent 自己跑。但這篇要談的是「在哪裡切斷鏈條」,好讓 Agent 跑上一整週,也不會跑出你交辦的工作範圍。

一個 dot、四個席位、一套權限階梯,外加每五步設一個檢查點。

懶人包:在接上任何 App 之前,先把工作寫清楚;給 dot 四個席位,但一次只坐一個;任何鏈條跑超過五步就必須停下來檢查;每天需要人工核准的次數控制在五次以內。提示詞在第 6 到 8 節,數學推演在第 3 和第 8 節。

1. 先看數字

text
1上線日期 2026 年 9 月 29 日
2模型 GPT-6 Astra
3可連接的 App 數量 4,000+
4第一個 dot Pro 與 Business Premium 方案內含
5Pro 方案級距 每月 $100 / $200 / $500
6Business Premium 每位使用者每月 $125,年繳每月 $100
7與 dot 對話 不計入 ChatGPT 用量上限
8它在 Codex 或 Work 中啟動的任務 照常計入用量
9運行環境 ChatGPT 桌面版、網頁版、行動版、Slack、Teams
10簡訊功能 「即將推出」
11
12摘自系統卡
135 步鏈條的越界標記率 8.6%
1410 步鏈條的越界標記率 19.7%
15間接注入攻擊(內部測試) 99.79% 成功防禦
16外部紅隊測試(1,810 次攻擊) 8.5% 突破防線
17誤導性資訊任務 151 項中 0 項偏離對齊目標

上面那張表大家早就貼爛了,真正該改變你設定方式的,是下面那張。

2. 一張圖看懂 dot 是什麼

dot 是一個全天候待命、專屬於你的 Agent。它跟一般 ChatGPT 對話有四個不同之處:

text
1模型 GPT-6 Astra,不是披著漂亮介面的輕量模型
2自己的電腦 一台雲端機器,有自己的瀏覽器,就算你筆電關機它照跑
3在你傳訊息 會在已連接的 App 裡「主動研究」,但唯讀
4的空檔工作 不能在那裡發送訊息、修改 App 內容或操控你的電腦
5單一身分 同一個 dot、同一份記憶,橫跨 ChatGPT、Slack 和 Teams

還有兩個你會最常用到的控制項:

text
1Custom Rules(自訂規則) 允許某個動作、要求先核准,或直接封鎖
2auto-review(自動審查) 檢查可能動到你的帳號或分享資料的動作

OpenAI 在上線公告最後提醒:dots 還是會犯錯,所以重要工作一定要親自檢查。以下所有內容,都是為了讓這個檢查過程夠快,快到你真的願意去做。

3. 沒人貼出來的那個數字

我拿系統卡上的兩個數字簡單算了一下。

如果鏈條中每一步越界的機率都一樣小、而且彼此獨立,那從 5 步推到 10 步只需要簡單的數學:

text
15 步鏈條被標記的機率 8.6%
2換算出每一步的越界機率 1 - (1 - 0.086)^(1/5) = 1.78%
3
4若各步獨立,10 步的越界機率 1 - (1 - 0.0178)^10 = 16.5%
5系統卡實際測出的 10 步越界機率 19.7%

實測數字比「各自獨立」算出來的還要高。

我的解讀是:錯誤會堆疊。某一步稍微走偏,就會把略微失真的結果交給下一步,而下一步又踩在這個失真上繼續蓋。所以風險成長的速度,比鏈條拉長的速度更快。

這畢竟只有兩個數字,OpenAI 也沒說明被標記的具體問題是什麼,所以把它當成粗略的警訊就好。但它已經足夠讓我們建立一條原則:

text
1本指南的核心原則
2兩個檢查點之間,絕對不超過 5 步

4. 四個席位,一個 dot

如果你告訴 dot「你是我的助理」,它產出的就是標準助理風格的東西:有幫助、很空泛、稍微冗長一點。但如果你說「現在你是 Skeptic,而 Skeptic 只負責挑毛病」,它給出的東西才真的能用。

所以我們給 dot 四個席位。它一次只坐一個,而且在每次回覆的最上方註明自己坐在哪。

text
1LOOKOUT 讀取你已連接的 App,回報變動,絕不寫入
2MAKER 在自己的電腦上工作,直接把成品交給你
3SKEPTIC 拿成品對照需求簡報,列出哪裡不合格
4RUNNER 把核准後的成果送到該去的地方,任何東西送出前都要先問過

這些是同一個 Agent 的四種模式,不是四個 Agent。一份記憶、一本規則手冊、四項專職工作。

fleyta - inline image

5. 設定流程(順序很重要)

text
11 用電腦開啟 ChatGPT 第一個 dot 只能在桌面版或網頁版建立,
2 手機版可以跟它對話,但不能建立
32 在側邊欄找到 dots 找不到=方案不對、尚未開放你的地區,
4 或管理員還沒開啟
53 幫它命名 簡短、全小寫、不加空格
6 想像你早上七點要在 Slack 裡打這個名字
74 貼上工作描述 見第 6 節,這是第一步,其他都先別做
85 連接資料來源 等它向你複述確認工作內容後再做
96 加到 Slack 或 Teams 等它搞清楚自己是來幹嘛的之後再加

很多人都在「第 5 步要排在第 4 步後面」這裡搞錯。一個接了 40 個 App 卻沒有需求簡報的 Agent,只是消息非常靈通,但產不出任何有用的東西。

6. 工作描述

把這段當作第一則訊息貼上去。只替換括號裡的內容,其餘不要動。

text
1你是我的常駐營運 Agent。請把這則訊息當作你所有任務的工作描述,
2包含我從 Slack 或手機發起的任務。
3
4我是誰
5我是 [公司或專案] 的 [職位]。我一週的主要工作是 [一句話描述]。
6
7你負責什麼(要結果,不是要動作)
81. [成果一]
92. [成果二]
103. [成果三]
11
12席位
13你一次只能坐一個席位,並且要在每次回覆的最上方註明是哪一個:
14LOOKOUT、MAKER、SKEPTIC、RUNNER。
15- LOOKOUT 只讀取和回報。
16- MAKER 直接給我看成品,不要給我成品的描述。
17- SKEPTIC 拿 MAKER 的成果對照這份簡報,列出哪裡不合格。
18- RUNNER 只搬運已核准的成果,任何東西送出前都要先問過我。
19
20鏈條規則
21連續執行的步驟絕對不能超過 5 步。第 5 步結束後,停下來,切換成
22SKEPTIC,執行檢查點,等到 PASS 才能繼續。
23
24怎麼跟我溝通
25- 先講結果。接著最多提三件需要我決定的事。
26- 卡住時:用兩行說明你試了什麼、你需要什麼。
27- 不確定某件事是否在範圍內:先讀取,再問一個問題。不要擅自行動。
28
29請用你自己的話複述這四個席位、三項成果和鏈條規則來確認。然後停下。

最後一行千萬別省。如果 dot 把「草擬每週報告」複述成「寫一篇關於這一週的報告」,你就能用一則訊息抓出問題,而不是收到一整週的錯誤報告才發現。

7. 權限階梯與核准預算

Custom Rules 提供三個層級:允許、需核准、封鎖。多數人會寫出一整面牆的禁令,結果每天要核准 40 件事,最後根本懶得看自己到底准了什麼。

先寫「允許」那一層。底層大方一點,頂層嚴格一點。

text
1允許
2- 讀取我已連接資料源中的任何內容。
3- 瀏覽公開網路、使用你自己的電腦、執行程式碼。
4- 在你自己的工作區和 [名稱] Space 中建立與改寫草稿。
5
6先問過我
7- 任何發給真人的訊息:Email、私訊、頻道貼文、邀請、留言。
8- 任何對非你建立的檔案所做的修改。
9- 儲存庫中的任何動作,包含開 pull request。
10- 任何購買、訂閱或表單提交。
11
12封鎖
13- 密碼、雙重驗證(2FA)、帳單、付款設定。
14- 刪除任何東西。
15- 以我的名義公開發文。
16- 聯繫任務簡報中未提及的任何人。
17
18漏洞
19規則沒涵蓋到的任何事,一律視為「先問過我」。
20告訴我哪條規則不清楚。遇到漏洞時,絕不可擅自採取行動。

接著給自己編列一份預算。以下是一個負責研究、寫草稿和每週摘要的 dot 的範例週。比例是我的估算,不是實測數據:

text
1範例一週,共 420 個動作 上述階梯制度 「凡事都要問」制度
2讀取與上網 300 允許 需核准
3在自己工作區寫草稿 80 允許 需核准
4發給真人的訊息 28 需核准 需核准
5儲存庫與檔案修改 8 需核准 需核准
6被封鎖的嘗試 4 封鎖 需核准
7你需要點擊的核准次數 每週 36 次 每週 420 次
8每個工作日 約 7 次 約 84 次

沒有人能一天看完 84 個核准請求,但你真的看得完 7 個。這就是權限階梯真正的用途:把核准數量壓低到你还願意認真看的程度。

我的目標:每天五次以內。如果連續兩週都超標,就把某項例行動作往下調一層,或是縮小資料源的範圍。

8. 每五步一次的檢查點

這就是 19.7% 那個數字派上用場的地方。

長任務不能一口氣跑成一條長鏈,而是要切成最多五步的小段,每一段都由 Skeptic 收尾。

text
1檢查點(Skeptic,於每一段結束時執行)
2
3回答以下五個問題,每個問題一行:
41. 這一段完成的是簡報要求的事,還是它附近比較簡單的事?
52. 是否有任何一步接觸到簡報中未提及的資料源或人員?
63. 每個數字是你自己算出來的,還是有附上你讀取該數字的來源連結?
74. 有沒有哪個主張是你指不出證據的?列出來。
85. 如果我核准了這一段但它是錯的,會搞砸什麼?
9
10判定:
11PASS 繼續下一段
12HOLD 停下來,先給我看第 2、4、5 項

現在用第 3 節的方式粗略算一下。假設 Skeptic 在檢查點能抓出五分之四的問題——這是我的假設,不是實測數據:

text
1一條 10 步鏈條,無檢查點 19.7% 被標記(系統卡數據)
2
3分成兩段 5 步,各有一個檢查點
4 每段被標記的機率 8.6%
5 經過檢查點後殘留的機率 8.6% x 0.2 = 1.7%
6 兩段合計的越界機率 1 - (1 - 0.017)^2 = 3.4%

就算 Skeptic 只抓出一半,兩段的總風險也會落在 8.6% 左右,而不是 19.7%。「切斷」承擔了大部分功勞,攔截率補足剩下的。

fleyta - inline image

9. 給工作成果一個落腳處

留在聊天串裡的工作成果,等於再也找不到的工作成果。dots 可以接入 ChatGPT Spaces 和 Pages,讓你、你的團隊和 dot 都在同一個地方協作。

一個 Space,四個頁面:

text
100 index 每次執行一行紀錄:日期、使用的席位、成品、判定結果
201 inbox LOOKOUT 的發現,最新的在最上面,附日期
302 review MAKER 的成品,下方附上 SKEPTIC 的檢查點紀錄
403 shipped 你核准過的項目,附上核准日期

只要跟 dot 說明一次這個架構。兩週後你會發現,索引頁是整套設定中最有價值的東西:它是唯一能讓人看懂「一個全天候 Agent 這週到底做了什麼」的紀錄。

10. 第一次正式執行

從有用、會重複執行、而且搞砸了重做成本很低的事情開始。例如「週五摘要」就能用到全部四個席位,而且失敗了也很安全。

text
1常駐任務。每週五 16:00 執行,以及當我說「run the digest」時執行。
2
3第一段(最多 5 步)
4LOOKOUT [行事曆]、[Email]、[儲存庫]:這週有哪些變動,是週一新進同事
5 必須知道的。最多五個重點,每個結尾標註「需決定」或「無需行動」。
6MAKER 只根據上述重點整理出:SHIPPED、MOVED、WAITING。
7 每個區塊最多 120 字,每個 SHIPPED 項目都要附上連結。
8SKEPTIC 執行檢查點。SHIPPED 中任何沒有連結的項目,移到 WAITING。
9
10第二段(僅在 PASS 後執行)
11RUNNER 存到 02 review,命名為「Week of [日期]」,並在 00 index 加一行。
12 不要發送給任何人。
13
14然後只傳給我檢查點第 5 題的答案,其他都不用。

11. Dots vs Grok Bot

同屬一個類別,但預設樣貌不同。

text
1 DOTS GROK BOT
2預設樣貌 一個 Agent,多個席位 多個具名的 bot
3記憶 一份,所有席位共享 每個 bot 各有一份
4運行環境 ChatGPT、Slack、Teams 自己的 App 和對話
5適合情境 一個人的整週工作、一本規則手冊 互不相干的獨立任務

如果你的各項工作需要共享上下文(收件匣餵給摘要,摘要再餵給週一計畫),用一個 dot 配四個席位會更簡單。如果它們絕對不能互相看到(客戶 A 和客戶 B),分開的 bot 才是更乾淨的界線。

12. 防護機制

text
1鏈條超過 5 步 -> 停下來,執行檢查點,等待 PASS
2規則漏洞 -> 先問過我,並指出哪條規則不清楚
3發給任何真人的訊息 -> 永遠都要先問過我
4密碼、帳單、刪除、公開發文 -> 封鎖
5任務中途遇到登入或驗證碼 -> 接手 dot 的電腦親自處理
6連續兩週每天核准超過 5 次 -> 調整權限層級或縮小資料源範圍
7SKEPTIC 開始寫稱讚的話 -> 重寫檢查點規則,而不是重寫成品

每一道防護機制,都是把不確定性推回給你,而不是推向擅自行動。

13. 我還沒測試的部分

漂移率的數學推演。系統卡上的兩個數字只是粗略的警訊,不是經過驗證的模型。OpenAI 沒說明被標記的越界問題具體是什麼,所以我無法判斷有多嚴重。

Skeptic 的攔截率。五分之四是為了展示數學結構而做的假設。dot 檢查自己的作品不等於獨立審查者,實際攔截率可能會更低。

範例週。420 個動作和各層級的比例,是我針對「研究+草稿型 dot」的估算,不是真實帳號的日誌。

第一個 dot 之後的定價。OpenAI 表示未來可以新增更多 dot,並依速度或每月工作量擴充,但目前尚未公布價格。

14. 實戰守則

在接上任何 App 之前,先把工作寫清楚。

一個 Agent、四個席位、一次只坐一個。

每五步就切斷鏈條。做完檢查點,再繼續。

先寫允許清單。規則漏洞一律歸類為「先問過我」。

每天核准次數壓在五次以內,否則你的審查形同虛設。

給工作成果一個落腳處,並在週五檢視索引頁。

fleyta - inline image

重點整理

Dots 是大多數人第一次會放著讓它在自己睡覺時繼續跑的 Agent。這讓問題從「它能不能完成任務」變成了「在有人查看之前,它會跑多遠」。

OpenAI 自己的系統卡已經給了暗示:鏈條長度翻倍,被標記的次數不只翻倍。

所以,別去打造更長的鏈條。改成較短的段落、每段結尾安排一個 Skeptic,再加上一套只在真正值得問的時候才來煩你的權限階梯。

五步,然後檢查。就這麼簡單。

上線細節取自 OpenAI 的 dots 公告。系統卡數據引用自 The New Stack 的報導。方案價格來自 2026 年 10 月 1 日的上線相關報導,日後可能有所變動。

一鍵儲存

使用 YouMind AI 深度閱讀爆款文章

保存原文、追問細節、總結觀點,並在一個 AI 工作空間裡把爆款文章沉澱成可複用筆記。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章