5 個任務時是 8.6%,10 個任務時是 19.7%。
這組數據出自 OpenAI 官方針對 dots 發布的系統卡(system card)。把 5 個任務串在一起,就有 8.6% 的執行會因為越界問題被標記;串到 10 個,這個比例直接翻倍還多。
上線那天,所有人都在曬那些絨毛吉祥物,卻幾乎沒人注意到這行字。
多數 dots 指南都教你把所有東西串起來,然後放手讓 Agent 自己跑。但這篇要談的是「在哪裡切斷鏈條」,好讓 Agent 跑上一整週,也不會跑出你交辦的工作範圍。
一個 dot、四個席位、一套權限階梯,外加每五步設一個檢查點。
懶人包:在接上任何 App 之前,先把工作寫清楚;給 dot 四個席位,但一次只坐一個;任何鏈條跑超過五步就必須停下來檢查;每天需要人工核准的次數控制在五次以內。提示詞在第 6 到 8 節,數學推演在第 3 和第 8 節。
1. 先看數字
1上線日期 2026 年 9 月 29 日2模型 GPT-6 Astra3可連接的 App 數量 4,000+4第一個 dot Pro 與 Business Premium 方案內含5Pro 方案級距 每月 $100 / $200 / $5006Business Premium 每位使用者每月 $125,年繳每月 $1007與 dot 對話 不計入 ChatGPT 用量上限8它在 Codex 或 Work 中啟動的任務 照常計入用量9運行環境 ChatGPT 桌面版、網頁版、行動版、Slack、Teams10簡訊功能 「即將推出」1112摘自系統卡135 步鏈條的越界標記率 8.6%1410 步鏈條的越界標記率 19.7%15間接注入攻擊(內部測試) 99.79% 成功防禦16外部紅隊測試(1,810 次攻擊) 8.5% 突破防線17誤導性資訊任務 151 項中 0 項偏離對齊目標
上面那張表大家早就貼爛了,真正該改變你設定方式的,是下面那張。
2. 一張圖看懂 dot 是什麼
dot 是一個全天候待命、專屬於你的 Agent。它跟一般 ChatGPT 對話有四個不同之處:
1模型 GPT-6 Astra,不是披著漂亮介面的輕量模型2自己的電腦 一台雲端機器,有自己的瀏覽器,就算你筆電關機它照跑3在你傳訊息 會在已連接的 App 裡「主動研究」,但唯讀4的空檔工作 不能在那裡發送訊息、修改 App 內容或操控你的電腦5單一身分 同一個 dot、同一份記憶,橫跨 ChatGPT、Slack 和 Teams
還有兩個你會最常用到的控制項:
1Custom Rules(自訂規則) 允許某個動作、要求先核准,或直接封鎖2auto-review(自動審查) 檢查可能動到你的帳號或分享資料的動作
OpenAI 在上線公告最後提醒:dots 還是會犯錯,所以重要工作一定要親自檢查。以下所有內容,都是為了讓這個檢查過程夠快,快到你真的願意去做。
3. 沒人貼出來的那個數字
我拿系統卡上的兩個數字簡單算了一下。
如果鏈條中每一步越界的機率都一樣小、而且彼此獨立,那從 5 步推到 10 步只需要簡單的數學:
15 步鏈條被標記的機率 8.6%2換算出每一步的越界機率 1 - (1 - 0.086)^(1/5) = 1.78%34若各步獨立,10 步的越界機率 1 - (1 - 0.0178)^10 = 16.5%5系統卡實際測出的 10 步越界機率 19.7%
實測數字比「各自獨立」算出來的還要高。
我的解讀是:錯誤會堆疊。某一步稍微走偏,就會把略微失真的結果交給下一步,而下一步又踩在這個失真上繼續蓋。所以風險成長的速度,比鏈條拉長的速度更快。
這畢竟只有兩個數字,OpenAI 也沒說明被標記的具體問題是什麼,所以把它當成粗略的警訊就好。但它已經足夠讓我們建立一條原則:
1本指南的核心原則2兩個檢查點之間,絕對不超過 5 步
4. 四個席位,一個 dot
如果你告訴 dot「你是我的助理」,它產出的就是標準助理風格的東西:有幫助、很空泛、稍微冗長一點。但如果你說「現在你是 Skeptic,而 Skeptic 只負責挑毛病」,它給出的東西才真的能用。
所以我們給 dot 四個席位。它一次只坐一個,而且在每次回覆的最上方註明自己坐在哪。
1LOOKOUT 讀取你已連接的 App,回報變動,絕不寫入2MAKER 在自己的電腦上工作,直接把成品交給你3SKEPTIC 拿成品對照需求簡報,列出哪裡不合格4RUNNER 把核准後的成果送到該去的地方,任何東西送出前都要先問過
這些是同一個 Agent 的四種模式,不是四個 Agent。一份記憶、一本規則手冊、四項專職工作。

5. 設定流程(順序很重要)
11 用電腦開啟 ChatGPT 第一個 dot 只能在桌面版或網頁版建立,2 手機版可以跟它對話,但不能建立32 在側邊欄找到 dots 找不到=方案不對、尚未開放你的地區,4 或管理員還沒開啟53 幫它命名 簡短、全小寫、不加空格6 想像你早上七點要在 Slack 裡打這個名字74 貼上工作描述 見第 6 節,這是第一步,其他都先別做85 連接資料來源 等它向你複述確認工作內容後再做96 加到 Slack 或 Teams 等它搞清楚自己是來幹嘛的之後再加
很多人都在「第 5 步要排在第 4 步後面」這裡搞錯。一個接了 40 個 App 卻沒有需求簡報的 Agent,只是消息非常靈通,但產不出任何有用的東西。
6. 工作描述
把這段當作第一則訊息貼上去。只替換括號裡的內容,其餘不要動。
1你是我的常駐營運 Agent。請把這則訊息當作你所有任務的工作描述,2包含我從 Slack 或手機發起的任務。34我是誰5我是 [公司或專案] 的 [職位]。我一週的主要工作是 [一句話描述]。67你負責什麼(要結果,不是要動作)81. [成果一]92. [成果二]103. [成果三]1112席位13你一次只能坐一個席位,並且要在每次回覆的最上方註明是哪一個:14LOOKOUT、MAKER、SKEPTIC、RUNNER。15- LOOKOUT 只讀取和回報。16- MAKER 直接給我看成品,不要給我成品的描述。17- SKEPTIC 拿 MAKER 的成果對照這份簡報,列出哪裡不合格。18- RUNNER 只搬運已核准的成果,任何東西送出前都要先問過我。1920鏈條規則21連續執行的步驟絕對不能超過 5 步。第 5 步結束後,停下來,切換成22SKEPTIC,執行檢查點,等到 PASS 才能繼續。2324怎麼跟我溝通25- 先講結果。接著最多提三件需要我決定的事。26- 卡住時:用兩行說明你試了什麼、你需要什麼。27- 不確定某件事是否在範圍內:先讀取,再問一個問題。不要擅自行動。2829請用你自己的話複述這四個席位、三項成果和鏈條規則來確認。然後停下。
最後一行千萬別省。如果 dot 把「草擬每週報告」複述成「寫一篇關於這一週的報告」,你就能用一則訊息抓出問題,而不是收到一整週的錯誤報告才發現。
7. 權限階梯與核准預算
Custom Rules 提供三個層級:允許、需核准、封鎖。多數人會寫出一整面牆的禁令,結果每天要核准 40 件事,最後根本懶得看自己到底准了什麼。
先寫「允許」那一層。底層大方一點,頂層嚴格一點。
1允許2- 讀取我已連接資料源中的任何內容。3- 瀏覽公開網路、使用你自己的電腦、執行程式碼。4- 在你自己的工作區和 [名稱] Space 中建立與改寫草稿。56先問過我7- 任何發給真人的訊息:Email、私訊、頻道貼文、邀請、留言。8- 任何對非你建立的檔案所做的修改。9- 儲存庫中的任何動作,包含開 pull request。10- 任何購買、訂閱或表單提交。1112封鎖13- 密碼、雙重驗證(2FA)、帳單、付款設定。14- 刪除任何東西。15- 以我的名義公開發文。16- 聯繫任務簡報中未提及的任何人。1718漏洞19規則沒涵蓋到的任何事,一律視為「先問過我」。20告訴我哪條規則不清楚。遇到漏洞時,絕不可擅自採取行動。
接著給自己編列一份預算。以下是一個負責研究、寫草稿和每週摘要的 dot 的範例週。比例是我的估算,不是實測數據:
1範例一週,共 420 個動作 上述階梯制度 「凡事都要問」制度2讀取與上網 300 允許 需核准3在自己工作區寫草稿 80 允許 需核准4發給真人的訊息 28 需核准 需核准5儲存庫與檔案修改 8 需核准 需核准6被封鎖的嘗試 4 封鎖 需核准7你需要點擊的核准次數 每週 36 次 每週 420 次8每個工作日 約 7 次 約 84 次
沒有人能一天看完 84 個核准請求,但你真的看得完 7 個。這就是權限階梯真正的用途:把核准數量壓低到你还願意認真看的程度。
我的目標:每天五次以內。如果連續兩週都超標,就把某項例行動作往下調一層,或是縮小資料源的範圍。
8. 每五步一次的檢查點
這就是 19.7% 那個數字派上用場的地方。
長任務不能一口氣跑成一條長鏈,而是要切成最多五步的小段,每一段都由 Skeptic 收尾。
1檢查點(Skeptic,於每一段結束時執行)23回答以下五個問題,每個問題一行:41. 這一段完成的是簡報要求的事,還是它附近比較簡單的事?52. 是否有任何一步接觸到簡報中未提及的資料源或人員?63. 每個數字是你自己算出來的,還是有附上你讀取該數字的來源連結?74. 有沒有哪個主張是你指不出證據的?列出來。85. 如果我核准了這一段但它是錯的,會搞砸什麼?910判定:11PASS 繼續下一段12HOLD 停下來,先給我看第 2、4、5 項
現在用第 3 節的方式粗略算一下。假設 Skeptic 在檢查點能抓出五分之四的問題——這是我的假設,不是實測數據:
1一條 10 步鏈條,無檢查點 19.7% 被標記(系統卡數據)23分成兩段 5 步,各有一個檢查點4 每段被標記的機率 8.6%5 經過檢查點後殘留的機率 8.6% x 0.2 = 1.7%6 兩段合計的越界機率 1 - (1 - 0.017)^2 = 3.4%
就算 Skeptic 只抓出一半,兩段的總風險也會落在 8.6% 左右,而不是 19.7%。「切斷」承擔了大部分功勞,攔截率補足剩下的。

9. 給工作成果一個落腳處
留在聊天串裡的工作成果,等於再也找不到的工作成果。dots 可以接入 ChatGPT Spaces 和 Pages,讓你、你的團隊和 dot 都在同一個地方協作。
一個 Space,四個頁面:
100 index 每次執行一行紀錄:日期、使用的席位、成品、判定結果201 inbox LOOKOUT 的發現,最新的在最上面,附日期302 review MAKER 的成品,下方附上 SKEPTIC 的檢查點紀錄403 shipped 你核准過的項目,附上核准日期
只要跟 dot 說明一次這個架構。兩週後你會發現,索引頁是整套設定中最有價值的東西:它是唯一能讓人看懂「一個全天候 Agent 這週到底做了什麼」的紀錄。
10. 第一次正式執行
從有用、會重複執行、而且搞砸了重做成本很低的事情開始。例如「週五摘要」就能用到全部四個席位,而且失敗了也很安全。
1常駐任務。每週五 16:00 執行,以及當我說「run the digest」時執行。23第一段(最多 5 步)4LOOKOUT [行事曆]、[Email]、[儲存庫]:這週有哪些變動,是週一新進同事5 必須知道的。最多五個重點,每個結尾標註「需決定」或「無需行動」。6MAKER 只根據上述重點整理出:SHIPPED、MOVED、WAITING。7 每個區塊最多 120 字,每個 SHIPPED 項目都要附上連結。8SKEPTIC 執行檢查點。SHIPPED 中任何沒有連結的項目,移到 WAITING。910第二段(僅在 PASS 後執行)11RUNNER 存到 02 review,命名為「Week of [日期]」,並在 00 index 加一行。12 不要發送給任何人。1314然後只傳給我檢查點第 5 題的答案,其他都不用。
11. Dots vs Grok Bot
同屬一個類別,但預設樣貌不同。
1 DOTS GROK BOT2預設樣貌 一個 Agent,多個席位 多個具名的 bot3記憶 一份,所有席位共享 每個 bot 各有一份4運行環境 ChatGPT、Slack、Teams 自己的 App 和對話5適合情境 一個人的整週工作、一本規則手冊 互不相干的獨立任務
如果你的各項工作需要共享上下文(收件匣餵給摘要,摘要再餵給週一計畫),用一個 dot 配四個席位會更簡單。如果它們絕對不能互相看到(客戶 A 和客戶 B),分開的 bot 才是更乾淨的界線。
12. 防護機制
1鏈條超過 5 步 -> 停下來,執行檢查點,等待 PASS2規則漏洞 -> 先問過我,並指出哪條規則不清楚3發給任何真人的訊息 -> 永遠都要先問過我4密碼、帳單、刪除、公開發文 -> 封鎖5任務中途遇到登入或驗證碼 -> 接手 dot 的電腦親自處理6連續兩週每天核准超過 5 次 -> 調整權限層級或縮小資料源範圍7SKEPTIC 開始寫稱讚的話 -> 重寫檢查點規則,而不是重寫成品
每一道防護機制,都是把不確定性推回給你,而不是推向擅自行動。
13. 我還沒測試的部分
漂移率的數學推演。系統卡上的兩個數字只是粗略的警訊,不是經過驗證的模型。OpenAI 沒說明被標記的越界問題具體是什麼,所以我無法判斷有多嚴重。
Skeptic 的攔截率。五分之四是為了展示數學結構而做的假設。dot 檢查自己的作品不等於獨立審查者,實際攔截率可能會更低。
範例週。420 個動作和各層級的比例,是我針對「研究+草稿型 dot」的估算,不是真實帳號的日誌。
第一個 dot 之後的定價。OpenAI 表示未來可以新增更多 dot,並依速度或每月工作量擴充,但目前尚未公布價格。
14. 實戰守則
在接上任何 App 之前,先把工作寫清楚。
一個 Agent、四個席位、一次只坐一個。
每五步就切斷鏈條。做完檢查點,再繼續。
先寫允許清單。規則漏洞一律歸類為「先問過我」。
每天核准次數壓在五次以內,否則你的審查形同虛設。
給工作成果一個落腳處,並在週五檢視索引頁。

重點整理
Dots 是大多數人第一次會放著讓它在自己睡覺時繼續跑的 Agent。這讓問題從「它能不能完成任務」變成了「在有人查看之前,它會跑多遠」。
OpenAI 自己的系統卡已經給了暗示:鏈條長度翻倍,被標記的次數不只翻倍。
所以,別去打造更長的鏈條。改成較短的段落、每段結尾安排一個 Skeptic,再加上一套只在真正值得問的時候才來煩你的權限階梯。
五步,然後檢查。就這麼簡單。
上線細節取自 OpenAI 的 dots 公告。系統卡數據引用自 The New Stack 的報導。方案價格來自 2026 年 10 月 1 日的上線相關報導,日後可能有所變動。





