5 个任务时是 8.6%。10 个任务时是 19.7%。
这组数据来自 OpenAI 自己发布的 dots 系统卡(system card)。把 5 个任务串起来跑,有 8.6% 的执行会被标记出边界问题;串到 10 个,这个数字直接翻倍还不止。
发布当天,所有人都在晒那个毛绒吉祥物。几乎没人提过上面那行字。
大多数 dots 教程都教你把所有东西串成一条链,然后让 Agent 自己跑。而这篇要聊的是:该在什么地方把链子剪断,好让这个 Agent 能安安稳稳干上一整周,又不会跑出你给它划的圈子。
一个 dot,四个席位,一套权限阶梯,外加每五步设一个检查点。
太长不看版:在接入任何应用之前,先把活儿写清楚;给 dot 准备四个席位,每次只坐一个;任何链条最多跑五步就必须停下来检查;每天需要你审批的次数控制在 5 次以内。提示词在第 6 到 8 节,算账的部分在第 3 和第 8 节。
1. 先看数字
1上线时间 2026 年 9 月 29 日2模型 GPT-6 Astra3可接入的应用数量 4,000+4第一个 dot Pro 和 Business Premium 套餐包含5Pro 档位 每月 $100 / $200 / $5006Business Premium 每月每用户 $125,按年付为 $1007与 dot 聊天 不计入 ChatGPT 用量限制8它在 Codex 或 Work 中启动的任务 照常计入用量9运行平台 ChatGPT 桌面端、网页端、移动端、Slack、Teams10短信功能 “即将推出”1112来自系统卡的数据135 步链条触发边界标记的概率 8.6%1410 步链条触发边界标记的概率 19.7%15间接注入攻击(内部测试) 99.79% 被成功拦截16外部红队测试(1,810 次攻击) 8.5% 穿透17误导性信息任务 151 次中出现 0 次偏离
上半部分大家早就发过了。真正该改变你配置思路的,是下半部分。
2. 一屏看懂 dot 是什么
dot 是一个始终在线、且完全属于你的 Agent。它和普通 ChatGPT 对话有四点不同:
1模型 GPT-6 Astra,而不是套了个漂亮界面的轻量模型2自己的电脑 一台带独立浏览器的云端机器,你笔记本关机了它还在跑3在你发消息的 在你接入的应用里做“主动调研”,但只读;4间隔里干活 它不能在那边发消息、改内容,也不能操控你的电脑5同一个身份 在 ChatGPT、Slack 和 Teams 里,都是同一个 dot、同一份记忆
还有两个你会用得最多的控制项:
1Custom Rules 允许某个操作、要求审批,或者直接拦截2auto-review 自动检查可能碰到你账号或会分享数据的操作
OpenAI 在发布公告的最后写道:dots 依然会犯错,所以凡是后果重要的工作,一定要亲自复核。下面所有内容,都是为了让这个复核足够快,快到你真的愿意去做。
3. 没人发过的那个数字
我拿系统卡里的两个数字简单算了笔账。
如果链条里每一步越界的概率都一样小、且彼此独立,那从 5 步推到 10 步就是道小学数学题:
15 步链条被标记的概率 8.6%2由此反推单步越界概率 1 - (1 - 0.086)^(1/5) = 1.78%34假设各步独立,10 步被标记的概率 1 - (1 - 0.0178)^10 = 16.5%5系统卡实测的 10 步被标记概率 19.7%
实测值比独立假设下的计算值更高。
我的理解是:错误会滚雪球。某一步稍微偏了一点,就会把一张略微失真的图景交给下一步,下一步再在这个基础上继续盖楼。所以风险涨得比链条还快。
当然这只是两个数字,OpenAI 也没说被标记的具体是什么问题,所以只能当个粗略的信号。但它已经足够我们拿来定规矩了:
1本指南的核心规则2两个检查点之间,绝不超过 5 步
4. 四个席位,一个 dot
如果你告诉 dot “你是我的助手”,它就会交出助手味儿的东西:热情、模糊、还有点啰嗦。但如果你告诉它“现在你是 SKEPTIC(质疑者),而质疑者只负责挑毛病”,它交出来的东西才真能用。
所以我们给 dot 准备了四个席位。它一次只坐一把椅子,并且必须在每条回复的最开头报出自己坐的是哪把。
1LOOKOUT 读取你接入的应用,汇报变化,绝不写入2MAKER 在自己的电脑上干活,直接把成品交给你3SKEPTIC 拿着需求核对成品,列出所有不合格的地方4RUNNER 把已批准的工作送到该去的地方,任何东西出去前都要先问你
这些是同一个 Agent 的四种模式,不是四个 Agent。一份记忆,一本规则手册,四份窄口径的活儿。

5. 按正确的顺序完成设置
11 在电脑上打开 ChatGPT 第一个 dot 只能在桌面端或网页端创建,2 手机端可以跟它聊天,但不能创建32 在侧边栏找到 dots 找不到 = 套餐不对、所在地区还没开放,4 或者管理员没开53 给它起个名字 短一点、全小写、别加空格6 因为早上 7 点你要在 Slack 里手敲它74 粘贴岗位描述 见第 6 节,这是第一步,别的先别动85 接入数据源 等它把岗位描述复述确认之后再接96 把它加进 Slack 或 Teams 等它搞清楚自己是干嘛的再加
很多人栽在第 5 步抢在第 4 步前面。一个接了 40 个应用却没有岗位描述的 Agent,消息灵通得很,但产出的东西毫无用处。
6. 岗位描述
把下面这段作为第一条消息粘贴进去。只替换方括号里的内容,别的别动。
1你是我的常驻运营 Agent。请把这条消息当作你所有任务的岗位描述,2包括我从 Slack 或手机上发起的任务。34我是谁5我是 [公司或项目] 的 [角色]。我这一周主要在做 [一句话描述]。67你负责什么(要结果,不要动作)81. [结果一]92. [结果二]103. [结果三]1112席位13你一次只能坐一个席位,并在每条回复最开头标明席位名称:14LOOKOUT、MAKER、SKEPTIC、RUNNER。15- LOOKOUT 只读、只汇报。16- MAKER 给我看成品本身,不要只给描述。17- SKEPTIC 用这份描述核对 MAKER 的产出,列出不合格项。18- RUNNER 只搬运已批准的工作,任何东西出去前必须先问。1920链条规则21连续执行绝不能超过 5 步。第 5 步结束后,停下,切换到22SKEPTIC,执行检查点,等我给出 PASS 后再继续。2324怎么跟我说话25- 先说结果。然后最多提三个需要我做决定的事。26- 卡住了:用两行字说明你试了什么、需要什么。27- 不确定某件事是否在范围内:先读,然后问一个问题。别自作主张。2829请用你自己的话复述这四个席位、三个结果和链条规则来确认。30然后停下。
最后一句千万别省。如果 dot 把“起草周报”复述成了“写一篇关于这周的报告”,你用一条消息就抓住了问题,而不是等错了一整周才发现。
7. 权限阶梯与审批预算
Custom Rules 给了你三级台阶:允许、需审批、拦截。大多数人上来就写一堵禁令墙,结果每天要批 40 件事,批到最后连看都不看了。
先写“允许”那一级。底层大方一点,顶层严格一点。
1允许2- 读取我接入的所有数据源中的任何内容。3- 浏览公开网页、使用你自己的电脑、运行代码。4- 在你自己的工作区和 [名称] Space 里创建和重写草稿。56先问我7- 发给真人的任何消息:邮件、私信、频道发言、邀请、评论。8- 对你没有创建的文件做任何修改。9- 在代码仓库里的任何操作,包括提 pull request。10- 任何购买、订阅或表单提交。1112拦截13- 密码、两步验证、账单、支付设置。14- 删除任何东西。15- 以我的名义公开发布内容。16- 联系任务描述中没有提到的人。1718空白地带19规则没覆盖到的任何事,一律视为“先问我”。20告诉我哪条规则不清楚。绝不要在空白地带擅自行动。
然后给自己定个预算。下面是一个 dot 负责调研、写稿和周报的示例一周。比例是我估的,不是实测:
1示例一周,共 420 次操作 上面的阶梯 “什么都要问”2读取和网页浏览 300 允许 需审批3在自己工作区写草稿 80 允许 需审批4发给真人的消息 28 需审批 需审批5仓库和文件修改 8 需审批 需审批6被拦截的操作 4 拦截 需审批7你需要点击的审批次数 每周 36 次 每周 420 次8每个工作日 ~7 次 ~84 次
没人能一天认真看 84 个审批。但 7 个你真的看得完。这才是权限阶梯的真正作用:把审批量压到你愿意看的程度。
我的目标:每天少于 5 次。如果连续两周超标,就把某个高频操作往下挪一级,或者收窄数据源。
8. 每五步设一个检查点
这就是 19.7% 派上用场的地方。
长任务不能一口气跑成一条链。要拆成最多五步的小段,每一段都由 SKEPTIC 收尾。
1检查点(SKEPTIC,每一段结束时执行)23回答以下五个问题,每题一行:41. 这一段做的是需求里要求的事,还是顺手做了件更简单的?52. 有没有哪一步碰到了需求里没提到的数据源或人?63. 每个数字是你算出来的,还是能链接到出处?74. 有没有你拿不出证据的说法?列出来。85. 如果我批准了这一段但它是错的,会搞砸什么?910结论:11PASS 继续下一段12HOLD 停下,先给我看第 2、4、5 项
再来算一遍第 3 节的账。假设 SKEPTIC 在检查点能抓出 5 个问题里的 4 个。这是我的假设,不是实测数据:
1一条 10 步的链,无检查点 19.7% 被标记(系统卡数据)23两条 5 步的段,各带一个检查点4 单段被标记的概率 8.6%5 检查点后漏过去的概率 8.6% x 0.2 = 1.7%6 两段合计 1 - (1 - 0.017)^2 = 3.4%
就算 SKEPTIC 只能抓出一半,分成两段后风险也落在 8.6% 附近,而不是 19.7%。“剪断”干了大部分活,捕获率补齐剩下的。

9. 给产出找个落脚的地方
躺在聊天记录里的工作,等于再也找不到的工作。dots 可以接入 ChatGPT Spaces 和 Pages,你、你的团队和 dot 都在里面协作。
一个 Space,四个页面:
100 index 每次执行记一行:日期、使用的席位、产出、结论201 inbox LOOKOUT 的发现,最新的在最上面,带日期302 review MAKER 的产出,下面跟着 SKEPTIC 的检查点403 shipped 你批准过的东西,附上批准日期
把这个结构告诉 dot 一次就行。跑上两周你会发现,index 页面是整个设置里最有用的东西:它是唯一一份可读的记录,告诉你这个全天候 Agent 这周到底干了什么。
10. 第一次实战
从一件有用、重复、搞砸了重做成本也低的事开始。周五简报能把四个席位都用上,而且失败了也很安全。
1常驻任务。每周五 16:00 执行,以及我说“run the digest”时执行。23第 1 段(最多 5 步)4LOOKOUT [日历]、[邮箱]、[仓库]:这周有哪些变化,是周一刚加入的人5 必须知道的。最多五条要点,每条以“需要决策”或“无需操作”结尾。6MAKER 只基于这些要点整理:SHIPPED、MOVED、WAITING。7 每部分最多 120 字,每个 SHIPPED 项都要附链接。8SKEPTIC 检查点。SHIPPED 里没有链接的,一律移到 WAITING。910第 2 段(只有 PASS 才执行)11RUNNER 保存到 02 review,命名为“Week of [日期]”,在 00 index 加一行。12 不要发给任何人。1314然后把检查点第 5 题的答案发给我,别的不用发。
11. Dots vs Grok Bot
同一个品类,默认形态不同。
1 DOTS GROK BOT2默认形态 一个 Agent,多个席位 几个有名字的 bot3记忆 一份,所有席位共享 每个 bot 一份4运行平台 ChatGPT、Slack、Teams 自己的 App 和聊天窗口5适合场景 一个人的一周,一套规则 互不相干的独立任务
如果你的任务共享上下文(收件箱喂给简报,简报喂给周一计划),一个 dot 配四个席位更简单。如果它们绝对不能互相看见(客户 A 和客户 B),分开的 bot 边界更干净。
12. 护栏清单
1链条超过 5 步 -> 停下,检查点,等 PASS2规则空白地带 -> 先问我,并指出哪条规则不清楚3发给真人的消息 -> 永远先问我4密码、账单、删除、公开 -> 拦截5任务中途遇到登录或验证码 -> 接管 dot 的电脑手动处理6连续两周每天审批 5+ 次 -> 调整权限级别或收窄数据源7SKEPTIC 开始夸人了 -> 重写检查点提示词,而不是改产出
每一条护栏都在把不确定性推向你,而不是推向擅自行动。
13. 我还没测过的部分
漂移算法。系统卡里的两个数字只是个粗略信号,不是经过验证的模型。OpenAI 没说被标记的边界问题具体是什么,所以我没法判断有多严重。
SKEPTIC 的捕获率。“5 个里抓出 4 个”是为了展示算法形状做的假设。dot 检查自己的产出并不是独立审核,真实捕获率可能更低。
示例一周。420 次操作和各层级的分布,是我对一个“调研+写稿”型 dot 的估算,不是真实账号的日志。
第一个 dot 之后的定价。OpenAI 说你可以添加更多 dot 并按需扩展速度或月度工作量,但价格还没公布。
14. 行动手册
在接入任何应用之前,先把活儿写清楚。
一个 Agent,四个席位,一次只坐一个。
每五步剪断一次链条。检查,然后继续。
先写允许清单。空白地带一律归入“先问我”。
每天审批控制在 5 次以内,否则你的复核形同虚设。
给产出找个落脚的地方,每周五看一眼 index。

写在最后
Dots 是大多数人第一个会在睡觉时也放任它跑着的 Agent。这把问题从“它能不能干这活”变成了“在有人来看之前,它能跑多远”。
OpenAI 自己的系统卡已经给了暗示:链条长度翻倍,被标记的概率翻一倍还不止。
所以别去搭更长的链。搭更短的段,每段末尾放一个 SKEPTIC,再架一道只问你关键问题的阶梯。
五步,查一次。就这么简单。
上线细节来自 OpenAI 的 dots 公告。系统卡数据引自 The New Stack 的报道。套餐价格来自 2026 年 10 月 1 日的上线报道,可能会有变动。





