YouMind
登录

OpenAI Dots:如何构建防止漂移的 4 席位 Agent 团队(完整指南)

@fleyta88
英语2026年10月01日
126K
90
5
10
150

TL;DR

本指南详解如何通过四席位角色系统(观察员、执行者、质疑者、运行者)配置 OpenAI Dots Agents,并利用严格的五步检查点和权限阶梯来防止任务漂移。

5 个任务时是 8.6%。10 个任务时是 19.7%。

这组数据来自 OpenAI 自己发布的 dots 系统卡(system card)。把 5 个任务串起来跑,有 8.6% 的执行会被标记出边界问题;串到 10 个,这个数字直接翻倍还不止。

发布当天,所有人都在晒那个毛绒吉祥物。几乎没人提过上面那行字。

大多数 dots 教程都教你把所有东西串成一条链,然后让 Agent 自己跑。而这篇要聊的是:该在什么地方把链子剪断,好让这个 Agent 能安安稳稳干上一整周,又不会跑出你给它划的圈子。

一个 dot,四个席位,一套权限阶梯,外加每五步设一个检查点。

太长不看版:在接入任何应用之前,先把活儿写清楚;给 dot 准备四个席位,每次只坐一个;任何链条最多跑五步就必须停下来检查;每天需要你审批的次数控制在 5 次以内。提示词在第 6 到 8 节,算账的部分在第 3 和第 8 节。

1. 先看数字

text
1上线时间 2026 年 9 月 29 日
2模型 GPT-6 Astra
3可接入的应用数量 4,000+
4第一个 dot Pro 和 Business Premium 套餐包含
5Pro 档位 每月 $100 / $200 / $500
6Business Premium 每月每用户 $125,按年付为 $100
7与 dot 聊天 不计入 ChatGPT 用量限制
8它在 Codex 或 Work 中启动的任务 照常计入用量
9运行平台 ChatGPT 桌面端、网页端、移动端、Slack、Teams
10短信功能 “即将推出”
11
12来自系统卡的数据
135 步链条触发边界标记的概率 8.6%
1410 步链条触发边界标记的概率 19.7%
15间接注入攻击(内部测试) 99.79% 被成功拦截
16外部红队测试(1,810 次攻击) 8.5% 穿透
17误导性信息任务 151 次中出现 0 次偏离

上半部分大家早就发过了。真正该改变你配置思路的,是下半部分。

2. 一屏看懂 dot 是什么

dot 是一个始终在线、且完全属于你的 Agent。它和普通 ChatGPT 对话有四点不同:

text
1模型 GPT-6 Astra,而不是套了个漂亮界面的轻量模型
2自己的电脑 一台带独立浏览器的云端机器,你笔记本关机了它还在跑
3在你发消息的 在你接入的应用里做“主动调研”,但只读;
4间隔里干活 它不能在那边发消息、改内容,也不能操控你的电脑
5同一个身份 在 ChatGPT、Slack 和 Teams 里,都是同一个 dot、同一份记忆

还有两个你会用得最多的控制项:

text
1Custom Rules 允许某个操作、要求审批,或者直接拦截
2auto-review 自动检查可能碰到你账号或会分享数据的操作

OpenAI 在发布公告的最后写道:dots 依然会犯错,所以凡是后果重要的工作,一定要亲自复核。下面所有内容,都是为了让这个复核足够快,快到你真的愿意去做。

3. 没人发过的那个数字

我拿系统卡里的两个数字简单算了笔账。

如果链条里每一步越界的概率都一样小、且彼此独立,那从 5 步推到 10 步就是道小学数学题:

text
15 步链条被标记的概率 8.6%
2由此反推单步越界概率 1 - (1 - 0.086)^(1/5) = 1.78%
3
4假设各步独立,10 步被标记的概率 1 - (1 - 0.0178)^10 = 16.5%
5系统卡实测的 10 步被标记概率 19.7%

实测值比独立假设下的计算值更高。

我的理解是:错误会滚雪球。某一步稍微偏了一点,就会把一张略微失真的图景交给下一步,下一步再在这个基础上继续盖楼。所以风险涨得比链条还快。

当然这只是两个数字,OpenAI 也没说被标记的具体是什么问题,所以只能当个粗略的信号。但它已经足够我们拿来定规矩了:

text
1本指南的核心规则
2两个检查点之间,绝不超过 5 步

4. 四个席位,一个 dot

如果你告诉 dot “你是我的助手”,它就会交出助手味儿的东西:热情、模糊、还有点啰嗦。但如果你告诉它“现在你是 SKEPTIC(质疑者),而质疑者只负责挑毛病”,它交出来的东西才真能用。

所以我们给 dot 准备了四个席位。它一次只坐一把椅子,并且必须在每条回复的最开头报出自己坐的是哪把。

text
1LOOKOUT 读取你接入的应用,汇报变化,绝不写入
2MAKER 在自己的电脑上干活,直接把成品交给你
3SKEPTIC 拿着需求核对成品,列出所有不合格的地方
4RUNNER 把已批准的工作送到该去的地方,任何东西出去前都要先问你

这些是同一个 Agent 的四种模式,不是四个 Agent。一份记忆,一本规则手册,四份窄口径的活儿。

fleyta - inline image

5. 按正确的顺序完成设置

text
11 在电脑上打开 ChatGPT 第一个 dot 只能在桌面端或网页端创建,
2 手机端可以跟它聊天,但不能创建
32 在侧边栏找到 dots 找不到 = 套餐不对、所在地区还没开放,
4 或者管理员没开
53 给它起个名字 短一点、全小写、别加空格
6 因为早上 7 点你要在 Slack 里手敲它
74 粘贴岗位描述 见第 6 节,这是第一步,别的先别动
85 接入数据源 等它把岗位描述复述确认之后再接
96 把它加进 Slack 或 Teams 等它搞清楚自己是干嘛的再加

很多人栽在第 5 步抢在第 4 步前面。一个接了 40 个应用却没有岗位描述的 Agent,消息灵通得很,但产出的东西毫无用处。

6. 岗位描述

把下面这段作为第一条消息粘贴进去。只替换方括号里的内容,别的别动。

text
1你是我的常驻运营 Agent。请把这条消息当作你所有任务的岗位描述,
2包括我从 Slack 或手机上发起的任务。
3
4我是谁
5我是 [公司或项目] 的 [角色]。我这一周主要在做 [一句话描述]。
6
7你负责什么(要结果,不要动作)
81. [结果一]
92. [结果二]
103. [结果三]
11
12席位
13你一次只能坐一个席位,并在每条回复最开头标明席位名称:
14LOOKOUT、MAKER、SKEPTIC、RUNNER。
15- LOOKOUT 只读、只汇报。
16- MAKER 给我看成品本身,不要只给描述。
17- SKEPTIC 用这份描述核对 MAKER 的产出,列出不合格项。
18- RUNNER 只搬运已批准的工作,任何东西出去前必须先问。
19
20链条规则
21连续执行绝不能超过 5 步。第 5 步结束后,停下,切换到
22SKEPTIC,执行检查点,等我给出 PASS 后再继续。
23
24怎么跟我说话
25- 先说结果。然后最多提三个需要我做决定的事。
26- 卡住了:用两行字说明你试了什么、需要什么。
27- 不确定某件事是否在范围内:先读,然后问一个问题。别自作主张。
28
29请用你自己的话复述这四个席位、三个结果和链条规则来确认。
30然后停下。

最后一句千万别省。如果 dot 把“起草周报”复述成了“写一篇关于这周的报告”,你用一条消息就抓住了问题,而不是等错了一整周才发现。

7. 权限阶梯与审批预算

Custom Rules 给了你三级台阶:允许、需审批、拦截。大多数人上来就写一堵禁令墙,结果每天要批 40 件事,批到最后连看都不看了。

先写“允许”那一级。底层大方一点,顶层严格一点。

text
1允许
2- 读取我接入的所有数据源中的任何内容。
3- 浏览公开网页、使用你自己的电脑、运行代码。
4- 在你自己的工作区和 [名称] Space 里创建和重写草稿。
5
6先问我
7- 发给真人的任何消息:邮件、私信、频道发言、邀请、评论。
8- 对你没有创建的文件做任何修改。
9- 在代码仓库里的任何操作,包括提 pull request。
10- 任何购买、订阅或表单提交。
11
12拦截
13- 密码、两步验证、账单、支付设置。
14- 删除任何东西。
15- 以我的名义公开发布内容。
16- 联系任务描述中没有提到的人。
17
18空白地带
19规则没覆盖到的任何事,一律视为“先问我”。
20告诉我哪条规则不清楚。绝不要在空白地带擅自行动。

然后给自己定个预算。下面是一个 dot 负责调研、写稿和周报的示例一周。比例是我估的,不是实测:

text
1示例一周,共 420 次操作 上面的阶梯 “什么都要问”
2读取和网页浏览 300 允许 需审批
3在自己工作区写草稿 80 允许 需审批
4发给真人的消息 28 需审批 需审批
5仓库和文件修改 8 需审批 需审批
6被拦截的操作 4 拦截 需审批
7你需要点击的审批次数 每周 36 次 每周 420 次
8每个工作日 ~7 次 ~84 次

没人能一天认真看 84 个审批。但 7 个你真的看得完。这才是权限阶梯的真正作用:把审批量压到你愿意看的程度。

我的目标:每天少于 5 次。如果连续两周超标,就把某个高频操作往下挪一级,或者收窄数据源。

8. 每五步设一个检查点

这就是 19.7% 派上用场的地方。

长任务不能一口气跑成一条链。要拆成最多五步的小段,每一段都由 SKEPTIC 收尾。

text
1检查点(SKEPTIC,每一段结束时执行)
2
3回答以下五个问题,每题一行:
41. 这一段做的是需求里要求的事,还是顺手做了件更简单的?
52. 有没有哪一步碰到了需求里没提到的数据源或人?
63. 每个数字是你算出来的,还是能链接到出处?
74. 有没有你拿不出证据的说法?列出来。
85. 如果我批准了这一段但它是错的,会搞砸什么?
9
10结论:
11PASS 继续下一段
12HOLD 停下,先给我看第 2、4、5 项

再来算一遍第 3 节的账。假设 SKEPTIC 在检查点能抓出 5 个问题里的 4 个。这是我的假设,不是实测数据:

text
1一条 10 步的链,无检查点 19.7% 被标记(系统卡数据)
2
3两条 5 步的段,各带一个检查点
4 单段被标记的概率 8.6%
5 检查点后漏过去的概率 8.6% x 0.2 = 1.7%
6 两段合计 1 - (1 - 0.017)^2 = 3.4%

就算 SKEPTIC 只能抓出一半,分成两段后风险也落在 8.6% 附近,而不是 19.7%。“剪断”干了大部分活,捕获率补齐剩下的。

fleyta - inline image

9. 给产出找个落脚的地方

躺在聊天记录里的工作,等于再也找不到的工作。dots 可以接入 ChatGPT Spaces 和 Pages,你、你的团队和 dot 都在里面协作。

一个 Space,四个页面:

text
100 index 每次执行记一行:日期、使用的席位、产出、结论
201 inbox LOOKOUT 的发现,最新的在最上面,带日期
302 review MAKER 的产出,下面跟着 SKEPTIC 的检查点
403 shipped 你批准过的东西,附上批准日期

把这个结构告诉 dot 一次就行。跑上两周你会发现,index 页面是整个设置里最有用的东西:它是唯一一份可读的记录,告诉你这个全天候 Agent 这周到底干了什么。

10. 第一次实战

从一件有用、重复、搞砸了重做成本也低的事开始。周五简报能把四个席位都用上,而且失败了也很安全。

text
1常驻任务。每周五 16:00 执行,以及我说“run the digest”时执行。
2
3第 1 段(最多 5 步)
4LOOKOUT [日历]、[邮箱]、[仓库]:这周有哪些变化,是周一刚加入的人
5 必须知道的。最多五条要点,每条以“需要决策”或“无需操作”结尾。
6MAKER 只基于这些要点整理:SHIPPED、MOVED、WAITING。
7 每部分最多 120 字,每个 SHIPPED 项都要附链接。
8SKEPTIC 检查点。SHIPPED 里没有链接的,一律移到 WAITING。
9
10第 2 段(只有 PASS 才执行)
11RUNNER 保存到 02 review,命名为“Week of [日期]”,在 00 index 加一行。
12 不要发给任何人。
13
14然后把检查点第 5 题的答案发给我,别的不用发。

11. Dots vs Grok Bot

同一个品类,默认形态不同。

text
1 DOTS GROK BOT
2默认形态 一个 Agent,多个席位 几个有名字的 bot
3记忆 一份,所有席位共享 每个 bot 一份
4运行平台 ChatGPT、Slack、Teams 自己的 App 和聊天窗口
5适合场景 一个人的一周,一套规则 互不相干的独立任务

如果你的任务共享上下文(收件箱喂给简报,简报喂给周一计划),一个 dot 配四个席位更简单。如果它们绝对不能互相看见(客户 A 和客户 B),分开的 bot 边界更干净。

12. 护栏清单

text
1链条超过 5 步 -> 停下,检查点,等 PASS
2规则空白地带 -> 先问我,并指出哪条规则不清楚
3发给真人的消息 -> 永远先问我
4密码、账单、删除、公开 -> 拦截
5任务中途遇到登录或验证码 -> 接管 dot 的电脑手动处理
6连续两周每天审批 5+ 次 -> 调整权限级别或收窄数据源
7SKEPTIC 开始夸人了 -> 重写检查点提示词,而不是改产出

每一条护栏都在把不确定性推向你,而不是推向擅自行动。

13. 我还没测过的部分

漂移算法。系统卡里的两个数字只是个粗略信号,不是经过验证的模型。OpenAI 没说被标记的边界问题具体是什么,所以我没法判断有多严重。

SKEPTIC 的捕获率。“5 个里抓出 4 个”是为了展示算法形状做的假设。dot 检查自己的产出并不是独立审核,真实捕获率可能更低。

示例一周。420 次操作和各层级的分布,是我对一个“调研+写稿”型 dot 的估算,不是真实账号的日志。

第一个 dot 之后的定价。OpenAI 说你可以添加更多 dot 并按需扩展速度或月度工作量,但价格还没公布。

14. 行动手册

在接入任何应用之前,先把活儿写清楚。

一个 Agent,四个席位,一次只坐一个。

每五步剪断一次链条。检查,然后继续。

先写允许清单。空白地带一律归入“先问我”。

每天审批控制在 5 次以内,否则你的复核形同虚设。

给产出找个落脚的地方,每周五看一眼 index。

fleyta - inline image

写在最后

Dots 是大多数人第一个会在睡觉时也放任它跑着的 Agent。这把问题从“它能不能干这活”变成了“在有人来看之前,它能跑多远”。

OpenAI 自己的系统卡已经给了暗示:链条长度翻倍,被标记的概率翻一倍还不止。

所以别去搭更长的链。搭更短的段,每段末尾放一个 SKEPTIC,再架一道只问你关键问题的阶梯。

五步,查一次。就这么简单。

上线细节来自 OpenAI 的 dots 公告。系统卡数据引自 The New Stack 的报道。套餐价格来自 2026 年 10 月 1 日的上线报道,可能会有变动。

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章