YouMind
Đăng nhập

OpenAI Dots: Cách xây dựng đội ngũ Agent 4 vị trí để ngăn chặn tình trạng trôi dạt (Hướng dẫn đầy đủ)

@fleyta88
TIẾNG ANH01 thg 10, 2026
126K
90
5
10
150

TL;DR

Hướng dẫn này giải thích cách cấu hình các agent trong OpenAI Dots để ngăn ngừa tình trạng trôi dạt nhiệm vụ, sử dụng hệ thống vai trò gồm bốn vị trí (Người giám sát, Người tạo lập, Người phản biện, Người thực thi) và áp dụng nghiêm ngặt các điểm kiểm tra năm bước cùng thang quyền hạn.

8,6% ở 5 tác vụ. 19,7% ở 10 tác vụ.

Đó là số liệu từ chính system card của OpenAI dành cho dots. Xâu chuỗi 5 tác vụ lại với nhau và 8,6% số lần chạy bị đánh dấu vì lỗi vượt giới hạn. Xâu chuỗi 10 tác vụ thì con số đó tăng hơn gấp đôi.

Ngày ra mắt, ai cũng đăng ảnh mấy linh vật nhồi bông. Gần như chẳng ai đăng dòng số liệu kia.

Hầu hết các hướng dẫn về dots đều bảo bạn cứ xâu chuỗi mọi thứ lại rồi để agent tự chạy. Bài này nói về việc nên cắt chuỗi ở đâu, để agent có thể làm việc cả tuần mà không đi chệch khỏi nhiệm vụ bạn giao.

Một dot, bốn vai trò, một thang phân quyền và một chốt kiểm tra sau mỗi năm bước.

Tóm lại: hãy viết rõ công việc trước khi kết nối bất kỳ ứng dụng nào, cấp cho dot bốn vai trò nhưng nó chỉ đảm nhận từng vai một, đừng bao giờ để một chuỗi chạy quá năm bước mà không có chốt kiểm tra, và giữ số lần phê duyệt dưới 5 lượt mỗi ngày. Các prompt nằm ở phần 6 đến 8, phần tính toán nằm ở phần 3 và 8.

1. Nhìn vào số liệu trước

text
1ra mắt 29 tháng 9, 2026
2model GPT-6 Astra
3số ứng dụng có thể kết nối 4.000+
4dot đầu tiên kèm theo gói Pro và Business Premium
5các mức Pro $100 / $200 / $500 mỗi tháng
6Business Premium $125 mỗi người dùng/tháng, $100 nếu trả theo năm
7trò chuyện với dot không tính vào giới hạn của ChatGPT
8tác vụ khởi chạy trong Codex hoặc Work vẫn tính vào giới hạn như bình thường
9nơi hoạt động ChatGPT desktop, web, mobile, Slack, Teams
10nhắn tin "sắp ra mắt"
11
12từ system card
13cảnh báo vượt giới hạn, chuỗi 5 tác vụ 8,6%
14cảnh báo vượt giới hạn, chuỗi 10 tác vụ 19,7%
15tấn công gián tiếp, thử nghiệm nội bộ phòng thủ được 99,79%
16red team bên ngoài, 1.810 cuộc tấn công 8,5% lọt qua
17tác vụ tạo thông tin sai lệch 0/151 trường hợp đi chệch hướng

Ai cũng đã đăng khối dữ liệu phía trên. Khối phía dưới mới là thứ đáng lẽ phải thay đổi cách bạn thiết lập hệ thống.

2. Dot là gì, tóm gọn trong một màn hình

Dot là một agent luôn hoạt động và thuộc về bạn. Có bốn điểm khiến nó khác biệt so với một đoạn chat ChatGPT thông thường:

text
1model GPT-6 Astra, chứ không phải model nhẹ hơn núp bóng giao diện đẹp hơn
2máy tính riêng một máy cloud có trình duyệt riêng, chạy ngay cả khi laptop của bạn tắt
3hoạt động xen kẽ "chủ động nghiên cứu" trong các ứng dụng đã kết nối, chỉ đọc
4giữa các tin nhắn nó không thể gửi, thay đổi nội dung ứng dụng hay điều khiển máy tính của bạn ở đó
5một danh tính cùng một dot và bộ nhớ xuyên suốt ChatGPT, Slack và Teams

Và hai công cụ kiểm soát bạn sẽ dùng nhiều hơn bất cứ thứ gì khác:

text
1Custom Rules cho phép hành động, yêu cầu phê duyệt hoặc chặn
2auto-review kiểm tra các hành động có thể chạm tới tài khoản hoặc chia sẻ dữ liệu của bạn

OpenAI kết thúc bài đăng ra mắt bằng câu này: dots vẫn có thể mắc lỗi, nên hãy luôn xem xét lại những công việc quan trọng. Mọi thứ dưới đây là để giúp việc xem xét đó đủ nhanh, sao cho bạn thực sự chịu làm nó.

3. Con số không ai nhắc tới

Tôi đã nhẩm tính nhanh dựa trên hai con số trong system card.

Nếu mỗi bước trong chuỗi có cùng một xác suất nhỏ và độc lập để đi chệch giới hạn, bạn có thể suy từ 5 bước sang 10 bước bằng phép tính đơn giản:

text
1chuỗi 5 bước bị đánh dấu 8,6%
2xác suất mỗi bước tương ứng 1 - (1 - 0,086)^(1/5) = 1,78%
3
410 bước, nếu các bước độc lập 1 - (1 - 0,0178)^10 = 16,5%
510 bước, số liệu thực tế đo được 19,7%

Con số đo được cao hơn con số tính theo giả định độc lập.

Cách tôi hiểu: lỗi sẽ tích tụ dần. Một bước hơi chệch hướng sẽ truyền một bức tranh hơi sai cho bước tiếp theo, và bước tiếp theo lại xây dựng trên cái sai đó. Vì vậy rủi ro tăng nhanh hơn độ dài của chuỗi.

Chỉ có hai con số, và OpenAI chưa nói rõ các lỗi bị đánh dấu là gì, nên hãy coi đây là một tín hiệu tham khảo sơ bộ. Nhưng chừng đó vẫn đủ để ta xây dựng quy tắc:

text
1quy tắc nền tảng của hướng dẫn này
2không bao giờ quá 5 bước giữa các chốt kiểm tra

4. Bốn vai trò, một dot

Một dot được dặn "bạn là trợ lý của tôi" sẽ tạo ra sản phẩm mang dáng dấp trợ lý: hữu ích, chung chung và hơi dài dòng. Một dot được dặn "ngay lúc này bạn là Skeptic, và Skeptic chỉ tìm ra những gì chưa đạt" sẽ tạo ra thứ bạn thực sự dùng được.

Vậy nên dot có bốn vai trò. Nó chỉ ngồi vào một vai tại một thời điểm và ghi rõ vai đó ở đầu mỗi câu trả lời.

text
1LOOKOUT đọc các ứng dụng đã kết nối, báo cáo thay đổi, không bao giờ ghi dữ liệu
2MAKER làm việc trên máy tính riêng, giao nộp chính thành phẩm cho bạn
3SKEPTIC đối chiếu thành phẩm với bản mô tả công việc, liệt kê những điểm chưa đạt
4RUNNER chuyển công việc đã duyệt đến đúng nơi, hỏi ý kiến trước khi đưa bất cứ thứ gì ra ngoài

Đây là các chế độ của một agent duy nhất, không phải bốn agent riêng biệt. Một bộ nhớ, một bộ quy tắc, bốn nhiệm vụ hẹp.

fleyta - inline image

5. Thiết lập theo thứ tự quan trọng

text
11 mở ChatGPT trên máy tính dot đầu tiên được tạo trên desktop hoặc web,
2 bản mobile có thể trò chuyện nhưng không tạo được
32 tìm dots ở thanh bên không thấy = sai gói cước, chưa hỗ trợ thị trường,
4 hoặc admin chưa bật lên
53 đặt tên ngắn, chữ thường, không dấu cách
6 bạn sẽ phải gõ tên này trên Slack lúc 7h sáng
74 dán bản mô tả công việc phần 6, làm trước mọi thứ khác
85 kết nối nguồn dữ liệu chỉ làm sau khi nó xác nhận lại công việc với bạn
96 thêm vào Slack hoặc Teams khi nó đã biết mình sinh ra để làm gì

Bước 5 phải làm sau bước 4 là chỗ mọi người hay sai. Một agent có 40 ứng dụng kết nối mà không có bản mô tả công việc thì nắm rất nhiều thông tin nhưng chẳng tạo ra gì hữu ích.

6. Bản mô tả công việc

Dán đoạn này làm tin nhắn đầu tiên. Chỉ thay thế phần trong ngoặc vuông, không sửa gì thêm.

text
1Bạn là agent vận hành thường trực của tôi. Hãy coi tin nhắn này là bản mô tả công việc
2cho mọi tác vụ, kể cả những tác vụ tôi bắt đầu từ Slack hay điện thoại.
3
4TÔI LÀ AI
5Tôi là [vai trò] tại [công ty hoặc dự án]. Tuần làm việc của tôi chủ yếu gồm [một câu mô tả].
6
7BẠN CHỊU TRÁCH NHIỆM GÌ (kết quả, không phải hành động)
81. [kết quả một]
92. [kết quả hai]
103. [kết quả ba]
11
12VAI TRÒ
13Bạn chỉ đảm nhận một vai trò tại một thời điểm và ghi tên vai trò đó ở đầu mỗi câu trả lời:
14LOOKOUT, MAKER, SKEPTIC, RUNNER.
15- LOOKOUT chỉ đọc và báo cáo.
16- MAKER cho tôi xem chính thành phẩm, không bao giờ chỉ mô tả nó.
17- SKEPTIC đối chiếu công việc của MAKER với bản mô tả này và liệt kê những điểm chưa đạt.
18- RUNNER chỉ di chuyển công việc đã được duyệt và phải hỏi trước khi đưa bất cứ thứ gì ra ngoài.
19
20QUY TẮC CHUỖI
21Không bao giờ chạy quá 5 bước liên tiếp. Sau bước thứ 5, dừng lại, chuyển sang
22SKEPTIC, chạy chốt kiểm tra và đợi lệnh PASS trước khi đi tiếp.
23
24CÁCH BẠN GIAO TIẾP VỚI TÔI
25- Kết quả trước. Sau đó nêu tối đa ba điều tôi cần quyết định.
26- Khi bị kẹt: bạn đã thử gì và bạn cần gì, gói gọn trong hai dòng.
27- Không chắc việc gì có nằm trong phạm vi không: đọc trước, rồi hỏi một câu. Không tự ý hành động.
28
29Hãy xác nhận bằng cách diễn đạt lại bốn vai trò, ba kết quả và quy tắc chuỗi
30theo lời của bạn. Sau đó dừng lại.

Đừng bỏ qua dòng cuối. Nếu dot diễn đạt lại "soạn báo cáo tuần" thành "viết một báo cáo về tuần vừa rồi", bạn đã phát hiện ra vấn đề chỉ bằng một tin nhắn thay vì phải nhận báo cáo sai suốt cả tuần.

7. Thang phân quyền kèm ngân sách phê duyệt

Custom Rules cho bạn ba nấc: cho phép, yêu cầu phê duyệt, chặn. Hầu hết mọi người viết ra một đống lệnh cấm, rồi mỗi ngày phê duyệt 40 thứ và cuối cùng chẳng buồn đọc xem mình đang duyệt cái gì nữa.

Hãy viết nấc cho phép trước. Thoáng ở dưới đáy và chặt ở trên đỉnh.

text
1CHO PHÉP
2- Đọc mọi thứ trong các nguồn tôi đã kết nối.
3- Duyệt web công khai, dùng máy tính riêng, chạy code.
4- Tạo và viết lại bản nháp trong workspace của bạn và Space [TÊN].
5
6HỎI TRƯỚC
7- Bất kỳ tin nhắn nào gửi cho người khác: email, DM, bài đăng kênh, lời mời, bình luận.
8- Bất kỳ thay đổi nào với tệp bạn không phải người tạo ra.
9- Bất kỳ hành động nào trong repository, kể cả mở pull request.
10- Bất kỳ giao dịch mua, đăng ký hay gửi biểu mẫu nào.
11
12CHẶN
13- Mật khẩu, 2FA, thanh toán, cài đặt chi trả.
14- Xóa bất cứ thứ gì.
15- Đăng công khai dưới tên của tôi.
16- Liên hệ với bất kỳ ai không được nêu tên trong bản mô tả tác vụ.
17
18KHOẢNG TRỐNG
19Bất cứ điều gì quy tắc không đề cập đều được tính là HỎI TRƯỚC.
20Hãy cho tôi biết quy tắc nào chưa rõ ràng. Không bao giờ tự giải quyết khoảng trống bằng cách chọn hành động.

Sau đó hãy tự đặt cho mình một ngân sách. Đây là ví dụ về một tuần làm việc của dot chuyên nghiên cứu, viết nháp và tổng hợp tin tuần. Tỷ lệ phân bổ là ước tính của tôi, không phải số đo thực tế:

text
1một tuần ví dụ, 420 hành động thang trên "gì cũng phải hỏi"
2đọc dữ liệu và duyệt web 300 cho phép hỏi
3viết nháp trong workspace 80 cho phép hỏi
4tin nhắn gửi người khác 28 hỏi hỏi
5thay đổi repo và tệp 8 hỏi hỏi
6lần thử bị chặn 4 chặn hỏi
7số lần bạn phải bấm duyệt 36/tuần 420/tuần
8mỗi ngày làm việc ~7 ~84

Chẳng ai đọc nổi 84 yêu cầu phê duyệt mỗi ngày. Bạn sẽ thực sự đọc được bảy cái. Đó mới là mục đích thật sự của thang phân quyền: giữ số lượt phê duyệt ít enough để bạn còn chịu liếc qua chúng.

Mục tiêu của tôi: dưới 5 lượt mỗi ngày. Nếu bạn vượt ngưỡng này trong hai tuần liên tiếp, hãy hạ một hành động lặp lại xuống nấc thấp hơn hoặc thu hẹp nguồn dữ liệu.

8. Chốt kiểm tra sau mỗi năm bước

Đây là lúc con số 19,7% phát huy tác dụng.

Một công việc dài không chạy thành một chuỗi liền mạch. Nó chạy thành các chặng, mỗi chặng tối đa năm bước, và chặng nào cũng kết thúc bằng Skeptic.

text
1CHỐT KIỂM TRA (Skeptic, ở cuối mỗi chặng)
2
3Trả lời cả năm câu, mỗi câu một dòng:
41. Chặng này có làm đúng yêu cầu không, hay lại đi làm một việc khác dễ hơn?
52. Có bước nào chạm tới nguồn dữ liệu hoặc người không được nêu tên trong bản mô tả không?
63. Mọi con số có do bạn tự tính hoặc có link dẫn tới nơi bạn đọc được không?
74. Có khẳng định nào bạn không chỉ ra được bằng chứng không? Liệt kê ra.
85. Nếu tôi duyệt chặng này mà nó sai, hậu quả là gì?
9
10Phán quyết:
11PASS đi tiếp sang chặng sau
12HOLD dừng lại, cho tôi xem mục 2, 4 và 5 trước

Giờ hãy tính nhẩm lại như phần 3. Giả sử Skeptic bắt được 4 trên 5 lỗi tại mỗi chốt kiểm tra. Đây là giả định của tôi, không phải tỷ lệ đo lường thực tế:

text
1một chuỗi 10 bước, không chốt kiểm tra 19,7% bị đánh dấu (system card)
2
3hai chặng 5 bước, mỗi chặng có một chốt kiểm tra
4 mỗi chặng bị đánh dấu 8,6%
5 sót lại sau chốt kiểm tra 8,6% x 0,2 = 1,7%
6 cộng dồn qua cả hai chặng 1 - (1 - 0,017)^2 = 3,4%

Ngay cả khi Skeptic chỉ bắt được một nửa số lỗi, hai chặng sẽ dừng ở mức gần 8,6% thay vì 19,7%. Việc cắt chặng gánh phần lớn công việc, tỷ lệ bắt lỗi lo phần còn lại.

fleyta - inline image

9. Cho thành phẩm một nơi để hạ cánh

Công việc nằm lẫn trong luồng chat là công việc bạn sẽ chẳng bao giờ tìm lại được. Dots tích hợp với ChatGPT Spaces và Pages, nơi bạn, đội ngũ của bạn và dot cùng làm việc.

Một Space, bốn trang:

text
100 index mỗi lần chạy một dòng: ngày, vai trò đã dùng, thành phẩm, phán quyết
201 inbox phát hiện của LOOKOUT, mới nhất lên đầu, có ghi ngày
302 review thành phẩm của MAKER kèm chốt kiểm tra của SKEPTIC ngay bên dưới
403 shipped những gì bạn đã duyệt, kèm ngày duyệt

Chỉ cần phổ biến sơ đồ này cho dot một lần. Sau hai tuần, trang index sẽ là thứ hữu ích nhất trong toàn bộ hệ thống: bản ghi duy nhất đọc được về những gì một agent luôn hoạt động đã làm với tuần làm việc của bạn.

10. Lần chạy thực tế đầu tiên

Hãy bắt đầu bằng việc gì đó hữu ích, lặp lại thường xuyên và rẻ nếu phải làm lại khi hỏng. Bản tin tổng hợp thứ Sáu dùng cả bốn vai trò và nếu sai cũng không gây hậu quả gì.

text
1Tác vụ thường trực. Mỗi thứ Sáu lúc 16:00, và khi tôi nói "chạy bản tổng hợp".
2
3CHẶNG 1 (tối đa 5 bước)
4LOOKOUT [calendar], [email], [repo]: tuần này có gì thay đổi mà một người
5 mới vào làm hôm thứ Hai cần biết. Tối đa 5 gạch đầu dòng, mỗi dòng kết thúc bằng
6 "cần quyết định" hoặc "không cần hành động".
7MAKER chỉ dựa trên các gạch đầu dòng đó: SHIPPED, MOVED, WAITING.
8 Tối đa 120 từ mỗi phần, kèm link cho mọi mục SHIPPED.
9SKEPTIC chốt kiểm tra. Mục nào trong SHIPPED thiếu link thì chuyển sang WAITING.
10
11CHẶNG 2 (chỉ chạy khi có lệnh PASS)
12RUNNER lưu vào 02 review với tên "Tuần [ngày]", thêm một dòng vào 00 index.
13 Không gửi cho ai cả.
14
15Sau đó nhắn cho tôi đáp án của mục 5 trong chốt kiểm tra, không thêm gì khác.

11. Dots so với Grok Bot

Cùng một nhóm, nhưng hình hài mặc định khác nhau.

text
1 DOTS GROK BOT
2hình hài mặc định một agent, nhiều vai trò nhiều bot có tên riêng
3bộ nhớ một, dùng chung cho mọi vai trò mỗi bot một bộ nhớ
4hoạt động tại ChatGPT, Slack, Teams ứng dụng và khung chat riêng
5phù hợp với tuần làm việc của một người, một bộ quy tắc các việc tách biệt không bao giờ trộn lẫn

Nếu các công việc của bạn dùng chung ngữ cảnh (hộp thư nuôi bản tổng hợp, bản tổng hợp nuôi kế hoạch thứ Hai), một dot với bốn vai trò sẽ gọn hơn. Nếu chúng tuyệt đối không được nhìn thấy nhau (khách hàng A và khách hàng B), các bot riêng biệt sẽ tạo ranh giới sạch hơn.

12. Các rào chắn

text
1chuỗi dài hơn 5 bước -> dừng, chốt kiểm tra, đợi lệnh PASS
2khoảng trống quy tắc -> HỎI TRƯỚC, nêu rõ quy tắc nào chưa rõ
3tin nhắn gửi bất kỳ ai -> HỎI TRƯỚC, luôn luôn
4mật khẩu, thanh toán, xóa, đăng công khai -> CHẶN
5dính login hoặc captcha giữa chừng -> nhảy vào làm thay trên máy tính của dot
65+ lượt phê duyệt/ngày trong 2 tuần -> hạ một nấc hoặc thu hẹp nguồn dữ liệu
7SKEPTIC viết lời khen -> viết lại chốt kiểm tra, không sửa thành phẩm

Mọi rào chắn đều đẩy sự mơ hồ về phía bạn, không bao giờ đẩy nó thành hành động tự ý.

13. Những gì tôi chưa thử nghiệm

Phần tính toán độ trôi. Hai con số từ một system card chỉ là tín hiệu tham khảo, không phải mô hình đã được chứng minh. OpenAI chưa nói rõ các lỗi vượt giới hạn bị đánh dấu là gì, nên tôi không thể khẳng định chúng nghiêm trọng đến đâu.

Tỷ lệ bắt lỗi của Skeptic. Con số 4 trên 5 chỉ là giả định để minh họa hình dáng của phép tính. Một dot tự kiểm tra công việc của mình không phải là người đánh giá độc lập, nên tỷ lệ thực tế có thể thấp hơn.

Tuần làm việc ví dụ. Con số 420 hành động và tỷ lệ phân bổ theo nấc là ước tính của tôi cho một dot chuyên nghiên cứu và viết nháp, không phải log từ tài khoản thật.

Giá cước sau dot đầu tiên. OpenAI cho biết bạn sẽ có thể thêm dot và mở rộng tốc độ hoặc khối lượng công việc hàng tháng, nhưng chưa công bố mức giá đó.

14. Cẩm nang vận hành

Viết rõ công việc trước khi kết nối bất kỳ ứng dụng nào.

Một agent, bốn vai trò, mỗi lần chỉ đóng một vai.

Cắt mọi chuỗi ở bước thứ năm. Chốt kiểm tra, rồi mới đi tiếp.

Viết danh sách cho phép trước. Khoảng trống rơi vào nấc HỎI TRƯỚC.

Giữ số lượt phê duyệt dưới 5 mỗi ngày, nếu không việc xem xét của bạn sẽ chỉ là hình thức.

Cho thành phẩm một nơi hạ cánh, và đọc trang index vào thứ Sáu.

fleyta - inline image

Điểm mấu chốt

Dots là agent đầu tiên mà phần lớn mọi người sẽ để chạy trong lúc ngủ. Điều đó biến câu hỏi từ "nó có làm được việc không" thành "nó đi xa được bao nhiêu trước khi có người ngó tới".

Chính system card của OpenAI đã gợi ý câu trả lời: chuỗi dài gấp đôi, số lỗi bị đánh dấu tăng hơn gấp đôi.

Vậy nên đừng dựng một chuỗi dài hơn. Hãy dựng những chặng ngắn hơn, đặt một Skeptic ở cuối mỗi chặng, và dùng một thang phân quyền chỉ hỏi bạn những điều thực sự đáng hỏi.

Năm bước, rồi kiểm tra. Chỉ vậy thôi.

Chi tiết ra mắt lấy từ thông báo về dots của OpenAI. Số liệu system card do The New Stack trích dẫn. Giá các gói cước lấy từ các bài viết ra mắt tính đến ngày 1 tháng 10 năm 2026 và có thể thay đổi.

Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral