8,6% ở 5 tác vụ. 19,7% ở 10 tác vụ.
Đó là số liệu từ chính system card của OpenAI dành cho dots. Xâu chuỗi 5 tác vụ lại với nhau và 8,6% số lần chạy bị đánh dấu vì lỗi vượt giới hạn. Xâu chuỗi 10 tác vụ thì con số đó tăng hơn gấp đôi.
Ngày ra mắt, ai cũng đăng ảnh mấy linh vật nhồi bông. Gần như chẳng ai đăng dòng số liệu kia.
Hầu hết các hướng dẫn về dots đều bảo bạn cứ xâu chuỗi mọi thứ lại rồi để agent tự chạy. Bài này nói về việc nên cắt chuỗi ở đâu, để agent có thể làm việc cả tuần mà không đi chệch khỏi nhiệm vụ bạn giao.
Một dot, bốn vai trò, một thang phân quyền và một chốt kiểm tra sau mỗi năm bước.
Tóm lại: hãy viết rõ công việc trước khi kết nối bất kỳ ứng dụng nào, cấp cho dot bốn vai trò nhưng nó chỉ đảm nhận từng vai một, đừng bao giờ để một chuỗi chạy quá năm bước mà không có chốt kiểm tra, và giữ số lần phê duyệt dưới 5 lượt mỗi ngày. Các prompt nằm ở phần 6 đến 8, phần tính toán nằm ở phần 3 và 8.
1. Nhìn vào số liệu trước
1ra mắt 29 tháng 9, 20262model GPT-6 Astra3số ứng dụng có thể kết nối 4.000+4dot đầu tiên kèm theo gói Pro và Business Premium5các mức Pro $100 / $200 / $500 mỗi tháng6Business Premium $125 mỗi người dùng/tháng, $100 nếu trả theo năm7trò chuyện với dot không tính vào giới hạn của ChatGPT8tác vụ khởi chạy trong Codex hoặc Work vẫn tính vào giới hạn như bình thường9nơi hoạt động ChatGPT desktop, web, mobile, Slack, Teams10nhắn tin "sắp ra mắt"1112từ system card13cảnh báo vượt giới hạn, chuỗi 5 tác vụ 8,6%14cảnh báo vượt giới hạn, chuỗi 10 tác vụ 19,7%15tấn công gián tiếp, thử nghiệm nội bộ phòng thủ được 99,79%16red team bên ngoài, 1.810 cuộc tấn công 8,5% lọt qua17tác vụ tạo thông tin sai lệch 0/151 trường hợp đi chệch hướng
Ai cũng đã đăng khối dữ liệu phía trên. Khối phía dưới mới là thứ đáng lẽ phải thay đổi cách bạn thiết lập hệ thống.
2. Dot là gì, tóm gọn trong một màn hình
Dot là một agent luôn hoạt động và thuộc về bạn. Có bốn điểm khiến nó khác biệt so với một đoạn chat ChatGPT thông thường:
1model GPT-6 Astra, chứ không phải model nhẹ hơn núp bóng giao diện đẹp hơn2máy tính riêng một máy cloud có trình duyệt riêng, chạy ngay cả khi laptop của bạn tắt3hoạt động xen kẽ "chủ động nghiên cứu" trong các ứng dụng đã kết nối, chỉ đọc4giữa các tin nhắn nó không thể gửi, thay đổi nội dung ứng dụng hay điều khiển máy tính của bạn ở đó5một danh tính cùng một dot và bộ nhớ xuyên suốt ChatGPT, Slack và Teams
Và hai công cụ kiểm soát bạn sẽ dùng nhiều hơn bất cứ thứ gì khác:
1Custom Rules cho phép hành động, yêu cầu phê duyệt hoặc chặn2auto-review kiểm tra các hành động có thể chạm tới tài khoản hoặc chia sẻ dữ liệu của bạn
OpenAI kết thúc bài đăng ra mắt bằng câu này: dots vẫn có thể mắc lỗi, nên hãy luôn xem xét lại những công việc quan trọng. Mọi thứ dưới đây là để giúp việc xem xét đó đủ nhanh, sao cho bạn thực sự chịu làm nó.
3. Con số không ai nhắc tới
Tôi đã nhẩm tính nhanh dựa trên hai con số trong system card.
Nếu mỗi bước trong chuỗi có cùng một xác suất nhỏ và độc lập để đi chệch giới hạn, bạn có thể suy từ 5 bước sang 10 bước bằng phép tính đơn giản:
1chuỗi 5 bước bị đánh dấu 8,6%2xác suất mỗi bước tương ứng 1 - (1 - 0,086)^(1/5) = 1,78%3410 bước, nếu các bước độc lập 1 - (1 - 0,0178)^10 = 16,5%510 bước, số liệu thực tế đo được 19,7%
Con số đo được cao hơn con số tính theo giả định độc lập.
Cách tôi hiểu: lỗi sẽ tích tụ dần. Một bước hơi chệch hướng sẽ truyền một bức tranh hơi sai cho bước tiếp theo, và bước tiếp theo lại xây dựng trên cái sai đó. Vì vậy rủi ro tăng nhanh hơn độ dài của chuỗi.
Chỉ có hai con số, và OpenAI chưa nói rõ các lỗi bị đánh dấu là gì, nên hãy coi đây là một tín hiệu tham khảo sơ bộ. Nhưng chừng đó vẫn đủ để ta xây dựng quy tắc:
1quy tắc nền tảng của hướng dẫn này2không bao giờ quá 5 bước giữa các chốt kiểm tra
4. Bốn vai trò, một dot
Một dot được dặn "bạn là trợ lý của tôi" sẽ tạo ra sản phẩm mang dáng dấp trợ lý: hữu ích, chung chung và hơi dài dòng. Một dot được dặn "ngay lúc này bạn là Skeptic, và Skeptic chỉ tìm ra những gì chưa đạt" sẽ tạo ra thứ bạn thực sự dùng được.
Vậy nên dot có bốn vai trò. Nó chỉ ngồi vào một vai tại một thời điểm và ghi rõ vai đó ở đầu mỗi câu trả lời.
1LOOKOUT đọc các ứng dụng đã kết nối, báo cáo thay đổi, không bao giờ ghi dữ liệu2MAKER làm việc trên máy tính riêng, giao nộp chính thành phẩm cho bạn3SKEPTIC đối chiếu thành phẩm với bản mô tả công việc, liệt kê những điểm chưa đạt4RUNNER chuyển công việc đã duyệt đến đúng nơi, hỏi ý kiến trước khi đưa bất cứ thứ gì ra ngoài
Đây là các chế độ của một agent duy nhất, không phải bốn agent riêng biệt. Một bộ nhớ, một bộ quy tắc, bốn nhiệm vụ hẹp.

5. Thiết lập theo thứ tự quan trọng
11 mở ChatGPT trên máy tính dot đầu tiên được tạo trên desktop hoặc web,2 bản mobile có thể trò chuyện nhưng không tạo được32 tìm dots ở thanh bên không thấy = sai gói cước, chưa hỗ trợ thị trường,4 hoặc admin chưa bật lên53 đặt tên ngắn, chữ thường, không dấu cách6 bạn sẽ phải gõ tên này trên Slack lúc 7h sáng74 dán bản mô tả công việc phần 6, làm trước mọi thứ khác85 kết nối nguồn dữ liệu chỉ làm sau khi nó xác nhận lại công việc với bạn96 thêm vào Slack hoặc Teams khi nó đã biết mình sinh ra để làm gì
Bước 5 phải làm sau bước 4 là chỗ mọi người hay sai. Một agent có 40 ứng dụng kết nối mà không có bản mô tả công việc thì nắm rất nhiều thông tin nhưng chẳng tạo ra gì hữu ích.
6. Bản mô tả công việc
Dán đoạn này làm tin nhắn đầu tiên. Chỉ thay thế phần trong ngoặc vuông, không sửa gì thêm.
1Bạn là agent vận hành thường trực của tôi. Hãy coi tin nhắn này là bản mô tả công việc2cho mọi tác vụ, kể cả những tác vụ tôi bắt đầu từ Slack hay điện thoại.34TÔI LÀ AI5Tôi là [vai trò] tại [công ty hoặc dự án]. Tuần làm việc của tôi chủ yếu gồm [một câu mô tả].67BẠN CHỊU TRÁCH NHIỆM GÌ (kết quả, không phải hành động)81. [kết quả một]92. [kết quả hai]103. [kết quả ba]1112VAI TRÒ13Bạn chỉ đảm nhận một vai trò tại một thời điểm và ghi tên vai trò đó ở đầu mỗi câu trả lời:14LOOKOUT, MAKER, SKEPTIC, RUNNER.15- LOOKOUT chỉ đọc và báo cáo.16- MAKER cho tôi xem chính thành phẩm, không bao giờ chỉ mô tả nó.17- SKEPTIC đối chiếu công việc của MAKER với bản mô tả này và liệt kê những điểm chưa đạt.18- RUNNER chỉ di chuyển công việc đã được duyệt và phải hỏi trước khi đưa bất cứ thứ gì ra ngoài.1920QUY TẮC CHUỖI21Không bao giờ chạy quá 5 bước liên tiếp. Sau bước thứ 5, dừng lại, chuyển sang22SKEPTIC, chạy chốt kiểm tra và đợi lệnh PASS trước khi đi tiếp.2324CÁCH BẠN GIAO TIẾP VỚI TÔI25- Kết quả trước. Sau đó nêu tối đa ba điều tôi cần quyết định.26- Khi bị kẹt: bạn đã thử gì và bạn cần gì, gói gọn trong hai dòng.27- Không chắc việc gì có nằm trong phạm vi không: đọc trước, rồi hỏi một câu. Không tự ý hành động.2829Hãy xác nhận bằng cách diễn đạt lại bốn vai trò, ba kết quả và quy tắc chuỗi30theo lời của bạn. Sau đó dừng lại.
Đừng bỏ qua dòng cuối. Nếu dot diễn đạt lại "soạn báo cáo tuần" thành "viết một báo cáo về tuần vừa rồi", bạn đã phát hiện ra vấn đề chỉ bằng một tin nhắn thay vì phải nhận báo cáo sai suốt cả tuần.
7. Thang phân quyền kèm ngân sách phê duyệt
Custom Rules cho bạn ba nấc: cho phép, yêu cầu phê duyệt, chặn. Hầu hết mọi người viết ra một đống lệnh cấm, rồi mỗi ngày phê duyệt 40 thứ và cuối cùng chẳng buồn đọc xem mình đang duyệt cái gì nữa.
Hãy viết nấc cho phép trước. Thoáng ở dưới đáy và chặt ở trên đỉnh.
1CHO PHÉP2- Đọc mọi thứ trong các nguồn tôi đã kết nối.3- Duyệt web công khai, dùng máy tính riêng, chạy code.4- Tạo và viết lại bản nháp trong workspace của bạn và Space [TÊN].56HỎI TRƯỚC7- Bất kỳ tin nhắn nào gửi cho người khác: email, DM, bài đăng kênh, lời mời, bình luận.8- Bất kỳ thay đổi nào với tệp bạn không phải người tạo ra.9- Bất kỳ hành động nào trong repository, kể cả mở pull request.10- Bất kỳ giao dịch mua, đăng ký hay gửi biểu mẫu nào.1112CHẶN13- Mật khẩu, 2FA, thanh toán, cài đặt chi trả.14- Xóa bất cứ thứ gì.15- Đăng công khai dưới tên của tôi.16- Liên hệ với bất kỳ ai không được nêu tên trong bản mô tả tác vụ.1718KHOẢNG TRỐNG19Bất cứ điều gì quy tắc không đề cập đều được tính là HỎI TRƯỚC.20Hãy cho tôi biết quy tắc nào chưa rõ ràng. Không bao giờ tự giải quyết khoảng trống bằng cách chọn hành động.
Sau đó hãy tự đặt cho mình một ngân sách. Đây là ví dụ về một tuần làm việc của dot chuyên nghiên cứu, viết nháp và tổng hợp tin tuần. Tỷ lệ phân bổ là ước tính của tôi, không phải số đo thực tế:
1một tuần ví dụ, 420 hành động thang trên "gì cũng phải hỏi"2đọc dữ liệu và duyệt web 300 cho phép hỏi3viết nháp trong workspace 80 cho phép hỏi4tin nhắn gửi người khác 28 hỏi hỏi5thay đổi repo và tệp 8 hỏi hỏi6lần thử bị chặn 4 chặn hỏi7số lần bạn phải bấm duyệt 36/tuần 420/tuần8mỗi ngày làm việc ~7 ~84
Chẳng ai đọc nổi 84 yêu cầu phê duyệt mỗi ngày. Bạn sẽ thực sự đọc được bảy cái. Đó mới là mục đích thật sự của thang phân quyền: giữ số lượt phê duyệt ít enough để bạn còn chịu liếc qua chúng.
Mục tiêu của tôi: dưới 5 lượt mỗi ngày. Nếu bạn vượt ngưỡng này trong hai tuần liên tiếp, hãy hạ một hành động lặp lại xuống nấc thấp hơn hoặc thu hẹp nguồn dữ liệu.
8. Chốt kiểm tra sau mỗi năm bước
Đây là lúc con số 19,7% phát huy tác dụng.
Một công việc dài không chạy thành một chuỗi liền mạch. Nó chạy thành các chặng, mỗi chặng tối đa năm bước, và chặng nào cũng kết thúc bằng Skeptic.
1CHỐT KIỂM TRA (Skeptic, ở cuối mỗi chặng)23Trả lời cả năm câu, mỗi câu một dòng:41. Chặng này có làm đúng yêu cầu không, hay lại đi làm một việc khác dễ hơn?52. Có bước nào chạm tới nguồn dữ liệu hoặc người không được nêu tên trong bản mô tả không?63. Mọi con số có do bạn tự tính hoặc có link dẫn tới nơi bạn đọc được không?74. Có khẳng định nào bạn không chỉ ra được bằng chứng không? Liệt kê ra.85. Nếu tôi duyệt chặng này mà nó sai, hậu quả là gì?910Phán quyết:11PASS đi tiếp sang chặng sau12HOLD dừng lại, cho tôi xem mục 2, 4 và 5 trước
Giờ hãy tính nhẩm lại như phần 3. Giả sử Skeptic bắt được 4 trên 5 lỗi tại mỗi chốt kiểm tra. Đây là giả định của tôi, không phải tỷ lệ đo lường thực tế:
1một chuỗi 10 bước, không chốt kiểm tra 19,7% bị đánh dấu (system card)23hai chặng 5 bước, mỗi chặng có một chốt kiểm tra4 mỗi chặng bị đánh dấu 8,6%5 sót lại sau chốt kiểm tra 8,6% x 0,2 = 1,7%6 cộng dồn qua cả hai chặng 1 - (1 - 0,017)^2 = 3,4%
Ngay cả khi Skeptic chỉ bắt được một nửa số lỗi, hai chặng sẽ dừng ở mức gần 8,6% thay vì 19,7%. Việc cắt chặng gánh phần lớn công việc, tỷ lệ bắt lỗi lo phần còn lại.

9. Cho thành phẩm một nơi để hạ cánh
Công việc nằm lẫn trong luồng chat là công việc bạn sẽ chẳng bao giờ tìm lại được. Dots tích hợp với ChatGPT Spaces và Pages, nơi bạn, đội ngũ của bạn và dot cùng làm việc.
Một Space, bốn trang:
100 index mỗi lần chạy một dòng: ngày, vai trò đã dùng, thành phẩm, phán quyết201 inbox phát hiện của LOOKOUT, mới nhất lên đầu, có ghi ngày302 review thành phẩm của MAKER kèm chốt kiểm tra của SKEPTIC ngay bên dưới403 shipped những gì bạn đã duyệt, kèm ngày duyệt
Chỉ cần phổ biến sơ đồ này cho dot một lần. Sau hai tuần, trang index sẽ là thứ hữu ích nhất trong toàn bộ hệ thống: bản ghi duy nhất đọc được về những gì một agent luôn hoạt động đã làm với tuần làm việc của bạn.
10. Lần chạy thực tế đầu tiên
Hãy bắt đầu bằng việc gì đó hữu ích, lặp lại thường xuyên và rẻ nếu phải làm lại khi hỏng. Bản tin tổng hợp thứ Sáu dùng cả bốn vai trò và nếu sai cũng không gây hậu quả gì.
1Tác vụ thường trực. Mỗi thứ Sáu lúc 16:00, và khi tôi nói "chạy bản tổng hợp".23CHẶNG 1 (tối đa 5 bước)4LOOKOUT [calendar], [email], [repo]: tuần này có gì thay đổi mà một người5 mới vào làm hôm thứ Hai cần biết. Tối đa 5 gạch đầu dòng, mỗi dòng kết thúc bằng6 "cần quyết định" hoặc "không cần hành động".7MAKER chỉ dựa trên các gạch đầu dòng đó: SHIPPED, MOVED, WAITING.8 Tối đa 120 từ mỗi phần, kèm link cho mọi mục SHIPPED.9SKEPTIC chốt kiểm tra. Mục nào trong SHIPPED thiếu link thì chuyển sang WAITING.1011CHẶNG 2 (chỉ chạy khi có lệnh PASS)12RUNNER lưu vào 02 review với tên "Tuần [ngày]", thêm một dòng vào 00 index.13 Không gửi cho ai cả.1415Sau đó nhắn cho tôi đáp án của mục 5 trong chốt kiểm tra, không thêm gì khác.
11. Dots so với Grok Bot
Cùng một nhóm, nhưng hình hài mặc định khác nhau.
1 DOTS GROK BOT2hình hài mặc định một agent, nhiều vai trò nhiều bot có tên riêng3bộ nhớ một, dùng chung cho mọi vai trò mỗi bot một bộ nhớ4hoạt động tại ChatGPT, Slack, Teams ứng dụng và khung chat riêng5phù hợp với tuần làm việc của một người, một bộ quy tắc các việc tách biệt không bao giờ trộn lẫn
Nếu các công việc của bạn dùng chung ngữ cảnh (hộp thư nuôi bản tổng hợp, bản tổng hợp nuôi kế hoạch thứ Hai), một dot với bốn vai trò sẽ gọn hơn. Nếu chúng tuyệt đối không được nhìn thấy nhau (khách hàng A và khách hàng B), các bot riêng biệt sẽ tạo ranh giới sạch hơn.
12. Các rào chắn
1chuỗi dài hơn 5 bước -> dừng, chốt kiểm tra, đợi lệnh PASS2khoảng trống quy tắc -> HỎI TRƯỚC, nêu rõ quy tắc nào chưa rõ3tin nhắn gửi bất kỳ ai -> HỎI TRƯỚC, luôn luôn4mật khẩu, thanh toán, xóa, đăng công khai -> CHẶN5dính login hoặc captcha giữa chừng -> nhảy vào làm thay trên máy tính của dot65+ lượt phê duyệt/ngày trong 2 tuần -> hạ một nấc hoặc thu hẹp nguồn dữ liệu7SKEPTIC viết lời khen -> viết lại chốt kiểm tra, không sửa thành phẩm
Mọi rào chắn đều đẩy sự mơ hồ về phía bạn, không bao giờ đẩy nó thành hành động tự ý.
13. Những gì tôi chưa thử nghiệm
Phần tính toán độ trôi. Hai con số từ một system card chỉ là tín hiệu tham khảo, không phải mô hình đã được chứng minh. OpenAI chưa nói rõ các lỗi vượt giới hạn bị đánh dấu là gì, nên tôi không thể khẳng định chúng nghiêm trọng đến đâu.
Tỷ lệ bắt lỗi của Skeptic. Con số 4 trên 5 chỉ là giả định để minh họa hình dáng của phép tính. Một dot tự kiểm tra công việc của mình không phải là người đánh giá độc lập, nên tỷ lệ thực tế có thể thấp hơn.
Tuần làm việc ví dụ. Con số 420 hành động và tỷ lệ phân bổ theo nấc là ước tính của tôi cho một dot chuyên nghiên cứu và viết nháp, không phải log từ tài khoản thật.
Giá cước sau dot đầu tiên. OpenAI cho biết bạn sẽ có thể thêm dot và mở rộng tốc độ hoặc khối lượng công việc hàng tháng, nhưng chưa công bố mức giá đó.
14. Cẩm nang vận hành
Viết rõ công việc trước khi kết nối bất kỳ ứng dụng nào.
Một agent, bốn vai trò, mỗi lần chỉ đóng một vai.
Cắt mọi chuỗi ở bước thứ năm. Chốt kiểm tra, rồi mới đi tiếp.
Viết danh sách cho phép trước. Khoảng trống rơi vào nấc HỎI TRƯỚC.
Giữ số lượt phê duyệt dưới 5 mỗi ngày, nếu không việc xem xét của bạn sẽ chỉ là hình thức.
Cho thành phẩm một nơi hạ cánh, và đọc trang index vào thứ Sáu.

Điểm mấu chốt
Dots là agent đầu tiên mà phần lớn mọi người sẽ để chạy trong lúc ngủ. Điều đó biến câu hỏi từ "nó có làm được việc không" thành "nó đi xa được bao nhiêu trước khi có người ngó tới".
Chính system card của OpenAI đã gợi ý câu trả lời: chuỗi dài gấp đôi, số lỗi bị đánh dấu tăng hơn gấp đôi.
Vậy nên đừng dựng một chuỗi dài hơn. Hãy dựng những chặng ngắn hơn, đặt một Skeptic ở cuối mỗi chặng, và dùng một thang phân quyền chỉ hỏi bạn những điều thực sự đáng hỏi.
Năm bước, rồi kiểm tra. Chỉ vậy thôi.
Chi tiết ra mắt lấy từ thông báo về dots của OpenAI. Số liệu system card do The New Stack trích dẫn. Giá các gói cước lấy từ các bài viết ra mắt tính đến ngày 1 tháng 10 năm 2026 và có thể thay đổi.





