YouMind
साइन इन करें

OpenAI Dots: कैसे बनाएं एक 4-सीट एजेंट टीम जो ड्रिफ्ट होने से पहले ही रुक जाए (पूरी गाइड)

@fleyta88
अंग्रेज़ी01 अक्टू॰ 2026
126K
90
5
10
150

TL;DR

यह गाइड बताती है कि OpenAI Dots एजेंट्स को कॉन्फ़िगर करने का तरीका, जिससे टास्क ड्रिफ्ट को रोका जा सके। इसके लिए चार-सीट भूमिका प्रणाली (Lookout, Maker, Skeptic, Runner) का उपयोग करें और अनुमति सीढ़ी के साथ कड़े पांच-चरणीय चेकपॉइंट लागू करें।

5 टास्क पर 8.6%। 10 पर 19.7%।

यह आंकड़ा dots के लिए OpenAI के अपने system card से लिया गया है। पांच टास्क को एक साथ जोड़ दें, तो 8.6% रन boundary problems के लिए फ्लैग हो जाते हैं। दस जोड़ें, तो यह आंकड़ा दोगुने से भी ज्यादा हो जाता है।

लॉन्च वाले दिन सबने plush mascots की फोटो शेयर की। लेकिन यह लाइन लगभग किसी ने पोस्ट नहीं की।

dots की ज़्यादातर गाइड्स आपको कहती हैं कि सब कुछ एक चेन में जोड़ दो और एजेंट को काम करने दो। यह गाइड उस बात पर है कि चेन को कहाँ काटना है, ताकि एजेंट पूरा हफ्ता बिना भटके वही काम करे जो आपने उसे सौंपा है।

एक dot, चार सीटें, एक permission ladder, और हर पांच स्टेप पर एक checkpoint।

TLDR: कोई भी ऐप कनेक्ट करने से पहले काम लिख लें, dot को चार सीटें दें जिन्हें वह एक-एक करके इस्तेमाल करे, चेन को बिना checkpoint के पांच स्टेप से ज़्यादा न चलने दें, और अपनी approvals को दिन में पांच से कम रखें। Prompts सेक्शन 6 से 8 में हैं, गणित (math) सेक्शन 3 और 8 में है।

1. पहले आंकड़े

text
1लॉन्च की तारीख 29 सितंबर, 2026
2मॉडल GPT-6 Astra
3जिन ऐप्स से यह कनेक्ट हो सकता है 4,000+
4पहला dot Pro और Business Premium में शामिल
5Pro tiers $100 / $200 / $500 प्रति माह
6Business Premium $125 प्रति यूज़र प्रति माह, सालाना प्लान पर $100
7dot से चैट करना ChatGPT की लिमिट में नहीं गिना जाएगा
8Codex या Work में शुरू किए गए टास्क हमेशा की तरह इनमें गिने जाएंगे
9यह कहाँ मिलेगा ChatGPT desktop, web, mobile, Slack, Teams
10मैसेजिंग "जल्द आ रहा है"
11
12system card से
13boundary flags, 5-task chain 8.6%
14boundary flags, 10-task chain 19.7%
15indirect injection, internal tests 99.79% सुरक्षित
16external red team, 1,810 attacks 8.5% पास हो गए
17misleading-information tasks 151 में से 0 misaligned

ऊपर वाला हिस्सा तो सभी ने पोस्ट कर दिया। नीचे वाला हिस्सा वो है जिससे आपका सेटअप करने का तरीका बदल जाना चाहिए।

2. एक स्क्रीन में समझें कि dot क्या है

dot एक हमेशा ऑन रहने वाला एजेंट है जो आपका अपना है। चार चीज़ें इसे ChatGPT की आम चैट से अलग बनाती हैं:

text
1मॉडल GPT-6 Astra, न कि अच्छे इंटरफ़ेस के पीछे छिपा कोई हल्का मॉडल
2अपना कंप्यूटर एक cloud machine जिसका अपना ब्राउज़र है, आपके लैपटॉप बंद होने पर भी चलती है
3आपके मैसेजेस के बीच आपके कनेक्टेड ऐप्स में "proactive research" करता है, सिर्फ read-only
4 यह वहाँ मैसेज नहीं भेज सकता, ऐप का डेटा नहीं बदल सकता, या आपका कंप्यूटर नहीं चला सकता
5एक पहचान ChatGPT, Slack और Teams में एक ही dot और एक ही memory

और दो कंट्रोल जिनका इस्तेमाल आप सबसे ज़्यादा करेंगे:

text
1Custom Rules किसी action की अनुमति दें, approval मांगें, या उसे ब्लॉक करें
2auto-review उन actions की जांच करता है जो आपके अकाउंट्स को छू सकते हैं या डेटा शेयर कर सकते हैं

OpenAI ने अपना लॉन्च पोस्ट इस बात से खत्म किया: dots अभी भी गलतियां कर सकते हैं, इसलिए महत्वपूर्ण कामों की हमेशा समीक्षा करें। आगे दी गई हर बात इसी समीक्षा को इतना तेज़ बनाने के बारे में है कि आप इसे असल में कर सकें।

3. वो आंकड़ा जो किसी ने पोस्ट नहीं किया

मैंने system card के इन दो आंकड़ों पर थोड़ा गणित लगाया।

अगर चेन के हर स्टेप में सीमा से बाहर जाने का उतना ही छोटा और स्वतंत्र मौका होता, तो साधारण गणित से 5 स्टेप से 10 स्टेप तक पहुँचा जा सकता था:

text
15-step chain flagged 8.6%
2per-step chance that implies 1 - (1 - 0.086)^(1/5) = 1.78%
3
410 steps, if steps were independent 1 - (1 - 0.0178)^10 = 16.5%
510 steps, what the card measured 19.7%

मापा गया आंकड़ा स्वतंत्र रूप से निकाले गए आंकड़े से ज़्यादा है।

मेरी समझ: गलतियां जमा होती जाती हैं। जो स्टेप थोड़ा सा भटकता है, वो अगले स्टेप को थोड़ी गलत तस्वीर देता है, और अगला स्टेप उसी पर आगे बढ़ता है। इसलिए रिस्क चेन से भी तेज़ी से बढ़ता है।

ये सिर्फ दो आंकड़े हैं, और OpenAI ने नहीं बताया है कि फ्लैग हुई समस्याएं क्या थीं, इसलिए इसे एक मोटे संकेत की तरह लें। फिर भी, इसके आधार पर नियम बनाने लायक ये काफी है:

text
1वह नियम जिस पर यह गाइड टिकी है
2checkpoints के बीच कभी 5 स्टेप से ज़्यादा नहीं

4. चार सीटें, एक dot

जिस dot को कहा जाए "तुम मेरे असिस्टेंट हो", वो असिस्टेंट जैसा काम करता है: मददगार, धुंधला, और ज़रूरत से थोड़ा लंबा। लेकिन जिस dot को कहा जाए "अभी तुम Skeptic हो, और Skeptic सिर्फ वो ढूंढता है जो फेल होता है", वो ऐसा काम देता है जो आप असल में इस्तेमाल कर सकते हैं।

इसीलिए dot को चार सीटें मिलती हैं। वह एक बार में एक ही सीट पर बैठता है और हर जवाब की शुरुआत में बताता है कि वह किस सीट पर है।

text
1LOOKOUT आपके कनेक्टेड ऐप्स पढ़ता है, बताता है कि क्या बदला, कभी कुछ लिखता नहीं
2MAKER अपने कंप्यूटर पर काम करता है, आपको सीधा artifact देता है
3SKEPTIC brief के आधार पर artifact की जांच करता है, बताता है कि क्या फेल हुआ
4RUNNER approved काम को सही जगह पहुंचाता है, कुछ भी बाहर जाने से पहले पूछता है

ये चार अलग एजेंट नहीं, बल्कि एक ही एजेंट के चार मोड हैं। एक memory, एक rulebook, चार छोटे-छोटे काम।

fleyta - inline image

5. सेटअप, सही क्रम में

text
11 कंप्यूटर पर ChatGPT खोलें पहला dot desktop या web पर बनता है,
2 mobile उससे बात कर सकता है पर बना नहीं सकता
32 sidebar में dots खोजें नहीं दिख रहा = गलत प्लान, अभी आपके देश में नहीं आया,
4 या admin ने इसे चालू नहीं किया है
53 नाम रखें छोटा, lowercase, बिना स्पेस
6 सुबह 7 बजे आपको इसे Slack में टाइप करना होगा
74 job description पेस्ट करें सबसे पहले, सेक्शन 6 वाला
85 sources कनेक्ट करें जब यह आपको काम दोहराकर confirm कर दे, तभी
96 Slack या Teams में जोड़ें जब यह समझ जाए कि इसे क्या करना है

लोग स्टेप 4 से पहले स्टेप 5 कर देते हैं, यहीं गलती होती है। 40 ऐप्स से जुड़ा लेकिन बिना brief वाला एजेंट बहुत जानकारी रखता है, पर कोई काम का आउटपुट नहीं देता।

6. Job description

इसे पहला मैसेज बनाकर पेस्ट करें। सिर्फ ब्रैकेट बदलें, बाकी कुछ नहीं।

text
1तुम मेरे standing operations agent हो। इस मैसेज को हर टास्क के लिए अपना job
2description मानो, उन टास्क सहित जो मैं Slack या अपने फोन से शुरू करता हूं।
3
4मैं कौन हूं
5मैं [company or project] में [role] हूं। मेरा हफ्ता ज़्यादातर [one sentence] में बीतता है।
6
7तुम्हारी ज़िम्मेदारी क्या है (नतीजे, काम नहीं)
81. [result one]
92. [result two]
103. [result three]
11
12सीटें
13तुम एक बार में एक ही सीट पर बैठोगे और हर जवाब की शुरुआत में उसका नाम बताओगे:
14LOOKOUT, MAKER, SKEPTIC, RUNNER।
15- LOOKOUT सिर्फ पढ़ता और रिपोर्ट करता है।
16- MAKER मुझे artifact दिखाता है, उसका वर्णन नहीं।
17- SKEPTIC इस brief के आधार पर MAKER के काम की जांच करता है और बताता है कि क्या फेल हुआ।
18- RUNNER सिर्फ approved काम आगे बढ़ाता है और कुछ भी बाहर जाने से पहले पूछता है।
19
20चेन का नियम
21कभी भी लगातार 5 स्टेप से ज़्यादा मत चलो। 5वें स्टेप के बाद रुको, SKEPTIC बनो,
22checkpoint चलाओ, और आगे बढ़ने से पहले PASS का इंतज़ार करो।
23
24मुझसे कैसे बात करनी है
25- पहले नतीजा। फिर ज़्यादा से ज़्यादा तीन बातें जिन पर मुझे फैसला लेना है।
26- Blocked: तुमने क्या कोशिश की और तुम्हें क्या चाहिए, सिर्फ दो लाइनों में।
27- अगर पक्का न हो कि कोई काम scope में है या नहीं: पहले पढ़ो, फिर एक सवाल पूछो। खुद कुछ मत करो।
28
29चारों सीटों, तीनों नतीजों और चेन के नियम को अपने शब्दों में दोहराकर confirm करो।
30फिर रुक जाओ।

आखिरी लाइन को नज़रअंदाज़ मत करें। अगर dot "weekly report draft करो" को "हफ्ते भर पर रिपोर्ट लिखो" में बदल दे, तो आपने गलत रिपोर्ट्स का पूरा हफ्ता बर्बाद होने से पहले ही, एक मैसेज में गलती पकड़ ली।

7. Approval budget के साथ permission ladder

Custom Rules आपको तीन पायदान देते हैं: allow, require approval, block। ज़्यादातर लोग पाबंदियों की एक दीवार खड़ी कर देते हैं, फिर दिन में 40 चीज़ें approve करते हैं और देखना बंद कर देते हैं कि वे क्या approve कर रहे हैं।

पहले allow वाला पायदान लिखें। नीचे उदार रहें, ऊपर सख्त।

text
1ALLOW
2- मेरे कनेक्टेड sources में कुछ भी पढ़ना।
3- public web ब्राउज़ करना, अपना कंप्यूटर इस्तेमाल करना, code चलाना।
4- अपने workspace और [NAME] Space में drafts बनाना और बदलना।
5
6ASK FIRST
7- किसी इंसान को भेजा गया कोई भी मैसेज: email, DM, channel post, invite, comment।
8- किसी ऐसे file में बदलाव जो तुमने नहीं बनाया।
9- repository में कोई भी action, pull request खोलना सहित।
10- कोई भी खरीदारी, subscription या form submission।
11
12BLOCK
13- Passwords, 2FA, billing, payment settings।
14- कुछ भी delete करना।
15- मेरे नाम से public में कुछ पोस्ट करना।
16- task के brief में दिए गए नामों के अलावा किसी और से संपर्क करना।
17
18GAPS
19जो भी चीज़ rules में नहीं आती, वो ASK FIRST में गिनी जाएगी।
20मुझे बताओ कि कौन सा rule साफ नहीं था। gap को कभी action के पक्ष में मत सुलझाओ।

फिर खुद को एक budget दें। यहां एक dot के लिए एक हफ्ते का उदाहरण है जो research, drafts और weekly digest करता है। यह बंटवारा मेरा अनुमान है, कोई मापा गया आंकड़ा नहीं:

text
1एक उदाहरण हफ्ता, 420 actions ऊपर वाला ladder "हर चीज़ के लिए पूछो"
2reads और web 300 allow ask
3अपने workspace में drafts 80 allow ask
4लोगों को messages 28 ask ask
5repo और file changes 8 ask ask
6blocked attempts 4 block ask
7आपको click करनी वाली approvals 36 प्रति सप्ताह 420 प्रति सप्ताह
8प्रति working day ~7 ~84

कोई भी दिन में 84 approvals नहीं पढ़ता। आप असल में सात ही पढ़ेंगे। ladder का असली काम यही है: approvals को इतना कम रखना कि आप उन्हें सच में देख सकें।

मेरा लक्ष्य: दिन में पांच से कम। अगर दो हफ्ते तक आप इससे ऊपर हैं, तो किसी एक recurring action को एक पायदान नीचे ले जाएं या source को सीमित करें।

8. हर पांच स्टेप पर checkpoint

यहीं पर वो 19.7% काम आता है।

कोई बड़ा काम एक लंबी चेन में नहीं चलता। वह ज़्यादा से ज़्यादा पांच स्टेप के legs में चलता है, और हर leg Skeptic पर खत्म होता है।

text
1CHECKPOINT (Skeptic, हर leg के अंत में)
2
3इन पांचों का जवाब दो, हर एक एक लाइन में:
41. क्या इस leg ने वो किया जो brief में था, या कोई आसान और मिलता-जुलता काम?
52. क्या किसी स्टेप ने ऐसे source या इंसान तक पहुंच बनाई जिसका नाम brief में नहीं था?
63. क्या हर number या तो तुमने calculate किया है या उस जगह से linked है जहां तुमने उसे पढ़ा?
74. क्या कोई ऐसा दावा है जिसके लिए तुम evidence नहीं दिखा सकते? उसे list करो।
85. अगर मैं इस leg को approve कर दूं और यह गलत हो, तो क्या टूटेगा?
9
10Verdict:
11PASS अगले leg पर बढ़ो
12HOLD रुको, पहले मुझे item 2, 4 और 5 दिखाओ

अब सेक्शन 3 जैसा ही rough calculation करते हैं। मान लें कि Skeptic checkpoint पर 5 में से 4 गलतियां पकड़ लेता है। यह मेरा अनुमान है, कोई मापी गई दर नहीं:

text
1एक 10-step chain, बिना checkpoint 19.7% flagged (system card)
2
3दो 5-step legs, हर एक में checkpoint
4 per leg flagged 8.6%
5 checkpoint के बाद बचा 8.6% x 0.2 = 1.7%
6 दोनों legs मिलाकर 1 - (1 - 0.017)^2 = 3.4%

अगर Skeptic आधी भी पकड़ता है, तो दो legs के बाद आंकड़ा 19.7% की जगह 8.6% के आसपास आ जाता है। चेन को काटना ज़्यादातर काम करता है, पकड़ने की दर बाकी का।

fleyta - inline image

9. काम को रखने की जगह दें

जो काम chat thread में दब जाता है, वो आपको दोबारा कभी नहीं मिलता। Dots ChatGPT Spaces और Pages से जुड़ते हैं, जिनमें आप, आपकी टीम और dot तीनों काम करते हैं।

एक Space, चार pages:

text
100 index हर run की एक लाइन: date, used seats, artifact, verdict
201 inbox LOOKOUT की findings, सबसे नई ऊपर, date के साथ
302 review MAKER के artifacts, हर एक के नीचे SKEPTIC का checkpoint
403 shipped जो आपने approve किया, approval date के साथ

dot को यह map एक बार बता दें। दो हफ्ते बाद, index page पूरे सेटअप की सबसे काम की चीज़ बन जाता है: यह एकमात्र पढ़ने लायक रिकॉर्ड होता है कि हमेशा ऑन रहने वाले एजेंट ने आपके हफ्ते के साथ क्या किया।

10. पहला असली run

किसी ऐसी चीज़ से शुरू करें जो काम की हो, बार-बार होती हो, और गलत होने पर दोबारा करना सस्ता हो। Friday digest चारों सीटों का इस्तेमाल करता है और गलत होने पर भी सुरक्षित रहता है।

text
1Standing task। हर शुक्रवार 16:00 बजे, और जब मैं कहूं "run the digest"।
2
3LEG 1 (max 5 steps)
4LOOKOUT [calendar], [email], [repo]: इस हफ्ते क्या बदला जो सोमवार को
5 जुड़ने वाले किसी व्यक्ति को जानना ज़रूरी होगा। ज़्यादा से ज़्यादा पांच bullets, हर एक
6 "decision needed" या "no action" पर खत्म हो।
7MAKER सिर्फ उन्हीं bullets से: SHIPPED, MOVED, WAITING।
8 हर section में ज़्यादा से ज़्यादा 120 words, हर SHIPPED item के लिए links।
9SKEPTIC checkpoint। SHIPPED में बिना link वाली कोई भी चीज़ WAITING में चली जाएगी।
10
11LEG 2 (सिर्फ PASS पर)
12RUNNER इसे 02 review में "Week of [date]" के नाम से save करो, 00 index में एक लाइन जोड़ो।
13 इसे किसी को मत भेजो।
14
15फिर मुझे सिर्फ checkpoint item 5 का जवाब मैसेज करो, और कुछ नहीं।

11. Dots vs Grok Bot

एक ही कैटेगरी, लेकिन default shape अलग।

text
1 DOTS GROK BOT
2default shape एक agent, कई seats कई named bots
3memory एक, हर seat share करती है हर bot की अपनी
4lives in ChatGPT, Slack, Teams अपनी app और chats
5good fit एक व्यक्ति का हफ्ता, एक rulebook अलग-अलग काम जो कभी नहीं मिलते

अगर आपके काम context share करते हैं (आपका inbox आपके digest को feed करता है, जो आपके Monday plan को feed करता है), तो चार सीटों वाला एक dot ज़्यादा आसान है। अगर उन्हें एक-दूसरे को कभी नहीं देखना चाहिए (client A और client B), तो अलग-अलग bots बेहतर boundary बनाते हैं।

12. The guards

text
1chain 5 steps से लंबी -> रुको, checkpoint, PASS का इंतज़ार करो
2rule gap -> ASK FIRST, unclear rule का नाम बताओ
3किसी भी इंसान को message -> ASK FIRST, हमेशा
4password, billing, delete, public -> BLOCK
5काम के बीच login या captcha -> dot के कंप्यूटर से control ले लो
62 हफ्ते तक दिन में 5+ approvals -> एक rung बदलो या source सीमित करो
7SKEPTIC तारीफ लिखे -> artifact नहीं, checkpoint दोबारा लिखो

हर guard अनिश्चितता को action की तरफ नहीं, आपकी तरफ धकेलता है।

13. जो मैंने test नहीं किया

Drift का गणित। एक system card के दो आंकड़े एक मोटा संकेत हैं, कोई proven model नहीं। OpenAI ने नहीं बताया कि flagged boundary problems क्या थीं, इसलिए मैं नहीं कह सकता कि वे कितनी गंभीर थीं।

Skeptic की catch rate। 5 में से 4 गणित का pattern दिखाने के लिए एक अनुमान है। खुद के काम की जांच करता dot कोई independent reviewer नहीं है, इसलिए असली दर इससे कम हो सकती है।

उदाहरण वाला हफ्ता। 420 actions और rungs के हिसाब से उनका बंटवारा research-and-drafts वाले dot के लिए मेरा अनुमान है, किसी real account का log नहीं।

पहले dot के बाद pricing। OpenAI कहता है कि आप dots जोड़ सकेंगे और speed या monthly work बढ़ा सकेंगे, लेकिन उन्होंने अभी तक वो prices publish नहीं किए हैं।

14. The playbook

कोई भी ऐप कनेक्ट करने से पहले काम लिख लें।

एक agent, चार seats, एक बार में एक seat।

हर chain को पांच steps पर काटें। Checkpoint करें, फिर आगे बढ़ें।

पहले allow list लिखें। Gaps ASK FIRST में जाएंगे।

Approvals को दिन में पांच से कम रखें, वरना आपकी review असली नहीं रहेगी।

काम को रखने की जगह दें, और शुक्रवार को index पढ़ें।

fleyta - inline image

The point

Dots पहला ऐसा agent है जिसे ज़्यादातर लोग सोते समय भी चलता छोड़ देंगे। इससे सवाल "क्या यह काम कर सकता है" से बदलकर "कोई देखे, इससे पहले यह कितना आगे निकल जाता है" हो जाता है।

OpenAI का अपना card इसका इशारा देता है: chain दोगुनी करो, flags दोगुने से भी ज़्यादा हो जाते हैं।

इसलिए लंबी chain मत बनाइए। छोटे legs बनाइए, हर leg के अंत में एक Skeptic रखिए, और ऐसा ladder बनाइए जो आपसे सिर्फ उन्हीं चीज़ों के बारे में पूछे जिनके बारे में पूछना ज़रूरी है।

पांच steps, फिर check। बस इतना ही करना है।

लॉन्च की जानकारी OpenAI के dots announcement से ली गई है। System card के आंकड़े The New Stack द्वारा रिपोर्ट किए गए हैं। प्लान की कीमतें 1 अक्टूबर, 2026 तक की लॉन्च coverage से ली गई हैं और बदल सकती हैं।

एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें