5 टास्क पर 8.6%। 10 पर 19.7%।
यह आंकड़ा dots के लिए OpenAI के अपने system card से लिया गया है। पांच टास्क को एक साथ जोड़ दें, तो 8.6% रन boundary problems के लिए फ्लैग हो जाते हैं। दस जोड़ें, तो यह आंकड़ा दोगुने से भी ज्यादा हो जाता है।
लॉन्च वाले दिन सबने plush mascots की फोटो शेयर की। लेकिन यह लाइन लगभग किसी ने पोस्ट नहीं की।
dots की ज़्यादातर गाइड्स आपको कहती हैं कि सब कुछ एक चेन में जोड़ दो और एजेंट को काम करने दो। यह गाइड उस बात पर है कि चेन को कहाँ काटना है, ताकि एजेंट पूरा हफ्ता बिना भटके वही काम करे जो आपने उसे सौंपा है।
एक dot, चार सीटें, एक permission ladder, और हर पांच स्टेप पर एक checkpoint।
TLDR: कोई भी ऐप कनेक्ट करने से पहले काम लिख लें, dot को चार सीटें दें जिन्हें वह एक-एक करके इस्तेमाल करे, चेन को बिना checkpoint के पांच स्टेप से ज़्यादा न चलने दें, और अपनी approvals को दिन में पांच से कम रखें। Prompts सेक्शन 6 से 8 में हैं, गणित (math) सेक्शन 3 और 8 में है।
1. पहले आंकड़े
1लॉन्च की तारीख 29 सितंबर, 20262मॉडल GPT-6 Astra3जिन ऐप्स से यह कनेक्ट हो सकता है 4,000+4पहला dot Pro और Business Premium में शामिल5Pro tiers $100 / $200 / $500 प्रति माह6Business Premium $125 प्रति यूज़र प्रति माह, सालाना प्लान पर $1007dot से चैट करना ChatGPT की लिमिट में नहीं गिना जाएगा8Codex या Work में शुरू किए गए टास्क हमेशा की तरह इनमें गिने जाएंगे9यह कहाँ मिलेगा ChatGPT desktop, web, mobile, Slack, Teams10मैसेजिंग "जल्द आ रहा है"1112system card से13boundary flags, 5-task chain 8.6%14boundary flags, 10-task chain 19.7%15indirect injection, internal tests 99.79% सुरक्षित16external red team, 1,810 attacks 8.5% पास हो गए17misleading-information tasks 151 में से 0 misaligned
ऊपर वाला हिस्सा तो सभी ने पोस्ट कर दिया। नीचे वाला हिस्सा वो है जिससे आपका सेटअप करने का तरीका बदल जाना चाहिए।
2. एक स्क्रीन में समझें कि dot क्या है
dot एक हमेशा ऑन रहने वाला एजेंट है जो आपका अपना है। चार चीज़ें इसे ChatGPT की आम चैट से अलग बनाती हैं:
1मॉडल GPT-6 Astra, न कि अच्छे इंटरफ़ेस के पीछे छिपा कोई हल्का मॉडल2अपना कंप्यूटर एक cloud machine जिसका अपना ब्राउज़र है, आपके लैपटॉप बंद होने पर भी चलती है3आपके मैसेजेस के बीच आपके कनेक्टेड ऐप्स में "proactive research" करता है, सिर्फ read-only4 यह वहाँ मैसेज नहीं भेज सकता, ऐप का डेटा नहीं बदल सकता, या आपका कंप्यूटर नहीं चला सकता5एक पहचान ChatGPT, Slack और Teams में एक ही dot और एक ही memory
और दो कंट्रोल जिनका इस्तेमाल आप सबसे ज़्यादा करेंगे:
1Custom Rules किसी action की अनुमति दें, approval मांगें, या उसे ब्लॉक करें2auto-review उन actions की जांच करता है जो आपके अकाउंट्स को छू सकते हैं या डेटा शेयर कर सकते हैं
OpenAI ने अपना लॉन्च पोस्ट इस बात से खत्म किया: dots अभी भी गलतियां कर सकते हैं, इसलिए महत्वपूर्ण कामों की हमेशा समीक्षा करें। आगे दी गई हर बात इसी समीक्षा को इतना तेज़ बनाने के बारे में है कि आप इसे असल में कर सकें।
3. वो आंकड़ा जो किसी ने पोस्ट नहीं किया
मैंने system card के इन दो आंकड़ों पर थोड़ा गणित लगाया।
अगर चेन के हर स्टेप में सीमा से बाहर जाने का उतना ही छोटा और स्वतंत्र मौका होता, तो साधारण गणित से 5 स्टेप से 10 स्टेप तक पहुँचा जा सकता था:
15-step chain flagged 8.6%2per-step chance that implies 1 - (1 - 0.086)^(1/5) = 1.78%3410 steps, if steps were independent 1 - (1 - 0.0178)^10 = 16.5%510 steps, what the card measured 19.7%
मापा गया आंकड़ा स्वतंत्र रूप से निकाले गए आंकड़े से ज़्यादा है।
मेरी समझ: गलतियां जमा होती जाती हैं। जो स्टेप थोड़ा सा भटकता है, वो अगले स्टेप को थोड़ी गलत तस्वीर देता है, और अगला स्टेप उसी पर आगे बढ़ता है। इसलिए रिस्क चेन से भी तेज़ी से बढ़ता है।
ये सिर्फ दो आंकड़े हैं, और OpenAI ने नहीं बताया है कि फ्लैग हुई समस्याएं क्या थीं, इसलिए इसे एक मोटे संकेत की तरह लें। फिर भी, इसके आधार पर नियम बनाने लायक ये काफी है:
1वह नियम जिस पर यह गाइड टिकी है2checkpoints के बीच कभी 5 स्टेप से ज़्यादा नहीं
4. चार सीटें, एक dot
जिस dot को कहा जाए "तुम मेरे असिस्टेंट हो", वो असिस्टेंट जैसा काम करता है: मददगार, धुंधला, और ज़रूरत से थोड़ा लंबा। लेकिन जिस dot को कहा जाए "अभी तुम Skeptic हो, और Skeptic सिर्फ वो ढूंढता है जो फेल होता है", वो ऐसा काम देता है जो आप असल में इस्तेमाल कर सकते हैं।
इसीलिए dot को चार सीटें मिलती हैं। वह एक बार में एक ही सीट पर बैठता है और हर जवाब की शुरुआत में बताता है कि वह किस सीट पर है।
1LOOKOUT आपके कनेक्टेड ऐप्स पढ़ता है, बताता है कि क्या बदला, कभी कुछ लिखता नहीं2MAKER अपने कंप्यूटर पर काम करता है, आपको सीधा artifact देता है3SKEPTIC brief के आधार पर artifact की जांच करता है, बताता है कि क्या फेल हुआ4RUNNER approved काम को सही जगह पहुंचाता है, कुछ भी बाहर जाने से पहले पूछता है
ये चार अलग एजेंट नहीं, बल्कि एक ही एजेंट के चार मोड हैं। एक memory, एक rulebook, चार छोटे-छोटे काम।

5. सेटअप, सही क्रम में
11 कंप्यूटर पर ChatGPT खोलें पहला dot desktop या web पर बनता है,2 mobile उससे बात कर सकता है पर बना नहीं सकता32 sidebar में dots खोजें नहीं दिख रहा = गलत प्लान, अभी आपके देश में नहीं आया,4 या admin ने इसे चालू नहीं किया है53 नाम रखें छोटा, lowercase, बिना स्पेस6 सुबह 7 बजे आपको इसे Slack में टाइप करना होगा74 job description पेस्ट करें सबसे पहले, सेक्शन 6 वाला85 sources कनेक्ट करें जब यह आपको काम दोहराकर confirm कर दे, तभी96 Slack या Teams में जोड़ें जब यह समझ जाए कि इसे क्या करना है
लोग स्टेप 4 से पहले स्टेप 5 कर देते हैं, यहीं गलती होती है। 40 ऐप्स से जुड़ा लेकिन बिना brief वाला एजेंट बहुत जानकारी रखता है, पर कोई काम का आउटपुट नहीं देता।
6. Job description
इसे पहला मैसेज बनाकर पेस्ट करें। सिर्फ ब्रैकेट बदलें, बाकी कुछ नहीं।
1तुम मेरे standing operations agent हो। इस मैसेज को हर टास्क के लिए अपना job2description मानो, उन टास्क सहित जो मैं Slack या अपने फोन से शुरू करता हूं।34मैं कौन हूं5मैं [company or project] में [role] हूं। मेरा हफ्ता ज़्यादातर [one sentence] में बीतता है।67तुम्हारी ज़िम्मेदारी क्या है (नतीजे, काम नहीं)81. [result one]92. [result two]103. [result three]1112सीटें13तुम एक बार में एक ही सीट पर बैठोगे और हर जवाब की शुरुआत में उसका नाम बताओगे:14LOOKOUT, MAKER, SKEPTIC, RUNNER।15- LOOKOUT सिर्फ पढ़ता और रिपोर्ट करता है।16- MAKER मुझे artifact दिखाता है, उसका वर्णन नहीं।17- SKEPTIC इस brief के आधार पर MAKER के काम की जांच करता है और बताता है कि क्या फेल हुआ।18- RUNNER सिर्फ approved काम आगे बढ़ाता है और कुछ भी बाहर जाने से पहले पूछता है।1920चेन का नियम21कभी भी लगातार 5 स्टेप से ज़्यादा मत चलो। 5वें स्टेप के बाद रुको, SKEPTIC बनो,22checkpoint चलाओ, और आगे बढ़ने से पहले PASS का इंतज़ार करो।2324मुझसे कैसे बात करनी है25- पहले नतीजा। फिर ज़्यादा से ज़्यादा तीन बातें जिन पर मुझे फैसला लेना है।26- Blocked: तुमने क्या कोशिश की और तुम्हें क्या चाहिए, सिर्फ दो लाइनों में।27- अगर पक्का न हो कि कोई काम scope में है या नहीं: पहले पढ़ो, फिर एक सवाल पूछो। खुद कुछ मत करो।2829चारों सीटों, तीनों नतीजों और चेन के नियम को अपने शब्दों में दोहराकर confirm करो।30फिर रुक जाओ।
आखिरी लाइन को नज़रअंदाज़ मत करें। अगर dot "weekly report draft करो" को "हफ्ते भर पर रिपोर्ट लिखो" में बदल दे, तो आपने गलत रिपोर्ट्स का पूरा हफ्ता बर्बाद होने से पहले ही, एक मैसेज में गलती पकड़ ली।
7. Approval budget के साथ permission ladder
Custom Rules आपको तीन पायदान देते हैं: allow, require approval, block। ज़्यादातर लोग पाबंदियों की एक दीवार खड़ी कर देते हैं, फिर दिन में 40 चीज़ें approve करते हैं और देखना बंद कर देते हैं कि वे क्या approve कर रहे हैं।
पहले allow वाला पायदान लिखें। नीचे उदार रहें, ऊपर सख्त।
1ALLOW2- मेरे कनेक्टेड sources में कुछ भी पढ़ना।3- public web ब्राउज़ करना, अपना कंप्यूटर इस्तेमाल करना, code चलाना।4- अपने workspace और [NAME] Space में drafts बनाना और बदलना।56ASK FIRST7- किसी इंसान को भेजा गया कोई भी मैसेज: email, DM, channel post, invite, comment।8- किसी ऐसे file में बदलाव जो तुमने नहीं बनाया।9- repository में कोई भी action, pull request खोलना सहित।10- कोई भी खरीदारी, subscription या form submission।1112BLOCK13- Passwords, 2FA, billing, payment settings।14- कुछ भी delete करना।15- मेरे नाम से public में कुछ पोस्ट करना।16- task के brief में दिए गए नामों के अलावा किसी और से संपर्क करना।1718GAPS19जो भी चीज़ rules में नहीं आती, वो ASK FIRST में गिनी जाएगी।20मुझे बताओ कि कौन सा rule साफ नहीं था। gap को कभी action के पक्ष में मत सुलझाओ।
फिर खुद को एक budget दें। यहां एक dot के लिए एक हफ्ते का उदाहरण है जो research, drafts और weekly digest करता है। यह बंटवारा मेरा अनुमान है, कोई मापा गया आंकड़ा नहीं:
1एक उदाहरण हफ्ता, 420 actions ऊपर वाला ladder "हर चीज़ के लिए पूछो"2reads और web 300 allow ask3अपने workspace में drafts 80 allow ask4लोगों को messages 28 ask ask5repo और file changes 8 ask ask6blocked attempts 4 block ask7आपको click करनी वाली approvals 36 प्रति सप्ताह 420 प्रति सप्ताह8प्रति working day ~7 ~84
कोई भी दिन में 84 approvals नहीं पढ़ता। आप असल में सात ही पढ़ेंगे। ladder का असली काम यही है: approvals को इतना कम रखना कि आप उन्हें सच में देख सकें।
मेरा लक्ष्य: दिन में पांच से कम। अगर दो हफ्ते तक आप इससे ऊपर हैं, तो किसी एक recurring action को एक पायदान नीचे ले जाएं या source को सीमित करें।
8. हर पांच स्टेप पर checkpoint
यहीं पर वो 19.7% काम आता है।
कोई बड़ा काम एक लंबी चेन में नहीं चलता। वह ज़्यादा से ज़्यादा पांच स्टेप के legs में चलता है, और हर leg Skeptic पर खत्म होता है।
1CHECKPOINT (Skeptic, हर leg के अंत में)23इन पांचों का जवाब दो, हर एक एक लाइन में:41. क्या इस leg ने वो किया जो brief में था, या कोई आसान और मिलता-जुलता काम?52. क्या किसी स्टेप ने ऐसे source या इंसान तक पहुंच बनाई जिसका नाम brief में नहीं था?63. क्या हर number या तो तुमने calculate किया है या उस जगह से linked है जहां तुमने उसे पढ़ा?74. क्या कोई ऐसा दावा है जिसके लिए तुम evidence नहीं दिखा सकते? उसे list करो।85. अगर मैं इस leg को approve कर दूं और यह गलत हो, तो क्या टूटेगा?910Verdict:11PASS अगले leg पर बढ़ो12HOLD रुको, पहले मुझे item 2, 4 और 5 दिखाओ
अब सेक्शन 3 जैसा ही rough calculation करते हैं। मान लें कि Skeptic checkpoint पर 5 में से 4 गलतियां पकड़ लेता है। यह मेरा अनुमान है, कोई मापी गई दर नहीं:
1एक 10-step chain, बिना checkpoint 19.7% flagged (system card)23दो 5-step legs, हर एक में checkpoint4 per leg flagged 8.6%5 checkpoint के बाद बचा 8.6% x 0.2 = 1.7%6 दोनों legs मिलाकर 1 - (1 - 0.017)^2 = 3.4%
अगर Skeptic आधी भी पकड़ता है, तो दो legs के बाद आंकड़ा 19.7% की जगह 8.6% के आसपास आ जाता है। चेन को काटना ज़्यादातर काम करता है, पकड़ने की दर बाकी का।

9. काम को रखने की जगह दें
जो काम chat thread में दब जाता है, वो आपको दोबारा कभी नहीं मिलता। Dots ChatGPT Spaces और Pages से जुड़ते हैं, जिनमें आप, आपकी टीम और dot तीनों काम करते हैं।
एक Space, चार pages:
100 index हर run की एक लाइन: date, used seats, artifact, verdict201 inbox LOOKOUT की findings, सबसे नई ऊपर, date के साथ302 review MAKER के artifacts, हर एक के नीचे SKEPTIC का checkpoint403 shipped जो आपने approve किया, approval date के साथ
dot को यह map एक बार बता दें। दो हफ्ते बाद, index page पूरे सेटअप की सबसे काम की चीज़ बन जाता है: यह एकमात्र पढ़ने लायक रिकॉर्ड होता है कि हमेशा ऑन रहने वाले एजेंट ने आपके हफ्ते के साथ क्या किया।
10. पहला असली run
किसी ऐसी चीज़ से शुरू करें जो काम की हो, बार-बार होती हो, और गलत होने पर दोबारा करना सस्ता हो। Friday digest चारों सीटों का इस्तेमाल करता है और गलत होने पर भी सुरक्षित रहता है।
1Standing task। हर शुक्रवार 16:00 बजे, और जब मैं कहूं "run the digest"।23LEG 1 (max 5 steps)4LOOKOUT [calendar], [email], [repo]: इस हफ्ते क्या बदला जो सोमवार को5 जुड़ने वाले किसी व्यक्ति को जानना ज़रूरी होगा। ज़्यादा से ज़्यादा पांच bullets, हर एक6 "decision needed" या "no action" पर खत्म हो।7MAKER सिर्फ उन्हीं bullets से: SHIPPED, MOVED, WAITING।8 हर section में ज़्यादा से ज़्यादा 120 words, हर SHIPPED item के लिए links।9SKEPTIC checkpoint। SHIPPED में बिना link वाली कोई भी चीज़ WAITING में चली जाएगी।1011LEG 2 (सिर्फ PASS पर)12RUNNER इसे 02 review में "Week of [date]" के नाम से save करो, 00 index में एक लाइन जोड़ो।13 इसे किसी को मत भेजो।1415फिर मुझे सिर्फ checkpoint item 5 का जवाब मैसेज करो, और कुछ नहीं।
11. Dots vs Grok Bot
एक ही कैटेगरी, लेकिन default shape अलग।
1 DOTS GROK BOT2default shape एक agent, कई seats कई named bots3memory एक, हर seat share करती है हर bot की अपनी4lives in ChatGPT, Slack, Teams अपनी app और chats5good fit एक व्यक्ति का हफ्ता, एक rulebook अलग-अलग काम जो कभी नहीं मिलते
अगर आपके काम context share करते हैं (आपका inbox आपके digest को feed करता है, जो आपके Monday plan को feed करता है), तो चार सीटों वाला एक dot ज़्यादा आसान है। अगर उन्हें एक-दूसरे को कभी नहीं देखना चाहिए (client A और client B), तो अलग-अलग bots बेहतर boundary बनाते हैं।
12. The guards
1chain 5 steps से लंबी -> रुको, checkpoint, PASS का इंतज़ार करो2rule gap -> ASK FIRST, unclear rule का नाम बताओ3किसी भी इंसान को message -> ASK FIRST, हमेशा4password, billing, delete, public -> BLOCK5काम के बीच login या captcha -> dot के कंप्यूटर से control ले लो62 हफ्ते तक दिन में 5+ approvals -> एक rung बदलो या source सीमित करो7SKEPTIC तारीफ लिखे -> artifact नहीं, checkpoint दोबारा लिखो
हर guard अनिश्चितता को action की तरफ नहीं, आपकी तरफ धकेलता है।
13. जो मैंने test नहीं किया
Drift का गणित। एक system card के दो आंकड़े एक मोटा संकेत हैं, कोई proven model नहीं। OpenAI ने नहीं बताया कि flagged boundary problems क्या थीं, इसलिए मैं नहीं कह सकता कि वे कितनी गंभीर थीं।
Skeptic की catch rate। 5 में से 4 गणित का pattern दिखाने के लिए एक अनुमान है। खुद के काम की जांच करता dot कोई independent reviewer नहीं है, इसलिए असली दर इससे कम हो सकती है।
उदाहरण वाला हफ्ता। 420 actions और rungs के हिसाब से उनका बंटवारा research-and-drafts वाले dot के लिए मेरा अनुमान है, किसी real account का log नहीं।
पहले dot के बाद pricing। OpenAI कहता है कि आप dots जोड़ सकेंगे और speed या monthly work बढ़ा सकेंगे, लेकिन उन्होंने अभी तक वो prices publish नहीं किए हैं।
14. The playbook
कोई भी ऐप कनेक्ट करने से पहले काम लिख लें।
एक agent, चार seats, एक बार में एक seat।
हर chain को पांच steps पर काटें। Checkpoint करें, फिर आगे बढ़ें।
पहले allow list लिखें। Gaps ASK FIRST में जाएंगे।
Approvals को दिन में पांच से कम रखें, वरना आपकी review असली नहीं रहेगी।
काम को रखने की जगह दें, और शुक्रवार को index पढ़ें।

The point
Dots पहला ऐसा agent है जिसे ज़्यादातर लोग सोते समय भी चलता छोड़ देंगे। इससे सवाल "क्या यह काम कर सकता है" से बदलकर "कोई देखे, इससे पहले यह कितना आगे निकल जाता है" हो जाता है।
OpenAI का अपना card इसका इशारा देता है: chain दोगुनी करो, flags दोगुने से भी ज़्यादा हो जाते हैं।
इसलिए लंबी chain मत बनाइए। छोटे legs बनाइए, हर leg के अंत में एक Skeptic रखिए, और ऐसा ladder बनाइए जो आपसे सिर्फ उन्हीं चीज़ों के बारे में पूछे जिनके बारे में पूछना ज़रूरी है।
पांच steps, फिर check। बस इतना ही करना है।
लॉन्च की जानकारी OpenAI के dots announcement से ली गई है। System card के आंकड़े The New Stack द्वारा रिपोर्ट किए गए हैं। प्लान की कीमतें 1 अक्टूबर, 2026 तक की लॉन्च coverage से ली गई हैं और बदल सकती हैं।





