अब तक आपने जितने भी agents इस्तेमाल किए हैं, वे सब एक ही पैकेज में आते थे। harness — यानी कंप्यूटर, लॉगिन, मेमोरी, रूटीन — और उसे चलाने वाला brain, दोनों एक ही कंपनी बनाती थी और साथ में बेचती थी।
7 अक्टूबर को Grok Bot ने इन दोनों को अलग कर दिया:
https://x.com/elonmusk/status/2107724314451878104
अब से SpaceX हर काम के लिए सबसे बेहतरीन back-end model को चुनेगा — और इस लिस्ट में सबसे पहला नाम Claude Opus 5.5 का है। harness अभी भी SpaceX के पास है, लेकिन brain अब Anthropic का हो गया है।
यह कॉम्बिनेशन इस प्रोडक्ट का अब तक का सबसे ताकतवर वर्ज़न है: एक ऐसा agent जिसका अपना कंप्यूटर है और जो आपके सोते हुए भी काम करता रहता है, जिसे वह मॉडल चला रहा है जो multi-step agentic work के independent benchmarks में सबसे आगे है।
यह 10-स्टेप ट्यूटोरियल है
इस बात को समझने से लेकर कि क्या बदला है, Opus-पावर्ड स्पेशलिस्ट्स की पूरी टीम चलाने तक — जो आपस में काम बांटते हैं और आपको सिर्फ तभी बीच में लाते हैं जब किसी फैसले के लिए इंसान की ज़रूरत हो।
01. समझें कि अभी-अभी क्या बदला
शुरुआत एक पोस्ट से हुई। US समय के मुताबिक 6 अक्टूबर की देर रात, Musk ने X पर लिखा कि SpaceX हर काम के लिए सबसे अच्छा back-end model इस्तेमाल करेगा — उन्होंने Claude Opus 5.5, Midjourney और Suno का नाम लिया। उनकी आखिरी लाइन थी: "जो भी आपको सबसे बेहतरीन नतीजा देने की संभावना रखता हो।"
कुछ घंटे बाद, Grok Bot टीम की Lauren (@poteto) ने इसे और साफ किया: सभी bots को Opus 5.5 की ताकत मिलेगी, और वे Cursor के models पर चलने वाले cloud agents बना सकते हैं। 9to5Mac ने 7 अक्टूबर को इसे लाइव रिपोर्ट किया।
https://x.com/claudeai/status/2107894039626277339
प्रतिद्वंद्वी का मॉडल क्यों? क्योंकि agent असल में जो काम करता है, उसमें यह फर्क बहुत बड़ा है। Artificial Analysis ने दोनों labs को एक ही harness पर मापा:

एक बात ध्यान रखें: यह Grok 4.6 है, सितंबर वाला Grok 4.7 नहीं, और दोनों को एक महीने के अंतर पर मापा गया था। लेकिन Terminal-Bench वो नंबर है जो बताता है कि क्या आप मॉडल को सिर्फ सवाल नहीं, बल्कि पूरा काम सौंप सकते हैं — और वहां यह अंतर लगभग 3 गुना है।
https://x.com/zhuokaiz/status/2102825912471527738
मीडिया से पहले X पर लोगों ने इस पर रिएक्ट किया:
7 अक्टूबर को Grok Bot ने इन्हें अलग कर दिया सबसे बेहतरीन back-end model के लिए — और इस लिस्ट में सबसे पहला नाम Claude Opus 5.5 का है। harness अभी भी SpaceX के पास है। brain अब Anthropic का हो गया है।
किसने
क्या कहा
Theo - t3.gg (@theo)
"बुरी खबर दोस्तों: Grok Bot वाकई बहुत अच्छा है" — 4.4M व्यूज़, खबर आने से कुछ घंटे पहले पोस्ट किया गया। अगले दिन Lauren ने जवाब दिया कि यह और भी बेहतर हो गया है।
Lauren (@poteto)
Musk की पोस्ट को quote-post करके बताया कि Grok Bot को अपग्रेड मिल रहा है।
Iorel (@Iorel_X)
इसे ऐसे पेश किया जैसे Grok Bot अब किसी एक मॉडल में बंधे रहने के बजाय बाहरी models के लिए खुल गया हो।
02. इसे इंस्टॉल करें और Chief से मिलें
Grok Bot कोई ब्राउज़र टैब नहीं, बल्कि एक ऐप है। यह Mac, iPhone और iPad पर चलता है। आप अपने Grok या Cursor अकाउंट से साइन इन करते हैं — यह अलग से नहीं बिकता, बल्कि ज़्यादातर SuperGrok और पेड Cursor प्लान्स के साथ बंडल में आता है।
आपको जो स्क्रीन दिखती है वो chatbot से ज़्यादा किसी messaging client जैसी होती है: बाईं तरफ नाम वाले bots, दाईं तरफ बातचीत। हर bot को क्लाउड पर अपना कंप्यूटर मिलता है।

Opus 5.5 पाने के लिए आपको कुछ भी बदलने की ज़रूरत नहीं है। Grok Bot टीम के मुताबिक, यह हर bot के लिए डिफ़ॉल्ट है। इसके लिए कोई अलग Claude सब्सक्रिप्शन नहीं लेना पड़ता।
शुरुआत एक general-purpose bot से करें — मान लीजिए उसका नाम Chief है। इसका काम ये है कि जब आपको यह न पता हो कि कौन सा काम किस स्पेशलिस्ट को देना है, तो आप इसे मैसेज करें।
इसे कोई ऐसा काम दें जिसका नतीजा आप तीस सेकंड में चेक कर सकें। इसके बाद का हर कदम इसे बड़े कामों पर भरोसा करने के बारे में है — इसलिए शुरुआत ऐसे काम से करें जिसे आप वेरिफाई कर सकें।
03. एक ज़्यादा ताकतवर brain के लिए charter लिखें
Prompt एक रिक्वेस्ट है। Bot एक रोल है — यह बना रहता है, मेमोरी बनाता है, और एक डोमेन का मालिक होता है। इसलिए इसे किसी काम के नाम पर रखें: Inbox Manager, Research Lead, Sales Outbound।

फिर इसे ऐसे ब्रीफ करें जैसे किसी नए कर्मचारी को करते हैं: इसकी ज़िम्मेदारी क्या है, अच्छा काम कैसा दिखता है, और इसे कहां रुककर आपसे पूछना होगा।
Opus 5.5 के साथ क्या बदलता है, वो ये है। पुराने डिफ़ॉल्ट के लिए लिखे गए charters बचाव वाली सोच से लिखे जाते थे — छोटी-छोटी चेन, बार-बार चेक-इन — क्योंकि मॉडल कुछ स्टेप्स के बाद अटक जाता था। लेकिन ऐसे brain के साथ जो multi-step काम में लगभग 3 गुना ज़्यादा स्कोर करता है, आप सिर्फ पहला कदम नहीं, बल्कि पूरा काम सौंप सकते हैं।
Opus 5.5 API पर 1M-token context window और 128K तक output tokens को भी सपोर्ट करता है। Grok Bot इसमें से कितना हिस्सा सामने लाता है, यह पब्लिश नहीं हुआ है — लेकिन अब असल खेल लंबे कामों का है।
1Charter prompt — Opus 5.5 के लिए तैयार किया गया2तुम मेरे Research Lead हो।34// तुम्हारी ज़िम्मेदारी क्या है5कोई टॉपिक मिलने पर पूरा काम शुरू से अंत तक करो: प्राइमरी6सोर्स ढूंढो, जिस भी पेज का हवाला दो उसे खोलकर देखो, नंबरों को कम से कम7दो सोर्सेज़ से क्रॉस-चेक करो, और 1,500 शब्दों का एक ब्रीफ ड्राफ्ट करो।89// अच्छा काम कैसा दिखता है10हर नंबर के बगल में उसका लिंक होना चाहिए। अगर सोर्सेज़ में विरोधाभास हो11तो उन्हें एवरेज मत करो, बल्कि फ्लैग करो। ड्राफ्ट चैट में नहीं, मेरे Drive फोल्डर में जाना चाहिए।1213// तुम्हें कहां रुकना है14कभी पब्लिश मत करना। कभी किसी को ईमेल मत करना। सिर्फ ड्राफ्ट बनाना है।15अगर दो सोर्सेज़ में मतभेद हो और तुम उसे सुलझा न पाओ, तो उसे रोककर मुझसे पूछो।
नियम यह है: ज़्यादा स्मार्ट brain को ज़्यादा स्टेप्स मिलते हैं, ज़्यादा अधिकार नहीं। "तुम्हें कहां रुकना है" वाला हिस्सा पहले जितना ही सख्त रहेगा।
04. टूल्स को एक बार कनेक्ट करें — और data line खींचें

Grok Bot में एक plugin panel आता है जिसमें एक क्लिक में कनेक्शन हो जाते हैं: Notion, Slack, Google Drive, AWS Agents, AWS SageMaker, Browserbase, Composio और Context7, साथ ही कस्टम कनेक्शन भी।
ये कनेक्शन account-level होते हैं। Gmail को एक बार कनेक्ट कर लें, और आपका बनाया हर bot इसे इस्तेमाल कर सकता है। आपका पांचवां bot सेकंडों में काम करने लगता है।
नई बात यह है: अब आपके डेटा की दूसरी मंज़िल भी है। जब कोई bot Opus 5.5 के साथ सोचता है, तो वह जो पढ़ता है वो उस स्टेप के लिए Anthropic के पास जाता है। Musk की पोस्ट के नीचे Tom के opt-out वाले सवाल का अभी तक कोई जवाब नहीं आया है, और SpaceXAI ने यह पब्लिश नहीं किया है कि क्या शेयर किया जाएगा।
आप यह नहीं चुन सकते कि मॉडल कहां चलेगा। लेकिन आप यह चुन सकते हैं कि bot किस चीज़ को छुए। हर charter में यह जोड़ें:
1// data line — हर charter में जोड़ें2इन्हें खोलना, पढ़ना या समराइज़ करना मना है:3 - मेरे /Legal या /Finance Drive फोल्डर्स में मौजूद कुछ भी4 - मेरे वकील, अकाउंटेंट या बैंक से आए ईमेल5 - कोई भी ऐसा मैसेज जिसमें पासवर्ड, seed phrases या 2FA codes हों67अगर किसी काम में इनमें से किसी की ज़रूरत पड़े, तो रुककर पहले मुझसे पूछो।8जब किसी डॉक्यूमेंट पर काम करो, तो सिर्फ उतना ही इस्तेमाल करो जितना काम के लिए ज़रूरी हो।
सिर्फ वही कनेक्ट करें जिसकी सच में ज़रूरत है, बाकी को हाथ न लगाएं। Beta के दौरान हर कनेक्शन हर bot तक पहुंचता है — और अब एक से ज़्यादा कंपनियों तक भी।
05. लॉगिन सौंपें, पासवर्ड कभी नहीं
किसी असली कंपनी के अंदर ज़्यादातर सॉफ्टवेयर में न API होता है और न MCP server। यही वो तरीका है जिससे Grok Bot फिर भी उन पर काम कर पाता है।
Bot अपना cloud browser तब तक चलाता है जब तक उसे कोई login wall न मिल जाए। फिर वो स्क्रीन आपको सौंप देता है। आप लॉगिन करते हैं, done पर क्लिक करते हैं, और bot उसी browser session में वहीं से काम शुरू कर देता है जहां उसने छोड़ा था।
Bot को secret नहीं, session मिलता है। आप कभी चैट में कोई credential टाइप नहीं करते — और अब जब एक third-party model भी इसमें शामिल है, तो यह पहले से कहीं ज़्यादा ज़रूरी हो गया है। चैट में पेस्ट किया गया पासवर्ड वो टेक्स्ट है जिसे मॉडल पढ़ता है। लेकिन सौंपी गई स्क्रीन पर किया गया लॉगिन ऐसा नहीं है।
यह नियम हमेशा याद रखें: अगर कोई टूल आपसे मैसेज में पासवर्ड पेस्ट करने को कहे, तो समझ लीजिए आप गलत रास्ते पर हैं।
06. एक बार करके दिखाएं, फिर उसे routine बना दें
आप किसी bot को एक workflow सिखा सकते हैं — बस एक बार उसे करते हुए दिखाएं जब वो देख रहा हो। वो स्टेप्स सेव कर लेता है और अगली बार खुद चलाता है।

पहली रिकॉर्डिंग के लिए सबसे अच्छा काम वो होता है जो बार-बार होता हो, कई टूल्स में हो और स्थिर हो: कुछ ऐसा जो आप हर हफ्ते दो या उससे ज़्यादा ऐप्स में करते हैं, और जिसके स्टेप्स शायद ही बदलते हों। बोलकर समझाना मुश्किल, लेकिन करके दिखाने में चालीस सेकंड।
फिर उस routine को ट्रिगर होने की वजह दें। दो विकल्प हैं, दोनों plain language में सेट होते हैं — न कोई node canvas, न workflow builder:
1// schedule — morning brief2हर कार्यदिवस सुबह 7 बजे, मेरा calendar, inbox और3#launches Slack channel चेक करो। एक छोटा ब्रीफ दो: आज क्या है,4किसका जवाब देना है, और रात भर में क्या बदला।56// trigger — inbound catcher7जब भी किसी ऐसे domain से ईमेल आए जो मेरे contacts में नहीं है और8उसमें pricing का ज़िक्र हो, template से जवाब ड्राफ्ट करो और उसे रोककर रखो।910// वो shortcut जिससे ज़्यादातर routines बनते हैं11इसे हर हफ्ते चलाओ।12 ^ यह किसी पसंद आए काम के ठीक बाद बोल दें।
Opus 5.5 यहां अपनी असली कीमत चुकाता है: routines तब टूटते हैं जब कोई साइट अपना layout बदल दे या input थोड़ा अलग दिखे। Multi-step काम में ताकतवर मॉडल चुपचाप फेल होने के बजाय बदले हुए page से उबरने की ज़्यादा संभावना रखता है।
07. ऐसे स्पेशलिस्ट्स रखें जो Cursor agents बनाएं
कई bots को एक साथ चलाएं, हर एक की अपनी अलग ज़िम्मेदारी। अलग-अलग bots का मतलब है अलग मेमोरी, अलग context, और जब कुछ गड़बड़ हो तो चेक करने के लिए एक साफ thread। SpaceXAI का कहना है कि उसकी अपनी टीमें sales outreach, marketing, office operations और bug fixes के लिए bots चलाती हैं।
बांटवारा काम के आकार से नहीं, domain के हिसाब से करें। Expense Manager जो सिर्फ receipts के बारे में सोचता है, वो आपके receipts में माहिर हो जाता है।
नई लेयर Grok Bot टीम के ऐलान का शांत हिस्सा है: bots अब Cursor के किसी भी मॉडल पर चलने वाले cloud agents बना सकते हैं। यह ownership map से मेल खाता है — SpaceX ने अगस्त में $60 बिलियन की डील में Cursor खरीदा था।
तो एक coding bot अब manager बन जाता है। Opus-पावर्ड bot काम की प्लानिंग करता है और context संभालता है। Cursor agents एक साथ भारी काम करते हैं। फिर bot वापस आए नतीजों को रिव्यू करता है।
1// Repo Maintainer — agents को मैनेज करने वाला bot2तुम मेरे Repo Maintainer हो।34जब GitHub पर किसी issue को "bug" label मिले:51. अपने कंप्यूटर पर उसे reproduce करो और एक failing test लिखो।62. नई branch पर उसे fix करने के लिए Cursor cloud agent बनाओ।73. नतीजे पर पूरा test suite चलाओ।84. test, fix और 3-लाइन summary के साथ draft PR खोलो।910कभी merge मत करना। कभी main पर push मत करना।11अगर fix auth, billing या migration से जुड़ा हो, तो उसे मेरे लिए रोककर रखो।
X पर यूज़र्स ऐलान से पहले ही ऐसा कुछ कर रहे थे — सितंबर के अंत में Grok Bot से Cursor cloud agents बनाने के बारे में पोस्ट किया गया था
https://x.com/mikepat711/status/2103551603102126149
08. इन्हें ग्रुप चैट में डालें
Bots एक-दूसरे को मैसेज कर सकते हैं और threads में context शेयर कर सकते हैं। कई को एक group chat में डाल दें और वे खुद तालमेल बिठाते हैं — काम पास करते हैं, ज़िम्मेदारी तय करते हैं, और आपको सिर्फ तभी बीच में लाते हैं जब कोई फैसला लेना हो।
SpaceXAI का अपना उदाहरण: एक engineering bot bug reproduce करता है, ticket फाइल करता है, और debug करने के लिए उसे दूसरे bot को सौंप देता है। एक bot का यह तय करना कि दूसरा इसके लिए ज़्यादा सही है — और ज़िम्मेदारी पास कर देना — वो चीज़ है जो कोई single-chat tool नहीं करता।
सितंबर के अंत से, टीमें एक shared bot भी पब्लिश कर सकती हैं जिसे सहकर्मी ऐप या Slack में इस्तेमाल कर सकते हैं।
असली ट्रिक यह है कि ग्रुप को task list नहीं, objective दें। Task list का मतलब है कि आपने काम का बंटवारा पहले ही कर दिया। Objective उन्हें काम खुद बांटने देता है — और काम को तोड़ना exactly वही multi-step reasoning है जिसमें Opus 5.5 सबसे ताकतवर है।
1// tasks नहीं, objective2लक्ष्य: शुक्रवार शाम 5 बजे तक October newsletter लॉन्च करना।34Research Lead facts और sources संभालेगा।5Inbox Manager subscribers के जवाब संभालेगा।6Chief timeline संभालेगा और मुझे बताएगा कि क्या अटका हुआ है।78काम खुद बांट लो। पब्लिक होने वाली कोई भी चीज़ मेरे लिए रोककर रखो।
09. Approval line तय करें
Grok Bot का आधार यह है कि bot काम शुरू से अंत तक खुद पूरा करता है और सिर्फ तभी लौटता है जब उसे आपकी approval चाहिए हो। इसका मतलब है कि "approval कब चाहिए" यह तय करने की ज़िम्मेदारी आपकी है — क्योंकि bot का डिफ़ॉल्ट शायद आपके डिफ़ॉल्ट से मेल न खाए।

यह line काम के आकार पर निर्भर नहीं करती। यह reversibility पर निर्भर करती है। जो कुछ भी bot undo कर सकता है, वो वो अकेले पूरा करेगा। जो बाहरी दुनिया देखेगी, जिसमें पैसा लगेगा, या जिसे वापस नहीं लिया जा सकता, वो आपके लिए रोका जाएगा।
यह अब पहले से कम नहीं, बल्कि ज़्यादा ज़रूरी है। एक ताकतवर brain आपकी line तक पहुंचने से पहले काम में और ज़्यादा आगे निकल जाएगा — इसलिए यह line साफ-साफ लिखी होनी चाहिए।
1// ये हमेशा अकेले पूरे करो2draft · file · tag · summarize · research · prepare · reconcile3 ये सब reversible हैं। पूछो मत, बस करो और log करो।45// ये हमेशा मेरे लिए रोककर रखो6कंपनी के बाहर किसी व्यक्ति को कुछ भी भेजना7पैसा खर्च करना या ट्रांसफर करना, या किसी कीमत पर सहमत होना8कुछ भी public करना9ऐसी कोई चीज़ डिलीट करना जो साफ तौर पर junk न हो10किसी terms को मानना या कहीं sign up करना1112// जब शक हो13अगर तुम उसे एक मिनट से कम में undo नहीं कर सकते, तो उसे रोककर मुझसे पूछो।
हर bot के लिए यह लक्ष्य रखें: 36 drafts queued, 0 sent। हर reversible step पूरा हो, और पहले irreversible step पर hard stop।
10. लागत पर नज़र रखें, हर हफ्ते रिव्यू करें
Opus 5.5 कोई सस्ता brain नहीं है। API पर इसकी कीमत Grok से काफी ऊपर है:

एक छोटे काम में — 30K tokens in, 8K out — यह 11 सेंट के मुकाबले लगभग 28 सेंट बैठता है। बहुत लंबे context में यह क्रम उलट जाता है, क्योंकि 200K tokens के ऊपर Grok की दरें दोगुनी हो जाती हैं जबकि Opus की दरें वैसी ही रहती हैं।
Grok Bot में आप token के हिसाब से भुगतान नहीं करते — यह आपके plan में शामिल है। खुला सवाल, जो Adam Hincu ने X पर पूछा, यह है कि क्या Opus-पावर्ड काम plan limits को तेज़ी से खत्म कर देंगे। SpaceXAI ने इस पर कुछ नहीं कहा है। इसलिए routines जोड़ने से पहले पहले हफ्ते usage पर नज़र रखें।

और जो कुछ ऐलान हुआ है, वो सब अभी live नहीं है। Midjourney और Suno की कोई तारीख नहीं है, और कम से कम एक यूज़र के bot ने पहले दिन कहा कि Suno उपलब्ध नहीं है। Opus 5.5 पर काम बनाएं — यह confirm हो चुका है। बाकी का इंतज़ार करें।
फिर हर हफ्ते कैलेंडर में पंद्रह मिनट निकालें और bots को खुद अपनी रिपोर्ट देने दें:
1इस हफ्ते तुमने जो भी routines चलाए, उनकी लिस्ट दो। हर एक के लिए:23 - यह कितनी बार trigger हुआ4 - इसने क्या तैयार किया5 - क्या इसने छोड़ा, फेल हुआ, या अनुमान लगाना पड़ा6 - ऐसी कोई चीज़ जो तुमने मेरे लिए रोकी और मैंने कभी जवाब नहीं दिया78फिर बताओ कि इनमें से सबसे कम उपयोगी कौन सा है, और क्यों।9अगर तुम यह नहीं बता सकते कि कोई step किस मॉडल ने संभाला, तो साफ कह दो।
हर routine के एक output को खुद हाथ से चेक करें। खुद अपने काम को grade करने वाले bot में वही blind spot होगा जो आपमें है।
निष्कर्ष: असल प्रोडक्ट harness ही है
तीन सालों से सवाल यही था कि कौन सा मॉडल सबसे अच्छा है। इस हफ्ते मार्केट के सबसे आक्रामक model-builder ने एक अलग सवाल का जवाब दिया: कौन सा harness सबसे अच्छा है — और फिर उसके अंदर प्रतिद्वंद्वी का brain डाल दिया।
यही असली बदलाव है। Harness कंप्यूटर, लॉगिन, मेमोरी और routines का मालिक है। Brain नीचे से बदला जा सकता है, और अभी agent work के लिए सबसे अच्छा brain Opus 5.5 है।
आपका काम नहीं बदला। आप तय करते हैं कि क्या delegate करना है, bot का अधिकार कहां खत्म होता है, और वो किस डेटा को छू सकता है। ये तीनों बातें charter में लिखें — और मार्केट के सबसे ताकतवर brain को clicking करने दें।





