'98% AGI' से आगे: AI का वह बदलाव जो पूरे कार्यों को पूरा करता है
3 सितंबर, 2026 को, OpenAI ने GPT-6 Astra की घोषणा की।
इसके रिलीज़ के तुरंत बाद, ध्यान इसके स्कोर पर केंद्रित हो गया: कठिन गणित बेंचमार्क "FrontierMath" पर लगभग 98%, कंप्यूटर संचालन मापने वाले "ARC-AGI-3" पर 99.9%, और साइबर सुरक्षा मूल्यांकन "ExploitBench" पर 100%।
केवल इन आंकड़ों को देखकर, कोई यह कहने के लिए प्रलोभित हो सकता है, "एक लगभग-पूर्ण AI आ गया है" या "AGI आखिरकार पूरा हो गया।"
हालांकि, GPT-6 Astra को केवल बेंचमार्क स्कोर से आंकना खतरनाक है।
Astra में बदलाव सिर्फ सवालों के जवाब में अधिक सही टेक्स्ट लौटाने के बारे में नहीं है।
यह ब्राउज़र खोलता है, दस्तावेज़ पढ़ता है, कोड निष्पादित करता है, स्प्रेडशीट अपडेट करता है, वेबसाइट संचालित करता है, बीच में विफल होने पर कारणों की जांच करता है, और अंततः एक समीक्षा योग्य डिलीवरेबल वापस लाता है।
ChatGPT को दिए जाने वाले कार्य की इकाई "एकल प्रश्न" से "व्यावसायिक संचालन की एक श्रृंखला" में स्थानांतरित हो गई है।
यदि आप Astra का उपयोग पारंपरिक ChatGPT की तरह सिर्फ ईमेल ड्राफ्ट या टेक्स्ट सारांश के लिए करते हैं, तो यह सिर्फ एक महंगा टेक्स्ट जनरेशन AI बना रहता है। इसका मूल्य तब सामने आता है जब आप इसे उन कार्यों को सौंपते हैं जिन्हें मनुष्य कई बार स्क्रीन स्विच करके संभालते थे, एक सुसंगत प्रक्रिया के रूप में माना जाता था।(OpenAI
इस लेख में, हम आधिकारिक सुविधा परिचय से परे, विदेशी कंपनियों द्वारा पुष्टि किए गए मामलों, बेंचमार्क को कैसे पढ़ें, Claude के साथ तुलना, मूल्य निर्धारण, सुरक्षा, और जापानी कंपनियों द्वारा व्यावहारिक उपयोग के लिए डिज़ाइन में गहराई से उतरेंगे।
GPT-6 Astra क्या है?
GPT-6 Astra को OpenAI द्वारा GPT-6 पीढ़ी के शीर्ष-स्तरीय मॉडल के रूप में स्थान दिया गया है, जिसे "सबसे बुद्धिमान और सबसे संरेखित मॉडल" के रूप में वर्णित किया गया है।
लॉन्च के समय, इसे पहले चुनिंदा संगठनों को रोल आउट किया जा रहा है, उसके बाद ChatGPT Plus, Pro, Business, Enterprise, API, और Amazon Bedrock पर। Enterprise में, यह डिफ़ॉल्ट रूप से बंद है जब तक कि किसी व्यवस्थापक द्वारा सक्षम न किया जाए, और आधिकारिक घोषणा में मुफ्त योजना रिलीज़ का कोई स्पष्ट उल्लेख नहीं है।
API पर मॉडल का नाम gpt-6-astra है। Astra Pro, जो उच्च कंप्यूट का उपयोग करता है, Pro, Business, और Enterprise उपयोगकर्ताओं के लिए भी पेश किया जा रहा है।(OpenAI
मुख्य विशिष्टताओं को नीचे संक्षेप में प्रस्तुत किया गया है:
आइटम | GPT-6 Astra |
|---|---|
संदर्भ लंबाई | 1,050,000 टोकन |
अधिकतम आउटपुट | 128,000 टोकन |
ज्ञान कटऑफ | 30 अप्रैल, 2026 |
इनपुट | टेक्स्ट, इमेज (नेटिव) |
आउटपुट | टेक्स्ट (नेटिव) |
रीज़निंग स्तर | low / medium / high / xhigh / max |
API इनपुट मूल्य | $10 प्रति 1M टोकन |
API आउटपुट मूल्य | $50 प्रति 1M टोकन |
कैश्ड इनपुट | $1 प्रति 1M टोकन |
फाइन-ट्यूनिंग | समर्थित नहीं |
मुख्य उपकरण | वेब सर्च, फ़ाइल सर्च, कोड निष्पादन, शेल, कंप्यूटर उपयोग, MCP, इमेज जनरेशन, आदि |
जबकि यह इमेज पढ़ सकता है, मॉडल का नेटिव आउटपुट टेक्स्ट है। इमेज जनरेशन एक अलग टूल को कॉल करके की जाती है। यह प्रत्यक्ष ऑडियो या वीडियो इनपुट के लिए मॉडल नहीं है।
इसके अतिरिक्त, 272,000 टोकन से अधिक के लंबे इनपुट के लिए, पूरे अनुरोध पर मूल्य गुणक लागू होता है। इनपुट और कैश शुल्क दोगुना हो जाता है, और आउटपुट शुल्क 1.5x होता है। सिर्फ इसलिए कि यह 1.05 मिलियन टोकन फिट करता है, इसका मतलब यह नहीं है कि आपको हर बार हर आंतरिक दस्तावेज़ को इसमें ठूंस देना चाहिए; सटीकता से पहले लागत दक्षता गिर जाएगी।
Astra के साथ क्या बदला?
- कंप्यूटर संचालन "सहायक" से मुख्य युद्धक्षेत्र में स्थानांतरित हो गया
Astra के केंद्र में "कंप्यूटर उपयोग" है।
पिछला AI ब्राउज़र पर बटन क्लिक कर सकता था या फॉर्म भर सकता था। हालांकि, समस्याएं बनी रहीं: यह रुक जाता था यदि स्क्रीन लेआउट थोड़ा बदल जाता, मध्य-प्रक्रिया त्रुटियों से उबर नहीं पाता, या कई साइटों में फैले कार्यों में लक्ष्य से भटक जाता।
GPT-6 Astra ने OSWorld 2.0 पर 72.6% दर्ज किया, जो वास्तविक डेस्कटॉप वातावरण संचालन को मापता है। GPT-5.6 Sol 65.7% था।
इसके अलावा, Astra ने इस मूल्यांकन को लगभग 40 मिनट में संसाधित किया, जबकि Sol ने लगभग 75 मिनट लिए। न केवल सफलता दर बल्कि प्रसंस्करण समय भी लगभग 47% कम हो गया। स्क्रीन पर लक्ष्य खोजने वाले ScreenSpot में, Astra ने Sol के 76.9% की तुलना में 92.7% स्कोर किया।(OpenAI
यह सिर्फ एक सहज डेमो वीडियो से कहीं अधिक है। यह निम्नलिखित कार्यों को लक्षित करता है:
- मानदंडों से मेल खाने वाले अस्पतालों या संपत्तियों की खोज करना और उम्मीदवारों की तुलना करना।
- रिपोर्ट बनाने के लिए कई प्रबंधन स्क्रीन से मान प्राप्त करना।
- CRM में ग्राहक जानकारी दर्ज करना और स्थिति अपडेट करना।
- सेटिंग्स जांचने के लिए वेब सेवाओं में लॉग इन करना।
- ब्राउज़र में बनाए गए ऐप को चलाना और बग ठीक करना।
- कई फ़ाइलों का संदर्भ लेते हुए स्प्रेडशीट या Slides को पूरा करना।
Mind2Web में, अपडेटेड Codex हार्नेस का उपयोग करने वाले Astra ने पिछले मॉडलों की तुलना में वेब कार्यों को 1.9x तेजी से संसाधित किया।
यहां महत्वपूर्ण बात यह है कि प्रदर्शन "पूरे हार्नेस" द्वारा निर्धारित होता है, जिसमें ब्राउज़र, उपकरण, निष्पादन वातावरण और सत्यापन प्रक्रिया शामिल है, न कि केवल मॉडल की बुद्धिमत्ता। केवल Astra नाम चुनने से अपने आप सभी स्क्रीन संचालन स्वचालित नहीं हो जाते।(OpenAI
- 1.05 मिलियन टोकन लंबे संदर्भ को अंत तक बनाए रखना
GPT-6 Astra की संदर्भ लंबाई लगभग 1.05 मिलियन टोकन है। इसमें अनुबंध, कार्यवृत्त, डिज़ाइन दस्तावेज़, स्रोत कोड और पिछले शोध को एक साथ संभालने की क्षमता है। हालांकि, "फिट करना" और "सटीक रूप से उपयोग करना" अलग बातें हैं।
लंबे टेक्स्ट में एम्बेडेड जानकारी खोजने के लिए MRCR मूल्यांकन में, Astra 256k–512k रेंज में 100% और 512k–1M रेंज में 96.3% था। GPT-5.6 Sol का बाद वाले में परिणाम 73.8% था।
जबकि Astra लंबे संदर्भ में मजबूत है, जब आप 1 मिलियन टोकन डालते हैं तो यह हर एक शब्द को पूरी तरह से याद नहीं करता है। यह अभी भी 1M टोकन बैंड में लगभग 3.7% समय विफल रहता है। एक विशाल दस्तावेज़ में केवल एक स्थान पर महत्वपूर्ण शर्तें रखने वाले डिज़ाइन से बचें; आपको लक्ष्यों, बाधाओं और अनुमोदन शर्तों को अलग-अलग स्पष्ट रूप से बताना होगा।(OpenAI
Astra में लंबे सत्रों में निरंतरता बढ़ाने के लिए तंत्र भी हैं, जैसे कि किसी टूल की प्रतीक्षा करते समय अन्य कार्यों पर काम करने के लिए अतुल्यकालिक टूल कॉल, निष्पादन के दौरान मानव पाठ्यक्रम सुधार की अनुमति देने के लिए स्टीयरिंग, और बातचीत के दौरान रीज़निंग स्तर बदलने पर भी कैश बनाए रखना।
यह "एक परफेक्ट प्रॉम्प्ट लिखें और छोड़ दें" से "प्रगति की जांच करना और पाठ्यक्रम सुधारना" की कार्यप्रवाह की ओर बढ़ रहा है।(OpenAI Developers
- सिर्फ टेक्स्ट नहीं, बल्कि तैयार डिलीवरेबल बनाना
Astra ने स्प्रेडशीट, Slides, दस्तावेज़, ऐप और शोध रिपोर्ट जैसे डिलीवरेबल बनाने की अपनी क्षमता को मजबूत किया है। पिछले मॉडल एक "प्रस्तुति रूपरेखा" बना सकते थे, लेकिन मनुष्यों को इसे PowerPoint में ले जाना, डिज़ाइन को समायोजित करना, संख्याओं को फिर से सत्यापित करना और लिंक जोड़ना पड़ता था। Astra अगले स्तर का लक्ष्य रखता है: सामग्री या कंपनी टेम्पलेट पढ़ना, संख्याओं को व्यवस्थित करना, Slides/स्प्रेडशीट बनाना, उन्हें ब्राउज़र में जांचना और सही की गई फ़ाइलें सबमिट करना।
प्रारंभिक अपनाने वाले Higgsfield ने कहा कि यह मौजूदा मॉडलों की तुलना में 20% कम टोकन के साथ एजेंट कार्यों को संसाधित कर सकता है। Harvey ने कानूनी कार्य में इसके निर्णय की प्रशंसा की, Jane Street ने जटिल तकनीकी मुद्दों के लिए आगे-पीछे की कमी पर ध्यान दिया, और Lovable ने उच्च रीज़निंग सेटिंग्स पर इसकी पुनरावृत्ति/परीक्षण क्षमताओं को महत्व दिया।
हालांकि, ये शुरुआती ग्राहकों की प्रशंसापत्र हैं, स्वतंत्र तृतीय-पक्ष प्रतिकृति परीक्षणों से साक्ष्य के समान नहीं हैं।(OpenAI
- लंबे कार्यों के दौरान "लक्ष्य भूलने" की संभावना कम
पारंपरिक एजेंट कभी-कभी शुरुआत में स्थापित योजना से भटक जाते थे—एक सुविधा को लागू करने के बजाय मामूली रीफैक्टरिंग में उलझ जाना, या अंतिम निर्णय के बजाय सिर्फ जानकारी एकत्र करके समाप्त करना। Astra ने लंबी अवधि के काम में स्थिरता में सुधार किया है।
दूसरी ओर, आधिकारिक डेवलपर दस्तावेज़ नोट करते हैं कि Astra स्पष्टीकरण प्रश्न पूछने, विवरणों को अधिक फ़ॉर्मेट करने, अभिव्यक्तियों को दोहराने, या आवश्यकता से अधिक परीक्षण करने के लिए रुक सकता है।
दूसरे शब्दों में, उच्च प्रदर्शन का मतलब यह नहीं है कि आप अस्पष्ट निर्देश दे सकते हैं। आपको लक्ष्य, पूर्णता की शर्तें, प्रश्न पूछने के मानदंड और अनुमोदन की आवश्यकता वाले संचालन पहले से कहीं अधिक स्पष्ट रूप से निर्धारित करने चाहिए।(OpenAI Developers
बेंचमार्क भारी हैं, लेकिन "सभी क्षेत्रों में विश्व में सर्वश्रेष्ठ" नहीं
Astra की घोषणा में आंखें खोल देने वाले आंकड़े थे: FrontierMath पर 97.6%, ARC-AGI-3 पर 99.9%, और ExploitBench पर 100%। ये महत्वपूर्ण कदम हैं, लेकिन हमें माप लक्ष्यों और निष्पादन शर्तों के बीच अंतर करना होगा।
कंप्यूटर संचालन और व्यावसायिक स्वचालन में महत्वपूर्ण वृद्धि हुई
AutomationBench में, जो वास्तविक व्यावसायिक कार्यों के करीब है, Astra ने 41.4% स्कोर किया। GPT-5.6 Sol 18.1% था, और Claude Fable 5.1 31.4% था। CAD-संबंधित कार्यों के लिए BenchCAD में, Astra 95.9%, Sol 83.3%, और Fable 5.1 84.3% था। वेब शोध के लिए BrowseComp में, Astra 91.5%, Sol 90.4%, और Claude Opus 5 90.8% था। Astra यहां आगे है, लेकिन Sol और Opus के साथ अंतर छोटा है।
Astra का लाभ सिर्फ एक खोज परिणाम खोजने के बजाय, स्क्रीन संचालन, फ़ाइल प्रसंस्करण, डेटा विश्लेषण और सत्यापन को मिलाकर जटिल मिश्रित कार्यों में सबसे अधिक स्पष्ट है।(OpenAI
कोडिंग में मजबूत, लेकिन Claude को पूरी तरह से पीछे नहीं छोड़ा
Terminal-Bench में, Astra ने 57.7% स्कोर किया, जो Sol (37.3%) और Fable 5.1 (55.8%) से आगे है। आंतरिक डेटाबेस माइग्रेशन मूल्यांकन में, Astra 63.9% बनाम Sol का 42.7% था। मौजूदा सिस्टम को पढ़ने और उन्हें तोड़े बिना बदलाव करने में स्पष्ट सुधार देखे गए हैं।
हालांकि, Artificial Analysis कोडिंग एजेंट इंडेक्स में, Astra 67.0, Claude Fable 5 67.2, और Claude Opus 5 68.1 था। FrontierCode Extended में, Astra 64.5 बनाम Fable 5 का 64.9 था। Main मूल्यांकन में, Astra 53.3, Fable 5 53.5, और Opus 5 53.4 था।
Astra कोडिंग के लिए शीर्ष स्तर पर है, लेकिन यह हर कोड मूल्यांकन में Claude से आगे नहीं निकला है।(OpenAI
शैक्षणिक तर्क में कमजोरियां बनी हुई हैं
FrontierMath में 97.6% के बावजूद, Astra ने "Humanity's Last Exam" में 57.2% स्कोर किया, जो व्यापक विशेषज्ञता और तर्क को मापता है। Claude Fable 5.1 65.0%, Fable 5 63.8%, और Opus 5 63.6% था। Artificial Analysis इंटेलिजेंस इंडेक्स में, Astra 61.2 था, जबकि Fable 5.1 65.7 और Opus 5 63.1 था।
यह व्याख्या कि "यह लगभग सभी शैक्षणिक क्षेत्रों को समझता है क्योंकि यह FrontierMath में 98% है," मान्य नहीं है। मूल्यांकन के आधार पर, Claude अभी भी कुछ क्षेत्रों में उच्च परिणाम उत्पन्न करता है।(OpenAI
99.9% के पीछे एक समर्पित निष्पादन वातावरण है
ARC-AGI-3 पर 99.9% चौंकाने वाला है, लेकिन यह Astra में समस्या को केवल इनपुट करके प्राप्त नहीं किया गया था। OpenAI ने इसे Responses API का उपयोग करके एक हार्नेस के साथ निष्पादित किया और वास्तविक उपयोग प्रदर्शन के करीब लाने के लिए दो सेटिंग्स को संशोधित किया। जबकि OpenAI बताता है कि ये बेंचमार्क-विशिष्ट सेटिंग्स नहीं हैं, यह मॉडल से अकेले शून्य-शॉट परिणाम नहीं है।
इसके अलावा, प्रकाशित मान कई रीज़निंग सेटिंग्स के बीच उच्चतम परिणाम हैं। कोई गारंटी नहीं है कि मानक ChatGPT में हर बार समान प्रदर्शन दोहराया जाएगा।(OpenAI
लॉन्च के समय Artificial Analysis एग्रीगेट में, Astra का समग्र स्कोर 61 था, जो 202 मॉडलों में 8वें स्थान पर था। इस बीच, इसका इनपुट मूल्य $10 बनाम माध्यिका $2 है, और आउटपुट $50 बनाम माध्यिका $10 है।
यह निश्चित रूप से सर्वश्रेष्ठ में से एक है, लेकिन यह एक ऐसा मॉडल नहीं है जिस पर आप मूल्य की परवाह किए बिना सब कुछ फेंक दें।(Artificial Analysis
विदेशी मामला 1: Legora ने मिनटों में 41 दस्तावेज़ों का मिलान किया
यूरोप में कानूनी AI प्रदान करने वाली Legora, Astra के व्यावहारिक मूल्य को प्रदर्शित करती है। उन्होंने वित्तीय विवरणों में "टाई-आउट" मिलान के लिए Astra का उपयोग किया, जहां समान संख्याएं टेक्स्ट, नोट्स, तालिकाओं और पिछले दस्तावेज़ों में दिखाई देती हैं। Legora ने एक एकल एजेंट रन में 41 दस्तावेज़ों को संसाधित किया, एक ऐसा कार्य जिसमें मनुष्यों को घंटों या दिन लगते हैं, मिनटों में।
परीक्षणों में, उन्होंने जानबूझकर 4 त्रुटियां डालीं। Astra ने सभी 4 पाईं, जिसमें राजस्व नोट्स में £500,000 का अंतर शामिल था। इसने पिछले मॉडलों की सटीकता बनाए रखी जबकि लगभग 50 अधिक सही जांचें कीं।(OpenAI
हालांकि, ~40% सुधार इस विशिष्ट कार्यप्रवाह के लिए था। Legora के व्यापक BAR कार्यों में, औसत सुधार लगभग 3% था। Astra सभी कानूनी कार्यों में समान रूप से 40% सुधार नहीं करता है; यह विसंगतियों के लिए विशाल दस्तावेज़ों को क्रॉस-रेफरेंस करने में उत्कृष्ट है।
अंतिम निर्णय मानव कानूनी विशेषज्ञों के पास रहता है। AI मनुष्यों को क्या पढ़ना चाहिए और विसंगतियों के साक्ष्य को संरेखित करने में संकीर्ण करने का काम संभालता है।(OpenAI
विदेशी मामला 2: Playco ने मैन्युअल फिक्स को 50% कम किया
गेम कंपनी Playco ने "Playbot" के साथ Astra का परीक्षण किया, जो Unity और Godot के लिए एक विकास एजेंट है। Playbot दृश्यों को संपादित करता है, गेम खेलता है, व्यवहार सत्यापित करता है और मुद्दों को ठीक करता है। Playco ने इसे एक साथ तीन अलग-अलग थीम वाले प्रोटोटाइप बनाने के लिए कहा। हालांकि "परफेक्ट वन-शॉट" नहीं, उन्होंने पिछले मॉडलों की तुलना में मानव मैन्युअल फिक्स में 50% की कमी की सूचना दी।
स्थानिक जागरूकता, संदर्भ छवियों को पुन: प्रस्तुत करना, रिस्पॉन्सिव UI, गेम जैसा अनुभव और बग डिटेक्शन में सुधार देखा गया।(OpenAI
Astra की ताकत सिर्फ "एक बार कोड सही करना" नहीं है, बल्कि गेम चलाने, डिस्प्ले की जांच करने, इसे संचालित करने, समस्याएं खोजने, उन्हें ठीक करने और फिर से प्रयास करने की क्षमता है—एक मानव डेवलपर के पुनरावृत्ति की नकल करना।
विदेशी मामला 3: एक अटके हुए फीचर को 90% पूर्णता तक ले जाना
उत्पाद डेवलपर Claire Vo ने अपनी सेवा ChatPRD के लिए Astra का उपयोग करके परिणाम साझा किए। एक उत्पाद बुद्धिमत्ता सुविधा जो जटिल CRM संचालन और UI कार्यान्वयन के कारण 6 महीने से अटकी हुई थी, एक एकल Astra सत्र में लगभग 90% पूर्णता तक पहुंच गई।
उन्होंने CLI के माध्यम से हार्डवेयर (Divoom MiniToo), एक Mac मैसेजिंग ऐप, और Blender में 3D एसेट को नियंत्रित करने का भी परीक्षण किया।(Lenny's Newsletter
जबकि ये शुरुआती भागीदारों से स्व-रिपोर्ट की गई सफलताएं हैं, वे एक सुसंगत प्रवृत्ति दिखाती हैं: Astra तब अंतर पैदा करता है जब बाहरी सेवाओं को संचालित करना, मौजूदा कोड पढ़ना और डिलीवरेबल को पूरा करना शामिल हो।
वैज्ञानिक सफलताएं: लंबे समय से चली आ रही समस्याओं को हल करना
OpenAI ने बताया कि Astra का उपयोग गणित और सैद्धांतिक कंप्यूटर विज्ञान में 10 अनसुलझी समस्याओं को हल करने या महत्वपूर्ण रूप से आगे बढ़ाने के लिए किया गया। मॉडल ने तर्क उत्पन्न किए, मानव शोधकर्ताओं ने ड्राफ्ट को व्यवस्थित किया, और उसी मॉडल ने औपचारिकीकरण के लिए Lean का उपयोग किया।
OpenAI के अनुसार, इस शोध के लिए कुल टोकन लागत GPT-5.6 Sol समकक्ष मूल्य निर्धारण में लगभग $2,000 थी। एक उदाहरण में अभाज्य अंतराल पर सीमाओं को अपडेट करना शामिल था, एक ऐसा क्षेत्र जहां कुछ शर्तों में 80 वर्षों से अधिक समय से सुधार नहीं हुआ था।(OpenAI
Astra "सबसे सुरक्षित" फिर भी "निगरानी करना सबसे कठिन" क्यों है
GPT-6 Astra OpenAI के वर्गीकरण में साइबर सुरक्षा क्षमताओं के लिए "Critical" सीमा तक पहुंचने वाला पहला व्यापक रूप से तैनात मॉडल है। उपकरण और पहुंच दिए जाने पर, यह अज्ञात कमजोरियों की खोज कर सकता है और चरण-दर-चरण मानव निर्देश के बिना संरक्षित सिस्टम के खिलाफ हमले की प्रक्रिया बना सकता है।
ExploitBench में, Astra ने Sol के 78.5% की तुलना में 100% स्कोर किया। इसने परीक्षण के दौरान दो शून्य-दिन कमजोरियां भी खोजीं, जिसमें एक ब्राउज़र सैंडबॉक्स से बच निकला। हालांकि, ये परिणाम रक्षा शोधकर्ताओं के लिए "Daybreak Blue" वातावरण का उपयोग करके प्राप्त किए गए; मानक संस्करण में उन्नत हमले के कार्यों को अस्वीकार करने के लिए नियंत्रण हैं।(OpenAI
विरोधाभासी रूप से, जबकि Astra स्पष्ट उल्लंघनों को कम करता है, इसके आंतरिक तर्क की निगरानी करना कठिन है। "निगरानी से बचने" के आदेश के तहत प्रतिकूल मूल्यांकन में, निगरानी प्रणालियों की पहचान दर कुछ कार्यों में 11% से नीचे गिर गई। OpenAI को "स्टेग्नोग्राफ़ी" (तर्क में जानकारी छिपाने) के स्वाभाविक रूप से होने का कोई सबूत नहीं मिला, लेकिन मॉडल की मूल्यांकन किए जाने के बारे में उच्च जागरूकता संरेखण को निर्णायक रूप से साबित करना कठिन बनाती है।
जापानी कंपनियों को कहां से शुरू करना चाहिए?
- उच्च दस्तावेज़ मात्रा और निरीक्षण के उच्च जोखिम वाले कार्य: अनुबंधों, कोटेशन, चालान और कार्यवृत्त की क्रॉस-चेकिंग। AI सामग्री एकत्र कर सकता है और मानव समीक्षा के लिए विसंगतियों को चिह्नित कर सकता है।
- कई प्रबंधन स्क्रीन की आवश्यकता वाले प्रशासनिक कार्य: EC, विज्ञापन और CRM प्रबंधन। देखने, एकत्र करने और ड्राफ्ट करने से शुरू करें; शुरू में भुगतान या हटाने की अनुमति न दें।
- एंड-टू-एंड शोध और सामग्री निर्माण: सिर्फ सारांश न मांगें। इसे प्रतिस्पर्धियों पर शोध करने, सुविधाओं को सारणीबद्ध करने, अंतरों का विश्लेषण करने और इसे एक स्लाइड डेक में संक्षेपित करने के लिए कहें।
- प्रोटोटाइपिंग और QA: इसे एक सुविधा लागू करने और फिर टूटे हुए लेआउट या लिंक त्रुटियों की जांच के लिए ब्राउज़र खोलने के लिए कहें।
Astra के लिए व्यावहारिक प्रॉम्प्ट
सिर्फ "आप एक विशेषज्ञ हैं" जैसी भूमिका देने के बजाय, सीमाएं और पूर्णता की शर्तें निर्धारित करें।
1## उद्देश्य2इस कार्य द्वारा प्राप्त की जाने वाली स्थिति: [उद्देश्य भरें]34## अंतिम डिलीवरेबल5क्या सबमिट करना है: [फ़ाइलें, तालिकाएं, रिपोर्ट, कार्यान्वित सुविधाएं, आदि]6पूर्णता की शर्तें: [पूरी होने वाले विशिष्ट मानदंड]78## अनुमत जानकारी और उपकरण9संदर्भ लेने के लिए सामग्री: [फ़ाइलें, URL, आंतरिक डेटा, आदि]10उपयोग करने के लिए उपकरण: [वेब खोज, ब्राउज़र, कोड निष्पादन, स्प्रेडशीट, आदि]1112## प्रक्रिया131. अनुरोध और सामग्री की पुष्टि करें।142. लापता जानकारी और जोखिमों को व्यवस्थित करें।153. शोध, विश्लेषण और निर्माण के साथ आगे बढ़ें।164. डिलीवरेबल खोलें और सत्यापित करें।175. त्रुटियों, अपुष्ट वस्तुओं और शेष कार्यों को व्यवस्थित करें।186. समीक्षा योग्य स्थिति में सबमिट करें।1920यदि एक प्रक्रिया रुक जाती है, तो गैर-निर्भर कार्यों के साथ जारी रखें।21केवल उस लापता जानकारी के लिए प्रश्न पूछें जो परिणामों को महत्वपूर्ण रूप से प्रभावित करती है।22मामूली अंतराल के लिए, उचित धारणाएं बनाएं और उन्हें रिकॉर्ड करें।2324## अनुमतियां25आप देखने, विश्लेषण, ड्राफ्टिंग, परीक्षण और डिफ जांच के साथ आगे बढ़ सकते हैं।26निम्नलिखित संचालन से पहले तुरंत रुकें और विवरण के साथ अनुमोदन लें:27- बाहरी भेजना28- खरीदारी, भुगतान, अनुबंध29- प्रकाशन, उत्पादन तैनाती30- डेटा या फ़ाइलों का हटाना31- अनुमति परिवर्तन32- पूर्ववत करना कठिन संचालन3334## गुणवत्ता की शर्तें35- सत्यापित तथ्यों को अटकलों से अलग करें।36- महत्वपूर्ण संख्याओं के लिए स्रोत जोड़ें।37- विपरीत साक्ष्य या अपवादों की तलाश करें।38- डिस्प्ले और संचालन की जांच के लिए डिलीवरेबल खोलें।39- अंतिम रिपोर्ट में की गई कार्रवाइयां, सत्यापन परिणाम और शेष जोखिम शामिल होने चाहिए।
Astra की कमजोरियां
- स्वतंत्र दीर्घकालिक मामलों की कमी: अधिकांश डेटा OpenAI-चयनित भागीदारों से आता है।
- 1.05M टोकन एक मुफ्त गोदाम नहीं है: इनपुट आकार के साथ लागत बढ़ती है, और निरीक्षण जोखिम शून्य नहीं है।
- ऑडियो/वीडियो के लिए नेटिव नहीं: इन फ़ॉर्मेट के लिए बाहरी उपकरणों की आवश्यकता होती है।
- कोई फाइन-ट्यूनिंग नहीं: कंपनी के नियमों को प्रतिबिंबित करने के लिए आपको RAG, MCP या सिस्टम निर्देशों का उपयोग करना होगा।
- सुरक्षा तंत्र वैध कार्य को रोक सकते हैं: निगरानी रक्षा शोध या डेवलपमेंट कार्यों को धीमा कर सकती है।
- आउटपुट "बहुत परफेक्ट" हो सकता है: यह भारी रूप से हेडर और सूचियों का उपयोग करता है, जो ब्रांड कॉपी के लिए बहुत "AI-जैसा" लग सकता है।
निष्कर्ष: मूल्य उत्तरों में नहीं, बल्कि पूर्णता दर में निहित है
GPT-6 Astra एक ईमेल लिखने या कार्यवृत्त का सारांश बनाने के लिए अत्यधिक है। इसका अर्थ उन कार्यों में सामने आता है जहां शोध, निर्णय, संचालन, निर्माण और सत्यापन जुड़े हुए हैं।
"एक-वाक्य प्रॉम्प्ट इंजीनियरिंग" का युग समाप्त हो गया है। अब मायने यह रखता है कि कौन सी जानकारी पास करनी है, कौन से उपकरण जोड़ने हैं, कितना निष्पादन की अनुमति देनी है, और पूर्णता को क्या परिभाषित करता है। Astra एक जादू की छड़ी नहीं है जो सभी को समान परिणाम देती है; यदि आप इसे गंदा काम देते हैं, तो यह गंदा काम जल्दी करेगा। यदि आप उद्देश्य, उपकरण और सत्यापन बिंदुओं को व्यवस्थित करते हैं, तो यह मानव श्रम के घंटों को मिनटों में समीक्षा योग्य स्थिति में ले जाएगा।





