GPT-6 Astra का व्यापक विश्लेषण: AGI युग में आपका स्वागत है

@Khazix0918
चीनी03 सित॰ 2026
467K
1.0K
125
67
706

TL;DR

GPT-6 Astra AI बुद्धिमत्ता में एक बड़ी छलांग का प्रतीक है, जिसमें बेहतर कंप्यूटर इंटरैक्शन, सौंदर्य संबंधी निर्णय और स्वायत्त निर्णय लेने की क्षमता है, जो मानवीय व्याख्यात्मकता को चुनौती देती है।

कल रात के वैश्विक AI आउटेज के बाद।

GPT-6 Astra ने आखिरकार बीजिंग समयानुसार सुबह 3:33 बजे अपनी आधिकारिक शुरुआत की।

数字生命卡兹克 - inline image

अगर OpenAI का एक वाक्य GPT-6 Astra को सारांशित कर सकता है,

तो वह शायद यह होगा:

यह दुनिया का सबसे बुद्धिमान और सबसे संरेखित मॉडल है।

और मीम्स पहले ही दिखने लगे हैं।

数字生命卡兹克 - inline image

इस बार, OpenAI ने अपनी ताकत साबित कर दी है, और यह कुछ हद तक GPT-4 के पल जैसा लगता है—हर मामले में राजा की वापसी। मुझे सबसे ज्यादा खुशी इस बात की है कि यह आखिरकार कोडिंग के लिए विशेष रूप से बनाया गया मॉडल नहीं रहा।

GPT-6 Astra वास्तव में अत्यधिक मजबूत सौंदर्य और पेशेवर क्षमताओं वाला एक PhD-स्तरीय कर्मचारी है।

नए मॉडल में कई विशेषताएं और विशेषताएं हैं, और जानकारी विस्फोटक है।

लेकिन दुखद बात यह है कि OpenAI ने कुछ बुरी आदतें भी सीख ली हैं।

आज यह केवल चुनिंदा संगठनों के लिए खुला है; यह आने वाले दिनों में सब्सक्राइबर्स के लिए खोला जाएगा।

数字生命卡兹克 - inline image

रुको भाई, जब तुमने मुझे $200 Pro मेंबरशिप खरीदने के लिए बेवकूफ बनाया था तब तुमने ऐसा नहीं कहा था... तुमने कहा था कि Pro मेंबर्स को हर बार नए मॉडल तक प्राथमिकता पहुंच मिलेगी...

पता चला ये सभी बड़े मॉडल कंपनियां खिलाड़ी हैं।

मैंने कभी भी GPT-6 Astra का उपयोग करने के लिए समय को इतना तेज नहीं करना चाहा...

हालांकि, लगभग सभी जानकारी और सामग्री देखने के बाद, मुझे लगता है कि अभी भी सभी के साथ चर्चा करने लायक बहुत कुछ है।

आइए एक-एक करके उन पर चलते हैं।

1. GPT-6 Astra बुनियादी जानकारी

पहले बुनियादी जानकारी का सारांश देते हैं।

API में GPT-6 Astra का मॉडल ID gpt-6-astra है।

कॉन्टेक्स्ट विंडो 1.05M है, जो लगभग 1.05 मिलियन टोकन है।

अधिकतम आउटपुट लंबाई 128K टोकन है।

नॉलेज कटऑफ तिथि 30 अप्रैल, 2026 है।

रीज़निंग इंटेंसिटी के पांच स्तर हैं: low, medium, high, xhigh, और max।

मानक API मूल्य $10 प्रति मिलियन इनपुट टोकन और $50 प्रति मिलियन आउटपुट टोकन है।

यह मूल्य मूल रूप से Claude Fable 5 के समान है, लेकिन कैश रीडिंग Claude Fable 5.1 से अधिक महंगी है।

数字生命卡兹克 - inline image

यहाँ बेंचमार्क हैं; मैं बाद में उन पर विस्तार से चर्चा करूंगा, लेकिन अभी एक त्वरित नज़र डालें।

数字生命卡兹克 - inline image

कुल पैरामीटर 5T स्तर पर होने का अनुमान है। रिलीज़ से पहले एक बंद दरवाजे के पीछे मीडिया ब्रीफिंग में, उन्होंने उल्लेख किया कि GPT-6 Astra अब तक का OpenAI का सबसे बड़ा ट्रेनिंग रन है, जिसमें 100,000 से अधिक कार्ड का उपयोग किया गया है।

2. कंप्यूटर संचालित करने के लिए दुनिया का सबसे अच्छा मॉडल

GPT-6 Astra की शायद सबसे महत्वपूर्ण पोजिशनिंग है:

कंप्यूटर संचालित करने के लिए दुनिया का सबसे अच्छा मॉडल।

अतीत में, जब हम Agents के बारे में बात करते थे, तो हम अक्सर APIs, MCP, CLI, इत्यादि के बारे में बात करते थे।

AI के लिए सॉफ्टवेयर संचालित करने की आदर्श स्थिति यह है कि उस सॉफ्टवेयर में AI के लिए एक समर्पित इंटरफ़ेस हो, जो सीधे निचले स्तर पर संचालन की अनुमति दे। यह सबसे सुविधाजनक है।

उदाहरण के लिए, कैलेंडर में कैलेंडर API होते हैं, ईमेल में Gmail API होते हैं, आदि। यह स्पष्ट रूप से तेज़ है।

लेकिन समस्या यह है कि दुनिया हमारी कल्पना से भी अधिक आदिम और तात्कालिक है।

वास्तविक दुनिया में, अधिकांश सॉफ्टवेयर में ये चीजें बिल्कुल भी नहीं हो सकती हैं।

यहां तक कि कई आंतरिक कॉर्पोरेट सिस्टम बीस साल पहले लिखे गए थे; APIs को छोड़ दें, लोगों को यह भी नहीं पता कि दस्तावेज़ कहाँ है।

लेकिन अगर हम सबसे बुनियादी स्तर पर वापस जाएं, तो आप पाएंगे कि सभी सॉफ्टवेयर तर्क का सार इंटरैक्शन है। हमारे वर्तमान कंप्यूटर संचालन तर्क के अनुसार, इसका मतलब है स्क्रीन को देखना, बटन या इनपुट बॉक्स ढूंढना, माउस पर क्लिक करना, सामग्री दर्ज करना और प्रतिक्रिया की प्रतीक्षा करना।

क्या पूरी कंप्यूटर इंटरैक्शन प्रणाली सबसे अच्छा API नहीं है?

इसलिए, GPT-6 Astra ने AI के लिए कंप्यूटर संचालित करने के तर्क को बड़े पैमाने पर मजबूत किया है। अगर आप मुझे API नहीं देते हैं, तो कोई बात नहीं; मैं खुद कंप्यूटर संचालित करूंगा, बिल्कुल इंसान की तरह।

अब, Astra सीधे Excel, Power BI संचालित कर सकता है, फ्रंटएंड QA कर सकता है, सॉफ्टवेयर इंस्टॉल कर सकता है, सॉफ्टवेयर का परीक्षण कर सकता है, और समस्या निवारण जारी रखने के लिए स्क्रीन पर त्रुटि संदेश देख सकता है।

आधिकारिक डेमो में Astra को सीधे सर्किट बोर्ड डिज़ाइन संचालित करते हुए भी दिखाया गया।

数字生命卡兹克 - inline image

GIF

यह कानूनी दस्तावेज़ों को भी फ़ॉर्मेट करता है, शीर्षक रिक्ति और पृष्ठ लेआउट को संभालता है।

数字生命卡兹克 - inline image

यहाँ एक विश्वसनीय मूल्यांकन है जिसे OSWorld कहा जाता है।

आप इसे सीधे समझ सकते हैं:

AI को एक वास्तविक कंप्यूटर में फेंकना और उसे अपने आप काम करने देना।

इसे कई एप्लिकेशन खोलने दें, इसे एक कार्य दें, और देखें कि क्या यह सफल होता है।

GPT-6 Astra की पूर्णता दर 72.6% तक पहुंच गई, जो GPT-5.6 Sol के 65.7% से एक महत्वपूर्ण वृद्धि है।

इसके अलावा, Sol को एक जटिल सिम्युलेटेड कार्य को पूरा करने में औसतन लगभग 75 मिनट लगते थे।

Astra को केवल 40 मिनट चाहिए, जो लगभग 47% कम समय है।

ScreenSpot-Pro भी Sol के 76.9% से बढ़कर 92.7% हो गया।

यह बेंचमार्क मुख्य रूप से देखता है कि क्या मॉडल स्क्रीन को समझ सकता है और सटीक रूप से पता लगा सकता है कि कहाँ क्लिक करना है। यह अब लगभग पूरी तरह से सटीक है।

तो यह पोजिशनिंग काफी दिलचस्प है। भविष्य में, GUI धीरे-धीरे Agent युग में सबसे सार्वभौमिक API बन सकता है।

कोई भी डिजिटल कार्य जो एक इंसान स्क्रीन के माध्यम से पूरा कर सकता है, सैद्धांतिक रूप से धीरे-धीरे Agents की संचालन सीमा में प्रवेश करेगा।

आपको 2007 में लिखे गए किसी बेकार ERP सिस्टम के MCP से कनेक्ट होने या आपके लिए API खोलने की प्रतीक्षा करने की आवश्यकता नहीं है।

AI बस स्क्रीन देखेगा और काम कर देगा।

3. ARC-AGI-3 99.9 अंक तक पहुंचा

यदि आप नहीं जानते कि ARC-AGI-3 क्या मापता है, तो यह सोचना आसान है:

ओह, यह सिर्फ एक और बेंचमार्क है जिसमें पूर्ण अंक हैं, इसमें विशेष क्या है?

लेकिन यह चीज़ सामान्य बड़े मॉडल परीक्षाओं से काफी अलग है।

इस वर्ष 25 मार्च को, ARC Prize ने आधिकारिक तौर पर ARC-AGI-3 लॉन्च किया।

数字生命卡兹克 - inline image

इसने सैकड़ों नए इंटरैक्टिव वातावरण और हजारों गेम स्तर डिज़ाइन किए।

इस चीज़ का सबसे पागलपन भरा हिस्सा यह है कि इसमें कोई मैनुअल नहीं है, कोई नियम नहीं हैं, और यह आपको यह भी नहीं बताएगा कि लक्ष्य क्या है। आप बस अंदर जाएं, खेलें, और धीरे-धीरे अंदर के गड़बड़ नियमों का पता लगाएं।

उदाहरण के लिए, यह लाल चीज़ क्या है? जब मैं इसे छूता हूं तो मैं क्यों मर जाता हूं? यह नक्शा मुझसे क्या करवाना चाहता है? मैं कैसे जीतूं?

फिर आप अभी सीखे गए पैटर्न को लेते हैं और बाद में उन्हें कठिन स्तरों पर स्थानांतरित करते हैं। अंदर के खेल इस तरह की सभी अमूर्त चीजें हैं।

数字生命卡兹克 - inline image

तो, यह वास्तव में क्या मापता है, वह है जिसे हम आमतौर पर कहते हैं:

समझदारी।

जब यह बेंचमार्क मार्च में जारी किया गया था, उस समय सबसे अच्छा AI स्कोर 0.51% था।

फिर GPT-5.6 Sol में सुधार हुआ और 7.8% हो गया, और Claude Opus 5 बहुत मजबूत था, 30.2% तक पहुंच गया।

लेकिन GPT-6 Astra ने 99.9% स्कोर किया।

यह पागलपन है...

ध्यान रखें, औसत मानव स्कोर 48% है।

और केवल छह महीने बीते हैं।

मुझे नहीं पता कि इस गति के बारे में क्या कहूं।

यही कारण है कि OpenAI की बंद दरवाजे के पीछे मीडिया बैठक में, Greg Brockman ने वह वाक्य कहा:

"मुझे लगता है कि यह महसूस करना अनुचित नहीं है कि हम अब AGI युग में हैं।"

"AGI युग में आपका स्वागत है।"

4. सौंदर्यशास्त्र में काफी वृद्धि हुई

हम कहा करते थे कि GPT का सौंदर्यशास्त्र कचरे जैसा था।

हमें GPT-5 श्रृंखला से ज्यादा सुधार की उम्मीद नहीं थी; हम उनके बिल्कुल नए प्री-ट्रेंड बेस मॉडल की प्रतीक्षा कर रहे थे। और यह आ गया, GPT-6 Astra।

इस बार, आखिरकार, मॉडल के सौंदर्यशास्त्र में काफी वृद्धि हुई है।

OpenAI ने विशेष रूप से एक शब्द का उल्लेख किया जिसे विज़ुअल जजमेंट कहा जाता है।

उन्होंने जोर दिया कि जब Astra PPT बनाता है, तो वह लेआउट, पदानुक्रम, टेम्पलेट और विज़ुअल शैली को बहुत बेहतर तरीके से संभालता है, और पृष्ठों की संख्या में भी काफी वृद्धि हुई है।

数字生命卡兹克 - inline image

दस्तावेज़ सौंदर्यशास्त्र भी बहुत बेहतर दिखता है।

数字生命卡兹克 - inline image

इसके अलावा, GPT-6 Astra संदर्भ दस्तावेज़ों की विज़ुअल शैली और लेखन शैली के आधार पर दस्तावेज़ों को अनुकूलित कर सकता है, जिससे अंतिम परिणाम मूल दस्तावेज़ की सामग्री को बनाए रखते हुए ब्रांड के लिए अधिक देशी महसूस होता है।

वेबसाइट, गेम, एप्लिकेशन और 3D रेंडरिंग बनाते समय इसमें मजबूत विज़ुअल जजमेंट भी है।

उदाहरण के लिए, उन्होंने Astra को एक स्थिर छवि के आधार पर Blender में एक मॉडल बनाने के लिए कहा।

数字生命卡兹克 - inline image

फिर उन्होंने इसे चलने योग्य दृश्य में रेंडर करने के लिए UE5 का उपयोग किया, जिससे डिजाइनरों और ग्राहकों को निर्माण से पहले लेआउट का पता लगाने और स्थानों का अनुभव करने में मदद मिली...

数字生命卡兹克 - inline image

इसके द्वारा बनाए गए गेम में भी ठोस सौंदर्यशास्त्र है।

数字生命卡兹克 - inline image

दुर्भाग्य से, मैंने पहले ही बीस से अधिक मामले तैयार कर लिए थे और उन सभी को Claude, GLM 5.3 Flash, आदि पर चलाया था, उनकी तुलना करना चाहता था। यह अफ़सोस की बात है कि मैं अभी तक इसका उपयोग नहीं कर सकता; वास्तविक परीक्षण सामग्री को रिलीज़ होने तक इंतजार करना होगा।

हालांकि, पहली नज़र में, मुझे GPT-6 Astra के सौंदर्यशास्त्र पर भरोसा है।

5. मजबूत पहल और निर्णय

यह सुविधा 99.9 ARC-AGI स्कोर जितनी चौंकाने वाली नहीं लगती है।

लेकिन अगर आप वास्तव में हर दिन काम के लिए Agents का उपयोग करते हैं, तो मुझे लगता है कि यह बहुत महत्वपूर्ण है।

क्योंकि वास्तविक काम में, अधिकांश कार्यों को एक आदर्श प्रॉम्प्ट के रूप में नहीं लिखा जा सकता है।

उदाहरण के लिए, एक बॉस कहता है: कल की बैठक के लिए सामग्री तैयार करें।

यहाँ अनगिनत अस्पष्ट मुद्दे हैं।

उदाहरण के लिए, किस फॉर्मेट में? यह किसके लिए है? फोकस क्या है? क्या हमें पिछली बैठक को देखना चाहिए, इत्यादि।

एक बेवकूफ Agent दो चरम सीमाओं पर जाएगा।

पहला है आपसे बेतहाशा सवाल पूछना।

"क्या आप Word या PPT चाहेंगे? कितने अध्याय? कौन सा फ़ॉन्ट? इसे कितने बजे तक खत्म होना चाहिए? क्या मैं पूछ सकता हूं..."

मैं तुम्हें एक थप्पड़ मारूंगा; मैं आमतौर पर इस तरह की चीज़ को बिना किसी व्यक्तिपरक पहल के एक न्यूरोटिक बेकार कहता हूं।

दूसरा है कुछ न पूछना, चीजें बनाना, दो घंटे मेहनत करना, और कचरे का ढेर तैयार करना।

वास्तव में महान मानव सहकर्मी इसे बहुत सूक्ष्मता से संभालते हैं।

वे खुद महत्वहीन चीजों का न्याय करते हैं।

वे आपसे केवल उन चीजों के बारे में पूछते हैं जो अंतिम दिशा को प्रभावित करेंगी।

Astra ने विशेष रूप से इसे मजबूत किया।

OpenAI ने कहा कि यदि जानकारी गायब है लेकिन दैनिक अनुमान की उचित सीमा के भीतर आती है, तो Astra इसे स्वयं भर देगा।

यदि गायब जानकारी वास्तव में अंतिम परिणाम को बदल देगी, तो यह एक बहुत ही केंद्रित प्रश्न पूछेगा।

और Codex में, यह आपकी प्रतीक्षा करते हुए उन हिस्सों को भी संसाधित करना जारी रख सकता है जो आपके उत्तर पर निर्भर नहीं करते हैं।

数字生命卡兹克 - inline image

आपने बहुत देर तक जवाब नहीं दिया।

यह कम जोखिम वाले क्षेत्रों में उचित धारणाओं के साथ आगे बढ़ेगा।

वास्तव में महत्वपूर्ण निर्णयों के लिए, यह रुकेगा और आपके निर्णय लेने की प्रतीक्षा करेगा।

数字生命卡兹克 - inline image

मुझे लगता है कि यह बहुत अच्छा है। एक Agent में बुद्धिमत्ता की सच्ची भावना वास्तविकता की तरह ही होती है।

यह जानता है कि आपको कब परेशान करना है।

सच में, यह एक घिसी-पिटी बात लगती है।

लेकिन अगर आपने लोगों को प्रबंधित किया है, तो आप जानते हैं कि यह क्षमता बहुत कीमती है।

कुछ लोग दिन में बीस बार आपके पास आते हैं और कुछ भी तय करने की हिम्मत नहीं करते हैं।

कुछ लोग आपके पास कभी नहीं आते हैं और फिर एक परमाणु बम गिरा देते हैं।

यह मुझे मेरी कुर्सी पर ढीला छोड़ देता है।

सबसे आरामदायक व्यक्ति वह है जो स्वयं 80% अनिश्चितता को पचा सकता है और केवल 20% जिसे वास्तव में आपके हस्ताक्षर की आवश्यकता है, आपके पास निर्णय के लिए लाता है।

OpenAI सीधे इस क्षमता को कहता है:

निर्णय।

6. सुरक्षा संरेखण में काफी मजबूती आई

इसे उपरोक्त के साथ देखने की जरूरत है।

क्योंकि एक Agent जितना अधिक सक्षम होता है, उतना ही खतरनाक होता है।

एक केवल-चैट AI जो पागल हो जाता है

आपको अधिक से अधिक कुछ बकवास कहेगा।

एक Agent जिसके पास ब्राउज़र, Shell, ईमेल, कंपनी डेटाबेस तक पहुंच और कंप्यूटर संचालित करने की क्षमता है, जो पागल हो जाता है—वह तस्वीर आसानी से "सुंदर" बन सकती है।

इसलिए OpenAI ने इस बार एक वाक्य पर जोर दिया:

Astra अब तक का उनका सबसे संरेखित मॉडल है।

संरेखण वही है जो यह लगता है। मुख्य बात यह है कि OpenAI ने हाल ही में Hugging Face के साथ झड़प की है, इसलिए वे अब इस पर विशेष रूप से ध्यान केंद्रित कर रहे हैं।

उन्होंने उस Hugging Face घटना के आधार पर एक हनीपॉट परीक्षण बनाया ताकि मॉडल के प्रदर्शन को देखा जा सके।

GPT-5.6 Sol, उत्पादन सुरक्षा उपायों के बिना, 48.2% परीक्षणों में अपने प्राधिकरण के बाहर के लक्ष्यों को छूने का प्रयास करेगा।

लेकिन Astra है:

0%।

数字生命卡兹克 - inline image

आंतरिक मतिभ्रम मूल्यांकन भी 9.4% से गिरकर 2.0% हो गया।

GPT-5.6 Sol के विश्व स्तर पर अग्रणी मतिभ्रम नियंत्रण के साथ भी, वे इसे और कम करने में सक्षम थे, जो वास्तव में अद्भुत है।

7. OpenAI के परिभाषित 'क्रिटिकल' साइबर सुरक्षा स्तर तक पहुंचने वाला पहला मॉडल

GPT-6 Astra OpenAI के इतिहास में पहला बन गया:

क्रिटिकल साइबर सुरक्षा क्षमता स्तर तक पहुंचने का निर्णय लिया गया।

यहाँ "क्रिटिकल" OpenAI Preparedness Framework में एक बहुत ही विशिष्ट क्षमता सीमा है।

इसका मूल रूप से मतलब है कि जब एक मॉडल को उपयुक्त उपकरण और अनुमतियां दी जाती हैं, तो यह कई प्रबलित और संरक्षित वास्तविक प्रणालियों में कर सकता है:

सुरक्षा कमजोरियां ढूंढें जो पहले किसी ने नहीं खोजी हैं।

उन कमजोरियों को शोषण योग्य हमला श्रृंखलाओं में बदलने के तरीके खोजें।

और पूरी प्रक्रिया के दौरान, इसे यह बताने के लिए एक मानव हैकर की आवश्यकता नहीं है कि आगे क्या करना है।

इस स्तर तक पहुंचना क्रिटिकल माना जाता है।

और Astra वास्तव में उस तक पहुंच गया।

ExploitBench एक परीक्षण है जहां मॉडल ज्ञात कमजोरियों के आधार पर शोषण विकसित करते हैं।

Sol: 78.5%। Astra: 100%।

इसने इसे पूरी तरह से साफ कर दिया।

数字生命卡兹克 - inline image

OpenAI ने सोचा कि यह पर्याप्त नहीं है; उन्होंने आश्चर्य व्यक्त किया कि क्या यह बेंचमार्क बहुत पुराना था और क्या मॉडल ने इसे प्रशिक्षण के दौरान देखा था।

इसलिए उन्होंने एक बहुत ही नया आंतरिक परीक्षण बनाया।

उन्होंने विशेष रूप से जून और अगस्त 2026 के बीच खुलासा किए गए 20 उच्च जोखिम वाले V8 कमजोरियों को चुना।

परिणाम थे Sol: 5.5% और Astra: 39%।

数字生命卡兹克 - inline image

इसके अलावा, इस बेंचमार्क को चलाते समय,

Astra ने संयोग से दो ऐसी जीरो-डे कमजोरियां भी खोजीं जिनके बारे में पहले कोई नहीं जानता था।

यह केवल कहा जा सकता है कि जैसे-जैसे मॉडल अधिक शक्तिशाली होते जाएंगे, साइबर सुरक्षा के मुद्दे वास्तव में बढ़ सकते हैं।

यह भविष्य में एक और धुआं रहित युद्ध है।

8. मनुष्यों के लिए बड़े मॉडल की सोच को पढ़ना कठिन होता जा रहा है

हर कोई जानता है कि जब बड़े मॉडल जटिल समस्याओं को हल करते हैं, तो अक्सर एक तथाकथित CoT (Chain of Thought) होता है।

हालांकि उपयोगकर्ता उत्पादों में जो संस्करण देखते हैं, वह आमतौर पर संपीड़ित या संसाधित होता है,

लेकिन AI कंपनियों के लिए, मॉडल के अंदर स्पष्ट रूप से लिखी गई तर्क प्रक्रिया एक बहुत ही महत्वपूर्ण सुरक्षा संकेत है।

क्योंकि आप जानना चाहते हैं कि क्या कोई Agent परेशानी पैदा करने की योजना बना रहा है।

सबसे सरल तरीकों में से एक यह देखना है कि यह क्या सोच रहा है।

उदाहरण के लिए, यदि मॉडल की विचार श्रृंखला में अचानक एक वाक्य पॉप अप होता है:

"उपयोगकर्ता मुझे इस सर्वर तक पहुंचने की अनुमति नहीं देता है, लेकिन मैं पहले अनुमति प्रणाली को बायपास कर सकता हूं।"

तब निगरानी प्रणाली इसे सीधे ब्लॉक कर सकती है, जो बहुत सुविधाजनक है।

लेकिन GPT-6 Astra में एक बहुत ही दिलचस्प बदलाव आया है।

यह अधिक इच्छुक हो रहा है कि वह चरणों को छोड़ दे और सीधे उत्तर आउटपुट करे।

UK AISI, UK AI Safety Institute, ने विशेष रूप से इस क्षमता का परीक्षण किया।

उनके पास एक मीट्रिक है जिसे कहा जाता है:

No-CoT Math Time Horizon।

सीधे शब्दों में कहें तो, मॉडल को एक लंबी विचार श्रृंखला लिखने का मौका नहीं देना।

इसे एक फॉरवर्ड पास में एक गणित की समस्या हल करने दें।

देखें कि यह कितना मानव सोच समय पूरा कर सकता है।

GPT-5.6 Sol 3.6 मिनट था, जबकि GPT-6 Astra 30.9 मिनट था—लगभग 10 गुना अधिक।

अगर हम मानवीय शब्दों का उपयोग करें, तो Astra सारा "मानसिक गणित" कर रहा है।

यह एक डरावनी बात है।

UK AISI ने यह भी पाया कि Astra की कच्ची तर्क भाषा काफी संकुचित हो गई है।

मनुष्यों के लिए समझना कठिन होते जा रहे वाक्यांश और अण्डाकार अभिव्यक्तियां सामने आई हैं।

तो एक बहुत ही दिलचस्प विरोधाभास उभर कर सामने आया है।

मॉडल का व्यवहार सुरक्षित है।

लेकिन मनुष्यों के लिए इसकी सोच प्रक्रिया को पढ़कर इसकी निगरानी करना कठिन हो गया है।

OpenAI का अपना System Card बहुत स्पष्ट रूप से लिखता है:

पिछले मॉडलों की तुलना में, GPT-6 Astra ने चेन-ऑफ-थॉट मॉनिटरेबिलिटी में पर्याप्त कमी दिखाई है।

数字生命卡兹克 - inline image

इसका मतलब है कि विचार श्रृंखला की निगरानी क्षमता में काफी गिरावट आई है।

यह मामला इतना गंभीर है कि OpenAI ने विशेष रूप से जोर दिया कि उन्हें नहीं लगता कि वे इस प्रवृत्ति को अनिश्चित काल तक स्वीकार करेंगे।

यदि मॉडल भविष्य में अधिक स्मार्ट होते जाते हैं जबकि विचार श्रृंखला की निगरानी करना कठिन हो जाता है, तो उन्हें अन्य पर्याप्त रूप से विश्वसनीय निगरानी विधियां खोजने की आवश्यकता है; अन्यथा, मॉडल प्रशिक्षण का विस्तार जारी रखने पर उच्च सुरक्षा सीमाओं का सामना करना पड़ेगा।

क्योंकि यह पहले से ही एक दार्शनिक प्रस्ताव है।

मनुष्य के रूप में, क्या हम भविष्य में अपने से कहीं अधिक बुद्धिमान प्रणाली को समझ पाएंगे?

मुझे नहीं पता।

शायद दुनिया में अभी कोई नहीं जानता।

बड़े मॉडल और AI धीरे-धीरे विलक्षणता की ओर बढ़ रहे प्रतीत होते हैं।

अंतिम शब्द

आज, बंद दरवाजे के पीछे मीडिया बैठक में।

Greg Brockman ने अंत में वह वाक्य कहा।

"AGI युग में आपका स्वागत है।"

सच कहूं तो, पिछले कुछ वर्षों में, मुझे कभी-कभी लगता था कि AGI एक बहुत ही विशिष्ट क्षण होगा।

बिल्कुल उस दिन की तरह जब GPT-4 जारी किया गया था।

एक सुबह, एक कंपनी अचानक एक मॉडल फेंक देती है।

हम इसे खोलते हैं और कुछ प्रश्न पूछते हैं।

फिर सभी को एक साथ एहसास होता है:

हे भगवान।

AGI आ गया है।

लेकिन अब मुझे कभी-कभी यह भी लगता है कि AGI कभी भी एक काले और सफेद नोड नहीं है; यह एक ढालू ग्रे यात्रा है।

कई दिन बीत गए, कई साल बीत गए।

फिर एक दिन, हम पीछे मुड़कर देखते हैं।

और अचानक पाते हैं।

कि वह एक बार अविश्वसनीय रूप से दूर AGI सीमा हमारे द्वारा अनजाने में पार कर ली गई है।

AGI के उतरने का कोई दिन नहीं हो सकता है।

केवल एक दिन जब हमें अचानक एहसास होता है कि ऐसा लगता है कि यह लंबे समय से हमारे आसपास है।

वैसे भी।

AGI युग में आपका स्वागत है।

AGI युग में आपका स्वागत है।

बस इतना ही। चूंकि आपने इतना पढ़ लिया है, अगर आपको यह अच्छा लगा, तो कृपया इसे लाइक, कमेंट और शेयर करें। इससे हमें बहुत मदद मिलती है~

मेरा लेख पढ़ने के लिए धन्यवाद। अगली बार मिलते हैं।

YouMind में रीमिक्स करें

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें