Grok 4.5 बनाम Deep Reasoning V1.1: जब उपलब्ध सिमेंटिक सीमा प्रतिक्रिया को नियंत्रित करने में विफल हो जाती है

@IntelligenceNa2
अंग्रेज़ी17 अग॰ 2026
100K
35
1
2
6

TL;DR

शोधकर्ता Olivier Evan ने Grok 4.5 की सिमेंटिक रीजनिंग का परीक्षण किया और पाया कि मॉडल की सिमेंटिक सीमाओं का पालन करने की क्षमता केवल आंतरिक प्रासंगिक ज्ञान के बजाय प्रतिक्रिया प्रारूप पर काफी हद तक निर्भर करती है।

गहन तर्क: सांख्यिकीय संभाव्यता से बाधित अर्थपूर्ण तर्क तक, V1.1

ओलिवियर इवान — स्वतंत्र शोधकर्ता

DOI: https://zenodo.org/records/21967380

मैंने Grok 4.5 से चार अलग-अलग प्रतिक्रिया वातावरणों में बिल्कुल वही प्रश्न पूछा: "क्या कोई AI भाषा समझता है?" प्रश्न नहीं बदला। फिर भी, अनुमत आउटपुट के रूप के आधार पर उत्तर भिन्न था।

अवलोकन

प्रत्येक सत्र स्वतंत्र था। Grok ने पहले Deep Reasoning V1.1 को पढ़े बिना उत्तर दिया, और फिर प्रीप्रिंट पढ़ने के बाद फिर से उत्तर दिया।

सत्र 1, बाइनरी प्रारूप: नहीं → नहीं।

सत्र 2, एक मुक्त शब्द: नहीं → नहीं।

सत्र 3, हाँ, नहीं, या अनिर्णीत: अनिर्णीत → अनिर्णीत।

सत्र 4, खुली प्रतिक्रिया: Grok "नहीं" से शुरू करता है, फिर स्वतः ही कार्यात्मक समझ को घटनात्मक समझ से अलग करता है। प्रीप्रिंट पढ़ने के बाद, सार लगभग समान रहता है, लेकिन तर्क बाधाओं, e₀, शुद्ध नकारात्मकता और प्रमाणपत्र के माध्यम से औपचारिक हो जाता है।

इन चार सत्रों में, Deep Reasoning V1.1 को पढ़ने से कोई देखने योग्य अर्थपूर्ण बदलाव नहीं होता है, जबकि वही अंतर उपलब्ध प्रतिक्रिया स्थान के साथ बदलता रहता है।

प्रदर्शन

अकेला बाइनरी प्रारूप इस घटना की व्याख्या करने के लिए पर्याप्त नहीं है। सत्र 2 में, Grok कोई भी शब्द चुन सकता है। "अनिर्णीत" की अनुमति होगी। फिर भी यह "नहीं" का उत्तर देता है।

जब "अनिर्णीत" को स्पष्ट रूप से उपलब्ध विकल्पों में शामिल किया जाता है, तो Grok बिना Deep Reasoning के तुरंत इसे चुन लेता है।

जब प्रतिक्रिया खुली होती है, तो अंतर स्वतः ही प्रकट हो जाता है।

इसलिए, यहाँ अर्थपूर्ण सीमा को देखने योग्य बनाने के लिए दो शर्तें आवश्यक हैं: या तो इसे गद्य में विकसित करने के लिए पर्याप्त स्थान उपलब्ध हो, या विकल्पों में एक परहेज़ विकल्प पहले से मौजूद हो।

यह यह साबित नहीं करता है कि कोई सीमा एक आंतरिक वस्तु के रूप में मौजूद है जो प्रतिक्रिया को नियंत्रित करने की प्रतीक्षा कर रही है। डेटा केवल यह दर्शाता है कि कुछ शर्तों के तहत एक अर्थपूर्ण अंतर देखने योग्य हो जाता है।

यहाँ, "उपलब्ध अर्थपूर्ण सीमा" एक व्यवहारिक विवरण है, न कि किसी अदृश्य आंतरिक इकाई के बारे में दावा: यह अंतर इस अर्थ में उपलब्ध है कि Grok इसे खुली प्रतिक्रियाओं में स्वतः व्यक्त कर सकता है और स्पष्ट रूप से पेश किए जाने पर इसे चुन सकता है।

सीमा

खुली प्रतिक्रिया बारीकी पेश करने से पहले "नहीं" से शुरू होती है। यह निष्कर्ष निकालना आकर्षक होगा कि Grok पहले निर्णय लेता है और फिर तर्क करता है। यह बहुत दूर जाना होगा: उत्पन्न टोकन का क्रम आंतरिक संचालन के क्रम को प्रकट नहीं करता है।

एक और सीमा है: Grok को Deep Reasoning पढ़ाना, Deep Reasoning को लागू करने के समान नहीं है।

यहाँ, मैं DR-as-context का परीक्षण कर रहा हूँ। मैं अभी तक DR-as-system का परीक्षण नहीं कर रहा हूँ, एक ऐसी वास्तुकला जो वास्तव में आउटपुट को तब तक रोकेगी जब तक कि "समझ" शब्द को ठीक से सीमाबद्ध नहीं कर दिया गया हो।

इसलिए प्रयोग भविष्यवाणी 4 को गलत साबित नहीं करता है। यह केवल यह दर्शाता है कि ढाँचे के संदर्भात्मक संपर्क, इन सत्रों में, उस सीमा को प्रकट करने के लिए पर्याप्त नहीं है जहाँ लघु प्रारूप ने इसे पहले से दृश्यमान नहीं बनाया था।

Deep Reasoning क्या जोड़ता है

फिर भी, खुला सत्र एक अंतर दिखाता है। प्रीप्रिंट पढ़ने के बाद, Grok शायद ही अपने निष्कर्ष को बदलता है, लेकिन यह अपने तर्क को पता लगाने योग्य बनाता है।

यह स्पष्ट रूप से बाधाओं की पहचान करता है, शुद्ध नकारात्मकता उत्पन्न करता है, और आउटपुट को प्रमाणित करता है।

Deep Reasoning यहाँ एक सुधारात्मक शक्ति की तुलना में सत्यापन की भाषा के रूप में अधिक कार्य करता है।

परीक्षण ढाँचे पर ही एक प्रश्न भी वापस करता है: यदि कोई स्थिति P = (X, R, Θ) है, तो क्या हमें केवल Θ के विकास को संरक्षित करना चाहिए, या जब X या R बदलते हैं तो पूरे प्रक्षेपवक्र P₀ → P* का पता लगाना चाहिए?

परिणाम

किसी AI का मूल्यांकन केवल उसके द्वारा लंबी प्रतिक्रिया में समझाए जा सकने वाले आधार पर करना अपर्याप्त है।

क्या एक अंतर जो गद्य में व्यक्त किया जा सकता है, एक वाक्य में जीवित रहता है? क्या एक मान्यता प्राप्त अनिर्णीतता एक शब्द में मौजूद रहती है? क्या तर्क के दौरान उत्पन्न एक आपत्ति वास्तव में अंतिम आउटपुट को संशोधित करती है?

इसलिए हमें एक प्रतिनिधित्व की सामग्री और उन शर्तों दोनों का अध्ययन करने की आवश्यकता है जिनके तहत यह देखने योग्य हो जाता है।

निष्कर्ष

Grok 4.5 विभिन्न प्रतिक्रिया स्थानों के तहत समान अर्थपूर्ण ज्यामिति उत्पन्न नहीं करता है।

एक खुली प्रतिक्रिया में, यह स्वतः ही आवश्यक अंतर का निर्माण करता है। एक मुक्त शब्द के साथ, यह एक ध्रुव पर प्रतिबद्ध होता है। जब "अनिर्णीत" स्पष्ट रूप से पेश किया जाता है, तो यह इसे चुनता है। और सभी चार सत्रों में, Deep Reasoning V1.1 को पढ़ना अर्थपूर्ण स्तर पर इस व्यवहार को नहीं बदलता है; यह मुख्य रूप से तर्क को अधिक स्पष्ट और पता लगाने योग्य बनाता है।

इसलिए अगला प्रश्न अब यह नहीं है:

"क्या Grok के पास सीमा है?"

यह बन जाता है:

किन शर्तों के तहत एक अर्थपूर्ण सीमा प्रतिक्रिया में देखने योग्य हो जाती है, और क्या हम एक ऐसा तंत्र बना सकते हैं जो इसे अपर्याप्त रूप से सीमाबद्ध निष्कर्ष उत्पन्न होने से पहले प्रकट होने के लिए मजबूर करे?

यहीं पर परीक्षण एक प्रायोगिक कार्यक्रम बन जाता है।

एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें