मैंने Apodex से Claude Opus 5 की भविष्यवाणी करवाई; एक फॉलो-अप के बाद, इसने सबूत के दो मुख्य हिस्से हटा दिए

@RealYDT
चीनी3 दिन पहले · 20 जुल॰ 2026
127K
116
9
187
26

TL;DR

लेखक Claude Opus 5 की रिलीज़ की भविष्यवाणी करने के लिए Apodex का उपयोग करके दिखाता है, जिसमें टूल की स्वयं ऑडिट करने और सवाल किए जाने पर कमजोर सबूतों को हटाने की क्षमता पर ध्यान केंद्रित किया गया है।

कर्सर में, Honeycomb EAP नाम का एक मॉडल संक्षिप्त रूप से दिखाई दिया और जल्दी ही हटा दिया गया।

कुछ ही समय में, कई लोगों ने इसे Claude Opus 5 का प्रारंभिक लीक मान लिया।

लेकिन Anthropic ने इसकी पुष्टि नहीं की, और कर्सर ने कोई स्पष्टीकरण नहीं दिया। इसलिए मैंने इस फिलहाल अनुत्तरित प्रश्न का परीक्षण करने के लिए Apodex का उपयोग किया, जिसे दो सप्ताह में सत्यापित किया जा सकता है।

लेकिन जिस चीज़ ने अंततः इस परीक्षण को सार्थक बनाया, वह 10% का आंकड़ा नहीं था। बल्कि यह था कि एक फॉलो-अप प्रश्न के बाद, इसने अपने दो मुख्य साक्ष्यों को हटा दिया और पुनः गणना की।

सामग्री मेरे वास्तविक संचालन और स्क्रीनशॉट पर आधारित है। पाठ में दी गई संभावनाएं 17 जुलाई, 2026 तक की सार्वजनिक जानकारी के आधार पर विश्लेषणात्मक अनुमान हैं, न कि स्थापित तथ्य।

मैंने पूछा:

क्या Anthropic 31 जुलाई, 2026 तक Claude Opus 5 को औपचारिक रूप से जारी और सार्वजनिक रूप से खोलेगा? यदि नहीं, तो Honeycomb EAP वास्तव में क्या है?

阿良|AI 工作流 - inline image

प्रश्न, समय सीमा, और निर्णय किए जाने वाले तीनों पहचानों को सबमिट करने से पहले Deep Discover Preview का उपयोग करके स्पष्ट रूप से लिखा गया था।

18:28 पर, मैंने जांच शुरू की। पेज एक मल्टी-पाथ Swarm प्रक्रिया में प्रवेश कर गया, जिसमें क्रमिक रूप से Research, Verification, और Writing प्रदर्शित हुआ।

阿良|AI 工作流 - inline image

कार्य सबमिट किया गया, और कई अनुसंधान रन शुरू हो गए।

रिपोर्ट का पहला संस्करण स्पष्ट था: 31 जुलाई से पहले Opus 5 के औपचारिक रिलीज़ की संभावना बेहद कम है; Honeycomb के Mythos/Fable स्तर का EAP नोड होने की अधिक संभावना है, उसके बाद विलंबित Opus 5, और अंत में शुद्ध शोध संस्करण।

阿良|AI 工作流 - inline image

अगर मैं सिर्फ एक मानक प्रायोजित पोस्ट करना चाहता था, तो यह पर्याप्त होता: एक निष्कर्ष, स्रोत, और संभावनाएं, साथ ही रिपोर्ट के कुछ अच्छे स्क्रीनशॉट।

लेकिन जितना मैंने देखा, उतना ही मुझे लगा कि दो साक्ष्य गलत थे।

पहला: Honeycomb सुरक्षा फ़ॉलबैक के बाद Opus 4.8 पर स्विच हो जाता है, इसलिए इसकी क्षमता Opus 4.8 से अधिक होनी चाहिए।

यह तर्क सही नहीं है। फ़ॉलबैक सुरक्षा नीतियों, EAP स्थिरता, उपलब्धता, या रूटिंग कॉन्फ़िगरेशन से आ सकते हैं; वे सीधे क्षमता रैंकिंग से संबंधित नहीं होते हैं।

दूसरा: Honeycomb को कर्सर मॉडल सूची में उच्च स्थान दिया गया है, इसलिए यह एक उच्च उत्पाद स्तर से संबंधित है।

जब तक कर्सर ने अपने सॉर्टिंग नियमों को सार्वजनिक नहीं किया है, सूची में स्थान रिलीज़ समय, वर्णमाला क्रम, एकीकरण प्राथमिकता, या UI निर्णयों से प्रभावित हो सकता है। किसी मॉडल की पहचान साबित करने के लिए इसका उपयोग करना बहुत अधिक बलात् है।

इसलिए 19:02 पर, Apodex से अधिक समर्थन सामग्री खोजने के लिए कहने के बजाय, मैंने इसे स्वयं रिवर्स-ऑडिट करने को कहा: सबसे मजबूत प्रति-साक्ष्य खोजें, स्रोत स्तरों की जांच करें, और विफलता की स्थितियों को स्पष्ट करें। यदि साक्ष्य पर्याप्त मजबूत नहीं है, तो उसे हटा दें; प्रारंभिक निर्णय का बचाव न करें।

阿良|AI 工作流 - inline image

दूसरा दौर मूल रिपोर्ट को चमकाने के बारे में नहीं था, बल्कि विशेष रूप से अपनी स्वयं की साक्ष्य श्रृंखला को चुनौती देने के बारे में था। इस प्रॉम्प्ट का सीधे पुनः उपयोग किया जा सकता है।

परिणाम: तीन सुधार, एक बरकरार।

阿良|AI 工作流 - inline image

इसने पहले स्वीकार किया कि "Opus 4.8 के लिए सुरक्षा फ़ॉलबैक" यह साबित नहीं करता है कि Honeycomb अधिक मजबूत है। मूल सामग्री केवल एक द्वितीयक खाता था जिसमें "दावा किया गया" और "कुछ इसे इस रूप में पढ़ रहे हैं" जैसे अनिश्चित वाक्यांश थे, न कि कोई आधिकारिक तकनीकी लॉग।

इस साक्ष्य का भार लगभग शून्य हो गया।

阿良|AI 工作流 - inline image

इसके बाद, यह कर्सर के आधिकारिक मॉडल सॉर्टिंग नियमों को खोजने में विफल रहा।

इस बार, इसने सूची स्थान के आधार पर कहानियाँ बनाना बंद कर दिया, निष्कर्ष को "अज्ञात" में बदल दिया, और इस साक्ष्य को पहचान निर्णय से पूरी तरह हटा दिया।

阿良|AI 工作流 - inline image

तीसरा सुधार Anthropic के हाल के मॉडलों के ऐतिहासिक रिलीज़ अनुक्रम से आया।

पहले संस्करण ने "पांच आधिकारिक चैनलों में वर्तमान में Opus 5 नहीं है" को मजबूत साक्ष्य माना। लेकिन दूसरी जांच में पाया गया कि Opus 4.x जैसे वृद्धिशील अपडेट अक्सर उसी दिन API दस्तावेज़ और घोषणाओं के साथ जारी किए जाते हैं; केवल Fable/Mythos जैसे नए स्तरों में लगभग 60 दिनों का EAP लीड टाइम रहा है।

इसलिए "पांच चैनल खाली होना" केवल यह साबित करता है कि वर्तमान में कोई सार्वजनिक संकेत नहीं हैं, यह नहीं कि अगले दो सप्ताह में निश्चित रूप से रिलीज़ नहीं होगा।

阿良|AI 工作流 - inline image

अस्थिर साक्ष्यों को हटाने और ऐतिहासिक बेंचमार्क को पुनः कैलिब्रेट करने के बाद, Apodex ने अभी भी कम संभावना का निर्णय बनाए रखा: 31 जुलाई तक Opus 5 के औपचारिक सार्वजनिक रिलीज़ की लगभग 10% संभावना।

Honeycomb के लिए तीन पहचानों को भी पुनर्वितरित किया गया:

阿良|AI 工作流 - inline image
阿良|AI 工作流 - inline image

ये संख्याएं किसी सांख्यिकीय मॉडल से प्राप्त वस्तुनिष्ठ सत्य नहीं हैं; ये वर्तमान सार्वजनिक साक्ष्यों पर आधारित विश्लेषणात्मक अनुमान हैं।

इसके अलावा, तीनों में से कोई भी स्पष्टीकरण 50% से अधिक नहीं था। वर्तमान में, कोई भी पहचान "पुष्ट तथ्य" कहलाने की हकदार नहीं है।

सबसे दिलचस्प हिस्सा अंतिम 10% नहीं था, बल्कि यह था कि मेरे फॉलो-अप के बाद, इसने वास्तव में दो अस्थिर साक्ष्यों को हटा दिया और पुनः गणना की। कम से कम इसने अपने पहले उत्तर का बचाव करने के लिए कहानी को जबरदस्ती सही साबित करने की कोशिश नहीं की।

वर्तमान निर्णय को पलट सकने वाले संकेत भी सूचीबद्ध किए गए: एक आधिकारिक Anthropic घोषणा, Honeycomb का Fable/Mythos EAP के रूप में पुनः प्रकट होना, हटाने का आधिकारिक स्पष्टीकरण, Opus 4.9 का आगमन, या Honeycomb का दीर्घकालिक रूप से गायब होना।

阿良|AI 工作流 - inline image

रिपोर्ट ने मिथ्याकरणीय स्थितियां प्रदान कीं, जिससे भविष्य में सार्वजनिक घटनाओं के विरुद्ध सत्यापन संभव हो सका।

इसके बाद, मैं Apodex को "उत्तर मशीन" के बजाय "अनुसंधान लेखा परीक्षक" के रूप में मानने के लिए अधिक इच्छुक हूं।

इसका पहला संस्करण अभी भी द्वितीयक सामग्रियों को अधिक भार देगा और बिना आधिकारिक नियमों के UI स्थितियों से तर्क करेगा। लेकिन यह स्रोतों, अनुमानों, प्रति-साक्ष्यों और अज्ञात तत्वों को रख सकता है। आप फिर फॉलो-अप कर सकते हैं और इसे साक्ष्य हटाने और निर्णय बदलने के लिए मजबूर कर सकते हैं।

प्रमुख स्रोतों की अभी भी मैन्युअल समीक्षा आवश्यक है, और परिणाम सामने आने के बाद भविष्यवाणियों को सत्यापित किया जाना चाहिए। दूसरे ऑडिट ने अंततः 13 संदर्भ सूचीबद्ध किए, मुख्य रूप से Anthropic, Claude Platform, और कर्सर आधिकारिक सामग्रियों से।

阿良|AI 工作流 - inline image

31 जुलाई के बाद, मैं यह जांचने के लिए वापस आऊंगा: कौन से साक्ष्य वास्तव में उपयोगी थे, और कौन से उस समय केवल उचित लगते थे।

यदि आपके पास कोई ऐसा प्रश्न है जिसका "अभी कोई मानक उत्तर नहीं है लेकिन बाद में सार्वजनिक रूप से सत्यापित किया जा सकता है", तो आप इसे Apodex पर चला सकते हैं। सिर्फ एक दौर मत पूछिए; दूसरे दौर में, सीधे इसे स्वयं रिवर्स-ऑडिट करने के लिए कहें।

YouMind में रीमिक्स करें

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें