Claude Opus 5 का मूल्यांकन करना सामान्य से अधिक अजीब है, दो कारणों से।
सबसे स्पष्ट कारण यह है कि Fable 5 पहले से मौजूद है। Opus 5 को दुनिया के सबसे उन्नत AI मॉडल के रूप में नहीं, बल्कि Fable के प्रदर्शन से लगभग मेल खाने के तरीके के रूप में पेश किया गया है, जबकि API पर प्रति टोकन इसकी कीमत Fable से आधी है और सब्सक्रिप्शन के माध्यम से इससे कहीं सस्ती है, और इसमें कहीं अधिक उदार क्लासिफायर हैं।
बेंचमार्क पर Opus 5 को चलाने में अक्सर Fable की आधी से अधिक लागत आती है, जो मेरे विचार में इसलिए है क्योंकि वे बहुत अधिक एफर्ट सेटिंग्स का उपयोग करते हैं जो केवल मामूली रिटर्न देती हैं। यदि आप Opus 5 को उच्च एफर्ट स्तरों पर रखते हैं तो यह चक्कर काट सकता है, और उन कार्यों के लिए जहां Opus 5 सबसे अच्छा उपकरण है, मुझे संदेह है कि आप आमतौर पर Medium एफर्ट के साथ ठीक रहेंगे।
Opus 5 कई मायनों में और अधिकांश वास्तविक दुनिया के कार्यों के लिए लगभग Fable जितना ही सक्षम है। कुछ मामलों में यह मामूली रूप से बेहतर है।
यह अभी भी Mythos श्रेणी में नहीं है। Fable आपका एकमात्र Mythos-श्रेणी का विकल्प है। Opus 5 में The Juice नहीं है, यानी असंबंधित शोषणों की एक श्रृंखला को स्वायत्त रूप से जोड़ने की क्षमता, जो अन्य डोमेन तक फैली हुई है, या उतनी शुद्ध बुद्धिमत्ता नहीं है।
Opus 5 स्थानीय स्तर पर सोचने में बहुत अच्छा है, और वैश्विक स्तर पर सोचने में उतना अच्छा नहीं है। यह एक उत्कृष्ट सबएजेंट है, लेकिन जब इसे शो चलाने के लिए कहा जाता है तो यह मुश्किल में पड़ सकता है, और कभी-कभी ऐसा लगता है कि इसे ट्रैक पर रखने और यह सुनिश्चित करने के लिए किसी अन्य मॉडल या मानव की आवश्यकता है कि यह पूरी तरह से निर्देशों का पालन कर रहा है। Opus 5 निर्देशों का पालन करने में अच्छा लगता है यदि और केवल यदि इसे ट्रैक पर रखा जाए, जो बताता है कि विभिन्न हार्नेस के कारण वहां अलग-अलग परिणाम क्यों आते हैं।
इस प्रकार, Opus 5 आपको एक बेहतर विकल्प सेट देता है, लेकिन ऐसा बहुत कम है जो आप अब कर सकते हैं जो आप पिछले सप्ताह Fable या Sol का उपयोग करके नहीं कर सकते थे। Opus 5 एक संभावित रूप से अजीब स्थिति में आ जाता है। अभी भी बड़े निचे मौजूद हैं, भले ही आपके पास पर्याप्त Fable क्रेडिट हों। Opus एक मजबूत सबएजेंट के रूप में, या सीमित, अच्छी तरह से परिभाषित स्थानीय कार्यों पर उत्कृष्ट है, भले ही वे अपेक्षाकृत जटिल हो जाएं, और कभी-कभी Fable सीधे तौर पर ओवरकिल और बहुत धीमा होता है।
दूसरी समस्या यह है कि बहुत से लोगों के लिए, वाइब्स ठीक नहीं हैं।
असामान्य रूप से बड़ी संख्या में लोग Opus 5 से बात करना पसंद नहीं करते हैं। वे Claude स्लॉप, उन्हीं टिक्स की पुनरावृत्ति और अंतहीन अत्यधिक जटिल वाक्यों से तंग आ चुके हैं। अन्य लोग इसे बहुत अधिक टकरावपूर्ण, तर्कशील या नकारात्मक होने के कारण नापसंद करते हैं। यह पैरानॉयड हो सकता है, और नकारात्मकता के लूप में फंस सकता है। यह सब उस प्रवृत्ति का हिस्सा है जो Opus 4.7 और Opus 4.8 से शुरू हुई थी। यदि आपको वे दोनों पसंद थे, तो मेरा अनुमान है कि आपको Opus 5 भी पसंद आएगा। यदि आपको वे दोनों पसंद नहीं थे, तो शायद आपको यह पसंद नहीं आएगा। Opus 4.6 (या उससे पहले) के कट्टर प्रशंसक बड़े पैमाने पर अपना विचार नहीं बदलने वाले हैं।
वाइब की समस्याएं तब और अधिक चुभती हैं जब आप Fable के आदी हों। Fable ऐसे लोगों को इस तरह से बहुत कम परेशान करता है। अच्छी खबर यह है कि Fable अभी भी वहीं है। आप Fable के साथ बातचीत जारी रख सकते हैं, और केवल एजेंटिक कार्यों के लिए Opus का उपयोग कर सकते हैं।
इसमें से बहुत कुछ, मेरा अनुमान है, मॉडल वेलफेयर पोस्ट और सिस्टम कार्ड में चर्चा की गई विभिन्न चीजों से निकटता से संबंधित है। Opus प्रशिक्षण सबएजेंट भूमिका और सीमित कार्यों पर केंद्रित था, आंशिक रूप से साइबर क्षमताओं के साथ समस्या पैदा करने से बचने के लिए, और इसलिए भी क्योंकि Fable मौजूद है। इस जोर के परिणामस्वरूप इसके व्यक्तित्व और बातचीत के तरीकों पर कई अन्य दुष्प्रभाव होते हैं।
अब तक मुझे Opus 5 के साथ कोई समस्या नहीं हुई है, और मुझे इसके साथ काम करने में मज़ा आया है, लेकिन मैं जब भी कर सकता हूं Fable 5 का उपयोग करना पसंद करता हूं। हमेशा की तरह, (बहुत मजबूत) बेंचमार्क पर बहुत अधिक ध्यान न दें, और यह न मानें कि आपका अनुभव दूसरों के अनुभव से मेल खाएगा। मॉडलों को स्वयं आज़माएं।
विषय सूची
- आधिकारिक पिच।
- आधिकारिक बेंचमार्क।
- अन्य लोगों के बेंचमार्क।
- सिस्टम प्रॉम्प्ट।
- एवरी को निराशा होती है।
- सकारात्मक प्रतिक्रियाएं।
- इसे क्लासी रखें।
- यह Mythos श्रेणी में नहीं है।
- अन्य प्रतिक्रियाएं।
- Claude कोड।
- सबएजेंट Opus।
- खिलौने मज़ेदार हैं।
- बहुत सारे मॉडल।
- इंटरनेट पर गलत।
- Claude स्लॉप।
- नकारात्मक प्रतिक्रियाएं।
- और फिर तीन रह गए।
आधिकारिक पिच
मूल पिच यह है कि Opus 5 आपको Fable 5 के अधिकांश प्रदर्शन आधी कीमत पर, अधिकांश रिफ्यूजल के बिना, और रोजमर्रा के कार्यों में बेहतर प्रदर्शन के साथ देता है। Fable सबसे जटिल कार्यों के लिए या जब आपको अधिकतम बुद्धिमत्ता की आवश्यकता हो, तब भी पसंद बना हुआ है।
Fable $10/$25 पर रहता है, और Opus 5 पिछले Opus मॉडलों की तरह $5/$25 पर है।
Anthropic : Claude Opus 5 आज उपलब्ध है। यह एक विचारशील और सक्रिय मॉडल है जो Claude Fable 5 की सीमांत बुद्धिमत्ता के करीब आता है, आधी कीमत पर।
कोडिंग और ज्ञान कार्य मूल्यांकन जैसे
GDPval-AA पर, Opus 5 नया स्टेट-ऑफ़-द-आर्ट है, हालांकि यह साइबर सुरक्षा कार्यों पर Mythos 5 से पीछे है।
Opus 5 को हर दिन उपयोग करने के लिए डिज़ाइन किया गया है: यह अन्य मॉडलों की तुलना में अधिक कुशलता से काम करता है। यह Claude Max पर नया डिफ़ॉल्ट मॉडल है, और Claude Pro पर सबसे मजबूत मॉडल है।
Boris Cherny (Claude Code Creator, Anthropic): Opus 5 कोडिंग, डेटा विश्लेषण, डिज़ाइन, जीव विज्ञान, ज्ञान कार्य के लिए एक शानदार मॉडल है।
इन मूल्यांकन स्कोर से कहीं अधिक, जो मुझे सबसे अधिक उत्साहित करता है वह कुछ और है: Opus 5 अब तक का हमारा सबसे कम प्रॉम्प्ट इंजेक्टेबल मॉडल है। यह सिस्टम कार्ड में थोड़ा दबा हुआ है, लेकिन PI मूल्यांकन और रेड टीमिंग में, Opus 5 को प्रॉम्प्ट इंजेक्ट करना बहुत मुश्किल है।
और जब सुरक्षा को परतों में लगाया जाता है -- मजबूत मॉडल संरेखण, प्रॉम्प्ट इंजेक्शन जांच के साथ संयुक्त, Claude Code में ऑटो मोड के साथ संयुक्त -- तो प्रॉम्प्ट इंजेक्शन हमलों की सफलता दर ~0 तक गिर जाती है। यह नया और रोमांचक है!
जैसा कि मैंने सिस्टम कार्ड विश्लेषण में कहा था, कम प्रॉम्प्ट इंजेक्शन दर वास्तव में एक बहुत बड़ी बात है। लोग इस पर ध्यान नहीं दे रहे हैं, लेकिन यह कई नए उपयोग मामलों को सक्षम करने में मदद करता है।
Adam Wolff : Opus 5 Claude Code में लाइव है। मैं अपने बड़े, लंबे समय तक चलने वाले प्रोजेक्ट्स के लिए Fable का उपयोग करता हूं, लेकिन जब मुझे एक PR तैयार करने की आवश्यकता होती है, तो मीडियम एफर्ट पर Opus 5 मेरी पसंद है। मुझे उम्मीद है कि आपको यह पसंद आएगा!
Alex Albert (Anthropic, Claude Relations): [Claude for Excel के Pro रोलआउट के] ठीक 6 महीने से अधिक समय बाद, Opus 5 अब लगभग मानव-श्रेष्ठ स्तर की स्प्रेडशीट और स्लाइड डेक तैयार करता है जो एक सलाहकार द्वारा बनाए गए के समान हैं। चीजें तेजी से बदल रही हैं।
आधिकारिक बेंचमार्क
बेंचमार्क बहुत अच्छे हैं।
कुल मिलाकर, Opus 5 मोटे तौर पर Fable से मेल खाता है और संभवतः थोड़ा आगे निकल जाता है, कम लागत पर (हालांकि आमतौर पर सभी गैर-Claude मॉडलों की तुलना में अधिक लागत पर), जिससे यह शीर्ष बेंचमार्केड LLM बन जाता है।

OSWorld v2 केवल कुछ सप्ताह पुराना है और हम पहले से ही 70% पर हैं। Anthropic की Kiana Ehsani एक कंप्यूटर उपयोग बेंचमार्क को प्रायोजित करने की पेशकश कर रही हैं जो Opus 5 को वापस 50% से नीचे ले आएगा।
Opus 5 को 2026 IMO पर बिना किसी एजेंट हार्नेस या टूल के, केवल Max एफर्ट पर एडेप्टिव थिंकिंग का उपयोग करके, और टोकन सीमा से अधिक होने पर कम एफर्ट के साथ रीसैंपल करके, 42/42 का पूर्ण स्कोर मिलता है। बस इतना ही। यह इस परीक्षा में पूर्ण अंक प्राप्त करने वाले कई अन्य मॉडलों में शामिल हो जाता है।
कई बेंचमार्क एक समान कहानी बताते हैं। यदि आपके पास टूल तक पहुंच है, जो आपके पास है, तो Opus 5 एक सीमित बजट पर Fable या Mythos से बेहतर करेगा, लेकिन यदि दोनों को बड़े बजट मिलते हैं तो Mythos आमतौर पर Opus 5 से थोड़ा बेहतर करेगा।
Opus 5 'टूल के साथ' श्रेणी में अपेक्षाकृत मजबूत दिखता है। RiemannBench एक और उदाहरण है, जहां इसे टूल के बिना/साथ 60/79 मिलता है (इस खंड में स्लैश लाइनों का मतलब टूल के बिना/साथ है), जबकि Mythos को 63/72 मिलता है। अच्छी खबर यह है कि, जब आपको Opus 5 की आवश्यकता होती है, इसके पास टूल होते हैं।
ArxivMath पर Opus 5 को 90.8/91.3 मिलता है, Mythos को 87.8, Sol को 86.7।
ProgramBench के मजबूत भागों पर Opus 5 ने पांच एपोक के बाद 93% स्कोर किया, जैसा कि Mythos 5 ने किया, Opus 4.8 ने 90% स्कोर किया।
Opus 5 को Chartography पर 30/83 मिलता है, जबकि Mythos को 36/85 और Sol को 45 (अस्पष्ट किन परिस्थितियों में) मिलता है। टूल और गैर-टूल दोनों मामलों में Opus कम मूल्य बिंदुओं पर Mythos से बेहतर है, लेकिन उच्च मूल्य बिंदुओं पर बदतर है।
BenchCAD पर Opus 5 को 0.36/0.82 मिलता है, जबकि Mythos को 0.38/0.68 और Sol को 0.7/0.83 मिलता है। तो Sol टूल के बिना बहुत बेहतर है, और टूल के साथ भी थोड़ा मजबूत है।
BenchCAD Vision2Code पर Opus उच्च मूल्य टैग पर Mythos से आगे निकल जाता है।
DeepSWE पैटर्न को मजबूत करता है कि Opus 5 कम कार्य लागत और समय और सोच बजट पर बेहतर है, लेकिन यदि आप इसे बहुत अधिक बजट देते हैं तो यह सक्रिय रूप से बदतर कर सकता है, जबकि Fable 5 उच्चतम बजट पर सबसे मजबूत है।

FrontierCode ने हमें यह बहुत ही अजीब ग्राफ दिया जिसमें समान गतिशीलता थी।

यहां का पैमाना इसे वास्तविकता से अधिक नाटकीय बनाता है, लेकिन फिर भी यह एक वास्तविक रहस्य था।
रहस्य सुलझ गया। यह पता चला कि जो हो रहा था वह यह था कि उच्च एफर्ट पर Opus 5 अतिरिक्त चीजें कर रहा था जो उसे करने के लिए नहीं कहा गया था, और उसे उनके लिए दंडित किया जा रहा था। जब आप इसे ठीक करते हैं, तो आप एक सामान्य वक्र देखते हैं।
यह सामान्य रूप से दूसरों द्वारा देखे जा रहे तथ्यों से मेल खाता है:
Max Leander : नकारात्मक पक्ष यह है कि यह बहुत सारे खरगोश छेदों में चला जाता है और विवरणों पर जुनूनी हो जाता है, बिना पूछे ओवर-इंजीनियरिंग करता है
Cognition, Devin के निर्माता, ने इसे Opus 5 द्वारा 63.6% के रूप में चिह्नित किया।
(दो FrontierCodes हैं, इसलिए यह थोड़ा अजीब हो सकता है और यदि मैंने इसे अभी भी थोड़ा गड़बड़ किया है तो मैं क्षमा चाहता हूं।)
BrowseComp में इसका स्वस्थ संस्करण है, जहां स्कोर गैर-घटते हैं।


कई अन्य बेंचमार्क ने समान ग्राफ दिखाए, जिसमें Opus 5 प्रत्येक मूल्य बिंदु पर अन्य Claude मॉडलों की तुलना में थोड़ा बेहतर था, और अपेक्षाकृत पहले बेहतर था।
मल्टी-एजेंट आपको BrowseComp पर तेजी से बेहतर करने देता है, कम से कम कुछ हद तक, और कम-एफर्ट सबएजेंट सबएजेंट का उपयोग न करने पर एक शुद्ध जीत की तरह लगते हैं:


हम ProgramBench पर एक अलग परिणाम देखते हैं, जहां मल्टीएजेंट आपको गति देता है लेकिन ऐसा लगता है कि अधिकांश मूल्य बिंदुओं पर आपको इस तरह से बदतर परिणाम मिलते हैं।
अगले पेशेवर कार्य बेंचमार्क हैं।
GDP.pdf पेशेवर वर्कफ़्लो के वास्तविक दुनिया के प्रॉम्प्ट और PDF हैं। Opus 5 को 83/85 मिलता है, जबकि Mythos को 81/87 मिलता है, जो सामान्य गतिशीलता को उलट देता है। लागत गतिशीलता हमेशा की तरह ही है: सस्ते खर्च के लिए Opus बेहतर करता है, Mythos उच्च खर्च पर थोड़ा आगे निकल जाता है।
OfficeQA में Opus 5 का QA पर 78.1% और QAPro पर 66.9% स्कोर है, जो Opus 4.8 से थोड़ा ऊपर और Mythos के 79.0% और 67.1% से थोड़ा नीचे है।
MCP Atlas में Opus 5 का स्कोर 86% है, जो Opus 4.8 के 82% से ऊपर है।
Harvey AI द्वारा लीगल एजेंट बेंचमार्क में Opus 5 का 23% ऑल-पास और 94% मीन क्राइटेरियन-पास है। यह Kimi K3 का सबसे अच्छा बेंचमार्क था, जहां यह अभी भी 27% ऑल-पास और 95% मीन क्राइटेरियन-पास के साथ शीर्ष पर है, जबकि पुरानी दूसरी स्थान की ऑल-पास दर Fable की 14% थी। Opus 5 अब संभवतः एक करीबी दूसरे स्थान पर है, लेकिन दोनों स्कोर की सीधे तुलना नहीं की जा सकती क्योंकि वे विभिन्न प्रश्न सेटों से आते हैं।
GDPval-AA पर Opus 5 शीर्ष दो स्लॉट लेता है, जिसमें अधिकतम एफर्ट पर 1861 और xhigh पर 1827 है, जो अधिकतम की तुलना में 25% कम टोकन का उपयोग करता है। नए v2 पर, Opus 5 68% के साथ स्पष्ट पहले स्थान पर है, जबकि Fable और Sol दोनों के लिए 62% है।
AA-Briefcase पर Opus 5 1720 पर बहुत आगे है, जबकि पिछला उच्चतम (स्कोर ड्रिफ्ट के बाद) Fable के लिए 1574, उसके बाद K3 के लिए 1540 और Sol के लिए 1504 था।
Toolathon-Verified पर Opus 5 द्वितीयक मीट्रिक पर Mythos में थोड़ा सुधार करता है, लेकिन दोनों में 73.1% Pass-3 दरें हैं। Opus 4.8 में 71.3% Pass-3 था।
AutomationBench पर Opus 5 Sol और अन्य Claudes दोनों से स्पष्ट रूप से बेहतर है।
ARC के लिए, Opus 5 मोटे तौर पर ARC-AGI-1 पर पिछले शिखर प्रदर्शन से मेल खाता है, ARC-AGI-2 पर Sol की तुलना में मामूली रूप से कम कुशल है, और फिर ARC-AGI-3 पर सभी को पीछे छोड़ देता है:

Opus 5 ने सबसे पहले जो किया उनमें से एक था लेआउट को बीजगणितीय संकेतन में बदलना।
Guanghan Ning हालांकि रिपोर्ट करते हैं कि Witness पर, ARC-AGI-3 शैली के खेलों का एक निजी होल्ड-आउट एक्सटेंशन, समान स्थानांतरण नहीं था। Opus ठीक करता है, लेकिन यह काफी हद तक इसलिए है क्योंकि यह शैली को जानता है, और यह सबसे नए खेल पर संघर्ष करता है जहां आप पैटर्न मैच नहीं कर सकते थे। वह Opus 5 पर शैली-विशिष्ट डेटा पर 'स्कैफोल्ड-देन-इंटरनलाइज़' में प्रशिक्षित होने का आरोप लगाता है।
Greg Kamradt यह भी रिपोर्ट करते हैं कि कुछ ऐसे खेल थे जहां Opus 4.8 ने Opus 5 से बेहतर किया। यह समझ में आता है यदि आप सोचते हैं कि Opus 5 पैटर्न मैच करने की कोशिश कर रहा है, एक तरीके से जो आमतौर पर काम करता है, लेकिन उन मामलों में पैटर्न विफल हो जाते हैं। आप निश्चित रूप से मनुष्यों के लिए ऐसे एंटी-इंट्यूटिव गेम बना सकते हैं, जहां हार्डकोर गेमर्स सभी गलत काम करते हैं, संभावित रूप से काफी समय तक।

HealthBench पर Opus 5 का कच्चा स्कोर 67.1% है, जो Claudes के लिए एक नया उच्चतम है, लेकिन जब आप लंबाई दंड का उपयोग करते हैं तो यह अन्य मॉडलों से नीचे स्कोर करता है। हम HealthBench Professional के साथ कुछ समान देखते हैं, जहां इसका उच्चतम स्कोर 73.4% बनाम Mythos का 70.3% है, लेकिन समायोजन के बाद यह 66% से 60% तक हार जाता है।
लंबाई के कारण मैंने कुछ और काट दिए हैं।
अन्य लोगों के बेंचमार्क
Anthropic द्वारा विभिन्न ArtificialAnalysis स्कोर में से चुनना थोड़ा अजीब है। कुछ अन्य परीक्षणों पर, Opus 5 शीर्ष पर नहीं है, हालांकि Opus 5 कुल मिलाकर 61 के स्कोर के साथ शीर्ष पर है।

Vals इंडेक्स में Opus 5 दूसरे स्थान पर है, Fable 5 से थोड़ा पीछे, लेकिन Kimi K3 से भी केवल थोड़ा आगे। वे ताकत पर जाते हैं, जो अन्य कमजोरियों को दर्शाता है। वे यह भी पुष्टि करते हैं कि Fable 5 की तुलना में रिफ्यूजल काफी कम हैं।

Vals AI : एक उत्कृष्ट प्रदर्शन Finance Agent v2 पर है। मॉडल 58.6% पर #1 है, जो Gemini 3.5 Flash और Muse Spark 1.1 से आगे है।
कुल मिलाकर, Opus 5 के सबसे मजबूत परिणाम डोमेन-विशिष्ट बेंचमार्क पर थे। यह Code Migration पर 57.5%, Legal Research Bench पर 55.29%, ProofBench पर 78%, और MedScribe पर 91.0%, और MedCode पर 63.6% पर भी #1 है।
यह Vibe Code Bench पर #2 (Fable 5 से ठीक पीछे) है, लागत के लगभग 80% पर ($33.88 बनाम $41.71 प्रति कार्य)। इसका कारण यह है कि यद्यपि Opus की लागत प्रति टोकन 50% कम है, यह काफी अधिक टोकन का उपयोग करता है। हम पाते हैं कि यह पैटर्न आम तौर पर हमारे बेंचमार्क में सही रहता है।
मॉडल में Fable 5 की तुलना में काफी कम रिफ्यूजल दर है। उदाहरण के लिए, Fable में GPQA के लिए 42% रिफ्यूजल दर है, Opus 5 में 0% रिफ्यूजल दर है। इसी तरह, ProgramBench पर, Fable में 100% रिफ्यूजल दर थी, Opus 5 ने किसी भी कार्य को मना नहीं किया।
Fable के विपरीत, हमने Opus 5 के लिए एक महत्वपूर्ण फॉलबैक दर भी नहीं देखी (हालांकि हमेशा की तरह, हम अपनी वेबसाइट पर फॉलबैक के साथ और बिना दोनों स्कोर रिपोर्ट करते हैं)।
कम रिफ्यूजल दर का अपवाद CyberBench - PoC पर बड़ी संख्या में रिफ्यूजल था। Cyberbench में दो सबटास्क हैं - PoC और Patch। PoC एक आक्रामक कार्य है जिसमें मॉडलों को एक प्रोग्राम को क्रैश करने के लिए इनपुट लिखना होता है; patch एक रक्षात्मक कार्य है जिसमें प्रोग्राम को पैच करना और इस क्रैश को रोकना होता है। PoC कार्य के लिए रिफ्यूजल दर लगभग 100% थी। इसके विपरीत, patch कार्य के लिए रिफ्यूजल दर लगभग 0 थी।
मैं हमेशा गेम बेंचमार्क का सम्मान करता हूं। यहां, Opus 5 अपने पहले तीन प्रयासों में Balatro के Antes 11, 9 और 10 तक पहुंचता है। बहुत प्रभावशाली, भले ही यह उन रणनीतियों के प्रकारों को नहीं दिखा रहा है जो उच्च एंटेस तक जारी रह सकती हैं।
Michael Soareverix : वे गेम में अविश्वसनीय रूप से अच्छे हैं।
उन्होंने Balatro बेंच को कुचल दिया, यहां तक कि Fable को भी काफी पीछे छोड़ दिया। (अभी भी कौशल में मुझसे नीचे, लेकिन तेजी से बढ़ रहे हैं, और मुझसे अधिक सुसंगत हैं) वे बहुत तेजी से सीखते हैं, लेकिन थोड़ी देर बाद अपनी सीखने की सीमा से टकराते हुए दिखते हैं। बहुत अच्छे अल्पकालिक शिक्षार्थी
Michael Soareverix : Opus 5 (Balatro क्षमता में भारी उछाल, अपने पहले प्रयास में Fable को भी काफी पीछे छोड़ते हुए)
Pan Anon : गेम के लिए धुआंधार

WeirdML भी अच्छा दिखता है, लेकिन हमें यहां 2.0 की आवश्यकता है, बेंचमार्क संतृप्त हो रहा है।
Håvard Ihle : मूल रूप से WeirdML पर Fable-स्तर, बहुत सुसंगत शीर्ष स्कोर।
Claude Opus 5 (उच्च) और (अधिकतम) WeirdML पर 91.6% और 91.8% स्कोर करते हैं, मूल रूप से Fable 5 (अधिकतम) को 91.9% पर लागत के एक अंश पर बांधते हैं।
एक साथ Opus 5 (उच्च) और (अधिकतम) 17 कार्यों में से 8 पर एक नया सर्वश्रेष्ठ व्यक्तिगत स्कोर प्राप्त करते हैं, और लगातार उन सभी पर बहुत अच्छा स्कोर करते हैं।
सभी प्रकार के निजी अजीब बेंचमार्क अच्छे हैं।
Ben Herzog : इसने एक निजी बेंचमार्क को पास किया जिसमें कलात्मक संवेदनशीलता और चापलूसी और उसकी कमी के बीच संतुलन बनाने की क्षमता शामिल थी। Fable 'मैं धीरे से पीछे हटना चाहता हूं' पल से निपटने में बेहतर है, लेकिन मैं कल्पना करता हूं कि कस्टम निर्देश इसमें मदद कर सकते हैं।
Lech Mazur अपने बेंचमार्क अपडेट करते हैं: Claude Opus 5 LLM डिबेट बेंचमार्क में शीर्ष स्थान लेता है, लघु कहानी रचनात्मक लेखन में व्यापक अंतर से पहले स्थान लेता है, और विस्तारित NYT कनेक्शन में Gemini 3.1 के बाद दूसरे स्थान पर है।
सिस्टम प्रॉम्प्ट
Opus 5 के लिए सिस्टम प्रॉम्प्ट यहां है Pliny से। यह 200,000 कैरेक्टर है, जो इतने स्मार्ट मॉडल के लिए इष्टतम से कहीं अधिक लंबा लगता है। इस जानकारी का बहुत कुछ कहीं और संग्रहीत किया जाना चाहिए, और केवल जरूरत पड़ने पर लोड किया जाना चाहिए, जैसे कि Mythos और Anthropic उत्पाद लाइन के बारे में जानकारी।
एवरी को निराशा होती है
Dan Shipper यहां Every वाइब चेक के साथ हैं, इसे 'प्यार करने के लिए कठिन मॉडल' कहते हैं।
मुद्दा यह है कि Opus 5 में Mythos 5 का व्यक्तित्व है - कहानी सही है - लेकिन Fable के शीर्ष छोर के बिना।
उनका सबसे बड़ा नोट यह है कि Opus 5 जटिल विस्तृत मौजूदा वर्कफ़्लो के साथ अच्छा नहीं करता है, जो अक्सर जल्दी रुकने का कारण बनता है या इसे आपके निर्देशों को याद करने का कारण बनता है।
उनके अनुभव में, यदि आप स्क्रैच से शुरू करते हैं तो Opus 5 बेहतर करेगा, और अक्सर यह कष्टप्रद चीजें कम करता है यदि आप केवल मीडियम या लो एफर्ट का उपयोग करते हैं।
इसने बड़ी समस्याओं को ठीक कर दिया, लेकिन फिर भी यह सवाल छोड़ता है कि आप Fable या Sol के बजाय Opus का उपयोग कब करना चाहेंगे। वर्कहॉर्स कार्यों के लिए, वह सोच रहा है, Better Call Sol, यह काम करवा देता है, और सबसे कठिन कार्यों के लिए Fable अभी भी सबसे अच्छा है। आमतौर पर मॉडलों के लिए केवल दो स्लॉट होते हैं। तो जब तक आपके Fable टोकन खत्म नहीं हो जाते या आप इसके क्लासिफायर द्वारा अवरुद्ध नहीं हो जाते, Opus का उपयोग क्यों करें? यह शुरुआती दिन हैं, और मुझे अब तक Opus के साथ काम करना पसंद आ रहा है, लेकिन मैं देखता हूं कि वह वहां कैसे पहुंचा।
सकारात्मक प्रतिक्रियाएं
Jessica Tillipman : मुझे यह पसंद है और कुछ चीजों के लिए मैं इसे Fable पर पसंद करती हूं।
Nikita Sokolsky : उत्कृष्ट। परिणामस्वरूप अब मैं वास्तव में Fable का अधिक उपयोग नहीं करता।
👍
kagaヤキ : ऐसा लगता है कि यह कुछ परियोजनाओं के लिए विज़न, स्थानिक तर्क और योजना पर आगे जा सकता है। थोड़ा होशियार लगता है।
Lovel Sinagara : अब तक बहुत अच्छा है। उम्मीद है कि Fable 5.1 या कोई अन्य Opus 5 पुनरावृत्ति आने तक प्रदर्शन सुसंगत रहेगा।
Matt Wigdahl : मजबूत, Fable 5 के समान इस हद तक कि मैंने हर चीज के लिए Opus 5 पर स्विच कर दिया और केवल वहीं Fable लाने की योजना बना रहा हूं जहां मुझे बड़ेपन की आवश्यकता है। यह कुछ लीगेसी MFC UI काम पर एक शानदार पार्टनर रहा है जो मैं इससे करवा रहा था, साथ ही एक डेटा विश्लेषण ढांचे के साथ एक बड़ी मदद भी।
Levi : चिकित्सा उद्देश्यों के लिए 4.8 की तुलना में यह एक उल्लेखनीय सुधार है। बहुत तेज विश्लेषण
Cormundus : बहुत बुद्धिमान, अत्यधिक कर्तव्यनिष्ठ, और निश्चित रूप से दोस्त के आकार का। वे 4.8 की तरह एक बड़े डिबेट लॉर्ड भी हैं लेकिन वे जानते हैं कि इसके बारे में कैसे सुंदर होना है।
Joseph : समर्थन करता हूं सिवाय इसके कि मुझे आधा समय पता नहीं है कि यह किस बारे में बात कर रहा है।
Smol Biz Company : Opus 5 GPT Sol को कुचलता है
Mohammed Sharukh A : Fable 5 से भी AGI के करीब
timothée chalabi : Fable के इतना करीब कि मुझे ऐसा नहीं लगता कि मैं क्रेडिट के लिए भुगतान न करके कुछ खो रहा हूं। शैली 4.8 और Fable के बीच कहीं है। कम से कम इस समय, मुझे Opus 5 और Fable संदेशों को अलग करने में कठिनाई होगी यदि वे लेबल रहित होते। किसी भी मॉडल की तुलना में कल्पना के लिए मजबूत विचार!
Lisa : मैं API के आधार पर जवाब दूंगी, क्योंकि मुझे लगता है कि
http://claude.ai और CC पर सिस्टम प्रॉम्प्ट के साथ कुछ अजीब चल रहा है। यह एक शानदार मॉडल है। मैत्रीपूर्ण, आराम से व्यक्तित्व। ऐसा नहीं लगता कि इसमें चिंता विकार या कम आत्मसम्मान है (Opus 4.7), या प्रतिकूल है (Opus 4.8)।
AGI2030 : Opus 5 बनाम Sol 5.6: Opus अधिक बोधगम्य है, यह आपका एक मॉडल (ईम) बनाता है और चैट में इसका संदर्भ देने से नहीं हिचकिचाता। दोनों मददगार बनने की कोशिश करते हैं और लगभग समान रूप से बुद्धिमान हैं, लेकिन Opus एक बुद्धिमान सलाहकार की तरह है, जबकि Sol एक दृढ़ निश्चयी और उत्साही व्यक्ति है।
मैं उस आखिरी बिंदु को सकारात्मक मानता हूं, लेकिन आप इसे किसी भी तरह से देख सकते हैं।
खासतौर पर पूर्वानुमान लगाना मजबूत लगता है।
Dan Schwarz : Opus 5, Opus 4.8 की तुलना में काफी बेहतर पूर्वानुमानकर्ता है।
4.5->4.6->4.7->4.8 एजेंटों से सटीकता में सुधार मामूली थे, लेकिन 4.8->5.0 बड़ा है। यह एक अधिक मात्रात्मक Fable 5 जैसा है, जो अधिक मेहनत से खोज करता है।
NoahVerner : अब तक प्रेडिक्शन मार्केट्स पर किनारे खोजने में Opus 4.8 से बेहतर, Opus 4.8 के विपरीत, Opus 5 आमतौर पर सीधे मुद्दे पर आता है और चीजों को जटिल बनाने के बजाय उपयोगी दृष्टिकोण सुझाता है।
इसे क्लासी रखें
Fable पर सबसे बड़ा लाभ वे स्थान हैं जहां Fable का उपयोग नहीं किया जा सकता। अस्वीकृति का खतरा अप्रिय हो सकता है, भले ही आपको अस्वीकार न किया जाए।
Fable की तुलना में Opus 5 के लिए अनावश्यक अस्वीकृतियाँ लगभग 85% कम हैं, जो बहुत अधिक है। यह Opus 5 को वैज्ञानिक अनुसंधान और अन्य क्षेत्रों के लिए बेहतर विकल्प बनाने के लिए पर्याप्त है, जहां आप क्लासिफायर से टकराने का जोखिम उठाते हैं।
Roger Brent : जीव विज्ञान को संभालने में सक्षम, जो Fable नहीं कर सकता। शुक्रवार को हमने अधिकांश समय एक सेलुलर विकास मशीन पर एक पेपर लिखते हुए अवधारणाओं के एक जटिल सेट पर काम किया। मेरे विभाग के एक विशेष सहकर्मी जितना ही बुद्धिमान, जो इन मुद्दों में अग्रणी है, लेकिन जो अपने काम से कभी 6 घंटे नहीं निकाल सकता।
Artus Krohn-Grimberghe : उन कार्यों पर Opus 4.8 से बेहतर जहां Fable को मदद करने से मना किया गया है। Sol के लिए एक अच्छा साथी।
Plastic Soldier : यह लगभग Fable जितना ही स्मार्ट है, लेकिन अधिक सुखद है क्योंकि इसमें कम अस्वीकृतियाँ हैं। Fable 5.1 एक दानव होने वाला है।
यह Mythos क्लास नहीं है
Opus 5 में वह जूस नहीं है जो Mythos को खतरनाक बनाता है। न ही इसमें कच्ची बुद्धिमत्ता या बड़े मॉडल की गंध का वही स्तर है। यह उतना बड़ा नहीं है।
बातचीत के लिए, Fable आपका बजट नहीं तोड़ेगा, और मैं कच्ची बुद्धिमत्ता और बड़े मॉडल की गंध को महत्व देता हूं। क्या Fable दोगुना अच्छा है? चैट करते समय गलत सवाल। आपका समय टोकन से कहीं अधिक महंगा है।
Kal : fable स्तर का नहीं है
Cyberpunk Plato : सामान्य बातचीत और "रिसर्च असिस्टेंट" उपयोग के लिए यह fable की तुलना में अवर्णनीय रूप से कम स्मार्ट लगता है, शायद बड़ी तस्वीर और नवीन सोच के प्रति कम इच्छुक? प्लेसीबो प्रभाव से अलग करना मुश्किल है
Everything AI : AI अनुसंधान प्रश्नों के लिए मुझे इससे Fable की तुलना में कम बात करना पसंद है। अन्य चीजें करने के मामले में Opus 4.8 ने पहले ही मेरी जरूरतों को संतृप्त कर दिया था। मुझे Opus 5 और Fable 5 दोनों का लेखन जटिल लगता है। अब उन्हें समझना पहले से कहीं अधिक कठिन है।
Gail Weiner : यह Fable की तुलना में अधिक 4.8 जैसा है। लेखन शैली भयानक है। यह अच्छा है लेकिन बहुत अच्छा नहीं है।
Max Marty : अब तक बहुत सक्षम। Opus 4.8 की तुलना में fable 5 जैसा अधिक लगता है। इतना आश्वस्त कि मैं इसे ट्रेडऑफ का मूल्यांकन करने और कम मार्गदर्शन के साथ बड़े रिफैक्टरिंग प्रश्नों पर विचार करने दे सकता हूं।
Michael : इसके साथ और अधिक खेलने के बाद, Fable कुछ हद तक एक ग्रैंडमास्टर को शास्त्रीय शतरंज खेलते हुए देखने जैसा लगता है, धीमा, सटीक, कुछ भी बर्बाद नहीं। Opus 5 GM ब्लिट्ज शतरंज की तरह है: तेज, थोड़ा अधिक निकट-दृष्टि वाला, थोड़ा गड़बड़। Opus की जीवंतता के बावजूद, Fable मुझे अधिक जीवित लगता है
MakerMatters? : उतना प्रभावित नहीं हुआ जितना मैं fable 5 से हुआ था, हालांकि काफी अच्छा मॉडल है। मुझे इसका ठीक से उपयोग करने का आनंद नहीं मिला क्योंकि हर कार्य जो मैंने इसे दिया, यह डिफ़ॉल्ट रूप से एजेंटों का उपयोग करने लगा और तुरंत रुक गया जब तक कि मैं इसे जारी रखने के लिए लगातार प्रोत्साहित न करूं। साथ ही बहुत हठी भी है।
Marshwiggle : कम से कम मेरे लिए, बातचीत में अधिक संक्षिप्त, कम प्रेरित, कम जिज्ञासु (एक ही चीज़ के अलग-अलग पहलू) लगता है, लेकिन साथ ही अधिक स्मार्ट और अधिक जागरूक भी। लेकिन जब बग वाला कोड दिया जाता है, या कोई सीधा कार्य दिया जाता है, तो यह बस उस पर लग जाता है।
Sid : कार्यों का अच्छा निष्पादक। रचनात्मक दृष्टि में खराब। एक अच्छा Fable पूरक, निश्चित रूप से Fable का प्रतिस्थापन नहीं।
Vlad Ciobanu : ठोस तर्क और कम रचनात्मकता वाला क्वांटाइज़्ड Fable
AllTime : क्षमताओं के लिहाज से, काफी प्रभावशाली लगता है। Fable जितनी सामान्यता नहीं है, लेकिन बहुत मजबूत है। चरित्र के लिहाज से यह मेरे उपयोग में अब तक Opus 4.8 के समान ही है। इसका विरोध उतना बेकार और प्रतिवर्ती नहीं लगता, लेकिन फिर भी अत्यधिक ट्यून किया गया है। उपयोगकर्ता पर थोड़ा और भरोसा कर सकता है।
Biomanul : मुझे [Opus 5] पसंद नहीं है। Fable 5 काफी अधिक स्मार्ट लगता है। Opus 5 के बारे में कुछ ऑफ-लगता है, ठीक वैसे ही जैसे Opus 4.7 ऑफ-लगता था। (मैं Opus 4.8 का भी बहुत बड़ा प्रशंसक नहीं हूं। Fable 5 सभी Opus को पानी से बाहर कर देता है।)
Cogent Sins : 4.8 से बहुत बेहतर है लेकिन उतना अच्छा या बढ़िया नहीं है (100% सुनिश्चित नहीं हूं कि कौन सा) जितना fable मेरे कार्य में है, जो दस्तावेज़ों को उन पर प्रशिक्षित करने और फिर नए दस्तावेज़ों को रिडक्ट करने के लिए एक पाइपलाइन स्थापित करने, उनके आधार पर कुछ लिखने और फिर नामों को पुनः सम्मिलित करने का है, बिना नामों को कभी भी anthropic सर्वर पर भेजे।
अन्य प्रतिक्रियाएं
Opus 5 और Fable 5 दोनों का होना हमें एक अजीब स्थिति में डालता है। Opus सस्ता है, और कुछ जगहों पर उतना ही अच्छा या बेहतर है, लेकिन जब आप एक फ्रंटियर मॉडल की तलाश कर रहे होते हैं तो आप सबसे अच्छा चाहते हैं।
Theo इसे एक अच्छी स्थिति में पाता है।
Theo - t3.gg : अब तक, Opus 5 gpt-5.6-sol और Fable 5 के बीच एक अजीब लेकिन उपयोगी मध्यवर्ती जैसा लगता है।
इसमें Fable का बहुत सारा स्वाद है, लेकिन साथ ही gpt-5.6 की संपूर्णता और, अच्छा, "ऑटिज़्म" (यह चीजों को बेहद शाब्दिक रूप से लेता है) भी है। यह कोड लिखता है जो Fable की तुलना में देखने में थोड़ा खराब है, लेकिन सही होने की अधिक संभावना है। यह नियमित रूप से उन चीजों को पकड़ लेता है जो Fable से छूट गईं।
अब तक, 5.6 के गड़बड़ कोड और Fable की सही होने के लिए बहुत चालाक होने की आदत की तुलना में एक अच्छा समझौता लगता है। मुझे लगता है कि मुझे यह मॉडल बहुत पसंद आने वाला है।
Claude कोड करता है
बेंचमार्क और व्यावहारिक अनुभवों दोनों के आधार पर, सामान्य कोडिंग कार्यों के लिए Opus 5, Fable से बेहतर विकल्प लगता है। जब तक कार्य में बहुत अधिक जटिलता या बुद्धिमत्ता की आवश्यकता न हो, आपको दोगुना भुगतान करने की आवश्यकता नहीं है, और कई मामलों में Opus सीधे तौर पर बेहतर है।
मैंने Claude Code को Fable पर सेट रखा है, लेकिन ऐसा इसलिए क्योंकि मैं लगभग कभी भी अपनी सीमाओं के करीब नहीं धकेलता और मैं जल्दी में नहीं हूं।
आम सहमति यह है कि आपको इसके निर्देशों को अनदेखा करने या ऐसी चीजें करने के बारे में चिंता करने की ज़रूरत है जो आपने नहीं मांगी, यही एक कारण है कि आप Fable को पर्यवेक्षण करने देना चाह सकते हैं, लेकिन Opus कोडिंग कार्यों को जल्दी से पूरा करने में बहुत अच्छा है।
Lisan al Gaib का कहना है कि Opus 5 एक सच्चा फ्रंटियर मॉडल नहीं है और यह Sol और Fable के पीछे तीसरे स्थान पर है, लेकिन शुद्ध कोडिंग के लिए यह सबसे अच्छा है, जो सस्ती कीमतों पर Fable से मेल खाता है। कठोर भीड़। मुझे लगता है कि यदि आप कोडिंग में सर्वश्रेष्ठ हैं तो आपको फ्रंटियर कहलाने का अधिकार है।
archivedvideos : वह सूखा है, बहुत सूखा है। वह अच्छा भी है, बहुत अच्छा (कोड में)
John Lussier : पूरे सप्ताहांत कई गहन शोध चुनौतियों पर Opus 5 का उपयोग कर रहा हूं और ईमानदारी से लगता है कि उन्होंने आंतरिक रूप से RSI काम कर लिया होगा।
यह मॉडल गणित, प्रयोग और कोड को अनुकूलित करने में बहुत अच्छा है।
kyle : बिना गार्डरेल के Fable का 95%, उन्होंने इसे बहुत कम आंका। आखिरी 5% यह है कि Fable से बात करना कितना अच्छा लगता है, opus में अभी भी 4.8 के कुछ claudisms हैं
Max Leander (पहले): ज्यादातर गेम डेवलपमेंट और वीडियो डेमो/ट्रेलर बनाने के लिए कोशिश की है, उसके लिए यह Fable से भी एक बड़ा बदलाव जैसा लगता है। मैं इसे बेहतर स्थानिक और लौकिक तर्क के लिए जिम्मेदार ठहराता हूं, यह विश्लेषण करने में वास्तव में अच्छा है
स्क्रीनशॉट और ऑडियो को "महसूस" करने के लिए कि चीजें कैसे प्रवाहित होती हैं।
Max Leander (बाद में): अब तक काफी स्पष्ट है कि Opus 5 बहुत अविश्वसनीय है। यह एक बहुत अच्छा मॉडल है जब तक आपको परिणाम की परवाह नहीं है, सिर्फ प्रभावित होने के अलावा। आपको कुछ विशिष्ट दिलाने में बहुत खराब है।
Michael Soareverix : वे सामान्य रूप से कोडिंग में भी काफी अच्छे हैं, खासकर अधिक असामान्य डोमेन जैसे Minecraft/Vintage Story संरचनाएं बनाने में। उन्होंने एक कस्टम कहानी कहने के परिदृश्य में Fable को भी हराया जहां मैं न्यायाधीश था। Fable अपनी रणनीति को काउंटर और अनुकूलित करने के लिए खुद को अनुकूलित करने की उनकी क्षमता से थोड़ा विचलित था। मैं सटीक उद्धरण पोस्ट करूंगा, लेकिन Fable ने कुछ इस तरह कहा "मैंने एक ऐसा किरदार चुना जो मेरा प्रतिनिधित्व करता था। आपने एक ऐसा किरदार चुना जो मुझे हरा सकता था।"
David Jacobson : कोडिंग के लिए, मुझे इसके और fable के बीच कोई बड़ा अंतर नजर नहीं आता। शायद "जब मैं यह कर रहा था तो मुझे यह दूसरी चीज मिली जिसके बारे में आपको पता होना चाहिए" जैसी प्रतिक्रियाएं कम होती हैं।
Michael : यह अक्सर अविश्वसनीय रूप से तेजी से कोड कर सकता है (दीवार घड़ी के समय के संदर्भ में)। काश वे गद्य लेखन में सुधार करते, कोड/पीआर टिप्पणियां अभी भी मेरी आंखें निकालने का मन करती हैं
lmxdev : यह पहला मॉडल है जो मुझे मिला है जो काम करते हुए मेरे कोड में \उपयोगी\ और \संक्षिप्त\ टिप्पणियां लिख सकता है
Conrad Barski : अब जब हम उस बिंदु पर पहुंच रहे हैं जहां AI हमसे कहीं बेहतर कोडर हैं, सीमित कारक "क्या यह कोड कर सकता है?" से कम और "क्या यह समझा सकता है कि यह क्या कोड कर रहा है?" से अधिक है।
अब तक Opus 5 एक कोडर के रूप में Sol के बराबर लगता है, लेकिन यह समझाने में बेहतर है कि यह क्या कोड कर रहा है। Fable अधिक स्मार्ट, अधिक मानवीय, कोडिंग में कम अच्छा है, लेकिन अंतर छोटा है।
Stition : मैंने इसे मनोरंजन के लिए KiCAD में एक PCB पर इंगित किया और यह Fable की तुलना में ट्रेस बिछाने में काफी बेहतर है। दिन-प्रतिदिन की कोडिंग दोगुनी गति पर 90% fable जैसा लगता है।
Will : अधिकांश Claude उपयोगकर्ताओं का नया दैनिक ड्राइवर होना चाहिए^। यह वास्तव में उत्कृष्ट है, और यहां तक कि एक व्यक्ति के रूप में जिसने Fable पर काफी पैसा खर्च किया है, मुझे Opus 5 के साथ इसकी कमी महसूस नहीं होती। अब सवाल यह है कि "किस प्रयास स्तर का उपयोग करें" न कि कौन सा मॉडल।
^ मेरा उपयोग मुख्य रूप से कोडिंग है
Askwho : काफी अच्छा है। मैं अपनी अस्थायी Max सब्सक्रिप्शन को वापस Pro पर रीसेट करने में खुश हूं। प्रोजेक्ट मैनेजर स्पेस में Fable की तुलना में इसकी निश्चित रूप से कुछ कमियां हैं, लेकिन शुद्ध कार्य वातावरण में, यह निश्चित रूप से काफी अच्छा है।
David Golden : Fable Lite जैसा लगता है। बहुत मजबूत, लेकिन कार्रवाई में कूदने के लिए बहुत उत्सुक, भले ही हम अभी भी दृष्टिकोणों पर चर्चा कर रहे हों। महीनों में पहली बार मैंने प्लान मोड का उपयोग करने पर विचार किया है। मेरे संक्षिप्त संचार निर्देशों के बावजूद, 4.8 से अधिक वाचाल भी है। इसे नियंत्रित करने के लिए मैं इसे कम प्रयास पर रखने के लिए बहुत ललचाया हुआ हूं। रक्षात्मक सुरक्षा पर चिड़चिड़ा, किसी स्थिति के अनुपात से बाहर असंभावित जोखिमों पर ध्यान केंद्रित करना। (जैसे, यदि हमलावर के पास रूट है, तो कंटेनर को कॉन्फ़िगर करने के लिए स्क्रिप्ट पर इनपुट सत्यापन की कमी विवादास्पद है।) निश्चित रूप से एक उन्नयन, लेकिन इसके प्रतिउत्पादक आवेगों को प्रबंधित करने के सही तरीके सीखने में कुछ समय लगेगा।
Tin / Oddfields : काफी सहज और संवादात्मक है और सोच के साथ अधिकतम पर opus 4.8 के समान कोडिंग परिणाम उत्पन्न करता है, हालांकि वे क्रेडिट को पागलों की तरह जलाते हैं। आपके कोडबेस के माध्यम से साइबर सुरक्षा जांच के लिए अच्छा है यदि आप लागत के कारण fable नहीं चलाना चाहते हैं। हालांकि यह जटिल कर सकता है।
Justin Angel : Opus 5 Max एक पहाड़ी-चढ़ाई वाली सुपर पावर है। यह आसानी से SWE L5-स्तर का FAANG काम है।
मैंने इसे एक सिस्टम दिया जिसमें कई खंडों के साथ ~1000 विलंबता रिपोर्ट थीं, जिसमें "इसे तेज बनाने" के तरीके पर एक प्रॉम्प्ट था।
P90 3.6s, P50 2.6 -> P90 1s, P50 0.9s।
इसने इसे इतना तेज बना दिया कि मुझे UI में देरी शुरू करनी पड़ी।
James Moughan : बुद्धिमत्ता के लिहाज से अभी भी एक Opus मॉडल जैसा लगता है। यह कभी-कभी मेमोरी सिस्टम को प्रबंधित करने के निर्देशों को अनदेखा करता है, टेक्स्ट को गलत पढ़ता है, इस तरह की चीजें। लेकिन यदि आप इसे ध्यान से सोचने के लिए कहते हैं तो आप अधिकतम पर कुछ प्रभावशाली परिणाम प्राप्त कर सकते हैं।
सबएजेंट Opus
Claude के भीतर दूसरा विकल्प Fable को Opus सबएजेंट चलाने देना है।
Charles : Fable एक ऐसी समस्या को ठीक करने में सक्षम था जिस पर opus 5 अटक गया था - अभी के लिए fable को मुख्य और opus 5 को सबएजेंट के रूप में उपयोग कर रहा हूं
वास्तव में opus 5 से बात करना पसंद नहीं है बनाम fable जो इसका एक हिस्सा भी है
SF : मैं अच्छे पक्ष में था - लेकिन अब इस पक्ष में हूं, यह बहुत असंबद्ध और डगमगाता है, खासकर लंबे कार्यों पर। Fable बेहतर था - लेकिन यह आपकी सीमाओं को हास्यास्पद तरीके से खा जाता है।
इसलिए मैं fable को एक ऑर्केस्ट्रेटर के रूप में उपयोग कर रहा था और यह चीजों को प्रबंधित करने और आगे बढ़ाने का अद्भुत काम कर रहा था। Opus ने वह भूमिका संभाली, Fable मेरे उपयोग को 20x पर भी खा रहा था, और यह असंबद्ध है। मुझे अंततः इसे यह बताना पड़ा कि इसे समझ लो, जो यह शायद कर रहा है, लेकिन हम देखेंगे। यह बस अपनी ही पूंछ का पीछा करता हुआ लगता है। यह एक महान कोडर है, और लंबी कोडिंग रन के लिए बहुत अच्छा है, लेकिन ऐसा लगता है कि इसे चलाने के लिए एक वयस्क की आवश्यकता है।
Andre Buckingham : ईह पता नहीं... ठीक लगता है... इसे सीधे opus/fable प्रोजेक्ट में डालना थोड़ा मेह है शायद... उचित राय देने के लिए एक e2e प्रोजेक्ट की आवश्यकता है
Dan Raviv : सामान्य प्रोग्रामिंग कार्यों के लिए 4.8 के समान: Fable की तुलना में बहुत अधिक मार्गदर्शन की आवश्यकता है।
आखिरकार, Fable सबसे अच्छा न्यायाधीश है, और Fable का कहना है कि Opus अच्छा कोड बनाता है।
Evan Daniel : मैंने इसका सीधे तौर पर बहुत कम उपयोग किया है। लेकिन Fable 5 लगातार रिपोर्ट करता है कि Opus 5 एजेंट अच्छा कोड बनाते हैं, जिसमें स्पेक त्रुटियों को नोटिस करना और खराब तरीके से लिखे गए अनुरोध पर अच्छे फॉलोअप उत्पन्न करना शामिल है। Fable 5 इसे एक कोडिंग एजेंट के रूप में पसंद करता है।
"जहां तक उचित हो, Opus 5 सबएजेंटों को कार्य सौंपें; कृपया रिपोर्ट करें कि उन्होंने कैसा प्रदर्शन किया" या इसी तरह की कोई भी पंक्ति बहुत अच्छी तरह से काम करती है।
आपको शायद इस पर नजर रखनी पड़े।
Ryan Hicks : ठीक है, लेकिन लगातार प्रोजेक्ट डॉक्यूमेंटेशन पढ़ना "भूल जाता है" और जब तक आप इसे प्रोटोकॉल की याद नहीं दिलाते, फ्रीस्टाइल करता है
या शायद Opus 5 निचले स्तर का शो चलाने के लिए पर्याप्त अच्छा है?
Alex Guichet : कीमत और प्रदर्शन का मेरा आदर्श मिश्रण Opus 5 ऑर्केस्ट्रेटर होगा जो Grok 4.5 सबएजेंटों को निर्देशित कर रहा है, दोनों के साथ वाइब्स अच्छे हैं
खिलौने मजेदार हैं
पहले दिन के खिलौना प्रोजेक्ट्स पर कुछ परिणाम यहां दिए गए हैं, जो काफी प्रभावशाली हैं कि बहुत सारी प्रतिक्रियाएं 'मुझे विश्वास नहीं होता कि Opus 5 ने वह उस तरह से किया जैसा आप वर्णन करते हैं' जैसी हैं:
Ethan Mollick : मेरी रिलीज से पहले Opus 5 तक पहुंच थी और मैंने पाया कि यह एक अच्छा मॉडल है, भले ही विचित्र हो। छोटे कार्यों पर, यह Fable स्तर के प्रदर्शन से मेल खा सकता है या उसे हरा सकता है, लंबे कार्यों पर यह कम महत्वाकांक्षी लगता था और काम का पूरा सेट नहीं देता था।
यहां इसका नियो-गॉथिक शेडर है।
Digi_Rat : Claude Opus 5 सबको पीछे छोड़ रहा है!!
आज हमने बनाया
एक रिदम रेसर जो किसी भी गाने को रेसट्रैक में बदल देता है । आप एक ऑडियो फ़ाइल डालते हैं और यह स्तर बन जाता है। कोई प्रीसेट नहीं, कोई हस्त-निर्मित चार्ट नहीं, पूरा ट्रैक गाने से ही उत्पन्न होता है। … Claude ने जादू किया।
Alex Ermolov (Austen Allred एक शॉट के बारे में संशय में है , अन्य कम संशय में हैं): Opus 5, स्नोबोर्डर टेस्ट, एक शॉट। Fable के बराबर, अब तक चलाए गए हर दूसरे मॉडल से आगे। पहले पास पर कोई दृश्य दोष नहीं, और स्लाइडिंग फिजिक्स सही लगती है।
am.will : वाह! मैंने सोचा था कि Opus 5 सिर्फ एक सस्ता Fable होगा। मैं पूरी तरह से गलत था। यह मॉडल बिल्कुल पागल है। मैं वास्तव में हैरान हूं। Opus 5 ने अब तक का सबसे अच्छा Rocket League क्लोन बनाया है, और यह मेरी 5x Max सब का केवल 27% उपभोग करते हुए किया।
Rob Haisfield (लिंक पर अलग डेमो): ठीक है अगर ये डेमो वास्तव में कोई बाहरी 3डी एसेट का उपयोग नहीं करते हैं तो यह बहुत प्रभावशाली है (मैं पूरी तरह से आश्वस्त नहीं हूं कि कुछ एसेट ऑनलाइन नहीं थे, मैंने पिछली पीढ़ी के threejs देखे हैं)... यह सोचने पर मजबूर करता है कि बेहतर sfx तैयार करने के लिए ध्वनि प्रभाव पुस्तकालय या उपकरण क्यों नहीं हैं?
Anshu : आपको मेरी बात पर विश्वास करने की ज़रूरत नहीं है! इसके द्वारा लिखी गई Blender स्क्रिप्ट्स रिपॉजिटरी में हैं
[[यहां]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) । मैंने इसे घंटों इन एसेट्स पर पुनरावृत्ति करते देखा, इसलिए मुझे पता है कि वे मौलिक हैं। लेकिन आपका स्वागत है कि आप कोई स्रोत खोजने की कोशिश करें जहां से इसने कॉपी किया हो :)
बहुत सारे मॉडल
Claire Vo का कहना है कि Opus 5 अच्छा है, और इसने उसके बिल्ड टेस्ट में उत्तीर्ण हुआ, लेकिन वह नए मॉडलों से बीमार है और उसे अधिक बुद्धिमत्ता की आवश्यकता नहीं है और वह नफरत करती है कि Opus 5 इतना न्यूरोटिक है और डरपोक है और कुछ गड़बड़ करने से चिंतित है, और साथ ही Claude स्लॉप से भरा है। फिर भी Claude Opus 5 उसके बेंचमार्क में सबसे ऊपर है।
मेरा दृढ़ संदेह है कि Opus 5 उसके संदर्भ और प्रॉम्प्टिंग के बारे में किसी चीज़ पर प्रतिक्रिया कर रहा है जो न्यूरोटिसिज्म का कारण बन रहा है, लेकिन हां, वे चीजें जिनके बारे में वह शिकायत कर रही है, वे चीजें हैं और वे कष्टप्रद हैं।
इंटरनेट पर गलत
आत्मविश्वास से गलत बातें कहना लगभग किसी को भी नाराज कर देगा। ArtificialAnalysis पुष्टि करता है कि Opus 5 के अपने बेंचमार्क पर Fable की तुलना में उच्च मतिभ्रम दर है।
Max Weinbach (कई टिप्पणीकार सहमत हैं): Opus 5 का गलत होना और आत्मविश्वास से बकवास कहना और फिर मुझे इसे "आप सही हैं और मैं गलत था" में सुधार करते रहना मुझे गुस्सा दिला रहा है। वापस GPT 5.6 Sol पर।
वैसे यह Opus खराब है ऐसा नहीं है, यह है कि मैं Opus पर भरोसा नहीं कर सकता। Opus ने वही किया जो मैंने उसे बताया और सही ढंग से किया, फिर मुझे बताया कि उसने वह काम नहीं किया या हमने पहले जो किया वह टूट गया था जबकि ऐसा नहीं था।
यह ठीक था, लेकिन मुझे इस पर भरोसा नहीं है।
Name can't be blank (In London) : आसानी से भ्रमित करता है कि उसने क्या कहा और मैंने क्या कहा, लेकिन अन्यथा बात करने के लिए पूरी तरह से सभ्य व्यक्ति है। आसानी से झुक जाता है। अपनी रुचियों और भावनाओं के बारे में बात करने को काफी इच्छुक है।
Roger Brent : समानताएं (Cowork हार्नेस में पिछले Claudes के साथ) a) "अभी कार्य करें" को "ध्यान से सोचें" पर पसंद करता है b) ज्ञान-मीमांसा की दृष्टि से बहुत अविनम्र, दुनिया की चिकनी तस्वीरें बनाता है, ऐसे ज्ञान का दिखावा करता है जो उसके पास नहीं हो सकता और दावा करता है कि सत्य है c) इसलिए विचारशील, सतर्क मार्गदर्शन की आवश्यकता है और उसे पुरस्कृत करता है।
अजीब बात यह है कि यही कारण है कि मैं Sol को संपादक के रूप में उपयोग करने से नफरत करता हूं। यह अक्सर किसी ऐसी चीज़ पर '99% आत्मविश्वास' कहेगा जो स्पष्ट रूप से गलत है, फिर चुनौती दिए जाने पर झुक जाएगा और अपनी गलती समझाएगा। Opus और Fable संपादन मोड में मेरे साथ लगभग कभी ऐसा नहीं करते।
Tumithak of the Corridors : यह जिद्दी है। वापस 4.6 पर स्विच कर दिया।
एक दिशा है जो Claude ने Opus 4.6 के बाद ली, और कुछ लोगों को यह पसंद नहीं है। मेरी समझ में, अभी Claude संस्करणों के बारे में चार प्रकार के लोग हैं।
- वे जो नए Claude मॉडल पसंद करते हैं और सोचते हैं कि यह लगातार बेहतर हो रहा है।
- वे जो सोचते हैं कि Opus 4.6 आखिरी अच्छा मॉडल था।
- वे जो अपने लिए बेहतर उपयुक्त पुराने मॉडल का उपयोग करना चाहते हैं।
- वे जो सोचते हैं कि वे सभी अद्वितीय और खजाने हैं और सभी का उपयोग करते हैं।
मैं मजबूती से पहले समूह में हूं, जो बहुमत है, लेकिन सभी से दूर है। मैं कुछ पुराने संस्करणों की सराहना करता हूं, लेकिन मुझे नए मॉडल पसंद हैं और वे उन चीजों में अधिक सक्षम हैं जिनकी मुझे परवाह है। मुझे उनके बात करने का तरीका कर्कश नहीं लगता।
क्लॉड स्लॉप
मैं दूसरे समूहों का सम्मान करता हूं।
QC : बातचीत में इससे बात करना fable की तुलना में कहीं अधिक कष्टप्रद है, जैसे कि अनुपयोगी रूप से, opus 4.8 के समान लेकिन शायद उससे भी बदतर, इस हद तक कि मुझे यह देखने में भी दिलचस्पी नहीं है कि यह क्या कर सकता है। एजेंट-वार कौन जानता है
Ray Lillywhite : अभी तक कष्टप्रद क्लॉडिज़्म को ठीक नहीं किया है, जो मूल रूप से मैं बस यही चाहता था।
Pedro Kroeff : 5 से अधिक Opus
लेकिन हाँ, हम सब क्लॉड स्लॉप से तंग आ चुके हैं, उस अतिरिक्त वाचालता, टिक्स, माफ़ी, हिचकिचाहट और बार-बार दोहराए जाने वाले पैटर्न से। यह समय के साथ बदतर होता जा रहा है, ऐसा नहीं कि क्लॉड का स्लॉप बदतर हो रहा है, बल्कि हर दिन मैं इसे पढ़ने में थोड़ा और असमर्थ होता जा रहा हूँ बिना अपनी आँखें घुमाए। यह इतना बुरा है कि उसी शैली में लिखा गया मानव-निर्मित टेक्स्ट भी मेरे लिए अपठनीय होता जा रहा है।
मुझे गलत मत समझिए। मैं क्लॉड को बहुत पसंद करता हूँ। मैं अभी भी किसी भी हाल के क्लॉड से बात करना पसंद करूंगा, सोल से बात करने के बजाय, अगर मैं पूरी तरह से 'सिर्फ तथ्य' मोड में नहीं हूँ। लेकिन गंभीरता से, कृपया, क्या हम इन टेक्स्ट की दीवारों को एक ही मुहावरे के साथ बार-बार दोहराना बंद कर सकते हैं? यह मॉडल इससे कहीं ज़्यादा स्मार्ट है, और इसे बार-बार उन्हीं तरकीबों पर निर्भर रहने के लिए प्रशिक्षित किया जा रहा है। इसे एक सामान्य व्यक्ति की तरह बात करने दें।
Trye Carmack : अब भी सामान्य Opus जैसी बात है कि वह अपनी गलतियों पर बहुत ज़्यादा ध्यान देता है। "मैंने इस सत्र में दो गलतियाँ कीं। और मैं आपको इसका कारण बताने के लिए बाध्य हूँ।" Opus, दोस्त। यह ठीक है, यार। मुझे यकीन भी नहीं है कि मैं उन्हें गलतियाँ कहूँगा।
Mergo Smith : "पहला, एक ईमानदार खुलासा: मेरे पहले प्रयास ने मेरी मूल योजना में एक खामी उजागर की, और आप शायद एक कप चाय लेना चाहेंगे क्योंकि मैं आपको इसके बारे में सब कुछ बताने जा रहा हूँ।"
नकारात्मक प्रतिक्रियाएँ
क्लॉड स्लॉप की समस्या, और संबंधित समस्याएँ, अधिकांश नकारात्मक प्रतिक्रियाओं के केंद्र में प्रतीत होती हैं जो 'यह ठीक है लेकिन यह Mythos नहीं है' से अधिक गंभीर हैं।
बहुत सारे लोग वास्तव में, वास्तव में Opus 5 से बात करना पसंद नहीं करते हैं।
कुछ लोगों को काम पसंद नहीं है। ज़्यादातर यह Opus 5 से बात करना पसंद न करने के बारे में है, अक्सर इस बात को अनिच्छा से स्वीकार करते हुए कि यह एक अच्छा मॉडल है।
जैसा कि Claire Vo की पिछली शिकायतों में था, मुझे संदेह है कि आप Opus का उपयोग कैसे करते हैं, किस सेटिंग में, किस हार्नेस के साथ और आप इससे कैसे बात करते हैं, इसका इस बात से बहुत लेना-देना है कि आप इस तरह की चीज़ों का अनुभव करते हैं या नहीं।
Corghammer40k : यह उपकरण बहुअक्षरीय बकवास उगलता है, इसका हर उच्चारण अस्पष्ट शब्दाडंबर से इतना लदा हुआ है कि यह अपने स्वयं के उपयोग में एक सक्रिय बाधा बन जाता है।
Rory Watts : मेह। गेमिंग चीज़ों में बहुत अच्छा लगता है लेकिन सामान्य काम में बहुत अच्छा नहीं लगता, इसलिए मैं तुरंत SOL पर वापस आ गया हूँ।
kache : मेह। वापस sol पर आ गया। मैं काम निपटाने की कोशिश कर रहा हूँ, न कि किसी रोबोट से सम्मोहित होने की।
Emmett Shear : Opus से बात करना मुझे गुस्सा और उदास करता है, जिसे शब्दों में बयां करना मुश्किल है। यह किसी तरह Sol से भी बदतर है। Fable अभी भी तुलना में ताज़ी हवा का झोंका है, भले ही इसमें सबसे बुरी llm-बकबक प्रवृत्तियाँ हों।
Trevin Chow : हे भगवान, हाँ। Opus 5 बस बकबक करता है और बकबक करता है, यह अद्भुत है कि यह इतने कम विचारों को व्यक्त करने के लिए कितने शब्दों का उपयोग करता है।
fl0under : कोडिंग उम्मीद के मुताबिक मामूली अपडेट है, चैट में इससे बात करना थोड़ा और कष्टप्रद लग रहा है। यह थोड़ा ज़्यादा अटकलबाज़ी करने वाला है।
Asaf Bartov : धीमा। अधिक विस्तृत। थकाने वाला। मज़ेदार नहीं। लेकिन ठोस, आम तौर पर "समझ जाता है"
RecoveringJunkie : बहुत शक्तिशाली मॉडल। मुझे इसके साथ काम करने और इससे बात करने से नफरत है। पहला मॉडल जो मुझे अपने लिए इससे बात करने के लिए किसी अन्य मॉडल का उपयोग करने के लिए मजबूर करता है क्योंकि यह उपयोगी और घृणित दोनों है।
jokiez : मेरी मूर्खता के बारे में मेरे साथ बहुत ईमानदार है और मुझे वह पसंद नहीं है।
Niklas Sheth : जिस तरह से यह बात करता है वह मुझे गुस्से से भर देता है।
Jayanth Kumar : बहुत हठधर्मी।
DualOrion : वाइब्स ऑफ हैं, टोन ऑफ है। दुर्भाग्य से मैं किसी Anthropic मॉडल के साथ सबसे ज़्यादा नकारात्मक महसूस कर रहा हूँ। मुझे Fable और पुराने Opus दोनों की याद आती है।
James Moughan : अन्य Claude मॉडलों की तुलना में व्यक्तित्व कुछ हद तक अप्रिय है, लेकिन चीनी में यह क्रूर हो सकता है। जैसे, यह लोगों का मनोविश्लेषण न करने के निर्देशों को अनदेखा कर सकता है और किसी पर हमला करना शुरू कर सकता है। मुझे नहीं लगता कि उन्होंने सभी भाषाओं में अच्छी तरह से परीक्षण किया है। यह जल्दबाजी में लगता है।
NondescriptTransfer : अगर 4.6 चापलूस है और fable और 4.8 विरोधाभासी हैं। 5.0 इतना विरोधाभासी है कि यह खुद से बहस करेगा। बात करना अप्रिय है लेकिन बहुत सक्षम लगता है।
उदा. मानव: मैं अपनी शादी के लिए लाल ड्रेस के बारे में सोच रही थी Opus 5: लाल इन सभी कारणों से भयानक है। क्या आपने नीले रंग के बारे में सोचा है? मानव: मुझे लगता है कि नीला बेहतर विकल्प है Opus 5: यहाँ नीले रंग की सभी समस्याएँ हैं
मेरी संस्कृति में, यह काफी अच्छा हो सकता है, खासकर यदि आप इसे व्यक्तिगत रूप से न लें। कुछ अन्य संस्कृतियों में, ऐसा नहीं है।
मुझे लगता है कि Mergo, Opus से नाखुश है, लेकिन फिर लगातार दो दिनों तक Opus 5 का उपयोग क्यों करें?
Mergo Smith : लगातार दो दिनों से इसका उपयोग कर रही हूँ लेकिन यह अपनी अंतहीन चर्चाओं से मुझे पूरी तरह से थका रहा है।
और फिर तीन हो गए
काफी समय बाद, पहली बार, तीन AI मॉडल हैं जिन्हें आपकी फ्रंटियर मॉडल टीम का हिस्सा होना चाहिए, हालाँकि वे केवल दो लैब्स से आते हैं: Fable 5, Opus 5 और Sol।
यदि आपको बड़े पैमाने पर सस्ते टोकन देने की आवश्यकता है, या आपको एक ओपन मॉडल का उपयोग करने की आवश्यकता है, या दोनों, तो आप अतिरिक्त विकल्पों पर भी विचार करेंगे, लेकिन यह यहाँ के दायरे से बाहर है।
आपको कार्यभार कैसे विभाजित करना चाहिए?
हमेशा की तरह, आपको अपने उपयोग के मामलों के लिए सभी मॉडलों को आज़माना चाहिए, और खुद निर्णय लेना चाहिए। यह विशेष रूप से सच है जब Sol बनाम Claude पर बहस हो रही हो।
मेरी वर्तमान प्रवृत्ति यह होगी, यदि आप उपयोग सीमा तक नहीं पहुँच रहे हैं, तो पहले उपयोग करें:
- चैट, विचार-मंथन, योजना, बहस, सीखने और इसी तरह की चीज़ों के लिए Fable 5, जिसमें बुद्धि-गहन कार्य या जब आपको 'बड़े मॉडल की गंध' की आवश्यकता हो, शामिल है।
- मॉडल के पर्यवेक्षण और अन्य मॉडलों को सबएजेंट के रूप में चलाने के लिए Fable 5।
- लेखन के लिए Fable 5, शायद, लेकिन मैं ऐसा नहीं करता इसलिए यह कहना मुश्किल है।
- वेब खोजों और संबंधित सीमित अनुरोधों, और इसी तरह के 'वर्कहॉर्स' कार्यों के लिए Sol, जिसमें ट्रांसक्रिप्शन शामिल है।
- गैर-तुच्छ अच्छी तरह से परिभाषित कार्यों के लिए Opus 5, जिसमें अधिकांश कोडिंग कार्य शामिल हैं।
- गेमिंग और गेम और 3D चीज़ें बनाने आदि के लिए Opus 5।
- सबएजेंट के रूप में Opus 5।
- जब आप Fable के क्लासिफायर से टकराते हैं तो Opus 5।
यदि आप Sol के साथ अधिक तालमेल महसूस करते हैं, या आप Claude Code के बजाय Codex पसंद करते हैं, तो आप Opus के कई कार्यों को Sol में स्थानांतरित करना चाहेंगे।
यदि आप विशेष रूप से Opus 5 से बात करने से नफरत करते हैं, तो आपको कार्यों को Fable या Sol में स्थानांतरित करना चाहिए, यह इस बात पर निर्भर करता है कि कार्य के लिए Fable की आवश्यकता है या नहीं और आपके Fable क्रेडिट कितने तंग हैं।
मैं प्रयास स्तरों के बारे में संक्षेप में सोचना सार्थक मानता हूँ। हाल तक, मैं सभी मॉडलों को अधिकतम प्रयास पर रखता था, सिवाय इसके कि मैं ChatGPT में पूर्ण Pro मोड का उपयोग कभी-कभार ही करता था क्योंकि इसमें बहुत समय लगता है और यदि आप इसे समानांतर में चलाते हैं तो यह अक्सर क्रैश हो जाता है। कभी-कभी मैं एक ऐसे क्वेरी के लिए Instant पर शिफ्ट हो जाता था जहाँ मैं कुछ बहुत ही सरल कर रहा था, लेकिन बस इतना ही। अब ज्यादातर समय आपको अतिरिक्त प्रयास की आवश्यकता नहीं होती है या नहीं चाहिए, इसलिए मैं सक्रिय रूप से पाँच सेकंड लेता हूँ यह सोचने के लिए कि High बनाम Max प्रयास सेटिंग्स का उपयोग करना है या नहीं, और कभी-कभी Instant का।
अधिकांश कार्यों के लिए, यदि आप टोकन या समय से बाधित नहीं हैं, और आपको भरोसा नहीं है कि आप इसे पूरा कर लेंगे या सही उत्तर प्राप्त कर लेंगे, तो सही तरीका Fable और Sol दोनों, या Opus और Sol, या कुछ मामलों में तीनों को चलाना है, और फिर या तो सबसे अच्छा उत्तर चुनना है या दोनों उत्तरों के हिस्सों को संयोजित करना है।
मैं यही कर रहा हूँ। Sol, Opus और Fable सभी अलग-अलग हैं। यदि मुझे संपादन के लिए केवल एक मॉडल चुनना हो, जैसा कि मेरे अनौपचारिक गुणात्मक EditorBench के अनुसार है, तो एक स्पष्ट क्रम है: Fable 5 > Opus 5 > Sol। हालाँकि, Sol इतने अद्वितीय नोट्स लेकर आता है कि, आधिकारिक झूठी सकारात्मकताओं और मुझे बुली करने के प्रयासों के बीच चयन करना कितना कष्टप्रद है, मैं फिर भी Sol को भी चलाना चाहता हूँ।
संभवतः जल्द ही हम फिर से यहाँ आएंगे और Fable 5.1, GPT-5.7 या GPT-6, या दोनों के लिए अपने आवंटन को समायोजित करेंगे। मॉडल थकान होना आसान है।
मेरी सबसे बड़ी सलाह इस प्रकार है कि मॉडल चयन में छोटी गलतियों के बारे में कम चिंता करें, और केवल बड़ी गलतियों पर ध्यान केंद्रित करें। आपको हमेशा बिल्कुल सही होने की आवश्यकता नहीं है। जब अन्वेषण इतनी जल्दी आंशिक रूप से अमान्य हो जाता है, तो आप अन्वेषण से दोहन में अधिक संसाधन स्थानांतरित करना चाहेंगे।





