YouMind
साइन इन करें

Opus 4.8: वही कीमत, दोगुना काम

@shmidtqq
अंग्रेज़ी30 मई 2026
1.2M
215
18
33
516

TL;DR

Anthropic का Opus 4.8 महत्वपूर्ण ऑपरेशनल अपग्रेड लेकर आया है, जिसमें एफर्ट कंट्रोल और डायनेमिक वर्कफ़्लो शामिल हैं। हालाँकि बेंचमार्क में मामूली सुधार दिखते हैं, लेकिन इसका असली मूल्य जटिल कोडिंग कार्यों के लिए टोकन उपयोग और गति को अनुकूलित करने में है।

समान मूल्य। अधिकांश लोग सिर्फ मॉडल बदल देंगे और बाकी सब कुछ मिस कर देंगे।

shmidt - inline image

Opus 4.8 के साथ, Anthropic ने तीन चीजें भेजी हैं जो बेंचमार्क नंबरों से ज्यादा आपके Claude Code में काम करने के तरीके को बदलती हैं: प्रयास नियंत्रण, गतिशील वर्कफ़्लो, और सस्ता फ़ास्ट मोड। जो लोग इन्हें सही तरीके से कॉन्फ़िगर करते हैं, उन्हें बेहतर परिणाम मिलते हैं और वे कम खर्च करते हैं। यहाँ विस्तृत जानकारी है।

सबसे महत्वपूर्ण एक नंबर

कोडिंग पर 69.2% नहीं। यह है कि 4.8 में अपने द्वारा लिखे गए कोड में खामियों को फिसलने देने की संभावना लगभग 4 गुना कम है।

पुराने मॉडल कमजोर सबूतों के साथ आत्मविश्वास से "हो गया, बग ठीक कर दिया" कहना पसंद करते थे। Anthropic ने ईमानदारी पर जोर दिया: 4.8 अधिक बार धीमा होता है और जहाँ उसे यकीन नहीं होता, वहाँ इसे फ़्लैग करता है, बजाय इसके कि प्रशंसनीय कोड जनरेट करे जो चुपचाप एज केस को तोड़ दे। एक लंबे सत्र में यह बढ़ता जाता है। एक मॉडल जो टर्न 15 पर अनिश्चितता स्वीकार करता है, वह आपको टर्न 40 पर कुछ घंटे डीबगिंग से बचाता है।

क्या बदला: संक्षिप्त संस्करण

कोडिंग।

SWE-bench Verified: 87.6% → 88.6% (सीमा के करीब)।

SWE-bench Pro (कठिन, कम दूषित): 64.3% → 69.2%, GPT-5.5 से 10+ अंक आगे।

यह मुख्य कोडिंग नंबर है।

टर्मिनल।

Terminal-Bench 2.1: 66.1% → 74.6% (+8.5), लेकिन GPT-5.5 अभी भी आगे है (78.2%)। सात में से एक बेंचमार्क जहाँ 4.8 हारता है।

ज्ञान कार्य।

GDPval-AA: GPT-5.5 के 1769 के मुकाबले 1890 Elo। पूरी तालिका में सबसे बड़ा अंतर।

कंप्यूटर उपयोग।

OSWorld-Verified: 83.4% (इस लाभ का एक हिस्सा अपडेटेड हार्नेस के कारण है, जिसे Anthropic ने खुले तौर पर फ़्लैग किया है)।

विज्ञान।

GPQA Diamond: 93.6%, मूलतः स्थिर (दोनों मॉडल 93% से ऊपर हैं, यह संतृप्ति है, प्रतिगमन नहीं)।

shmidt - inline image

Anthropic स्वयं इस रिलीज़ को "एक मामूली लेकिन ठोस सुधार" कहता है। बेंचमार्क एक प्लस हैं। नीचे दिए गए परिचालन परिवर्तन ही असली कहानी हैं।

फीचर 1. प्रयास नियंत्रण (सबसे कम आंका गया)

Opus 4.8 डिफ़ॉल्ट रूप से उच्च प्रयास पर काम करता है। लेकिन अब आप तय करते हैं कि यह किसी कार्य में कितनी सोच लगाए। इसे तर्क के लिए मैनुअल ट्रांसमिशन समझें।

claude.ai और Cowork में स्लाइडर मॉडल चयनकर्ता के बगल में होता है, जिसमें पाँच स्तर होते हैं: निम्न, मध्यम, उच्च (डिफ़ॉल्ट), अतिरिक्त, अधिकतम, साथ ही एक अलग थिंकिंग टॉगल। Claude Code में यह थोड़े अलग नामों के साथ समान स्तर हैं, और एक ऑटो मोड है:

नोट: claude.ai में "अतिरिक्त" और Claude Code में xhigh एक ही स्तर हैं, बस अलग-अलग सतहों पर अलग-अलग लेबल।

shmidt - inline image

पैसे वाला हिस्सा, ताकि कोई भ्रम न हो। प्रयास स्तर के अनुसार कोई अलग अधिभार नहीं है। दर हर स्तर पर समान है: $5 प्रति 1M इनपुट टोकन, $25 प्रति 1M आउटपुट। अंतर प्रति-टोकन मूल्य का नहीं है, यह है कि मॉडल कितने टोकन खर्च करता है। निम्न संक्षेप में उत्तर देता है और कम सोचता है, अधिकतम लंबा सोचता है और कई गुना अधिक टोकन जलाता है। इसलिए अधिकतम दर के कारण नहीं, बल्कि वॉल्यूम के कारण "महंगा" है।

एक ही कार्य पर सापेक्ष खर्च के लिए एक मोटा गाइड (अंतर्ज्ञान के लिए उदाहरणात्मक संख्याएँ):

एक पैसे का उदाहरण। मान लें कि एक उच्च उत्तर की लागत ~$0.05 है। निम्न पर वही अनुरोध ~$0.005 चलता है, और अधिकतम पर यह आसानी से ~$0.20-0.40 तक पहुँच सकता है। यदि आपके 60% प्रॉम्प्ट छोटे हैं ("यह फ़ंक्शन क्या लौटाता है?"), तो उन्हें उच्च से निम्न पर ले जाने से दैनिक खर्च कई गुना कम हो जाता है, जहाँ इसकी आवश्यकता है, वहाँ गुणवत्ता पर कोई प्रभाव नहीं पड़ता।

यह बिल को सबसे ज्यादा क्यों प्रभावित करता है। अधिकांश लोग सब कुछ उच्च पर छोड़ देंगे (या "सुरक्षित रहने के लिए" इसे अधिकतम पर बढ़ा देंगे) और कभी स्लाइडर को नहीं छूएंगे। जो लोग प्रति कार्य प्रयास को रूट करते हैं, उन्हें काफी कम खर्च पर समान परिणाम मिलते हैं। यह रिलीज़ की सबसे कम आंकी गई विशेषता है।

फीचर 2. फ़ास्ट मोड (3x सस्ता)

फ़ास्ट मोड Opus को समान गुणवत्ता के साथ 2.5x गति से चलाता है, और यह अब पहले की तुलना में 3x सस्ता है।

इसे Claude Code में /fast से टॉगल करें (एक सक्रिय सत्र ↯ आइकन से चिह्नित होता है)। API एक्सेस फिलहाल गेटेड है (claude.com/fast-mode पर वेटलिस्ट)।

फ़ास्ट मोड का उपयोग करें: बड़े मल्टी-फ़ाइल रीफ़ैक्टर, स्पेक्स से कोड जनरेशन, दस्तावेज़ीकरण, टेस्ट जनरेशन। जहाँ भी गति गहराई से बेहतर हो। स्टैंडर्ड में रहें: जटिल डीबगिंग, आर्किटेक्चर निर्णय, सुरक्षा समीक्षा। जहाँ भी सोच की गुणवत्ता गति से बेहतर हो।

फीचर 3. गतिशील वर्कफ़्लो (बड़ा वाला)

Claude Code अब आपके कार्य के लिए एक JavaScript ऑर्केस्ट्रेशन स्क्रिप्ट लिखता है और इसे बैकग्राउंड में चलाता है जबकि आपका सत्र प्रतिक्रियाशील रहता है। योजना कोड में रहती है, मॉडल के कॉन्टेक्स्ट में नहीं, इसलिए केवल अंतिम उत्तर आपके सत्र में वापस आता है।

आधिकारिक दस्तावेज़ों से जानने योग्य बातें:

  • एक साथ अधिकतम 16 सबएजेंट, प्रति रन कुल 1,000 की कठोर सीमा।
  • फिर से शुरू करने योग्य: यदि आपका लैपटॉप खत्म हो जाता है या आप टर्मिनल बंद कर देते हैं, तो रन वहीं से शुरू होता है जहाँ रुका था।
  • Claude Code v2.1.154+ की आवश्यकता है। रिसर्च प्रीव्यू।
  • Max, Team, Enterprise पर डिफ़ॉल्ट रूप से चालू। Pro पर, इसे /config में चालू करें (और पहले Opus 4.8 पर स्विच करें)।
  • सबएजेंट acceptEdits मोड में चलते हैं और आपकी टूल अनुमति सूची प्राप्त करते हैं।

इसे /effort ultracode (एक Claude Code सेटिंग: xhigh प्लस स्वचालित वर्कफ़्लो ऑर्केस्ट्रेशन) से ट्रिगर करें, या बस एक बड़े कार्य को शब्दों में वर्णित करें:

shmidt - inline image

इसके लिए अच्छा: 200+ फ़ाइलों में माइग्रेशन, पूर्ण-कोडबेस सुरक्षा ऑडिट, प्रोजेक्ट-वाइड टेस्ट जनरेशन, बड़े रीफ़ैक्टर, कई रिपॉजिटरी में शोध। इसके लिए अच्छा नहीं: सरल बग फिक्स, सिंगल-फ़ाइल एडिट, त्वरित प्रश्न। ओवरकिल।

लागत पर। वर्कफ़्लो सामान्य सत्र की तुलना में काफी अधिक टोकन की खपत करते हैं। खर्च को नियंत्रण में रखने का आधिकारिक तरीका कार्य का दायरा निर्धारित करना है: पहले एक फ़ोल्डर पर ऑडिट चलाएँ, देखें कि यह कितने सबएजेंट उत्पन्न करता है, फिर वहाँ से बड़े रन को कैलिब्रेट करें।

वर्कफ़्लो को पूरी तरह से अक्षम करने के लिए:

उदाहरण Claude Code कॉन्फ़िग (स्टार्टर टेम्पलेट)

पर्यावरण चर (~/.zshrc या ~/.bashrc में):

फिर उपयोगी भाग आता है: सुरक्षित अनुमतियों वाला एक settings.json। यह मॉडल को कोड पढ़ने और संपादित करने, टेस्ट चलाने और कमिट करने देता है, लेकिन खतरनाक चीजों को हार्ड-ब्लॉक करता है: .env और SSH कुंजियाँ पढ़ना, rm -rf, sudo, और git push। एजेंट स्वतंत्र रूप से काम करता है लेकिन कुछ भी नहीं तोड़ सकता या लीक नहीं कर सकता।

shmidt - inline image

तैयार-टू-पेस्ट settings.json फ़ाइल मेरे Telegram चैनल में है (फ़ॉर्मेट यहाँ साफ़ पढ़ने के लिए बहुत बड़ा है): t.me/+JmDeelv5UCwwMTcy

shmidt - inline image

दैनिक कमांड चीट शीट

Opus 4.8 इंस्टॉल करने के तीन तरीके

A. ब्राउज़र या ऐप। claude.ai पर, मॉडल सूची में Claude Opus 4.8 चुनें और प्रयास स्लाइडर सेट करें। कोई इंस्टॉल आवश्यक नहीं।

B. API। मॉडल ID claude-opus-4-8। मूल्य $5/$25 प्रति 1M। कॉन्टेक्स्ट 1M तक (Microsoft Foundry पर 200k), आउटपुट 128k तक। फिक्स्ड-बजट एक्सटेंडेड थिंकिंग समर्थित नहीं है: एडेप्टिव थिंकिंग (thinking: {type: "adaptive"}) और effort पैरामीटर का उपयोग करें।

C. Claude Code (टर्मिनल)। मूल इंस्टॉलर अब अनुशंसित विधि है (npm लीगेसी है):

फिर claude चलाएँ, ब्राउज़र के माध्यम से साइन इन करें, और /model से Opus 4.8 चुनें।

माइग्रेशन चेकलिस्ट: 4.7 से 4.8

  • मॉडल ID को claude-opus-4-8 में बदलें
  • अपने 10-20 वास्तविक कार्यों को समान प्रॉम्प्ट के साथ 4.7 और 4.8 पर चलाएँ
  • तुलना करें: पूर्णता दर, चरण संख्या, टोकन, टेस्ट पास दर
  • 4.7 के व्यवहार के लिए ट्यून किए गए प्रॉम्प्ट की जाँच करें
  • प्रति कार्य प्रकार प्रयास स्तर निर्दिष्ट करें
  • जहाँ गति मायने रखती है, वहाँ फ़ास्ट मोड का परीक्षण करें
  • Claude Code को v2.1.154+ (वर्कफ़्लो के लिए) अपडेट करें
  • पहले सप्ताह के बाद API बिल की पुनः जाँच करें

सेव कार्ड: सब कुछ एक जगह

मॉडल: claude-opus-4-8 · शिप किया गया 2026-05-28

मूल्य: $5 / $25 प्रति 1M · फ़ास्ट मोड $10 / $50

कॉन्टेक्स्ट: 1M तक · आउटपुट 128k तक

मुख्य: SWE-bench Pro 64.3% → 69.2% (+10 GPT-5.5 से अधिक) · SWE-bench Verified 88.6% · 4x कम छूटे बग · GDPval-AA 1890 Elo

नया: प्रयास नियंत्रण · फ़ास्ट मोड 3x सस्ता · गतिशील वर्कफ़्लो (16 समवर्ती / 1,000 प्रति रन)

पढ़ने के लिए धन्यवाद। यदि आप इसमें से एक चीज़ लेते हैं, तो वह हो "प्रति कार्य प्रयास को रूट करें।"

Claude और वाइब कोडिंग पर मेरे बाकी नोट्स यहाँ रहते हैं: t.me/+JmDeelv5UCwwMTcy।

वहाँ मिलते हैं।

@shmidtqq.

एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें