Fable 5.1 को टोकन बर्बाद करने से रोकें

@dr_cintas
अंग्रेज़ी02 सित॰ 2026
180K
68
6
1
210

TL;DR

Alvaro Cintas ने Fable 5.1 के टोकन खपत को अनुकूलित करने के लिए एक वर्कफ़्लो साझा किया है, जो रीजनिंग एफर्ट लेवल, प्रॉम्प्ट हाइजीन और विशेष कंप्रेशन टूल्स पर केंद्रित है।

Fable 5.1 एक दमदार मॉडल है। और यह टोकन भी उतनी ही तेज़ी से जलाता है।

यहाँ बताया गया है कि कैसे चार कमांड्स और मुफ्त ओपन-सोर्स रिपॉजिटरीज़ की मदद से टोकन की बर्बादी को कम किया जा सकता है।

इससे आउटपुट की गुणवत्ता पर कोई असर नहीं पड़ता। यह सिर्फ बदलता है कि आप उसी परिणाम के लिए कितना भुगतान करते हैं।

और यह सब तब भी काम करता है जब आप Fable 5.1 पर नहीं हैं, क्योंकि टोकन की लागत चाहे जो भी मॉडल चलाएं, उसी तरह बढ़ती है।

अब शुरू करते हैं।

चरण 1: अपना प्रयास स्तर कम करें।

यह सबसे बड़ी ट्रिक है, और यह एक सेटिंग है जिसे आप हर अनुरोध पर नियंत्रित कर सकते हैं।

पाँच स्तर हैं: low, medium, high, xhigh, और max

प्रयास यह नियंत्रित करता है कि मॉडल उत्तर देने से पहले कितना तर्क करता है। उच्च प्रयास का मतलब है प्रतिक्रिया से पहले अधिक सोचना, जिसमें अधिक टोकन खर्च होते हैं, भले ही कार्य के लिए उस सोच की आवश्यकता हो या नहीं।

इसे समझने का तरीका यह है। प्रयास स्तर यह है कि आप किसी को जवाब देने से पहले कितनी देर सोचने देते हैं। किसी से पूछें कि 2+2 क्या होता है और वे कहेंगे "4"। उनसे पहले दस मिनट तक जोर से सोचने को कहें, और आप उसी "4" को पाने के लिए दस मिनट की सोच का भुगतान करते हैं।

खैर...अधिकांश कार्य 2+2 जैसे ही हैं।

Fable 5.1 के लिए Anthropic का मार्गदर्शन है: high से शुरू करें, जो डिफ़ॉल्ट है। केवल सबसे अधिक क्षमता-संवेदनशील कोडिंग और एजेंटिक कार्यों के लिए xhigh या max पर जाएं। नियमित या विलंबता-संवेदनशील कार्यों के लिए medium या low पर आएं, एक बार जब यह पुष्टि हो जाए कि निचला स्तर अभी भी गुणवत्ता बनाए रखता है।

Alvaro Cintas - inline image

आंकड़े चौंकाने वाले हैं। CursorBench पर, Fable 5.1 ने low प्रयास पर, high प्रयास पर Fable 5 से अधिक स्कोर किया, और लागत एक तिहाई थी।

इस पर भरोसा करने से पहले इसका परीक्षण करें। एक ऐसा कार्य चुनें जिसका सही उत्तर पहले से ज्ञात हो, फिर इसे low पर चलाएं।

"इस अनुरोध को low प्रयास पर चलाएं और मुझे बताएं कि प्रतिक्रिया में क्या बदला"

अपने वास्तविक कार्यों में से एक का उपयोग करें। यह मानने से पहले कि low प्रयास का मतलब खराब परिणाम है, सीधे आउटपुट की तुलना करें। भारी काम, बहु-चरणीय तर्क, वास्तविक डिबगिंग, ऐसा कुछ भी जहां गलत उत्तर की कीमत बाद में समय लगेगा, उसे high या उससे ऊपर रखें।

चरण 2: cost-optimize चलाएं।

यह 26 अगस्त को claude-api कौशल के भाग के रूप में लॉन्च किया गया था। यह हाल के उपयोग को देखता है और उन लागत लीवरों को रैंक करता है जो किसी विशिष्ट प्रोजेक्ट के लिए मायने रखते हैं।

bash
1/claude-api cost-optimize

यह कैशिंग, टोकन स्वच्छता, बैच प्रोसेसिंग, प्रयास स्तर और मॉडल विकल्प की जांच करता है, इसी क्रम में। कैशिंग और टोकन स्वच्छता आमतौर पर सबसे सस्ते सुधार होते हैं और सबसे तेज़ी से लाभ देते हैं, इससे पहले कि यह कभी मॉडल बदलने जैसा कोई संरचनात्मक सुझाव दे।

Alvaro Cintas - inline image

प्रत्येक सुझाव को एक-एक करके अनुमोदित या छोड़ दिया जाता है। पुष्टि के बिना कुछ भी नहीं बदलता, इसलिए सेटअप को फिर से लिखने का कोई जोखिम नहीं है।

चरण 3: prompt-audit चलाएं।

प्रॉम्प्ट और कौशल समय के साथ कबाड़ इकट्ठा करते हैं।

इसे एक कबाड़ दराज की तरह समझें। हर संपादन इसमें एक और चीज़ डालता है, और आप इसे कभी साफ नहीं करते। सिवाय इसके कि यह "दराज" आपसे हर अनुरोध के लिए टोकन वसूलता है, हमेशा के लिए, जब तक कि कबाड़ हटा नहीं दिया जाता।

bash
1/claude-api prompt-audit
Alvaro Cintas - inline image

इसे अपने किसी भी Skills फ़ोल्डर पर चलाएं। पुराने कौशल, जिन्हें आपने शायद बार-बार संपादित किया है, वही हैं जहां यह सबसे अधिक बर्बादी पाता है। हर संपादन ने कुछ जोड़ा बिना उसे हटाए जिसे बदला गया था। इसे चलाएं और आप अंतर देखेंगे।

चरण 4: पुराने API कॉन्फ़िगरेशन को माइग्रेट करें।

यदि कोई प्रोजेक्ट अभी भी पुराने मॉडल के लिए बनाए गए कॉन्फ़िगरेशन पर चल रहा है, तो यह कोडबेस में मॉडल आईडी स्वैप और किसी भी ब्रेकिंग पैरामीटर परिवर्तन को संभालता है।

bash
1/claude-api इस प्रोजेक्ट को claude-fable-5-1 पर माइग्रेट करें

वास्तविक लक्ष्य मॉडल का नाम बताएं। यह पहले दायरा तय करता है, पूरी वर्किंग डायरेक्टरी, एक उपनिर्देशिका, या फ़ाइलों की एक विशिष्ट सूची, इससे पहले कि वह कुछ भी संपादित करे। फिर यह आपको शेष बची हुई चीज़ों की एक चेकलिस्ट देता है जिन्हें हाथ से सत्यापित करना है।

बर्बादी को और कम करने के लिए चार रिपॉजिटरीज़।

ये विशेष रूप से Fable 5.1 के लिए नहीं हैं। किसी भी मॉडल पर, वही टोकन बचत लागू होती है, इसलिए यह जानना अच्छा है कि वहाँ क्या उपलब्ध है और प्रत्येक वास्तव में क्या करता है।

Caveman

Alvaro Cintas - inline image

मॉडल के अपने उत्तरों को वाचाल उत्तरों के बजाय छोटी, टेलीग्राफिक प्रतिक्रियाओं में संपीड़ित करता है।

सेटअप:

bash
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash

RTK

Alvaro Cintas - inline image

एक Rust प्रॉक्सी जो शेल कमांड आउटपुट को मॉडल के संदर्भ में पहुंचने से पहले संपीड़ित करता है।

सेटअप:

bash
1brew install rtk
2rtk init -g

Ponytail

Alvaro Cintas - inline image

एजेंट को शुरू में ही कम कोड लिखने के लिए प्रेरित करता है। एक वरिष्ठ-डेवलपर लेंस जो पचास के बजाय एक पंक्ति चुनता है।

सेटअप:

bash
1/plugin marketplace add DietrichGebert/ponytail
2/plugin install ponytail@ponytail

CodeGraph

Alvaro Cintas - inline image

यह पूरी तरह से अलग तरीके से काम करता है। टेक्स्ट को संपीड़ित करने के बजाय, यह कोडबेस का एक नॉलेज ग्राफ बनाता है, ताकि एजेंट grep और read के साथ फ़ाइलों को स्कैन करने के बजाय सीधे सिंबल रिलेशनशिप और कॉल ग्राफ़ क्वेरी कर सके।

सेटअप:

bash
1npx @colbymchenry/codegraph
2cd your-project
3codegraph init -i

कहां से शुरू करें।

अगर कुछ और नहीं होता, तो चरण 1 करें। अगले नियमित कार्य पर प्रयास स्तर कम करें और आउटपुट की तुलना करें। वह एक सेटिंग आपके क्रेडिट के लिए किसी भी रिपॉजिटरी से अधिक करती है, और इसे आज़माने में कुछ भी खर्च नहीं होता।

फिर अपने किसी भी प्रोजेक्ट पर cost-optimize और prompt-audit चलाएं।

Anthropic की अपनी टीम के चार पुष्ट किए गए सेटिंग्स किसी भी रिपॉजिटरी से स्थापित चीज़ से बेहतर हैं। उसके बाद मैंने आपको जो चार रिपॉजिटरीज़ दी हैं, उनके साथ व्यापक इकोसिस्टम में देखें।

अगर इससे आपके टोकन/पैसे बचे हैं, तो कृपया इसे लाइक करें और अपने नेटवर्क के साथ साझा करें।

अगली बार मिलते हैं :)

YouMind में रीमिक्स करें

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें