Fable 5.1 एक दमदार मॉडल है। और यह टोकन भी उतनी ही तेज़ी से जलाता है।
यहाँ बताया गया है कि कैसे चार कमांड्स और मुफ्त ओपन-सोर्स रिपॉजिटरीज़ की मदद से टोकन की बर्बादी को कम किया जा सकता है।
इससे आउटपुट की गुणवत्ता पर कोई असर नहीं पड़ता। यह सिर्फ बदलता है कि आप उसी परिणाम के लिए कितना भुगतान करते हैं।
और यह सब तब भी काम करता है जब आप Fable 5.1 पर नहीं हैं, क्योंकि टोकन की लागत चाहे जो भी मॉडल चलाएं, उसी तरह बढ़ती है।
अब शुरू करते हैं।
चरण 1: अपना प्रयास स्तर कम करें।
यह सबसे बड़ी ट्रिक है, और यह एक सेटिंग है जिसे आप हर अनुरोध पर नियंत्रित कर सकते हैं।
पाँच स्तर हैं: low, medium, high, xhigh, और max।
प्रयास यह नियंत्रित करता है कि मॉडल उत्तर देने से पहले कितना तर्क करता है। उच्च प्रयास का मतलब है प्रतिक्रिया से पहले अधिक सोचना, जिसमें अधिक टोकन खर्च होते हैं, भले ही कार्य के लिए उस सोच की आवश्यकता हो या नहीं।
इसे समझने का तरीका यह है। प्रयास स्तर यह है कि आप किसी को जवाब देने से पहले कितनी देर सोचने देते हैं। किसी से पूछें कि 2+2 क्या होता है और वे कहेंगे "4"। उनसे पहले दस मिनट तक जोर से सोचने को कहें, और आप उसी "4" को पाने के लिए दस मिनट की सोच का भुगतान करते हैं।
खैर...अधिकांश कार्य 2+2 जैसे ही हैं।
Fable 5.1 के लिए Anthropic का मार्गदर्शन है: high से शुरू करें, जो डिफ़ॉल्ट है। केवल सबसे अधिक क्षमता-संवेदनशील कोडिंग और एजेंटिक कार्यों के लिए xhigh या max पर जाएं। नियमित या विलंबता-संवेदनशील कार्यों के लिए medium या low पर आएं, एक बार जब यह पुष्टि हो जाए कि निचला स्तर अभी भी गुणवत्ता बनाए रखता है।

आंकड़े चौंकाने वाले हैं। CursorBench पर, Fable 5.1 ने low प्रयास पर, high प्रयास पर Fable 5 से अधिक स्कोर किया, और लागत एक तिहाई थी।
इस पर भरोसा करने से पहले इसका परीक्षण करें। एक ऐसा कार्य चुनें जिसका सही उत्तर पहले से ज्ञात हो, फिर इसे low पर चलाएं।
"इस अनुरोध को low प्रयास पर चलाएं और मुझे बताएं कि प्रतिक्रिया में क्या बदला"
अपने वास्तविक कार्यों में से एक का उपयोग करें। यह मानने से पहले कि low प्रयास का मतलब खराब परिणाम है, सीधे आउटपुट की तुलना करें। भारी काम, बहु-चरणीय तर्क, वास्तविक डिबगिंग, ऐसा कुछ भी जहां गलत उत्तर की कीमत बाद में समय लगेगा, उसे high या उससे ऊपर रखें।
चरण 2: cost-optimize चलाएं।
यह 26 अगस्त को claude-api कौशल के भाग के रूप में लॉन्च किया गया था। यह हाल के उपयोग को देखता है और उन लागत लीवरों को रैंक करता है जो किसी विशिष्ट प्रोजेक्ट के लिए मायने रखते हैं।
1/claude-api cost-optimize
यह कैशिंग, टोकन स्वच्छता, बैच प्रोसेसिंग, प्रयास स्तर और मॉडल विकल्प की जांच करता है, इसी क्रम में। कैशिंग और टोकन स्वच्छता आमतौर पर सबसे सस्ते सुधार होते हैं और सबसे तेज़ी से लाभ देते हैं, इससे पहले कि यह कभी मॉडल बदलने जैसा कोई संरचनात्मक सुझाव दे।

प्रत्येक सुझाव को एक-एक करके अनुमोदित या छोड़ दिया जाता है। पुष्टि के बिना कुछ भी नहीं बदलता, इसलिए सेटअप को फिर से लिखने का कोई जोखिम नहीं है।
चरण 3: prompt-audit चलाएं।
प्रॉम्प्ट और कौशल समय के साथ कबाड़ इकट्ठा करते हैं।
इसे एक कबाड़ दराज की तरह समझें। हर संपादन इसमें एक और चीज़ डालता है, और आप इसे कभी साफ नहीं करते। सिवाय इसके कि यह "दराज" आपसे हर अनुरोध के लिए टोकन वसूलता है, हमेशा के लिए, जब तक कि कबाड़ हटा नहीं दिया जाता।
1/claude-api prompt-audit

इसे अपने किसी भी Skills फ़ोल्डर पर चलाएं। पुराने कौशल, जिन्हें आपने शायद बार-बार संपादित किया है, वही हैं जहां यह सबसे अधिक बर्बादी पाता है। हर संपादन ने कुछ जोड़ा बिना उसे हटाए जिसे बदला गया था। इसे चलाएं और आप अंतर देखेंगे।
चरण 4: पुराने API कॉन्फ़िगरेशन को माइग्रेट करें।
यदि कोई प्रोजेक्ट अभी भी पुराने मॉडल के लिए बनाए गए कॉन्फ़िगरेशन पर चल रहा है, तो यह कोडबेस में मॉडल आईडी स्वैप और किसी भी ब्रेकिंग पैरामीटर परिवर्तन को संभालता है।
1/claude-api इस प्रोजेक्ट को claude-fable-5-1 पर माइग्रेट करें
वास्तविक लक्ष्य मॉडल का नाम बताएं। यह पहले दायरा तय करता है, पूरी वर्किंग डायरेक्टरी, एक उपनिर्देशिका, या फ़ाइलों की एक विशिष्ट सूची, इससे पहले कि वह कुछ भी संपादित करे। फिर यह आपको शेष बची हुई चीज़ों की एक चेकलिस्ट देता है जिन्हें हाथ से सत्यापित करना है।
बर्बादी को और कम करने के लिए चार रिपॉजिटरीज़।
ये विशेष रूप से Fable 5.1 के लिए नहीं हैं। किसी भी मॉडल पर, वही टोकन बचत लागू होती है, इसलिए यह जानना अच्छा है कि वहाँ क्या उपलब्ध है और प्रत्येक वास्तव में क्या करता है।
Caveman

मॉडल के अपने उत्तरों को वाचाल उत्तरों के बजाय छोटी, टेलीग्राफिक प्रतिक्रियाओं में संपीड़ित करता है।
सेटअप:
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
RTK

एक Rust प्रॉक्सी जो शेल कमांड आउटपुट को मॉडल के संदर्भ में पहुंचने से पहले संपीड़ित करता है।
सेटअप:
1brew install rtk2rtk init -g
Ponytail

एजेंट को शुरू में ही कम कोड लिखने के लिए प्रेरित करता है। एक वरिष्ठ-डेवलपर लेंस जो पचास के बजाय एक पंक्ति चुनता है।
सेटअप:
1/plugin marketplace add DietrichGebert/ponytail2/plugin install ponytail@ponytail
CodeGraph

यह पूरी तरह से अलग तरीके से काम करता है। टेक्स्ट को संपीड़ित करने के बजाय, यह कोडबेस का एक नॉलेज ग्राफ बनाता है, ताकि एजेंट grep और read के साथ फ़ाइलों को स्कैन करने के बजाय सीधे सिंबल रिलेशनशिप और कॉल ग्राफ़ क्वेरी कर सके।
सेटअप:
1npx @colbymchenry/codegraph2cd your-project3codegraph init -i
कहां से शुरू करें।
अगर कुछ और नहीं होता, तो चरण 1 करें। अगले नियमित कार्य पर प्रयास स्तर कम करें और आउटपुट की तुलना करें। वह एक सेटिंग आपके क्रेडिट के लिए किसी भी रिपॉजिटरी से अधिक करती है, और इसे आज़माने में कुछ भी खर्च नहीं होता।
फिर अपने किसी भी प्रोजेक्ट पर cost-optimize और prompt-audit चलाएं।
Anthropic की अपनी टीम के चार पुष्ट किए गए सेटिंग्स किसी भी रिपॉजिटरी से स्थापित चीज़ से बेहतर हैं। उसके बाद मैंने आपको जो चार रिपॉजिटरीज़ दी हैं, उनके साथ व्यापक इकोसिस्टम में देखें।
अगर इससे आपके टोकन/पैसे बचे हैं, तो कृपया इसे लाइक करें और अपने नेटवर्क के साथ साझा करें।
अगली बार मिलते हैं :)





