आज, हम चर्चा करेंगे कि कैसे "टोकन मैक्सिंग" (Token Maxing) का चरण—AI टोकन उपयोग को अधिकतम करना—पूरा चक्र पूरा कर चुका है, और अब रुझान "टोकन प्रबंधन" (Token Management) की ओर बढ़ रहा है, जो AI के ROI पर सवाल उठाता है। टोकन प्रबंधन अब एक प्रबंधन मुद्दा बन गया है, जो कार्मिक योजना या विपणन निवेश निर्णयों जितना ही महत्वपूर्ण है।
विदेशों में, "टोकन प्रबंधन" की इस अवधारणा पर अक्सर अधिक तकनीकी रूप से "टोकन ऑप्टिमाइज़ेशन" (Token Optimization) के रूप में चर्चा की जाती है। स्पष्टता के लिए, मैं यहां टोकन प्रबंधन शब्द का उपयोग करूंगा, लेकिन कृपया इसे टोकन ऑप्टिमाइज़ेशन का पर्याय समझें।
टोकन मैक्सिंग और इसकी प्रतिक्रिया

पिछले एक साल में, जनरेटिव AI का उपयोग एक ऐसे चरण में रहा है जिसे "टोकन मैक्सिंग" कहा जा सकता है। यह कार्यों पर टोकनों की बौछार करने, सबसे शक्तिशाली मॉडलों को बार-बार हिट करने, और संदर्भ को पूरी सीमा तक फीड करने के बारे में था। AI विक्रेताओं ने भी उपयोग विस्तार को सफलता के मीट्रिक के रूप में अपनाया, और फ्लैट-रेट सब्सक्रिप्शन के माध्यम से प्रभावी रूप से सब्सिडी प्रदान की। उपयोगकर्ता पक्ष पर, लागत की चिंता किए बिना सबसे शक्तिशाली मॉडल का उपयोग करना एक प्रतिस्पर्धात्मक लाभ के रूप में बताया जाता था।
हालांकि, 2026 में प्रवेश करते हुए, इस संरचना के प्रति एक स्पष्ट प्रतिक्रिया उभरने लगी है।
Uber एक प्रतीकात्मक उदाहरण है। कंपनी ने इंजीनियरों को उपयोग पर प्रतिस्पर्धा करने के लिए आंतरिक रूप से एक Claude Code लीडरबोर्ड स्थापित किया, और परिणामस्वरूप, उन्होंने अपना 2026 AI कोडिंग बजट केवल चार महीनों में समाप्त कर दिया। Uber के COO एंड्रयू मैकडोनाल्ड ने एक पॉडकास्ट में उल्लेख किया:
"अब से, हमें श्रम लागत के साथ-साथ टोकन खपत और इससे जुड़ी लागतों पर भी चर्चा करनी होगी। यदि हम एक सीधी रेखा नहीं खींच सकते हैं जो दर्शाती है कि ग्राहकों तक पहुंचने वाली सुविधाएं उतनी ही बढ़ रही हैं जितना हम खर्च कर रहे हैं, तो इस व्यापार-नापसंद को सही ठहराना मुश्किल है।"
इसी तरह की चिंताएं AI बेचने वालों द्वारा भी व्यक्त की जा रही हैं। Microsoft के सत्य नडेला ने मार्च 2026 में मॉर्गन स्टेनली TMT सम्मेलन में कहा:
"हम इतने सारे टोकन क्यों उपयोग कर रहे हैं? कई मामलों में, हम टोकन दक्षता के मामले में सबसे बुरे काम कर रहे हैं। अगले वर्ष में हर कोई टूल उपयोग और AI को कुशल बनाने के लिए सॉफ्टवेयर पर काम करेगा।"
वास्तव में, Microsoft ने आंतरिक रूप से शुरू किए गए प्रत्यक्ष Claude Code लाइसेंसों को काफी हद तक कम कर दिया है।
यहाँ से, AI एक ऐसा उपकरण नहीं रहेगा जहाँ आप बस "जितना चाहें उपयोग कर सकते हैं", बल्कि एक ऐसा विषय बन जाएगा जहाँ ROI पर सवाल उठाया जाता है, ठीक श्रम या विपणन लागत की तरह। प्रबंधन का ध्यान इस बात से हट जाएगा कि कितने टोकन उपयोग किए गए, इस ओर कि उन टोकनों ने क्या उत्पादन किया और उन्हें आगे कहाँ आवंटित किया जाए।
बड़े पैमाने पर टोकन उपयोग प्रतिस्पर्धा के लिए एक पूर्व शर्त है
जबकि यह थोड़ा नकारात्मक लगता है, इसका आधार यह है कि AI का विकास अत्यंत शक्तिशाली है। विकास के क्षेत्र में, कोडिंग एजेंटों का उपयोग न करने का कोई विकल्प नहीं है। जो कंपनियां एक निश्चित स्तर की टोकन लागत वहन नहीं कर सकतीं, वे मूल रूप से प्रतिस्पर्धा से बाहर हो रही हैं। इसके अलावा, उस "निश्चित स्तर" की टोकन लागत की बाधा काफी ऊँची है। हमें कठोर वास्तविकता का सामना करना होगा कि निवेश क्षमता के बिना आप गति नहीं बढ़ा सकते।
वास्तव में, इंजीनियरों द्वारा उपभोग की गई टोकन लागत उनके वेतन के दसियों प्रतिशत या आधे तक पहुँचना असामान्य नहीं है। एक इंजीनियर को काम पर रखने की "लागत" को केवल "वेतन" के रूप में नहीं, बल्कि "वेतन प्लस AI टोकन लागत" के एक सेट के रूप में सोचना आवश्यक होता जा रहा है। प्रबंधन के लिए, यह एक पूरी तरह से नई लागत श्रेणी का उद्भव है।
टोकन मैक्सिंग एक अर्थहीन आंदोलन नहीं था; AI का पूरी गति से उपयोग करके, मेरा मानना है कि इस बारे में सीखने में तेजी आई कि कहाँ गति बढ़ानी है और कहाँ अधिक नियंत्रण रखना है। आगे बढ़ते हुए, जो कंपनियां टोकन प्रबंधन कर सकती हैं—जहाँ चाहिए वहाँ कदम रखना और जहाँ चाहिए वहाँ नियंत्रण रखना—वे अलग दिखेंगी।
टोकन प्रबंधन स्वयं एक प्रबंधन मुद्दा बन गया है। टोकन मैक्सिंग कंपनियों के संरचनात्मक परिवर्तन के लिए एक महत्वपूर्ण पहला कदम था।
हमारी कंपनी में, केवल टोकनों का उपयोग करने का चरण समाप्त हो गया है, और हम परिणाम उत्पन्न करने के चरण में हैं। LayerX के "Compass" (मार्गदर्शक सिद्धांतों) के भीतर, निर्देश हैं जैसे "AI को विकास का चालक बनाएं" और "ऐसी चीजें न बनाएं जिनका उपयोग नहीं होगा। AI बिल्ड ट्रैप में न पड़ें।"

https://speakerdeck.com/layerx/compass_202209?slide=34 से

https://speakerdeck.com/layerx/compass_202209?slide=36 से
इन दिशानिर्देशों के परिणामस्वरूप, हमने आंतरिक रूप से टोकनों को अनुकूलित किया। हमने उनका उपयोग वहाँ किया जहाँ उनका उपयोग किया जाना चाहिए और वहाँ अनुकूलित किया जहाँ अनुकूलित किया जाना चाहिए, फिर भी LayerX पर टोकन मैक्सिंग करते समय उपयोग किए गए टोकनों की संख्या में कोई महत्वपूर्ण बदलाव नहीं आया है। मुझे लगता है कि एक निश्चित स्तर से ऊपर बड़े पैमाने पर टोकन उपयोग प्रतिस्पर्धा के लिए एक पूर्व शर्त बन गया है।
कोडिंग एजेंट केवल एक "मिसाल" हैं
यहाँ महत्वपूर्ण बात यह है कि यह विस्फोटक टोकन खपत कोडिंग के विशेष क्षेत्र तक सीमित नहीं है।
वर्तमान में, कोडिंग के अलावा सभी प्रकार के व्यावसायिक संचालन को कोडिंग एजेंटों की तरह ही हल किया जा रहा है। बिक्री के लिए सिग्नल संग्रह और प्रस्ताव निर्माण, ग्राहक सहायता पूछताछ, स्वचालित व्यय रिपोर्टिंग और अनुमोदन, कानूनी अनुबंध समीक्षा, विपणन विज्ञापन संचालन, HR भर्ती स्क्रीनिंग—इन सभी को एक के बाद एक स्वायत्त निष्पादन एजेंटों के रूप में पुनः डिज़ाइन किया जा रहा है।
स्वायत्त एजेंट टोकनों की खपत उस पिछले "एक प्रश्न, एक उत्तर" तरीके से अतुलनीय मात्रा में करते हैं जिसका उपयोग मनुष्य करते थे। जैसे-जैसे एजेंट अधिक काम करते हैं, सभी AI उपयोग उसी पैटर्न में परिवर्तित हो जाएंगे जो अब हम कोडिंग एजेंटों के साथ देखते हैं। कोडिंग एजेंट बस उस पैटर्न तक पहुँचने वाली पहली मिसाल थे।

AI टोकन लागत प्रबंधन चुनौती, जो वर्तमान में एक "केवल इंजीनियरों की समस्या" जैसी दिखती है, जल्द ही एक कंपनी-व्यापी प्रबंधन मुद्दा बन जाएगी। ऐसा इसलिए क्योंकि कंपनी के भीतर प्रत्येक व्यावसायिक क्षेत्र में अगले कुछ वर्षों में समान टोकन खपत प्रोफ़ाइल होगी।
टोकन लागत एक टाइम बम है

यहाँ एक और तथ्य है जिसे हमें पहचानना होगा। AI सब्सक्रिप्शन शुल्क जो हम वर्तमान में दे रहे हैं, वास्तविक लागतों से काफी कम हैं।
वर्तमान में, फाउंडेशन मॉडल प्रदाताओं के लिए AI सब्सक्रिप्शन को घाटे पर पेश करना आम बात है, और हम जो फ्लैट शुल्क देते हैं और वास्तविक लागतों के बीच एक बड़ा अंतर है। यदि आप उसी उपयोग की API पे-एज़-यू-गो मूल्य निर्धारण के साथ पुनर्गणना करते हैं, तो लागत परिमाण के क्रम में बढ़ जाती है। सब्सक्रिप्शन प्रारूप वास्तविक लागत को उपयोगकर्ता के लिए अदृश्य बना देता है।
समस्या यह है कि फाउंडेशन मॉडल कंपनियां किसी भी समय इस वास्तविक लागत के अंतर को स्पष्ट कर सकती हैं। जिस क्षण सब्सिडी वाला हिस्सा फ्लैट-रेट से टोकन-आधारित बिलिंग, उच्च योजनाओं के लिए मार्गदर्शन, या मूल्य वृद्धि के रूप में ग्राहकों पर डाला जाने लगता है, "प्रति आईडी प्रति माह दसियों हज़ार येन, 100 कर्मचारियों की कंपनी के लिए वार्षिक रूप से दसियों लाख येन" की भावना थोड़े समय में "पूरी कंपनी के लिए वार्षिक रूप से करोड़ों या अरबों येन" के क्रम में कूद सकती है। सब्सक्रिप्शन द्वारा छिपाई गई वास्तविक लागत का अंतर टाइम बम की शक्ति बन जाता है।
पहली चीज़ जो आवश्यक है, वह है विस्फोट सतह पर आने से पहले कंपनी के अंदर क्या हो रहा है, उसे दृश्यमान बनाना।
(विवरण के लिए यह लेख सहायक है: https://www.thestateofbrand.com/news/ai-subscription-time-bombhttps://www.thestateofbrand.com/news/ai-subscription-time-bomb))
पहले, विज़ुअलाइज़ेशन
इस समस्या के लिए सबसे पहली चीज़ जो आवश्यक है, वह अत्यंत बुनियादी है: "कौन किस मॉडल का उपयोग कर रहा है और कितने टोकन" दृश्यमान बनाना। बस इतना ही।
लोगों के लिए, हमारे पास पहले से ही कार्मिक मूल्यांकन, लक्ष्य प्रबंधन, वेतन प्रणाली, और संगठनात्मक डिज़ाइन जैसे विशाल प्रबंधन आधार हैं। विपणन व्यय के लिए, CAC और पेबैक को मापते हुए अनुकूलन करना स्वाभाविक है। खरीद के लिए विशेष टीमें और कार्यप्रवाह हैं।
हालांकि, AI के लिए, यह सबसे बुनियादी विज़ुअलाइज़ेशन भी अभी तक लागू नहीं है। CEO और IT विभागों के लिए, यह तथ्य कि वे "अभी AI पर कौन कितना खर्च कर रहा है" नहीं देख सकते, पहले से ही एक बड़ा तनाव है। डैशबोर्ड पर नंबर डालने मात्र से मूल्य निर्मित होता है।
"AI टोकन एडवाइज़र" जो हम वर्तमान में प्रदान कर रहे हैं, विशेष रूप से इस अंतर को भरने के लिए डिज़ाइन किया गया एक उत्पाद है। यह यह विज़ुअलाइज़ करने का एक सरल उपकरण है कि किसने किस कार्य के लिए किस मॉडल का उपयोग किया और कितने टोकन। (Bakuraku उपयोगकर्ता मुफ्त में एक ID का उपयोग कर सकते हैं!)

https://bakuraku.jp/resources/product/pre-registration-ai-token-advisor/ से
हालांकि, विज़ुअलाइज़ेशन केवल प्रवेश द्वार है। जो वास्तव में महत्वपूर्ण है वह प्रश्न है जो अनिवार्य रूप से उससे परे उठता है।
"क्या वास्तव में उस कार्य के लिए उस मॉडल का उपयोग किया जाना चाहिए था?"
जैसे-जैसे विज़ुअलाइज़ेशन आगे बढ़ता है, अगला प्रश्न जो हमेशा उठता है: "क्या वास्तव में उस कार्य के लिए उस मॉडल का उपयोग किया जाना चाहिए था?"
उदाहरण के लिए, "आज मौसम कैसा है?" जैसे प्रश्न के लिए एक शीर्ष-स्तरीय तर्क मॉडल (जैसे Claude Opus 4.8 या GPT-5.5; मई 2026 तक के नवीनतम मॉडल) का उपयोग करना स्पष्ट रूप से अत्यधिक है। सबसे हल्का मॉडल पर्याप्त है, और इसे तर्क मॉडल होने की आवश्यकता भी नहीं हो सकती है। इसी तरह, कंपनियों के भीतर बड़े पैमाने पर ऐसे मामले हैं जहाँ नियमित ईमेल निर्माण जैसे परिपक्व कार्यों के लिए महंगे मॉडल का उपयोग जारी रहता है।
रुझान भी व्यक्ति के अनुसार भिन्न होते हैं। जो लोग AI का उपयोग करने के आदी नहीं हैं, वे अभी के लिए केवल सबसे शक्तिशाली मॉडल चुनते हैं। इसके विपरीत, जो AI का गहराई से उपयोग करते हैं, वे कार्य की प्रकृति के आधार पर मॉडल बदलते हैं। यह अंतर, लागत और गुणवत्ता दोनों के संदर्भ में, एक संगठन के लिए अनदेखा करने के लिए बहुत बड़ा हो जाता है।
यहाँ महत्वपूर्ण बात यह है कि AI को सभी इनपुट अंततः एक "प्रॉम्प्ट" के रूप में परिवर्तित हो जाते हैं। चैट प्रश्न और एजेंटों को पारित संदर्भ सभी आंतरिक रूप से मॉडल को प्रॉम्प्ट के रूप में इनपुट किए जाते हैं। दूसरे शब्दों में, यदि आप प्रॉम्प्ट को देखते हैं, तो आप काफी हद तक बता सकते हैं कि वह व्यक्ति AI से क्या करवा रहा है।
इस प्रॉम्प्ट से शुरू करके, हम कार्यों और मॉडलों के बीच बेमेल का पता लगा सकते हैं और मार्गदर्शन प्रदान कर सकते हैं जैसे, "इस कार्य के लिए, एक हल्का मॉडल पर्याप्त है।" आगे बढ़ते हुए, हर बार लोगों द्वारा मॉडल चुनने के बजाय, सिस्टम स्वचालित रूप से इष्टतम मॉडल आवंटित करेगा। हम ऐसी दुनिया की ओर बढ़ रहे हैं।

एजेंटों के युग में, यह और भी महत्वपूर्ण हो जाता है। चूँकि एजेंट स्वायत्त रूप से निष्पादित करते हैं, इसलिए हर बार यह सोचने के लिए कोई गुंजाइश नहीं है, "क्या अब Opus का उपयोग करना एक विलासिता है?" शुरू से, कार्य की प्रकृति के आधार पर इष्टतम मॉडल चयन को सिस्टम पर छोड़ने के अलावा कोई विकल्प नहीं होगा।
Bakuraku में हम जो सेवाएं प्रदान करते हैं, वे प्रबंधित सेवाओं के रूप में पेश की जाएंगी, जिसमें बैकएंड कार्यान्वयन शामिल है जो उपयोगकर्ता को इसके बारे में जागरूक हुए बिना इष्टतम मॉडल का चयन करता है। AI टोकन एडवाइज़र केवल प्रवेश द्वार है।
सारांश
AI टोकन लागत पहले से ही उस पैमाने को पार कर चुकी है जहाँ उन्हें "बस पैसा फेंको" दृष्टिकोण से संभाला जा सकता है। कुछ कंपनियों के लिए, वे श्रम और विपणन लागत के बराबर व्यय बन रहे हैं।
विपणन लागत को CAC द्वारा सख्ती से प्रबंधित किया जाता है, और कोई भी यह कहकर काम नहीं करता, "CAC की परवाह किए बिना विज्ञापन चलाएं।" श्रम लागत के लिए भी यही बात है; वेतन, भर्ती और प्लेसमेंट सभी प्रबंधित हैं। आप किसी भी वेतन पर लोगों को नहीं रखते।
इसी स्तर पर, AI लागत प्रबंधन के दायरे में आ जाएगी। तब सबसे पहली चीज़ जो आवश्यक है, वह है "कितना खर्च किया जा रहा है" दृश्यमान बनाना। और अगला है यह जाँचना कि "कार्य और व्यक्ति के लिए उपयुक्त मॉडल चुना जा रहा है या नहीं।"
यह अप्रभावी लग सकता है, लेकिन इन दो बिंदुओं में महारत हासिल करना आने वाले वर्षों में एक महत्वपूर्ण प्रबंधन मुद्दा बन जाएगा।
उन लोगों के लिए जो ऐसे भविष्य को एक साथ लागू करना चाहते हैं, LayerX सक्रिय रूप से AI बिल्डरों की भर्ती कर रहा है!

हम सक्रिय रूप से भर्ती कर रहे हैं! https://jobs.layerx.co.jp/





