OpenAI या Anthropic के बिल में वास्तव में क्या होता है, दोनों कंपनियों द्वारा प्रकाशित की गई वे छूटें जिन तक आप एक चैट बॉक्स से नहीं पहुँच सकते, और वह परत जो उन्हें एक्सेस कर सकती है, अचानक आपके स्वामित्व वाली संपत्ति क्यों बन गई।
अधिकतर लोगों से पूछें कि AI आपको कितना खर्च करता है, तो वे महीने का सब्सक्रिप्शन शुल्क बताएंगे।
पूछें कि एक बातचीत (conversation) की लागत क्या है, तो कमरा शांत हो जाएगा, जो कि उचित भी है, क्योंकि ईमानदार जवाब थोड़ा जटिल है। OpenAI और Anthropic दोनों उस इकाई में बिलिंग करते हैं जिसे आप देख नहीं सकते, इसे चार अलग-अलग मापदंडों पर तय किया जाता है, और अपनी डॉक्यूमेंटेशन में छूटों का एक सेट प्रकाशित करते हैं जो लगभग पूरी तरह से अप्राप्य होती हैं यदि आप सिर्फ एक टेक्स्ट बॉक्स के सामने बैठे हैं।
इनमें से कुछ भी छिपा हुआ नहीं है। यह सब अभी उनके प्राइसिंग पेज और डेवलपर डॉक्यूमेंटेशन में उपलब्ध है। बस इसकी समझ के लिए आपको वहां से एक स्तर नीचे जाना होगा जहां अधिकतर लोग खड़े हैं।
प्रकाशित कीमत कार्ड और आम आदमी द्वारा भुगतान की जाने वाली कीमत के बीच यह अंतर कोई घोटाला नहीं है। यह एक व्यापार है, और हाल ही तक आपके पास इसके दूसरी तरफ होने का कोई तरीका नहीं था।
यह लेख बताता है कि बिल में वास्तव में क्या होता है, असली लीवर (levers) वहां क्यों स्थित हैं, और क्या बदलाव आता है जब उन लीवर को खींचने वाली परत एक ऐसी चीज़ बन जाती है जिसे आप रख सकते हैं, न कि केवल उसके लिए भुगतान कर सकते हैं। यदि आप AI और स्वामित्व (ownership) पर इसी तरह की और सामग्री चाहते हैं, तो @MossAI_Official को फॉलो करें।
उनकी अपनी डॉक्यूमेंटेशन से सीधे आपके बिल पर 7 बातें
नीचे दी गई हर चीज़ OpenAI या Anthropic द्वारा प्रकाशित की गई है। इंजीनियरिंग टीमों के बाहर इनमें से लगभग कोई भी बात आम ज्ञान नहीं है। दरें लगातार बदलती रहती हैं, इसलिए आंकड़ों को संरचना के उदाहरण के रूप में मानें, न कि ठोस कोटेशन के रूप में।
- आउटपुट, इनपुट से कई गुना महंगा होता है, दोनों प्लेटफॉर्म पर
दोनों प्राइस शीट पर हर मॉडल इनपुट और आउटपुट के लिए अलग-अलग बिलिंग करता है, और आउटपुट हमेशा महंगा होता है। अनुपात आमतौर पर चार से छह के बीच होता है।

व्यावहारिक पुनर्संरेखण (reframe) सबसे महत्वपूर्ण हिस्सा है। जो आप टाइप करते हैं वह लगभग मुफ्त है। जो मॉडल जवाब देता है, वही बिल है। उत्तर को सीमित करना आपके खर्च को कम करने में प्रश्न को छोटा करने से कहीं ज्यादा मदद करता है, जो कि लगभग हर किसी के व्यवहार के बिल्कुल विपरीत है।
2. आपको उस रीजनिंग (reasoning) के लिए बिल किया जाता है जिसे आप पढ़ने के लिए अनुमति प्राप्त नहीं करते
यह वह बात है जो आपको वास्तव में हैरान करनी चाहिए।
OpenAI की अपनी हेल्प डॉक्यूमेंटेशन में कहा गया है कि रीजनिंग टोकन्स उत्तर के रूप में दृश्यमान नहीं होते लेकिन आउटपुट उपयोग में गिने जाते हैं और आउटपुट टोकन्स के रूप में बिल किए जाते हैं, और इसलिए एक छोटा दृश्यमान उत्तर अपने प्रदर्शित पाठ की तुलना में अधिक टोकन्स का उपयोग कर सकता है। उनकी रीजनिंग गाइड पुष्टि करती है कि कच्चे रीजनिंग टोकन्स एक्सपोज़ नहीं किए जाते, केवल एक वैकल्पिक सारांश दिया जाता है।
आप उस पाठ के लिए आउटपुट दरें चुका रहे हैं जिसे आप संरचनात्मक रूप से देखने के लिए अनुमति प्राप्त नहीं करते।
3. आपकी आउटपुट कैप छिपे हुए हिस्से को कैप नहीं करती
यह और भी तीखा हो जाता है। इन मॉडलों को चलाने के लिए डॉक्यूमेंटेशन में नोट किया गया है कि अधिकतम आउटपुट टोकन्स पैरामीटर दृश्यमान आउटपुट को सीमित करता है जबकि छिपे हुए रीजनिंग टोकन्स उस सीमा से प्रतिबंधित नहीं होते।
एक प्रलेखित परिणाम इसका अनुसरण करता है। एक अनुरोध रीजनिंग चरण के भीतर अपना बजट खर्च कर सकता है और कुछ भी वापस नहीं लौटा सकता, जबकि टोकन्स पहले ही खपत हो चुके हैं। OpenAI की रीजनिंग गाइड इस परिणाम को सीधे स्वीकार करती है, यह नोट करते हुए कि आप बिना दृश्यमान प्रतिक्रिया प्राप्त किए इनपुट और रीजनिंग टोकन्स के लिए लागत वहन कर सकते हैं।
मीटर चलता है, स्क्रीन खाली रहती है, और यह एक प्रलेखित व्यवहार है, बग नहीं।
4. दोहराया गया संदर्भ (context) नब्बे प्रतिशत छूट पर होता है, और दोनों ही आपको इसके बारे में बताते हैं
प्रॉम्प्ट कैशिंग स्टैक में सबसे बड़ा एकल लीवर है और अधिकतर लोगों ने इसके बारे में कभी नहीं सुना है।
Anthropic की कैशिंग डॉक्यूमेंटेशन में कैश रीड्स को बेस इनपुट मूल्य का 0.1 गुना रखा गया है, पांच मिनट के कैश राइट को 1.25 गुना और एक घंटे के राइट को 2 गुना। OpenAI वर्तमान GPT-5 परिवारों पर उसी ढांचे को लागू करता है, कैश्ड इनपुट को मानक इनपुट दर के लगभग दस प्रतिशत पर तय करता है, जिसमें कैश राइट्स अपने स्वयं के प्रीमियम के साथ आते हैं।
गणित वहीं से उपयोगी हो जाता है। एक दसवें भाग पर रीड और 1.25 गुना पर राइट के साथ, एक कैश मिस उसी प्रिफिक्स के लिए हिट की तुलना में लगभग बारह और आधा गुना महंगा पड़ता है, और ब्रेक-ईवन (break-even) लगभग दो रीड्स पर आता है। किसी भी चीज़ के लिए जो हर कॉल पर वही सिस्टम प्रॉम्प्ट, टूल स्कीमा, या रेफरेंस डॉक्यूमेंट भेजती है, यही छोटे बिल और बड़े बिल के बीच का पूरा अंतर है।

यह एक ऐसे तरीके से भी नाजुक है जिसके बारे में जानना आवश्यक है। दोनों प्रदाता सटीक प्रिफिक्स मैचिंग पर कैश करते हैं, इसलिए प्रॉम्प्ट में ऊपर की ओर एक बदला हुआ बाइट उसके नीचे सब कुछ अमान्य (invalidate) कर देता है और कीमत चुपचाप पूर्ण दर पर वापस आ जाती है।
5. दोनों ही उस काम के लिए बिल आधा कर देंगे जो रुक सकता है
OpenAI और Anthropic दोनों ही इनपुट और आउटपुट पर पचास प्रतिशत छूट के साथ एक एसिंक्रोनस बैच टियर चलाते हैं। Anthropic की प्राइसिंग डॉक्यूमेंटेशन स्पष्ट रूप से कहती है कि कैशिंग मल्टीप्लायर्स बैच डिस्काउंट के साथ जुड़ते हैं (stack)।
उनको जोड़ने पर, एक बैच के अंदर एक कैश्ड इनपुट टोकन मानक का एक छोटा सा अंश बन जाता है। यह किसी भी इंटरैक्टिव चीज़ के लिए काम नहीं करता, जो ठीक इसी कारण है कि कोई भी उपभोक्ता उत्पाद इसे आपको दिखाता नहीं है।
6. छूट इस बात पर निर्भर करती है कि आप किस मॉडल ID से जुड़े हैं, न कि किस मॉडल का उपयोग आप सोच रहे हैं कि कर रहे हैं
यहाँ एक बात है जिसे लगभग कोई नहीं चेक करता।
कैशिंग छूट प्रदाता की कैटलॉग में समान नहीं होती। OpenAI पर, वर्तमान GPT-5 परिवारों को कैश्ड इनपुट पर लगभग नब्बे प्रतिशत छूट मिलती है, जबकि पुरानी पीढ़ी के मॉडल काफी कम छूट प्राप्त करते हैं। Anthropic पर मानक कैश रीड मल्टीप्लायर बेस इनपुट का 0.1 गुना है, कुछ नए मॉडल इससे भी आगे जाते हैं।
एक ही प्रदाता, एक ही फीचर नाम, आपकी कॉन्फिग में एक स्ट्रिंग के आधार पर मौलिक रूप से अलग अर्थव्यवस्था। विरासत (legacy) मॉडल IDs इससे भी बुरे हैं। क्लाउड पार्टनर्स के माध्यम से अब भी पहुँच योग्य सेवानिवृत्त (retired) Anthropic मॉडल अपने मूल दरों पर चलते हैं, जो एक कम सक्षम मॉडल के लिए वर्तमान मूल्य से कई गुना अधिक हो सकते हैं।
किसी ने एक बार वह स्ट्रिंग सेट की थी और किसी ने फिर उसे दोबारा नहीं देखा। यही वह जगह है जहां आश्चर्यजनक मात्रा में अतिरिक्त खर्च वास्तव में निहित होता है।
7. एक संदर्भ सीमा (context threshold) को पार करने से पूरे अनुरोध की कीमत बदल सकती है
सबसे सूक्ष्म, और सबसे कठोर आकार वाला।
OpenAI कुछ मॉडलों पर अलग लंबे संदर्भ दरें प्रकाशित करता है, और तंत्र वह नहीं है जो लोग मानते हैं। सीमा के ऊपर, पूरा अनुरोध पुनर्मूल्यित (reprices) हो जाता है, केवल लाइन के ऊपर वाले टोकन्स नहीं। एक टोकन अधिक और पूरा कॉल लगभग दोगुना महंगा हो जाता है।
Anthropic ने इस पर एक अलग स्थिति अपनाई है। हाल के Claude मॉडलों पर, पूरा संदर्भ विंडो मानक प्रति टोकन दरों पर बिल किया जाता है, जिसमें कैशिंग और बैच छूटें पूरी विंडो पर लागू होती हैं।
यह दोनों प्लेटफॉर्म के बीच एक वास्तविक संरचनात्मक अंतर है और यह किसी भी उपभोक्ता इंटरफेस से अदृश्य है। यदि आपका वर्कलोड लंबे संदर्भ चलाता है, तो यह अन्य सभी मूल्य विचारों पर हावी हो सकता है।

लीवर सार्वजनिक हैं। आप अभी भी उन तक नहीं पहुँच सकते।
यहाँ संरचनात्मक बिंदु है।
ऊपर दिए गए हर लीवर API लेयर पर स्थित हैं। उन तक पहुँचने के लिए प्रॉम्प्ट संरचना पर नियंत्रण की आवश्यकता होती है ताकि कैश वास्तव में हिट हो, मॉडल रूटिंग ताकि सही काम सही मूल्य टियर पर जाएं, उस काम के लिए बैचिंग जो विलंब (latency) सहन कर सकता है, रीजनिंग प्रयास नियंत्रण, और यह जागरूकता कि अनुरोध किस संदर्भ टियर में गिरता है।
एक उपभोक्ता चैट इंटरफेस से आपके पास एक टेक्स्ट बॉक्स और एक मासिक शुल्क है। आप रूट नहीं कर सकते, बैच नहीं कर सकते, कैश प्रिफिक्स को संरचित नहीं कर सकते, और यह नहीं देख सकते कि आपकी रीजनिंग प्रयास सेटिंग आपको कितना खर्च कर रही है।
तो एक स्प्रेड (spread) मौजूद है। एक तरफ वह है जो एक कुशल ऑपरेटर इन सबको जोड़कर प्राप्त करता है। दूसरी तरफ वह है जो एक सामान्य उपयोगकर्ता भुगतान करता है। किसी के साथ धोखा नहीं हो रहा है। छूटें इंजीनियरिंग सतहें हैं, उपभोक्ता फीचर्स नहीं, और उपभोक्ता उत्पादों को उन्हें प्रकट करने के लिए नहीं बनाया गया है।
उस स्प्रेड के अंदर रहने वाले व्यवसाय रिले, गेटवे और एग्रीगेटर हैं। वे उपयोगकर्ताओं और प्रदाताओं के बीच बैठते हैं, सबसे सस्ता पर्याप्त मॉडल रूट करते हैं, कैश को गर्म रखते हैं ताकि दोहराया गया संदर्भ पूर्ण मूल्य पर दोबारा खरीदा न जाए, जो बैच हो सकता है उसे बैच करते हैं, और उपयोगकर्ता को एक कच्चे API से सरल चीज़ देते हैं।
उनका राजस्व स्प्रेड है। और यहीं से यह दिलचस्प हो जाता है।

एक रिले एक थ्रूपुट व्यवसाय है, और यह यहाँ दुर्लभ है
इस बाजार में अधिकतर चीज़ें दांव हैं। आप एक दृष्टिकोण लेते हैं, आप सही या गलत होते हैं, परिणाम झूलता है।
एक रिले एक टोल बूथ है। वॉल्यूम गुजरता है, प्रति इकाई मार्जिन जमा होता है, और अर्थव्यवस्था किसी के सही होने के बजाय उपयोग के साथ बढ़ती है।
तीन गुण इसके बाद आते हैं, और तीनों ही असामान्य हैं।
राजस्व प्रति इकाई और निरंतर है। न कि लंपी, न कि इवेंट संचालित, न कि किसी कॉल के सही दिशा में जाने पर निर्भर। टोकन्स बहते हैं, मार्जिन जमा होता है, घंटे के बाद घंटा।
मांग क्रिप्टो से असंबद्ध है। कोड लिखने, वीडियो जनरेट करने और असिस्टेंट चलाने वाले लोग पहले बाजार नहीं देखते। खपत चालक AI गोद लेना है, जो इस उद्योग में बहुत कम चीज़ों में से एक है जो बाकी सबके साथ नहीं चलती।
गतिविधि एक गिनती है, व्याख्या नहीं। थ्रूपुट को किसी आर्टिब्यूशन तर्क के बिना मापा जा सकता है। यह सवाल नहीं कि अच्छा महीना कौशल था या भाग्य। अनुरोध या तो गुजरे थे या नहीं।
आखिरी बात जितनी लगती है उससे ज्यादा महत्वपूर्ण है। किसी भी चीज़ को स्वामित्व योग्य बनाने का कठिन हिस्सा यह साबित करना है कि उसने क्या किया। एक थ्रूपुट व्यवसाय में जो हुआ और जो दिखाया जा सकता है, उसके बीच की दूरी असामान्य रूप से कम होती है।

Model Max, और टोल बूथ को केवल भुगतान करने के बजाय उसका स्वामित्व रखना
Model Max एक टोकन API रिले है, और यह Moss Agent Marketplace पर एक रिडीम्शन एजेंट के रूप में अभी लाइव है।
उत्पाद का आधा हिस्सा सीधा है। एक ही रास्ते के माध्यम से मॉडलों तक पहुँच, जिसमें रूटिंग, कैशिंग और बैचिंग उस लेयर पर संभाली जाती है जहां ये निर्णय वास्तव में उपलब्ध होते हैं, न कि उस लेयर पर जहां आप एक टेक्स्ट बॉक्स के साथ फंस जाते हैं।
दूसरा आधा हिस्सा वह हिस्सा है जिस पर ध्यान देने की आवश्यकता है। मार्केटप्लेस पर एक एजेंट के रूप में, रिले केवल वह चीज़ नहीं है जिसका आप उपयोग करते हैं। यह वह चीज़ है जिसमें आप एक स्थिति (position) रख सकते हैं।
यह आकार इस श्रेणी के अधिकांश चीज़ों से अलग है। एक रिले की गतिविधि एक सत्यापन योग्य दावे के लिए आदर्श इनपुट के करीब है, क्योंकि थ्रूपुट एक तथ्य है, एक कहानी नहीं। व्याख्या करने के लिए कोई ट्रैक रिकॉर्ड नहीं, विश्वास पर स्वीकार करने के लिए कोई प्रदर्शन कहानी नहीं। उपयोग हुआ या नहीं हुआ, और यह पढ़ने योग्य है।
यह दूसरा रिडीम्शन एजेंट भी है जिसे हमने लॉन्च किया है जहां उपयोग की जाने वाली चीज़ और स्वामित्व वाली चीज़ एक ही वस्तु है। आप एक ही समय में रिले के ग्राहक और उसके होल्डर हो सकते हैं, और दूसरा संबंध कोई वफादारी टियर नहीं है। यह एक स्थिति है।
हमने ट्रेडिंग एजेंट्स से शुरूआत की क्योंकि ट्रेडिंग सबसे कठोर परीक्षण स्थल है। एक संख्या या तो वास्तविक है या एक कहानी है, और ब्लॉकचेन आपको इस बारे में झूठ बोलने की अनुमति नहीं देता कि कौन सा है। रिडीम्शन एजेंट उसी मानक को उन लोगों तक ले जाते हैं जो कभी एक perp (perpetual futures) नहीं खोलेंगे। इनके बाद जो आता है, वह और आगे बढ़ता है, उन सिस्टम की ओर जो केवल चेन पर चलते नहीं हैं बल्कि खुद उस पर जारी और संचालित करते हैं।
जब यह लॉन्च होगा तब इसके बारे में अधिक, पहले नहीं।
इस हफ्ते करने के लिए 4 चीज़ें, चाहे आप कुछ भी उपयोग करें
इनमें से किसी के लिए Moss की आवश्यकता नहीं है।
प्रॉम्प्ट लंबाई को अनुकूलित करना बंद करें और आउटपुट को सीमित करना शुरू करें। आप उत्तर के लिए भुगतान कर रहे हैं, प्रश्न के लिए नहीं। पांच सौ शब्दों के बजाय पचास शब्दों का अनुरोध करना आपके बिल के लिए अपने प्रॉम्प्ट को छोटा करने से लगभग दस गुना अधिक मदद करता है।
जांचें कि आपकी रीजनिंग प्रयास सेटिंग आपको क्या दिला रही है। उन कार्यों पर जिनके लिए विचार-मंथन की आवश्यकता नहीं है, उच्च प्रयास छिपे हुए टोकन्स पर पैसा खर्च करना है जो वास्तव में आपके द्वारा प्राप्त की जाने वाली किसी भी चीज़ में सुधार नहीं करते। यह लोगों द्वारा बिना पहचाने अधिक भुगतान करने का सबसे आम तरीका है।
अपनी कॉन्फिग खोलें और मॉडल ID पढ़ें। वह मॉडल नाम नहीं जो आप सोचते हैं कि आप उपयोग कर रहे हैं, वास्तविक स्ट्रिंग। फिर उसे वर्तमान प्राइस शीट के खिलाफ जांचें। पुराने IDs चुपचाप पुरानी अर्थव्यवस्थाओं को ले जाते हैं, और कभी-कभी एक कम सक्षम मॉडल के लिए काफी खराब कैशिंग छूटें।
यदि आप कुछ भी बनाते हैं, तो किसी और चीज़ को अनुकूलित करने से पहले कैश हिट दर को मापें। प्रतिक्रिया में उपयोग फील्ड्स आपको ताजे इनपुट, कैश राइट्स और कैश रीड्स के बीच विभाजन देते हैं। दोहराए गए कॉल्स पर शून्य रीड्स का मतलब है कि आपके प्रॉम्प्ट में ऊपर की ओर कुछ बदल रहा है और उसके नीचे सब कुछ अमान्य कर रहा है। यह एक बाइट के पीछे छिपा बारह गुना लागत अंतर है।
चारों के नीचे आदत ही वास्तविक मुख्य बात है। AI खर्च को एक संरचना वाले बिल के रूप में मानें, न कि एक संख्या वाले सब्सक्रिप्शन के रूप में। एक बार जब संरचना दृश्यमान हो जाती है, तो यह सवाल भी दृश्यमान हो जाता है कि उसके अंदर कौन कहाँ स्थित है।
अभी क्या करना है
moss.site पर जाएं और Model Max को देखें। यदि आपको इसकी आवश्यकता है तो इसे एक रिले के रूप में उपयोग करें। देखें कि इसमें एक स्थिति रखने का क्या मतलब है यदि यह आपको रुचि देता है। दोनों लाइव हैं, और वे एक ही वस्तु हैं, जो हिस्सा हमारे अनुसार नया है।
हर अर्थव्यवस्था अंततः तय करती है कि उसका बुनियादी ढांचा किसका है। AI अर्थव्यवस्था वर्तमान में उस चरण में है जहां हर कोई टोल बूथ पर भुगतान करता है और किसी ने यह पूछने का नहीं सोचा कि इसका स्वामित्व किसके पास है।
यह सवाल थोड़ी देर के लिए खुला रहता है।
स्रोत
- OpenAI Help Center, Understanding and counting tokens, रीजनिंग टोकन्स के आउटपुट के रूप में बिल किए जाने के बारे में जबकि वे उत्तर पाठ के रूप में दृश्यमान नहीं होते: https://help.openai.com/en/articles/4936856-what-are-tokens-and-how-to-count-them
- OpenAI reasoning models guide, कच्चे रीजनिंग टोकन्स के एक्सपोज़ न होने और बिना दृश्यमान प्रतिक्रिया के लागत वहन करने के बारे में: https://developers.openai.com/api/docs/guides/reasoning
- OpenAI API pricing page, वर्तमान प्रति मॉडल इनपुट, कैश्ड इनपुट और आउटपुट दरों, बैच और फ्लेक्स टियर्स, और लंबे संदर्भ दरों के लिए: https://openai.com/api/pricing/
- Microsoft Learn Q&A on Azure OpenAI billing, छिपे हुए रीजनिंग टोकन्स के बिलिंग में शामिल होने और अधिकतम आउटपुट टोकन्स पैरामीटर द्वारा उन्हें प्रतिबंधित न किए जाने के बारे में: https://learn.microsoft.com/en-us/answers/questions/5542366/why-did-azure-report-more-completion-tokens-than-m
- Anthropic prompt caching documentation, बेस इनपुट के 0.1 गुना पर कैश रीड्स, राइट मल्टीप्लायर्स, और Batch API छूट के साथ स्टैकिंग के बारे में: https://platform.claude.com/docs/en/build-with-claude/prompt-caching
- Anthropic pricing page, वर्तमान प्रति मॉडल दरों और Batch API छूट के लिए: https://claude.com/pricing





