जब हमने AI-लिखित शोज़ की तरफ रुख किया, तो अनगिनत लोगों ने हमसे कहा कि इससे Pocket FM खत्म हो जाएगा। छह लंबे महीनों बाद, मैं भी लगभग उनकी बात मानने लगा था। लेकिन फिर हमारा इकोसिस्टम तेज़ी से फला-फूला, और यह AI राइटिंग के बावजूद नहीं, बल्कि उसी की वजह से हुआ। <2 साल के अंदर, हमारे AI ने लेखकों को Pocket पर 161 ब्लॉकबस्टर बनाने में मदद की, जिनमें $100M की एक IP भी शामिल है।
राइटिंग में LLMs का बेहद कमज़ोर होना ही वह वजह थी जिसने हमें अपने कस्टम मॉडल और हार्नेस बनाने के लिए मजबूर कर दिया। शून्य से शुरुआत करना कई बार हौसला तोड़ देने वाला रहा। इसके लिए बहुत ज़्यादा प्रयोग और गलतियों से गुज़रना पड़ा, साथ ही प्लेटफॉर्म पर मौजूद 550k लेखकों और 100M+ यूज़र्स द्वारा तैयार किए गए एक गोल्डन डेटासेट की ज़रूरत पड़ी।
मैं आपको बताऊंगा कि हमने कुछ न होने से शुरू करके एक बेहतरीन तरीके से कैलिब्रेटेड राइटिंग मॉडल कैसे बनाया, Pocket FM टेस्टिंग के लिए सबसे सही जगह क्यों है, और ब्लॉकबस्टर लिखने की Sherpa की क्षमता के पीछे का असली राज़ क्या है।
ChatGPT के लॉन्च होने के बाद से, हर कोई यही कहता आया है कि यह बहुत ज़्यादा AI जैसा लगता है। जब आप किसी LLM से कुछ भी लिखने को कहते हैं, चाहे वह कितना भी छोटा या बड़ा हो, em-dashes आ ही जाते हैं, छोटे और चुटीले वाक्य राइटिंग में घुस आते हैं, और पूरा आउटपुट एक बड़े, उबाऊ काम जैसा पढ़ा जाता है।
LLMs को बुनियादी तौर पर लॉजिकल रीज़निंग, मैथ के सवालों के जवाब देने, कोडिंग में मदद करने और एनसाइक्लोपीडिक जानकारी निकालने के लिए डिज़ाइन किया गया था। उनकी ट्रेनिंग में ऐसी कोई चीज़ नहीं है जो उन्हें कुछ ऐसा लिखना सिखाए जिसे कोई पाठक अपनी मर्ज़ी से पढ़ना या सुनना चाहे। इसमें मॉडल्स की कोई गलती नहीं है।
Reinforcement learning तब सबसे अच्छा काम करता है जब आउटपुट किसी स्पष्ट सफलता संकेत से जुड़ा हो, ताकि मॉडल को यह ट्रेनिंग मिल सके कि कौन सी चीज़ काम आई। कोडिंग में, कोड या तो काम करता है और वही करता है जो आपने मांगा था, या फिर नहीं करता। जवाब पक्का होता है।
जब आप कुछ लिखते हैं, तो आप तुरंत नहीं बता सकते कि वह अच्छा है या नहीं। आपको यह नहीं पता होता कि पाठक ने पहला वाक्य पढ़कर ही छोड़ दिया या पूरा पढ़ा। इससे भी बुरी बात यह है कि 10 लोगों से किसी खास किताब या आर्टिकल के बारे में पूछिए जिसे उन्होंने पढ़ा है, और आपको 10 अलग-अलग जवाब मिलेंगे।
कंटेंट क्रिएशन और डिस्ट्रीब्यूशन दोनों पर नियंत्रण होने की वजह से Pocket FM एक बहुत ही अनोखी स्थिति में है। हम यूसेज को मिनट-दर-मिनट ट्रैक करते हैं। हमें पता होता है कि लोग सुनना कब बंद करते हैं, क्या वे अगला एपिसोड सुनने के लिए वापस आते हैं, और क्या वे लंबे समय तक हमारे साथ जुड़े रहते हैं। इससे बेहतर कोई संकेत नहीं हो सकता। जिस भी चीज़ से यूज़र बीच में छोड़कर जाता है, Sherpa उसे करने से बचना सीखता है; और जो भी चीज़ यूज़र को किसी खास शो से जोड़े रखती है, Sherpa उसे नए शोज़ के लिए इस्तेमाल करता है।

Pocket FM पर एक औसत यूज़र दिन में 150+ मिनट सुनता है, जो YouTube पर बिताए जाने वाले समय का लगभग 3 गुना और Netflix से ~50% ज़्यादा है। मेरा मानना है कि हम बेहद मनोरंजक, इमर्सिव और हाइपर-पर्सनलाइज़्ड कंटेंट की एक नई लहर की बिल्कुल शुरुआत में हैं, और जैसे-जैसे हमारे पास ज़्यादा डेटा आएगा, यह और भी बेहतर होती जाएगी।
AI राइटिंग AI जैसी क्यों लगती है
Dostoevsky एक शानदार लेखक इसलिए थे क्योंकि उन्होंने अपने किरदारों के व्यवहार और उनके विचारों में विरोधाभास और भावनाओं को दिखाया। Oscar Wilde और Fitzgerald इसलिए क्योंकि उन्होंने अपनी चतुर राइटिंग को इतनी खूबसूरती से सजाया कि आप पन्ने पलटते ही चले जाते हैं। Conan Doyle इसलिए क्योंकि उनमें आखिरी पल तक पाठक से जानकारी छिपाए रखने की कला थी।
जनरल-पर्पस LLMs को ठीक इसके उल्टा काम करने के लिए बनाया गया है, और इनके पास इसे बेहतर बनाने का कोई रास्ता नहीं है। ये सीधे जवाब देते हैं, न्यूट्रल भाषा में लिखते हैं, और बात को प्रभावशाली बनाने के लिए संसाधनों का ज़रूरत से ज़्यादा इस्तेमाल करते हैं। इसी तरह, अच्छे AI असिस्टेंट्स को आपको जल्दी से सही निष्कर्ष तक पहुंचाने के लिए ट्रेन किया जाता है। उनकी बनावट के ये सभी बुनियादी हिस्से उनकी राइटिंग में झलकते हैं, और यही कारण है कि वे इसमें कमज़ोर होते हैं।
क्रिएटिव राइटिंग के लिए तनाव, भावनाएं, रचना और टकराव का धीरे-धीरे समाधान, एक-लाइनर से कहीं आगे जाने वाले किरदारों के गुण, और गति में बदलाव ज़रूरी होते हैं। यूज़र्स को सुराग देते हुए गलत निष्कर्षों की ओर ले जाना चाहिए ताकि वे कहानी से जुड़े रहें।
यहां तक कि एक रीज़निंग मॉडल, जो सोचने में ज़्यादा समय लगाता है, आम तौर पर समस्या को सुलझाने की दिशा में काम कर रहा होता है, न कि दर्शकों को उस मुकाम तक पहुंचने के अनुभव के लिए रिवॉर्ड किया जा रहा हो। किसी रहस्य को सुलझाना और रहस्य लिखना — ये दो बिल्कुल अलग चीज़ें हैं।
मौजूदा चीज़ों में बदलाव करने की कोशिश में हम नाकाम रहे
शुरुआत में, हमने सोचा कि जो उपलब्ध है उसी से काम चल जाएगा। हमने रेडीमेड मॉडल्स आज़माए और उनकी बेजान कहानियों को सुधारने की उम्मीद में उन्हें रिफाइन करने की कोशिश की।
हमने सीधे तौर पर तेज़ मॉडल्स को प्रॉम्प्ट करने, कहानी के आगे बढ़ने के साथ रोलिंग समरी बनाए रखने, और सवालों के जवाब देने के लिए रिट्रीवल और नॉलेज ग्राफ का इस्तेमाल करने के प्रयोग किए।
सीधे प्रॉम्प्ट करने से, आप 10-20 विसंगतियों के साथ 100वें एपिसोड तक पहुंच जाते हैं। रोलिंग समरी असल में महत्वपूर्ण विवरणों को हवा में उड़ा देती है, जिसके बाद कहानी कमज़ोर पड़ जाती है। बड़ा context window मदद करता है, लेकिन फिर भी मॉडल्स को लंबे कॉन्टेक्स्ट में जानकारी का सटीक इस्तेमाल करने में दिक्कत आ सकती है।
असली आउटपुट के अलावा, क्वेरीज़ इस बात का सबसे अच्छा पैमाना हैं कि मॉडल ने जो लिखा है उसे वह कितना समझता है। शुरुआत में ही हमने महसूस कर लिया कि हम किसी मॉडल पर कितनी भी मेहनत कर लें, वह मल्टी-हॉप नैरेटोलॉजिकल क्वेरीज़ का जवाब देने में नाकाम रहा, जिनके लिए कई एपिसोड्स के विवरणों की ज़रूरत होती है। इससे तकनीक की मौजूदा सीमाओं का पता चला।
हमने यह निष्कर्ष निकाला कि यह रास्ता आगे नहीं चल सकता और हमने अपनी खुद की तकनीक बनाने का फैसला किया... Sherpa, जिसे कहानी सुनाने के सबसे कठिन हिस्सों में लेखक का मार्गदर्शन करने के लिए बिल्कुल सही नाम दिया गया है
तकनीकी कारण जिनकी वजह से Sherpa वह कहानी लिखता है जिसे आप सुनना चाहते हैं
Sherpa एक लॉन्ग-फॉर्म, सीरियलाइज़्ड क्रिएटिव राइटिंग मॉडल हार्नेस है। यह तीन हिस्सों से बना है, जिन्हें मैं इस परिचय के बाद विस्तार से बताऊंगा:
- एक प्लानर यह तय करता है कि हर आर्क और सीन को क्या हासिल करना है, और किरदारों के विकास व उनके रिश्तों में बदलाव के बारे में सोचता है।
- एक Narrative World Model इस बात का स्ट्रक्चर्ड रिकॉर्ड रखता है कि क्या हुआ है, हर किरदार को क्या पता है, और कहानी अभी भी दर्शकों से कौन से वादे पूरे करने वाली है।
- एक प्रोज़ इंजन उस प्लान और स्थिति के आधार पर ड्राफ्ट तैयार करता है, जबकि क्रिटिक्स किरदारों के व्यवहार, निरंतरता और सीन की क्वालिटी की जांच करते हैं। इसके बाद लेखक के एडिट और दर्शकों का रिस्पॉन्स अगले वर्ज़न को बेहतर बनाने में मदद करते हैं।
नतीजे काफी उत्साहजनक हैं। जब Sherpa और उसके हर प्रतिद्वंद्वी ने एक खाली पेज से कहानी लिखी, तो ब्लाइंडेड पेयरवाइज़ जजमेंट में 65.6% से 97.1% मामलों में Sherpa को पसंद किया गया, जो इस बात पर निर्भर करता था कि प्रतिद्वंद्वी कौन है। Sherpa के reinforcement learning और Pocket के बढ़ते डेटासेट को देखते हुए, इस अंतर के और बढ़ने की पूरी संभावना है।

मेमोरी - Narrative World Model (NWM)
लैंग्वेज मॉडल्स में एक कॉल से दूसरी कॉल के बीच कोई मेमोरी नहीं होती, इसलिए कहानी के बारे में उन्हें जो कुछ भी पता होना चाहिए, वह सब प्रॉम्प्ट में फिट होना चाहिए। लंबे context windows इसका समाधान नहीं हैं क्योंकि मॉडल्स लंबे प्रॉम्प्ट के बीच में दबी जानकारी का असमान इस्तेमाल करते हैं। रॉ टेक्स्ट पर रिट्रीवल भी इसे हल नहीं करता। सर्च वह हिस्सा तो दिखा सकता है जिसमें बताया गया हो कि कोई चीज़ कहां थी, लेकिन यह नहीं बता सकता कि वह अभी कहां है।
जब Sherpa के साथ कोई एपिसोड फाइनल होता है, तो एक मॉडल उसमें से स्ट्रक्चर्ड रिकॉर्ड निकालता है, जिनमें से हर एक उस हिस्से से जुड़ा होता है जो उसका समर्थन करता है। ये फील्ड फिक्शन के लिए बनाए गए हैं: किरदारों को क्या पता है और अभी तक क्या नहीं पता, कोई घटना कब हुई बनाम दर्शकों को उसके बारे में कब पता चला, और कौन सी तैयारी अपने नतीजे का इंतज़ार कर रही है। हर तथ्य उस चैप्टर से मान्य होता है जिसने उसे स्थापित किया, उस चैप्टर तक जो उसे बदल देता है। अगर कोई लेखक पहले के किसी चैप्टर में बदलाव करता है, तो उस पर निर्भर हर चीज़ दोबारा बनाई जाती है।
सवालों के जवाब देने के लिए, NWM एक ही समय में सटीक शब्दों और अर्थ दोनों के आधार पर ग्राफ को सर्च करता है, हर नतीजे के सीधे कनेक्शन खींचता है, और मॉडल को एक छोटा, फोकस्ड पैकेट सौंपता है।
इसका एपिसोड-अवेयर रिट्रीवल सिर्फ प्रासंगिक कैनन सामने लाता है, जिससे भविष्य की कहानी लीक हुए बिना मल्टी-हॉप रीज़निंग संभव हो पाती है। 60 आइटम वाले एक इंटरनल बेंचमार्क में, Sherpa NWM ने $0.7793 प्रति रन की लागत पर 86.7% (52/60) सटीकता हासिल की। यह वही सटीकता है जो opus 5.x क्लास मॉडल्स के साथ Claude Code के मेमोरी हार्नेस की है, लेकिन लगभग 21× कम लागत ($16.2172 प्रति रन) पर। इसने प्रोज़-ओनली रिट्रीवल को 20 प्रतिशत अंक (66.7% → 86.7%) से पीछे छोड़ा, जबकि इसकी लागत काफी कम थी।

प्रोज़ इंजन: इतना मुश्किल कि हमें अपना मॉडल बनाना पड़ा
Reinforcement learning को एक रिवॉर्ड सिग्नल की ज़रूरत होती है, और प्रोज़ में ऐसा कोई साफ सिग्नल नहीं होता। किसी पैराग्राफ के लिए ऐसा कोई टेस्ट नहीं है जो बता सके कि वह नोबेल पुरस्कार के लायक है या सिर्फ जगह भरने वाला।
Sherpa राइटिंग के काम के हर हिस्से को एक अलग मॉडल को सौंपता है। हर किरदार एक एजेंट है, जो हमारे कस्टम, पोस्ट-ट्रेन्ड मॉडल्स पर चलता है और अपने व्यक्तित्व, कहानी के मौजूदा लक्ष्य, हाल की घटनाओं, और दुनिया के उन हिस्सों के आधार पर यह बताता है कि वह आगे क्या करने वाला है जो उससे जुड़े हैं। एक अलग क्रिटिक मॉडल हर प्रस्ताव की समीक्षा करता है और जो कुछ भी अस्पष्ट, अविश्वसनीय, किरदार से मेल न खाने वाला, दोहराव वाला, या कहानी को आगे न बढ़ाने वाला हो, उसे वापस भेज देता है। फिर तीसरा मॉडल, यानी नैरेटर, चुनता है कि कौन से प्रस्ताव सीन के लिए सही हैं और उन्हें अगले पैराग्राफ में लिखता है। केवल वे ही एक्शन कहानी की मेमोरी में जुड़ते हैं जो पेज पर पहुंचते हैं।
इसके अलावा, हम सीरियलाइज़्ड फिक्शन के लिए बनाए गए रिवॉर्ड फंक्शंस के साथ एक प्रोप्राइटरी प्रोज़ मॉडल को ट्रेन कर रहे हैं। हम भड़कील भाषा, दोहराव और ज़रूरत से ज़्यादा व्याख्या को दंडित करते हैं, और स्वाभाविक संवाद, आवाज़ों और तनाव को रिवॉर्ड करते हैं।
वे सिग्नल जिनके आधार पर हम प्रोज़ को मापते हैं:
- क्या यह स्थापित घटनाओं या किरदार की जानकारी का खंडन करता है?
- क्या यह एक्शन विश्वसनीय है, किरदार के अनुसार है, और सीन को आगे बढ़ा रहा है?
- क्या लेखक किसी विकल्प की तुलना में इस संवाद, आवाज़ और गति को पसंद करते हैं?
- क्या सुनने वाले एपिसोड पूरा सुनते हैं और बाद वाले एपिसोड के लिए वापस आते हैं?
ये सिग्नल अलग-अलग समय-सीमा पर काम करते हैं। कोई वाक्य सुनने में अच्छा लग सकता है लेकिन कैनन को तोड़ सकता है, और कोई क्लिफहैंगर अगले एपिसोड की शुरुआत को बेहतर बना सकता है लेकिन पूरे आर्क को कमज़ोर कर सकता है। Sherpa को "अच्छी राइटिंग" के लिए रिटेंशन को एक ही स्कोर मानकर नहीं चलना चाहिए क्योंकि यह बहुत व्यक्तिपरक है, बल्कि उसे इन सभी सिग्नल्स के बीच संतुलन बनाना होगा।
Sherpa का प्रोज़ इंजन पहले से ही हमारे इंटरनल फिक्शन बेंचमार्क्स में मूल्यांकन किए गए ज़्यादातर ओपन और कमर्शियल मॉडल्स को पीछे छोड़ रहा है, जिसमें Sonnet 5 के खिलाफ 69% और Gemini 3.1 Pro के खिलाफ 94% प्रोज़ प्रिफरेंस स्कोर हैं। हर बार में दिए गए मॉडल की तुलना में Sherpa की राइटिंग को दी गई प्राथमिकता दिखाई गई है, जिसका जजमेंट दोनों प्रेजेंटेशन ऑर्डर में किया गया है, और 50% बराबरी को दर्शाता है। ये चल रही पोस्ट-ट्रेनिंग के शुरुआती नतीजे हैं, और हमें उम्मीद है कि ट्रेनिंग जारी रहने पर और सुधार होगा।

हाइरार्किकल स्टोरी प्लानर
कहानी का स्ट्रक्चर पूरे शो की विशेषता होती है, और लैंग्वेज मॉडल सिर्फ अगला हिस्सा जनरेट करते हैं। नेक्स्ट-वर्ड प्रिडिक्शन में कुछ भी यह नहीं जानता कि एपिसोड 5 में बोया गया सुराग एपिसोड 60 में अपना नतीजा देने वाला है, या इस चैप्टर को एक लक्ष्य, एक टकराव और एक नतीजे की ज़रूरत है। एक फ्रंटियर मॉडल की 100 पेज की कहानी में, सिर्फ पांच चैप्टर की सैंपलिंग करने वाले AI एडिटर ने 52 स्ट्रक्चरल समस्याएं पकड़ीं: ऐसी प्रगति जो काम नहीं कर रही थी, और ऐसे चैप्टर जिनकी कहानी को ज़रूरत ही नहीं थी।
Sherpa का प्लानर पूरी कहानी से शुरू होकर आर्क और एपिसोड्स तक नीचे आता है और हर सीन को एक काम सौंपता है, जिसमें यह भी शामिल है कि उसे क्या अधूरा छोड़ना है, ताकि एपिसोड 20 एपिसोड 80 के खुलासे की तैयारी कर सके बिना उसे ज़ाहिर किए। हर सेटअप को कहानी की मेमोरी में एक खुले वादे के रूप में तब तक स्टोर किया जाता है जब तक उसका नतीजा नहीं आ जाता। एक गोल जेनरेटर कहानी को आगे बढ़ाता रहता है: जब कोई लक्ष्य पूरा हो जाता है या रुक जाता है, तो वह एक नया लक्ष्य तय करता है जो पहले के किसी भी लक्ष्य की नकल नहीं करता। उसी 100 पेज के टेस्ट में, स्ट्रक्चरल समस्याएं 52 से घटकर 31 रह गईं, और सिर्फ गोल अपडेट्स को हटाने से चैप्टर-लेवल क्रिटिक में लगभग आधा सुधार हुआ।

अगले कुछ सालों में Sherpa के जरिए लेखकों को बिलियन-डॉलर IP बनाने में मदद करने के लिए सब कुछ तैयार है। जैसे-जैसे हम प्लेटफॉर्म पर ज़्यादा क्रिएटर्स और यूज़र्स को जोड़ रहे हैं, Sherpa लगातार बेहतर होता जा रहा है।
आगे बहुत काम बाकी है, और कई मुद्दे अभी भी अनसुलझे हैं; Sherpa को परफेक्ट बनाना इनमें से एक है, और लेखकों के लिए इसे बेहतरीन तरीके से इस्तेमाल करने के लिए ज़रूरी लॉजिस्टिकल हालात बनाना भी।
मैं Pocket FM में हम जो कर रहे हैं उसको लेकर बेहद उत्साहित हूं। हम क्रिएटर्स को ऐसी कहानियां सुनाकर अपनी आजीविका कमाने में मदद कर रहे हैं जिनके लिए कुछ साल पहले करोड़ों डॉलर के बजट की ज़रूरत होती।
$1T के इस अवसर की अभी तो बस शुरुआत है।





