दुनिया की सबसे चतुर प्रयोगशाला ने गलती से गलत उत्पाद कैसे भेज दिया
मैंने Anthropic के सबसे सक्षम सार्वजनिक मॉडल से Anthropic के बारे में एक निबंध संपादित करने को कहा। उसे मौका ही नहीं मिला। मैंने यह ड्राफ्ट संलग्न किया और सात हानिरहित शब्द टाइप किए: “Redraft make this POP. Format for Twitter.” ऐप ने स्वचालित रूप से कार्य को Fable 5 से Opus 4.8 पर स्विच कर दिया। इसका स्पष्टीकरण सरल था: “Fable की सुरक्षा प्रणालियों ने इस संदेश को फ़्लैग किया।”
सटीक कहें तो, यह सामान्य रेट लिमिटिंग नहीं थी। Fable ने उत्तर नहीं दिया और मना नहीं किया। Anthropic की सुरक्षा प्रणाली ने चयनित मॉडल के जवाब देने से पहले ही अनुरोध को रोक लिया और इसे दूसरे मॉडल पर भेज दिया। Anthropic ने समझाया है कि यह ठीक वैसे ही काम करता है: जब Fable का क्लासिफायर किसी अनुरोध को ब्लॉक करता है, तो अनुरोध Opus 4.8 को भेज दिया जाता है। कंपनी ने यह भी स्वीकार किया है कि उसने जानबूझकर क्लासिफायर की सुरक्षा मार्जिन को बढ़ाया, यह जानते हुए कि इसका परिणाम हानिरहित कार्यों पर अधिक झूठी सकारात्मकताएं होंगी। (Anthropic
मुझे नहीं पता कि सुरक्षा प्रणाली क्यों सक्रिय हुई, और मैं यह दावा नहीं कर रहा कि Anthropic ने आलोचना को सेंसर किया। सत्यापन योग्य—और काफी अजीब—तथ्य यह है कि एक नियमित संपादन अनुरोध एक ऐसी सुरक्षा प्रणाली द्वारा पकड़ा गया जिसकी अपनी चेतावनी में वैध कोडिंग, साइबर सुरक्षा और जीवविज्ञान कार्यों में झूठी सकारात्मकताओं पर चर्चा की गई थी। यह उस टीम के बारे में एक निबंध के लिए लगभग हास्यपूर्ण रूप से एकदम सही शुरुआत थी जिसने वह बनाया जिसे कई लोग ग्रह पर सबसे शानदार AI प्रणाली मानते हैं।
यह निबंध जांचता है कि क्या होता है जब कोई प्रणाली अपने व्यक्तिगत भागों के प्रदर्शन में इतनी व्यस्त हो जाती है कि वह उस परिणाम की दृष्टि खो देती है जिसे उत्पन्न करने के लिए पूरी प्रणाली मौजूद है। मॉडल शानदार हो सकता है, सुरक्षा प्रणाली बिल्कुल डिज़ाइन के अनुसार काम कर सकती है, और मूल्य निर्धारण नीति इसे बनाने वालों को पूरी तरह से समझ में आ सकती है। उपयोगकर्ता का काम फिर भी अधूरा रह सकता है।
प्रदर्शनी A:

मैंने Fable 5 से इस लेख को संपादित करने को कहा। Anthropic की सुरक्षा प्रणालियों ने अनुरोध को फ़्लैग किया और इसे Opus 4.8 पर स्विच कर दिया।
मुर्गियाँ और उनके अंडे
1982 में, पर्ड्यू विश्वविद्यालय के आनुवंशिकीविद् विलियम मुइर ने अंडे देने वाली मुर्गियों के साथ एक असामान्य प्रजनन प्रयोग शुरू किया। मुइर यह जानना चाहते थे कि यदि उत्पादकता को व्यक्ति के बजाय समूह के स्तर पर चुना जाए तो क्या होगा। केवल सबसे अधिक उत्पादन करने वाली व्यक्तिगत मुर्गियों—व्यक्तिगत उत्पादन का एक माप—से प्रजनन करने के बजाय, उन्होंने संबंधित मुर्गियों को एक साथ रखा और उनके सामूहिक प्रदर्शन के अनुसार पूरे परिवार समूहों का चयन किया। पिंजरा, न कि अलग मुर्गी, चयन की इकाई बन गया। (PubMed
मार्गरेट हेफ़रन ने बाद में मुइर के तकनीकी प्रजनन कार्यक्रम को प्रसिद्ध “सुपरचिकन” कहानी में बदल दिया। प्रबंधकों के लिए, उनकी कहानी एक अशुभ चेतावनी बन गई: सबसे मजबूत और सबसे चतुर लोगों को काम पर रखना हमेशा सबसे अच्छा उत्पादन नहीं देता। उनके पुनर्कथन में, मुर्गियों के एक झुंड को एक सामान्य झुंड बने रहने दिया गया—कोई सुपरचिकन नहीं। दूसरे समूह को बार-बार सबसे अधिक उत्पादक व्यक्तिगत मुर्गियों से प्रजनित किया गया; वह उन्हें “ऑल-स्टार मुर्गियाँ” कहती हैं। (Purdue Alumnus
परिणाम नाटकीय थे। छह पीढ़ियों में, मुइर के समूह-चयनित झुंड में वार्षिक मृत्यु दर 68 प्रतिशत से गिरकर 8.8 प्रतिशत हो गई। इसी अवधि में, उत्पादन प्रति मुर्गी 91 से बढ़कर 237 अंडे हो गया—अपने मूल उत्पादन का 2.6 गुना। बाद में बारह के समूहों में किए गए एक सीधे मुकाबले में, व्यक्तिगत प्रदर्शन के लिए पैदा की गई एक वाणिज्यिक लाइन में 58 सप्ताह की आयु तक 89 प्रतिशत मृत्यु दर हुई। मुइर की समूह-चयनित लाइन में केवल 20 प्रतिशत मृत्यु दर हुई, जबकि अचयनित नियंत्रण में 54 प्रतिशत मृत्यु दर हुई। उसी समूह वातावरण में, समूह-चयनित झुंड ने प्रति मुर्गी अंडे, अंडे का द्रव्यमान और प्रति मुर्गी प्रति दिन अंडे में वाणिज्यिक ऑल-स्टार से बेहतर प्रदर्शन किया। (PubMed
इस बीच, सुपरचिकन का झुंड उखड़ा हुआ और थका हुआ था। प्रयोग के उस संस्करण में जिसने कहानी को प्रसिद्ध बनाया, नौ में से छह ऑल-स्टार मुर्गियाँ मर चुकी थीं और बाकी तीन को नोच-नोच कर नंगा कर दिया गया था। झुंड ने, लगभग शाब्दिक रूप से, खुद को मौत के घाट उतार दिया था। (Purdue Alumnus
सबक यह कभी नहीं था कि औसत दर्जा प्रतिभा को हरा देता है। असली सबक यह है कि आपका उत्पादन वही दर्शाएगा जिसे आप पुरस्कृत करते हैं। केवल व्यक्तिगत प्रदर्शन के लिए चयन करें और आप गलती से एक कमजोर टीम बना सकते हैं, क्योंकि जो लक्षण एक व्यक्ति को हावी होने देते हैं, वे उनके आसपास के सभी लोगों की उत्पादकता को कम कर सकते हैं। व्यक्तियों का चयन उसके अनुसार करें जो वे समूह में योगदान करते हैं, और वे गुण जो एक व्यक्तिगत रैंकिंग के अंदर गायब हो जाते हैं—अनुकूलता, संयम, विश्वसनीयता और सहयोग—अचानक दिखाई देने लगते हैं।
एक मुर्गी का वास्तविक योगदान केवल यह नहीं है कि वह कितने अंडे दे सकती है। इसमें वह भी शामिल है जो उसकी उपस्थिति अन्य मुर्गियों को उत्पादन करने की अनुमति देती है—या रोकती है। मुइर ने सद्भाव के पक्ष में उत्पादकता का त्याग नहीं किया था। उन्होंने खोजा था कि, एक सामाजिक व्यवस्था में, सद्भाव उत्पादकता का हिस्सा है। प्रदर्शन की असली इकाई कभी मुर्गी नहीं थी। वह कूप (coop) था।
मैंने अपनी खुद की निर्माण कंपनी चलाते हुए इस कठिन सबक का एक संस्करण सीखा। वर्षों तक, हमारे विशेष व्यापार में भरोसेमंद मदद ढूंढना इतना मुश्किल था कि एक ऑल-स्टार मुक्ति जैसा लगता था। लेकिन जो लोग ऑल-स्टार दिखते थे, वे अक्सर एक छिपे हुए कर के साथ आते थे: अतिरिक्त अपवाद, अतिरिक्त प्रबंधन, क्षतिग्रस्त मनोबल, और घर्षण जिसे बाकी टीम को सहन करना पड़ता था।
आखिरकार, मैंने केवल यह पूछना बंद कर दिया, “यह व्यक्ति अपने शिल्प में कितना अच्छा है?” और यह पूछना शुरू कर दिया, “जब यह व्यक्ति टीम में शामिल होता है तो बाकी सभी के काम का क्या होता है?” जो व्यक्ति सबसे मजबूत दिखता है, वह हमेशा वह नहीं होता जो वास्तव में कंपनी को मजबूत बनाता है। एक मास्टर कारीगर जो हर आसन्न व्यापार को धीमा कर देता है, फोरमैन का ध्यान खा जाता है, या भरोसेमंद लोगों को भगा देता है, वह अकेले में प्रभावशाली और व्यवहार में महंगा हो सकता है। एक शांत कार्यकर्ता जो पूरी टीम को अधिक विश्वसनीय बनाता है, वह अपने व्यक्तिगत उत्पादन से कहीं अधिक योगदान दे सकता है।
सुपरकूप (Supercoop)
Anthropic ने वास्तव में बहुत चतुर मुर्गियों का एक असाधारण झुंड इकट्ठा किया है। 2025 के एक SignalFire विश्लेषण, जो सार्वजनिक रोजगार डेटा पर आधारित था, ने अनुमान लगाया कि इंजीनियरों के OpenAI से Anthropic में जाने की संभावना उलट की तुलना में आठ गुना अधिक थी और DeepMind से वहाँ जाने की संभावना लगभग ग्यारह गुना अधिक थी। इसने यह भी अनुमान लगाया कि कम से कम दो साल पहले काम पर रखे गए 80 प्रतिशत Anthropic कर्मचारी अपने दूसरे वर्ष के अंत तक बने रहे, जबकि DeepMind में यह 78 प्रतिशत और OpenAI में 67 प्रतिशत था। (SignalFire
ये संख्याएँ एक ऐसी कंपनी का वर्णन नहीं करतीं जो प्रतिभा को आकर्षित करने या बनाए रखने में संघर्ष कर रही है। वे ऑल-स्टार के लिए एक चुंबक का वर्णन करती हैं।
इसका मतलब यह नहीं है कि Anthropic के कर्मचारी एक-दूसरे को नोच-नोच कर मार रहे हैं। यह एक सस्ती उपमा होगी, और प्रतिभा संख्याएँ इसे साबित नहीं करतीं। अधिक महत्वपूर्ण खतरा सूक्ष्म है। जब कोई कंपनी विश्वसनीय रूप से असाधारण शोधकर्ताओं, असामान्य रूप से उच्च प्रतिधारण और सीमा-अग्रणी मॉडलों की ओर इशारा कर सकती है, तो व्यक्तिगत भागों में उत्कृष्टता को इस बात के प्रमाण के रूप में मानना आसान हो जाता है कि पूरी प्रणाली काम कर रही है।
मुइर का प्रयोग दर्शाता है कि इस अनुमान पर भरोसा क्यों नहीं किया जा सकता। खतरा प्रतिभा ही नहीं है। खतरा एक स्तर नीचे प्रदर्शन को मापना है।
मॉडल उत्पाद नहीं है
AI उद्योग सुपरचिकन पर बना है: प्रसिद्ध शोधकर्ता, बेंचमार्क-अग्रणी मॉडल, विशाल मुआवजा पैकेज, और अतिशयोक्तियों से भरे लॉन्च पेज। प्रयोगशाला के अंदर, पदानुक्रम स्पष्ट है। बाहर, हम केवल अंडे देखते हैं।
सिलिकॉन वैली में एक स्पष्ट अंधा धब्बा है: आपकी टीम असाधारण हो सकती है जबकि आपके द्वारा बनाया गया उत्पाद निराशाजनक, दुर्गम या अविश्वसनीय बना रहे।
दैनिक उपयोगकर्ता किसी मॉडल को उसकी प्रतिभाशाली मुर्गियों की टीम या बेंचमार्क के आधार पर नहीं आंकते। हमारे पास केवल मॉडल, ऐप, सुरक्षा प्रणालियाँ, उपयोग सीमाएँ, मूल्य निर्धारण और ग्राहक सहायता है।
दो कंपनियाँ, 74 मिनट का अंतर
17 जुलाई को, Anthropic ने Fable की भारी मांग के जवाब में एक समझौता किया। 20 जुलाई से, Max और Team Premium सब्सक्राइबर्स को अपनी योजनाओं के हिस्से के रूप में Fable मिलेगा, लेकिन उनकी सामान्य सीमाओं के आधे पर। Pro और Team Standard उपयोगकर्ता उपयोग क्रेडिट के माध्यम से मॉडल तक पहुँच जारी रखेंगे और उन्हें एकमुश्त $100 का क्रेडिट मिलेगा।
https://x.com/claudeai/status/2078302415804379218
चौहत्तर मिनट बाद, OpenAI के थिबॉल्ट सोटियाक्स ने घोषणा की कि प्रत्येक भुगतान करने वाले Codex और ChatGPT Work उपयोगकर्ता के लिए उपयोग सीमाएँ रीसेट कर दी गई हैं।
ये आर्थिक रूप से समान प्रस्ताव नहीं थे। Anthropic एक असामान्य रूप से कम्प्यूट-गहन मॉडल के लिए एक सतत पहुँच नीति स्थापित कर रहा था, जबकि OpenAI एक कठिन उत्पाद लॉन्च के बाद एक अस्थायी रीसेट प्रदान कर रहा था। यह आरक्षण मायने रखता है। उत्पाद मुद्रा में अंतर फिर भी मुश्किल से छूटने वाला था।
https://x.com/thsottiaux/status/2078320950488297917
OpenAI पूर्णता की स्थिति से काम नहीं कर रहा था। उसने हाल ही में अपने डेस्कटॉप और ChatGPT Work रोलआउट के कुछ हिस्सों को गड़बड़ कर दिया था, और सोटियाक्स ने सार्वजनिक रूप से स्वीकार किया था कि कंपनी “सब कुछ बिल्कुल सही नहीं कर पाई।” उपयोगकर्ताओं को भ्रमित करने वाली उच्च-कम्प्यूट सेटिंग्स, अपारदर्शी उपयोग लागत और एक रीडिज़ाइन का सामना करना पड़ा जिसने परिचित वर्कफ़्लो को बाधित कर दिया। OpenAI ने डिफ़ॉल्ट बदलकर, इंटरफ़ेस को ठीक करने का वादा करके, और बार-बार उपयोग रीसेट करके जवाब दिया ताकि ग्राहक काम करना जारी रख सकें।
एक संगठन कमी को सही ठहरा रहा था।
दूसरा सद्भावना पैदा कर रहा था।
OpenAI औसत दर्जे की मुर्गियों का झुंड नहीं है। वह भी असाधारण प्रतिभा से भरा है, और उसने अपनी गंभीर सांस्कृतिक और उत्पाद गलतियाँ की हैं। इस क्षण में सार्थक अंतर बुद्धिमत्ता नहीं है, न मॉडलों में और न ही कूप में। यह वह है जो दबाव आने पर सिस्टम पुरस्कृत करता प्रतीत होता है।
अपने सर्वश्रेष्ठ रूप में, OpenAI की वर्तमान उत्पाद मुद्रा बेहद सामान्य है। यह उपयोगकर्ता के कार्य से शुरू होती है: यह व्यक्ति क्या पूरा करने की कोशिश कर रहा है? उन्हें पूरा करने से क्या रोक रहा है? घर्षण कहाँ है, और हम इसे कितनी जल्दी दूर कर सकते हैं? रीसेट यह साबित नहीं करते कि OpenAI ने उत्पाद संस्कृति को हल कर लिया है, लेकिन यह उपयोगकर्ताओं को अपनी गलतियों की कुछ लागत को वहन करने की प्रवृत्ति प्रदर्शित करता है, बजाय इसके कि उन्हें सारा बोझ उठाने दिया जाए।
Anthropic की उत्पाद मुद्रा अक्सर कुछ अलग संचार करती है: हमने असाधारण बुद्धिमत्ता बनाई है, और हमारी प्रमुख जिम्मेदारी यह निर्धारित करना है कि आप इसे कितनी सुरक्षित रूप से एक्सेस कर सकते हैं। यह एक सुसंगत संस्थागत मुद्रा हो सकती है, लेकिन यह ग्राहक-केंद्रित नहीं है। सुनहरे अंडे प्रभावशाली हैं, लेकिन वे परिवार का पेट नहीं भरते जब कूप आपको उन्हें इकट्ठा करने नहीं देता।
एक कंपनी तेजी से अपने आप को उपयोगकर्ता के कार्य के आसपास संगठित कर रही है। दूसरी अभी भी खुद को प्रणालीगत जोखिम के आसपास संगठित करती है। दोनों कंपनियों को दोनों प्रश्नों की परवाह करनी चाहिए, लेकिन जो प्रश्न वे पहले पूछते हैं, वह उस उत्पाद को आकार देता है जिसे वे अंततः बनाते हैं। अंतर केवल मिशन वक्तव्यों में नहीं दिखता। यह रूटिंग, सीमाओं, मूल्य निर्धारण, संचार और सिस्टम के विफल होने पर विश्वास की मरम्मत की इच्छा में दिखता है।
पूरा कूप (coop)
संस्कृति वह नहीं है जो कोई कंपनी अपने बारे में कहती है। संस्कृति वह है जिसे उसकी प्रणालियाँ बार-बार आसान बनाती हैं—और जिसे वे बार-बार कठिन बनाती हैं।
Anthropic को कम प्रतिभाशाली लोगों की आवश्यकता नहीं है। इसे सफलता की एक व्यापक परिभाषा की आवश्यकता है, जिसमें न केवल मॉडल बुद्धिमत्ता और सुरक्षा प्रणाली की ताकत शामिल हो, बल्कि पहुँच, विश्वसनीयता, पारदर्शिता और विश्वास भी शामिल हो। ग्राहक की ओर से, अंतिम माप आश्चर्यजनक रूप से सरल है: क्या मैं काम पूरा करने के लिए इस पूरी प्रणाली पर भरोसा कर सकता हूँ?
मुइर ने अपनी मुर्गियों को कम उत्पादक नहीं बनाया। उन्होंने उस स्तर को बदल दिया जिस पर उत्पादकता मापी गई और खोजा कि सामूहिक प्रदर्शन में वह जानकारी होती है जिसे एक व्यक्तिगत अंडे की गणना कैद नहीं कर सकती। समूह प्रदर्शन के लिए चुनी गई मुर्गियाँ स्वस्थ और अधिक उत्पादक बन गईं क्योंकि विनाशकारी अंतःक्रिया अब मीट्रिक के लिए अदृश्य नहीं थी। सहयोग उत्पादन का एक भावनात्मक विकल्प नहीं है। यह उन परिस्थितियों में से एक है जिसने अधिक उत्पादन को संभव बनाया।
फ्रंटियर-मॉडल दौड़ उसी चरण में प्रवेश कर रही है। जब केवल एक प्रयोगशाला असाधारण बुद्धिमत्ता उत्पन्न कर सकती है, तो सबसे चतुर मॉडल सबसे अच्छे उत्पाद से अप्रभेद्य दिख सकता है। एक बार जब कई प्रयोगशालाएँ असाधारण बुद्धिमत्ता उत्पन्न कर सकती हैं, तो प्रतिस्पर्धात्मक लाभ पूरी प्रणाली में बाहर की ओर बढ़ जाता है।
दुनिया का सबसे चतुर मॉडल अब स्वचालित रूप से सबसे अच्छा उत्पाद या सबसे अच्छा बाज़ार फिट नहीं है। Claude AI में सबसे बड़ी और सबसे चतुर मुर्गी हो सकती है, लेकिन कूप के बाहर कोई भी मुर्गियों को ग्रेड नहीं देता। हम केवल अंडे गिन रहे हैं।
—
स्रोत
William M. Muir, “Group Selection for Adaptation to Multiple-Hen Cages,” Poultry Science (1996).
https://pubmed.ncbi.nlm.nih.gov/8786932/
William M. Muir, “Incorporation of Competitive Effects in Breeding Programs,” Purdue University.
https://web.ics.purdue.edu/~bmuir/papers/muir%20group%20selection%20genetics%20final%20v2.pdf
Margaret Heffernan, A Bigger Prize.
https://www.hachettebookgroup.com/titles/margaret-heffernan/a-bigger-prize/9781610392914/
Margaret Heffernan, “Is the Professional Pecking Order Doing More Harm Than Good?,” NPR/TED Radio Hour.
SignalFire, “The State of Tech Talent Report — 2025.”
https://www.signalfire.com/blog/signalfire-state-of-talent-report-2025
Anthropic, “Claude Fable 5 and Claude Mythos 5.”
https://www.anthropic.com/news/claude-fable-5-mythos-5
—
AI प्रकटीकरण: मैंने तर्क विकसित किया और अपने अनुभव से मूल ड्राफ्ट लिखा, फिर निबंध के कुछ हिस्सों पर शोध, पुनर्संरचना और पुनर्लेखन के लिए ChatGPT का उपयोग किया। मैंने अंतिम पाठ की समीक्षा और संशोधन किया और इसके दावों और निष्कर्षों की जिम्मेदारी लेता हूँ।
**मेरे द्वारा बनाई जा रही चीज़ के बारे में उत्सुक हैं?
एक AI जो अपने स्रोतों का हवाला देता है:**





