YouMind
साइन इन करें

वर्ल्ड मॉडल्स का एक कार्यात्मक वर्गीकरण

@drfeifei
अंग्रेज़ी03 जून 2026
787K
4.3K
874
150
5.7K

TL;DR

यह लेख AI वर्ल्ड मॉडल्स के लिए एक कार्यात्मक वर्गीकरण को परिभाषित करता है, उन्हें रेंडरर्स, सिमुलेटर्स और प्लानर्स में वर्गीकृत करता है, और यह तर्क देता है कि वास्तविक स्थानिक बुद्धिमत्ता प्राप्त करने के लिए सिमुलेशन एक महत्वपूर्ण कड़ी है।

“दुनिया वह सब कुछ है जो मामला है।” — लुडविग विट्गेन्स्टाइन,

ट्रैक्टेटस लॉजिको-फिलॉसॉफिकस

, 1921

दुनिया शब्दों से नहीं बनी है।

एक पिछले निबंध में, हमने तर्क दिया कि स्थानिक बुद्धिमत्ता AI की अगली सीमा है और विश्व मॉडल इसका रास्ता हैं। यहाँ, World Labs टीम और मैं एक स्तर और गहराई में जाना चाहते हैं: अब जो अनेक चीज़ें बनाई जा रही हैं और 'विश्व मॉडल' कहलाती हैं, उनमें से कौन से कार्यात्मक टुकड़े वास्तव में उस क्षमता का निर्माण करते हैं — और प्रत्येक किसके लिए है?

भाषा मॉडलों ने मशीनों को अवधारणाओं, शब्दावली और तर्क पर असाधारण पकड़ दी है, लेकिन भौतिक दुनिया, चाहे आभासी हो या वास्तविक, एक अलग आधार पर चलती है। जहाँ भाषा मॉडल पाठ की सांख्यिकीय संरचना सीखते हैं, वहीं विश्व मॉडल स्थान और समय की सांख्यिकीय संरचना सीखते हैं: प्रकाश किसी सतह पर कैसे पड़ता है, कोई बगीचा उस कोण से कैसा दिखता है जिसे किसी कैमरे ने कभी कैप्चर नहीं किया, वस्तुएँ बल पर कैसे प्रतिक्रिया करती हैं और भौतिकी के नियमों का पालन कैसे करती हैं।

यह "विश्व मॉडल" शब्द को आज AI में सबसे महत्वपूर्ण और सबसे अधिक ओवरलोडेड शब्दों में से एक बनाता है। कंप्यूटर विज़न, रोबोटिक्स, रीइन्फोर्समेंट लर्निंग और जनरेटिव AI, सभी विश्व मॉडल बनाने का दावा करते हैं, और प्रत्येक का मतलब काफी अलग होता है। एक वीडियो मॉडल जो शानदार लेकिन भौतिक रूप से असंभव लपटें उत्पन्न करता है, एक भाषा मॉडल जो एक खेलने योग्य गेम का सुधार करता है, और एक भौतिकी इंजन जो ईमानदारी से दहन का अनुकरण करता है, सभी एक ही नाम से जाने जाते हैं।

प्राचीन यूनानी कभी इस बात पर सहमत नहीं हो पाए कि दुनिया किस चीज़ से बनी है, चाहे वह आग हो, पानी हो, या अविभाज्य परमाणु, क्योंकि "दुनिया" कभी एक एकल चीज़ नहीं थी। यह हमेशा उस समग्रता के लिए एक स्थानापन्न था जिसके बारे में किसी विचारक को तर्क करने की आवश्यकता थी। AI को भी यही समस्या विरासत में मिली है, ठीक उस समय जब क्षेत्र को सटीकता की आवश्यकता है।

वर्गीकरण के नीचे का लूप

उस भ्रम को दूर करने की शुरुआत एक ऐसे आरेख से होती है जो प्रश्नगत किसी भी तकनीक से पुराना है। रीइन्फोर्समेंट लर्निंग की पाठ्यपुस्तकों, जिनमें विहित सटन और बार्टो शामिल हैं, ने दशकों से उसी चित्र के एक संस्करण का उपयोग यह वर्णन करने के लिए किया है कि एक एजेंट एक दुनिया के साथ कैसे बातचीत करता है। इस चित्र का औपचारिक नाम आंशिक रूप से अवलोकनीय मार्कोव निर्णय प्रक्रिया, या POMDP है, और "विश्व मॉडल" शब्द की मूल परिभाषा उसी परंपरा से संबंधित है।

एक एजेंट, जो एक व्यक्ति, एक रोबोट या एक सॉफ्टवेयर सिस्टम हो सकता है, कार्रवाई करता है। वे कार्रवाइयाँ दुनिया की स्थिति को प्रभावित करती हैं। एजेंट स्थिति को सीधे कभी नहीं देखता। एजेंट तक जो पहुँचता है वह अवलोकन हैं: रेटिना पर पड़ने वाले फोटॉन, सेंसर से रीडिंग, और वीडियो फ्रेम में पिक्सेल। नए अवलोकन नई कार्रवाइयों को सूचित करते हैं, और लूप जारी रहता है।

"स्थिति" शब्द को स्पष्ट करने की आवश्यकता है, क्योंकि इसका अर्थ क्षेत्र से क्षेत्र में बदलता है। यह रसायनज्ञ की स्थिति नहीं है, ठोस, तरल और गैस के बीच का अंतर। यह भौतिक विज्ञानी और रोबोटिकिस्ट की स्थिति है: किसी दिए गए क्षण में दुनिया में क्या हो रहा है, इसका एक पूर्ण विवरण, जिसमें हर वस्तु, हर स्थिति, हर वेग, हर गुण शामिल है। स्थिति दुनिया की अंतर्निहित वास्तविकता है; सिद्धांत रूप में पूर्ण, लेकिन उसके अंदर किसी भी एजेंट को कभी सीधे दिखाई नहीं देती। अवलोकन उस वास्तविकता पर एक एजेंट का आंशिक दृश्य हैं। कार्रवाइयाँ वह हैं जो एजेंट प्रतिक्रिया में करता है।

यह लूप — एजेंट से कार्रवाई, कार्रवाई से स्थिति, स्थिति से अवलोकन और वापस — वह संरचना है जिसने आधुनिक शब्द "विश्व मॉडल" को अपना तकनीकी अर्थ दिया। यह वाक्यांश स्वयं पुराना है, जिसका पता केनेथ क्रेक के 1943 के प्रस्ताव से लगाया जा सकता है कि मन वास्तविकता के "छोटे पैमाने के मॉडल" चलाकर तर्क करता है, और 1980 के दशक के अंत और 1990 के दशक की शुरुआत में तंत्रिका नेटवर्क में लाया गया। और यह लूप यह भी बताता है कि लोग आज इस शब्द से क्या मतलब रखते हैं। अब विश्व मॉडल कही जाने वाली विभिन्न चीज़ें वास्तव में इसी लूप के अलग-अलग प्रक्षेपण हैं। प्रत्येक इसका एक अलग टुकड़ा आउटपुट करता है।

एक विश्व मॉडल के तीन कार्य

पहले प्रकार का विश्व मॉडल एक रेंडरर है। एक रेंडरर मानव आँखों के लिए अभिप्रेत पिक्सेल के रूप में अवलोकन आउटपुट करता है, और सबसे महत्वपूर्ण गुणवत्ता दृश्य निष्ठा है। एक वीडियो मॉडल जो टेक्स्ट प्रॉम्प्ट को सिनेमाई ड्रोन शॉट में बदल देता है, एक रेंडरर है। Google का Genie 3 जैसा एक इंटरैक्टिव सिस्टम, या World Labs का अपना RTFM भी ऐसा ही है, जहाँ मॉडल उपयोगकर्ता इनपुट पर निर्भर रीयल टाइम में फ्रेम उत्पन्न करता है। मॉडल त्रि-आयामी संरचना की कोई स्पष्ट समझ नहीं रखता। यह वही उत्पन्न करता है जो एक दर्शक देखेगा, न कि वह जो वास्तव में है। ड्रोन शॉट में इमारतें ऊपर से दोषरहित लग सकती हैं, लेकिन नीचे शहर में गाड़ी चलाने की कोशिश करें और वे बिखर जाती हैं।

दूसरा प्रकार एक सिमुलेटर है। एक सिमुलेटर स्थिति आउटपुट करता है: दुनिया का एक ज्यामितीय, भौतिक या गतिशील रूप से विश्वसनीय प्रतिनिधित्व जिस पर मनुष्य और कंप्यूटर प्रोग्राम दोनों गणना कर सकते हैं और बातचीत कर सकते हैं। जहाँ रेंडरर का अनुबंध पूरी तरह से दृश्य होता है, वहीं सिमुलेटर का अनुबंध संरचनात्मक होता है, जिसमें ज्यामिति की माँग होती है जो निरीक्षण पर टिकी रहे, भौतिकी जो न्यूटन के नियमों का सम्मान करे, और गतिशीलता जो भौतिकी के नियमों को देखते हुए दुनिया को जिस तरह व्यवहार करने की आवश्यकता है, वैसा व्यवहार करे। एक सिमुलेटर एक साथ दो उपभोक्ताओं की सेवा करता है। आर्किटेक्ट, डिज़ाइनर, फिल्म निर्माता और गेम डेवलपर जैसे मानव पेशेवरों को दृश्य प्रशंसनीयता से परे सटीकता की आवश्यकता होती है। रीइन्फोर्समेंट लर्निंग एजेंट, रोबोट नियंत्रक और स्वायत्त वाहन जैसे कंप्यूटर प्रोग्राम सिमुलेटर को प्रशिक्षण के मैदान के रूप में उपयोग करते हैं जहाँ वे बड़े पैमाने पर दुनिया के साथ बातचीत कर सकते हैं, उन परिदृश्यों का परीक्षण कर सकते हैं जो वास्तविकता में चलाने के लिए खतरनाक, महंगे या असंभव होंगे।

तीसरा प्रकार एक प्लानर है। एक प्लानर कार्रवाइयाँ आउटपुट करता है। एक अवलोकन और एक लक्ष्य दिए जाने पर, एक प्लानर इस प्रश्न का उत्तर देता है कि एजेंट को आगे क्या करना चाहिए। यह कई मायनों में, रेंडरर का उलटा है। जहाँ एक रेंडरर कार्रवाइयों को इनपुट के रूप में लेता है और अवलोकन उत्पन्न करता है, वहीं एक प्लानर अवलोकनों को इनपुट के रूप में लेता है और कार्रवाइयाँ उत्पन्न करता है, धारणा-कार्रवाई लूप को बंद करता है। विज़न-लैंग्वेज-एक्शन मॉडल, मॉडल-आधारित सिस्टम और वर्ल्ड एक्शन मॉडल की नई लहर, सभी प्लानर के प्रयास हैं: ऐसे सिस्टम जो यह तय कर सकते हैं कि एक रोबोट को एक असंरचित दुनिया में क्या करना चाहिए।

ये तीन श्रेणियाँ उस अधिकांश चीज़ का वर्णन करती हैं जो वास्तव में आज शिप हो रही है, और उनके बीच का अंतर व्यवहार में उपयोगी है। हालाँकि, श्रेणियाँ मौलिक रूप से अलग नहीं हैं। दुनिया कैसे काम करती है, इसका वही अंतर्निहित ज्ञान — ज्यामिति, भौतिकी, गतिशीलता — उन सभी के नीचे बैठता है। एक मॉडल जो किसी कप को किसी भी कोण से रेंडर कर सकता है, सिद्धांत रूप में, यह अनुकरण करने में सक्षम होना चाहिए कि जब कप को धकेला जाता है तो क्या होता है और कप को उठाने के लिए एक हाथ की योजना बना सकता है। तेजी से, सबसे दिलचस्प शोध जानबूझकर तीनों के बीच की सीमाओं को धुंधला कर रहा है।

Fei-Fei Li - inline image

GIF

सिमुलेशन ही केंद्रबिंदु क्यों है

तीन श्रेणियों में से, सिमुलेटर को सबसे कम सार्वजनिक ध्यान मिलता है, और यह तीनों में सबसे अधिक परिणामकारी है। यह निबंध इस विषमता को संबोधित करता है।

रेंडरर अब तक सबसे अधिक व्यावसायिक रूप से परिपक्व है। कई इमेज- या टेक्स्ट-टू-वीडियो उत्पाद उपभोक्ता या उद्यम बाजारों में तेजी से विस्तार कर रहे हैं। Google के Nano Banana मॉडल ने रेंडरर-गुणवत्ता वाली छवि निर्माण को संभावित रूप से करोड़ों उपयोगकर्ताओं के हाथों में दे दिया है। तकनीक वास्तविक है, और बाजार वास्तविक हैं। फिर भी रेंडरर दृश्य प्रशंसनीयता के लिए अनुकूलन करते हैं न कि भौतिक सटीकता के लिए, और वह सीमा मायने रखती है। उनके आउटपुट सुंदर हैं, लेकिन उन पर किसी भवन को डिज़ाइन करने या किसी रोबोट को प्रशिक्षित करने के लिए भरोसा नहीं किया जा सकता।

प्लानर सबसे दिलचस्प और सबसे नवजात है, जो तेजी से विकसित हो रहे रोबोटिक लर्निंग के क्षेत्र से निकटता से जुड़ा है।** इस क्षेत्र ने पिछले दो वर्षों में रोबोटिक डेमो तैयार किए हैं जो वीडियो में प्रभावशाली लगते हैं, लेकिन यह आवश्यक है कि वे डेमो वास्तव में क्या दिखाते हैं, इसके बारे में स्पष्टता बरती जाए। लगभग सभी भारी रूप से बाधित प्रयोगशाला सेटअपों, संकीर्ण वस्तु सेटों और छोटे कार्य क्षितिजों तक सीमित रहे हैं। किसी भी वास्तविक दुनिया की तैनाती की माँग की जटिलता, परिवर्तनशीलता या अवधि पर किसी को भी मान्य नहीं किया गया है। एक सम्मोहक डेमो रील और एक रोबोट जो रसोई, गोदाम या ऑपरेटिंग रूम में विश्वसनीय रूप से काम करता है, के बीच का अंतर बहुत बड़ा बना हुआ है। इसके बावजूद व्यावसायिक दाँव काफी बड़े हैं। अच्छी तरह से वित्त पोषित प्रतिभागियों की एक लहर सामान्य-उद्देश्यीय योजना प्रणालियों को शिप करने की होड़ में है, जबकि सबसे बड़े बुनियादी ढाँचा खिलाड़ी व्यापक सिमुलेशन स्टैक के शीर्ष पर प्लानर को स्थापित कर रहे हैं। एक रोबोट जो योजना बना सकता है, वह रोबोट है जो काम कर सकता है, और पूरा उद्योग पहले वहाँ पहुँचने की होड़ में है।

सिमुलेशन दोनों के बीच का सेतु है। यदि भाषा दुनिया का एक अमूर्तन है और पिक्सेल इसका एक प्रक्षेपण है, तो ज्यामिति, भौतिकी और गतिशीलता स्वयं दुनिया हैं। एक सिमुलेटर को उस स्तर पर काम करना चाहिए: संरचनात्मक रीढ़ जिससे दृश्य स्वरूप (रेंडरर के लिए) और कार्रवाई परिणाम (प्लानर के लिए) दोनों प्राप्त किए जा सकते हैं।

एक मॉडल जो सिमुलेशन में महारत हासिल करता है, वह अपनी समझ को मानव उपभोग के लिए पिक्सेल में और सन्निहित एजेंटों के लिए कार्रवाई भविष्यवाणियों में प्रक्षेपित कर सकता है। एक मॉडल जो केवल रेंडरिंग या केवल प्लानिंग में महारत हासिल करता है, वह दोनों में से कोई भी नहीं कर सकता। व्यावसायिक सतह क्षेत्र बहुत बड़ा है। अकेले NVIDIA का Omniverse कंपनी के अनुमान के अनुसार कारखानों, गोदामों, आपूर्ति श्रृंखलाओं और डिजिटल ट्विन्स में एक ट्रिलियन डॉलर से अधिक के संबोध्य बाजार को लक्षित करता है। रोबोटिक्स प्रशिक्षण, स्वायत्त वाहन परीक्षण, वास्तुशिल्प विज़ुअलाइज़ेशन, इंजीनियरिंग और दवा खोज — सभी किसी न किसी सिमुलेशन-आकार की चीज़ पर निर्भर करते हैं।

इस क्षेत्र की सबसे कठिन खुली समस्याएँ भी वहीं रहती हैं। स्पष्ट ज्यामिति, भौतिक गुणों और भौतिक एनोटेशन के साथ त्रि-आयामी डेटा, इंटरनेट वीडियो की तुलना में परिमाण के क्रम से दुर्लभ है, जिस पर रेंडरर प्रशिक्षित होते हैं। सिम-टू-रियल गैप, जो सिमुलेशन में चीज़ें कैसे व्यवहार करती हैं और वास्तविकता में वे कैसे व्यवहार करती हैं, के बीच का अंतर है, बना रहता है। जनरेटिव सिमुलेटर उसके ऊपर एक नया जोखिम लाते हैं: AI-जनरेटेड ज्यामिति सही दिख सकती है जबकि उसमें स्व-प्रतिच्छेद या गलत पैमाना हो जो निरर्थक भौतिकी उत्पन्न करता है। बड़े पैमाने पर मल्टी-फिजिक्स सिमुलेशन, जहाँ कठोर पिंड, विकृत वस्तुएँ, तरल पदार्थ और कपड़े सभी परस्पर क्रिया करते हैं, एकल-डोमेन सिमुलेशन की तुलना में परिमाण के क्रम से अधिक महंगा बना हुआ है।

World Labs में, Marble इस क्षेत्र में हमारा पहला कदम है। यह मल्टीमॉडल प्रॉम्प्ट (टेक्स्ट, इमेज, वीडियो या स्थानिक स्केच) लेता है और खोजे जा सकने वाले 3D वातावरण उत्पन्न करता है, दृश्य अन्वेषण के लिए Gaussian splats के साथ-साथ कोलिजन मेश आउटपुट करता है जिस पर एक भौतिकी इंजन काम कर सकता है। लेकिन Marble एक बहुत लंबे चाप का केवल पहला अध्याय है जो पूरे क्षेत्र में लिखा जा रहा है क्योंकि रेंडरिंग, सिमुलेशन और प्लानिंग के बीच की रेखाएँ ढहने लगी हैं।

जहाँ सीमाएँ ढह रही हैं और आगे क्या है

लेकिन और भी बहुत कुछ आना बाकी है। इस समय क्षेत्र में सबसे महत्वपूर्ण पैटर्न यह है कि तीन श्रेणियाँ एक-दूसरे में विलीन होने लगी हैं। साझा अंतर्दृष्टि यह है कि एक दुनिया को रेंडर करने, उसका अनुकरण करने और उसमें कार्य करने के लिए आवश्यक ज्ञान काफी हद तक समान है। पिछले उदाहरण को जारी रखते हुए, एक मॉडल जो वास्तव में समझता है कि एक कप मेज पर कैसे बैठता है (उसकी ज्यामिति, भौतिक गुण, बल के प्रति प्रतिक्रिया, आदि) उस कप को किसी भी कोण से रेंडर करने, जब कप को धकेला जाता है तो क्या होता है इसका अनुकरण करने, और कप को उठाने के लिए एक हाथ की योजना बनाने में सक्षम होना चाहिए। तीन श्रेणियाँ एक ही अंतर्निहित समझ के तीन प्रक्षेपण हैं।

उदाहरण के लिए: विभिन्न रोबोटिक्स प्रयोगशालाओं के हाल के काम की एक छोटी लेकिन बढ़ती संख्या ने प्रदर्शित किया है कि — कम से कम अवधारणात्मक रूप से — एक पूर्व-प्रशिक्षित वीडियो रेंडरर को संयुक्त विश्व-और-कार्रवाई भविष्यवाणी के लिए रीढ़ के रूप में उपयोग किया जा सकता है, जो एक मॉडल को यह कल्पना करने की अनुमति देकर रेंडरर और प्लानर के बीच एक सेतु का सुझाव देता है कि क्या होगा और क्या करना है। World Labs का Marble पहले से ही एक एकल मॉडल से Gaussian splats और कोलिजन मेश आउटपुट करता है, रेंडरर और सिमुलेटर के बीच की सीमा को समाप्त करता है। हर स्तर निष्क्रिय आउटपुट से इंटरैक्टिव सिस्टम की ओर बढ़ रहा है, जिसमें रेंडरर कार्रवाई-सशर्त बन रहे हैं, सिमुलेटर ऐसी दुनिया उत्पन्न कर रहे हैं जो अधिक नियंत्रणीय और संपादन योग्य हैं, और प्लानर केवल प्रतिक्रिया करने के बजाय विचार-विमर्श कर रहे हैं।

तार्किक अंतिम बिंदु एक एकीकृत विश्व मॉडल है: एक फाउंडेशन मॉडल जो फोटोरियलिस्टिक दृश्य रेंडर कर सकता है, भौतिक रूप से सटीक संरचना उत्पन्न कर सकता है, और कार्रवाई अनुक्रमों की योजना बना सकता है, डाउनस्ट्रीम उपभोक्ता की आवश्यकता के अनुसार आउटपुट मोड के बीच स्विच कर सकता है। हमें अभी भी कई कठिन चुनौतियों का सामना करना होगा। डेटा की स्थिति असमान है, रेंडरर इंटरनेट वीडियो में डूबे हुए हैं जबकि सिमुलेटर और प्लानर को 3D एसेट और रोबोट प्रदर्शनों की तीव्र कमी का सामना करना पड़ता है। दृश्य सुंदरता के लिए अनुकूलन उस सटीकता को त्याग सकता है जिसकी एक रोबोट या उच्च-निष्ठा सिमुलेशन को आवश्यकता होती है। एक एकल आर्किटेक्चर के अंदर इन तनावों को समेटना आज विश्व मॉडल अनुसंधान में सबसे परिभाषित खुली समस्या है, और यही वह है जो World Labs ने Marble को विकसित करना जारी रखते हुए करने का निर्णय लिया है।

Fei-Fei Li - inline image

GIF

दिशा, हालाँकि, स्पष्ट है। वही दाँव जो क्षेत्र 1980 के दशक के अंत से लगा रहा है — कि दुनिया का एक पर्याप्त रूप से समृद्ध मॉडल ही वह सब कुछ है जो किसी भी एजेंट को दुनिया देखने, उन्हें बनाने और उनमें कार्य करने के लिए चाहिए — वही दाँव अब अनुसंधान की एक पूरी पीढ़ी को चला रहा है। जो चीज़ उस "बड़े दाँव" को भारी बनाती है, वह है पहले से चल रहा अभिसरण: तीन धागे, जिनमें से प्रत्येक अपने आप में अरबों डॉलर के उद्योगों को चला रहा है और आकार दे रहा है, जो अलग-अलग शोध कार्यक्रमों के रूप में शुरू हुए थे, एक जैसा व्यवहार करने लगे हैं। एक साथ लिए जाने पर, जैसे-जैसे उनके बीच की सीमाएँ ढहती हैं, वे कुछ बड़ा पुनर्आकार देंगे: मशीन इंटेलिजेंस और उसके द्वारा बसाई गई भौतिक दुनिया के बीच का संबंध — स्थानिक बुद्धिमत्ता का लंबा चाप।

भाषा ने मशीनों को उस दुनिया के बारे में बात करने का एक तरीका दिया। विश्व मॉडल वह तरीका है जिससे मशीनें अंततः उसे समझने, कल्पना करने, तर्क करने और उसके साथ बातचीत करने आएंगी।

एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें