YouMind
साइन इन करें

रोबोट लर्निंग के लिए एक नई डेटा लेयर

@NikolausWest
अंग्रेज़ी14 मई 2026
319K
172
26
5
218

TL;DR

Rerun 0.32 रोबोटिक्स के लिए विशेष रूप से बनाई गई एक डेटा लेयर पेश करता है, जिसमें स्टेबल .rrd फॉर्मेट, PyTorch इंटीग्रेशन और रॉ सेंसर डेटा तथा मॉडल ट्रेनिंग के बीच की दूरी को पाटने के लिए एडवांस्ड विज़ुअलाइज़ेशन शामिल है।

भौतिक AI भौतिक दुनिया भर के उद्योगों को नया आकार देगा, लेकिन रोबोटिक्स में अभी भी एकीकृत डेटा लेयर का अभाव है जो आधुनिक AI द्वारा मांगी गई गति से पुनरावृत्ति करने के लिए आवश्यक है। मुख्य चुनौती यह है कि रोबोट लर्निंग भौतिक डेटा पर काम करता है: मल्टीमॉडल, मल्टी-रेट स्ट्रीम जो समय, स्थान और एम्बॉडिमेंट से जुड़ी होती हैं। मौजूदा बुनियादी ढाँचा ज्यादातर वेब डेटा के आसपास बनाया गया था और इन गुणों से जूझता है।

@rerundotio पर हम भौतिक डेटा के लिए एक एकीकृत डेटा लेयर बना रहे हैं ताकि टीमों को वास्तविक दुनिया के लिए इंटेलिजेंस को प्रशिक्षित और शिप करने में मदद मिल सके।

Rerun का अब तक का सबसे बड़ा रिलीज़

Rerun मल्टीमॉडल टाइम-सीरीज़ डेटा को विज़ुअलाइज़ करने के लिए जाना जाता है। पिछले डेढ़ साल से, हम चुपचाप एक एकीकृत डेटा लेयर के अन्य टुकड़ों का निर्माण कर रहे हैं ताकि संग्रह से प्रशिक्षण तक की पूरी यात्रा का समर्थन किया जा सके। 0.32 Rerun SDK रिलीज़ के साथ, वे क्षमताएँ ओपन सोर्स में आ रही हैं!

यह तीन साल पहले Rerun के मूल रूप से ओपन सोर्स होने के बाद से सबसे बड़ा रिलीज़ है, और यह उन कार्यों के प्रकार का एक बड़ा विस्तार दर्शाता है जो आप Rerun के साथ कर सकते हैं।

हम फ़ाइल फ़ॉर्मेट को स्थिर कर रहे हैं और फ़ाइलों के लिए निम्न-स्तरीय रीड और राइट API का एक नया सेट जोड़ रहे हैं। हम Rerun डेटा चंक्स में हेरफेर करने के लिए एक नया API जोड़ रहे हैं जो वास्तविक रोबोटिक्स डेटा को रैंगल और नॉर्मलाइज़ करने के लिए डिज़ाइन किया गया है। हम अपने MCAP और ROS 2 मैसेज सपोर्ट का विस्तार कर रहे हैं ताकि आउट-ऑफ-द-बॉक्स अनुभव बेहतर हो सके। हम एक नया डेटासेट रिव्यू UI जोड़ रहे हैं ताकि प्रशिक्षण डेटासेट की समीक्षा बहुत तेज़ हो सके। ओपन सोर्स कैटलॉग सर्वर अब डिस्क पर .rrd फ़ाइलों में इंडेक्स करता है ताकि आप या आपका एजेंट रोबोटिक्स रिकॉर्डिंग के निर्देशिकाओं पर सामान्य क्वेरी लिख सकें। उसी नींव पर निर्मित, हम एक Pytorch डेटालोडर भी जारी कर रहे हैं ताकि आप .rrd फ़ाइलों पर सीधे रोबोट मॉडल को प्रशिक्षित कर सकें, बिना किसी प्रशिक्षण-विशिष्ट फ़ॉर्मेट में निर्यात करने की आवश्यकता के।

रोबोटिक्स इकोसिस्टम में एक एकीकृत फ्रेमवर्क का अभाव था जो रोबोट लर्निंग डेटा के पूर्ण जीवनचक्र का समर्थन करने के लिए पर्याप्त लचीला हो। 0.32 के साथ, वह नींव अब उभर रही है।

इस बड़े ओपन सोर्स रिलीज़ के अलावा, हम Rerun Hub की भी घोषणा कर रहे हैं, जो हमारा वाणिज्यिक डेटा कैटलॉग और स्टोरेज इंजन है। Rerun Hub अब प्राइवेट प्रीव्यू में है और Rerun SDK को ऑब्जेक्ट स्टोरेज द्वारा समर्थित डेटासेट तक विस्तारित करता है। यह रोबोट डेटा को बहुत बड़े पैमाने पर बदलने, क्वेरी करने, विज़ुअलाइज़ करने और स्ट्रीम करने के लिए एक साझा कैटलॉग और एक्सेस लेयर प्रदान करता है, जबकि उसी डेटा मॉडल और API को संरक्षित करता है।

यदि आपकी महत्वाकांक्षा आपकी स्थानीय मशीन पर फिट होने वाले डेटा से परे स्केल करने की है - तेज़ी से आगे बढ़ते हुए! - तो Rerun Hub का उपयोग करें। यदि आप एक टीम हैं जो रोबोट लर्निंग के आसपास एक उत्पाद बना रहे हैं और अपने डेटा लेयर के बारे में सोच रहे हैं, तो संपर्क करें।

इस पोस्ट के शेष भाग में दो भाग हैं। पहला, डेटा आर्किटेक्चर पर एक प्राइमर जो हमारा मानना है कि फिजिकल AI को स्केल करने के लिए आवश्यक है। दूसरा, Rerun SDK 0.32 में नई क्षमताओं का एक दौरा जो उस आर्किटेक्चर को व्यवहार में लाता है।

रोबोट लर्निंग को एक डेटा लेयर की आवश्यकता है जो भौतिक डेटा के लिए विशेष रूप से बनाई गई हो

जैसा कि \द डेटा लेयर टैक्स फॉर रोबोट लर्निंग\ में उल्लिखित है, फिजिकल AI की प्रगति को धीमा करने वाला अधिकांश घर्षण पारंपरिक सॉफ्टवेयर और एनालिटिक्स वर्कलोड के लिए डिज़ाइन किए गए बुनियादी ढाँचे के माध्यम से भौतिक डेटा को मजबूर करने के प्रयासों से आता है। जिस चीज़ की आवश्यकता है वह एक डेटा लेयर है जो मल्टी-रेट, मल्टीमॉडल डेटा के लिए बनाई गई है, जो रोबोट इंटेलिजेंस पर पुनरावृत्ति करने के लिए आवश्यक सब कुछ का समर्थन करती है, संग्रह से प्रशिक्षण और तैनाती तक।

कोडिंग एजेंट का मतलब है कि उपयोगकर्ताओं को कंप्यूट और एप्लिकेशन लेयर पर पूर्ण नियंत्रण की आवश्यकता है

संग्रह, सामान्यीकरण, पोस्ट-प्रोसेसिंग, क्यूरेशन और प्रशिक्षण के पूरे वर्कफ़्लो की सेवा के लिए, टीमों को विभिन्न प्रकार के टूल और कंप्यूट जॉब्स की आवश्यकता होती है। वे टूल और जॉब उदाहरण के लिए उन विशिष्ट तरीकों को एनकोड कर सकते हैं जिनमें एक टीम संचालित होती है या वे तकनीकें जिनका उपयोग वे बड़े पैमाने पर डेटा गुणवत्ता चलाने के लिए करते हैं, जो उन्हें भेदभाव का एक प्रमुख क्षेत्र बनाता है जिसे टीमों को अपने पास रखने की आवश्यकता है।

कोडिंग एजेंट टीमों के लिए इन टूल और कंप्यूट जॉब्स को ठीक उसी तरह डिज़ाइन करना तेजी से संभव बना रहे हैं जैसा वे चाहते हैं, जब तक उनके पास कोड-स्तरीय नियंत्रण है। इस वजह से, बहुत कम टीमें उस नियंत्रण को नहीं रखना स्वीकार करेंगी। यही कारण है कि Rerun SDK पूरी तरह से ओपन सोर्स है और एक फ्रेमवर्क के रूप में डिज़ाइन किया गया है जिसके साथ आप निर्माण कर सकते हैं, न कि एक दीवार वाले बगीचे वाले SaaS प्लेटफ़ॉर्म के रूप में। यहां तक कि व्यूअर को एक लाइब्रेरी के रूप में डिज़ाइन किया गया है ताकि आप कभी अटके नहीं। Rerun हमेशा कोड-फर्स्ट रहा है और हम इसे एजेंटों के लिए उपयोग करना और भी आसान बनाने पर जोर दे रहे हैं। इसमें पूरी तरह से हेडलेस रेंडरिंग और व्यूअर नेविगेशन पर आगामी कार्य भी शामिल है ताकि एजेंट भौतिक डेटा को इंसानों की तरह देख सकें।

अधिकांश टीमें पहले से ही अपने स्वयं के वर्कफ़्लो के अनुरूप कस्टम वन-ऑफ एप्लिकेशन और प्रोसेसिंग स्क्रिप्ट बना रही हैं। एक ठोस नींव के ऊपर निर्माण किए बिना, आप ऊर्ध्वाधर टुकड़ों के साथ समाप्त होते हैं जिनके बारे में तर्क करना कठिन होता है और वे अच्छी तरह से रचना नहीं करते हैं, जो उत्पादकता लाभ पर एक सीमा लगाता है।

डेटा लेयर को बड़े पैमाने पर भौतिक डेटा का उपयोग करने के कठिन हिस्सों को संभालना चाहिए

Nikolaus West - inline image

संग्रह से मॉडल तक पूरी डेटा यात्रा की सेवा के लिए आवश्यक मुख्य क्षमताएँ विज़ुअलाइज़ेशन, विश्लेषणात्मक क्वेरी, परिवर्तन और प्रशिक्षण हैं। इन सभी क्षमताओं को मल्टी-रेट, मल्टीमॉडल डेटा से निपटने की आवश्यकता है जो रोबोटिक्स सिमैंटिक्स जैसे 3D संबंध या आकार ले सकता है। बग और असंगत डेटा से बचने के लिए, आप इस प्रकार के डेटा की सूक्ष्मताओं से लगातार निपटना चाहते हैं जहाँ भी इसका उपयोग किया जाता है। उदाहरण के लिए, टाइम अलाइनमेंट और 3D ट्रांसफ़ॉर्म को प्रीप्रोसेसिंग, क्वेरी, विज़ुअलाइज़ेशन और डेटासेट रिव्यू में लगातार व्यवहार करना चाहिए।

डेटा-प्रयोग लूप और इसे शक्ति देने वाले टूल दोनों पर पुनरावृत्ति करना आसान बनाने के लिए, आप एक एकीकृत डेटा लेयर के ऊपर निर्माण करना चाहते हैं जो हैंडऑफ़ को तुच्छ बनाता है और शीर्ष पर एप्लिकेशन को सरल बनाता है। इसका मतलब है कि डेटा लेयर को सभी मुख्य एप्लिकेशन और कंप्यूट क्षमताओं की आवश्यकताओं को संभालने के लिए पर्याप्त लचीला होना चाहिए। उदाहरण के लिए, विज़ुअलाइज़ेशन और कंप्यूट दोनों को मल्टीमॉडल टाइम सीरीज़ तक तेज़ रैंडम एक्सेस की आवश्यकता होती है, जबकि विश्लेषणात्मक क्वेरी को कुशल कॉलम स्कैन की आवश्यकता होती है, और बड़े पैमाने पर पोस्ट-प्रोसेसिंग कंप्यूट (CPU) और प्रशिक्षण (GPU) दोनों को उच्च बैंडविड्थ समानांतर डेटा स्ट्रीमिंग की आवश्यकता होती है।

भौतिक डेटा मौलिक रूप से वेब और व्यावसायिक डेटा से अलग व्यवहार करता है, जिसका अर्थ है कि यह विभिन्न स्टोरेज और क्वेरी एब्स्ट्रैक्शन से लाभान्वित होता है।

भौतिक डेटा के लिए मुख्य स्टोरेज यूनिट एक कॉलम चंक है

भौतिक डेटा में दो विशिष्ट विशेषताएँ हैं:

पहली यह है कि यह मल्टी-रेट है: विभिन्न सेंसर अत्यधिक भिन्न आवृत्तियों पर डेटा रिकॉर्ड करेंगे। GPS 1-10Hz पर हो सकता है, कैमरे 10-30Hz पर, जॉइंट-एंगल 100-200Hz पर, और IMU 1kHz पर। पोस्ट-प्रोसेसिंग में आप हर 10वें कैमरा फ्रेम के लिए सिमैंटिक एम्बेडिंग या प्रत्येक एपिसोड की शुरुआत और अंत में दृश्य विवरण की गणना कर सकते हैं।

दूसरी यह है कि यह मल्टीमॉडल है: विभिन्न सेंसर अत्यधिक भिन्न आकारों का डेटा रिकॉर्ड करते हैं। IMU और GPS को कुछ संख्याओं को एनकोड करने के लिए केवल मुट्ठी भर बाइट्स की आवश्यकता होती है, जबकि एक RGB कैमरा प्रत्येक इमेज फ्रेम के लिए कई MB का उपयोग कर सकता है।

यदि आप एक रोबोटिक्स रिकॉर्डिंग को एक तालिका में संग्रहीत करते हैं जहाँ एक पंक्ति एक टाइम स्टैम्प का प्रतिनिधित्व करती है, और एक कॉलम डेटा की एक स्ट्रीम का प्रतिनिधित्व करता है, तो मल्टी-रेट पहलू आम तौर पर इस तालिका को बहुत विरल बना देगा; किसी भी दी गई पंक्ति के लिए अधिकांश कॉलम खाली होने की संभावना है। डेटा का मल्टीमॉडल पहलू एक बड़े मेमोरी असंतुलन की ओर ले जाता है क्योंकि एक एकल पंक्ति में ऐसे सेल हो सकते हैं जो आकार में परिमाण के क्रम से भिन्न होते हैं। मौजूदा सारणीबद्ध डेटा बुनियादी ढाँचा इस संयोजन को बहुत खराब तरीके से संभालता है।

मल्टी-रेट और मल्टीमॉडल डेटा को चंक्स में संग्रहीत किया जाना चाहिए जो प्रत्येक डेटासेट की पंक्तियों और स्तंभों के उपसमूहों को धारण करते हैं। उदाहरण के लिए, एक चंक में दस लाख IMU नमूने और दूसरे चंक में केवल कुछ वीडियो पैकेट रखने की क्षमता आपको विरलता और मेमोरी असंतुलन दोनों समस्याओं को हल करने की अनुमति देती है।

Nikolaus West - inline image

चंक के भीतर, कॉलम-ओरिएंटेड स्टोरेज बेहतर संपीड़न और कॉलम स्कैन क्वेरी के लिए अनुकूलित करता है, जबकि रो-ओरिएंटेड स्टोरेज सरल लेखन के लिए अनुकूलित करता है।

Rerun में हमारा मानना है कि कॉलम चंक रोबोट लर्निंग डेटा सिस्टम के लिए सबसे अच्छा ट्रेडऑफ़ प्रस्तुत करते हैं, और हमने अपने आर्किटेक्चर को मुख्य स्टोरेज एब्स्ट्रैक्शन के रूप में उनके आसपास मानकीकृत किया है।

Rerun का .rrd फ़ाइल फ़ॉर्मेट कॉलम चंक्स के आसपास बनाया गया है

Rerun का मूल फ़ाइल फ़ॉर्मेट, .rrd, कॉलम चंक एब्स्ट्रैक्शन का ऑन-डिस्क प्रतिनिधित्व है। आंतरिक रूप से, प्रत्येक कॉलम चंक को एक Apache Arrow रिकॉर्ड बैच के साथ सिमैंटिक मेटाडेटा के साथ एनकोड किया जाता है जो बताता है कि डेटा की व्याख्या कैसे की जानी चाहिए। Apache Arrow डेटा साइंस के लिए उद्योग मानक है, और Arrow का उपयोग करने का मतलब है कि हमारे पास DataFusion, Pandas और Polars में तेज़ जीरो-कॉपी पथ है।

Nikolaus West - inline image

प्रत्येक चंक में मेटाडेटा में डेटा की व्याख्या करने के तरीके के बारे में सिमैंटिक जानकारी होती है ("यह एक IMU सेंसर है, यह एक GPS है, …") ताकि इसे प्रोसेसिंग पाइपलाइनों के माध्यम से ले जाया जा सके और फिर भी स्वचालित रूप से व्याख्या और विज़ुअलाइज़ किया जा सके।

एनकोडेड कॉलम चंक्स को प्रोटोबफ़ मैसेज में लपेटा जाता है और एक .rrd फ़ाइल बनाने के लिए जोड़ा जाता है। फ़ाइल के अंत में एक फुटर एक इंडेक्स की ओर इशारा करता है, जो पूरी फ़ाइल को स्कैन किए बिना अलग-अलग चंक्स तक तेज़ रैंडम एक्सेस की अनुमति देता है।

Nikolaus West - inline image

अन्य फ़ॉर्मेट से तुलना

Apache Parquet एक कॉलमनार ऑन-डिस्क फ़ॉर्मेट है, जिसका उपयोग आमतौर पर Arrow के साथ किया जाता है। यह अपने डेटा को रो ग्रुप्स में व्यवस्थित करता है, लेकिन .rrd में चंक्स के विपरीत, ये समूह ओवरलैप नहीं कर सकते: प्रत्येक रो ग्रुप में पंक्तियों की एक सघन श्रेणी पर सभी कॉलम होते हैं। यह इसे मल्टी-रेट, मल्टी-मॉडल रोबोटिक्स डेटा के लिए अनुपयुक्त बनाता है। आप नई पंक्तियाँ जोड़ सकते हैं, लेकिन आप नए कॉलम नहीं जोड़ सकते (कोई स्कीमा इवोल्यूशन नहीं)।

MCAP आपके रोबोट पर रोबोटिक्स लॉग रिकॉर्ड करने के लिए एक फ़ॉर्मेट है। यह तेज़ और लचीला लिखने के लिए डिज़ाइन किया गया है, जिसमें मजबूत ROS संगतता है। हालाँकि, यह अनिवार्य रूप से अपारदर्शी संदेशों (JSON, प्रोटोबफ़, CBOR, आदि के साथ एनकोडेड) का एक कंटेनर फ़ॉर्मेट है और कॉलमनार विश्लेषणात्मक क्वेरी के लिए अनुकूलित नहीं है। बड़े स्कैन और जॉइन भी धीमे हैं, क्योंकि आपको प्रत्येक संदेश को डीकोड करने की आवश्यकता है।

Lance एक नया फ़ॉर्मेट है, जो विशेष रूप से मल्टीमॉडल डेटा और रैंडम एक्सेस के लिए बनाया गया है (जो प्रशिक्षण के लिए अत्यंत महत्वपूर्ण है)। Parquet के विपरीत, यह स्कीमा इवोल्यूशन का समर्थन करता है। हालाँकि, एक Lance डेटासेट अभी भी पंक्ति-संरेखित टुकड़ों का एक ऊर्ध्वाधर ढेर है, इसलिए मल्टी-रेट स्ट्रीम नल के साथ फूल जाएगी।

NCore Nvidia का एक नया फ़ॉर्मेट है, जो न्यूरल रिकंस्ट्रक्शन के लिए बनाया गया है। मल्टी-रेट को प्रति-घटक टाइमस्टैम्प के माध्यम से मूल रूप से समर्थित किया जाता है, और एक पोज़ ग्राफ के माध्यम से स्थानिक संरेखण। हालाँकि, स्कीमा बंद है (कैनोनिकल सेंसर घटक, मनमाना उपयोगकर्ता-परिभाषित डेटा नहीं), यह Arrow-मूल के बजाय Zarr-आधारित है, और यह एक सामान्य SQL / डेटाफ्रेम क्वेरी इंजन की सेवा के लिए नहीं बनाया गया है।

आपकी टीम को जिस भी सुविधा की आवश्यकता है जो एक फ़ाइल फ़ॉर्मेट प्रदान नहीं करता है, उसका मतलब है एक और पाइपलाइन जिसे सिंक्रोनाइज़ रखना है और आपकी टीम को सफल होने के लिए सीखने के लिए अतिरिक्त उपकरण। Rerun का फ़ॉर्मेट एकमात्र विकल्प है जो रोबोट रिकॉर्डिंग को इंटेलिजेंस में बदलने के लिए आवश्यक सभी उपयोग मामलों की सेवा कर सकता है। यह आपको डेटा को मूल टाइमस्टैम्प पर रखने की अनुमति देता है, जबकि अभी भी उसी डेटासोर्स से क्वेरी और देखने में सक्षम है, और प्रशिक्षण के लिए स्ट्रीम करने में सक्षम है। इसमें शीर्ष पर एकीकृत डेटा सिस्टम बनाने के लिए पर्याप्त संरचना है, लेकिन विभिन्न रीड और राइट पैटर्न के लिए अनुकूलित करने के लिए पर्याप्त लचीला है।

कॉलम चंक्स के ऊपर एक इंडेक्सिंग, स्कीमा और मेटाडेटा लेयर बड़े पैमाने पर भौतिक डेटा के उपयोग को सरल बनाती है

एक एकल सिग्नल का विश्लेषण करने के लिए डेटासेट में सभी चंक्स को स्कैन करना छोटे डेटासेट के लिए भी खराब पैमाने पर होता है, इसलिए उन्हें प्रभावी ढंग से उपयोग करने के लिए आपको एक मेटाडेटा और इंडेक्सिंग लेयर की आवश्यकता होती है जो किसी भी क्वेरी के लिए सही चंक्स खोजने में मदद कर सके। यह क्लासिक डेटा लेकहाउस पैटर्न जैसा दिखता है। हमारे मामले में, एक एकल डेटासेट या रिकॉर्डिंग विषम चंक्स से बनी होती है जो समान स्कीमा साझा नहीं करते हैं। क्लासिक डेटा प्रोसेसिंग टूल एक समान स्कीमा वाली तालिकाओं से निपटने के लिए बनाए गए हैं। भौतिक डेटा के लिए एक लेकहाउस-शैली इंडेक्सिंग और मेटाडेटा लेयर को इसलिए इन व्यक्तिगत स्कीमा पर भी नज़र रखने की आवश्यकता है ताकि यह किसी भी स्ट्रीम की मर्ज की गई स्कीमा को तुरंत मटेरियलाइज़ कर सके ताकि क्लासिक डेटा टूल इसके साथ काम कर सकें। उदाहरण के लिए, यदि आप अपने IMU को एक ऐसे सेंसर में अपग्रेड करते हैं जो अपने संदेशों में चुंबकीय क्षेत्र डेटा प्रकाशित करता है, तो यह जोड़ आपके पुराने IMU के साथ संगत है जिसमें यह फ़ील्ड नहीं था, संगतता के लिए ऐतिहासिक डेटा को फिर से लिखने की कोई आवश्यकता नहीं है।

Nikolaus West - inline image

कॉलम चंक्स कुशल इंडेक्सिंग के साथ मिलकर आपको ठीक उसी डेटा को लाने देते हैं जिसकी आपको आवश्यकता है, बिना इसके साथ संग्रहीत असंबंधित स्ट्रीम के लिए दंड का भुगतान किए। आपको सामान्य संचालन को तेज़ बनाने और लंबी पूंछ वाले बगों का पीछा करने में सक्षम होने के बीच चयन नहीं करना है क्योंकि आपने सामान्य डेटा को एक अलग वेयरहाउस में निर्यात किया है।

प्रदर्शन लाभों के अलावा, यह लेयर हमें फ़ाइलों को अमूर्त करने और ऊपर की परतों में भौतिक डेटा के सभी उपयोगकर्ताओं के लिए एक एकीकृत API प्रस्तुत करने की अनुमति देती है। अक्सर रोबोट डेटा एक फ़ाइल में संग्रहीत होता है और कैलिब्रेशन दूसरी में, इन कार्यान्वयन विवरणों को अमूर्त करना डेटा घर्षण को कम करने और कंप्यूट और एप्लिकेशन लेयर को सरल बनाने का एक महत्वपूर्ण हिस्सा है।

बड़े पैमाने पर प्रसंस्करण और प्रशिक्षण के लिए ऑब्जेक्ट स्टोरेज से सीधे चयनात्मक स्ट्रीमिंग की आवश्यकता होती है

रोबोट लर्निंग डेटासेट पहले से ही बहुत बड़े हो सकते हैं और टीमों द्वारा अधिक से अधिक सक्षम मॉडल प्राप्त करने के लिए स्केलिंग कानूनों का पालन करने पर और भी बड़े हो जाएंगे। डेटा के इस पैमाने को संसाधित करने के लिए आपको अक्सर पोस्ट-प्रोसेसिंग के लिए बड़ी संख्या में CPU या प्रशिक्षण के लिए GPU में फैलने की आवश्यकता होती है। इन मामलों में यह महत्वपूर्ण है कि डेटा थ्रूपुट इस कंप्यूट की जरूरतों के साथ स्केल कर सके।

प्रदर्शन को अधिकतम करने और ईग्रेस लागत को कम करने दोनों के लिए, आप डेटा के करीब कंप्यूट चलाना चाहते हैं। साथ ही, GPU कंप्यूट प्राप्त करना कठिन हो सकता है, इसलिए कई टीमें समय के साथ विभिन्न स्थानों पर किराए पर लेती हैं। इन सभी कारकों का मतलब है कि आप स्टोरेज को इंडेक्सिंग और मेटाडेटा को संभालने वाली सेवाओं से अलग करने में सक्षम होना चाहते हैं।

Nikolaus West - inline image

Rerun में, क्वेरी Rerun SDK से शुरू होती है जो फिर Rerun Hub से क्वेरी करता है, जो यह जानने के लिए जिम्मेदार है कि क्वेरी को हल करने के लिए किन चंक्स की आवश्यकता है। सेटिंग के आधार पर, SDK या तो Rerun Hub में एक कैश्ड प्रॉक्सी के माध्यम से चंक्स मांगता है, या ऑब्जेक्ट स्टोरेज पर बाइट रेंज के लिए। यह एक सरलीकृत एक्सेस API, चयनात्मक चंक स्ट्रीमिंग और अंतर्निहित ऑब्जेक्ट स्टोरेज से अधिकतम स्ट्रीमिंग बैंडविड्थ की अनुमति देता है।

Rerun SDK 0.32 रोबोट लर्निंग के लिए एक एकीकृत डेटा टूलकिट है

Rerun 0.32 फरवरी 2023 में मूल रूप से ओपन सोर्स होने के बाद से सबसे बड़ा रिलीज़ है। यह SDK के व्यावहारिक उपयोग के मामलों को लॉगिंग, विज़ुअलाइज़िंग और सरल क्वेरी से लेकर संग्रह से प्रशिक्षण तक पूर्ण डेटा यात्रा तक विस्तारित करता है। निम्नलिखित नई सुविधाओं का एक दौरा है जो इस विस्तार को उजागर करता है। अधिक विवरण के लिए रिलीज़ नोट्स देखें।

चंक-स्तरीय Python API के साथ एक स्थिर फ़ाइल फ़ॉर्मेट

Rerun 0.23 में हमने Rerun के .rrd फ़ाइल फ़ॉर्मेट के लिए संस्करण-से-संस्करण बैकवर्ड संगतता की घोषणा की। व्यवहार में हमने तब से किसी भी संस्करण के बीच संगतता नहीं तोड़ी है और अब फ़ाइल फ़ॉर्मेट पर सामान्य बैकवर्ड संगतता का वादा करने में विश्वास महसूस करते हैं। हम क्षमताओं और प्रदर्शन को आगे बढ़ाने के लिए फ़ॉर्मेट को विकसित करना जारी रखेंगे, लेकिन पुराना डेटा हमेशा लोड होगा।

0.32 से पहले, आप केवल किसी अन्य फ़ॉर्मेट से एक इम्पोर्टर या उच्च-स्तरीय log या send_columns API का उपयोग करके .rrd फ़ाइलें लिख सकते थे, और डेटा पढ़ने का एकमात्र तरीका डेटाफ्रेम या SQL क्वेरी के माध्यम से था। इस रिलीज़ के साथ हम अब चंक-स्तरीय रीड और राइट API पेश कर रहे हैं, जो आपको अपने डेटा के सटीक आकार पर सटीक नियंत्रण देते हैं।

एक साथ लेने पर, इन दो परिवर्तनों का मतलब है कि .rrd टीमों की एक विस्तृत श्रृंखला के लिए अपने डेटा लेयर बनाने के लिए पर्याप्त परिपक्व है।

रोबोटिक्स-मूल डेटा रैंगलिंग के लिए चंक प्रोसेसिंग API

रोबोटिक्स डेटा अक्सर गड़बड़ होता है। कई स्रोतों से डेटा को सामान्य करना जिसका विश्लेषण और प्रशिक्षण टीमें कर सकें, जल्दी से जटिल हो जाता है। डेटा पाइपलाइन का यह हिस्सा अक्सर एक साथ जोड़े गए Python स्क्रिप्ट से बना होता है जो धीमी और सूक्ष्म बग से भरी होती हैं।

इन समस्याओं को हल करने के लिए हम (प्रयोगात्मक) चंक प्रोसेसिंग API का एक नया सेट पेश कर रहे हैं। वे .rrd, MCAP, Parquet और URDF जैसे फ़ॉर्मेट के लिए एक समान लोडर इंटरफ़ेस प्रदान करते हैं जो Apache Arrow चंक्स की स्ट्रीम उत्पन्न करते हैं। फिर आप उन स्ट्रीम के शीर्ष पर आसानी से प्रोसेसिंग पाइपलाइनों को परिभाषित कर सकते हैं।

रोबोटिक्स डेटा अक्सर गहराई से नेस्टेड स्ट्रक्ट के रूप में आता है और डेटा सामान्यीकरण और रैंगलिंग का अर्थ अक्सर उनकी सामग्री को नया आकार देना, कास्ट करना और बदलना होता है। उस आवश्यकता को पूरा करने के लिए हम Lenses भी जारी कर रहे हैं, जो इस प्रकार के डेटा के चयन और परिवर्तन के लिए एक घोषणात्मक भाषा है, जो jq से प्रेरित है।

इन API को विशेष रूप से कोडिंग एजेंटों को ध्यान में रखकर डिज़ाइन और परीक्षण किया गया है, और हम पाते हैं कि सामान्य Python की तुलना में Rerun चंक प्रोसेसिंग API के साथ सही और कुशल कोड तैयार करना उनके लिए बहुत आसान है। भविष्य में ये चंक प्रोसेसिंग ट्रांसफ़ॉर्म वर्तमान SDK साइड एक्ज़ीक्यूटर के अलावा Rerun Hub के माध्यम से व्यूअर और क्लाउड में भी चलने में सक्षम होंगे।

MCAP, ROS 2 प्रकार और रोबोटिक्स विज़ुअलाइज़ेशन के लिए विस्तारित अंतर्निहित समर्थन

हमारा मानना है कि यह महत्वपूर्ण है कि Rerun में सभी रोबोटिक्स डेटा को इन्जेस्ट करना और उपयोगी बनाना आसान हो। साथ ही, बहुत सारा डेटा है जिसे अनुकूलन के बिना पूरी तरह से संभाला जा सकता है, और हम प्रत्येक रिलीज़ पर उस अनुभव में सुधार करना जारी रखते हैं। 0.32 बेहतर प्रदर्शन और MCAP और सामान्य ROS 2 प्रकारों के लिए अधिक आउट-ऑफ-द-बॉक्स समर्थन के साथ-साथ उपलब्ध विज़ुअलाइज़ेशन का विस्तार लाता है। अंतर्निहित समर्थन वाले संदेशों की अद्यतन सूची यहाँ देखें।

अधिभोग ग्रिड, या 3D में 2D मानचित्र, मोबाइल रोबोट के लिए महत्वपूर्ण हैं और कुछ समय से Rerun में एक अत्यधिक अनुरोधित सुविधा रही है। इसलिए 0.32 नया GridMap आर्किटाइप और विज़ुअलाइज़र जोड़ता है, जो संबंधित ROS 2 संदेशों के लिए अंतर्निहित समर्थन के साथ युग्मित है।

एक और सामान्य अनुरोध समय के साथ स्थिति परिवर्तनों को देखने की क्षमता रही है। 0.32 एक नया प्रयोगात्मक स्टेट टाइमलाइन व्यू लाता है। यदि आप Rerun में इस दृश्य की प्रतीक्षा कर रहे हैं, तो हमें इस बारे में आपकी प्रतिक्रिया पसंद आएगी कि आप दृश्य से और क्या देखना चाहेंगे।

डिस्क पर कई रिकॉर्डिंग की सामग्री पर अनुक्रमित SQL या डेटाफ्रेम क्वेरी के साथ कैटलॉग सर्वर

Rerun SDK में कैटलॉग API आपको रोबोटिक्स डेटासेट पर पूरी तरह से सामान्य SQL या डेटाफ्रेम क्वेरी लिखने की अनुमति देते हैं। जब Rerun Hub से कनेक्ट किया जाता है, तो यह कुछ समय से बड़े पैमाने के डेटासेट का समर्थन करता है, जबकि ओपन सोर्स सर्वर ने केवल उन डेटासेट का समर्थन किया है जो पूरी तरह से मेमोरी में फिट होते हैं। 0.32 के साथ हम ओपन सोर्स कैटलॉग सर्वर का विस्तार कर रहे हैं ताकि स्थानीय डिस्क पर फ़ाइलों के बाइट रेंज में इंडेक्स किया जा सके, ताकि अब आप केवल ओपन सोर्स SDK के साथ .rrd फ़ाइलों में रोबोट रिकॉर्डिंग के किसी भी स्थानीय निर्देशिका का आसानी से विश्लेषण कर सकें।

प्रशिक्षण और मूल्यांकन के लिए डेटासेट की तीव्र समीक्षा के लिए एक नया UI

0.32 में हम अपने (प्रयोगात्मक) डेटासेट समीक्षा टूल का पहला संस्करण शिप कर रहे हैं। यह आपको एक साथ कई रिकॉर्डिंग को जल्दी से देखने, विसंगति का शिकार करने और अपने डेटा के लिए अंतर्ज्ञान बनाने की अनुमति देता है। यह आपको रिकॉर्डिंग को फ़्लैग करने की भी अनुमति देता है, जो इसे एक सरल एनोटेशन टूल के रूप में उपयोगी बनाता है। दृश्य एक सामान्य Rerun ब्लूप्रिंट का उपयोग करके कॉन्फ़िगर किया गया है।

कई रोबोट लर्निंग टीमों ने इस कार्यक्षमता के लिए पूछा है और हमें इस बारे में आपकी सभी प्रतिक्रिया पसंद आएगी कि इसे सबसे कुशल डेटासेट समीक्षा टूल कैसे बनाया जाए।

रोबोट लर्निंग के लिए एक डेटालोडर जो सरल डेटासेट मिक्सिंग और .rrd फ़ाइलों में रैंडम सीक का समर्थन करता है

हमने अपनी सबसे अधिक अनुरोधित सुविधाओं में से एक पर काम शुरू कर दिया है: Rerun के लिए एक PyTorch डेटालोडर! नया rerun.experimental.dataloader मॉड्यूल Rerun रिकॉर्डिंग को iterable या map-style PyTorch डेटासेट के रूप में उजागर करता है, जो एनकोडेड इमेज, स्केलर और संपीड़ित वीडियो (h264/h265/av1) को तुरंत स्ट्रीम करता है। रैंडम एक्सेस, मल्टी-वर्कर प्रीफ़ेचिंग और DDP समर्थन आउट-ऑफ-द-बॉक्स काम करते हैं। यह OSS कैटलॉग सर्वर और हमारे वाणिज्यिक उत्पाद Rerun Hub दोनों के साथ संगत है, जब आप ऑब्जेक्ट स्टोरेज द्वारा समर्थित बड़े डेटासेट पर सीधे प्रशिक्षित करना चाहते हैं।

हम इस प्रशिक्षण डेटालोडर को समुदाय के लिए प्रयोग शुरू करने के लिए जारी करने के लिए अविश्वसनीय रूप से उत्साहित हैं। हम इसे रोबोट लर्निंग के लिए सबसे अच्छा स्ट्रीमिंग डेटालोडर बनाने का इरादा रखते हैं और हमें आपकी सभी प्रतिक्रिया और अनुरोध पसंद आएंगे।

उसी डेटा लेयर से सीधे प्रशिक्षित करने में सक्षम होना जिसका उपयोग आप विज़ुअलाइज़ेशन, विश्लेषण और परिवर्तन के लिए करते हैं, टीमों के लिए अपने डेटा लेयर को वास्तव में एकीकृत करने में सक्षम होने के लिए महत्वपूर्ण है, जो कि वे सिस्टम को वास्तव में सरल बना सकते हैं और प्रयोग चक्रों को गति दे सकते हैं।

Rerun Hub प्राइवेट प्रीव्यू में है और स्केल के लिए बनाया गया है

पिछले डेढ़ साल में हम चुपचाप शुरुआती स्टार्टअप और लैब्स के एक बेहतरीन सेट के साथ मिलकर रोबोट लर्निंग को मूल्यवान वास्तविक दुनिया के अनुप्रयोगों में लाने में तेजी लाने के लिए आवश्यक डेटा लेयर का निर्माण कर रहे हैं। हम वर्तमान में पेटाबाइट्स रोबोट प्रशिक्षण डेटा को संभाल रहे हैं और एक ऐसे बिंदु पर हैं जहाँ हम अपने वाणिज्यिक उत्पाद Rerun Hub में अधिक टीमों को शामिल करने के लिए तैयार हैं, जो अब प्राइवेट प्रीव्यू में प्रवेश कर रहा है।

Rerun Hub एक कैटलॉग और स्टोरेज इंजन है जो ओपन सोर्स Rerun SDK से जुड़ता है ताकि संग्रह से प्रशिक्षण और तैनाती तक रोबोट लर्निंग डेटा के साथ काम करना आसान हो सके। यह एक समान प्रबंधन और एक्सेस लेयर के रूप में कार्य करता है जो इन्जेशन, विज़ुअलाइज़ेशन, विश्लेषणात्मक क्वेरी, परिवर्तन और प्रशिक्षण से सभी मुख्य डेटा क्षमताओं को शक्ति प्रदान करता है। डेटा को किसी भी S3 संगत ऑब्जेक्ट स्टोरेज में संग्रहीत किया जा सकता है, और Rerun Hub आपके प्रशिक्षण या बड़े पैमाने पर समानांतर पोस्ट-प्रोसेसिंग जॉब्स में ऑब्जेक्ट स्टोरेज से Rerun SDK तक कुशलतापूर्वक प्रत्यक्ष चयनात्मक-स्ट्रीमिंग की मध्यस्थता करता है। केंद्रीकृत हब कोड के माध्यम से या व्यूअर में इंटरैक्टिव रूप से साझा करने योग्य डेटा लिंक बनाना आसान बनाकर सहयोग और स्वचालित समीक्षा को भी सरल बनाता है।

Nikolaus West - inline image

यदि आप बुद्धिमान रोबोट बना रहे हैं और अपने डेटा लेयर को अपग्रेड करने में रुचि रखते हैं ताकि आप तेज़ी से पुनरावृत्ति कर सकें, संपर्क करें। उन टीमों के लिए जो पहले से ही जटिल मौजूदा सिस्टम के साथ कुछ पैमाने पर पहुँच चुकी हैं, Rerun को टुकड़े-टुकड़े करके अपनाना आसान है और हम आपको मुख्य लोगों को अन्य शीर्ष प्राथमिकताओं से हटाए बिना अपग्रेड करने में मदद करने के लिए फॉरवर्ड डिप्लॉयड इंजीनियर भी प्रदान कर सकते हैं।

एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें