आपका इन्फरेंस सर्वर गुप्त रूप से एक लर्नर है: सेल्फ-इम्प्रूविंग एजेंट्स के लिए Reef को ओपन-सोर्स करना

@ao_qu18465
अंग्रेज़ी01 सित॰ 2026
121K
216
46
9
262

TL;DR

Reef एक ओपन-सोर्स इंफ्रास्ट्रक्चर है जिसे AI एजेंट्स के निरंतर सेल्फ-इम्प्रूवमेंट के लिए डिज़ाइन किया गया है। यह मॉडल वेट्स और हार्नेस लॉजिक दोनों को लाइव इन्फरेंस अनुभव और फीडबैक के आधार पर विकसित होने की अनुमति देता है।

Reef पूरी तरह से ओपन सोर्स है: https://github.com/Human-Agent-Society/reef

1. “RSI” हाइप के वास्तविकता बनने से पहले

आज RSI के आसपास के उत्साह के पूरी तरह से साकार होने से पहले, हम Reef को ओपन-सोर्स करना चाहते हैं, जो एक इंफ्रास्ट्रक्चर है जिसे हम उसी व्यापक समस्या के लिए बना रहे हैं: एजेंटों (हार्नेस + मॉडल) को उनके अनुभव से लगातार विकसित होने में सक्षम बनाना।

लक्ष्य ओपन-सोर्स समुदाय के लिए निरंतर आत्म-सुधार के साथ प्रयोग करना और इसके लिए प्रोडक्शन-ग्रेड इंफ्रास्ट्रक्चर तक आसानी से पहुंच प्राप्त करना आसान बनाना है। हम यहाँ निरंतर आत्म-सुधार का उपयोग एक व्यापक और अधिक व्यावहारिक फ्रेमिंग के रूप में करते हैं, जिसमें RSI उसी विचार के अधिक पूरी तरह से पुनरावर्ती रूप का प्रतिनिधित्व करता है।¹

2. निरंतर आत्म-सुधार को नए इंफ्रास्ट्रक्चर की आवश्यकता क्यों है?

Ao Qu - inline image

GIF

अधिकांश LLM इंफ्रास्ट्रक्चर एक अपेक्षाकृत सरल जीवनचक्र मानता है। हम एक मॉडल को प्रशिक्षित करते हैं, उसका मूल्यांकन करते हैं, उसे तैनात करते हैं, और फिर उसका उपयोग अनुमान के लिए करते हैं। लगातार आत्म-सुधार करने वाले एजेंटों के लिए, हमें लगता है कि इस सेटअप के पीछे दो धारणाएँ टूटने लगती हैं।

पहला, अनुमान अब पाइपलाइन का अंत नहीं है। एजेंट काम करते समय उपयोगी अनुभव उत्पन्न करते हैं, जिसमें ट्रैजेक्टरी, निष्पादन परिणाम, उपयोगकर्ता प्रतिक्रिया और अन्य संकेत शामिल हैं जो भविष्य में सुधार ला सकते हैं। अनुमान के समय जो होता है वह अब कुछ ऐसा नहीं है जिसे हम केवल परोसते और त्याग देते हैं। यह स्वयं सीखने की प्रक्रिया का हिस्सा बन जाता है।

दूसरा, मॉडल ही एकमात्र ऐसी चीज़ नहीं है जो विकसित होती है। एक एजेंट एक मॉडल से अधिक है, और निरंतर आत्म-सुधार मॉडल वेट तक ही सीमित नहीं होना चाहिए। प्रॉम्प्ट, मेमोरी, कौशल, उपकरण और ऑर्केस्ट्रेशन लॉजिक सभी अनुभव से संभावित रूप से सुधार कर सकते हैं। एक मजबूत मॉडल एजेंट की क्षमताओं का विस्तार करता है, जबकि एक बेहतर हार्नेस उन क्षमताओं को अधिक प्रभावी ढंग से उजागर करने और जटिल कार्यों में अधिक विश्वसनीय रूप से उनका उपयोग करने में मदद करता है।

एक साथ, ये परिवर्तन एक बार जो अधिकतर अनुक्रमिक पाइपलाइन था, उसे एक सतत विकास लूप में बदल देते हैं। एजेंट बातचीत करते हैं, अनुभव उत्पन्न करते हैं, अपने विभिन्न भागों में सुधार करते हैं, मूल्यांकन करते हैं कि क्या वे परिवर्तन रखने लायक हैं, और सिस्टम के नए संस्करणों के रूप में सेवा में लौट आते हैं।

यही कारण है कि हम Reef को केवल प्रशिक्षण इंफ्रास्ट्रक्चर के रूप में नहीं सोचते हैं। प्रशिक्षण लूप का केवल एक हिस्सा है। हमें लगता है कि निरंतर आत्म-सुधार के लिए इंफ्रास्ट्रक्चर को लाइव इन्फ्रेंस से शुरू करना होगा और पूरे एजेंट के विकास का समर्थन करना होगा।

Ao Qu - inline image

GIF

3. ऐसे इंफ्रास्ट्रक्चर को क्या चाहिए, और Reef इसे कैसे लागू करता है?

Ao Qu - inline image

Reef आर्किटेक्चर

निरंतर आत्म-सुधार के लिए इंफ्रास्ट्रक्चर को तीन चीजों का अंत-से-अंत तक स्वामित्व रखना होगा: अनुभव, एजेंट और अपडेट। इसका मतलब है (1) लाइव ट्रैफिक से सीखना, (2) मॉडल और हार्नेस दोनों को अपडेट करना, और (3) ठीक से मूल्यांकन, संस्करण नियंत्रण और नियंत्रण करना कि अपडेट कैसे जारी किए जाते हैं।

अनुभव का स्वामित्व — सीखने को लाइव सर्विंग के शीर्ष पर बनाया जाना चाहिए

अनुमान और प्रशिक्षण ऐतिहासिक रूप से अलग-अलग रहे हैं। कुछ RL इंफ्रास्ट्रक्चर (जैसे, Slime, veRL) डेटा उत्पन्न करने के लिए एक इन्फ्रेंस इंजन शामिल करते हैं, लेकिन ये सिस्टम मॉडल सर्विंग के बजाय मॉडल प्रशिक्षण के लिए डिज़ाइन किए गए हैं। हम मानते हैं कि एक निरंतर आत्म-सुधार करने वाला इंफ्रास्ट्रक्चर पहले एक इन्फ्रेंस इंफ्रास्ट्रक्चर होना चाहिए और लाइव इन्फ्रेंस के आसपास अपनी प्रशिक्षण क्षमता का निर्माण करना चाहिए: सिस्टम वास्तविक अनुप्रयोगों की सेवा करता है, परीक्षण-समय का अनुभव एकत्र करता है, और सीखने की रेसिपी को इसे लगातार उपभोग करने देता है। यह विश्वास कई डिज़ाइन विकल्पों के पुनर्विचार की ओर ले जाता है, जिसमें प्रशिक्षण संकेत उत्पादन और प्रशिक्षण नमूना चयन शामिल है।

अनुमान Reef के लिए स्वाभाविक है। Reef मानक अनुमान एंडपॉइंट प्रदर्शित करता है, जिससे मौजूदा अनुप्रयोगों में एकीकृत करना और उन्हें स्व-विकसित प्रणालियों में बदलना आसान हो जाता है।

python
1# client = xxx # Reef के सर्विंग एंडपॉइंट पर httpx क्लाइंट को इनिशियलाइज़ करें
2
3# Reef के माध्यम से मानक अनुमान कॉल, Open-AI प्रारूप
4response = client.post(
5 "/v1/chat/completions",
6 json={"model": xxx, "messages": xxx},
7)
8
9# Reef द्वारा संग्रहीत अनुमान रिकॉर्ड का संदर्भ
10receipt = response.headers["x-reef-agent-record-id"]

एप्लिकेशन विशिष्ट अनुमान कॉल से जुड़े पुरस्कार, मूल्यांकनकर्ता प्रतिक्रिया या अन्य संकेत भी इसके माध्यम से रिपोर्ट कर सकते हैं:

python
1# संबंधित अनुमान रिकॉर्ड में फीडबैक संलग्न करें
2client.post(
3 "/reef/report",
4 json={"feedback": "wrong answer", "references": [receipt]},
5)

मौजूदा इन्फ्रेंस इंजनों से अलग जो अपने जीवनचक्र में स्थिर रहते हैं, Reef स्टेटफुल इन्फ्रेंस प्रदान करता है: Reef अनुमान ट्रेस और फीडबैक को एक संरचित अनुभव स्ट्रीम के रूप में संग्रहीत करता है, जो ऑफ-पॉलिसी स्टेलनेस, सत्र विलय और डीडुप्लीकेशन जैसे मुद्दों को संभालता है। सीखने की रेसिपी परिभाषित करती हैं कि इस स्ट्रीम को कैसे संसाधित किया जाता है, किस सीखने के एल्गोरिदम का उपयोग किया जाता है, और अपडेट का मूल्यांकन और तैनाती कब की जाती है। यह विभिन्न अनुप्रयोगों को एक ही इंफ्रास्ट्रक्चर के शीर्ष पर अपनी सीखने की रणनीतियों के साथ विकसित होने देता है।

पूरे एजेंट का स्वामित्व — मॉडल और हार्नेस दोनों को स्टेटफुल इन्फ्रेंस के माध्यम से विकसित किया जाता है

एक AI एजेंट जो अंत-से-अंत परिणाम देने में सक्षम है, उसमें न केवल एक मॉडल होता है, बल्कि एक हार्नेस भी होता है। मॉडल कार्यों को हल करने के लिए आवश्यक अंतर्निहित क्षमताएं प्रदान करता है, जबकि हार्नेस उपकरणों, संदर्भ, मेमोरी, फीडबैक और ऑर्केस्ट्रेशन का प्रबंधन करके जटिल, लंबी-अवधि की ट्रैजेक्टरी में विश्वसनीय निष्पादन सक्षम बनाता है। दोनों एक-दूसरे से कसकर जुड़े हुए हैं: हार्नेस यह निर्धारित करता है कि मॉडल की क्षमताओं को कैसे उजागर, आधारित और उपयोग किया जाता है, जबकि मॉडल यह निर्धारित करता है कि हार्नेस किस प्रकार के निष्पादन का विश्वसनीय रूप से समर्थन कर सकता है। इसलिए दोनों में से किसी में भी प्रगति दूसरे के इष्टतम डिज़ाइन को बदल सकती है। एक निरंतर आत्म-सुधार करने वाले इंफ्रास्ट्रक्चर को पूरे एजेंट स्टैक के संयुक्त विकास का समर्थन करना चाहिए, जिसमें न केवल मॉडल वेट, बल्कि प्रॉम्प्ट, मेमोरी, कौशल, उपकरण और ऑर्केस्ट्रेशन लॉजिक भी शामिल हैं।

Reef मॉडल और हार्नेस दोनों के अपडेट का समर्थन करता है।

हार्नेस पक्ष पर, Reef एक "प्रशिक्षण बैकएंड" के रूप में Cordis का उपयोग करता है। एक हार्नेस विकास रेसिपी आमतौर पर एजेंट ट्रैजेक्टरी और फीडबैक का विश्लेषण करती है, फिर हार्नेस में संपादन का प्रस्ताव करती है। यह प्रक्रिया पूरी तरह से Reef के भीतर होती है, और प्रत्येक विकसित हार्नेस संस्करण उपयोगकर्ता को एक इंस्टॉल करने योग्य अपडेट के रूप में जारी किया जाता है (यह मानते हुए कि Reef localhost:8900 पर परोसा जाता है):

bash
1curl -fsS -H "Authorization: Bearer $REEF_TOKEN" \
2 'http://localhost:8900/reef/harness/install?adapter=pi' | bash

उपरोक्त कमांड एक विशिष्ट कोडिंग एजेंट की तरह ही एक Reef-लिपटे Pi हार्नेस को स्थापित करता है। हार्नेस को Reef के स्टेटफुल इन्फ्रेंस एंडपॉइंट का उपयोग करने के लिए कॉन्फ़िगर किया गया है, इसलिए इसका इन्फ्रेंस ट्रैफिक Reef के माध्यम से प्रवाहित होता है। जैसे-जैसे उपयोगकर्ता काम करता है, Cordis कॉन्फ़िगर की गई हार्नेस विकास रेसिपी के बाद हार्नेस को विकसित करता है, और नए संस्करण Reef के माध्यम से उपलब्ध कराए जाते हैं। अगली बार जब उपयोगकर्ता हार्नेस खोलता है, तो वे देख सकते हैं:

Ao Qu - inline image

मॉडल पक्ष पर, सीखने की रेसिपी मॉडल वेट को अपडेट करने के लिए Reef रिकॉर्ड का उपभोग करती हैं। प्रशिक्षण एक वितरित प्रशिक्षण बैकएंड का उपयोग करके लाइव सर्विंग के साथ अतुल्यकालिक रूप से चलता है, जो वर्तमान में Slime से अनुकूलित है, और चेकपॉइंट या LoRA एडेप्टर जैसे उम्मीदवार वेट अपडेट तैयार करता है।

एक बार जब कोई उम्मीदवार मूल्यांकन पास कर लेता है और तैनाती के लिए अनुमोदित हो जाता है, तो Reef इसे परिदृश्य के मॉडल आर्टिफैक्ट के एक नए संस्करण के रूप में प्रकाशित करता है और सेवा को पुनरारंभ किए बिना NCCL-आधारित वेट सिंक्रोनाइज़ेशन का उपयोग करके सर्विंग इंजन को हॉट-अपडेट करता है।

अपडेट का स्वामित्व — विकसित रिलीज़ का मूल्यांकन और संस्करण नियंत्रण किया जाता है

एक लगातार विकसित होने वाला एजेंट सेवा गुणवत्ता में गिरावट के अधीन है, खासकर जब विकास प्रदर्शन में सुधार लाने की गारंटी नहीं है। इस प्रकार, प्रत्येक विकसित उम्मीदवार का रिलीज़ से पहले मूल्यांकन किया जाना चाहिए। Reef नियंत्रित करता है कि क्या किसी विकसित उम्मीदवार को वर्तमान में किसी परिदृश्य की सेवा करने वाले आर्टिफैक्ट को बदलने की अनुमति है। यदि उम्मीदवार को अस्वीकार कर दिया जाता है, तो सर्विंग अपरिवर्तित रहती है। अन्यथा Reef इसे एक नई, ऑडिट करने योग्य रिलीज़ के रूप में प्रकाशित करता है।

Reef जो कुछ भी विकसित कर सकता है—जैसे मॉडल चेकपॉइंट, LoRA एडेप्टर, हार्नेस ट्री, या रूटिंग पॉलिसी—को एक आर्टिफैक्ट के रूप में दर्शाया जाता है जिसे एक संस्करण नियंत्रक द्वारा प्रबंधित किया जाता है। Reef आर्टिफैक्ट के प्रबंधन के लिए Git LFS को अपनाता है, विशेष रूप से वे जो मॉडल वेट जैसी बड़ी डिस्क स्पेस लेते हैं। रिलीज़ पथ है:

Ao Qu - inline image

प्रत्येक परिदृश्य में एक केवल-जोड़ें रिलीज़ श्रृंखला होती है। Reef कंपेयर-एंड-स्वैप का उपयोग करके परिदृश्य के रिलीज़ हेड को आगे बढ़ाता है, इसलिए एक पुराना प्रकाशक नए रिलीज़ को ओवरराइट नहीं कर सकता है। रिलीज़ पाइपलाइन Reef को निरंतर संस्करण परिवर्तनों और रिलीज़ प्रक्रियाओं को कुशलतापूर्वक ट्रैक करने की अनुमति देती है।

4. Reef में निरंतर आत्म-सुधार के तरीके

उपरोक्त इंफ्रास्ट्रक्चर निरंतर आत्म-सुधार के लिए सामान्य अमूर्तता प्रदान करता है। एजेंट कैसे सुधार करता है इसका वास्तविक तर्क मॉड्यूलर सीखने की रेसिपी के माध्यम से कार्यान्वित किया जाता है।

हमने परीक्षण के समय उत्पन्न संकेतों को बेहतर एजेंटों में बदलने के तरीकों का एक बढ़ता हुआ संग्रह देखा है: ऑनलाइन सुदृढीकरण सीखना, परीक्षण-समय प्रशिक्षण, कौशल विकास, हार्नेस विकास, सेल्फ-प्ले, और बहुत कुछ। उनके अलग-अलग नामों और तंत्रों के बावजूद, वे एक ही मूल पैटर्न साझा करते हैं: परीक्षण के समय उत्पन्न संकेतों को उस सिस्टम में अपडेट में बदल दिया जाता है जो अगली बातचीत उत्पन्न करता है।

ये रेसिपी मुख्य रूप से तीन आयामों में भिन्न होती हैं:

सीखने का संकेत: सुधार लाने वाला संकेत किस रूप में है, और यह कहाँ से आता है?

अनुभव अधिग्रहण: सीखने का अनुभव कैसे उत्पन्न होता है? क्या यह एजेंट द्वारा सक्रिय रूप से मांगा जाता है, या किसी बाहरी कार्य या बातचीत से प्रतिक्रियात्मक रूप से उत्पन्न होता है?

विकसित होने वाला लक्ष्य: वास्तव में क्या बदलता है: मॉडल, हार्नेस, या दोनों?

Ao Qu - inline image

रेसिपी पहले से ही समर्थित हैं या जल्द ही Reef में आ रही हैं

Reef को इस तरह से डिज़ाइन किया गया है कि इन विधियों को काफी हद तक एक ही इंफ्रास्ट्रक्चर के शीर्ष पर विभिन्न सीखने की रेसिपी के माध्यम से व्यक्त किया जा सकता है। एक रेसिपी का उपयोग करना सरल है: एक चुनें और Reef सेवा शुरू करते समय इसे कॉन्फ़िगर करें।

yaml
1# serve.yaml
2reef:
3 recipe: recipes.sao.recipe:SAORecipe # एक विकास रेसिपी प्लग इन करें
4 batch_size: 1 # रेसिपी-विशिष्ट कॉन्फ़िगरेशन
5 max_staleness: 18

फिर कॉन्फ़िगरेशन के साथ Reef शुरू करें:

bash
1reef serve -c recipes/sao/examples/sao/serve.yaml

नीचे, हम दो उदाहरण दिखाते हैं, OpenClaw-RL और TTT-Discover, जो बहुत अलग विकास रणनीतियों का पालन करते हैं लेकिन दोनों को Reef में लागू किया जा सकता है।

Ao Qu - inline image

GIF

विज़ुअल Reef में OpenClaw-RL के एकीकरण को प्रदर्शित करता है। उपयोगकर्ता एक एजेंट के साथ बातचीत करता है जिसका मॉडल Reef द्वारा उपयोगकर्ता को बाधित किए बिना अतुल्यकालिक रूप से लगातार विकसित किया जाता है। जैसे-जैसे अधिक से अधिक राउंड जमा होते हैं, एजेंट धीरे-धीरे उपयोगकर्ता की प्राथमिकता की सही व्याख्या करना सीखता है और एक संतोषजनक उत्तर देता है।

Ao Qu - inline image

GIF

विज़ुअल प्रदर्शित करता है कि कैसे TTT एक Packing 32 समाधान को पुनरावृत्त रूप से सुधारता है। जैसे-जैसे अनुकूलन आगे बढ़ता है, तेजी से प्रभावी समाधान खोजे और बनाए रखे जाते हैं, जिससे उत्तरोत्तर उच्च पैकिंग स्कोर प्राप्त होते हैं।

5. निष्कर्ष

Reef निरंतर आत्म-सुधार के व्यापक विचार को एक ठोस सिस्टम समस्या में बदलने का हमारा प्रयास है। Reef को ओपन-सोर्स करके, हम इस समस्या का अध्ययन करना आसान बनाने और समुदाय को उन एजेंटों के निर्माण के लिए एक व्यावहारिक आधार देने की उम्मीद करते हैं जो केवल सेवा नहीं करते, बल्कि अनुभव से लगातार सीखते और विकसित होते हैं।

हम आपको Reef आज़माने, अपनी खुद की सीखने की रेसिपी बनाने और इसे अपने एजेंटों के साथ एकीकृत करने के लिए आमंत्रित करते हैं। कोड, दस्तावेज़ीकरण और उदाहरण रेसिपी का अन्वेषण करें https://github.com/Human-Agent-Society/reef पर। यदि आपको Reef उपयोगी लगता है, तो हम रिपॉजिटरी पर एक स्टार की सराहना करेंगे। यदि आप हमारे साथ निर्माण करना चाहते हैं या निरंतर आत्म-सुधार पर अधिक व्यापक रूप से चर्चा करना चाहते हैं, तो आप हमारे Discord में शामिल होने के लिए स्वागत है: https://discord.gg/5y8e5f937k

  1. हम निरंतर आत्म-सुधार का उपयोग RSI की तुलना में एक व्यापक और अधिक व्यावहारिक फ्रेमिंग के रूप में करते हैं। यह उन प्रणालियों को कवर करता है जो अनुभव से बार-बार सुधार करते हैं, बिना RSI से अक्सर जुड़े पूरी तरह से बंद लूप की आवश्यकता के, जहां AI स्वयं उस सिस्टम के निर्माण और सुधार में भाग लेता है जो इसका अगला संस्करण तैयार करता है। Reef इस व्यापक समस्या के लिए डिज़ाइन किया गया है, जबकि आत्म-सुधार के अधिक पुनरावर्ती रूपों के लिए इसके शीर्ष पर उभरने की गुंजाइश छोड़ता है।

बढ़ती योगदानकर्ता सूची (वर्णमाला क्रम): Chai Wenhao (@wenhaocha1), Ding Shuangrui (@ShuangruiDing), He Hao, He Haoze, Jiang Chonhe (@JiangChonghe), Jiang Nan (@nanjiangwill), Jiang Xuan, Li Xiaochen (@jacobli99), Liang Paul (@pliang279), Liu Bo (@Benjamin_eecs), Long Boyuan, Mang Qiuyang (@MangQiuyang), Qi Zhenting (@ZhentingQi), Qu Ao (@ao_qu18465), Qu Mingruo, Wang Zhaokai, Yan Xuezhi, Yu Hanfei (@yhfchitanda), Yu Haofei (@haofeiyu44), Yu Simon (@simon_ycl), Zheng Han (@hanzheng_7), Zhou Kaichen (@alex_kai2020), Zhou Zijian (@BobbyZhouZijian), Zhu Jiacheng (@JiachengZhu_ML), Zhuang Dingyi

एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें