हमने पूरी टीम के समर्थन के लिए Hermes को कैसे बनाया

@JacquelineSYC19
अंग्रेज़ी16 सित॰ 2026
153K
863
74
76
2.0K

TL;DR

Artie Labs अपने 17-व्यक्ति टीम में Hermes, एक ओपन-सोर्स AI एजेंट हार्नेस के तैनाती का विवरण देते हैं। वे बताते हैं कि उन्होंने विशिष्ट भूमिकाओं के लिए एजेंट प्रोफाइल को कैसे अनुकूलित किया, एकल सर्वर के माध्यम से लागतों को कैसे प्रबंधित किया और स्मृति अनुकूलन के लिए रात्रिकालीन 'ड्रीमिंग' रूटीन को कैसे लागू किया।

लेखन के समय, Artie में 17 लोगों की एक टीम है। हममें से हर कोई Hermes के साथ काम करता है, जो @NousResearch का एक ओपन-सोर्स AI एजेंट हार्नेस है। यह जर्मनी में एक भौतिक मशीन पर चलता है, हर टीम के लिए इसका अलग व्यक्तित्व होता है, और रात में यह सपने देखता है।

यह सब कैसे हुआ, इसकी कहानी यहाँ है।

शुरुआत एक इंजीनियर के WhatsApp कॉन्टैक्ट से हुई

कुछ महीने पहले, हमारे एक इंजीनियर (Ani, @anirudhsriramzz) अपने लिए Hermes चला रहे थे। यह सिर्फ एक निजी सेटअप था, और वे इसके साथ WhatsApp पर बात करते थे।

उसी समय, हमारे CTO Robin एक हैकाथॉन से लौटे, जहाँ उनके एक दोस्त ने उन्हें एजेंट्स की पूरी रेंज दिखाई थी जो अपना काम कर रहे थे। उन्होंने जो सवाल उठाया वह सरल था: हम इसे Artie में सभी के लिए, न कि केवल इंजीनियर्स के लिए, उपलब्ध कैसे बनाएं?

हमने पहले OpenClaw को देखा। यह अच्छा है। लेकिन एजेंट के बिना अनुमति के कुछ भी करने या भटक जाने को देखना आसान था, और हम स्केल से पहले गार्डरेल्स चाहते थे। इसलिए हमने Hermes चुना और सोचना शुरू किया कि गार्डरेल्स क्या होने चाहिए।

ब्लाइंडर्स वाला दिमाग

हमारा दृष्टिकोण यह है: हर लैब ने एक 'दिमाग' (brain) शिप किया है। आप उससे कुछ भी पूछ सकते हैं और वह जवाब देगा। उसी सवाल को पाँच बार पूछिए और आपको पाँच अलग-अलग, परंतु विश्वसनीय लगने वाले उत्तर मिलेंगे।

एक चैट विंडो के लिए यह ठीक है। लेकिन जब आप चाहते हैं कि यह दिमाग एक काम करे, तो यह समस्या बन जाता है। यदि एक सेल्स इंजीनियर 25 खुली कस्टमर थ्रेड्स पर जोखिम का विश्लेषण मांगता है, तो उन्हें हर बार समान फॉर्मेट चाहिए ताकि वे उस पर कार्य कर सकें, हफ्तों की तुलना कर सकें, और उस चीज़ पर भरोसा कर सकें।

घोड़े ब्लाइंडर्स (blindfold) इसलिए पहनते हैं ताकि वे भीड़ की ओर देखने के बजाय रेस ट्रैक पर ध्यान केंद्रित करें। स्किल्स और टूल्स वही ब्लाइंडर्स हैं। हार्नेस उनको बांधने का तरीका है। Hermes, Codex, Claude Code और अन्य सभी एक ही विचार के विभिन्न संस्करण हैं: यह तय करने का तरीका कि मॉडल क्या करने के लिए अधिकृत है और उसका आउटपुट कैसा दिखना चाहिए।

जब हमने इसे इस तरह से देखा, तो प्रोजेक्ट 'एक चैटबॉट सेट अप करना' नहीं रहा, बल्कि यह 'Artie में हर काम के लिए ब्लाइंडर्स बनाना' बन गया।

जर्मनी में $60 का सर्वर यह सब चलाता है

Robin और Ani ने एक हफ्ते के अंत में लगभग तीन घंटों में पहला Hermes सेट अप किया। हमने Railway पर सबसे सस्ता प्लान किराए पर लिया, एक डिफ़ॉल्ट प्रोफाइल के साथ Hermes को बूट किया, और इंजीनियरिंग टीम को इसे चलाने दिया।

पाँच दिनों के भीतर, हम बार-बार Railway की उपयोग सीमाओं से टकरा रहे थे। हर अलर्ट अपग्रेड करने का एक संकेत था। यह पहला वास्तविक सबक था: जैसे ही कोई टीम किसी एजेंट को अपनाती है, बिल अब साइड प्रोजेक्ट जैसा नहीं दिखता।

हमारा प्रोडक्शन इन्फ्रास्ट्रक्चर AWS पर चलता है और वहीं रहेगा। लेकिन यह एजेंट्स के लिए एक आंतरिक सैंडबॉक्स था, ग्राहकों का इन्फ्रास्ट्रक्चर नहीं, और हम देखना चाहते थे कि हम इसे कितना सस्ता बना सकते हैं। हमें Hetzner (@Hetzner_Online), एक जर्मन होस्टिंग कंपनी मिली, और हमने सालाना $60 में एक भौतिक मशीन खरीदी। आज Artie में हर Hermes उसी बॉक्स पर चलता है।

हम एक छोटी और चालाक (scrappy) कंपनी हैं। Artie में AI का पूरा सवाल यह रहा है: बिना पैसा बर्बाद किए, हम अपनी टीम को AI-नेटिव कैसे बनाएं? Hetzner बॉक्स पहला जवाब था।

हम वास्तव में क्या चाहते थे

एक मशीन के साथ जो भार उठा सकती थी, हम बैठे और तय किया कि Hermes किस लिए है। दो लक्ष्य थे।

हर किसी को एक साइडकिक मिलता है। इंजीनियर्स, सेल्स, ऑप्स, मार्केटिंग, डिज़ाइन। आपका एक जूनियर वर्जन जो आपको और अधिक करने में मदद करे, न कि वह चीज़ जो आपको प्रतिस्थापित कर दे। उद्योग में डर यह है कि एजेंट नौकरी छीन लेंगे। हमारा अनुभव इसके विपरीत है: जब हर किसी के पास एक होता है, तो हर कोई तेजी से शिप करता है और ऐसे काम लेता है जो पहले असंभव थे।

मानव हमेशा लूप में रहता है। Hermes वह सब कर सकता है जिसके लिए उसे निर्देशित किया गया है। उत्पादन में, डॉक्स में, या ग्राहक के सामने कुछ भी लैंड करने से पहले, एक व्यक्ति उसकी समीक्षा करता है।

लोग विशेषज्ञ होते हैं, इसलिए एजेंट्स भी होने चाहिए

17 लोगों की टीम में कोई भी केवल एक चीज़ में अच्छा नहीं होता। लेकिन हर किसी की कोई न कोई विशेषज्ञता होती है। हम विशेषज्ञता के लिए भर्ती करते हैं।

तो हमने पूछा कि हमारे एजेंट्स क्यों अलग होने चाहिए। मार्केटिंग कॉपी पर काम कर रहा एक जूनियर इंजीनियर बर्बादी है। कोडबेस में एक जूनियर मार्केटर और भी बुरा है। हमने एजेंट्स को उसी तरह मॉडल किया जिस तरह हम लोगों के बारे में सोचते हैं: प्रत्येक को एक डोमेन, एक व्यक्तित्व, और उस डोमेन को आवश्यक चीज़ों तक पहुँच दें।

इससे हमें Hermes प्रोफाइल्स का एक परिवार मिला, हर टीम के लिए एक।

Hermes Plan और Hermes Code इंजीनियरिंग से संबंधित हैं। Plan टेक लीड के लिए है: यह तय करना कि हम A फिर B करेंगे, या A और B समानांतर में और C बाद में, और इसे लिखना। Plan काम को एक Kanban बोर्ड पर भेजता है। Code टिकट्स उठाता है, हमारे मौजूदा कोडबेस के खिलाफ बैकग्राउंड में निष्पादित करता है, PRs खोलता है, और इंतजार करता है। एक मानव PR की समीक्षा करता है, और केवल तभी इसे master में मर्ज किया जाता है। एक कार्य पूरा होने पर प्लान में अगला कार्य शुरू हो जाता है।

अनुमानित नहीं किया गया दुष्प्रभाव: अब इंजीनियरिंग का अधिकांश समय प्लान पर खर्च होता है। ऐतिहासिक रूप से लोग कोड और निष्पादन में रहते थे। अब वे सिस्टम डिज़ाइन और समीक्षा में रहते हैं, और Hermes Code बीच का हिस्सा संभालता है।

Hermes Sales डिस्कवरी कॉल से पहले तैयारी करता है। यह संभावित ग्राहक (prospect) पर शोध करता है, उनके मौजूदा स्टैक को समझता है, और डील पर वर्तमान संदर्भ प्राप्त करता है। क्योंकि इसके पास हमारे डॉक्स और इंजीनियरिंग ज्ञान भी है, यह एक कदम आगे जा सकता है: यदि एक संभावित ग्राहक बताता है कि वे एक विशेष टूल के साथ डेटा स्थानांतरित कर रहे हैं, तो Hermes कॉल शुरू होने से पहले ही रिप्रेजेंटेटिव को बता सकता है कि वह टूल कहाँ टूटता है, जैसे स्कीमा ड्रिफ्ट (schema drift) पर।

Hermes Design और Hermes Code मिलकर मार्केटिंग को एक इंजीनियर को शामिल किए बिना लैंडिंग पेजेस डिज़ाइन, बनाने और शिप करने की अनुमति देते हैं। हमारी मार्केटिंग साइट Next.js पर है और हम अब CMS का उपयोग नहीं करते। Design मौजूदा कंपोनेंट सिस्टम के भीतर काम करता है, किसी नए कंपोनेंट को आविष्कार करने से पहले जांचता है कि क्या वह पहले से मौजूद है, और कार्यान्वयन के लिए Code को सौंप देता है।

Hermes BizOps पुनरावृत्ति वाली परिचालन गतिविधियों को संभालता है: पाइपलाइन समीक्षा, सुधार (reconciliation), ट्रैकर अपडेट, और उन अपवादों को खोजना जिनके लिए एक मानव की आवश्यकता होती है।

और उन चीज़ों के लिए एक डिफ़ॉल्ट प्रोफाइल है जो इनमें से किसी में फिट नहीं होती।

हममें से ज्यादातर लोग Slack के माध्यम से इनसे बात करते हैं। कुछ लोग Hermes desktop का उपयोग करते हैं। किसी भी तरह, यह पूरी चीज़ प्रतिक्रियात्मक (reactive) से सक्रिय (proactive) में बदल गई: एजेंट्स के पास पहले से कोडबेस, डॉक्स, CRM, और इंटरनेट है, इसलिए वे हर जगह से उत्तर दे सकते हैं बजाय संदर्भ दिए जाने का इंतजार करने के।

स्किल्स, दिन एक से कोड की तरह वर्जनिंग

प्रोफाइल्स व्यक्तित्व हैं। स्किल्स उन्हें सक्षम बनाती हैं।

स्किल वास्तविक कार्य वर्ग के लिए एक पुन: उपयोग योग्य प्रक्रिया है: पहले क्या जांचना है, कौन स्रोत प्राधिकृत हैं, आउटपुट कैसा दिखता है, इसे कैसे सत्यापित करना है। हमने पहले हफ्ते से अपनी स्किल्स लिखीं और उन्हें Git रिपॉजिटरी में डाल दिया। हर Hermes वहां से पढ़ता है। जब कोई स्किल बदलती है, तो यह एक कमिट होता है, इतिहास के साथ, जिसे हर प्रोफाइल उठा लेता है।

हम जानबूझकर बहुत सारी स्किल्स नहीं लिख रहे थे। AI को आपके लिए काम में लाने के लाखों तरीके हैं और इंटरनेट का अधिकांश हिस्सा आपको स्वतंत्र एजेंट्स की 24/7 फैक्ट्री बनाने के लिए कहेगा। यदि आपके पास अनंत टोकन होते, तो निश्चित रूप से। हमारे पास नहीं हैं। सैकड़ों स्किल्स में से यह तय करने के लिए घूमता हुआ एजेंट निर्णय लेने में टोकन जला देता है। इसलिए हमने वह सब काट दिया जो स्पष्ट रूप से लागत के लायक नहीं था, और हम काटना जारी रखते हैं।

हमारे द्वारा अपनाया गया नियम: यदि मूल्य स्पष्ट है, तो लागत उचित है। यदि मूल्य अस्पष्ट है, तो उसे नहीं बनाया जाता।

Hermes सपने देखता है

Hermes में एक cron सिस्टम है। आप इसे एक कार्य और एक आवृत्ति दे सकते हैं और यह अपने आप चलता है।

Anthropic के एजेंट मेमोरी पर काम से प्रेरित होकर, हमने इसका उपयोग मनुष्यों द्वारा की जाने वाली एक चीज़ की नकल करने के लिए किया। REM नींद के दौरान, आपका दिमाग दिन को व्यवस्थित करता है। कुछ चीज़ें दीर्घकालिक स्मृति में बढ़ाई जाती हैं। कुछ छोड़ दी जाती हैं। वह वर्ष जब आपने शहर बदले और लगातार यात्रा की, यादगार होता है क्योंकि कुछ भी दोहराया नहीं गया।

तो हर रात, जब कोई इसका उपयोग नहीं कर रहा होता, हर Hermes सपने देखता है। यह उस दिन किए गए कार्यों की समीक्षा करता है, तय करता है कि क्या उपयोगी था और क्या नहीं, उपयोगी भागों को स्मृति में बढ़ाता है और बाकी को हटा देता है। फिर यह हमारे इंजीनियर को एक रिपोर्ट भेजता है। रिपोर्ट में चीज़ें होती हैं जैसे: मैंने यह गलत किया, मैंने वह गलत किया, मैंने इसे सुधार लिया है, मैंने सुधार संग्रहीत किया है, और मैं उस आदत को भूल गया हूं जिसने इसे ट्रिगर किया था।

हफ्तों में, हर प्रोफाइल अपने टीम के लिए क्या करना चाहिए और क्या नहीं, इसके बारे में अधिक राय वाला (opinionated) हो जाता है। हमने ये रायें प्रोग्राम नहीं की थीं। वे सपनों से आई थीं।

हम अपना हार्नेस क्यों चलाते हैं

लोग पूछते हैं कि हम बस Cursor, या Codex, या Claude Code का उपयोग क्यों नहीं करते।

हम कर सकते थे, और तकनीकी रूप से हम कल ही वर्कलोड्स को स्थानांतरित कर सकते थे। लेकिन क्योंकि हम Hermes को स्वयं चलाते और संचालित करते हैं, नीचे का मॉडल किसी भी लैब का हो सकता है। यदि कोई लैब अगले हफ्ते कीमतें बढ़ा दे, तो हम स्विच कर देते हैं। हमारी प्रोफाइल्स अब इतनी स्थिर हैं कि मॉडल बदलने से वे नहीं टूटतीं। सोमवार को हम Anthropic मॉडल पर हो सकते हैं; यदि कीमतें बदलती हैं, तो शुक्रवार तक हम OpenAI पर हो सकते हैं।

दूसरा कारण फीचर्स है। यदि Cursor उस प्रमाणीकरण (authentication) का समर्थन नहीं करता जो आपको चाहिए, या आपके कोडबेस में वही गलती करता रहता है, तो आप एक टिकट दाखिल करते हैं और इंतजार करते हैं। जब Hermes को कुछ चाहिए होता है, हम उसे बनाते हैं। Hermes Artie का हिस्सा है, हमारी सिस्टम्स में इस तरह से जुड़ा हुआ है जैसे कोई भी आंतरिक टूल होता है, न कि कोई ऐसी चीज़ जिसे हमने जोड़ दिया हो और उम्मीद करते हों कि यह काम करती रहेगी।

AI इंजीनियरिंग अभी महंगी है क्योंकि टोकन अर्थव्यवस्था स्थिर नहीं हुई है। एक दिन यह सब चलाना लगभग मुफ्त हो जाएगा। तब तक, हार्नेस का स्वामित्व रखना ही इस तरह है कि हम बिल पर नियंत्रण बनाए रखें।

आज यह कहाँ है, और आगे क्या है

Hermes शायद 85 से 90 प्रतिशत तक अपनी मंजिल के करीब है। यह हर दिन वास्तविक काम करता है। पहला प्रयास हमेशा सबसे अच्छा प्रयास नहीं होता।

इसलिए हम evals में निवेश कर रहे हैं। हर बार जब Hermes एक सवाल प्राप्त करता है और एक उत्तर उत्पन्न करता है, हम जानना चाहते हैं कि किस चीज़ में समय लगा, किस स्किल को बुलाया गया, कौन से टूल्स विफल हुए और क्यों। हम Arize Phoenix को सेल्फ-होस्ट कर रहे हैं, जो ओपन सोर्स है, इसलिए हमें यह बिना कोई और टूल खरीदे मिल जाता है। Hermes से ट्रेस Phoenix में जाते हैं, और Phoenix हमें बताता है: इस कार्य ने पाँच स्किल्स और दो टूल्स को बुलाया, इस टूल ने सबसे अधिक समय लिया, यह विफल हुआ, यहाँ कारण है।

इसके नीचे, हम Datadog के माध्यम से टेलीमेट्री चलाते हैं: खर्च किए गए टोकन, प्रति कार्य सफलता दर, और यदि कोई Hermes डाउन हो जाता है या मेमोरी स्टोर भर जाता है तो ऑन-कॉल को अलर्ट। हर कार्य एक सैंडबॉक्स में चलता है, और हमने अपना स्वयं का प्रूनिंग सिस्टम बनाया है जो सैंडबॉक्स को दैनिक रूप से साफ करता है।

इस सब का उद्देश्य यह है कि हमें अब यह अनुमान लगाने की ज़रूरत नहीं है कि क्या किसी बदलाव ने Hermes को बेहतर बनाया है। हम एक स्किल बदलते हैं, हमें एक रिपोर्ट मिलती है। यदि यह बेहतर है, तो यह रहती है। यदि यह खराब है, तो हम रिवर्ट कर देते हैं।

हमने डॉक्यूमेंटेशन भी Hermes सर्वर में ही लिखी है: आपके कॉन्फ़िग में क्या है, आपको क्या करने की अनुमति है, डेटा का क्या अर्थ है। कोई भी Hermes इसे पढ़ सकता है। जिसका मतलब है कि हम एक ऐसा Hermes चालू कर सकते हैं जिसका एकमात्र काम eval डेटा पढ़ना और अन्य प्रोफाइल्स को बेहतर बनाना है।

यह मूल रूप से Hermes Coach है। यह Hermes को कोच करता है।

सत्रह लोग, एक जर्मन सर्वर, एजेंट्स का एक परिवार जो हर रात सोता है और थोड़ा अधिक तीक्ष्ण होकर जागता है। हमने इसे बनाया क्योंकि हम छोटे हैं और चाहते थे कि हम इस तरह शिप करें जैसे हम बड़े हों।

एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें