पिछले 3 वर्षों में, मैंने AI के साथ कोडिंग करने में 2,000 घंटे से अधिक बिताए हैं, और मैंने एजेंटिक इंजीनियरिंग के क्षेत्र में कुछ सबसे उत्पादक लोगों का व्यक्तिगत रूप से साक्षात्कार किया है।
नीचे मेरा पूरा एजेंटिक इंजीनियरिंग सेटअप है, जैसा कि वर्तमान में 2026 की तीसरी तिमाही में है।
इंटरफ़ेस
इसका मतलब है UI / CLI जिसके माध्यम से आप एजेंटों के साथ बातचीत करते हैं। मेरा मुख्य इंटरफ़ेस bb है।
यह ओपन सोर्स, पूरी तरह से मुफ़्त है, और यह आपको एक ही GUI के अंदर किसी भी सब्सक्रिप्शन, किसी भी एजेंट, किसी भी मॉडल का उपयोग करने की अनुमति देता है। Codex, Claude Code, Pi, Cursor CLI, OpenCode, Grok Build, Hermes, सभी एक ही UI के भीतर।
Codex या Cursor जैसे ऐप्स के साथ समस्या यह है कि वे केवल अपने स्वयं के मॉडल और अपनी स्वयं की सब्सक्रिप्शन की अनुमति देते हैं। लक्ष्य सबसे कम डॉलर में सबसे अधिक टोकन प्राप्त करना है।
Codex या Cursor ऐप्स की आपको पसंद आने वाली सभी सुविधाएं bb के अंदर हैं, और यह हर हफ्ते बेहतर हो रहा है (साथ ही, यह पूरी तरह से ओपन-सोर्स और 100% उपयोग करने के लिए मुफ़्त है)।
एक और चीज़ जो मैं बहुत उपयोग करता हूँ वह है cmux।
जब आप एक नया cmux वर्कस्पेस लॉन्च करते हैं, तो आप स्क्रीन को ठीक वैसे ही विभाजित कर सकते हैं जैसे आप tmux में करते हैं (इसलिए समान नाम), प्रत्येक फलक में अलग-अलग टर्मिनल लॉन्च कर सकते हैं, और इसमें एक अंतर्निहित ब्राउज़र है।
cmux जहाँ कमज़ोर पड़ता है वह है जब आपके पास बहुत सारे एजेंट और वर्कस्पेस होते हैं। बायाँ साइडबार वास्तव में सही प्रिमिटिव नहीं है। कुछ चीज़ों के लिए ठीक है, लेकिन बड़े पैमाने पर गंभीर एजेंटिक इंजीनियरिंग कार्य के लिए यह सबसे अच्छा नहीं है।
मैं अपने टर्मिनल के रूप में Ghostty का उपयोग करता हूँ क्योंकि यह बहुत तेज़ और नेटिव है।
Ghostty के अंदर, आप Herdr चला सकते हैं, जो मूल रूप से एजेंटों के लिए tmux है, एजेंटों के लिए एक बैकएंड रनटाइम। बहुत न्यूनतम, बहुत हल्का, टर्मिनल में रहता है, और जब कोई एजेंट समाप्त हो जाता है, तो उसकी स्थिति बाईं ओर दिखाई देती है: done, idle, blocked, running।
AI एजेंटों की स्थितियों को ट्रैक करना आवश्यक है। मेरा अनुमान है कि 3 से 6 महीनों में यह "एजेंट स्थिति ट्रैकिंग" और अधिक महत्वपूर्ण हो जाएगी, क्योंकि आप एक ही एजेंट से बात नहीं कर रहे होंगे। आप एक प्रबंधक एजेंट से बात कर रहे होंगे जो बहुत सारे कार्यकर्ता एजेंटों का प्रबंधन करता है।
अंतिम इंटरफ़ेस जिसका मुझे उल्लेख करना है वह है Corral, जिसे मैंने स्वयं विकसित किया है।
एजेंटों के समाप्त होने पर बेतरतीब ढंग से उनके बीच स्विच करने के बजाय (Herdr में, कोई वास्तविक क्रम नहीं है), प्रत्येक एजेंट की एक प्राथमिकता होती है। ठीक वैसे ही जैसे कार्यों के अलग-अलग प्राथमिकता/महत्व स्तर होते हैं। जब कोई P1 एजेंट समाप्त होता है, तो वह शीर्ष पर चला जाता है। जब कोई P1 एजेंट चलना समाप्त कर चुका हो तो आपको कभी भी P4 एजेंट को जवाब नहीं देना चाहिए। (हाँ... मुझे Corral को ओपन-सोर्स करने की आवश्यकता है। अभी तक ऐसा नहीं कर पाया हूँ।)
मॉडल और सब्सक्रिप्शन
आप सबसे कम डॉलर में सबसे अधिक टोकन चाहते हैं। यह प्रत्येक एजेंटिक इंजीनियर के मुख्य लक्ष्यों में से एक होना चाहिए (काम निपटाने के बाद)।
अभी 4 मुख्य सब्सक्रिप्शन हैं, और हाँ... 2 महीने बाद यह पूरी तरह से अलग हो सकता है।
अभी सबसे अच्छा "पैसे के बदले में सबसे अच्छा मूल्य" सौदा OpenCode Go है। यह केवल $10 है, और यह आपको Kimi K3, Grok 4.6, GLM 5.3, DeepSeek V4 Pro, और कई अन्य मॉडल देता है... लेकिन इसमें Fable 5 और GPT-5.6 Sol जैसे सबसे अच्छे मॉडल नहीं हैं (साथ ही, उपयोग सीमाएँ काफी छोटी हैं)।
इसलिए, यदि आपके पास थोड़ा अधिक पैसा है, तो आपको यह करना चाहिए:
- $30 -- OpenCode Go + ChatGPT Plus ($20) लें
- $50 -- ऊपर से $20 का Claude Code सब्सक्रिप्शन जोड़ें।
- $70 -- Cursor का $20 प्रति माह जोड़ें, और आपके पास सभी सब्सक्रिप्शन का सबसे निचला स्तर है।
- $110 -- OpenCode + बड़ी योजनाओं में से एक। ChatGPT की $100 योजना आपको Claude से बेहतर सौदा देगी। यह वैसा ही है। OpenAI के पास अधिक कंप्यूट है, वे इसे और अधिक सब्सिडी देने को तैयार हैं।
- $210 -- बस दोनों $100 योजनाएँ लें।
- और यदि आप वास्तव में गंभीर हैं (मेरी तरह) तो बस सभी $200 योजनाएँ (Codex, Claude, Cursor) लें क्योंकि वे 20x उपयोग हैं, और ये योजनाएँ आपको सबसे अच्छा सौदा देती हैं।
वैसे... Cursor योजना बहुत कम आंकी गई है। Cursor, उर्फ Grok, SpaceX अधिग्रहण के कारण एक महान सब्सक्रिप्शन बनने जा रहा है। SpaceXAI के पास भारी मात्रा में कंप्यूट है, इसलिए उन्हें सब्सिडी देने का खेल खेलने की अनुमति है। और -- मुझे लगता है -- Cursor/Grok योजना आपको Cursor + Grok Bot के लिए अलग-अलग सीमाएँ देती है, जो अविश्वसनीय है।
Grok Bot तेजी से लोगों के एजेंटों के साथ बातचीत करने का नया तरीका बन रहा है, इसलिए Cursor सब्सक्रिप्शन होना पहले से कहीं अधिक महत्वपूर्ण हो गया है (प्रायोजित नहीं lol, यह बस सच है)। साथ ही, नया मॉडल -- Grok 4.7 -- आने ही वाला है।
कोई बात नहीं, API मूल्य निर्धारण का भुगतान न करें। यह सबसे खराब सौदा है। बस सब्सक्रिप्शन लें।
क्लाउड एजेंट
यह बिल्कुल स्पष्ट है कि क्लाउड एजेंट भविष्य हैं। Cursor, Amp, Devin, Codex... ये सभी कंपनियाँ क्लाउड एजेंटों पर सब कुछ दांव पर लगा रही हैं।
इस बात का प्रमाण कि क्लाउड एजेंट भविष्य हैं, नीचे दिया गया ग्राफ है।
[यहाँ छवि]
यह Cursor का क्लाउड एजेंटों से मर्ज किए गए PR का आंतरिक हिस्सा है: इस वर्ष की शुरुआत में लगभग 10-15%, अब 60% के करीब पहुँच रहा है। और वह मर्ज किए गए PR हैं, वह सामग्री जो वास्तव में उपयोग की जाती है। जल्द ही यह 70%, फिर 80% और फिर 90% हो जाएगा।
सभी एजेंटों को स्थानीय रूप से, अपनी मशीन पर चलाने में समस्या यह है कि यह स्केलेबल नहीं है। आप एक साथ सैकड़ों एजेंट नहीं चला सकते। बस कुछ एजेंटों को एक ही समय में आपका पूरा टेस्ट सूट चलाने का निर्णय लेने में समय लगता है और आपका कंप्यूटर अजीब आवाज़ें करने लगेगा (यहाँ तक कि मेरा $7,000 का मैकबुक प्रो भी संघर्ष करता है)।
क्लाउड एजेंट आपको पृथक वातावरण, स्थायी सत्र, इंटरनेट और बिजली तक स्थायी पहुँच प्रदान करते हैं। यदि आप अपना लैपटॉप बंद करते हैं, तो आप अपने सत्र खो देते हैं। कुछ मिनटों के लिए इंटरनेट खो देते हैं, और हार्नेस स्वयं को पुनर्प्राप्त नहीं कर सकते।
मौजूदा क्लाउड एजेंट समाधानों के साथ समस्या इकोसिस्टम लॉक-इन का अत्यधिक स्तर है। वातावरण और अपने सभी रहस्यों को स्थापित करने में बहुत सारे घंटे लगते हैं, और फिर आप बंद हो जाते हैं: आपके सत्र वहाँ हैं, आप उनके मूल्य निर्धारण पर हैं, और आप उन्हें अपना सारा डेटा देते हैं। भले ही वे उस पर मॉडल प्रशिक्षित न करें, आपके डेटा का उपयोग करने के और भी कई तरीके हैं।
समाधान आपका अपना सर्वर होना है। और AI के लिए धन्यवाद, इसे स्थापित करने में लगभग 10 मिनट लगते हैं (गंभीरता से)। बस एक VPS लें, उस पर Herdr चलाएँ, और उसमें SSH करें।
Herdr आपको स्थायी एजेंट सत्र देता है, और SSH आपको अपने फोन, अपने लैपटॉप, किसी भी चीज़ से कनेक्ट करने देता है। आप सचमुच लॉक-इन के बिना, कुछ डॉलर में क्लाउड एजेंटों का 80/20 प्राप्त कर सकते हैं।
अपना स्वयं का क्लाउड वातावरण बनाएँ
मैं अपने VPS के लिए Hostinger का उपयोग करता हूँ, और एक KVM2 योजना पर्याप्त है। यहाँ मुख्य बात जो मैं बताना चाहता हूँ... आपको VPS, DevOps, Linux, इनमें से किसी का विशेषज्ञ होने की आवश्यकता नहीं है।
बस अपने एजेंट से सरल अंग्रेजी में बात करें!!!
आगामी वीडियो में, मैं पूरी चीज़ लाइव सेट करता हूँ। एक cmux वर्कस्पेस, बाएँ फलक में एक कोडिंग एजेंट (Grok 4.6 चलाने वाला Cursor CLI), दाईं ओर एक खाली टर्मिनल फलक।
मेरा cmux कौशल एजेंट को उस दूसरे फलक को खोजने और उसमें कमांड चलाने देता है। मैंने स्वयं ताज़ा VPS में SSH किया, फिर एजेंट से कहा "उस सर्वर के बारे में सब कुछ जानें, और डेव वातावरण सेट करें। Herdr, Node.js, Python 3, Git"।
इसने सेकंडों में VPS का विश्लेषण किया, सब कुछ स्थापित किया, Herdr शुरू किया, फिर Pi Agent स्थापित किया, मेरे मैकबुक पर एक OpenRouter कुंजी पाई, और पूरी सेटअप स्वयं किया। कुछ छोटे प्रॉम्प्ट के बाद, मेरे पास GPT-5.6 Sol चलाने वाला Pi और Fable चलाने वाला दूसरा सत्र था, दोनों क्लाउड में, मेरे अपने VPS पर, पूर्ण रूट एक्सेस के साथ।
यदि मेरे कंप्यूटर या वाई-फाई को कुछ होता है... यदि मेरा मैकबुक फट जाता है, तो वे एजेंट चलते रहते हैं। पूर्ण वॉकथ्रू वीडियो में है। यहाँ मेरे YouTube का लिंक।
एक और गति की बात... मैं SuperWhisper के साथ डिक्टेट करता हूँ। आप में से अधिकांश जो यह पढ़ रहे हैं, शायद 40 या 50 शब्द प्रति मिनट टाइप करते हैं। वह बहुत धीमा है।
लेकिन! आप 250+ WPM पर बोल सकते हैं। एक वॉयस AI टूल (जैसे Superwhisper, Glaido, Whispr FLow) तुरंत आपको प्रॉम्प्ट भेजने में 3-4 गुना तेज़ बनाता है। एक का उपयोग करें। मूर्ख मत बनो।
हार्नेस
पहला हार्नेस जिसका मुझे उल्लेख करना है वह है Pi Agent, GOAT।
सबसे न्यूनतम हार्नेस: केवल 4 उपकरण, हमेशा YOLO मोड में चलता है, किसी भी मॉडल, किसी भी प्रदाता का समर्थन करता है। बहुत सुरुचिपूर्ण, अत्यधिक कॉन्फ़िगरेबल, और यही कारण है कि बहुत से लोग Pi के शीर्ष पर निर्माण करते हैं। यह ओपन सोर्स है, पूरी तरह से मुफ़्त है, बस pi.dev पर जाएँ और इसे प्राप्त करें। गैर-परक्राम्य। यह पहला हार्नेस है जिसे मैंने VPS पर रखा।
Cursor CLI। बहुत कम आंका गया, क्योंकि आप सभी मॉडलों का उपयोग कर सकते हैं: Grok, GPT मॉडल, Anthropic मॉडल, Kimi। आप कौशल को टैग कर सकते हैं, और आप संदेश पहले से भेज सकते हैं। कुल मिलाकर बढ़िया हार्नेस।
हार्नेस की अगली श्रेणी वह है जिसे मैं "स्व-सुधार" हार्नेस कहना पसंद करता हूँ।
दो सबसे लोकप्रिय हैं Hermes Agent और Prime Agent। यह तब के लिए है जब आप नहीं जानते कि आप क्या कर रहे हैं। यदि किसी कार्य में बहुत अधिक अनिश्चितता है, बहुत कुछ पता लगाना है, तो एक स्व-सुधार हार्नेस का उपयोग करें, क्योंकि यह कौशल बनाता है और समय के साथ आपके साथ सुधार करता है।
और अंत में, क्लासिक्स, Claude Code और Codex। मेरे पास उन्हें उपनाम के रूप में रखा है। बहुत से लोग हर दिन claude --dangerously-skip-permissions टाइप करते हैं। अत्यंत धीमा, अत्यंत अक्षम। मैं cc टाइप करता हूँ और यह अनुमतियों को दरकिनार करके Claude Code लॉन्च करता है; cx YOLO मोड में Codex लॉन्च करता है।
आपको उन लंबे कमांडों के लिए ग्लोबल उपनाम बनाने होंगे जिन्हें आप अक्सर चलाते हैं। यह एजेंटिक इंजीनियरिंग के नियमों में से एक है: आप समान समय में और अधिक कैसे प्राप्त कर सकते हैं?
कौशल
मेरा कौशल रेपो पिछले महीने वायरल हुआ था। (देखें github.com/davidondrej/skills) यह भी पूरी तरह से मुफ़्त, ओपन सोर्स, वह सब है।
एजेंटिक इंजीनियरिंग के लिए सबसे अधिक प्रासंगिक SKILLs हैं:
(1) /total-review
- यह दो अन्य कौशल चलाता है, /gpt-review और /fable-review, जो आपके द्वारा अभी किए गए कोड परिवर्तनों की GPT-5.6 Sol और Fable 5 के साथ समीक्षा करते हैं, फिर दोनों सूचियों को एक ही सूची में डीडुप करते हैं जिसमें वास्तव में मायने रखने वाले मुद्दे होते हैं। यह आपके सभी सबसे चतुर दोस्तों से आपके नौकरी के आवेदन की समीक्षा करने के लिए कहने जैसा है, और वे आपको केवल सबसे बड़ी समस्याएँ देते हैं। इसे मध्यम से बड़े परिवर्तनों पर चलाएँ, खासकर यदि कोई भिन्न मॉडल ने इसे बनाया है। यदि Grok 4.6 ने काम किया है, तो आप एक पूरी तरह से अलग मॉडल चाहते हैं जो इसकी समीक्षा करे।
महत्वपूर्ण: आप जो कुछ भी अक्सर दोहराते हैं वह एक प्रीसेट बन जाना चाहिए।
यदि यह एक एकल चरण है, तो टेक्स्ट रिप्लेसमेंट का उपयोग करें। मेरे पास वे Raycast स्निपेट के रूप में हैं। "सरल अंग्रेजी में संक्षेप में उत्तर दें।" "अपने पिछले उत्तर को सरल और छोटा बनाएँ।" "सभी फ़ाइलों को स्टेज करें, एक स्पष्ट कमिट लिखें, GitHub पर पुश करें।"
यदि यह एक बहु-चरणीय वर्कफ़्लो है, तो इसे एक कौशल में बदल दें।
(2) /ask-then-build
- मैं इस कौशल का हर दिन, किसी भी निर्माण से पहले उपयोग करता हूँ। यह कहने के बजाय "इसे Windows संगत बनाएँ" और मॉडल को चुपचाप महत्वपूर्ण आर्किटेक्चरल निर्णय लेने दें जिसका आपको बाद में पछतावा हो सकता है, यह आपको एक-एक करके मुख्य निर्णयों के माध्यम से, विकल्पों के साथ ले जाता है। AI मॉडल कोडिंग में महान हैं, कार्यान्वयन में महान हैं। उनमें स्वाद नहीं है। उनके पास अच्छा निर्णय नहीं है। आपको, मनुष्य के रूप में, उस पर नियंत्रण रखने की आवश्यकता है।
(3) /deepapi
- यह कौशल वह है जिसका उपयोग मैं किसी भी गहन शोध, किसी भी स्क्रैपिंग, किसी भी वेब के लिए करता हूँ। Codex और Claude Code बुनियादी वेब खोज के साथ आते हैं, लेकिन कोई स्क्रैपिंग नहीं, कोई गहन शोध नहीं, और वे आसानी से अवरुद्ध हो जाते हैं। 8 तेज़ वेब खोजें चलाएँ और मुझे शीर्ष 3 विकल्प दें, Twitter स्क्रैप करें, GitHub स्क्रैप करें, किसी व्यक्ति से संपर्क करने के 3 तरीके खोजें। मेरी टीम में हर कोई इसका उपयोग करता है। होना ही चाहिए।
(4) गार्डरेल और पुश लॉक
- अधिक उबाऊ, लेकिन बिल्कुल आवश्यक, और आप उन्हें केवल एक बार सेट करते हैं। ग्लोबल एजेंट गार्डरेल एक प्री-टूल-कॉल हुक है जो सुनिश्चित करता है कि आपके एजेंट कभी भी आपकी डिस्क को मिटा न दें, कभी भी Git इतिहास को ओवरराइट न करें, कभी भी आपके पासवर्ड मैनेजर को न छुएँ। और पुश लॉक, जब आप समानांतर में 15+ एजेंट चला रहे हों: पूरे जहाज पर एक OS-स्तरीय कर्नेल लॉक। मर्ज करें, सत्यापित करें, पुश करें, CI, डिप्लॉय, हेल्थ चेक।
मेरे सभी कौशल स्थापित न करें। बस वही लें जिनकी आपको आवश्यकता है।
वर्कट्री
एक वर्कट्री मूल रूप से आपके प्राथमिक चेकआउट की एक प्रतिलिपि एक अलग फ़ोल्डर में होती है और वहाँ एक नई Git शाखा बनाती है, ताकि एजेंट समानांतर में, पूरी तरह से पृथक रूप से काम कर सकें।
एक छोटी परियोजना पर, यह पूरी तरह से अतिशयोक्ति है। एक ही शाखा पर रहें और तेज़ी से काम करें।
मध्यम से बड़ी परियोजनाओं पर जहाँ आप हर समय 20-30+ एजेंट चला रहे हैं, इससे बचने का कोई तरीका नहीं है। वर्कट्री के बिना, एजेंट संघर्ष करेंगे, एक-दूसरे के परिवर्तनों को उलट देंगे, और एक-दूसरे से लड़ेंगे। BB के बारे में एक और अच्छी बात: इसमें अंतर्निहित वर्कट्री हैं। यह याद रखता है कि मेरे बड़े रेपो पर मैं हमेशा origin/main पर आधारित एक नया वर्कट्री चाहता हूँ।
अन्य एजेंटिक इंजीनियरिंग टिप्स
जानें कि प्रत्येक मॉडल का उपयोग कब करना है।
- कोई योजना डिज़ाइन कर रहे हैं या कोई नई परियोजना शुरू कर रहे हैं? Fable। इसमें प्रतिभा की सबसे अधिक चिंगारी है। किसी गहरे, गंभीर बग को ठीक कर रहे हैं? GPT-5.6 Sol, अधिकतम तर्क प्रयास। डिफ़ॉल्ट चैटिंग? Grok 4.6 उच्च पर। लगभग समान बुद्धिमत्ता, लेकिन 2x सस्ता और 2x तेज़। फ्रंट-एंड? Kimi K3।
- और जब कोई प्रमुख नया मॉडल जारी किया जाता है, तो एक दिन अलग रखें जहाँ आप केवल उस मॉडल का उपयोग करें। Twitter न सुनें। इसे स्वयं आज़माएँ।
जानें कि समीक्षा कब करनी है।
- मैं हर बदलाव पर कुल समीक्षा नहीं चला रहा हूँ। एक छोटा फ्रंट-एंड ट्वीक सीधे प्रोडक्शन में जाता है।
- और कभी भी पुनरावर्ती समीक्षा न करें। यदि आप किसी मॉडल से कहते हैं "5 सबसे बड़ी समस्याएँ खोजें", तो यह 5 समस्याएँ ढूंढ लेगा, भले ही कोडबेस पूरी तरह से ठीक हो। ये मॉडल काल्पनिक बग बनाते हैं।
पूर्व-भेजना।
- आमतौर पर मुझे पता होता है कि एजेंट आगे क्या करेगा, इसलिए मैं संदेशों को पहले से कतारबद्ध करता हूँ: "योजना को लागू करें", "इस पर Fable समीक्षा चलाएँ", "अब उन चीज़ों को ठीक करें"।
- कभी-कभी यह 2 संदेश होते हैं, कभी-कभी 6।
- कभी भी ऐसे हार्नेस का उपयोग न करें जो आपको पूर्व-भेजने की अनुमति नहीं देता।
उप-एजेंटों का अत्यधिक उपयोग किया जाता है।
- बहुत से लोग उन पर अपनी सीमाएँ जला देते हैं। मैं उनका उपयोग तब करता हूँ जब मैं नियंत्रण में होता हूँ। मैं चुनना चाहता हूँ कि उप-एजेंट में कौन सा मॉडल चलता है, क्योंकि मुझे पता है कि मेरे पास कौन सी सब्सक्रिप्शन और सीमाएँ हैं।
- भविष्य एक प्रबंधक एजेंट है जो कार्यकर्ताओं को लॉन्च करता है, लेकिन आपको अभी भी उस प्रणाली को डिज़ाइन करने की आवश्यकता है: नियम, अनुमतियाँ, वे शर्तें जब कोई उप-एजेंट लॉन्च किया जाता है। मैं नहीं चाहता कि Anthropic या OpenAI का कोई व्यक्ति मेरे लिए वह निर्णय ले।
ADR.
- इस तरह आप निर्णयों को कोडबेस में डालते हैं। /docs/adr उन पहले फ़ोल्डरों में से एक है जो मैं किसी भी परियोजना में बनाता हूँ।
- प्रत्येक मुख्य आर्किटेक्चरल निर्णय को एक छोटी फ़ाइल मिलती है: क्या तय किया गया था, क्यों, और उस समय परियोजना की स्थिति क्या थी। कुछ चीज़ें कोड से पढ़ी जा सकती हैं, लेकिन सब कुछ नहीं।
- जो चीज़ें नहीं पढ़ी जा सकतीं, उन्हें प्रलेखित किया जाना चाहिए, ताकि भविष्य के एजेंट और मनुष्य तुरंत समझ सकें कि इसे इस तरह क्यों बनाया गया है।
परीक्षण।
- वर्तमान मॉडल आपके रेपो को परीक्षणों से भर देते हैं: यूनिट परीक्षण, एकीकरण परीक्षण, डेटाबेस परीक्षण, यहाँ तक कि सबसे छोटे रेपो पर भी जहाँ इसका कोई मतलब नहीं है।
- यदि आप मॉडल से परीक्षण जोड़ने के लिए कहते हैं, तो यह एक पागलपन भरी मात्रा जोड़ता है। यदि आप इसे "परीक्षण न जोड़ें" कहते हैं, तो यह अभी भी कुछ जोड़ता है, और आप सही मात्रा पर पहुँचते हैं।
प्रोडक्शन DB एक्सेस।
- वास्तविक उपयोग वाले किसी भी उत्पाद को यह करने की आवश्यकता है... एक केवल-पढ़ने के लिए Postgres भूमिका बनाएँ और अपने एजेंटों को वह दें।
- उन्हें लिखने की पहुँच न दें। बस एक अपरिवर्तनीय परिवर्तन लगता है और आपको इसका पछतावा होगा।
- लेकिन कोई पहुँच न होना भी एक गलती है। केवल-पढ़ने की पहुँच के साथ, आप प्रत्येक सुविधा की वास्तविकता की जाँच कर सकते हैं। क्या यह प्रोडक्शन में भी होता है? क्या लोग इसका उपयोग भी कर रहे हैं? काश मैंने यह पहले किया होता।
अपनी एजेंटिक उत्पादकता को ट्रैक करें।
- हमने अभी Vectal Labs के तहत एक नया ओपन-सोर्स रेपो जारी किया है जिसे agentic-productivity कहा जाता है। यह आपके कमिट, आपके एजेंट सत्र और आपके उपयोगकर्ता प्रॉम्प्ट को ट्रैक करता है।
- अपने आप में प्रत्येक एक खराब मीट्रिक है, लेकिन 3 को मिलाएँ और दीर्घकालिक प्रवृत्ति को देखें, और आप देख सकते हैं कि क्या आप वास्तव में एक बेहतर एजेंटिक इंजीनियर बन रहे हैं।
यह वर्तमान में सेटअप है। एक महीने में, यह शायद अलग होगा। यह हर समय बदलता है।
डेविड ओन्ड्रेज द्वारा (YouTube के लिए बोला गया, फिर लेख प्रारूप के लिए पुनः लिखा गया)





