इवैल इंजीनियरिंग को स्वचालित करने की दिशा में

@Vtrivedy10
अंग्रेज़ी1 दिन पहले · 22 जुल॰ 2026
222K
631
62
15
1.7K

TL;DR

LangChain Labs ने एक इवैल इंजीनियरिंग स्किल जारी किया है जो रिपॉजिटरी और ट्रेस का विश्लेषण करके Harbor-फॉर्मेट टास्क तैयार करता है, जिससे AI एजेंट मूल्यांकन की प्रक्रिया स्वचालित हो जाती है।

आज हम अपनी Eval Engineering Skill जारी कर रहे हैं, यह एक ऐसी स्किल है जो कोडिंग एजेंटों को रिपॉजिटरी और एजेंट ट्रेसेस के संदर्भ का उपयोग करके इवैल्स बनाने में मदद करती है।

यह स्किल जांचती है कि एजेंट कैसे संरचित है, यदि उपलब्ध हों तो ट्रेसेस से पैटर्न निकालती है, और परीक्षण योग्य क्षमताओं का प्रस्ताव करती है।

यह स्किल उपयोगकर्ता का साक्षात्कार लेने के लिए डिज़ाइन की गई है जो प्रस्तावों पर फीडबैक दे सकता है और प्रत्येक इवैल को बारी-बारी से अनुमोदित कर सकता है। अंतिम उत्पाद Harbor फॉर्मेट में निष्पादन योग्य इवैल्स का एक सेट होता है।

वातावरण और कार्य का निर्माण

स्किल पहले रिपॉजिटरी को पढ़ती है और एजेंट की सतह को मैप करती है जिसमें प्रॉम्प्ट, मॉडल, टूल्स, स्किल्स, हुक्स आदि शामिल हैं। यह उन डेटा और सेवाओं की भी पहचान करती है जो उन व्यवहारों को समर्थन देते हैं, जैसे कि API कॉल्स।

उपयोगकर्ता एजेंट को ट्रेसेस की ओर भी इंगित कर सकते हैं जिन्हें langsmith-cli जैसे टूल का उपयोग करके पुनर्प्राप्त किया जा सकता है। ट्रेसेस दिखाते हैं कि टूल्स व्यवहार में कैसे काम करते हैं, जैसे उनके आर्गुमेंट्स, परिणाम और त्रुटियाँ। ये देखे गए कॉन्ट्रैक्ट स्किल को नियंत्रित वातावरण में प्रासंगिक प्रोडक्शन व्यवहार को पुन: उत्पन्न करने में मदद करते हैं।

रिपोजिटरी और ट्रेसेस को क्रॉल करने से एजेंट को यह ज्ञान मिलता है कि इवैल कार्य प्रस्तावित करते समय एजेंट के लिए कौन सी क्षमताएँ महत्वपूर्ण हैं। हमने पाया कि उपयोगकर्ता का साक्षात्कार लेना एक बार में जेनरेट करने की तुलना में कहीं बेहतर इवैल स्वीकृति देता है। उपयोगकर्ता प्रस्तावित इवैल दिशाओं में से चुनता है, और इस प्रकार के प्रश्नों पर मार्गदर्शन देता है कि कौन से टूल्स और निर्भरताएँ लाइव चलनी चाहिए या सिम्युलेटेड होने की आवश्यकता है। उदाहरण के लिए, जो टूल कॉल्स लागत लगाती हैं या प्रोडक्शन में लिखने की आवश्यकता होती है, उन्हें हर इवैल इनवोकेशन पर चलाने के बजाय सिम्युलेट किया जा सकता है।

हमने इस प्रवाह का परीक्षण अपने दस्तावेज़ीकरण Q&A एजेंट, chat-langchain पर किया। इस एजेंट के लिए, वातावरण में एक डेटा कॉर्पस की आवश्यकता थी जो प्रोडक्शन एजेंट पर मॉडल किए गए एजेंट सर्च टूल्स के माध्यम से उजागर हुआ। कार्यों में वास्तविक ट्रेसेस से लिए गए यथार्थवादी दस्तावेज़ीकरण प्रश्न और एक वेरिफायर शामिल था जिसने गोल्डन आंसर स्ट्रिंग और उद्धृत दस्तावेज़ों का उपयोग करके उत्तर की जाँच की।

Viv - inline image

इवैल डिज़ाइन पुनरावृत्तीय है

हमने पाया कि हालांकि एजेंट कभी-कभी एक बार में इवैल्स जनरेट करने में सक्षम होते हैं, सबसे अच्छे इवैल्स उपयोगकर्ताओं द्वारा फीडबैक प्रदान करने और यह निर्दिष्ट करने से आए कि एजेंटों में किन क्षमताओं को मापना योग्य है। कोडिंग एजेंट और स्किल्स एक प्राकृतिक इंटरफ़ेस प्रदान करते हैं जहाँ एक अच्छा इवैल बनाने का डोमेन ज्ञान एन्कोडेड होता है और उपयोगकर्ता समय के साथ उन पर पुनरावृत्ति कर सकते हैं।

उदाहरण के लिए, हमने पाया कि वेरिफायर बनाते समय, पहला वेरिफायर शायद ही कभी अंतिम होता था। इसे सुधारने का एक उपयोगी तरीका इवैल को चलाना और परिणाम के दोनों पक्षों का निरीक्षण करना था:

  • एजेंट का ट्रेजेक्ट्री, जिसमें उसके संदेश, टूल कॉल्स और कार्रवाइयाँ शामिल हैं।
  • वेरिफायर का ट्रेजेक्ट्री, साक्ष्य, तर्क और अंतिम स्कोर।

इससे यह पता चलने में मदद मिली कि क्या कार्य या वेरिफायर डिज़ाइन वह माप रहा था जिसकी हमें परवाह थी या क्या इसे रिवॉर्ड हैक किया जा सकता था जहाँ एजेंट शॉर्टकट ले सकते थे। इन शॉर्टकट्स में पूर्ण क्रेडिट प्राप्त करने के लिए अप्रासंगिक स्रोतों का अत्यधिक उद्धरण देना, एक ऐसी कार्रवाई का दावा करना जो उसने कभी नहीं की, उजागर उत्तर सामग्री का शोषण करना, या कार्य पूरा किए बिना किसी प्रॉक्सी को संतुष्ट करना शामिल हो सकता है। एजेंट समस्याओं को कैसे हल करते हैं, इसके लिए ट्रेसेस का अवलोकन करने से अक्सर इन विफलताओं का स्रोत पता चलता है। फिर कार्य, वातावरण और वेरिफायर को संशोधित किया जा सकता है और फिर से चलाया जा सकता है।

इवैल्स Harbor फॉर्मेट में हैं

यह स्किल इवैल्स को Harbor कार्यों के रूप में बनाती है:

  1. एक निर्देश: एजेंट को शुरुआत में दिया गया संदेश जो कार्य का वर्णन करता है
  2. एक वातावरण: एक Dockerfile के रूप में दिया गया जिसमें कार्य के लिए सेटअप होता है जैसे कि कौन से टूल्स इंस्टॉल करने हैं या फाइलसिस्टम में कौन सा डेटा रखना है
  3. एक वेरिफायर जो स्कोर करता है कि एजेंट ने कार्य सही ढंग से पूरा किया या नहीं।

यह स्किल इन घटकों को एक Harbor कार्य के रूप में एक साथ बनाती है:

markdown
1evals/<task-id>/
2├── task.toml
3├── instruction.md
4├── environment/
5└── tests/

Harbor एजेंट को वातावरण में चलाता है और उसके ट्रेजेक्ट्री, आर्टिफैक्ट्स, रिवॉर्ड और त्रुटियों को रिकॉर्ड करता है। वही इवैल फिर विभिन्न मॉडलों, प्रॉम्प्ट, टूल्स और एजेंट वर्जनों के विरुद्ध चल सकता है।

यह क्यों मायने रखता है

निरंतर सीखने को एक सतत डेटा माइनिंग समस्या के रूप में सोचा जा सकता है जहाँ प्रोडक्शन डेटा का उपयोग ऐसे इवैल्स बनाने के लिए किया जाता है जो समय के साथ एजेंटों में सुधार करते हैं। टीमें बार-बार उपयोगकर्ता अनुरोधों, त्रुटियों, विफल टूल कॉल्स और गलत स्थिति परिवर्तनों को खोजने के लिए ट्रेसेस की माइनिंग करती हैं। ये इवैल्स बन जाते हैं ताकि भविष्य में उसी व्यवहार को मापा और रोका जा सके।

इवैल्स एजेंटों के लिए प्रशिक्षण डेटा हैं। टीमें प्रॉम्प्ट और टूल्स बदलने या फाइन-ट्यूनिंग जैसे हार्नेस इंजीनियरिंग के माध्यम से एजेंट व्यवहार को उनमें फिट कर सकती हैं। इवैल यह तय करने के लिए एक निश्चित लक्ष्य प्रदान करता है कि क्या उन परिवर्तनों ने इच्छित क्षमता में सुधार किया है।

कंटेनरीकृत इवैल्स इस प्रक्रिया को तेज बनाते हैं। कार्य और वातावरण स्थिर रहते हैं जबकि एजेंट कॉन्फ़िगरेशन बदलता है, इसलिए बिल्डर मॉडल, टूल्स, प्रॉम्प्ट या पूर्ण एजेंट वर्जनों को बदल सकते हैं और सीधे परिणामों की तुलना कर सकते हैं। कई कॉन्फ़िगरेशन समानांतर में चल सकते हैं।

प्रतिलिपि योग्य वातावरण उस सिग्नल के लिए महत्वपूर्ण हैं। जब एक इवैल प्रोडक्शन से प्रासंगिक टूल्स, डेटा, अनुमतियाँ, स्थिति और विफलता मोड को दर्शाता है, तो बिल्डरों को एक स्थिर परीक्षण मंच मिलता है जो अभी भी इस बात का प्रतिनिधि है कि एजेंट कैसे संचालित होता है। वे बदलते प्रोडक्शन सिस्टम पर निर्भर हुए या प्रोडक्शन स्थिति में लिखे बिना तेज़ी से प्रयोग कर सकते हैं।

परिणामी लूप यह है:

ट्रेसेस माइन करें -> एक विफलता पहचानें -> एक इवैल बनाएं -> एजेंट में सुधार करें -> पुनः चलाएँ

आज ही आज़माएँ

Eval Engineering Skill langchain-ai/langchain-skills रिपॉजिटरी में उपलब्ध है।

इस स्किल को Codex या Claude Code में इंस्टॉल करें, उस रिपॉजिटरी को खोलें जिसमें वह एजेंट है जिसका आप मूल्यांकन करना चाहते हैं, यदि उपलब्ध हो तो एजेंट को ट्रेसेस के एक सेट पर इंगित करें, और एक सरल प्रॉम्प्ट से शुरू करें:

हम इस स्किल का विस्तार करने और ऐसे टूलिंग बनाने के लिए तत्पर हैं जो स्वचालित रूप से इवैल्स बनाने और एजेंटों को स्वायत्त रूप से उनमें फिट करने को आसान बनाए।

एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें