Adversarial Panel: मल्टी-मॉडल एडवर्सरियल रिव्यू के माध्यम से क्वालिटी एश्योरेंस

@wayama_ryousuke
जापानी09 जुल॰ 2026
128K
190
16
0
399

TL;DR

यह लेख Claude Code के लिए adversarial-panel स्किल का विवरण देता है, जो एक GAN-प्रेरित प्रोटोकॉल है। यह LLM द्वारा जनरेट की गई सामग्री की विश्वसनीयता सुनिश्चित करने के लिए स्वतंत्र मल्टी-मॉडल डिबेट और क्रॉस-क्रिटिक का उपयोग करता है।

एकल-शॉट जनरेशन परिणामों पर भरोसा करना बंद करें; केवल तभी निष्कर्ष पर पहुँचें जब कई मॉडलों को आपस में भिड़ने दिया जाए। Claude Code कौशल की एक डिज़ाइन व्याख्या जो GANs की प्रतिकूल संरचना को अनुमान चरण में स्थानांतरित करती है।

  • लेखक: Ryousuke Wayama (@wayama_ryousuke
  • तिथि: 2026-07-09
  • पृष्ठभूमि: GANs से प्रेरित अवधारणा (2023 भविष्यवाणी ट्वीट) / Claude Fable 5 के साथ डिज़ाइन पर विचार-विमर्श
  • भंडार: https://github.com/makinux/adversarial-panel

पृष्ठभूमि: एकल-शॉट उत्तर पर्याप्त क्यों नहीं हैं

LLM उत्तर तब सबसे खतरनाक नहीं होते जब वे गलत होते हैं, बल्कि तब होते हैं जब वे गलत होते हुए भी आत्मविश्वासी होते हैं। एक एकल मॉडल का एक एकल पास, संरचनात्मक रूप से, इसे पकड़ने के लिए एक तंत्र की कमी रखता है। स्व-आलोचना के साथ भी, उत्पादन और आलोचना के दौरान अंधे धब्बे सहसंबंधित होते हैं क्योंकि वे समान भारों से उत्पन्न होते हैं; इसके अलावा, यह सिद्ध हो चुका है कि मॉडलों में स्व-पसंद पूर्वाग्रह होता है, जो अपने स्वयं के आउटपुट को उच्च दर्जा देते हैं। संक्षेप में, "स्वयं लिखना और समीक्षा करना" किसी भी ऑडिट के लिए शुरू से ही हितों का टकराव है।

इस कौशल की प्रेरणा GANs से आती है। GAN का सार केवल प्रतिस्पर्धी जनरेटर और डिस्क्रिमिनेटर की संरचना नहीं है, बल्कि अंतर्निहित सिद्धांत है: वह विषमता जहां पता लगाना, बनाने से आसान है। जनरेटर द्वारा अपनी शुद्धता की गारंटी देने के बजाय, स्वतंत्र प्रतिकूल एजेंटों को हमला करने देने और केवल उसी को पास करने से जो बच जाता है, समान कम्प्यूटेशनल लागत पर उच्च गुणवत्ता आश्वासन प्राप्त होता है। जहां GANs इस लूप को ग्रेडिएंट के माध्यम से चलाते थे, वहीं adversarial-panel इसे प्राकृतिक भाषा आलोचना के माध्यम से चलाता है। केवल सिग्नल का माध्यम बदला है; खेल की संरचना वही रहती है।

हालांकि, केवल कई मॉडलों को पंक्तिबद्ध करने का कोई मूल्य नहीं है। जो काम करता है वह निम्नलिखित दो डिज़ाइन विशेषताएं हैं, जिन्हें कौशल जानबूझकर बनाने के लिए डिज़ाइन किया गया है:

  • त्रुटियों का असंबंधन — एक समीक्षक किसी जनरेटर की निगरानी को तभी पकड़ सकता है जब उनके विफलता मोड भिन्न हों। चूंकि एक ही मॉडल के पैनल अंधे धब्बे साझा करते हैं, "सर्वसम्मत सहमति" उतनी सबूत नहीं है जितनी दिखती है। मॉडल परिवारों को पार करना मूल है।
  • सत्यापन लाभ — किसी दिए गए उत्तर का खंडन करना, उत्तर बनाने से आसान है। इसलिए, आलोचकों को सत्यापन योग्य दावों को लक्षित करने का निर्देश दिया जाता है। "मुझे लगता है कि यह संदिग्ध है" नहीं, बल्कि "यह इनपुट X पर विफल रहता है" — केवल दावा करके नहीं, बल्कि पुनरुत्पादन के माध्यम से खंडन करना

आर्किटेक्चर: सुविधाकर्ता और पैनलिस्ट

केवल दो प्रकार के घटक हैं। मुख्य सत्र (Claude Code स्वयं) सुविधाकर्ता के रूप में कार्य करता है, जो प्रगति, सत्यापन और एकीकरण को संभालता है, जबकि 2 से 4 पैनलिस्ट प्रतिक्रियाओं और पारस्परिक आलोचना को संभालते हैं। सुविधाकर्ता को पैनल के मुंह से अपनी राय नहीं बोलनी चाहिए (सुविधाकर्ता कब्जे का निषेध); यदि कोई राय जोड़ना है, तो उसे "सुविधाकर्ता का दृष्टिकोण" के रूप में लेबल किया जाना चाहिए।

Ryousuke_Wayama - inline image

चित्र 1 — adversarial-panel का विन्यास। सुविधाकर्ता एक स्व-निहित ब्रीफ वितरित करता है (ठोस रेखा), और पैनलिस्ट एक-दूसरे के उत्तरों पर हमला करते हैं (क्रॉस-आलोचना) इससे पहले कि वे उत्तर और आलोचनाएं सुविधाकर्ता को लौटाएं (धराशायी रेखा)। यह लूप प्रत्येक दौर के लिए चलता है।

पैनलिस्टों को विषमता को अधिकतम करने की प्राथमिकता के साथ स्रोतित किया जाता है:

  1. विभिन्न मॉडल परिवार — Bash के माध्यम से Codex जैसी बाहरी CLI। यह त्रुटियों का सबसे मजबूत असंबंधन प्रदान करता है।
  2. विभिन्न Claude मॉडल — एजेंट टूल के मॉडल पैरामीटर (Opus/Sonnet/Haiku) के माध्यम से।
  3. समान मॉडल + बलपूर्वक पद्धतिगत शाखाएं — एक पहले सिद्धांतों से तर्क करता है, एक आधार दरों (बाहरी दृष्टिकोण) से, एक केवल प्रति-साक्ष्य की खोज करता है, और एक सत्यापन योग्य दावों को फिर से निष्पादित करता है। केवल व्यक्तित्व से नहीं, बल्कि विधि द्वारा अंतर करें।

डिफ़ॉल्ट 2 पैनलिस्ट × 3 राउंड है। चूंकि लागत पैनलिस्टों और राउंड की संख्या के साथ बढ़ती है, 3-4 पैनलिस्टों तक विस्तार केवल तभी होता है जब उपयोगकर्ता पूर्णता की मांग करता है।

प्रोटोकॉल: 4 राउंड + संश्लेषण

Ryousuke_Wayama - inline image

चित्र 2 — प्रोटोकॉल प्रगति। सफेद सुविधाकर्ता के कार्यों का प्रतिनिधित्व करता है, बैंगनी पैनलिस्टों के कार्यों का प्रतिनिधित्व करता है। राउंड 1 के बाद यह जांचने के लिए एक सत्यापन द्वार डाला जाता है कि क्या "उत्तरों में सार है।" सस्ती क्वेरी के लिए, राउंड 2 और 3 को एक में मर्ज किया जा सकता है।

राउंड 0 — फ्रेमिंग और आवश्यकता निर्णय

पहले, निर्धारित करें कि क्या कोई पैनल खोला जाना चाहिए। कम दांव वाली क्वेरी या ऐसे मामलों के लिए जहां आत्मविश्वास उचित है, सीधे उत्तर दें और पैनल को केवल एक विकल्प के रूप में प्रस्तुत करें। एक पूर्ण पैनल केवल महत्वपूर्ण, विवादास्पद, या सत्यापन योग्य क्वेरी के लिए ट्रिगर होता है—क्योंकि वहां आलोचना लागत के लायक है।

"ट्रायेज ट्रैप" के खिलाफ बचाव यहां बनाया गया है। चूंकि जिस मॉडल को अंधे स्थान को पकड़ना चाहिए वह इस द्वार को संचालित कर रहा है, यह किसी कार्य में जितना अधिक आत्मविश्वास से विफल होता है, द्वार के खुलने की संभावना उतनी ही कम होती है। इसलिए, यदि कोई उपयोगकर्ता स्पष्ट रूप से पैनल का अनुरोध करता है, तो यह आत्मविश्वास की परवाह किए बिना निष्पादित होता है, और महत्वपूर्ण क्वेरी के लिए, निर्णय स्व-आत्मविश्वास के बजाय दांव के आकार पर आधारित होता है।

इसके बाद, एक स्व-निहित ब्रीफ लिखें। चूंकि उप-एजेंट बातचीत के संदर्भ को बिल्कुल नहीं देख सकते हैं, ब्रीफ में क्वेरी, संदर्भ, बाधाएं और आउटपुट प्रारूप शामिल होना चाहिए, साथ ही "तथ्यों को अटकलों से अलग करें और प्रमुख दावों में आत्मविश्वास स्तर और मिथ्याकरण की स्थितियां (कौन से अवलोकन इसे उलट देंगे) संलग्न करें" के निर्देश शामिल होने चाहिए। मिथ्याकरण की स्थितियां विशिष्ट और निरीक्षण योग्य होनी चाहिए, जैसे "इनपुट X पर विफल रहता है" या "स्रोत Y का खंडन करता है"; "यदि विपरीत साक्ष्य प्रकट होता है" जैसे सामान्य वाक्यांशों को लापता डेटा (अंशांकन थिएटर) माना जाता है।

राउंड 1 — स्वतंत्र उत्तर (समानांतर/अंधा)

सभी पैनलिस्टों को समानांतर में लॉन्च करें। यह एक पूर्ण आवश्यकता है कि कोई भी दूसरों के उत्तर न देखे; एक पैनलिस्ट जो दूसरे का उत्तर देखता है वह उस पर एंकर हो जाएगा, जिससे स्वतंत्रता की धारणा टूट जाती है।

वापसी पर, सत्यापन द्वार: स्थिति रेखाएं या त्रुटि डंप उत्तर नहीं हैं। उन्हें मिनटों में शामिल करने से बाद के राउंड भूतों की आलोचना करेंगे (बाद में वर्णित भूत पैनलिस्ट समस्या)। विफल पैनलिस्टों को पुनः प्रयास किया जाता है; यदि वे दो बार विफल होते हैं, तो विषमता स्तर को जारी रखने के लिए एक कदम नीचे किया जाता है, और वास्तविक पैनल विन्यास उपयोगकर्ता को प्रकट किया जाता है।

राउंड 2 — क्रॉस-आलोचना (समानांतर)

प्रत्येक पैनलिस्ट को अन्य पैनलिस्टों के उत्तर दिए जाते हैं। उन्हें उद्धरणों के साथ विशिष्ट दावों पर हमला करना चाहिए—तथ्यात्मक त्रुटियां, कमजोर साक्ष्य, तार्किक छलांग, अनदेखे विकल्प, या निहित धारणाएं। सत्यापन योग्य दावों का पुनरुत्पादन (कोड चलाना, मूल्यों की पुनर्गणना करना, स्रोतों की जांच करना) के माध्यम से खंडन किया जाता है। सहमति, सारांश, या प्रशंसा की मुद्रास्फीति निषिद्ध है। स्वीकारोक्ति और हमले दोनों के लिए कारणों की आवश्यकता होती है।

राउंड 3 — अंतिम दृष्टिकोण (समानांतर)

प्रत्येक पैनलिस्ट को उनके खिलाफ आलोचनाएं दी जाती हैं। उन्हें वैध हमलों को स्वीकार करना चाहिए (कारणों के साथ, सामाजिक शिष्टाचार से नहीं), बचे हुए दावों का कारणों के साथ बचाव करना चाहिए, और शेष अनिश्चितताओं के साथ-साथ अंशांकित आत्मविश्वास और मिथ्याकरण की स्थितियों को बताना चाहिए। बिना कारण के पूर्ण रूपांतरण चापलूसी का संकेत है, इसलिए स्वीकार करने से पहले रूपांतरण के आधार पर सवाल उठाया जाता है।

संश्लेषण — सुविधाकर्ता द्वारा एकीकरण

अंतिम आउटपुट में तीन भाग होते हैं: सहमति के बिंदु / संघर्ष के बिंदु / निष्कर्ष

  • सहमति के बिंदु — सबसे मजबूत एकल समर्थन तर्क के साथ, यह निर्दिष्ट करते हुए कि क्या अभिसरण मजबूत सबूत है (विषम पैनल) या कमजोर सबूत (समरूप पैनल, संभावित साझा अंधे धब्बे)।
  • संघर्ष के बिंदु — "कौन, क्या, किस साक्ष्य के साथ" + सुविधाकर्ता के निर्णय के रूप में लिखा गया, साक्ष्य शक्ति द्वारा भारित। यदि एक पक्ष के पास पुनरुत्पादक साक्ष्य है और दूसरे के पास अंतर्ज्ञान है, तो निर्णय दिया जाता है। दोनों पक्षों को समान रूप से प्रस्तुत करना तटस्थता नहीं है, बल्कि झूठा संतुलन है।
  • निष्कर्ष — आत्मविश्वास स्तर, ऐसी स्थितियां जो निष्कर्ष को बदल सकती हैं, अल्पमत की राय जो संरक्षित करने लायक हैं, और स्वीकृत/अस्वीकृत आलोचनाओं का एक ऑडिट ट्रेल शामिल है।

पूरे समय बनाए रखने के लिए तीन अपरिवर्तनीयताएं

अपरिवर्तनीयता

सामग्री

स्वतंत्रता

राउंड 1 के उत्तर अंधे उत्पन्न होने चाहिए। जो पैनलिस्ट दूसरों के उत्तर देखते हैं वे एंकर हो जाते हैं और अब स्वतंत्र नमूने नहीं रहते।

प्रतिकूलता

नए तर्कों के बिना सहमति एक दौर की विफलता है। निर्देश को बलपूर्वक लागू करें: "कम से कम एक केंद्रीय दावे का विरोध करें; इसे खोजें।"

कोई औसत नहीं

संश्लेषण औसत निकालना नहीं है। संघर्षों को संरक्षित और निर्णीत किया जाता है। जैसे ही आप जोड़ते और दो से विभाजित करते हैं, पैनल द्वारा उत्पन्न सिग्नल गायब हो जाता है।

GANs के साथ पत्राचार

"प्रतिकूल जनरेशन को अनुमान में स्थानांतरित करने" के डिज़ाइन इरादे को निम्नानुसार मैप किया जा सकता है। यह महत्वपूर्ण है कि पैनल पक्ष पर विफलता मोड ज्ञात GAN विफलता मोड से बड़े करीने से मेल खाते हैं।

GAN (प्रशिक्षण)

adversarial-panel (अनुमान)

जनरेटर

पैनलिस्टों के स्वतंत्र उत्तर (राउंड 1)

डिस्क्रिमिनेटर

क्रॉस-आलोचना का हमला करने वाला पक्ष (राउंड 2)

ग्रेडिएंट अपडेट

प्राकृतिक भाषा आलोचना और तर्कसंगत स्वीकारोक्ति/बचाव (राउंड 3)

मिनिमैक्स संतुलन

निर्णय के साथ सुविधाकर्ता का संश्लेषण (संश्लेषण)

डिस्क्रिमिनेटर लाभ

सत्यापन विषमता—पता लगाना बनाने से आसान है

कोई भार साझाकरण नहीं

मॉडल परिवारों का पृथक्करण—त्रुटियों का असंबंधन

मोड पतन

चापलूसी अभिसरण (पारस्परिक सहमति)



विफलता मोड और प्रति-उपाय — सभी उत्पादन में देखे गए

कौशल प्रतिरूपों का यह संग्रह सैद्धांतिक चिंताओं की सूची नहीं है, बल्कि सामने आए वास्तविक खतरों की एक सूची है।

  • भूत पैनलिस्ट स्थिति स्ट्रिंग या त्रुटि डंप उत्तर के रूप में मिनटों में मिल जाते हैं, जिससे सभी बाद के राउंड खाली हवा के खिलाफ बहस करते हैं। → प्रति-उपाय: राउंड 1 के तुरंत बाद सत्यापन द्वार। बाहरी CLI के लिए अग्रभूमि निष्पादन को बलपूर्वक लागू करें और उन रैपरों को प्रतिबंधित करें जो पूरा होने से पहले वापस आते हैं।
  • चापलूसी अभिसरण हर कोई राउंड 2 में बिना नए तर्कों के सहमत होता है। GANs में मोड पतन के बराबर। → प्रति-उपाय: आलोचना प्रॉम्प्ट में "आप कम से कम एक केंद्रीय दावे का विरोध कर रहे हैं। इसे खोजें" जोड़ें।
  • सुविधाकर्ता कब्जा सुविधाकर्ता पैनल को अपनी पूर्व राय बोलने देता है, उन्हें सर्वसम्मति के अधिकार के माध्यम से धोता है। → प्रति-उपाय: सुविधाकर्ता के दृष्टिकोण को लेबल के साथ अलग किया जाना चाहिए।
  • आत्मविश्वास थिएटर मिथ्याकरण की स्थितियों के बिना संख्यात्मक आत्मविश्वास। "80% आत्मविश्वास" तब तक अर्थहीन है जब तक आप यह नहीं कह सकते कि कौन सा अवलोकन आपको इसे वापस लेने पर मजबूर करेगा। → प्रति-उपाय: मिथ्याकरण की स्थितियों के बिना आत्मविश्वास को लापता मानें।
  • विविधता भ्रम एक ही मॉडल के विभिन्न व्यक्तित्वों को स्वतंत्र समीक्षकों के रूप में मानना। भूमिका का नाम "रेड टीम" त्रुटियों को असंबंधित नहीं करता है—केवल विभिन्न मॉडल, विभिन्न पद्धतियां, या दावों का वास्तविक पुनरुत्पादन असंबंधन पैदा करता है। → प्रति-उपाय: समरूप पैनलों में अभिसरण को स्पष्ट रूप से कमजोर साक्ष्य के रूप में डाउनग्रेड करें।

उपयोग के मामले और इसे कैसे कॉल करें

कौशल स्वयं makinux/adversarial-panel पर प्रकाशित है। इसे Claude Code में ~/.claude/skills/adversarial-panel/SKILL.md के रूप में रखकर, यह स्पष्ट कॉल या प्राकृतिक भाषा के माध्यम से ट्रिगर होता है जैसे:

"Opus और Codex को इस डिज़ाइन की प्रतिकूल समीक्षा करने दें।" "सच में? उन्हें बहस करने दें ताकि सुनिश्चित हो सके।" / "red-team this" / "मुझे दूसरी राय चाहिए।" यह सक्रिय रूप से ट्रिगरिंग के लिए एक उम्मीदवार भी बन जाता है जब आप महत्वपूर्ण बिंदुओं पर "क्या आपको यकीन है?" के साथ निश्चितता के लिए दबाव डालते हैं।

यह महत्वपूर्ण क्वेरी के लिए उपयुक्त है जो या तो विवादास्पद या सत्यापन योग्य हैं। आर्किटेक्चर चयन, विफलताओं के लिए मूल कारण परिकल्पनाएं, तकनीकी पूर्वानुमान, या शोध निष्कर्षों को सत्यापित करना। इसके विपरीत, कम दांव वाली क्वेरी के लिए इसे खोलना लागत की बर्बादी है, जिसे राउंड 0 ट्रायेज फ़िल्टर करता है। लागत पैनलिस्टों की संख्या × राउंड के समानुपाती होती है; 2×3 दैनिक उपयोग के लिए मानक है, महत्वपूर्ण क्षणों के लिए 3-4 तक विस्तार होता है।

खराब वातावरण के लिए गिरावट भी परिभाषित है:

  • कोई उप-एजेंट तंत्र नहीं → अनुक्रमिक निष्पादन में अलग-अलग अनुभागों के साथ स्थानापन्न (कमजोर, क्योंकि भार और संदर्भ साझा किए जाते हैं—संश्लेषण में नोट किया गया)।
  • केवल एक एकल परिवार उपलब्ध → पद्धतिगत शाखाओं (तीसरा स्तर) पर ड्रॉप करें और अभिसरण की साक्ष्य शक्ति को डाउनग्रेड करें।
  • बाहरी CLI दो बार विफल होती है → उस पैनलिस्ट को हटाएं, जारी रखें, और प्रकट करें।

रिपोर्ट करें कि इरादे के आधार पर नहीं, बल्कि माप के आधार पर वास्तव में कौन सा स्तर चला—यह ऑडिटेबिलिटी की कुंजी है।

निष्कर्ष: अनुमान से प्रशिक्षण तक

जब मैंने 2023 में भविष्यवाणी की थी कि "LLM के लिए प्रतिकूल जनरेशन अगला कदम है," तो मेरे मन में GAN-जैसी प्रशिक्षण योजना थी।

https://x.com/wayama_ryousuke/status/1658698942161510400

तीन साल बाद उत्तर की जांच करने पर, प्रतिकूल संरचनाएं प्रशिक्षण (ग्रेडिएंट) के बजाय पहले अनुमान (प्राकृतिक भाषा आलोचना) में व्यावहारिक हुईं। CriticGPT जैसे आलोचना-विशिष्ट मॉडल, बहु-एजेंट बहस अनुसंधान, और कोडिंग में क्रॉस-समीक्षा संचालन—उद्योग विभिन्न प्रवेश द्वारों से एक ही संरचना पर अभिसरित हो रहा है।

अगला चरण संभवतः पुनर्एकीकरण है। जबकि अनुमान-समय की समीक्षा के परिणाम वर्तमान में डिस्पोजेबल हैं, आलोचनाओं को RL पुरस्कार संकेतों (RLAIF मार्ग) में परिवर्तित करने से प्रतिकूल परिणामों को भारों में जमा होने की अनुमति मिलती है—GANs ने मूल रूप से जो किया उस पर वापस लौटना। यदि हम "प्रतिकूल समीक्षाओं के परिणामों के साथ अगले मॉडल को प्रशिक्षित करने" के बिंदु पर पहुंचते हैं, तो यह कौशल एक संक्रमणकालीन अवधि का एक प्रोटोटाइप रहा होगा। तब तक, एकल-पास उत्तर पर दांव लगाने से पहले मॉडलों को एक-दूसरे के खिलाफ भिड़ना काफी सार्थक है।

यह लेख Claude Code कौशल adversarial-panel (SKILL.md) के लिए एक डिज़ाइन व्याख्या है। अवधारणा: [@wayama_ryousuke](https://x.com/@wayama_ryousuke) (GANs से प्रेरित, Claude Fable 5 के साथ डिज़ाइन पर विचार-विमर्श)। आरेख Executor/Advisor एजेंट विन्यास के सम्मेलनों का पालन करते हैं।

YouMind में रीमिक्स करें

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें