एकल-शॉट जनरेशन परिणामों पर भरोसा करना बंद करें; केवल तभी निष्कर्ष पर पहुँचें जब कई मॉडलों को आपस में भिड़ने दिया जाए। Claude Code कौशल की एक डिज़ाइन व्याख्या जो GANs की प्रतिकूल संरचना को अनुमान चरण में स्थानांतरित करती है।
- लेखक: Ryousuke Wayama (@wayama_ryousuke
- तिथि: 2026-07-09
- पृष्ठभूमि: GANs से प्रेरित अवधारणा (2023 भविष्यवाणी ट्वीट) / Claude Fable 5 के साथ डिज़ाइन पर विचार-विमर्श
- भंडार: https://github.com/makinux/adversarial-panel
पृष्ठभूमि: एकल-शॉट उत्तर पर्याप्त क्यों नहीं हैं
LLM उत्तर तब सबसे खतरनाक नहीं होते जब वे गलत होते हैं, बल्कि तब होते हैं जब वे गलत होते हुए भी आत्मविश्वासी होते हैं। एक एकल मॉडल का एक एकल पास, संरचनात्मक रूप से, इसे पकड़ने के लिए एक तंत्र की कमी रखता है। स्व-आलोचना के साथ भी, उत्पादन और आलोचना के दौरान अंधे धब्बे सहसंबंधित होते हैं क्योंकि वे समान भारों से उत्पन्न होते हैं; इसके अलावा, यह सिद्ध हो चुका है कि मॉडलों में स्व-पसंद पूर्वाग्रह होता है, जो अपने स्वयं के आउटपुट को उच्च दर्जा देते हैं। संक्षेप में, "स्वयं लिखना और समीक्षा करना" किसी भी ऑडिट के लिए शुरू से ही हितों का टकराव है।
इस कौशल की प्रेरणा GANs से आती है। GAN का सार केवल प्रतिस्पर्धी जनरेटर और डिस्क्रिमिनेटर की संरचना नहीं है, बल्कि अंतर्निहित सिद्धांत है: वह विषमता जहां पता लगाना, बनाने से आसान है। जनरेटर द्वारा अपनी शुद्धता की गारंटी देने के बजाय, स्वतंत्र प्रतिकूल एजेंटों को हमला करने देने और केवल उसी को पास करने से जो बच जाता है, समान कम्प्यूटेशनल लागत पर उच्च गुणवत्ता आश्वासन प्राप्त होता है। जहां GANs इस लूप को ग्रेडिएंट के माध्यम से चलाते थे, वहीं adversarial-panel इसे प्राकृतिक भाषा आलोचना के माध्यम से चलाता है। केवल सिग्नल का माध्यम बदला है; खेल की संरचना वही रहती है।
हालांकि, केवल कई मॉडलों को पंक्तिबद्ध करने का कोई मूल्य नहीं है। जो काम करता है वह निम्नलिखित दो डिज़ाइन विशेषताएं हैं, जिन्हें कौशल जानबूझकर बनाने के लिए डिज़ाइन किया गया है:
- त्रुटियों का असंबंधन — एक समीक्षक किसी जनरेटर की निगरानी को तभी पकड़ सकता है जब उनके विफलता मोड भिन्न हों। चूंकि एक ही मॉडल के पैनल अंधे धब्बे साझा करते हैं, "सर्वसम्मत सहमति" उतनी सबूत नहीं है जितनी दिखती है। मॉडल परिवारों को पार करना मूल है।
- सत्यापन लाभ — किसी दिए गए उत्तर का खंडन करना, उत्तर बनाने से आसान है। इसलिए, आलोचकों को सत्यापन योग्य दावों को लक्षित करने का निर्देश दिया जाता है। "मुझे लगता है कि यह संदिग्ध है" नहीं, बल्कि "यह इनपुट X पर विफल रहता है" — केवल दावा करके नहीं, बल्कि पुनरुत्पादन के माध्यम से खंडन करना।
आर्किटेक्चर: सुविधाकर्ता और पैनलिस्ट
केवल दो प्रकार के घटक हैं। मुख्य सत्र (Claude Code स्वयं) सुविधाकर्ता के रूप में कार्य करता है, जो प्रगति, सत्यापन और एकीकरण को संभालता है, जबकि 2 से 4 पैनलिस्ट प्रतिक्रियाओं और पारस्परिक आलोचना को संभालते हैं। सुविधाकर्ता को पैनल के मुंह से अपनी राय नहीं बोलनी चाहिए (सुविधाकर्ता कब्जे का निषेध); यदि कोई राय जोड़ना है, तो उसे "सुविधाकर्ता का दृष्टिकोण" के रूप में लेबल किया जाना चाहिए।

चित्र 1 — adversarial-panel का विन्यास। सुविधाकर्ता एक स्व-निहित ब्रीफ वितरित करता है (ठोस रेखा), और पैनलिस्ट एक-दूसरे के उत्तरों पर हमला करते हैं (क्रॉस-आलोचना) इससे पहले कि वे उत्तर और आलोचनाएं सुविधाकर्ता को लौटाएं (धराशायी रेखा)। यह लूप प्रत्येक दौर के लिए चलता है।
पैनलिस्टों को विषमता को अधिकतम करने की प्राथमिकता के साथ स्रोतित किया जाता है:
- विभिन्न मॉडल परिवार — Bash के माध्यम से Codex जैसी बाहरी CLI। यह त्रुटियों का सबसे मजबूत असंबंधन प्रदान करता है।
- विभिन्न Claude मॉडल — एजेंट टूल के मॉडल पैरामीटर (Opus/Sonnet/Haiku) के माध्यम से।
- समान मॉडल + बलपूर्वक पद्धतिगत शाखाएं — एक पहले सिद्धांतों से तर्क करता है, एक आधार दरों (बाहरी दृष्टिकोण) से, एक केवल प्रति-साक्ष्य की खोज करता है, और एक सत्यापन योग्य दावों को फिर से निष्पादित करता है। केवल व्यक्तित्व से नहीं, बल्कि विधि द्वारा अंतर करें।
डिफ़ॉल्ट 2 पैनलिस्ट × 3 राउंड है। चूंकि लागत पैनलिस्टों और राउंड की संख्या के साथ बढ़ती है, 3-4 पैनलिस्टों तक विस्तार केवल तभी होता है जब उपयोगकर्ता पूर्णता की मांग करता है।
प्रोटोकॉल: 4 राउंड + संश्लेषण

चित्र 2 — प्रोटोकॉल प्रगति। सफेद सुविधाकर्ता के कार्यों का प्रतिनिधित्व करता है, बैंगनी पैनलिस्टों के कार्यों का प्रतिनिधित्व करता है। राउंड 1 के बाद यह जांचने के लिए एक सत्यापन द्वार डाला जाता है कि क्या "उत्तरों में सार है।" सस्ती क्वेरी के लिए, राउंड 2 और 3 को एक में मर्ज किया जा सकता है।
राउंड 0 — फ्रेमिंग और आवश्यकता निर्णय
पहले, निर्धारित करें कि क्या कोई पैनल खोला जाना चाहिए। कम दांव वाली क्वेरी या ऐसे मामलों के लिए जहां आत्मविश्वास उचित है, सीधे उत्तर दें और पैनल को केवल एक विकल्प के रूप में प्रस्तुत करें। एक पूर्ण पैनल केवल महत्वपूर्ण, विवादास्पद, या सत्यापन योग्य क्वेरी के लिए ट्रिगर होता है—क्योंकि वहां आलोचना लागत के लायक है।
"ट्रायेज ट्रैप" के खिलाफ बचाव यहां बनाया गया है। चूंकि जिस मॉडल को अंधे स्थान को पकड़ना चाहिए वह इस द्वार को संचालित कर रहा है, यह किसी कार्य में जितना अधिक आत्मविश्वास से विफल होता है, द्वार के खुलने की संभावना उतनी ही कम होती है। इसलिए, यदि कोई उपयोगकर्ता स्पष्ट रूप से पैनल का अनुरोध करता है, तो यह आत्मविश्वास की परवाह किए बिना निष्पादित होता है, और महत्वपूर्ण क्वेरी के लिए, निर्णय स्व-आत्मविश्वास के बजाय दांव के आकार पर आधारित होता है।
इसके बाद, एक स्व-निहित ब्रीफ लिखें। चूंकि उप-एजेंट बातचीत के संदर्भ को बिल्कुल नहीं देख सकते हैं, ब्रीफ में क्वेरी, संदर्भ, बाधाएं और आउटपुट प्रारूप शामिल होना चाहिए, साथ ही "तथ्यों को अटकलों से अलग करें और प्रमुख दावों में आत्मविश्वास स्तर और मिथ्याकरण की स्थितियां (कौन से अवलोकन इसे उलट देंगे) संलग्न करें" के निर्देश शामिल होने चाहिए। मिथ्याकरण की स्थितियां विशिष्ट और निरीक्षण योग्य होनी चाहिए, जैसे "इनपुट X पर विफल रहता है" या "स्रोत Y का खंडन करता है"; "यदि विपरीत साक्ष्य प्रकट होता है" जैसे सामान्य वाक्यांशों को लापता डेटा (अंशांकन थिएटर) माना जाता है।
राउंड 1 — स्वतंत्र उत्तर (समानांतर/अंधा)
सभी पैनलिस्टों को समानांतर में लॉन्च करें। यह एक पूर्ण आवश्यकता है कि कोई भी दूसरों के उत्तर न देखे; एक पैनलिस्ट जो दूसरे का उत्तर देखता है वह उस पर एंकर हो जाएगा, जिससे स्वतंत्रता की धारणा टूट जाती है।
वापसी पर, सत्यापन द्वार: स्थिति रेखाएं या त्रुटि डंप उत्तर नहीं हैं। उन्हें मिनटों में शामिल करने से बाद के राउंड भूतों की आलोचना करेंगे (बाद में वर्णित भूत पैनलिस्ट समस्या)। विफल पैनलिस्टों को पुनः प्रयास किया जाता है; यदि वे दो बार विफल होते हैं, तो विषमता स्तर को जारी रखने के लिए एक कदम नीचे किया जाता है, और वास्तविक पैनल विन्यास उपयोगकर्ता को प्रकट किया जाता है।
राउंड 2 — क्रॉस-आलोचना (समानांतर)
प्रत्येक पैनलिस्ट को अन्य पैनलिस्टों के उत्तर दिए जाते हैं। उन्हें उद्धरणों के साथ विशिष्ट दावों पर हमला करना चाहिए—तथ्यात्मक त्रुटियां, कमजोर साक्ष्य, तार्किक छलांग, अनदेखे विकल्प, या निहित धारणाएं। सत्यापन योग्य दावों का पुनरुत्पादन (कोड चलाना, मूल्यों की पुनर्गणना करना, स्रोतों की जांच करना) के माध्यम से खंडन किया जाता है। सहमति, सारांश, या प्रशंसा की मुद्रास्फीति निषिद्ध है। स्वीकारोक्ति और हमले दोनों के लिए कारणों की आवश्यकता होती है।
राउंड 3 — अंतिम दृष्टिकोण (समानांतर)
प्रत्येक पैनलिस्ट को उनके खिलाफ आलोचनाएं दी जाती हैं। उन्हें वैध हमलों को स्वीकार करना चाहिए (कारणों के साथ, सामाजिक शिष्टाचार से नहीं), बचे हुए दावों का कारणों के साथ बचाव करना चाहिए, और शेष अनिश्चितताओं के साथ-साथ अंशांकित आत्मविश्वास और मिथ्याकरण की स्थितियों को बताना चाहिए। बिना कारण के पूर्ण रूपांतरण चापलूसी का संकेत है, इसलिए स्वीकार करने से पहले रूपांतरण के आधार पर सवाल उठाया जाता है।
संश्लेषण — सुविधाकर्ता द्वारा एकीकरण
अंतिम आउटपुट में तीन भाग होते हैं: सहमति के बिंदु / संघर्ष के बिंदु / निष्कर्ष।
- सहमति के बिंदु — सबसे मजबूत एकल समर्थन तर्क के साथ, यह निर्दिष्ट करते हुए कि क्या अभिसरण मजबूत सबूत है (विषम पैनल) या कमजोर सबूत (समरूप पैनल, संभावित साझा अंधे धब्बे)।
- संघर्ष के बिंदु — "कौन, क्या, किस साक्ष्य के साथ" + सुविधाकर्ता के निर्णय के रूप में लिखा गया, साक्ष्य शक्ति द्वारा भारित। यदि एक पक्ष के पास पुनरुत्पादक साक्ष्य है और दूसरे के पास अंतर्ज्ञान है, तो निर्णय दिया जाता है। दोनों पक्षों को समान रूप से प्रस्तुत करना तटस्थता नहीं है, बल्कि झूठा संतुलन है।
- निष्कर्ष — आत्मविश्वास स्तर, ऐसी स्थितियां जो निष्कर्ष को बदल सकती हैं, अल्पमत की राय जो संरक्षित करने लायक हैं, और स्वीकृत/अस्वीकृत आलोचनाओं का एक ऑडिट ट्रेल शामिल है।
पूरे समय बनाए रखने के लिए तीन अपरिवर्तनीयताएं
अपरिवर्तनीयता | सामग्री |
|---|---|
स्वतंत्रता | राउंड 1 के उत्तर अंधे उत्पन्न होने चाहिए। जो पैनलिस्ट दूसरों के उत्तर देखते हैं वे एंकर हो जाते हैं और अब स्वतंत्र नमूने नहीं रहते। |
प्रतिकूलता | नए तर्कों के बिना सहमति एक दौर की विफलता है। निर्देश को बलपूर्वक लागू करें: "कम से कम एक केंद्रीय दावे का विरोध करें; इसे खोजें।" |
कोई औसत नहीं | संश्लेषण औसत निकालना नहीं है। संघर्षों को संरक्षित और निर्णीत किया जाता है। जैसे ही आप जोड़ते और दो से विभाजित करते हैं, पैनल द्वारा उत्पन्न सिग्नल गायब हो जाता है। |
GANs के साथ पत्राचार
"प्रतिकूल जनरेशन को अनुमान में स्थानांतरित करने" के डिज़ाइन इरादे को निम्नानुसार मैप किया जा सकता है। यह महत्वपूर्ण है कि पैनल पक्ष पर विफलता मोड ज्ञात GAN विफलता मोड से बड़े करीने से मेल खाते हैं।
GAN (प्रशिक्षण) | adversarial-panel (अनुमान) |
|---|---|
जनरेटर | पैनलिस्टों के स्वतंत्र उत्तर (राउंड 1) |
डिस्क्रिमिनेटर | क्रॉस-आलोचना का हमला करने वाला पक्ष (राउंड 2) |
ग्रेडिएंट अपडेट | प्राकृतिक भाषा आलोचना और तर्कसंगत स्वीकारोक्ति/बचाव (राउंड 3) |
मिनिमैक्स संतुलन | निर्णय के साथ सुविधाकर्ता का संश्लेषण (संश्लेषण) |
डिस्क्रिमिनेटर लाभ | सत्यापन विषमता—पता लगाना बनाने से आसान है |
कोई भार साझाकरण नहीं | मॉडल परिवारों का पृथक्करण—त्रुटियों का असंबंधन |
मोड पतन | चापलूसी अभिसरण (पारस्परिक सहमति) |
विफलता मोड और प्रति-उपाय — सभी उत्पादन में देखे गए
कौशल प्रतिरूपों का यह संग्रह सैद्धांतिक चिंताओं की सूची नहीं है, बल्कि सामने आए वास्तविक खतरों की एक सूची है।
- भूत पैनलिस्ट स्थिति स्ट्रिंग या त्रुटि डंप उत्तर के रूप में मिनटों में मिल जाते हैं, जिससे सभी बाद के राउंड खाली हवा के खिलाफ बहस करते हैं। → प्रति-उपाय: राउंड 1 के तुरंत बाद सत्यापन द्वार। बाहरी CLI के लिए अग्रभूमि निष्पादन को बलपूर्वक लागू करें और उन रैपरों को प्रतिबंधित करें जो पूरा होने से पहले वापस आते हैं।
- चापलूसी अभिसरण हर कोई राउंड 2 में बिना नए तर्कों के सहमत होता है। GANs में मोड पतन के बराबर। → प्रति-उपाय: आलोचना प्रॉम्प्ट में "आप कम से कम एक केंद्रीय दावे का विरोध कर रहे हैं। इसे खोजें" जोड़ें।
- सुविधाकर्ता कब्जा सुविधाकर्ता पैनल को अपनी पूर्व राय बोलने देता है, उन्हें सर्वसम्मति के अधिकार के माध्यम से धोता है। → प्रति-उपाय: सुविधाकर्ता के दृष्टिकोण को लेबल के साथ अलग किया जाना चाहिए।
- आत्मविश्वास थिएटर मिथ्याकरण की स्थितियों के बिना संख्यात्मक आत्मविश्वास। "80% आत्मविश्वास" तब तक अर्थहीन है जब तक आप यह नहीं कह सकते कि कौन सा अवलोकन आपको इसे वापस लेने पर मजबूर करेगा। → प्रति-उपाय: मिथ्याकरण की स्थितियों के बिना आत्मविश्वास को लापता मानें।
- विविधता भ्रम एक ही मॉडल के विभिन्न व्यक्तित्वों को स्वतंत्र समीक्षकों के रूप में मानना। भूमिका का नाम "रेड टीम" त्रुटियों को असंबंधित नहीं करता है—केवल विभिन्न मॉडल, विभिन्न पद्धतियां, या दावों का वास्तविक पुनरुत्पादन असंबंधन पैदा करता है। → प्रति-उपाय: समरूप पैनलों में अभिसरण को स्पष्ट रूप से कमजोर साक्ष्य के रूप में डाउनग्रेड करें।
उपयोग के मामले और इसे कैसे कॉल करें
कौशल स्वयं makinux/adversarial-panel पर प्रकाशित है। इसे Claude Code में ~/.claude/skills/adversarial-panel/SKILL.md के रूप में रखकर, यह स्पष्ट कॉल या प्राकृतिक भाषा के माध्यम से ट्रिगर होता है जैसे:
"Opus और Codex को इस डिज़ाइन की प्रतिकूल समीक्षा करने दें।" "सच में? उन्हें बहस करने दें ताकि सुनिश्चित हो सके।" / "red-team this" / "मुझे दूसरी राय चाहिए।" यह सक्रिय रूप से ट्रिगरिंग के लिए एक उम्मीदवार भी बन जाता है जब आप महत्वपूर्ण बिंदुओं पर "क्या आपको यकीन है?" के साथ निश्चितता के लिए दबाव डालते हैं।
यह महत्वपूर्ण क्वेरी के लिए उपयुक्त है जो या तो विवादास्पद या सत्यापन योग्य हैं। आर्किटेक्चर चयन, विफलताओं के लिए मूल कारण परिकल्पनाएं, तकनीकी पूर्वानुमान, या शोध निष्कर्षों को सत्यापित करना। इसके विपरीत, कम दांव वाली क्वेरी के लिए इसे खोलना लागत की बर्बादी है, जिसे राउंड 0 ट्रायेज फ़िल्टर करता है। लागत पैनलिस्टों की संख्या × राउंड के समानुपाती होती है; 2×3 दैनिक उपयोग के लिए मानक है, महत्वपूर्ण क्षणों के लिए 3-4 तक विस्तार होता है।
खराब वातावरण के लिए गिरावट भी परिभाषित है:
- कोई उप-एजेंट तंत्र नहीं → अनुक्रमिक निष्पादन में अलग-अलग अनुभागों के साथ स्थानापन्न (कमजोर, क्योंकि भार और संदर्भ साझा किए जाते हैं—संश्लेषण में नोट किया गया)।
- केवल एक एकल परिवार उपलब्ध → पद्धतिगत शाखाओं (तीसरा स्तर) पर ड्रॉप करें और अभिसरण की साक्ष्य शक्ति को डाउनग्रेड करें।
- बाहरी CLI दो बार विफल होती है → उस पैनलिस्ट को हटाएं, जारी रखें, और प्रकट करें।
रिपोर्ट करें कि इरादे के आधार पर नहीं, बल्कि माप के आधार पर वास्तव में कौन सा स्तर चला—यह ऑडिटेबिलिटी की कुंजी है।
निष्कर्ष: अनुमान से प्रशिक्षण तक
जब मैंने 2023 में भविष्यवाणी की थी कि "LLM के लिए प्रतिकूल जनरेशन अगला कदम है," तो मेरे मन में GAN-जैसी प्रशिक्षण योजना थी।
https://x.com/wayama_ryousuke/status/1658698942161510400
तीन साल बाद उत्तर की जांच करने पर, प्रतिकूल संरचनाएं प्रशिक्षण (ग्रेडिएंट) के बजाय पहले अनुमान (प्राकृतिक भाषा आलोचना) में व्यावहारिक हुईं। CriticGPT जैसे आलोचना-विशिष्ट मॉडल, बहु-एजेंट बहस अनुसंधान, और कोडिंग में क्रॉस-समीक्षा संचालन—उद्योग विभिन्न प्रवेश द्वारों से एक ही संरचना पर अभिसरित हो रहा है।
अगला चरण संभवतः पुनर्एकीकरण है। जबकि अनुमान-समय की समीक्षा के परिणाम वर्तमान में डिस्पोजेबल हैं, आलोचनाओं को RL पुरस्कार संकेतों (RLAIF मार्ग) में परिवर्तित करने से प्रतिकूल परिणामों को भारों में जमा होने की अनुमति मिलती है—GANs ने मूल रूप से जो किया उस पर वापस लौटना। यदि हम "प्रतिकूल समीक्षाओं के परिणामों के साथ अगले मॉडल को प्रशिक्षित करने" के बिंदु पर पहुंचते हैं, तो यह कौशल एक संक्रमणकालीन अवधि का एक प्रोटोटाइप रहा होगा। तब तक, एकल-पास उत्तर पर दांव लगाने से पहले मॉडलों को एक-दूसरे के खिलाफ भिड़ना काफी सार्थक है।
यह लेख Claude Code कौशल adversarial-panel (SKILL.md) के लिए एक डिज़ाइन व्याख्या है। अवधारणा: [@wayama_ryousuke](https://x.com/@wayama_ryousuke) (GANs से प्रेरित, Claude Fable 5 के साथ डिज़ाइन पर विचार-विमर्श)। आरेख Executor/Advisor एजेंट विन्यास के सम्मेलनों का पालन करते हैं।





