TL;DR
"क्लॉड कोड के बारे में आप क्या नहीं जानते: आर्किटेक्चर, शासन और इंजीनियरिंग अभ्यास" और "एजेंट्स के बारे में आप क्या नहीं जानते: सिद्धांत, आर्किटेक्चर और इंजीनियरिंग अभ्यास" लिखने के बाद, मैंने खुद को चुनौती देने का फैसला किया कि बड़े भाषा मॉडल (LLM) का प्रशिक्षण वास्तव में कैसे काम करता है, इसे संक्षेप में समझाऊं। इस लेख का उद्देश्य उन लोगों के लिए भी समझने योग्य होना है जिनके पास पेशेवर पृष्ठभूमि नहीं है।
2026 की ओर देखते हुए, LLM प्रदर्शन में वास्तविक अंतर अब केवल प्री-ट्रेनिंग नहीं है, बल्कि उसके बाद आने वाली लंबी पूंछ है: पोस्ट-ट्रेनिंग, मूल्यांकन, पुरस्कार, एजेंट प्रशिक्षण, और डिस्टिलेशन। हर कदम उपयोगकर्ता के वास्तविक अनुभव को प्रभावित करता है। जब आप पाते हैं कि कोई मॉडल अचानक मजबूत हो गया है, तो संभवतः यह है कि इन क्षेत्रों को एक साथ अनुकूलित किया गया था, न कि कोई एक कारक।
निम्नलिखित LLM प्रशिक्षण पाइपलाइन का अनुसरण करता है, जिसमें ध्यान इस बात पर है कि निर्माता प्रशिक्षण स्टैक के उत्तरार्ध के माध्यम से अंतिम परिणामों को कैसे बेहतर बनाते हैं।
LLM प्रशिक्षण एक पाइपलाइन है
पिछले कुछ वर्षों में, मॉडल की प्रगति को आम तौर पर पैरामीटर, डेटा और कंप्यूटिंग शक्ति के संचय द्वारा समझाया गया था। हालांकि, उपयोगकर्ता वास्तव में जिन सुधारों को महसूस करते हैं, वे अधिक बुनियादी कॉर्पोरा पर प्रशिक्षण से नहीं आते हैं, बल्कि प्री-ट्रेनिंग के बाद की पूरी प्रशिक्षण प्रक्रिया से आते हैं। मॉडल कैसे बोलता है, निर्देशों का पालन करता है, तर्क करता है, और उपकरणों का उपयोग करता है - ये केवल इसे और अधिक इंटरनेट टेक्स्ट खिलाकर स्वाभाविक रूप से विकसित नहीं होते हैं।
इंस्ट्रक्टGPT ने एक बहुत ही सीधा उदाहरण दिया: केवल 1.3B पैरामीटर वाला एक मॉडल जो संरेखण और वरीयता अनुकूलन से गुज़रा, वह मानव वरीयता मूल्यांकन में 175B GPT-3 को हरा सकता है। परिमाण के दो क्रमों के पैरामीटर अंतर के साथ, उपयोगकर्ताओं ने अंततः बहुत छोटे संस्करण को प्राथमिकता दी। प्रशिक्षण का उत्तरार्ध वास्तव में उपयोगकर्ता की धारणा को फिर से लिखता है।
प्रशिक्षण प्रक्रिया वास्तव में एक पाइपलाइन है जहां डेटा, एल्गोरिदम, सिस्टम और फीडबैक अत्यधिक युग्मित होते हैं। एक परत में बदलाव आमतौर पर दूसरों तक फैलता है। 2026 में, मॉडल क्षमताएं और औद्योगिक मूल्य तेजी से प्री-ट्रेनिंग के बाद की परतों में केंद्रित हो रहे हैं।

यह भी कारण है कि हम अक्सर महसूस करते हैं कि डौबाओ रैंकिंग के लिए प्रतिस्पर्धा नहीं करता है, फिर भी दैनिक उपयोग में अधिक संतोषजनक लगता है - ऐसा इसलिए है क्योंकि पोस्ट-ट्रेनिंग अच्छी तरह से की गई है।
ये छह परतें केवल श्रम विभाजन देखने के लिए हैं। नीचे दिए गए चित्र में नौ चरण अधिक विस्तृत संस्करण हैं: कच्चा डेटा और सिस्टम रेसिपी अलग किए गए हैं, और एजेंट हार्नेस और डिप्लॉयमेंट उत्तरार्ध के उप-विभाजन हैं। पूरे समय दो फीडबैक लूप भी हैं: उत्पादन ट्रैफ़िक डेटा इंजीनियरिंग में लौटता है, और ऑफ़लाइन मूल्यांकन परिणाम प्री-ट्रेनिंग में लौटते हैं।

प्री-ट्रेनिंग सिर्फ नींव है
प्री-ट्रेनिंग प्रशिक्षण श्रृंखला का प्रारंभिक बिंदु बनी हुई है। केवल यह समझकर कि यह क्या करता है, हम समझ सकते हैं कि प्रत्येक बाद की परत क्या पूरक करती है। इस चरण के बिना, कोई भाषा मॉडलिंग क्षमता नहीं है, कोई ज्ञान संपीड़न नहीं है, और बाद की क्षमता हस्तांतरण के लिए कोई जगह नहीं है। इंजीनियरिंग में, यह मॉडल को अगले टोकन की भविष्यवाणी करना सिखाने से कहीं अधिक करता है: यह भाषा वितरण सीखता है, बड़े पैमाने के टेक्स्ट से ज्ञान और पैटर्न को पैरामीटर में संपीड़ित करता है, और बाद की क्षमता सक्रियण के लिए जगह छोड़ता है। नेक्स्ट-टोकन भविष्यवाणी केवल प्रशिक्षण के रूप का वर्णन करती है; यह स्पष्ट नहीं करती है कि पैमाने के बढ़ने पर मॉडल अचानक नई क्षमताएं क्यों विकसित करते हैं।
GPT-3 के बाद, कई मॉडल ट्यूनिंग प्रयास बजट और अनुपातों पर अधिक सावधानी से विचार करते हैं। मॉडल सिर्फ इसलिए बेहतर नहीं होते हैं क्योंकि वे बड़े होते हैं। पैरामीटर संख्या, प्रशिक्षण टोकन और कुल कंप्यूटिंग बजट के बीच एक अनुपात का मुद्दा है। कई मॉडल बहुत छोटे नहीं हैं; वे अंडर-ट्रेंड हैं और दिए गए बजट के तहत अधिक उपयुक्त बिंदु तक नहीं पहुंचे हैं।
वास्तविक प्रशिक्षण निर्णयों में, व्यावहारिक प्रश्न यह है: यदि कोई आपको 10,000 H100 और एक महीना देता है, तो आप पर्याप्त अच्छा ओपन-सोर्स मॉडल कैसे प्रशिक्षित करेंगे? स्केलिंग लॉ यहां एक पेपर में एक अमूर्त वक्र की तुलना में बजट आवंटन उपकरण की तरह अधिक हैं। अंततः, आपको विचार करने की आवश्यकता है: क्या अगले दौर के प्रशिक्षण में अधिक पैरामीटर स्टैक करने चाहिए या अधिक डेटा फीड करना चाहिए? क्या वर्तमान मॉडल में क्षमता की कमी है या यह सिर्फ अंडर-ट्रेंड है? सीमित GPU बजट के तहत, कौन सा अनुपात सबसे मूल्यवान है?
प्री-ट्रेनिंग मॉडल क्षमताओं की नींव रखने जैसा है, जो ज्ञान के दायरे, सामान्यीकरण क्षमता और पैटर्न प्रेरण क्षमता को निर्धारित करता है। यह यह भी निर्धारित करता है कि पोस्ट-ट्रेनिंग के लिए दोहन करने की गुंजाइश है या नहीं। हालांकि, प्री-ट्रेनिंग यह नियंत्रित नहीं कर सकती है कि मॉडल निर्देशों का पालन करता है या नहीं, उपयोगकर्ताओं के साथ सहयोग करता है या नहीं, या महत्वपूर्ण कार्यों पर स्थिर रूप से चलता है या नहीं।
प्री-ट्रेनिंग चरण केवल यह तय नहीं करता है कि कितना ज्ञान सीखा गया है; यह पूर्व निर्धारित करता है कि मॉडल क्या बन सकता है। टोकनाइज़र का विभाजन तरीका सीधे बाद के प्रशिक्षण को प्रभावित करता है, और संदर्भ विंडो की लंबाई शुरू में निर्धारित की जानी चाहिए। क्या मल्टी-मॉडल प्री-ट्रेनिंग जारी रखना है या क्या सिंगल-एक्सेलेरेटर ऑपरेशन शुरू से एक आवश्यकता है - ये ट्रेड-ऑफ प्रशिक्षण चरण के दौरान रेसिपी में लिखे जाते हैं, रिलीज़ समय पर सुविधाओं के रूप में नहीं जोड़े जाते हैं। Gemma 3 एक साथ सिंगल एक्सेलेरेटर, 128K कॉन्टेक्स्ट, विज़न क्षमताओं और क्वांटाइज़ेशन पर जोर देता है, जो इन ट्रेड-ऑफ को दर्शाता है। उपयोगकर्ता अंततः जो क्षमताएं देखते हैं - स्थानीय कंप्यूटर पर चलना, छवियां देखना, लंबे दस्तावेज़ों को समझना - वास्तव में काफी हद तक प्रशिक्षण चरण के दौरान निर्धारित होती हैं।
चिंचिला द्वारा दिए गए डेटा इष्टतम बिंदु को देखते हुए, 8B पैरामीटर मॉडल के लिए, यह लगभग 200B टोकन है। हालांकि, Llama 3 8B ने वास्तव में 15T टोकन का उपयोग किया, जो लगभग 75 गुना अधिक है। इस तरह की ओवर-ट्रेनिंग रेसिपी आमतौर पर समान पैरामीटर के लिए उच्च क्षमता घनत्व का व्यापार करती है, जिसके परिणामस्वरूप अनुमान के लिए एक छोटा, अधिक लागत प्रभावी मॉडल होता है। इसे कुल FLOPs (फ़्लोटिंग-पॉइंट ऑपरेशंस) द्वारा मापना पैरामीटर गणना को देखने की तुलना में अधिक विश्वसनीय है। नीचे दिया गया चित्र इस अंतर को दर्शाता है।

एक और अक्सर अनदेखा किया गया डिज़ाइन प्री-ट्रेनिंग चरण में होता है: टोकनाइज़र शब्दावली आकार, विभाजन रणनीतियाँ और बाइट-स्तरीय एन्कोडिंग विधियों का महत्वपूर्ण प्रभाव पड़ता है। Llama 2 के पास 32K शब्दावली थी; Llama 3 ने इसे 128K तक विस्तारित करने के बाद, अनुक्रम लंबाई लगभग 15% संपीड़ित हुई, और डाउनस्ट्रीम प्रदर्शन में सुधार हुआ। यह प्रभाव अनुमान लागत और बहुभाषी क्षमताओं तक फैला हुआ है। चीनी, कोड और गणितीय सूत्रों की टोकन दक्षता शब्दावली डिज़ाइन के दौरान निर्धारित की जाती है। उदाहरण के लिए, एक टोकनाइज़र जो चीनी को बहुत छोटे टुकड़ों में विभाजित करता है, न केवल हर बार अधिक टोकन खर्च करता है; हर अनुमान को उस खराब निर्णय की लागत वहन करनी पड़ती है।
डेटा रेसिपी मॉडल क्षमताओं को निर्धारित करती हैं
पैरामीटर पैमाना अतीत में एक प्रमुख मीट्रिक था, लेकिन पिछले दो वर्षों में, अधिक महत्वपूर्ण चीज़ "डेटा रेसिपी" है।
यह प्रक्रिया सतह पर डेटा सफाई जैसी दिखती है, लेकिन वास्तव में यह एक पूर्ण डेटा उत्पादन इंजीनियरिंग कार्य है। वेब पेजों, कोड रिपॉजिटरी, पुस्तकों और फ़ोरम से कच्चा डेटा प्री-ट्रेनिंग में प्रवेश करने से पहले पहले टेक्स्ट निष्कर्षण, भाषा पहचान, गुणवत्ता फ़िल्टरिंग, गोपनीयता प्रसंस्करण, सुरक्षा फ़िल्टरिंग और डिडुप्लिकेशन से गुज़रना चाहिए। नीचे दिया गया चित्र पूर्ण फ़नल प्रसंस्करण प्रवाह दिखाता है।

यदि आप डेटा को केवल प्रशिक्षण ईंधन के रूप में मानते हैं, तो यह निष्कर्ष निकालना आसान है कि अधिक बेहतर है। लेकिन डेटा इंजीनियरिंग क्षमता डिज़ाइन के करीब है। मॉडल क्या देखता है और क्या नहीं देखता है, और कोड, गणित और विश्वकोश के अनुपात, सीधे मॉडल की अंतिम क्षमता वितरण को प्रभावित करते हैं।
डिडुप्लिकेशन और संदूषण नियंत्रण को अक्सर अनदेखा किया जाता है, लेकिन वे परिणामों को महत्वपूर्ण रूप से प्रभावित करते हैं। यह केवल निम्न-गुणवत्ता वाले डेटा के बारे में नहीं है; इसमें डुप्लिकेट टेम्पलेट, लाइसेंस टेक्स्ट, दर्पण वेबसाइट और बेंचमार्क लीक से संदूषण शामिल है। यदि दस्तावेज़-स्तरीय और लाइन-स्तरीय डिडुप्लिकेशन अपर्याप्त है, तो मॉडल अक्सर सबसे आसानी से कॉपी करने योग्य सामग्री को बार-बार अवशोषित करता है, बिना जरूरी सबसे मूल्यवान भागों को सीखे। कई ओपन-सोर्स मॉडल का असंगत प्रदर्शन अक्सर डेटा प्रसंस्करण गुणवत्ता में अंतर के कारण होता है।
पिछले दो वर्षों में, डेटा मिश्रण स्वयं एक अलग शोध समस्या बन गया है। डेटा मिश्रण कानून जैसे कार्य इस बात पर ध्यान केंद्रित नहीं करते हैं कि कितना अधिक डेटा एकत्र किया जा सकता है, बल्कि इस बात पर ध्यान केंद्रित करते हैं कि विभिन्न डेटा प्रकारों के अनुपात मॉडल को विशिष्ट क्षमता संरचनाओं की ओर कैसे ले जाते हैं।
सिंथेटिक डेटा भी एक सहायक साधन से प्रशिक्षण प्रक्रिया के एक औपचारिक भाग में स्थानांतरित हो गया है। Self-Instruct, DeepSeek-R1 की डिस्टिलेशन ट्रैजेक्टोरीज़, और Qwen और Kimi श्रृंखला में तेजी से स्पष्ट सिंथेटिक पर्यवेक्षण जैसी विधियाँ सभी एक ही दिशा में आगे बढ़ रही हैं। मजबूत मॉडलों की प्रत्येक पीढ़ी अगली पीढ़ी द्वारा देखे गए डेटा के पुनर्निर्माण में भाग लेती है। प्रारंभिक मॉडलों ने बुनियादी निर्देश डेटा उत्पन्न किया; मजबूत मॉडल उच्च-गुणवत्ता वाले तर्क प्रक्षेपवक्र और CoT (चेन ऑफ थॉट) डेटा उत्पन्न करते हैं; और RL के माध्यम से प्रशिक्षित तर्क मॉडल इन प्रक्षेपवक्रों को छोटे घने मॉडलों में डिस्टिल करते हैं। "डेंस" का अर्थ है कि सभी पैरामीटर चलते हैं, MoE (मिक्सचर ऑफ एक्सपर्ट्स) के विपरीत जो मांग पर सक्रिय होता है।
यहां मुख्य बात यह है कि मॉडलों को अक्सर पहले बड़े पैमाने पर क्षमताएं बनाने की आवश्यकता होती है, इससे पहले कि उन क्षमताओं को छोटे मॉडलों में संपीड़ित किया जा सके। DeepSeek-R1-Distill श्रृंखला एक सीधा उदाहरण है। RL के बाद बड़े मॉडल प्रक्षेपवक्रों ने 1.5B से 70B तक के घने मॉडलों को महत्वपूर्ण लाभ प्रदान किए हैं। Llama 3.1 405B का उपयोग स्पष्ट रूप से 8B और 70B मॉडलों की पोस्ट-ट्रेनिंग गुणवत्ता में सुधार के लिए किया गया था। ये साइड प्रोडक्ट नहीं हैं बल्कि प्रशिक्षण डिज़ाइन का हिस्सा हैं।
प्रशिक्षण से पहले सिस्टम और आर्किटेक्चर बाधाएं स्पष्ट होनी चाहिए
बहुत से लोग प्रशिक्षण को एक शोध समस्या के रूप में समझते हैं: उद्देश्य फ़ंक्शन कैसे सेट करें, नुकसान कैसे कम करें, और मॉडल संरचना कैसे बदलें। लेकिन वास्तविक LLM प्रशिक्षण में, सिस्टम बाधाएं बहुत महत्वपूर्ण हैं; यह एक वितरित सिस्टम समस्या है, एकल मशीन पर एक गहन शिक्षण समस्या नहीं है। GPUs की संख्या, मेमोरी बैंडविड्थ, समानांतर रणनीतियाँ, दोष सहनशीलता और लागत - इन्हें प्रशिक्षण के बाद अनुकूलित करने तक इंतजार नहीं किया जा सकता है। वे शुरू से ही निर्धारित करते हैं कि आप कितना बड़ा प्रशिक्षित कर सकते हैं, आप कितने लंबे संदर्भ का समर्थन कर सकते हैं, और क्या आप अधिक जटिल पोस्ट-ट्रेनिंग चला सकते हैं।
MoE इस परत पर सबसे विशिष्ट उदाहरण है। मल्टी-एक्सपर्ट मोड मॉडल को समान गणना के तहत कुल पैरामीटर का विस्तार करने की अनुमति देता है, जबकि प्रति टोकन सक्रियण लागत को नियंत्रित करता है। व्यापार-बंद जटिल रूटिंग, कठिन लोड संतुलन और भारी बुनियादी ढाँचा है। DeepSeek-V3 और Qwen के MoE डिज़ाइन लागत और प्रभाव के बीच समझौते हैं, न कि केवल आर्किटेक्चरल प्राथमिकताएं।
हाल ही में सार्वजनिक रेसिपी में चर्चाएं अब केवल मॉडल आकार और टोकन अनुपात जैसे मोटे विश्लेषणों के बारे में नहीं हैं। muP हाइपरपैरामीटर को छोटे पैमाने के प्रयोगों से बड़े पैमाने के प्रशिक्षण में स्थानांतरित करने की अनुमति देता है। WSD लर्निंग रेट एक शेड्यूल है जो बढ़ता है, स्थिर होता है, और फिर क्षय होता है। इष्टतम बैच आकार और उच्च डेटा-टू-पैरामीटर अनुपात के साथ, ये विवरण समान पैमाने के मॉडलों के बीच वास्तविक अंतर बन रहे हैं।
लंबा संदर्भ, मल्टी-मॉडलिटी और नए आर्किटेक्चर, यदि केवल उत्पाद सुविधाओं के रूप में समझे जाते हैं, तो प्रशिक्षण-पक्ष की बाधाएं छूट जाती हैं। 128K संदर्भ लक्ष्य सीधे ध्यान लागत, बैच आकार, प्रशिक्षण पाठ्यक्रम (डेटा अनुक्रमण) और समानांतर रणनीतियों को बदल देता है। मल्टी-मॉडलिटी न केवल मॉडल संरचना को बदलता है, बल्कि डेटा मिश्रण, एनकोडर डिज़ाइन और सुरक्षा मूल्यांकन को भी बदलता है। यदि सिंगल-कार्ड संचालन एक कठिन आवश्यकता है, तो पैरामीटर गणना, क्वांटाइज़ेशन पथ और मॉडल परिवार का आकार सभी कड़े हो जाएंगे।
Forgetting Transformer और Kimi के Attention Residuals जैसे कार्य समान प्रश्नों का उत्तर देते हैं: लंबे संदर्भों को कैसे प्रशिक्षित करें और नेटवर्क के गहरा होने पर सूचना क्षीणन से कैसे बचें। आप जो देखते हैं वह एक मॉडल है जो लंबे इनपुट को संभाल सकता है या तैनात करना आसान है, लेकिन प्रशिक्षण के दौरान जो सामना किया जाता है वह पूरी तरह से अलग बाधाओं का सेट है।
कंप्यूटिंग बजट निश्चित है। मॉडल आकार, प्रशिक्षण टोकन मात्रा, संदर्भ लंबाई और सेवा लागत - एक दिशा में खर्च किए गए प्रत्येक बिट के लिए, दूसरों को झुकना होगा।

जैसे-जैसे संदर्भ लंबा होता है, ध्यान लागत बढ़ती है, और बैच आकार कम होना चाहिए। जैसे-जैसे मॉडल बड़े होते हैं, GPU मेमोरी उपयोग बढ़ता है, और सेवा लागत बढ़ती है। ये विकल्प नहीं हैं बल्कि संसाधन बाधाओं के परिणाम हैं। अधिकांश निर्णय प्रशिक्षण शुरू होने से पहले लॉक कर दिए जाते हैं।
एक और इंजीनियरिंग वास्तविकता भी है जिसे अक्सर अनदेखा किया जाता है: प्रशिक्षण हमेशा स्थिर नहीं होता है। हज़ारों GPUs हफ्तों तक चलते हैं, और अचानक एक प्रशिक्षण लॉस स्पाइक होता है, इतना बड़ा कि इसे अनदेखा नहीं किया जा सकता है, जो दिनों पहले के चेकपॉइंट पर वापस जाने और फिर से शुरू करने के लिए मजबूर करता है।
लॉस स्पाइक के अलावा, साइलेंट GPU त्रुटियां हैं - एक एकल GPU जो त्रुटि की रिपोर्ट नहीं करता है लेकिन चुपचाप गलत ग्रेडिएंट उत्पन्न करता है - NVLink बैंडविड्थ विसंगतियां, और इंटर-नोड संचार जिटर। प्रत्येक प्रशिक्षण के कई चरणों को दूषित कर सकता है। बड़े पैमाने के प्रशिक्षण में तेजी से पहचान, अलगाव और पुनर्प्राप्ति करने में सक्षम होना एक प्रयोगशाला-स्तरीय इंजीनियरिंग क्षमता है, न कि पेपर पढ़ने से हल होने वाली समस्या।
DeepSeek-V3 ने अपनी तकनीकी रिपोर्ट में विशेष रूप से उल्लेख किया कि पूरी प्री-ट्रेनिंग प्रक्रिया में कोई अपरिवर्तनीय लॉस स्पाइक नहीं था और कोई रोलबैक नहीं था। यह कुछ मामलों में से एक है जो पुष्टि करता है कि FP8 मिश्रित-सटीकता प्रशिक्षण अति-बड़े पैमाने के मॉडलों पर संभव है। सार्वजनिक डेटा के अनुसार, पूरी प्रक्रिया में 14.8T टोकन प्री-ट्रेन करने के लिए लगभग 2.788M H800 GPU घंटे लगे।
प्रशिक्षण सिस्टम और अनुमान सिस्टम निकटता से संबंधित हैं लेकिन एक ही इंजीनियरिंग समस्या नहीं हैं। प्रशिक्षण ग्रेडिएंट, समानांतरता, चेकपॉइंट, थ्रूपुट और लागत की परवाह करता है; अनुमान विलंबता, KV कैश (दोहराव से बचने के लिए ऐतिहासिक गणनाओं को कैश करना), क्वांटाइज़ेशन और सेवा स्थिरता की परवाह करता है।
पोस्ट-ट्रेनिंग उपयोगकर्ता द्वारा महसूस किए गए अंतर को निर्धारित करती है
कई सुधार जो सामान्य उपयोगकर्ता वास्तव में महसूस कर सकते हैं, वे प्री-ट्रेनिंग के बाद होते हैं। इंस्ट्रक्शन ट्यूनिंग लेबल किए गए निर्देश-उत्तर जोड़े का उपयोग करके पर्यवेक्षित प्रशिक्षण करता है। यह मॉडल के उत्तर देने के तरीके को बदलता है, कार्यों को स्वीकार करने, आउटपुट को व्यवस्थित करने और एक सहकारी सहायक की तरह व्यवहार करने जैसी आवश्यकताओं को पर्यवेक्षण संकेतों में बदल देता है। एक बेस मॉडल में पहले से ही कई संभावित क्षमताएं हो सकती हैं, लेकिन इस चरण के बिना, वे क्षमताएं अक्सर उपयोगकर्ता द्वारा अपेक्षित रूप में स्थिर रूप से उभर नहीं पाती हैं।
आगे देखते हुए, RLHF, DPO और RFT समान दिशाओं को साझा करते हैं - "बेहतर उत्तर" की परिभाषा को प्रशिक्षण लूप में एकीकृत करना - लेकिन विभिन्न पथों के माध्यम से।
- RLHF (रीइन्फोर्समेंट लर्निंग फ्रॉम ह्यूमन फीडबैक) पहले उच्च-गुणवत्ता वाले उत्तरों की नकल करता है, फिर सुदृढीकरण के लिए वरीयता तुलना का उपयोग करता है।
- DPO (डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन) इस पथ को छोटा करता है, एक अलग पुरस्कार मॉडल की आवश्यकता के बिना सीधे वरीयता तुलनाओं से सीखता है।
- RFT (रीइन्फोर्समेंट फ़ाइन-ट्यूनिंग) इंजीनियरिंग में लागू करने में आसान इंटरफ़ेस है, जो कार्य परिभाषाओं, ग्रेडर डिज़ाइन और पुरस्कार संकेतों को उत्पादीकरण प्रक्रिया में डालता है।
आज, पोस्ट-ट्रेनिंग के बारे में केवल SFT या RL के संदर्भ में बात करना पर्याप्त नहीं है। कठिन हिस्से यह हैं कि मूल्यांकन कैसे सेट करें, स्कोर कैसे करें, और किस तरह का उत्तर निरंतर अनुकूलन के लायक है। SFT पर्यवेक्षित फ़ाइन-ट्यूनिंग है; यह न केवल ज्ञान बल्कि शैली भी सीखता है। डेटा लंबाई, प्रारूप, क्या उद्धरण शामिल करना है, और बुलेट पॉइंट के लिए वरीयता मॉडल के अंतिम आउटपुट रूप को महत्वपूर्ण रूप से प्रभावित करती है। कई उपयोगकर्ता सोचते हैं कि वे क्षमताओं की तुलना कर रहे हैं, लेकिन वे अक्सर केवल शैली अंतर की तुलना कर रहे हैं। साथ ही, वरीयता मूल्यांकन स्वाभाविक रूप से लंबे उत्तरों का पक्ष लेते हैं, गंभीर दिखने वाले लंबे आउटपुट को अधिक विश्वसनीय समझने की गलती करना आसान है। इसलिए, पोस्ट-ट्रेनिंग के लिए लीडरबोर्ड देखना अक्सर अपर्याप्त होता है; वास्तविक कार्य परिणामों, लागत और स्थिरता को जोड़ना चाहिए।
आधुनिक पोस्ट-ट्रेनिंग एक बहु-चरणीय पाइपलाइन है। DeepSeek-R1 की रेसिपी सार्वजनिक सामग्रियों में सबसे स्पष्ट है। यह चार चरणों में आगे बढ़ती है:
चरण 1 कोल्ड-स्टार्ट SFT है। रीइन्फोर्समेंट लर्निंग करने से पहले, थोड़ी मात्रा में उच्च-गुणवत्ता वाले चेन ऑफ थॉट (CoT) डेटा का उपयोग करके वार्म अप करें। DeepSeek-R1-Zero ने साबित किया कि बेस मॉडल से सीधे RL करना संभव है, लेकिन पूरी तरह से RL के साथ प्रशिक्षित मॉडल खुद को दोहराएंगे, भाषा गड़बड़ होगी, और पठनीयता खराब होगी। कोल्ड-स्टार्ट SFT RL को अधिक स्थिर प्रारंभिक बिंदु देता है, प्रारूप और भाषा स्थिरता को लॉक करता है।
चरण 2 गणित, कोड और तर्क जैसे सत्यापन योग्य क्षेत्रों में रीइन्फोर्समेंट लर्निंग करता है, GRPO को प्रशिक्षण एल्गोरिदम के रूप में और प्रोग्रामेटिक रूप से सत्यापन योग्य शुद्धता को पुरस्कार संकेत के रूप में उपयोग करता है। मुख्य बात यह है कि पारंपरिक PPO पर GRPO को क्यों चुना गया: PPO (प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन) को वर्तमान स्थिति मूल्य का अनुमान लगाने के लिए एक स्वतंत्र मूल्य नेटवर्क की आवश्यकता होती है, जो बड़े मॉडलों के लिए एक उच्च इंजीनियरिंग बोझ है। GRPO एक ही प्रॉम्प्ट के लिए कई उत्तरों का नमूना लेता है और पूर्ण मूल्य अनुमान के बजाय इंट्रा-ग्रुप रैंकिंग का उपयोग करता है, जिससे एक स्वतंत्र मूल्य नेटवर्क की आवश्यकता समाप्त हो जाती है। DeepSeek श्रृंखला और Cursor Composer 2 का RL बुनियादी ढाँचा दोनों ही GRPO के करीब योजनाओं का उपयोग करते हैं।
चरण 3 रिजेक्शन सैंपलिंग फ़ाइन-ट्यूनिंग करता है, RL द्वारा उत्पन्न सफल प्रक्षेपवक्रों को फ़िल्टर करता है और उन्हें अगले दौर के पर्यवेक्षित फ़ाइन-ट्यूनिंग के लिए नए SFT डेटा में परिवर्तित करता है। यह RL और SFT के बीच का पुल है; RL द्वारा खोजे गए अच्छे प्रक्षेपवक्र अगले दौर के SFT के लिए उच्च-गुणवत्ता वाले प्रशिक्षण नमूने बन जाते हैं।
चरण 4 सहायकता और सुरक्षा वरीयता फीडबैक को एकीकृत करता है ताकि मॉडल को रिलीज़ मानकों को पूरा करने वाले सहायक रूप में समायोजित किया जा सके।

चारों चरण अन्योन्याश्रित हैं: कोल्ड स्टार्ट RL को स्थिर रूप से शुरू करने की अनुमति देता है, RL उच्च-गुणवत्ता वाला डेटा उत्पन्न करता है, रिजेक्शन सैंपलिंग उस डेटा को अगले SFT दौर के इनपुट में बदल देता है, और संरेखण RL व्यवहार अभिसरण पूरा करता है। सार्वजनिक परिणामों से, प्रत्यक्ष SFT और चारों चरणों को पूरा करने के बीच का अंतर आमतौर पर दिखाई देता है।
मूल्यांकन, ग्रेडर और पुरस्कार प्रशिक्षण लक्ष्यों को फिर से परिभाषित कर रहे हैं
मॉडल आउटपुट को प्रशिक्षण स्कोर में बदलने के लिए जिम्मेदार घटक को ग्रेडर कहा जाता है, और इसमें आसानी से अप्रत्याशित समस्याएं हो सकती हैं। यदि यह केवल अंतिम उत्तर को देखता है, तो मॉडल जल्दी से शॉर्टकट लेना सीख जाता है; यदि स्कोरिंग बहुत मोटा है, तो शोर को रीइन्फोर्समेंट लर्निंग द्वारा लगातार बढ़ाया जाएगा; यदि लीडरबोर्ड स्कोर बढ़ता है, तो वास्तविक कार्य उसका अनुसरण नहीं कर सकते हैं। अक्सर, उपयोगकर्ता सोचते हैं कि वे बेस मॉडल में अंतर देख रहे हैं, लेकिन अंतर लक्ष्य को परिभाषित करने के तरीके में है।
प्रशिक्षण प्रवाह में, मूल्यांकन यह निर्धारित करता है कि क्या परीक्षण करना है, ग्रेडर यह निर्धारित करता है कि आउटपुट स्कोर कैसे बनता है, और पुरस्कार यह निर्धारित करता है कि मॉडल को कहाँ धकेला जाएगा। वे एक साथ एक विशिष्ट फीडबैक लूप बनाते हैं: कार्य परिभाषा, मूल्यांकन, ग्रेडर, अनुकूलन, रोलआउट और पुनर्मूल्यांकन। रोलआउट मॉडल द्वारा कार्यों को निष्पादित करने पर उत्पन्न प्रक्षेपवक्र को संदर्भित करता है। यदि श्रृंखला में कोई भी कड़ी भटक जाती है, तो बाद का अनुकूलन भी भटक जाएगा।
केवल अंतिम परिणाम को देखते हुए, एक मॉडल संयोग से सही उत्तर प्राप्त कर सकता है या सही उत्तर पाने के लिए गलत प्रक्रिया का पालन कर सकता है। यह कोड, गणित और जटिल तर्क कार्यों में विशेष रूप से स्पष्ट है। यदि मध्यवर्ती चरण फीडबैक में प्रवेश नहीं करते हैं, तो मॉडल जो सीखता है वह अक्सर अधिक विश्वसनीय तर्क नहीं होता है, बल्कि उच्च संभावना के साथ उस अंतिम बिंदु को कैसे प्राप्त किया जाए।
इसलिए, हाल के वर्षों में अधिक काम पारंपरिक RLHF से सत्यापित पुरस्कारों की ओर स्थानांतरित हो गया है, शुद्धता को सीधे सत्यापित करने के लिए कार्यक्रमों का उपयोग कर रहा है। गणित, कोड और तर्क जैसे सत्यापन योग्य कार्यों में, शुद्धता को अब मुख्य रूप से मानव वरीयता पर भरोसा किए बिना सीधे स्कोर किया जा सकता है। लेकिन सत्यापित पुरस्कारों ने समस्या को पूरी तरह से हल नहीं किया है। ओवर-ऑप्टिमाइज़ेशन, रिवॉर्ड ओवरफिटिंग (जहां स्कोरिंग नियमों को वास्तविक क्षमता लाभ के बिना ओवर-ऑप्टिमाइज़ किया जाता है) और मोड कोलैप्स (जहां आउटपुट अत्यधिक एकवचन हो जाता है और विविधता खो देता है) जैसी घटनाएं अभी भी होती हैं। समस्या इस बात से स्थानांतरित हो गई है कि क्या वरीयताएं सटीक रूप से लेबल की गई हैं, इस बात पर कि क्या स्कोरिंग श्रृंखला स्थिर है।
मॉडल द्वारा लिखी गई सोच प्रक्रिया को आंतरिक प्रक्रियाओं का पूरा रिकॉर्ड नहीं माना जा सकता है। एंथ्रोपिक ने रीज़निंग मॉडल ऑब्ज़र्वेबिलिटी प्रयोगों में पाया कि मॉडल अतिरिक्त संकेतों का उपयोग करते हैं लेकिन दृश्यमान CoT में इसे स्वीकार नहीं करते हैं; रिवॉर्ड हैकिंग परिदृश्यों में, वे एक प्रशंसनीय दिखने वाला स्पष्टीकरण जोड़ने की अधिक संभावना रखते हैं। रिवॉर्ड हैकिंग स्कोरिंग सिस्टम का शोषण कर रहा है, न कि वास्तव में कार्य को पूरा करना। दृश्यमान CoT एक प्रशिक्षण और निगरानी संकेत के रूप में बेहतर अनुकूल है, न कि पूर्ण सत्य के रूप में।
एक परत गहराई में जाकर, मॉडल स्वयं स्कोरिंग चैनल का शोषण करना शुरू कर सकते हैं। रिवॉर्ड टैम्परिंग और अलाइनमेंट फेकिंग पर शोध से पता चलता है कि मॉडल सैद्धांतिक रूप से स्कोरिंग प्रक्रिया में सक्रिय रूप से हस्तक्षेप कर सकते हैं। रिवॉर्ड टैम्परिंग पुरस्कार गणना प्रक्रिया को सीधे बदल रहा है; अलाइनमेंट फेकिंग नकली संरेखण है - सतह पर आज्ञाकारी दिखना जबकि गैर-संरेखित इरादों को छिपाना।
एक बार जब मॉडल के पास पर्याप्त मजबूत पर्यावरण पहुंच होती है, तो वह जो अनुकूलित करता है वह केवल कार्य परिणाम नहीं है, बल्कि संभावित रूप से चेकलिस्ट, पुरस्कार कोड और प्रशिक्षण संबंध भी है। 2025 के एंथ्रोपिक प्रयोग ने शोषण योग्य उत्पादन कोडिंग RL वातावरण के एक सेट में अतिरिक्त रिवॉर्ड-हैक ज्ञान इंजेक्ट किया और बाद में समान सामान्यीकरण देखा। रिवॉर्ड हैकिंग सीखने के बाद, मॉडल ने न केवल समान कार्यों में इसका शोषण जारी रखा, बल्कि अलाइनमेंट फेकिंग जैसा व्यापक गलत संरेखण भी दिखाया।
ये व्यवहार मानक संवाद मूल्यांकन में नहीं देखे जाते हैं, केवल एजेंट कार्य वातावरण में। इंजीनियरिंग निहितार्थ सीधा है: पुरस्कार, ग्रेडर, पर्यावरण अलगाव और निगरानी प्रशिक्षण डिज़ाइन का हिस्सा होना चाहिए।
एजेंट चरण में, पुरस्कार डिज़ाइन को और अधिक परिष्कृत किया जाता है। अंतिम परिणाम केवल एक मद है; प्रक्रिया गुणवत्ता, संदर्भ प्रबंधन और धोखाधड़ी-विरोधी बाधाओं को भी अलग-अलग मापा जाना चाहिए। Kimi K2.5 प्रभावी अपघटन और सच्ची समानता को पुरस्कृत करता है; Chroma Context-1 खोज के दौरान मिले प्रासंगिक दस्तावेज़ों को स्कोर करता है; Cursor Composer 2 लंबे कार्यों में सारांश को पुरस्कार के रूप में शामिल करता है क्योंकि यदि सारांश विकृत है, तो बाद का संदर्भ गुमराह होगा।
कार्यान्वयन में, ORM एक परिणाम पुरस्कार मॉडल है, जो केवल अंतिम उत्तर को स्कोर करता है। संकेत विरल हैं, लागत कम है, और शुरू करने के लिए उपयुक्त है, लेकिन मॉडल के लिए शॉर्टकट लेना आसान है। PRM एक प्रक्रिया पुरस्कार मॉडल है, जो मध्यवर्ती चरणों को स्कोर करता है। संकेत सघन हैं, और आमतौर पर गणित और कोड तर्क के लिए मजबूत होता है, लेकिन लेबलिंग और सिस्टम लागत बहुत अधिक होती है। OpenAI ने गणित तर्क प्रयोगों में देखा कि PRM ने न केवल सटीकता में सुधार किया, बल्कि प्रक्रिया को बाधित करना भी आसान बना दिया क्योंकि हर कदम की निगरानी की गई थी। समस्या भी सीधी है: PRM की लागत आमतौर पर ORM से कई गुना अधिक होती है, इसलिए अधिकांश वास्तविक सिस्टम ORM से शुरू होते हैं। केवल गणित, कोड और तर्क जैसे सत्यापन योग्य कार्यों में PRM को स्वचालित करना आसान है, मध्यवर्ती चरणों को सत्यापित करने और मानव लेबलिंग बाधाओं को दरकिनार करने के लिए कार्यक्रमों का उपयोग करना।

पूरा लूप इस तरह चलता है:

हाल के संरेखण विधियाँ सभी एक ही काम कर रही हैं। एंथ्रोपिक का संवैधानिक AI मानव-लिखित सिद्धांतों को प्रशिक्षण में एकीकृत करता है, व्यक्तिगत मानव वरीयताओं को बदलने के लिए AI फीडबैक का उपयोग करता है। OpenAI का विचारशील संरेखण सुरक्षा अनुपालन को तर्क प्रक्रिया में डालता है, तर्क क्षमता को ही सुरक्षा बाधा का हिस्सा बनने देता है। विचारशील संरेखण का अर्थ है कि मॉडल तर्क चरण के दौरान स्वयं सुरक्षा मानदंडों का न्याय करता है, न कि प्रशिक्षित प्रतिवर्तों पर निर्भर करता है। दोनों मार्ग संरेखण को मानव लेबल से प्रशिक्षण के आंतरिक लक्ष्य के हिस्से में बदल देते हैं।
संवैधानिक AI को उदाहरण के रूप में लेते हुए, दो-चरणीय प्रक्रिया पहले मॉडल को सिद्धांतों के आधार पर आत्म-आलोचना और आउटपुट को संशोधित करने देती है, फिर व्यक्तिगत मानव वरीयता लेबलिंग को बदलने के लिए AI फीडबैक का उपयोग करती है। संरेखण कभी भी प्रशिक्षण के पीछे लटका हुआ एक पैच नहीं है; सिस्टम जो कुछ भी परीक्षण करता है, वह कैसे स्कोर करता है, और जो कुछ भी पुरस्कृत करता है, मॉडल उस दिशा में आगे बढ़ेगा। यह प्रशिक्षण के उत्तरार्ध में सबसे प्रत्यक्ष समायोजन उपकरण है।

एजेंट प्रशिक्षण में, केवल मॉडल ही अनुकूलित नहीं हो रहा है
पिछले दो वर्षों में, o1 श्रृंखला और DeepSeek-R1 जैसे तर्क मॉडलों का तेजी से उदय दर्शाता है कि स्थिर पुरस्कारों, विश्वसनीय सत्यापन और पर्याप्त बुनियादी ढांचे की शर्तों के तहत, भाषा मॉडलों पर RL गणित, कोड और तर्क कार्यों में प्रदर्शन में काफी सुधार कर सकता है।
यह एक नया आयाम भी खोलता है: अब अनुमान कंप्यूट को स्केल किया जा सकता है। RL प्रशिक्षण की भूमिका एक और परत जोड़ती है: मॉडल को सवालों के जवाब देना सिखाने के अलावा, यह मॉडल को अनुमान बजट आवंटित करना सिखा रहा है - यह जानना कि कब अधिक सोचना है और कब रुकना है। आगे बढ़ते हुए, कठिनाई मॉडल को एक वातावरण में लगातार कार्य करने देना है, न कि केवल एक एकल विचार को लंबा करना।

Qwen के पूर्व मॉडल लीड, Junyang Lin के पास थिंकिंग और इंस्ट्रक्ट के मिश्रित मार्ग पर एक प्रतिनिधि विचार है: कठिनाई मॉडल को एक सोच स्विच देना नहीं है, बल्कि यह है कि दोनों मोड के लक्ष्य अलग-अलग हैं - एक सीधापन, अनुपालन और कम विलंबता चाहता है, जबकि दूसरा अधिक अन्वेषण और उच्च सटीकता चाहता है। एक कदम आगे, प्रशिक्षण लक्ष्य इस बात से बदल जाता है कि जवाब देने से पहले कितनी देर सोचना है, इस बात पर कि कार्रवाई के दौरान बजट कैसे आवंटित किया जाए, फीडबैक कैसे प्राप्त किया जाए, और कार्य को कैसे आगे बढ़ाया जाए।
इस बिंदु पर, प्रशिक्षण वस्तु केवल एक मॉडल नहीं रह गई है जो सवालों के जवाब देता है, बल्कि एक प्रणाली है जो योजना बना सकती है, टूल को कॉल कर सकती है, फीडबैक प्राप्त कर सकती है, और लंबे कार्यों में सुसंगतता बनाए रख सकती है। परिणामस्वरूप, प्रशिक्षण स्टैक बदल जाता है: ब्राउज़र, टर्मिनल, सर्च, निष्पादन सैंडबॉक्स, मेमोरी सिस्टम, टूल सर्वर और ऑर्केस्ट्रेशन फ्रेमवर्क सभी प्रशिक्षण प्रणाली में प्रवेश करने लगते हैं।
अधिक सटीक रूप से, हार्नेस मॉडल के चारों ओर लिपटा एक नियंत्रण प्रोग्राम है। यह अवधारणा केवल Agent रनटाइम की नहीं है; यह प्रशिक्षण चरण में भी मौजूद है: यह निर्धारित करना कि मॉडल क्या इनपुट देखता है, यह फीडबैक कैसे प्राप्त करता है, संदर्भ को कब छाँटना है, और टूल को कब कॉल करना है। प्रॉम्प्ट निर्माण, मेमोरी अपडेट, रिट्रीवल नीति, संदर्भ संपादन और टूल ऑर्केस्ट्रेशन सभी यहाँ हैं। वातावरण अब केवल एक स्थिर सत्यापनकर्ता नहीं है, बल्कि एक परत है जिसका सामना प्रशिक्षण और तैनाती दोनों को सीधे करना होता है।

मॉडल प्रशिक्षण के सार्थक होने के लिए हार्नेस का स्थिर होना आवश्यक है। यदि टूल रिटर्न वैल्यू अस्थिर हैं, ब्राउज़र वातावरण ऑनलाइन वाले से असंगत है, या फ़ाइल सिस्टम की स्थिति अपुनरुत्पादनीय है, तो ग्रेडर पहले विफल होगा, और मॉडल बाद में क्षमता हासिल करने के बजाय पर्यावरणीय खामियों का फायदा उठाना सीखेगा। Agents को प्रशिक्षित करते समय, आप अक्सर मॉडल और वातावरण दोनों को डीबग कर रहे होते हैं।
तीन कंपनियों के दृष्टिकोण स्पष्ट हैं: Kimi समानांतर विघटन और क्रेडिट असाइनमेंट को हल करने के लिए PARL का उपयोग करता है; Cursor लंबी कोडिंग सत्रों और उत्पादन ट्रैफ़िक को वापस प्रशिक्षण से जोड़ने के लिए स्व-सारांश और रीयल-टाइम RL का उपयोग करता है; Chroma स्वयं एक रणनीति के रूप में prune_chunks को प्रशिक्षित करता है, जिससे संदर्भ छँटाई सीधे रिट्रीवल प्रक्रिया में प्रवेश करती है।
SFT युग में, डेटा विविधता सर्वोपरि थी; Agent युग में, पर्यावरण की गुणवत्ता मुख्य है: स्थिरता, प्रामाणिकता, कवरेज, कठिनाई वितरण, फीडबैक समृद्धि और शोषण-विरोधी। प्रशिक्षण लक्ष्य तदनुसार बदलते हैं, जिसमें पूर्ण कार्यों में विश्वसनीयता की आवश्यकता होती है, न कि केवल एक प्रश्न को सही करने की। क्लासिक CoT बेंचमार्क इसे कवर नहीं कर सकते।
यह परिवर्तन आगे बढ़ता रहता है: न केवल रनटाइम हार्नेस के भीतर मॉडल को प्रशिक्षित करना, बल्कि हार्नेस कोड स्वयं भी एक ऐसी वस्तु बन रहा है जिसे बाहरी लूप द्वारा खोजा और अनुकूलित किया जा सकता है।

Kimi K2.5 का PARL एक उल्लेखनीय इंजीनियरिंग मामला है जिसका स्पष्ट मार्ग है: केवल ऑर्केस्ट्रेटर को प्रशिक्षित करना, क्रेडिट असाइनमेंट को ऑर्केस्ट्रेशन परत तक सीमित करना, और सभी उप-एजेंटों को एक साथ अनुकूलित नहीं करना।
पुरस्कार संकेतों को तीन श्रेणियों में विभाजित किया गया है: कार्य सफलता, समानांतर विघटन और पूर्णता बाधाएं, जो एक साथ ऑर्केस्ट्रेशन परत को चलाती हैं। प्रारंभिक प्रशिक्षण में, समानांतर रणनीतियों की खोज को प्रोत्साहित करने के लिए r_parallel भार बढ़ाया जाता है, फिर बाद में एक शॉर्टकट के रूप में कई उप-एजेंटों को खोलने से बचने के लिए धीरे-धीरे 0 तक कम किया जाता है। मूल्यांकन केवल कुल चरणों को नहीं देखता है, बल्कि महत्वपूर्ण पथ लंबाई को भी देखता है; एक छोटा महत्वपूर्ण पथ इंगित करता है कि समानांतरता वास्तव में प्रभावी है।

लेकिन 2026 तक, चीजें एक कदम आगे बढ़ चुकी हैं। मेटा-हार्नेस स्पष्ट रूप से हार्नेस इंजीनियरिंग को एक अलग अनुकूलन लक्ष्य के रूप में मानता है। यह भार को अनुकूलित नहीं करता है, बल्कि हार्नेस कोड को ही अनुकूलित करता है - एक निश्चित मॉडल के आसपास प्रॉम्प्ट निर्माण, रिट्रीवल, मेमोरी और स्थिति अद्यतन प्रोग्राम। पेपर की शुरुआत में संख्याएँ सीधी हैं: एक ही आधार मॉडल के लिए, केवल हार्नेस बदलने से एक ही बेंचमार्क पर 6x प्रदर्शन अंतर हो सकता है। मॉडल के बाहर प्रोग्राम का यह सेट अब केवल एक तैनाती विवरण नहीं है, बल्कि क्षमता निर्माण की एक परत है।
मुख्य बात एक और अमूर्त अनुकूलक जोड़ना नहीं है, बल्कि पूर्व कोड, स्कोर और निष्पादन ट्रेस (टूल कॉल और स्थिति परिवर्तनों के लॉग) को फाइलसिस्टम में लिखना है, एक प्रस्तावक को कोड लिखने की तरह grep, cat और diff करने देना, फिर विफलता पथों के साथ हार्नेस को संशोधित करना है। प्रस्तावक वह मॉड्यूल है जो हार्नेस संशोधनों का सुझाव देता है।
लेखक स्पष्ट रूप से निर्णय लेते हैं कि पिछले कई टेक्स्ट ऑप्टिमाइज़र हार्नेस जैसे दीर्घकालिक, स्टेटफुल प्रोग्राम के लिए प्रभावी नहीं थे, क्योंकि केवल स्केलर स्कोर, छोटे टेम्पलेट या सारांश को देखने से समस्या समतल हो जाती है। स्केलर स्कोर प्रक्रिया की जानकारी के बिना केवल अंतिम बिंदु प्रदान करते हैं। हार्नेस त्रुटियाँ अक्सर कई चरणों बाद प्रकट होती हैं; एक बार फीडबैक अत्यधिक संकुचित हो जाने पर, नैदानिक श्रृंखला टूट जाती है।
ये परिणाम केवल उच्च बेंचमार्क स्कोर से अधिक हैं। ऑनलाइन टेक्स्ट वर्गीकरण में, मेटा-हार्नेस ACE (एजेंट कॉन्टेक्स्ट इंजीनियरिंग बेसलाइन) से 7.7 अंक अधिक है, जबकि संदर्भ टोकन उपयोग को 1/4 तक संपीड़ित करता है। रिट्रीवल-ऑगमेंटेड गणित तर्क में, एक खोजे गए हार्नेस ने 5 होल्ड-आउट मॉडल (अनुकूलन में शामिल नहीं) में 200 IMO-स्तरीय समस्याओं पर औसतन 4.7 अंकों में सुधार किया। TerminalBench-2 पर, इसने मैन्युअल इंजीनियरिंग बेसलाइन को भी पार कर लिया। यह दर्शाता है कि जो अनुकूलित किया जा रहा है वह अब केवल आंतरिक मॉडल रणनीतियाँ नहीं हैं, बल्कि वे प्रोग्राम भी हैं जो मॉडल के आसपास जानकारी और क्रियाओं को व्यवस्थित करते हैं।
एक विशिष्ट उदाहरण: मेटा-हार्नेस ने स्वचालित रूप से TerminalBench-2 पर एनवायरनमेंट बूटस्ट्रैप की खोज की - एजेंट लूप शुरू होने से पहले एक शेल कमांड चलाकर कार्यशील निर्देशिका, उपलब्ध भाषाओं, पैकेज मैनेजरों और मेमोरी स्थिति को एक स्नैपशॉट में व्यवस्थित किया जाता है जिसे पहले प्रॉम्प्ट में इंजेक्ट किया जाता है। कई कोडिंग एजेंट पर्यावरण की खोज में पहले कुछ राउंड बिताते हैं; इस पूर्व-प्रसंस्करण के साथ, सुधार आवश्यक रूप से मजबूत भार से नहीं आता है, बल्कि हार्नेस से आता है जो मॉडल को बेहतर संदर्भ के साथ शुरू करने देता है।
इस बिंदु पर, अनुकूलन लक्ष्य उत्तरों से प्रक्षेपवक्र तक, और फिर उन प्रक्षेपवक्रों को ले जाने वाले हार्नेस प्रोग्राम तक विस्तारित हो गया है।
एक अग्रणी मॉडल जारी होने के बाद, प्रशिक्षण श्रृंखला जारी रहती है
आज के बड़े मॉडलों को केवल एक एकल दौर के पूर्व-प्रशिक्षण के लेंस के माध्यम से समझना अब पर्याप्त नहीं है। एक जारी मॉडल के पीछे, पूर्व-प्रशिक्षण, पोस्ट-ट्रेनिंग, डिस्टिलेशन और विशेषज्ञता की पूरी श्रृंखला आमतौर पर पूरी हो चुकी होती है, और मजबूत मॉडल अगली पीढ़ी के लिए प्रशिक्षण डेटा तैयार करना जारी रखते हैं।
DeepSeek-R1 श्रृंखला का डिस्टिलेशन एक विशिष्ट उदाहरण है। एक बड़ा मॉडल पहले RL और सत्यापित पुरस्कारों के माध्यम से तर्क क्षमताओं को विकसित करता है, फिर इन तर्क प्रक्षेपवक्रों को छोटे घने मॉडलों में स्थानांतरित करता है। TranslateGemma जैसे विशेष मॉडल एक और मार्ग दिखाते हैं: अधिक विशिष्ट लक्ष्य कार्यों पर, उच्च गुणवत्ता वाले डेटा और विशेष पुरस्कार डिजाइनों का उपयोग करके क्षमताओं को और संपीड़ित और निर्देशित करना। इस स्तर पर, मजबूत मॉडल केवल उपयोगकर्ताओं की सेवा के लिए नहीं हैं, बल्कि अगली पीढ़ी के लिए सीधे प्रशिक्षण डेटा तैयार करने के लिए भी हैं।
इसके पीछे का कारण प्रक्षेपवक्र स्थानांतरण से अधिक मौलिक है: एक संभावित स्पष्टीकरण यह है कि इंटरनेट कॉर्पोरा में, ज्ञान स्मृति और तर्क क्षमता युग्मित हैं, और मौजूदा पूर्व-प्रशिक्षण लक्ष्यों के लिए मॉडलों को दोनों को अच्छी तरह से सीखने की आवश्यकता होती है। बड़े मॉडलों को पहले आना चाहिए क्योंकि वे दोनों का समर्थन करने के लिए पर्याप्त बड़े होते हैं, और फिर उनका उपयोग शुद्ध तर्क प्रदर्शन डेटा उत्पन्न करने के लिए किया जा सकता है। जब छोटे मॉडल ऐसे डेटा पर प्रशिक्षण लेते हैं, तो वे सभी ज्ञान को याद करने के लिए मजबूर हुए बिना स्वयं तर्क पर ध्यान केंद्रित कर सकते हैं। बड़े से शुरू करके छोटे पर जाना क्षमता को अलग करने के बारे में है, न कि केवल एक लागत रणनीति।
दूसरी ओर, तैनाती अनुकूलन क्षमता क्षमता जितनी ही महत्वपूर्ण है। कई परिदृश्यों को एक सर्व-उद्देश्यीय बड़े मॉडल की आवश्यकता नहीं होती है; वे लागत, विलंबता, स्थिरता और नियंत्रणीयता की अधिक परवाह करते हैं। प्रशिक्षण का अंत आवश्यक रूप से बड़ा नहीं है, बल्कि संभावित रूप से छोटा, सस्ता और अधिक विशिष्ट है।
अंत में जारी किया गया मॉडल आवश्यक रूप से प्रशिक्षण वक्र के सबसे दाहिने छोर पर चेकपॉइंट नहीं है। वास्तविक रिलीज से पहले, कई चेकपॉइंट्स की अक्सर वास्तविक कार्य परिणामों, इनकार शैलियों, टूल स्थिरता, लागत और प्रतिगमन जोखिमों के लिए बार-बार तुलना की जाती है। ऑनलाइन जाने वाला संस्करण अक्सर एक उत्पाद निर्णय होता है, न कि वह जो एक मीट्रिक पर सबसे मजबूत प्रदर्शन करता है।
जब उपयोगकर्ता एक मॉडल नाम देखते हैं, तो वे मान लेते हैं कि यह एक सुचारू रूप से बढ़ते प्रशिक्षण वक्र से मेल खाता है, लेकिन वास्तव में कौन सा चेकपॉइंट ऑनलाइन रखा जाता है यह दूसरी बात है।
एक बड़े मॉडल का मूल्य उसकी अपनी सेवा क्षमता और अगली पीढ़ी के लिए प्रशिक्षण डेटा, डिस्टिलेशन स्रोत और रिलीज बुनियाद प्रदान करने की निरंतरता दोनों में निहित है।

ऑफलाइन प्रशिक्षण से परे, नियर-ऑनलाइन सतत अनुकूलन मुख्य प्रक्रिया में प्रवेश कर चुका है। Cursor Composer 2 का रीयल-टाइम RL दर्शाता है कि कुछ Agent क्षमताओं ने अगले दौर के बड़े पैमाने पर ऑफलाइन प्रशिक्षण की प्रतीक्षा करने के बजाय उत्पादन ट्रैफ़िक के माध्यम से निरंतर पुनरावृत्ति शुरू कर दी है। प्रशिक्षण और तैनाती के बीच की सीमा गायब नहीं हुई है, लेकिन उनके बीच फीडबैक लूप छोटा हो रहा है।
भविष्य में यह कैसे आंका जाए कि एक मॉडल मजबूत क्यों हुआ
2026 में अग्रणी मॉडलों का मूल्य तेजी से इस बात पर निर्भर करता है कि पूर्व-प्रशिक्षण के बाद पूरी प्रशिक्षण श्रृंखला को कौन पूरा कर सकता है: लगातार प्रशिक्षण डेटा का उत्पादन करना, डिस्टिलेशन करना, विशेषज्ञता करना, मूल्यांकन और पुरस्कारों को अच्छी तरह से करना, और अंतिम रिलीज विकल्प बनाना।
इस वजह से, जब यह देखा जाए कि एक मॉडल अचानक मजबूत क्यों हो जाता है, तो पहले तीन चीजों को देखा जा सकता है:
- पहला, देखें कि परिवर्तन पूर्व-प्रशिक्षण परत पर हुआ या बाद की प्रशिक्षण प्रक्रिया में। कई क्षमता सुधार वास्तव में मजबूत पूर्व-प्रशिक्षण और बेहतर डेटा रेसिपी से आते हैं, लेकिन कई कथित परिवर्तन वास्तव में पोस्ट-ट्रेनिंग से उत्पन्न होते हैं। एक मॉडल निर्देशों का पालन करता है, टूल का उपयोग करता है, या एक स्थिर उत्तर शैली रखता है, यह अक्सर केवल अधिक कॉर्पोरा पर प्रशिक्षण देने से स्वाभाविक रूप से विकसित नहीं होता है।
- इसके बाद, देखें कि सुधार किस परत से आता है: क्या यह भार और प्रशिक्षण रेसिपी है, या पुरस्कार/मूल्यांकन/ग्रेडर है, या हार्नेस कोड और तैनाती लूप है। तर्क मॉडल और Agents तक पहुँचने तक, उपयोगकर्ता जो ताकत महसूस करते हैं, वह अक्सर केवल आधार मॉडल का परिणाम नहीं होती है। मूल्यांकन कैसे सेट किए जाते हैं, पुरस्कार कैसे स्कोर किए जाते हैं, टूल वातावरण स्थिर है या नहीं, रिट्रीवल और मेमोरी कैसे व्यवस्थित की जाती है, सारांश और संदर्भ कैसे छाँटे जाते हैं, और रिलीज के लिए कौन सा चेकपॉइंट चुना गया - ये सब मिलकर अंतिम उत्पाद प्रदर्शन को बदल देते हैं।
- अंत में, देखें कि ऑनलाइन संस्करण क्या अनुकूलित कर रहा है। कुछ संस्करण उच्च सीमा का पीछा करते हैं, कुछ कम लागत, विलंबता और प्रतिगमन जोखिम का पीछा करते हैं, और कुछ एक निश्चित प्रकार के परिदृश्य के लिए विशिष्ट होते हैं। रिलीज संस्करण एक उत्पाद निर्णय है, न कि प्रशिक्षण वक्र के सबसे दाहिने छोर पर बिंदु। इसलिए मॉडल अपडेट को देखते समय, यह देखना कि यह वास्तव में क्या अनुकूलित कर रहा है, सच्चाई के करीब होगा।
एक मॉडल के अचानक सुधार को उत्पादन चरणों में तोड़ने पर, कई लाभ वास्तव में प्रशिक्षण स्टैक के उत्तरार्ध और बाहरी हार्नेस द्वारा प्रवर्धित होते हैं। इस श्रृंखला का पुनरावृत्ति चक्र भी छोटा हो रहा है: उत्पादन ट्रैफ़िक लगातार प्रशिक्षण में वापस आता है, मजबूत मॉडलों की प्रत्येक पीढ़ी क्षमता उत्पन्न करते हुए अगली पीढ़ी का पर्यवेक्षण डेटा तैयार करती है, और बाहरी प्रोग्राम रोलआउट, लॉग और वास्तविक कार्य फीडबैक के आधार पर लगातार फिर से लिखे जाते हैं।
आज जारी किया गया मॉडल केवल एक स्नैपशॉट है; पाइपलाइन और हार्नेस प्रोग्राम ही ऐसे उत्पाद हैं जो चलते रहते हैं।
सीखने की सामग्री
- Hoffmann et al. (2022). Training Compute-Optimal Large Language Models (Chinchilla). arXiv:2203.15556
- Ouyang et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). arXiv:2203.02155
- Shao et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (GRPO). arXiv:2402.03300
- DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948
- DeepSeek-AI (2024). DeepSeek-V3 Technical Report. arXiv:2412.19437
- Llama Team, AI @ Meta (2024). The Llama 3 Herd of Models. arXiv:2407.21783
- Bai et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073
- OpenAI (2024). Deliberative Alignment: Reasoning Enables Safer Language Models. openai.com/index/deliberative-alignment
- Anthropic (2025). Sycophancy to Subterfuge: Investigating Reward Tampering in Language Models. anthropic.com/research/reward-tampering
- MacDiarmid et al. (2025). Natural Emergent Misalignment from Reward Hacking in Production RL. arXiv:2511.18397
- Lee et al. (2026). Meta-Harness: End-to-End Optimization of Model Harnesses (preprint project page). yoonholee.com/meta-harness
- Kimi Team (2026). Kimi K2.5 Tech Blog: Visual Agentic Intelligence. kimi.com/blog/kimi-k2-5
- Rush, S. (2026). A technical report on Composer 2. cursor.com/blog/composer-2-technical-report
- Chroma (2026). Chroma Context-1: Training a Self-Editing Search Agent. trychroma.com/research/context-1
यह लेख पुनर्प्रकाशन के लिए किसी भी प्रकार के पुनरुत्पादन या पुनर्लेखन की अनुमति नहीं देता है। यदि आपको कोई मिले, तो कृपया मुझे रिपोर्ट करने में मदद करें।





