मॉडल राउटर आजकल हर जगह मौजूद हैं, लेकिन इनकी एक बुनियादी सीमा है। चाहे ये एडवांस्ड ह्यूरिस्टिक्स पर आधारित हों या किसी ऐसे छोटे मॉडल पर जो हर टर्न को पढ़कर तय करता हो कि कौन सा LLM इस्तेमाल करना है, एक राउटर हमेशा उस मॉडल से कम सक्षम होगा जिसका वह चुनाव कर रहा है। Replit Agent इसकी बजाय मॉडल को ही फैसला लेने देता है।
मुख्य एजेंट, यानी कोर लूप, अपने सब-एजेंट्स के टियर और एफर्ट (effort) का चुनाव खुद करता है और काम आगे बढ़ने के साथ अपने स्तर को भी ढाल लेता है। इस छूट के चलते, GPT-6 Astra रोज़मर्रा के इम्प्लीमेंटेशन का काम कम खर्चीले सब-एजेंट्स को सौंप देता है और खुद तय करता है कि उसके टोकन कहाँ खर्च करने लायक हैं। DeepSWE और Terminal-Bench दोनों पर, Replit Agent अकेले Astra के मुकाबले पैरेटो-एफिशिएंट (Pareto-efficient) है: कोई भी प्रकाशित Astra बेसलाइन ऐसा नहीं है जो कम लागत में ज्यादा स्कोर करता हो। यह साइडकिक आर्किटेक्चर — यानी एक लंबे समय तक चलने वाले वर्कर वाला वैसा ही सेटअप — को भी 11 और 16 पॉइंट्स से मात देता है।

एनिमेशन और फुटनोट्स के साथ पूरी पोस्ट पढ़ने के लिए देखें https://replit.com/blog/free-the-models
हम स्केफोल्डिंग कम क्यों करते हैं
हर नया मॉडल रिलीज़ होने पर हार्नेस में पहले से तय मान्यताएं गलत साबित हो जाती हैं।
जैसे-जैसे मॉडल लंबे समय तक चलने वाले (long-horizon) कामों में बेहतर होते जा रहे हैं, उन्हें हार्नेस लेयर पर उतनी स्केफोल्डिंग की ज़रूरत नहीं रहती। व्यवहार में हमने देखा है कि वे खुद-ब-खुद डेलिगेशन (delegation) की तरफ झुक रहे हैं: कॉन्टेक्स्ट मैनेजमेंट और पैरेलिज़्म के लिए सब-एजेंट्स का इस्तेमाल कर रहे हैं। हालिया सफलताएं, जिनमें Navier–Stokes भी शामिल है, कुछ हद तक फ्रंटियर मॉडल्स द्वारा संचालित एजेंट्स के समूहों (swarms) को आपस में जोड़ने से ही आई हैं [[1]](https://openai.com/index/navier-stokes-solution/)।
लेकिन फ्रंटियर एकसमान नहीं है। सबसे ताकतवर कोडिंग मॉडल ज़रूरी नहीं कि UI डिज़ाइन करने या Slides बनाने में भी उतना ही तेज़ हो, और न ही ईमेल लिखने में सबसे बेहतरीन हो।
इसलिए हम अपना हार्नेस इस तरह डिज़ाइन करते हैं कि हर मॉडल अपने तरीके से काम कर सके — उसे वही सुरक्षा घेरा (guardrails) मिले जिसकी अभी भी ज़रूरत है, और लक्ष्य हो न्यूनतम लागत में अधिकतम गुणवत्ता।
हर नया मॉडल हमें वापस उसी बिंदु पर ले जाता है जहाँ हम अपनी पक्की धारणाओं को फिर से परखें और उन तकनीकों के साथ तेज़ी से प्रयोग करें जो नई उभरती क्षमताओं पर टिकी हैं। तो मॉडल को आज़ाद करने का मतलब है उसे यह तय करने देना कि कितना गहरा सोचना है, काम कब सौंपना है, और किसे सौंपना है।

चित्र 1: तीन फैसले जो कोर लूप हर कदम पर लेता है।
डेलिगेशन के लिए कंपोज़ेबल प्रिमिटिव्स
जब हमने GPT-6 Astra [[2]](https://openai.com/index/gpt-6-astra) के साथ प्रयोग शुरू किए, तो पाया कि यह मॉडल काम बांटने में काफी माहिर है। GPT-6 परिवार OpenAI का पहला ऐसा परिवार भी है जो कैश को तोड़े बिना टर्न के बीच में ही एफर्ट बदलने की सुविधा देता है।
इन क्षमताओं का इस्तेमाल करने के लिए हमने हार्नेस के चार प्रिमिटिव्स को और निखारा। ये कोर लूप को हर कदम पर कुछ चुनिंदा विकल्प देते हैं: किस तरह का सब-एजेंट भेजना है, किस साइज़ और एफर्ट पर, क्या पहले से ब्रीफ किए गए एजेंट के पास वापस जाना है, और कितना गहरा सोचना है:
- डोमेन-अवेयर सब-एजेंट्स। एक सामान्य वर्कर के साथ-साथ हार्नेस विशेषज्ञ भी उपलब्ध कराता है: रीड-ओनली एक्सप्लोरर्स, ब्राउज़र टेस्टर्स, रिव्यूअर्स, और Slides व UI के लिए एक डिज़ाइन सब-एजेंट — हर एक का अपना मॉडल और टूलिंग है। फिलहाल हार्नेस ही तय करता है कि कौन-कौन से विशेषज्ञ मौजूद होंगे; कोर लूप तय करता है कि उनका इस्तेमाल कब और कैसे करना है।
- सब-एजेंट टियर्स और एफर्ट। Small, standard और large — हर एक लागत और क्षमता में पिछले से एक कदम ऊपर, और हर टियर के भीतर एक एफर्ट लेवल। ये दोनों हर सब-एजेंट पर लागू होते हैं, और कोर लूप हर बार डिस्पैच करते समय इनका चुनाव करता है। उदाहरण के लिए, सिर्फ नाम बदलने जैसा काम low effort वाले small को जाता है, जबकि किसी जिद्दी बग के लिए अनुमान लगाने का काम high effort वाले large को।
- रीयूज़ेबल सब-एजेंट्स। कोर लूप शुरुआत से शुरू करने की बजाय उस सब-एजेंट के पास वापस जा सकता है जिसे वह पहले ही ब्रीफ कर चुका है। पूरे सेशन के लिए कोई एक साइडकिक ज़िंदा नहीं रखा जाता: अलग-अलग प्रकार और टियर के कई सब-एजेंट्स तैयार रहते हैं, और कोर लूप चुनता है कि किसे जगाना है। OpenAI के नए मॉडल्स में कैश की लंबी लाइफटाइम इसकी लागत को कम रखती है।
- डायनामिक एफर्ट ट्यूनिंग। अब जब कुछ मॉडल्स पर टर्न के बीच एफर्ट बदलने से कैश बचा रहता है, तो हमने एक एस्कलेशन सिस्टम ट्रेन किया है जो हर कदम पर प्रगति की जांच करता है और काम की कठिनाई के हिसाब से एफर्ट तय करता है। राउटर के उलट, यह रिक्वेस्ट पर एक बार नहीं, बल्कि टर्न के बीच में चल रहे काम पर कार्रवाई करता है।
Astra और Fable 5.1 [[3]](https://www.anthropic.com/claude-fable-and-mythos-5-1) की कोड क्वालिटी ने हमें अपने कोड-रिव्यू सब-एजेंट का इस्तेमाल कम करने की छूट दी, बिना eval स्कोर में किसी गिरावट के। हमने पहले किसी मॉडल में इंजीनियरिंग का यह स्तर नहीं देखा था।
नए मॉडल खुद-ब-खुद काम बांटते हैं
Astra और Fable जैसे फ्रंटियर मॉडल्स की प्रति-टोकन लागत ज्यादा होती है, जिससे छोटे मॉडल्स के मुकाबले वे महंगे लगते हैं। हमने देखा है कि वे स्वाभाविक रूप से कम खर्चीले सब-एजेंट्स को काम सौंप देते हैं और अपने टोकन उन फैसलों के लिए बचाकर रखते हैं जहाँ उनकी असल में ज़रूरत होती है।
Replit Agent कभी कोर लूप को सब-एजेंट्स बनाने के लिए मजबूर नहीं करता। तालिका 1 दिखाती है कि प्रोडक्शन में तीन मॉडल इस फैसले को कैसे संभालते हैं:

तालिका 1: Replit Agent प्रोडक्शन में डेलिगेशन, हर मॉडल medium reasoning effort पर।
तीनों मॉडल काम बांटते हैं, लेकिन हर एक अपने अंदाज़ में। Medium effort पर, Fable मॉडल शायद ही कभी काम किसी सामान्य वर्कर को सौंपते हैं: वे रीड-ओनली एक्सप्लोरर्स और रिव्यूअर्स को भेजते हैं और इम्प्लीमेंटेशन खुद संभालते हैं। Astra पहला ऐसा मॉडल है जिसे हमने बिना कहे नियमित तौर पर सामान्य वर्कर्स को काम सौंपते देखा है, और एक बार किसी को ब्रीफ करने के बाद वह दोबारा शुरुआत करने की बजाय उसी के पास लौटना पसंद करता है। यह वापसी दर हर नई मॉडल जनरेशन के साथ बढ़ी है।

चित्र 2: 17 सितंबर 2026 का एक प्रोडक्शन टर्न, ट्रेस से लिया गया। कोर लूप ने एक एक्सप्लोरर, दो वर्कर्स और एक टेस्टर को डिस्पैच किया; अपने पांच वर्कर डिस्पैच में से तीन उन वर्कर्स के पास वापसी थीं जिन्हें वह पहले ही ब्रीफ कर चुका था।
नतीजे
हमने Replit Agent का मूल्यांकन Max मोड में किया — Astra को कोर लूप के रूप में इस्तेमाल करने वाली हमारी सर्वोच्च गुणवत्ता वाली सेटिंग — दो सॉफ्टवेयर इंजीनियरिंग बेंचमार्क पर: DeepSWE और Terminal-Bench। हमने दो बेसलाइन्स से तुलना की: mini-swe-agent में अकेला Astra, जैसा हर लीडरबोर्ड पर प्रकाशित है, और एक साइडकिक आर्किटेक्चर, जो बिल्कुल वैसा ही सेटअप है बस एक बदलाव के साथ: इसके सब-एजेंट प्रिमिटिव्स की जगह एक अकेला लंबे समय तक चलने वाला वर्कर है। हर चार्ट में प्रति-कार्य लागत के मुकाबले स्कोर दिखाया गया है, इसलिए सबसे कुशल सेटअप ऊपर बाईं ओर दिखते हैं।
DeepSWE v1.1 [[4]](https://deepswe.datacurve.ai/) पर, जो सक्रिय ओपन-सोर्स रिपॉज़िटरीज़ में लंबे समय तक चलने वाले बदलावों को परखता है, Replit Agent $2.11 प्रति कार्य की लागत पर 72% स्कोर करता है। Mini-swe-agent में low effort पर Astra 67% ($1.60) और xhigh effort पर 74% ($4.43) स्कोर करता है; साइडकिक आर्किटेक्चर 61% ($1.34) स्कोर करता है। Terminal-Bench 4.0 [[5]](https://www.tbench.ai/) उन बहु-चरणीय कामों को परखता है जो पूरी तरह शेल से किए जाते हैं। Replit Agent $2.53 प्रति कार्य पर 49% तक पहुंचता है, जबकि low effort पर Astra 42% ($2.25) और xhigh पर 60% ($5.86) स्कोर करता है। साइडकिक आर्किटेक्चर $1.84 पर 33% हासिल करता है।

Replit Agent दोनों बेंचमार्क पर साइडकिक आर्किटेक्चर को 11 और 16 पॉइंट्स से हराता है। साइडकिक की लागत कम है, लेकिन इसके बदले वह स्कोर का छठा हिस्से से लेकर एक-तिहाई तक गंवा देता है। अकेला Astra ज्यादा स्कोर तभी करता है जब ज्यादा खर्च करता है: इसकी बेहतरीन सेटिंग्स Replit Agent से 2 और 11 पॉइंट ऊपर हैं, लेकिन दोगुनी से भी ज्यादा लागत पर। कोई भी बेसलाइन लागत और स्कोर दोनों में जीत नहीं पाती। हमने Replit Agent को ठीक वैसे ही चलाया जैसे यह यूज़र्स को दिया जाता है, प्रॉम्प्टिंग या हार्नेस में कोई बदलाव नहीं किया गया।
हार्नेस डिज़ाइन का कड़वा सबक
हम इन नतीजों को Sutton के कड़वे सबक (bitter lesson) [[6]](http://www.incompleteideas.net/IncIdeas/BitterLesson.html) के एक उदाहरण के रूप में देखते हैं। एजेंट में इंसानी ज्ञान भरना短期 में मदद करता है, लंबे समय में ठहर जाता है, और आखिरकार उन सामान्य तरीकों से पीछे छूट जाता है जो कंप्यूटेशन के साथ स्केल होते हैं। एक सख्त हार्नेस मॉडल को एक ही तरीके से काम करने पर मजबूर करता है; एक कंपोज़ेबल हार्नेस उसे चुनने देता है। मॉडल जितने समझदार होते जाएंगे, हार्नेस को उनके लिए उतने कम फैसले लेने चाहिए।
अधिक निर्धारित (prescribed) आर्किटेक्चर के मुकाबले, यह तरीका हमें तीन फायदे देता है:
- यह मॉडल स्केलिंग लॉज़ पर दांव लगाता है। मॉडल की सूझबूझ पर निर्भर डेलिगेशन हर रिलीज़ के साथ बेहतर होता जाता है। अगली पीढ़ी के मॉडल्स के शुरुआती प्रीव्यू भी इसी रुझान को आगे बढ़ा रहे हैं।
- यह काम के हिसाब से ढलता है। छोटे काम के लिए मॉडल कुछ नहीं बनाता, सर्च के लिए एक एक्सप्लोरर, और जब बिल्ड स्वतंत्र हिस्सों में बंट जाता है तो एक पूरी टीम।
- यह बिना स्टोर किए रीयूज़ करता है। सब-एजेंट अपना कॉन्टेक्स्ट बनाए रखता है ताकि मॉडल चाहे तो वापस आ सके, और अगर मॉडल न चाहे तो कुछ भी स्टोर नहीं रहता।
Sutton के शब्दों में कहें तो हार्नेस को मॉडल को यह खोजने देना चाहिए कि काम कैसे करना है, न कि यह थोपना चाहिए कि हम इसे कैसे करते। मॉडल्स को आज़ाद करो।
आभार
Daniel Furman, Jacky Zhao, Vaibhav Kumar, Ed Sioufi और Michele Catasta द्वारा लिखित। James Austin, Toby Ho, Preeya Kirani, Zhen Li, Robin Newhouse, Devanshu Sen Pandey, Ibrahim Sheikh, Samuel Spitz, Peter Zhong और Replit की बाकी AI टीम को इस काम में उनके योगदान के लिए धन्यवाद। अगर आप Replit में AI पर काम करना चाहते हैं, तो मेरी टीम भर्ती कर रही है; pirroh@repl.it पर संपर्क करें।





