Маршрутизатори моделей зараз усюди, але вони мають фундаментальне обмеження. Незалежно від того, чи базуються вони на складних евристичних алгоритмах, чи на невеликій моделі, яка аналізує кожен крок і обирає потрібну LLM, маршрутизатор завжди буде менш здатним за ту модель, яку він обирає. Replit Agent натомість дозволяє самій моделі ухвалювати рішення.
Головний агент, або основний цикл, сам визначає рівень та інтенсивність роботи своїх субагентів і коригує власні параметри в процесі виконання завдання. Маючи таку свободу, GPT-6 Astra делегує рутинну реалізацію дешевшим субагентам і сама вирішує, на що варто витрачати свої токени. Як на DeepSWE, так і на Terminal-Bench Replit Agent є Парето-ефективнішим порівняно з Astra, що працює самостійно: жоден опублікований бенчмарк Astra не демонструє нижчих витрат при вищих показниках. Він також перевершує архітектуру «напарника» (sidekick) — ту саму конфігурацію, але з одним довгоживучим воркером — на 11 та 16 балів відповідно.

Повну публікацію з анімаціями та примітками можна прочитати тут: https://replit.com/blog/free-the-models
Чому ми будуємо менше каркасів
Кожен новий реліз моделі спростовує припущення, закладені в основу робочого каркаса (harness).
Що краще моделі справляються з довгостроковими завданнями, то менше допоміжної інфраструктури їм потрібно на рівні каркаса. На практиці ми помітили, що вони дедалі більше схиляються до самостійного делегування: використовують субагентів для керування контекстом і паралельної роботи. Нещодавні прориви, зокрема розв'язання рівнянь Нав'є — Стокса, частково стали можливими саме завдяки координації роїв агентів на базі передових моделей [[1]](https://openai.com/index/navier-stokes-solution/).
Але межа технологій нерівна. Найпотужніша модель для написання коду не обов'язково найкраще проєктує інтерфейси чи створює презентації, як і не є лідером у написанні листів.
Тому ми проєктуємо наш каркас так, щоб кожна модель могла працювати по-своєму, маючи ті запобіжники, які їй ще потрібні, і прагнучи досягти максимальної якості за мінімальних витрат.
Кожна нова модель змушує нас переглядати те, в чому ми були абсолютно впевнені, й швидко експериментувати з підходами, що спираються на її нові властивості. Отже, «звільнити модель» означає дати їй змогу самій вирішувати, наскільки глибоко думати, коли передавати роботу і кому саме.

Рисунок 1: три рішення, які основний цикл ухвалює на кожному кроці.
Композиційні примітиви для делегування
Коли ми почали експериментувати з GPT-6 Astra [[2]](https://openai.com/index/gpt-6-astra), то виявили, що модель чудово справляється з делегуванням. Сімейство GPT-6 також стало першим від OpenAI, яке підтримує зміну інтенсивності міркувань посеред циклу без скидання кешу.
Щоб скористатися цими можливостями, ми вдосконалили чотири примітиви каркаса. Вони дають основному циклу невеликий набір варіантів на кожному кроці: якого субагента запустити, якого розміру та з якою інтенсивністю, чи повернутися до вже проінструктованого, і наскільки глибоко думати:
- Субагенти з урахуванням предметної області. Окрім універсального воркера, каркас пропонує спеціалістів: дослідників у режимі лише читання, тестувальників у браузері, рецензентів, а також субагента-дизайнера для презентацій та UI — кожен із власною моделлю та інструментами. Поки що каркас усе ще визначає, які саме спеціалісти доступні; а от коли і як їх використовувати — вирішує основний цикл.
- Рівні та інтенсивність субагентів. Малі, стандартні та великі — кожен наступний рівень дорожчий і потужніший, плюс налаштування інтенсивності міркувань у межах рівня. Це стосується кожного субагента, і основний цикл обирає параметри під час кожного запуску. Наприклад, механічне перейменування йде малому субагенту з низькою інтенсивністю, а генерування гіпотез для впертого багу — великому з високою.
- Багаторазові субагенти. Основний цикл може повернутися до вже проінструктованого субагента замість того, щоб починати все спочатку. Немає єдиного «напарника», який тримається активним протягом усієї сесії: будь-яка кількість субагентів різних типів і рівнів залишається «теплою», і цикл сам вирішує, кого розбудити. Довший час життя кешу в новіших моделях OpenAI допомагає тримати витрати на це під контролем.
- Динамічне налаштування інтенсивності. Оскільки зміна інтенсивності посеред циклу тепер зберігає кеш у деяких моделях, ми навчили систему ескалації, яка перевіряє траєкторію на кожному кроці та підбирає інтенсивність відповідно до складності завдання. На відміну від маршрутизатора, вона діє посеред процесу над поточною роботою, а не одноразово на етапі прийняття запиту.
Якість коду Astra та Fable 5.1 [[3]](https://www.anthropic.com/claude-fable-and-mythos-5-1) також дозволила нам рідше залучати субагента для код-рев'ю без жодного падіння оцінок на наших бенчмарках. Ми ще ніколи не бачили такого рівня інженерної якості від жодної моделі.
Новіші моделі делегують самостійно
Передові моделі, як-от Astra та Fable, коштують дорожче за токен, тому на тлі менших виглядають неекономно. Але ми помітили, що вони природно делегують завдання дешевшим субагентам, залишаючи власні токени для рішень, де вони дійсно потрібні.
Replit Agent ніколи не змушує основний цикл створювати субагентів. У таблиці 1 показано, як три моделі ухвалюють це рішення в продакшені:

Таблиця 1: Делегування в продакшені Replit Agent, кожна модель із середньою інтенсивністю міркувань.
Усі три моделі делегують, але кожна по-своєму. За середньої інтенсивності моделі Fable рідко передають роботу універсальному воркеру: вони запускають дослідників у режимі лише читання та рецензентів, а реалізацію залишають собі. Astra — перша відома нам модель, яка регулярно делегує завдання універсальним воркерам без прямої вказівки, і, проінструктувавши одного, зазвичай повертається до нього, а не починає заново. Цей показник повернення зростав із кожним поколінням моделей.

Рисунок 2: Продакшен-цикл від 17 вересня 2026 року, відтворений за трейсом. Основний цикл запустив дослідника, двох воркерів і тестувальника; з п'яти запусків воркерів три були поверненнями до вже проінструктованого.
Результати
Ми протестували Replit Agent у режимі Max — нашому найякіснішому налаштуванні з Astra як основним циклом — на двох бенчмарках із програмної інженерії: DeepSWE та Terminal-Bench. Порівнювали з двома базовими лініями: Astra окремо в mini-swe-agent (як опубліковано в кожному лідерборді) та архітектурою «напарника» (та сама конфігурація з однією зміною: її примітиви субагентів замінені на одного довгоживучого воркера). На кожному графіку відображено співвідношення балів і вартості за завдання, тож найефективніші конфігурації розташовані ближче до верхнього лівого кута.
На DeepSWE v1.1 [[4]](https://deepswe.datacurve.ai/), який перевіряє довгострокові зміни в активних open-source репозиторіях, Replit Agent набирає 72% за $2,11 на завдання. Astra в mini-swe-agent з низькою інтенсивністю показує 67% за $1,60, а з дуже високою (xhigh) — 74% за $4,43; архітектура «напарника» дає 61% за $1,34. Terminal-Bench 4.0 [[5]](https://www.tbench.ai/) тестує багатокрокову роботу, що виконується повністю через командний рядок. Replit Agent досягає 49% за $2,53 на завдання, проти 42% за $2,25 у Astra з низькою інтенсивністю та 60% за $5,86 з дуже високою. Архітектура «напарника» видає 33% за $1,84.

Replit Agent перевершує архітектуру «напарника» на обох бенчмарках — на 11 та 16 балів. «Напарник» коштує дешевше, але поступається за це від шостої до третини балів. Astra сама по собі набирає більше лише ціною вищих витрат: її найкращі налаштування випереджають Replit Agent на 2 та 11 балів, але коштують більш ніж удвічі дорожче. Жодна з базових ліній не виграє одночасно і за вартістю, і за балами. Ми запускали Replit Agent точно в тому вигляді, в якому він постачається користувачам, без жодних змін у промптах чи каркасі.
Гірка правда про дизайн каркасів
Ми розглядаємо ці результати як приклад «гіркої правди» Саттона [[6]](http://www.incompleteideas.net/IncIdeas/BitterLesson.html). Закладання людських знань в агента допомагає в короткостроковій перспективі, виходить на плато в довгостроковій і зрештою програє загальним методам, які масштабуються разом з обчислювальними потужностями. Жорсткий каркас змушує модель працювати одним способом; композиційний — дозволяє обирати. Що розумнішими стають моделі, то менше каркас має вирішувати за них.
Порівняно з більш регламентованою архітектурою, цей підхід дає нам три переваги:
- Він робить ставку на закони масштабування моделей. Делегування, яке спирається на «смак» самої моделі, покращується з кожним релізом. Ранні прев'ю моделей наступного покоління лише підтверджують цю тенденцію.
- Він адаптується до завдання. Для дрібної задачі модель не створює нічого, для пошуку — одного дослідника, а коли білд розпадається на незалежні частини — цілу команду.
- Він перевикористовує без збереження стану. Субагент тримає свій контекст на випадок, якщо модель захоче до нього повернутися, і нічого не зберігається, якщо цього не відбувається.
Мовою Саттона, каркас має дозволяти моделі самій знаходити спосіб виконання роботи, а не нав'язувати їй те, як це зробили б ми. Звільніть моделі.
Подяки
Автори: Daniel Furman, Jacky Zhao, Vaibhav Kumar, Ed Sioufi та Michele Catasta. Дякуємо James Austin, Toby Ho, Preeya Kirani, Zhen Li, Robin Newhouse, Devanshu Sen Pandey, Ibrahim Sheikh, Samuel Spitz, Peter Zhong та решті команди AI у Replit за внесок у цю роботу. Якщо ви хочете працювати над AI у Replit, моя команда шукає людей; пишіть на pirroh@repl.it.





