Roteadores de modelos estão por toda parte hoje em dia, mas têm uma limitação fundamental. Não importa se são baseados em heurísticas avançadas ou em um modelo pequeno que lê cada turno e escolhe qual LLM usar: um roteador sempre será menos capaz do que o modelo que ele está escolhendo. O Replit Agent deixa o próprio modelo decidir.
O agente principal, ou loop central, escolhe a camada e o esforço dos seus subagentes, ajustando os seus próprios conforme a tarefa avança. Com essa liberdade, o GPT-6 Astra delega implementações rotineiras para subagentes mais baratos e decide por conta própria onde vale a pena gastar seus tokens. Tanto no DeepSWE quanto no Terminal-Bench, o Replit Agent é Pareto-eficiente em relação ao Astra sozinho: nenhuma baseline publicada do Astra custa menos e pontua mais. Ele também supera uma arquitetura sidekick — a mesma configuração, mas com um único worker de longa duração — por 11 e 16 pontos.

Para ver o post completo, com animações e notas de rodapé, acesse https://replit.com/blog/free-the-models
Por que usamos menos scaffolding
Cada lançamento de modelo invalida premissas embutidas no harness.
À medida que os modelos ficam mais fortes em tarefas de longo prazo, eles precisam de menos scaffolding na camada do harness. Na prática, observamos que eles tendem a delegar por conta própria: usando subagentes para gerenciamento de contexto e paralelismo. Avanços recentes, incluindo Navier–Stokes, vieram em parte da coordenação de enxames de agentes movidos por modelos de fronteira [[1]](https://openai.com/index/navier-stokes-solution/).
Mas a fronteira é irregular. O modelo mais forte em código não é necessariamente o melhor para projetar interfaces ou criar slides, nem o ideal para escrever e-mails.
Por isso, projetamos nosso harness para deixar cada modelo trabalhar do seu jeito, com as travas de segurança de que ainda precisa e tendo como meta a máxima qualidade pelo menor custo.
Cada novo modelo nos obriga a testar de novo aquilo que dávamos como certo e a experimentar rápido técnicas que aproveitam comportamentos emergentes. Libertar o modelo, então, significa deixá-lo decidir o quanto pensar, quando passar o trabalho adiante e para quem passá-lo.

Figura 1: as três decisões que o loop central toma a cada passo.
Primitivas combináveis para delegação
Quando começamos a testar o GPT-6 Astra [[2]](https://openai.com/index/gpt-6-astra), descobrimos que o modelo delega muito bem. A família GPT-6 também é a primeira da OpenAI a permitir mudanças de esforço no meio de um turno sem quebrar o cache.
Para aproveitar esses recursos, refinamos quatro primitivas do harness. Elas dão ao loop central um conjunto pequeno de escolhas a cada passo: que tipo de subagente acionar, com qual tamanho e esforço, se deve voltar a um que já foi instruído antes e o quanto pensar:
- Subagentes especializados por domínio. Além de um worker genérico, o harness oferece especialistas: exploradores somente leitura, testadores de navegador, revisores e um subagente de design para slides e UI, cada um com seu próprio modelo e ferramentas. Por enquanto, o harness ainda define quais especialistas existem; o loop central decide quando e como usá-los.
- Camadas e esforço dos subagentes. Pequeno, padrão e grande, cada um representando um degrau a mais em custo e capacidade, além de um nível de esforço dentro da camada. Ambos se aplicam a todo subagente, e o loop central os escolhe a cada acionamento. Por exemplo, uma renomeação mecânica vai para o pequeno com esforço baixo, enquanto gerar hipóteses para um bug teimoso vai para o grande com esforço alto.
- Subagentes reutilizáveis. O loop central pode voltar a um subagente que já instruiu, em vez de começar do zero. Não existe um único sidekick mantido vivo durante a sessão: qualquer número de subagentes fica "aquecido" entre tipos e camadas, e o loop escolhe qual acordar. Um tempo de vida maior do cache nos modelos mais recentes da OpenAI mantém o custo dessa estratégia sob controle.
- Ajuste dinâmico de esforço. Agora que mudar o esforço no meio do turno preserva o cache em alguns modelos, treinamos um sistema de escalonamento que avalia a trajetória a cada passo e ajusta o esforço à dificuldade da tarefa. Diferente de um roteador, ele age no meio do turno sobre o trabalho em andamento, e não apenas uma vez no momento da requisição.
A qualidade do código do Astra e do Fable 5.1 [[3]](https://www.anthropic.com/claude-fable-and-mythos-5-1) também nos permitiu usar menos o nosso subagente de revisão de código, sem queda nas pontuações das nossas avaliações. Nunca tínhamos visto esse nível de qualidade de engenharia em nenhum modelo.
Modelos mais novos delegam por conta própria
Modelos de fronteira como Astra e Fable custam mais por token, o que os faz parecer antieconômicos perto dos menores. Observamos que eles delegam naturalmente para subagentes mais baratos, reservando seus próprios tokens para as decisões que realmente exigem sua capacidade.
O Replit Agent nunca força o loop central a criar subagentes. A Tabela 1 mostra como três modelos lidam com essa decisão em produção:

Tabela 1: Delegação em produção no Replit Agent, cada modelo com esforço de raciocínio médio.
Os três modelos delegam, mas cada um do seu jeito. Com esforço médio, os modelos Fable raramente passam trabalho para um worker genérico: eles enviam exploradores somente leitura e revisores e guardam a implementação para si. O Astra é o primeiro modelo que vimos delegar rotineiramente para workers genéricos sem receber essa instrução e, depois de preparar um deles, tende a voltar ao mesmo em vez de recomeçar. Essa taxa de retorno aumentou a cada geração de modelo.

Figura 2: Um turno em produção no dia 17 de setembro de 2026, extraído do trace. O loop central acionou um explorador, dois workers e um testador; das cinco chamadas a workers, três foram retornos a um worker que já havia sido instruído.
Resultados
Avaliamos o Replit Agent no modo Max, nossa configuração de maior qualidade com o Astra como loop central, em dois benchmarks de engenharia de software: DeepSWE e Terminal-Bench. Comparamos com duas baselines: o Astra sozinho no mini-swe-agent, conforme publicado em cada leaderboard, e uma arquitetura sidekick, a mesma configuração com uma única mudança: suas primitivas de subagente substituídas por um único worker de longa duração. Cada gráfico relaciona pontuação e custo por tarefa, então as configurações mais eficientes ficam no canto superior esquerdo.
No DeepSWE v1.1 [[4]](https://deepswe.datacurve.ai/), que testa mudanças de longo prazo em repositórios open-source ativos, o Replit Agent atinge 72% a US$ 2,11 por tarefa. O Astra no mini-swe-agent com esforço baixo marca 67% a US$ 1,60 e, com esforço xhigh, 74% a US$ 4,43; a arquitetura sidekick marca 61% a US$ 1,34. O Terminal-Bench 4.0 [[5]](https://www.tbench.ai/) testa trabalhos de múltiplas etapas feitos inteiramente via shell. O Replit Agent chega a 49% a US$ 2,53 por tarefa, contra 42% a US$ 2,25 do Astra com esforço baixo e 60% a US$ 5,86 com esforço xhigh. A arquitetura sidekick alcança 33% a US$ 1,84.

O Replit Agent supera a arquitetura sidekick nos dois benchmarks, por 11 e 16 pontos. O sidekick custa menos, mas abre mão de um sexto a um terço da pontuação por isso. O Astra sozinho só pontua mais gastando mais: suas melhores configurações ficam 2 e 11 pontos acima do Replit Agent, mas custam mais que o dobro. Nenhuma das baselines vence em custo e pontuação ao mesmo tempo. Rodamos o Replit Agent exatamente como ele é entregue aos usuários, sem nenhuma alteração no prompting ou no harness.
A lição amarga do design de harness
Lemos esses resultados como um exemplo da lição amarga de Sutton [[6]](http://www.incompleteideas.net/IncIdeas/BitterLesson.html). Embutir conhecimento humano em um agente ajuda no curto prazo, estagna no longo prazo e acaba sendo superado por métodos gerais que escalam com computação. Um harness rígido força o modelo a trabalhar de um único jeito; um combinável deixa o modelo escolher. Quanto mais inteligentes os modelos ficam, menos o harness deve decidir por eles.
Comparada a uma arquitetura mais prescritiva, essa abordagem nos garante três coisas:
- Ela aposta nas leis de escala dos modelos. A delegação que depende do bom senso do modelo melhora a cada lançamento. As prévias iniciais dos modelos de próxima geração confirmam a tendência.
- Ela se adapta à tarefa. O modelo não cria nada para uma tarefa pequena, aciona um explorador para uma busca e monta uma equipe quando o trabalho se divide em partes independentes.
- Ela reutiliza sem persistir. Um subagente mantém seu contexto caso o modelo queira chamá-lo de volta, e nada persiste se isso não acontecer.
Nos termos de Sutton, o harness deve deixar o modelo descobrir como executar o trabalho, em vez de ditar como nós faríamos. Liberte os modelos.
Agradecimentos
Escrito por Daniel Furman, Jacky Zhao, Vaibhav Kumar, Ed Sioufi e Michele Catasta. Agradecimentos a James Austin, Toby Ho, Preeya Kirani, Zhen Li, Robin Newhouse, Devanshu Sen Pandey, Ibrahim Sheikh, Samuel Spitz, Peter Zhong e ao restante do time de IA da Replit pelas contribuições a este trabalho. Se você quer trabalhar com IA na Replit, meu time está contratando; entre em contato pelo e-mail pirroh@repl.it.





