YouMind
Iniciar sessão

Liberte os modelos: design de harness na fronteira da IA

@pirroh
INGLÊS29/09/2026
237K
511
79
21
1.2K

TL;DR

A Replit argumenta que roteadores de modelos rígidos limitam o desempenho em comparação com a abordagem de deixar modelos de fronteira selecionarem dinamicamente subagentes e níveis de esforço. Seu novo design de harness alcança eficiência de Pareto em benchmarks de codificação ao aproveitar a autonomia do modelo.

Roteadores de modelos estão por toda parte hoje em dia, mas têm uma limitação fundamental. Não importa se são baseados em heurísticas avançadas ou em um modelo pequeno que lê cada turno e escolhe qual LLM usar: um roteador sempre será menos capaz do que o modelo pelo qual está escolhendo. O Replit Agent deixa o próprio modelo decidir.

O agente principal, ou loop central, escolhe a categoria e o esforço dos seus subagentes, ajustando os seus à medida que a tarefa avança. Com essa liberdade, o GPT-6 Astra delega implementações rotineiras para subagentes mais baratos e decide sozinho onde vale a pena gastar seus tokens. Tanto no DeepSWE quanto no Terminal-Bench, o Replit Agent é Pareto-eficiente em relação ao Astra isolado: nenhuma baseline publicada do Astra custa menos e pontua mais. Ele também supera uma arquitetura sidekick — a mesma configuração, mas com um único worker de longa duração — por 11 e 16 pontos.

Michele Catasta - inline image

Para ver a publicação completa, com animações e notas de rodapé, acesse https://replit.com/blog/free-the-models

Por que usamos menos scaffolding

Cada lançamento de modelo invalida premissas embutidas no harness.

Conforme os modelos ficam mais fortes em tarefas de longo horizonte, eles precisam de menos scaffolding na camada do harness. Na prática, observamos que eles tendem naturalmente a delegar mais por conta própria: usando subagentes para gerenciamento de contexto e paralelismo. Avanços recentes, incluindo Navier–Stokes, vieram em parte da coordenação de enxames de agentes movidos por modelos de fronteira [[1]](https://openai.com/index/navier-stokes-solution/).

Mas a fronteira é irregular. O modelo mais forte em código não é necessariamente o melhor para criar UIs ou montar Slides, nem o ideal para escrever e-mails.

Por isso, projetamos nosso harness para deixar cada modelo trabalhar do seu jeito, com as travas de segurança de que ainda precisa e tendo como meta qualidade ao menor custo possível.

Cada novo modelo nos obriga a retestar o que dávamos como certo e a experimentar rápido técnicas que aproveitam comportamentos emergentes. Libertar o modelo, portanto, significa deixá-lo decidir o quanto pensar, quando repassar trabalho e para quem repassá-lo.

Michele Catasta - inline image

Figura 1: as três decisões que o loop central toma a cada passo.

Primitivas combináveis para delegação

Quando começamos a testar o GPT-6 Astra [[2]](https://openai.com/index/gpt-6-astra), descobrimos que o modelo delega bem. A família GPT-6 também é a primeira da OpenAI a permitir mudanças de esforço no meio de um turno sem quebrar o cache.

Para aproveitar esses recursos, refinamos quatro primitivas do harness. Elas dão ao loop central um conjunto pequeno de escolhas a cada passo: que tipo de subagente acionar, com qual tamanho e esforço, se deve voltar a um que já foi instruído e o quanto pensar:

  • Subagentes especializados por domínio. Além de um worker geral, o harness oferece especialistas: exploradores somente leitura, testadores de navegador, revisores e um subagente de design para Slides e UI, cada um com seu próprio modelo e ferramentas. Por enquanto, o harness ainda define quais especialistas existem; o loop central decide quando e como usá-los.
  • Categorias e esforço dos subagentes. Pequeno, padrão e grande, cada um representando um degrau acima em custo e capacidade, além de um nível de esforço dentro da categoria. Ambos se aplicam a todo subagente, e o loop central escolhe essas opções a cada acionamento. Por exemplo, uma renomeação mecânica vai para o pequeno com baixo esforço, enquanto gerar hipóteses para um bug teimoso vai para o grande com alto esforço.
  • Subagentes reutilizáveis. O loop central pode voltar a um subagente que já instruiu, em vez de começar do zero. Não existe um único sidekick mantido vivo durante a sessão: qualquer número de subagentes fica "aquecido" entre tipos e categorias, e ele escolhe qual despertar. Um tempo de vida de cache maior nos modelos mais recentes da OpenAI mantém o custo dessa estratégia sob controle.
  • Ajuste dinâmico de esforço. Agora que mudar o esforço no meio do turno preserva o cache em alguns modelos, treinamos um sistema de escalonamento que avalia a trajetória a cada passo e ajusta o esforço à dificuldade da tarefa. Diferente de um roteador, ele age no meio do turno sobre o trabalho em andamento, e não apenas uma vez sobre a requisição.

A qualidade de código do Astra e do Fable 5.1 [[3]](https://www.anthropic.com/claude-fable-and-mythos-5-1) também nos permitiu usar menos o nosso subagente de revisão de código, sem queda nas pontuações das nossas evals. Nunca tínhamos visto esse nível de qualidade de engenharia em nenhum modelo antes.

Modelos mais novos delegam por conta própria

Modelos de fronteira como Astra e Fable custam mais por token, o que os faz parecer pouco econômicos perto de modelos menores. Observamos que eles delegam naturalmente para subagentes mais baratos, reservando seus próprios tokens para as decisões que realmente exigem sua capacidade.

O Replit Agent nunca força o loop central a gerar subagentes. A Tabela 1 mostra como três modelos lidam com essa decisão em produção:

Michele Catasta - inline image

Tabela 1: Delegação em produção no Replit Agent, com cada modelo em esforço de raciocínio médio.

Os três modelos delegam, mas cada um do seu jeito. Com esforço médio, os modelos Fable raramente passam trabalho para um worker geral: eles disparam exploradores somente leitura e revisores e guardam a implementação para si. O Astra é o primeiro modelo que vimos delegar rotineiramente para workers gerais sem receber essa instrução e, depois de orientar um deles, tende a voltar ao mesmo em vez de recomeçar. Essa taxa de retorno aumentou a cada geração de modelo.

Michele Catasta - inline image

Figura 2: Um turno em produção no dia 17 de setembro de 2026, extraído do trace. O loop central acionou um explorador, dois workers e um testador; das cinco chamadas a workers, três foram retornos a um worker que já havia sido instruído.

Resultados

Avaliamos o Replit Agent no modo Max, nossa configuração de maior qualidade, com o Astra como loop central, em dois benchmarks de engenharia de software: DeepSWE e Terminal-Bench. Comparamos com duas baselines: o Astra isolado no mini-swe-agent, conforme publicado em cada leaderboard, e uma arquitetura sidekick, a mesma configuração com uma única mudança: suas primitivas de subagente substituídas por um único worker de longa duração. Cada gráfico plota a pontuação contra o custo por tarefa, então as configurações mais eficientes ficam na parte superior esquerda.

No DeepSWE v1.1 [[4]](https://deepswe.datacurve.ai/), que testa alterações de longo horizonte em repositórios open-source ativos, o Replit Agent atinge 72% a US$ 2,11 por tarefa. O Astra no mini-swe-agent com esforço baixo marca 67% a US$ 1,60 e, com esforço xhigh, 74% a US$ 4,43; a arquitetura sidekick alcança 61% a US$ 1,34. O Terminal-Bench 4.0 [[5]](https://www.tbench.ai/) testa trabalhos em várias etapas feitos inteiramente via shell. O Replit Agent chega a 49% a US$ 2,53 por tarefa, contra 42% a US$ 2,25 do Astra com esforço baixo e 60% a US$ 5,86 com esforço xhigh. A arquitetura sidekick consegue 33% a US$ 1,84.

Michele Catasta - inline image

O Replit Agent supera a arquitetura sidekick nos dois benchmarks, por 11 e 16 pontos. O sidekick custa menos, mas abre mão de um sexto a um terço da pontuação por isso. O Astra isolado só pontua mais gastando mais: suas melhores configurações ficam 2 e 11 pontos acima do Replit Agent, custando mais que o dobro. Nenhuma das baselines vence simultaneamente em custo e pontuação. Rodamos o Replit Agent exatamente como ele é entregue aos usuários, sem nenhuma alteração no prompting ou no harness.

A lição amarga do design de harness

Lemos esses resultados como um exemplo da lição amarga de Sutton [[6]](http://www.incompleteideas.net/IncIdeas/BitterLesson.html). Embutir conhecimento humano em um agente ajuda no curto prazo, estagna no longo prazo e acaba sendo superado por métodos gerais que escalam com computação. Um harness rígido força o modelo a trabalhar de um único jeito; um combinável deixa o modelo escolher. Quanto mais inteligentes os modelos ficam, menos o harness deve decidir por eles.

Comparada a uma arquitetura mais prescritiva, essa abordagem nos garante três coisas:

  • Ela aposta nas leis de escala dos modelos. A delegação que depende do bom senso do modelo melhora a cada lançamento. Os primeiros previews de modelos da próxima geração confirmam a tendência.
  • Ela se adapta à tarefa. O modelo não gera nada para uma tarefa pequena, cria um explorador para uma busca e monta uma equipe quando o trabalho se divide em partes independentes.
  • Ela reutiliza sem persistir. Um subagente mantém seu contexto caso o modelo queira chamá-lo de volta, e nada persiste se isso não acontecer.

Nos termos de Sutton, o harness deve deixar o modelo descobrir como executar o trabalho, em vez de ditar como nós faríamos. Liberte os modelos.

Agradecimentos

Escrito por Daniel Furman, Jacky Zhao, Vaibhav Kumar, Ed Sioufi e Michele Catasta. Agradecimentos a James Austin, Toby Ho, Preeya Kirani, Zhen Li, Robin Newhouse, Devanshu Sen Pandey, Ibrahim Sheikh, Samuel Spitz, Peter Zhong e ao restante do time de IA da Replit pelas contribuições a este trabalho. Se você quer trabalhar com IA na Replit, minha equipe está contratando; entre em contato pelo e-mail pirroh@repl.it.

Referências

  1. Sobre o Problema do Prêmio Millennium de Navier–Stokes
  2. Apresentando o GPT-6 Astra
  3. Apresentando o Claude Fable 5.1 e o Claude Mythos 5.1
  4. DeepSWE v1.1
  5. Terminal-Bench 4.0
  6. A Lição Amarga
  7. Idiossincrasias em Modelos de Linguagem de Grande Escala
  8. Design Arena
  9. Resultados do Terminal-Bench 4.0, Artificial Analysis
Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais