YouMind
Iniciar sesión

Libera los modelos: diseño de arnés en la frontera

@pirroh
INGLÉS29 sept 2026
237K
511
79
21
1.2K

TL;DR

Replit argumenta que los enrutadores de modelos rígidos limitan el rendimiento en comparación con permitir que los modelos de frontera seleccionen dinámicamente subagentes y niveles de esfuerzo. Su nuevo diseño de arnés logra la eficiencia de Pareto en puntos de referencia de codificación aprovechando la autonomía del modelo.

Los model routers están por todas partes en este momento, pero tienen una limitación fundamental. Ya sea que se basen en heurísticas avanzadas o en un modelo pequeño que lee cada turno y elige qué LLM usar, un router siempre será menos capaz que el modelo por el que está decidiendo. Replit Agent deja que el modelo decida por sí mismo.

El agente principal, o core loop, elige el nivel y el esfuerzo de sus subagentes, y ajusta los propios a medida que avanza la tarea. Con esa libertad, GPT-6 Astra delega la implementación rutinaria a subagentes más económicos y decide por sí mismo dónde vale la pena gastar sus tokens. Tanto en DeepSWE como en Terminal-Bench, Replit Agent es Pareto-eficiente frente a Astra por sí solo: ninguna línea base publicada de Astra cuesta menos y obtiene una puntuación más alta. También supera a una arquitectura sidekick —la misma configuración, pero con un único worker de larga duración— por 11 y 16 puntos.

Michele Catasta - inline image

Para ver la publicación completa con animaciones y notas al pie, visita https://replit.com/blog/free-the-models

Por qué usamos menos scaffolding

Cada lanzamiento de un modelo invalida suposiciones que estaban integradas en el harness.

A medida que los modelos se vuelven más potentes para tareas de largo alcance, necesitan menos scaffolding en la capa del harness. En la práctica, hemos observado que tienden a delegar más por su cuenta: usan subagentes para gestionar el contexto y trabajar en paralelo. Avances recientes, entre ellos Navier–Stokes, surgieron en parte de coordinar enjambres de agentes impulsados por modelos frontier [[1]](https://openai.com/index/navier-stokes-solution/).

Pero la frontera es irregular. El modelo más potente para programar no necesariamente es el mejor diseñando interfaces o creando slides, ni el más hábil redactando correos.

Por eso diseñamos nuestro harness para que cada modelo trabaje a su manera, con las barreras de seguridad que todavía necesita y con la meta de lograr calidad al menor costo posible.

Cada nuevo modelo nos obliga a volver a probar lo que dábamos por sentado y a experimentar rápido con técnicas que aprovechan comportamientos emergentes. Liberar al modelo, entonces, significa dejarlo decidir cuánto pensar, cuándo delegar trabajo y a quién entregárselo.

Michele Catasta - inline image

Figura 1: las tres decisiones que toma el core loop en cada paso.

Primitivas componibles para la delegación

Cuando empezamos a experimentar con GPT-6 Astra [[2]](https://openai.com/index/gpt-6-astra), descubrimos que el modelo delega muy bien. La familia GPT-6 también es la primera de OpenAI que permite cambiar el nivel de esfuerzo a mitad de un turno sin romper la caché.

Para aprovechar estas capacidades, refinamos cuatro primitivas del harness. Le dan al core loop un conjunto reducido de opciones en cada paso: qué tipo de subagente enviar, con qué tamaño y esfuerzo, si retomar uno al que ya le dio instrucciones y cuánto pensar:

  • Subagentes especializados por dominio. Además de un worker general, el harness ofrece especialistas: exploradores de solo lectura, probadores de navegador, revisores y un subagente de diseño para slides e interfaces, cada uno con su propio modelo y herramientas. Por ahora, el harness sigue definiendo qué especialistas existen; el core loop decide cuándo y cómo usarlos.
  • Niveles y esfuerzo de los subagentes. Pequeño, estándar y grande, cada uno con un escalón más de costo y capacidad, además de un nivel de esfuerzo dentro de ese nivel. Ambos aplican a todos los subagentes, y el core loop los elige en cada envío. Por ejemplo, un cambio de nombre mecánico va al nivel pequeño con bajo esfuerzo, mientras que generar hipótesis para un bug persistente va al nivel grande con alto esfuerzo.
  • Subagentes reutilizables. El core loop puede volver a un subagente al que ya le dio instrucciones en lugar de empezar de cero. No hay un único sidekick que se mantenga vivo durante toda la sesión: cualquier cantidad de subagentes permanece activa entre distintos tipos y niveles, y el core loop elige cuál despertar. Una vida útil de caché más larga en los modelos más recientes de OpenAI mantiene bajo el costo de hacerlo.
  • Ajuste dinámico del esfuerzo. Ahora que cambiar el esfuerzo a mitad de turno conserva la caché en algunos modelos, entrenamos un sistema de escalamiento que evalúa la trayectoria en cada paso y ajusta el esfuerzo a la dificultad de la tarea. A diferencia de un router, actúa a mitad del turno sobre el trabajo en progreso, no una sola vez sobre la solicitud.

La calidad del código de Astra y Fable 5.1 [[3]](https://www.anthropic.com/claude-fable-and-mythos-5-1) también nos permitió usar menos nuestro subagente de revisión de código, sin que bajaran nuestras puntuaciones en las evaluaciones. Nunca habíamos visto este nivel de calidad de ingeniería en ningún modelo.

Los modelos más nuevos delegan por su cuenta

Los modelos frontier como Astra y Fable cuestan más por token, lo que los hace parecer poco económicos frente a los más pequeños. Hemos observado que delegan de forma natural en subagentes más baratos y reservan sus propios tokens para las decisiones que realmente los necesitan.

Replit Agent nunca obliga al core loop a crear subagentes. La Tabla 1 muestra cómo tres modelos manejan esa decisión en producción:

Michele Catasta - inline image

Tabla 1: Delegación en producción de Replit Agent, cada modelo con esfuerzo de razonamiento medio.

Los tres modelos delegan, pero cada uno a su manera. Con esfuerzo medio, los modelos Fable rara vez le pasan trabajo a un worker general: envían exploradores de solo lectura y revisores, y se quedan con la implementación. Astra es el primer modelo que hemos visto delegar de forma habitual en workers generales sin que se le indique, y una vez que le da instrucciones a uno, tiende a volver a él en lugar de empezar de cero. Esta tasa de retorno ha aumentado con cada generación de modelos.

Michele Catasta - inline image

Figura 2: Un turno en producción del 17 de septiembre de 2026, extraído del trace. El core loop envió un explorador, dos workers y un tester; de sus cinco envíos a workers, tres fueron retornos a un worker al que ya le había dado instrucciones.

Resultados

Evaluamos Replit Agent en modo Max, nuestra configuración de mayor calidad con Astra como core loop, en dos benchmarks de ingeniería de software: DeepSWE y Terminal-Bench. Comparamos contra dos líneas base: Astra por sí solo en mini-swe-agent, tal como se publicó en cada leaderboard, y una arquitectura sidekick, la misma configuración con un solo cambio: sus primitivas de subagentes reemplazadas por un único worker de larga duración. Cada gráfico muestra la puntuación frente al costo por tarea, así que las configuraciones más eficientes quedan hacia la esquina superior izquierda.

En DeepSWE v1.1 [[4]](https://deepswe.datacurve.ai/), que evalúa cambios de largo alcance en repositorios open source activos, Replit Agent alcanza un 72 % a $2.11 por tarea. Astra en mini-swe-agent con esfuerzo bajo logra un 67 % a $1.60, y con esfuerzo xhigh un 74 % a $4.43; la arquitectura sidekick llega al 61 % a $1.34. Terminal-Bench 4.0 [[5]](https://www.tbench.ai/) evalúa trabajo de múltiples pasos realizado completamente desde una shell. Replit Agent alcanza un 49 % a $2.53 por tarea, frente al 42 % a $2.25 de Astra con esfuerzo bajo y el 60 % a $5.86 con xhigh. La arquitectura sidekick logra un 33 % a $1.84.

Michele Catasta - inline image

Replit Agent supera a la arquitectura sidekick en ambos benchmarks, por 11 y 16 puntos. El sidekick cuesta menos, pero sacrifica entre un sexto y un tercio de la puntuación por ello. Astra por sí solo solo logra una puntuación más alta gastando más: sus mejores configuraciones quedan 2 y 11 puntos por encima de Replit Agent, pero a más del doble del costo. Ninguna línea base gana en costo y puntuación al mismo tiempo. Ejecutamos Replit Agent exactamente como se entrega a los usuarios, sin cambios en el prompting ni en el harness.

La lección amarga del diseño de harnesses

Interpretamos estos resultados como un ejemplo de la lección amarga de Sutton [[6]](http://www.incompleteideas.net/IncIdeas/BitterLesson.html). Integrar conocimiento humano en un agente ayuda a corto plazo, se estanca a largo plazo y eventualmente es superado por métodos generales que escalan con la computación. Un harness rígido obliga al modelo a trabajar de una sola forma; uno componible lo deja elegir. Cuanto más inteligentes sean los modelos, menos debería decidir el harness por ellos.

Comparado con una arquitectura más predefinida, este enfoque nos da tres ventajas:

  • Apuesta por las leyes de escalamiento de los modelos. La delegación que depende del criterio del modelo mejora con cada lanzamiento. Las versiones preliminares de los modelos de próxima generación confirman esta tendencia.
  • Se adapta a la tarea. El modelo no crea nada para una tarea pequeña, genera un explorador para una búsqueda y arma un equipo cuando un build se divide en partes independientes.
  • Reutiliza sin persistir. Un subagente conserva su contexto por si el modelo quiere retomarlo, y nada persiste a menos que eso ocurra.

En términos de Sutton, el harness debe permitir que el modelo descubra cómo ejecutar el trabajo, no imponerle cómo lo habríamos hecho nosotros. Libera los modelos.

Agradecimientos

Escrito por Daniel Furman, Jacky Zhao, Vaibhav Kumar, Ed Sioufi y Michele Catasta. Gracias a James Austin, Toby Ho, Preeya Kirani, Zhen Li, Robin Newhouse, Devanshu Sen Pandey, Ibrahim Sheikh, Samuel Spitz, Peter Zhong y al resto del equipo de IA de Replit por sus aportes a este trabajo. Si quieres trabajar en IA en Replit, mi equipo está contratando; escríbele a pirroh@repl.it.

Referencias

  1. Sobre el problema del Premio del Milenio de Navier–Stokes
  2. Presentamos GPT-6 Astra
  3. Presentamos Claude Fable 5.1 y Claude Mythos 5.1
  4. DeepSWE v1.1
  5. Terminal-Bench 4.0
  6. La lección amarga
  7. Particularidades en los modelos de lenguaje grandes
  8. Design Arena
  9. Resultados de Terminal-Bench 4.0, Artificial Analysis
Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales