YouMind
Iniciar sesión

Libera los modelos: diseño de arnés en la frontera

@pirroh
INGLÉS29 sept 2026
237K
511
79
21
1.2K

TL;DR

Replit argumenta que los enrutadores de modelos rígidos limitan el rendimiento en comparación con dejar que los modelos de frontera seleccionen dinámicamente subagentes y niveles de esfuerzo. Su nuevo diseño de arnés logra la eficiencia de Pareto en puntos de referencia de codificación aprovechando la autonomía del modelo.

Los enrutadores de modelos están por todas partes hoy en día, pero tienen una limitación fundamental. Ya sea que se basen en heurísticas avanzadas o en un modelo pequeño que lee cada turno y decide qué LLM usar, un enrutador siempre será menos capaz que el modelo por el que está decidiendo. Replit Agent deja que sea el propio modelo quien decida.

El agente principal, o bucle central, elige el nivel y el esfuerzo de sus subagentes, y ajusta los suyos a medida que avanza la tarea. Con esa libertad, GPT-6 Astra delega las implementaciones rutinarias a subagentes más económicos y decide por sí mismo dónde vale la pena gastar sus tokens. Tanto en DeepSWE como en Terminal-Bench, Replit Agent es Pareto-eficiente frente a Astra por sí solo: ninguna línea base publicada de Astra cuesta menos y obtiene una puntuación más alta. También supera a una arquitectura sidekick —la misma configuración, pero con un único trabajador persistente— por 11 y 16 puntos.

Michele Catasta - inline image

Para ver la publicación completa con animaciones y notas al pie, visita https://replit.com/blog/free-the-models

Por qué usamos menos andamiaje

Cada lanzamiento de un modelo invalida suposiciones integradas en el harness.

A medida que los modelos mejoran en tareas de largo alcance, necesitan menos andamiaje en la capa del harness. En la práctica, hemos observado que tienden a delegar más por su cuenta: usan subagentes para gestionar el contexto y trabajar en paralelo. Avances recientes, entre ellos el de Navier-Stokes, surgieron en parte de coordinar enjambres de agentes impulsados por modelos frontier [[1]](https://openai.com/index/navier-stokes-solution/).

Pero la frontera es irregular. El modelo más potente programando no es necesariamente el mejor diseñando interfaces o creando slides, ni el más hábil redactando correos.

Por eso diseñamos nuestro harness para que cada modelo trabaje a su manera, con las barreras de seguridad que aún necesita y con la máxima calidad al menor costo posible como objetivo.

Cada nuevo modelo nos obliga a volver a probar lo que dábamos por sentado y a experimentar rápido con técnicas que aprovechan comportamientos emergentes. Liberar al modelo, entonces, significa dejarle decidir cuánto pensar, cuándo delegar trabajo y a quién entregárselo.

Michele Catasta - inline image

Figura 1: las tres decisiones que toma el bucle central en cada paso.

Primitivas componibles para la delegación

Cuando empezamos a experimentar con GPT-6 Astra [[2]](https://openai.com/index/gpt-6-astra), descubrimos que el modelo delega muy bien. La familia GPT-6 también es la primera de OpenAI que permite cambiar el nivel de esfuerzo a mitad de turno sin romper la caché.

Para aprovechar estas capacidades, refinamos cuatro primitivas del harness. Le dan al bucle central un conjunto reducido de opciones en cada paso: qué tipo de subagente enviar, con qué tamaño y esfuerzo, si volver a uno al que ya le dio instrucciones y cuánto pensar:

  • Subagentes especializados por dominio. Además de un trabajador general, el harness ofrece especialistas: exploradores de solo lectura, probadores de navegador, revisores y un subagente de diseño para slides e interfaces, cada uno con su propio modelo y herramientas. Por ahora, el harness sigue decidiendo qué especialistas existen; el bucle central decide cuándo y cómo usarlos.
  • Niveles y esfuerzo de los subagentes. Pequeño, estándar y grande, cada uno un escalón más arriba en costo y capacidad, además de un nivel de esfuerzo dentro de cada nivel. Ambos aplican a todos los subagentes, y el bucle central los elige en cada envío. Por ejemplo, un cambio de nombre mecánico va al nivel pequeño con bajo esfuerzo, mientras que generar hipótesis para un bug rebelde va al nivel grande con alto esfuerzo.
  • Subagentes reutilizables. El bucle central puede volver a un subagente al que ya le dio instrucciones en lugar de empezar de cero. No hay un único sidekick que se mantenga vivo durante toda la sesión: cualquier cantidad de subagentes permanece activa entre distintos tipos y niveles, y el bucle elige cuál despertar. Una mayor duración de la caché en los modelos más nuevos de OpenAI mantiene bajo el costo de hacerlo.
  • Ajuste dinámico del esfuerzo. Ahora que cambiar el esfuerzo a mitad de turno conserva la caché en algunos modelos, entrenamos un sistema de escalamiento que evalúa la trayectoria en cada paso y ajusta el esfuerzo a la dificultad de la tarea. A diferencia de un enrutador, actúa a mitad de turno sobre el trabajo en curso, no una sola vez sobre la solicitud.

La calidad del código de Astra y Fable 5.1 [[3]](https://www.anthropic.com/claude-fable-and-mythos-5-1) también nos permitió usar menos nuestro subagente de revisión de código, sin que bajaran nuestras puntuaciones en las evaluaciones. Nunca habíamos visto este nivel de calidad técnica en ningún modelo.

Los modelos más nuevos delegan por su cuenta

Los modelos frontier como Astra y Fable cuestan más por token, lo que los hace parecer poco económicos frente a los más pequeños. Hemos observado que delegan de forma natural en subagentes más baratos, reservando sus propios tokens para las decisiones que realmente los necesitan.

Replit Agent nunca obliga al bucle central a crear subagentes. La tabla 1 muestra cómo tres modelos toman esa decisión en producción:

Michele Catasta - inline image

Tabla 1: Delegación en producción de Replit Agent, cada modelo con esfuerzo de razonamiento medio.

Los tres modelos delegan, pero cada uno a su manera. Con esfuerzo medio, los modelos Fable rara vez le pasan trabajo a un trabajador general: envían exploradores de solo lectura y revisores, y se reservan la implementación. Astra es el primer modelo que hemos visto delegar habitualmente en trabajadores generales sin que se le pida, y una vez que le da instrucciones a uno, tiende a volver a él en lugar de empezar de cero. Esta tasa de retorno ha aumentado con cada generación de modelos.

Michele Catasta - inline image

Figura 2: Un turno en producción del 17 de septiembre de 2026, extraído del trace. El bucle central envió un explorador, dos trabajadores y un probador; de sus cinco envíos a trabajadores, tres fueron retornos a uno al que ya le había dado instrucciones.

Resultados

Evaluamos Replit Agent en modo Max, nuestra configuración de mayor calidad con Astra como bucle central, en dos benchmarks de ingeniería de software: DeepSWE y Terminal-Bench. Lo comparamos con dos líneas base: Astra por sí solo en mini-swe-agent, tal como se publicó en cada leaderboard, y una arquitectura sidekick, la misma configuración con un solo cambio: sus primitivas de subagentes reemplazadas por un único trabajador persistente. Cada gráfico representa la puntuación frente al costo por tarea, así que las configuraciones más eficientes quedan hacia la esquina superior izquierda.

En DeepSWE v1.1 [[4]](https://deepswe.datacurve.ai/), que prueba cambios de largo alcance en repositorios open-source activos, Replit Agent alcanza un 72 % con $2.11 por tarea. Astra en mini-swe-agent con esfuerzo bajo logra un 67 % con $1.60, y con esfuerzo xhigh un 74 % con $4.43; la arquitectura sidekick consigue un 61 % con $1.34. Terminal-Bench 4.0 [[5]](https://www.tbench.ai/) evalúa trabajos de varios pasos realizados completamente desde una shell. Replit Agent llega al 49 % con $2.53 por tarea, frente al 42 % con $2.25 de Astra con esfuerzo bajo y al 60 % con $5.86 con esfuerzo xhigh. La arquitectura sidekick se queda en un 33 % con $1.84.

Michele Catasta - inline image

Replit Agent supera a la arquitectura sidekick en ambos benchmarks, por 11 y 16 puntos. El sidekick cuesta menos, pero sacrifica entre un sexto y un tercio de la puntuación por ello. Astra por sí solo solo logra una puntuación más alta gastando más: sus mejores ajustes quedan 2 y 11 puntos por encima de Replit Agent, pero a más del doble de costo. Ninguna línea base gana en costo y puntuación a la vez. Ejecutamos Replit Agent exactamente como se entrega a los usuarios, sin modificar nada del prompting ni del harness.

La lección amarga del diseño de harnesses

Interpretamos estos resultados como un ejemplo de la lección amarga de Sutton [[6]](http://www.incompleteideas.net/IncIdeas/BitterLesson.html). Integrar conocimiento humano en un agente ayuda a corto plazo, se estanca a largo plazo y termina siendo superado por métodos generales que escalan con la computación. Un harness rígido obliga al modelo a trabajar de una única forma; uno componible le deja elegir. Cuanto más inteligentes sean los modelos, menos debería decidir el harness por ellos.

Frente a una arquitectura más predefinida, este enfoque nos aporta tres cosas:

  • Apuesta por las leyes de escalamiento de los modelos. La delegación que depende del criterio del modelo mejora con cada lanzamiento. Las primeras versiones preliminares de los modelos de próxima generación confirman la tendencia.
  • Se adapta a la tarea. El modelo no crea nada para una tarea pequeña, lanza un explorador para una búsqueda y arma un equipo cuando el trabajo se divide en partes independientes.
  • Reutiliza sin persistir. Un subagente conserva su contexto por si el modelo quiere recuperarlo, y nada persiste a menos que lo haga.

En palabras de Sutton, el harness debe permitir que el modelo descubra cómo ejecutar el trabajo, no imponerle cómo lo habríamos hecho nosotros. Libera los modelos.

Agradecimientos

Escrito por Daniel Furman, Jacky Zhao, Vaibhav Kumar, Ed Sioufi y Michele Catasta. Gracias a James Austin, Toby Ho, Preeya Kirani, Zhen Li, Robin Newhouse, Devanshu Sen Pandey, Ibrahim Sheikh, Samuel Spitz, Peter Zhong y al resto del equipo de IA de Replit por sus aportes a este trabajo. Si quieres trabajar en IA en Replit, mi equipo está contratando; escríbeme a pirroh@repl.it.

Referencias

  1. Sobre el problema del Premio del Milenio de Navier-Stokes
  2. Presentamos GPT-6 Astra
  3. Presentamos Claude Fable 5.1 y Claude Mythos 5.1
  4. DeepSWE v1.1
  5. Terminal-Bench 4.0
  6. La lección amarga
  7. Idiosincrasias en los modelos de lenguaje grandes
  8. Design Arena
  9. Resultados de Terminal-Bench 4.0, Artificial Analysis
Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales