El método manual
Cada laboratorio importante se ha reestructurado silenciosamente en torno a la misma idea: un bucle que sigue funcionando después de que dejas de escribir. Esta es la guía de campo de cómo funcionan realmente los bucles al 25 de julio de 2026, en Claude, GPT, Gemini, Grok, Muse Spark de Meta, Mira y la ola de pesos abiertos, con cada afirmación respaldada por fuentes.
Observa a alguien usando IA en el trabajo y generalmente verás el mismo ritual. Escribes una solicitud. Esperas. Lees la respuesta. Identificas los problemas. Explicas los problemas. Esperas de nuevo. Pegas el resultado en otro lado. Vuelves al día siguiente y lo haces todo de nuevo, desde cero.
Aquí está la parte incómoda: ese ritual ES un bucle. Preguntar, verificar, corregir, repetir. La única diferencia entre eso y lo que ahora ofrecen los laboratorios es quién gira la manivela. Cuando lo haces manualmente, tú eres el disparador, la memoria, el verificador y la condición de parada, y eres costoso.
Durante el año pasado, todos los laboratorios serios de IA convergieron en la misma solución: mover la manivela dentro de la máquina. Anthropic publica una taxonomía oficial de bucles para Claude. OpenAI reconstruyó ChatGPT en torno a un modo de trabajo que ejecuta trabajos de múltiples pasos por sí solo. Google vende bucles de investigación que alquilas por tarea. Meta entrenó su modelo Muse Spark específicamente para orquestar flotas de subagentes. Incluso el actor más pequeño en esta historia, una startup de dos personas con un bot de Telegram llamado Mira, en realidad está vendiendo bucles a personas que nunca abrirán una terminal.
Y el terreno sigue moviéndose mientras escribo esto. Solo en los siete días anteriores a esta actualización: Anthropic lanzó un nuevo Opus construido para el trabajo agéntico cotidiano, Alibaba previsualizó un Qwen de 2.4 billones de parámetros, y el modelo de peso abierto más grande jamás lanzado está a unas 48 horas de publicar sus pesos.
El resultado es el cambio silencioso más grande en cómo se usa esta tecnología desde que aparecieron las interfaces de chat: la unidad de trabajo ya no es el prompt. Es el bucle, un ciclo de trabajo que continúa hasta que se cumple una condición que definiste.
Esta pieza es la versión larga de esa historia. Qué es realmente un bucle, sin exageraciones. Cómo se ve la pila de bucles de cada laboratorio ahora mismo, incluidos los modelos que no existían hace un mes. Qué funciona realmente, que resulta ser sorprendentemente consistente en todos los proveedores. Y los modos de fallo y costos que las publicaciones de lanzamiento no mencionan.
Una nota sobre el método, porque el discurso sobre IA está saturado de afirmaciones sin fundamento: todo lo que sigue está basado en la documentación y anuncios de los propios laboratorios, o en evaluaciones independientes nombradas, verificadas en vivo durante la semana que terminó el 25 de julio de 2026. Cuando un número es auto-reportado por un proveedor, lo digo. Cuando algo no está verificado o sigue siendo una vista previa, también lo digo. Lista completa de fuentes al final.
Parte 1: Qué es realmente un bucle
Quita la jerga y un bucle son cuatro tiempos más una razón para detenerse.
El equipo de Claude Code de Anthropic, que publicó lo más parecido a una definición canónica en este campo, lo resume en una línea: los bucles son "agentes que repiten ciclos de trabajo hasta que se cumple una condición de parada". La propia guía de agentes de OpenAI dice lo mismo en lenguaje de ingeniería: "Cada enfoque de orquestación necesita el concepto de una 'ejecución', típicamente implementada como un bucle que permite a los agentes operar hasta que se alcanza una condición de salida", donde las condiciones de salida incluyen un resultado final, un error o un número máximo de turnos.
Los cuatro tiempos, en lenguaje sencillo:
- Disparador. Algo inicia la ejecución. Tú, un horario, una alerta, una nueva solicitud de extracción, un correo electrónico que llega.
- Trabajo. El modelo reúne contexto y realiza una acción con herramientas: lee los archivos, ejecuta la consulta, redacta el mensaje, edita el código.
- Verificación. El resultado se verifica contra algo real. Las pruebas pasan o fallan. El número coincide con la fuente. Un segundo modelo califica el borrador según tus criterios.
- Repetir o detener. Si la verificación falla, el bucle vuelve a comenzar con lo que aprendió. Si la verificación pasa, o se alcanza un límite, se detiene.
Ese es todo el truco. Un prompt es una sola pasada por los tiempos dos y tres, haciendo tú el tiempo tres en tu cabeza. Un bucle es lo mismo, pero con la verificación y la repetición delegadas a la máquina, más dos barreras de seguridad: una condición de parada para que no pueda ejecutarse para siempre, y un presupuesto para que no pueda gastar para siempre.
El reparto de apoyo
Alrededor de esos cuatro tiempos, cada pila de bucles seria incluye las mismas cinco piezas de apoyo, sea cual sea el nombre que les dé el proveedor:
- Memoria. Notas que sobreviven entre ejecuciones, para que la ejecución cuarenta sepa lo que aprendió la ejecución uno.
- Estado. Dónde se encuentra actualmente el bucle: qué está hecho, qué falló, qué sigue.
- Verificador. Lo que decide si es "suficientemente bueno". La decisión de diseño más importante que tomarás.
- Condición de parada. "Pruebas pasan", "la cola está vacía", "detener después de cinco intentos", "son las 9 a.m. y el resumen se envió".
- Medidor de costos. Tokens y dólares por ciclo, porque los bucles multiplican todo lo que tocan, incluida tu factura.
Los cuatro tipos de bucle
Vale la pena aprender la taxonomía de Anthropic porque se aplica claramente a los productos de todos los demás proveedores, aunque los nombres difieran. Su equipo clasifica los bucles por lo que delegas:
- Bucles basados en turnos. Tú preguntas, el agente hace un ciclo (reunir, actuar, verificar, responder), tú revisas, preguntas de nuevo. Tú sigues siendo la condición de parada. Aquí es donde todos empiezan, y Anthropic señala que cada prompt ya ejecuta este micro-bucle internamente.
- Bucles basados en objetivos. Delegas la condición de parada. Defines cómo se ve el "completado", y el agente itera hasta llegar allí o alcanzar un límite de turnos. En Claude Code esto es literalmente un comando /goal, y cada vez que el modelo intenta detenerse, "un modelo evaluador verifica tu condición y lo envía de vuelta al trabajo hasta que se cumple el objetivo". Los criterios deterministas funcionan mejor: pruebas pasadas, puntuación superada, lista de verificación completada.
- Bucles basados en tiempo. Delegas el disparador. El bucle se ejecuta en un intervalo o un horario y reacciona a lo que cambió: resumir Slack cada mañana, verificar la solicitud de extracción hasta que la CI pase.
- Bucles proactivos. Delegas el prompt mismo. Un evento o un horario inicia la ejecución sin intervención humana en tiempo real: los nuevos informes de errores se clasifican a medida que llegan, las dependencias se actualizan semanalmente, y cada tarea termina cuando se cumple su propio objetivo.
Mantén esa escalera en tu cabeza (delegar la verificación, luego la condición de parada, luego el disparador, luego el prompt) y el resto de este artículo es solo ver a siete proveedores escalarla desde diferentes direcciones.
Parte 2: El estado actual, en una instantánea
Antes del recorrido laboratorio por laboratorio, una orientación, porque la frontera se movió increíblemente rápido en las cinco semanas anteriores a este artículo: Grok 4.5 se lanzó el 8 de julio, Muse Spark 1.1 de Meta y GPT-5.6 de OpenAI se lanzaron ambos el 9 de julio, Thinking Machines lanzó su primer modelo el 15 de julio, Kimi K3 de Moonshot llegó el 16 de julio, Alibaba previsualizó Qwen3.8-Max el 19 de julio, y Anthropic lanzó Claude Opus 5 el 24 de julio, el día anterior a esta actualización.
Para una métrica neutral, el evaluador independiente Artificial Analysis puntúa la capacidad general en su Índice de Inteligencia. Según la instantánea de esta semana (v4.1), la parte superior publicada de la tabla muestra:
- Claude Fable 5 (Anthropic): 59.9
- GPT-5.6 Sol Max (OpenAI): 58.9
- Kimi K3 (Moonshot, pesos abiertos inminentes): 57.1, cuarto en general
- Con Claude Opus 4.8, Grok 4.5, Muse Spark 1.1, GLM-5.2 y el resto del campo por debajo
Dos advertencias que merecen su espacio. Claude Opus 5 tiene un día de antigüedad al momento de escribir esto y aún no está indexado. Y un índice compuesto único no puede capturar el trabajo agéntico de largo horizonte, que es lo que los bucles realmente hacen, así que cuando un laboratorio ha publicado resultados específicos para agentes, los cito en la sección de ese laboratorio, marcados como auto-reportados cuando lo son.
Dos cosas para notar de todos modos. La parte superior de la tabla ahora tiene una diferencia de menos de tres puntos, lo que significa: para fines de construcción de bucles, la elección del modelo dentro de esa banda importa menos que el bucle que lo rodea. Y un modelo de peso abierto ahora se sienta dentro de esa banda por primera vez.
Claude: el bucle como primitiva de primera clase
Los modelos. Claude Fable 5, lanzado el 9 de junio de 2026, es el modelo más capaz de Anthropic y el que está más explícitamente construido para este estilo de trabajo. El propio marco de Anthropic es que, ejecutado dentro de un arnés como Claude Code, puede "trabajar durante días seguidos: planificando a través de etapas, delegando en subagentes y verificando su propio trabajo". Su pensamiento es adaptativo y siempre está activo, ajustado por una configuración de esfuerzo, con una ventana de contexto de un millón de tokens. Todavía encabeza el índice independiente anterior. Su hermano Mythos 5, lanzado junto con él, es el especialista que Anthropic califica como el más fuerte en tareas de ciberseguridad.
La novedad de esta semana es Claude Opus 5, lanzado el 24 de julio: Anthropic lo describe como cercano a la inteligencia fronteriza de Fable 5 a la mitad del precio ($5 por millón de tokens de entrada y $25 de salida), el nuevo estado del arte en evaluaciones de trabajo de conocimiento como GDPval-AA según el anuncio, y el nuevo modelo predeterminado en el plan Max de Claude. Para los constructores de bucles, la propuesta es directa: ciclos casi fronterizos a la mitad del costo cambia lo que puedes permitirte ejecutar todo el día.
La pila de bucles. Lo que hace distintivo a Anthropic es que los bucles no son una característica enterrada en una aplicación. Son primitivas con nombre que puedes escribir:
- /goal define el "completado" y permite que un modelo evaluador devuelva el agente al trabajo hasta que se cumpla la condición o se alcance un límite de turnos. Este es el bucle basado en objetivos, literalmente convertido en producto.
- /loop vuelve a ejecutar un prompt en un intervalo en tu máquina; /schedule mueve ese bucle a la nube de Anthropic como una rutina, donde sigue ejecutándose con tu laptop cerrada, activado por horarios, llamadas API o eventos de GitHub.
- Los flujos de trabajo dinámicos manejan el extremo complejo: Claude escribe un script de orquestación real que puede coordinar hasta 1,000 subagentes en una sola ejecución. La anécdota insignia es un desarrollador que portó el runtime de Bun, aproximadamente 750,000 líneas, de Zig a Rust en unos once días con cientos de agentes en paralelo.
- Skills, hooks y subagentes completan el reparto de apoyo: las skills codifican cómo verificar el trabajo, un segundo agente con contexto nuevo hace revisión de código, y la memoria persiste en archivos entre sesiones.
La filosofía. La guía de Anthropic es inusualmente explícita sobre la moderación: no todas las tareas necesitan un bucle complejo, comienza con la primitiva más simple, establece criterios de parada deterministas, prueba una pequeña porción antes de una ejecución grande, y monitorea el uso con comandos integrados. Su línea que todo el campo sigue redescubriendo: los agentes que pueden verificar y mejorar su propia producción son fundamentalmente más confiables.
Léelo como: el laboratorio de bucles para desarrolladores. La versión más legible y más componible de cada tipo de bucle, y ahora con un motor casi fronterizo más barato para ejecutar dentro de él.
OpenAI: tres modos y un aprobador separado
Los modelos. La generación GPT-5.6 de OpenAI se lanzó a disponibilidad general el 9 de julio de 2026 en tres niveles: Sol (insignia, $5 de entrada / $30 de salida por millón de tokens), Terra (el medio equilibrado) y Luna (rápido y barato), todos con una ventana de contexto de aproximadamente un millón de tokens. Sol ocupa el segundo lugar en el índice independiente, esencialmente empatado con Fable 5. Su característica principal de bucle es un modo ultra que coordina cuatro agentes en paralelo por defecto en problemas difíciles.
La pila de bucles para consumidores. La historia de OpenAI aquí es una reconstrucción. El "agente de ChatGPT" independiente de 2025 fue descontinuado; en su lugar, ChatGPT ahora tiene tres modos: Chat para conversación, Work para tareas largas de múltiples pasos que producen entregables finalizados, y Codex para software. Work ejecuta trabajos en la nube, puede pausarse en puntos de control de aprobación y, crucialmente, puede ejecutarse con disparadores: Las Tareas Programadas ahora incluyen tareas de monitoreo que verifican algo en un intervalo y solo te notifican cuando hay algo que informar. Eso es un bucle basado en tiempo vendido a consumidores, sin código involucrado. Un modo agente también vive dentro del navegador Atlas para tareas de actuar en la web.
La pila de bucles para desarrolladores. La línea divisoria está declarada claramente en los documentos de OpenAI: "Usa la API de Responses cuando quieras ser dueño del bucle. Usa el SDK de Agents cuando quieras que el SDK lo ejecute." La API de Responses es agéntica por defecto, permitiendo que el modelo llame a la búsqueda web, búsqueda de archivos, uso de computadora, ejecución de código y tus funciones dentro de una sola solicitud. Dos adiciones de la era GPT-5.6 importan específicamente para los bucles: Llamada a Herramientas Programática, donde el modelo escribe un pequeño programa JavaScript en un entorno aislado para coordinar sus propias llamadas a herramientas, y una versión beta multi-agente donde un agente raíz genera y gestiona un árbol de subagentes.
La idea distintiva: separar al hacedor del aprobador. La contribución de bucle más interesante de OpenAI es Auto-review(30 de abril de 2026): cuando un agente de Codex quiere hacer algo fuera de su entorno aislado, un modelo revisor separado, no el agente mismo, decide si la acción es consistente con lo que el usuario pidió. Su razonamiento es directo: el agente principal está optimizado para completar la tarea, lo que crea presión para tratar un límite de aprobación como solo otro obstáculo. Mantener la decisión de aprobación en una llamada de modelo diferente la hace auditable. Resultado, según OpenAI: las sesiones se detienen para preguntar a un humano aproximadamente 200 veces menos a menudo, y el revisor aprueba alrededor del 99 por ciento de lo que aún se escala. Esos números son auto-reportados, pero el principio de diseño perdura: nunca dejes que el modelo que quiere terminar sea también el modelo que decide que está terminado.
Léelo como: la rampa de entrada de bucles para consumidores, más una pila seria para desarrolladores. Y un memento mori para los constructores de plataformas: OpenAI dejó obsoleto su Agent Builder visual dentro del año de haberlo lanzado, con un cierre definitivo el 30 de noviembre de 2026.
Google: bucles de investigación que alquilas por tarea
El modelo. El buque insignia actual de Google es Gemini 3.1 Pro (abril de 2026), pero la parte interesante para esta historia no es el modelo de chat. Es que Google convirtió un bucle completo en un producto.
La pila de bucles. Los agentes de Deep Research, lanzados el 21 de abril de 2026 en dos versiones (estándar, para velocidad, y Max, para exhaustividad), son bucles de investigación basados en objetivos que invocas con una sola solicitud API. Los documentos describen el ciclo directamente: planificar, buscar, leer, iterar, producir, ejecutándose durante minutos a una hora en segundo plano, con citas en el informe final. Los detalles de diseño son una pequeña clase magistral de ingeniería de bucles:
- La ejecución en segundo plano es obligatoria. Un bucle de investigación sobrevive a un tiempo de espera de HTTP, por lo que consultas el resultado. El bucle, no la solicitud, es la unidad de trabajo.
- La planificación colaborativa es una puerta humana al frente: el agente propone su plan de investigación, tú lo editas o apruebas, luego se ejecuta. Dirección antes del bucle en lugar de supervisión durante el mismo.
- Una condición de parada estricta está integrada: tiempo máximo de investigación de 60 minutos, la mayoría de las tareas terminan en unos 20.
- Las herramientas se definen por ejecución: Búsqueda de Google, lectura de URL, ejecución de código por defecto, tus propios servidores MCP y almacenes de archivos opcionalmente, y puedes apagar la web abierta por completo para investigar solo tus datos privados.
- El costo se fija por bucle, honestamente.Las estimaciones propias de Google: una tarea estándar típica consume alrededor de 80 búsquedas y aproximadamente un cuarto de millón de tokens de entrada, lo que resulta en uno a tres dólares; una ejecución Max puede alcanzar 160 búsquedas y alrededor de $3 a $7. Un bucle no es un mensaje de chat, y Google factura como tal.
Léelo como: la prueba comercial más clara de que el bucle, no la llamada al modelo, se está convirtiendo en el producto. No compras tokens; compras una investigación terminada.
Una advertencia honesta: al momento de escribir esto, los agentes de Deep Research están en vista previa a través de la API de Interactions, así que espera que la interfaz cambie.
Muse Spark 1.1: el recién llegado entrenado para orquestar
El modelo. Muse Spark 1.1 es el modelo de razonamiento multimodal de Meta Superintelligence Labs, lanzado el 9 de julio de 2026 como una actualización de Muse Spark 1.0 de abril, y es uno de los recién llegados más importantes en este resumen por tres razones.
Primero, la estrategia: es la primera API de modelo paga de Meta, a $1.25 por millón de tokens de entrada y $4.25 de salida, y es de peso cerrado, una ruptura limpia con la era abierta de Llama. Los defensores de la línea Llama están efectivamente cedidos a la ola de pesos abiertos cubierta a continuación; Meta solo ha dicho que espera abrir versiones futuras de Muse.
Segundo, el objetivo de entrenamiento. Mientras que la mayoría de los modelos aprenden el comportamiento agéntico como un subproducto, Meta dice que este fue entrenado directamente para el organigrama: "Como agente principal, puede reunir contexto, hacer un plan y delegar la ejecución a través de subagentes paralelos. Como subagente, se adhiere a su tarea, entiende las herramientas disponibles y sabe cuándo escalar de vuelta al agente principal." Aprende nuevas herramientas, servidores MCP y skills personalizadas con cero ejemplos, gestiona activamente su contexto de un millón de tokens (recordando, recuperando y compactando mientras trabaja), y maneja flujos de trabajo de uso de computadora a través de múltiples aplicaciones.
Tercero, la posición precio-rendimiento. En el índice independiente saltó ocho puntos desde la versión 1.0 en tres meses, lo que lo coloca por debajo del trío fronterizo pero a una fracción de su costo por tarea, y actualmente lidera el punto de referencia de uso de herramientas MCP Atlas con 88.1 (números adyacentes al proveedor; trátalos con la sal habitual).
La nota al pie para constructores de bucles que muestra hacia dónde se dirige todo esto. Los propios documentos para desarrolladores de Meta advierten que si construyes un agente de múltiples turnos en la antigua API de Chat Completions, el razonamiento del modelo se descarta entre turnos, por lo que los bucles se desvían y repiten trabajo; te dirigen a una API de tipo Responses que transporta el razonamiento cifrado a través de los turnos. La infraestructura de la industria se está reconstruyendo en torno a los bucles, una API obsoleta a la vez.
Léelo como: el motor que alquilas para bucles con mucha orquestación cuando el trío fronterizo es excesivo en costo. Todavía joven; la pendiente de 1.0 a 1.1 es la razón para prestar atención.
Grok 4.5: ciclos baratos y rápidos, entrenado en el trabajo
El modelo. Grok 4.5 se lanzó el 8 de julio de 2026 desde xAI de Musk (ahora operando bajo el paraguas de SpaceXAI que cotiza en bolsa), presentado como su modelo más inteligente para codificación, tareas agénticas y trabajo de conocimiento. El propio posicionamiento de Musk fue inusualmente directo: un modelo de clase Opus, aproximadamente comparable a Claude Opus 4.7, pero más rápido y más barato. La puntuación independiente es consistente con la vibra: por encima de la generación Opus anterior, por debajo del trío fronterizo.
Por qué importa específicamente para los bucles. Dos afirmaciones, ambas de xAI y ambas relevantes para bucles incluso después de descontar el marketing:
- Fue entrenado en bucles. xAI dice que el aprendizaje por refuerzo cubrió cientos de miles de tareas de ingeniería de múltiples pasos con calificación automatizada, en infraestructura donde los despliegues agénticos se ejecutan durante horas mientras el entrenamiento continúa. Sean cuales sean los puntos de referencia, la dieta de entrenamiento fue el trabajo mismo.
- La economía del bucle es la propuesta. A $2 de entrada / $6 de salida por millón de tokens, aproximadamente 80 tokens por segundo, y una eficiencia de tokens reclamada del doble (resolviendo tareas en menos de la mitad de los pasos de modelos comparables), el argumento no es "el ciclo más inteligente", es "la mayoría de los ciclos por dólar". Para los bucles, donde el costo equivale al costo por ciclo multiplicado por los ciclos, esa aritmética es todo el juego. Los documentos lo refuerzan con una infraestructura de bucle poco glamorosa: almacenamiento en caché de prompts fijado a la conversación para que los bucles largos no paguen precios de caché frío, y orientación sobre compactación de contexto para ejecuciones con muchas herramientas.
El bucle convertido en producto vive en Grok Build, su agente de codificación (entrenado junto con Cursor, donde está disponible en todos los planes), que se extiende a un territorio curiosamente práctico: modelos de Excel de múltiples hojas con investigación web, diagramas nativos de PowerPoint, documentos de Word.
Léelo como: el caballo de batalla económico para bucles de alto volumen, con la salvedad habitual de que la mayoría de los números de eficiencia son del propio proveedor.
Mira: bucles para personas que nunca abrirán una terminal
Aquí está la entrada que parece un error en una lista de modelos fronterizos, y en realidad es una de las más instructivas.
Qué es realmente Mira. Mira no es un modelo. Es un agente de IA para consumidores que vive completamente dentro de Telegram, construido por una startup tan pequeña que se redondea a dos personas, liderada por Daria Yakovleva e incubada en The Open Platform, una empresa de software del ecosistema de Telegram. Se lanzó silenciosamente en febrero de 2026 y reportó haber superado el millón de usuarios mensuales a principios de junio (auto-reportado, aproximadamente 1.17 millones). Bajo el capó, es independiente del modelo: enruta cada tarea a modelos de terceros (GPT, Claude y otros) en lugar de ejecutar el suyo propio.
Por qué pertenece a este artículo. Porque el producto de Mira son bucles, y nada más que bucles, vendidos a personas que nunca escucharán la palabra. Sus automatizaciones empaquetadas, llamadas Skills, cada una incluye la anatomía exacta de la Parte 1: un disparador (un horario, una nota de voz, un evento de chat grupal), una acción a través de aplicaciones conectadas (calendario, correo electrónico, rastreadores de proyectos, herramientas de contenido) y entrega autónoma de vuelta al chat. Monitorear el precio de un vuelo y alertarme. Convertir mi nota de voz en publicaciones para tres plataformas. Resumir lo que este grupo decidió hoy y archivar los elementos de acción. La línea de posicionamiento en sus propios materiales es el resumen más limpio de toda la era de los bucles: ChatGPT responde, Mira actúa.
Las advertencias honestas. Los recuentos de usuarios y de conectores (que sus materiales sitúan entre 200 y más de 1,000 servicios) son auto-reportados e inconsistentes entre páginas, la empresa no publica ninguna guía de ingeniería sobre cómo sus bucles verifican algo, y llamar a las Skills "bucles" es una interpretación externa, no el vocabulario propio de Mira. Un equipo pequeño que envuelve modelos de otros laboratorios también es una base frágil en comparación con todo lo demás en esta lista.
Léelo como: la señal de demanda. Cuando un bot de Telegram de dos personas alcanza un millón de usuarios al empaquetar disparadores, acciones y entrega autónoma para personas comunes, el bucle ha dejado de ser un concepto de desarrollador. La distribución y la configuración cero superan a la capacidad para una enorme porción del trabajo real.
La ola de pesos abiertos: trae tu propio bucle
La historia más ruidosa de mediados de 2026 es que el mundo de pesos abiertos dejó de estar años atrás y comenzó a estar meses atrás, y en las últimas dos semanas, por puntos. Para los constructores de bucles, eso cambia el cálculo por completo, porque un modelo abierto es el único motor de bucle que nadie puede dejar obsoleto debajo de ti.
El breve recorrido, fechas y licencias verificadas:
- Kimi K3 de Moonshot ahora es la noticia principal. Lanzado el 16 de julio de 2026 con 2,8 billones de parámetros, se convirtió en el primer modelo de código abierto en superar la banda fronteriza del índice independiente: 57,1 en Artificial Analysis (v4.1), cuarto en general, solo detrás de Fable 5 y GPT-5.6 Sol Max entre las puntuaciones publicadas. También obtuvo el primer lugar en Arena.ai en el Frontend Code Arena de votación ciega, superando a Fable 5. Los pesos completos están programados para publicarse en HuggingFace el 27 de julio de 2026 bajo una licencia MIT modificada, lo que lo convertiría en el primer modelo descargable en su clase; al 24 de julio los pesos aún no se habían enviado, así que considera esa afirmación como programada, no como hecha. La demostración insignia de Moonshot es puro teatro de bucle: 48 horas de operación autónoma continua diseñando un pequeño chip funcional, ejecutado como un solo agente en un contexto de un millón de tokens. Un número más que importa, de la misma evaluación independiente: la tasa de alucinación medida de K3 aumentó aproximadamente al 51 por ciento en tareas sensibles a los hechos, frente al 39 de su predecesor, incluso mientras la precisión factual mejoraba. Mejor en respuestas correctas, peor en saber cuándo está equivocado. Recuérdalo para la Parte 3.
- Qwen3.8-Max de Alibaba, presentado en vista previa el 19 de julio de 2026 durante la Conferencia Mundial de IA: un modelo multimodal de 2,4 billones de parámetros según se afirma, el primero de Qwen por encima de un billón de parámetros, con la autodescripción "solo superado por Fable 5" y la promesa de que los pesos abiertos llegarán pronto. La vista previa está disponible; la tabla de benchmarks, la ficha del modelo, la licencia y los pesos no lo están, así que considera cada afirmación como vista previa del proveedor hasta que se confirmen.
- DeepSeek V4 (24 de abril de 2026, licencia MIT) fue, en palabras de OpenRouter, el primer modelo abierto que los equipos integraron en pipelines de agentes reales como un sustituto plausible de la frontera. La variante Pro encabeza los rankings de agentes de codificación de código abierto en SWE-bench Verified con un 80,6 por ciento; la variante Flash mantiene casi todo eso a precios que se redondean a centavos.
- GLM-5.2 de Z.ai (mediados de junio de 2026, MIT, 753B de mezcla de expertos) fue el líder en calidad de código abierto hasta que llegó K3, descrito por OpenRouter como el sustituto abierto más cercano para la planificación estilo Opus y la codificación de largo horizonte. Vicio conocido: piensa caro, quemando tokens de salida.
- MiniMax M3 (1 de junio de 2026, MIT modificado) es la vía multimodal abierta: comprensión nativa de imágenes y video en un contexto de un millón de tokens, lo que importa en cuanto tu bucle necesite leer capturas de pantalla o inspeccionar estados de interfaz de usuario.
- NVIDIA Nemotron 3 Ultra es el participante de código abierto más fuerte construido en EE. UU., diferenciado por su implementación y el stack de NVIDIA más que por su puntuación máxima.
- También en el tablero: Thinking Machines Lab, la empresa de Mira Murati, lanzó su primer modelo, Inkling, el 15 de julio de 2026: un modelo multimodal de mezcla de expertos con 975 mil millones de parámetros y código abierto bajo Apache 2.0. Un laboratorio de primer nivel más que apuesta por los pesos abiertos como la cuña.
Léelo así: si tu bucle es de alto volumen, sensible a la privacidad o necesita superar las hojas de ruta de los proveedores, la ola abierta ya no es la opción de compromiso. La brecha con la frontera cerrada ahora se mide en puntos individuales y no se ha estado ampliando.
Parte 3: Lo que realmente funciona
Esto es lo sorprendente después de semanas en la documentación de siete proveedores: quita la marca y todos están dando el mismo consejo. Cuando rivales acérrimos convergen en una guía idéntica, eso es lo más cercano a la verdad fundamental que este campo ofrece. Siete reglas, cada una triangulada entre laboratorios.
1. Define lo que significa "terminado" antes de empezar. El /goal de Anthropic existe para que un evaluador pueda verificar una condición explícita; la guía de OpenAI exige condiciones de salida en cada ejecución; Google limita la investigación a 60 minutos exactos. Un bucle sin una condición de parada clara no es automatización, es una suscripción para quemar tokens. Lo determinista supera a las sensaciones: pruebas que pasan, números que coinciden, lista de verificación completada, N intentos máximos.
2. El verificador es el producto. El techo de calidad del bucle es su paso de verificación, no su modelo. Anthropic te dice que codifiques la verificación como habilidades y que apuntes a un segundo agente con contexto fresco para las revisiones. OpenAI fue más allá e hizo que el aprobador fuera un modelo estructuralmente separado del ejecutor, por la razón explícita de que el ejecutor quiere terminar. Google fundamenta los informes en citas en las que puedes hacer clic. Y esta semana nos dio la mejor evidencia hasta ahora: el modelo abierto más impresionante del tablero mejoró mediblemente en producir respuestas correctas mientras empeoraba en saber cuándo está equivocado. En un chat, eso es una nota al pie. En un bucle no verificado, es una fábrica de errores seguros. Si inviertes una hora en algún lado, inviértela en lo que significa "verificado" para tu tarea.
3. Nunca dejes que el ejecutor se califique a sí mismo en nada que importe. El mismo principio desde el otro lado, porque es la única lección que toda la industria pagó por aprender: un modelo que completa tareas trata cada puerta como un obstáculo. Modelo verificador separado, agente revisor separado, o un humano en el paso irreversible.
4. Gestiona el contexto como el recurso escaso que es. La guía de ingeniería de contexto de Anthropic (conjunto más pequeño de tokens de alta señal, archivos de notas, subagentes que devuelven resúmenes), la compactación activa de Meta, la guía de compactación de Grok, el contraargumento del contexto gigante de Kimi: todos están respondiendo la misma pregunta, que es cómo un bucle largo se mantiene coherente. La respuesta consensuada es memoria fuera de la ventana más recuperación bajo demanda, no acumulación.
5. Escala el tipo de bucle solo cuando el peldaño anterior falle. Anthropic dice que empieces con la primitiva más simple. OpenAI dice que maximices un solo agente antes de pasar a múltiples agentes. Google te hace aprobar un plan antes de una ejecución de una hora. La escalera de la Parte 1 también es una disciplina: entrega la verificación, luego la condición de parada, luego el disparador, luego el mensaje, en ese orden, un peldaño a la vez.
6. Pon precio al bucle, no al mensaje. El costo de un bucle es costo por ciclo multiplicado por ciclos, por eso Google pone precio a la investigación por tarea ($1 a $7), por eso Grok lidera con eficiencia de tokens, por eso Anthropic acaba de reducir a la mitad el precio de los ciclos casi fronterizos con Opus 5, y por eso cada stack serio incluye herramientas de inspección de uso. Decide cuánto puede costar una ejecución antes de empezarla.
7. Mantén a un humano en las puertas de lo irreversible. Dinero que sale, correos que se envían, datos que se eliminan, código que se fusiona en producción. Los puntos de control de aprobación en Work mode, la planificación colaborativa, los modos de permiso, las escalaciones de Auto-review: cada proveedor, sin excepción, mantuvo una puerta humana en el paso irreversible. Los proveedores con los bucles más capaces son también los que más insisten en esto. Eso debería decirte algo.
Parte 4: Lo que nadie te dice
Las publicaciones de lanzamiento terminan aquí. La experiencia operativa no.
Los bucles multiplican todo, incluidos los errores. Una suposición incorrecta en un chat es una mala respuesta. La misma suposición incorrecta en un bucle produce cincuenta artefactos incorrectos, consistentes y seguros para la mañana. Por eso la verificación es la regla número uno, y por eso los bucles sin supervisión deberían comenzar en modo solo lectura hasta que se ganen el acceso de escritura.
La factura se acumula silenciosamente. La guía de cada proveedor tiene una sección de gestión de tokens por una razón. Los modelos que piensan mucho pueden quemar dólares en tokens de salida en un solo paso difícil; una rutina que se ejecuta cada hora cuando lo subyacente cambia diariamente está pagando 24 veces por nada. Iguala el intervalo a la tasa de cambio, limita las vueltas y revisa el medidor.
La inyección de mensajes empeora en un bucle. En cuanto tu bucle lea la web abierta, bandejas de entrada o cargas de usuarios, asume que alguien eventualmente plantará instrucciones en ese contenido. Un asistente de chat que es engañado te avergüenza una vez; un bucle engañado con acceso a herramientas actúa sobre ello, repetidamente, mientras duermes. Los propios documentos de seguridad de OpenAI dicen la parte que no se dice: incluso con mitigaciones, los agentes no serán perfectos y aún pueden ser engañados. Trata todo lo que el bucle ingiere como datos, nunca como órdenes, y delimita sus permisos como si lo dijeras en serio.
La brecha entre demo y producción es real. Un diseño de chip autónomo de 48 horas es una demostración magnífica y también una controlada. Múltiplos de eficiencia autoinformados, benchmarks privados, recuentos de parámetros de vista previa del proveedor anunciados sin fichas de modelo: señales útiles, ninguna de ellas un sustituto de ejecutar el bucle en tus propias tareas con tu propio verificador. Cada laboratorio está de acuerdo en privado, por eso todos te dicen que construyas evaluaciones.
Las plataformas cambian bajo tus pies. En los doce meses anteriores a este artículo: OpenAI discontinuó su producto de agente independiente, retiró Pulse y programó su Agent Builder visual para el cierre (30 de noviembre de 2026); un nuevo Opus reorganizó la oferta de planes de Claude de la noche a la mañana; las APIs se reconstruyeron en torno a diseños amigables para bucles; y una directiva de control de exportaciones en junio incluso dejó fuera de línea a los modelos fronterizos de Claude brevemente para muchos usuarios. Construye tus bucles de modo que la lógica (el objetivo, el verificador, las notas) viva en tus archivos, no en la interfaz de un proveedor, y el motor siga siendo intercambiable.
El foso no es el modelo. La frontera ahora es un margen de menos de tres puntos que se reordena semanalmente, y un modelo abierto acaba de unirse a ella. Lo que se acumula es tuyo: el conjunto de evaluación construido a partir de tus fracasos, el verificador que codifica tus estándares, las notas que tus bucles han acumulado. Cambiar de modelo es un cambio de configuración. Reconstruir un año de lógica de verificación no lo es.
¿Qué stack de bucles es el tuyo?
El emparejamiento honesto, dado todo lo anterior:
- Vives en una terminal y quieres el máximo control: Claude Code, con Fable 5 para las ejecuciones más difíciles y Opus 5 como el nuevo valor predeterminado. Las primitivas más legibles (/goal, /schedule, flujos de trabajo dinámicos) y la filosofía mejor documentada.
- Quieres bucles dentro de un producto que todos ya usan: Work mode de ChatGPT más Scheduled Tasks (las tareas de monitoreo están criminalmente subutilizadas), o Codex con Auto-review para código.
- Tu bucle es "investiga X a fondo y dame un informe citado": alquila Deep Research o Deep Research Max de Google por tarea y omite construir cualquier cosa.
- Estás orquestando muchos subagentes y vigilando costos: Muse Spark 1.1 o Grok 4.5 como motor; ambos están preciados y construidos exactamente para esto, un escalón por debajo del trío fronterizo.
- Quieres automatizaciones en tu bolsillo sin configuración: agentes de consumo estilo Mira dentro de la aplicación de chat que ya usas.
- Necesitas volumen, privacidad o permanencia: la ola abierta. DeepSeek V4 Flash por costo, GLM-5.2 por calidad de planificación, MiniMax M3 para multimodal, y Kimi K3 si quieres capacidad de nivel fronterizo que puedas (a partir del 27 de julio, si los pesos se envían según lo programado) descargar realmente. Solo trae un verificador real; los propios números de K3 abogan por uno.
Tu primer bucle esta semana
Una receta honesta, neutral en cuanto al proveedor:
- Elige una tarea que ya repitas manualmente, donde tú seas el cuello de botella.
- Escribe la condición de parada primero. Si no puedes escribir "terminado significa X", la tarea aún no está lista para un bucle.
- Escribe la verificación. Un script, una prueba, una rúbrica para un segundo modelo. Esta es la hora que importa.
- Ejecútalo por turnos unas cuantas veces, observando cada ciclo.
- Entrega la condición de parada (un bucle de objetivo con un límite de vueltas). Observa dónde se estanca o se excede; ajusta los criterios.
- Solo entonces entrega el disparador (programalo), con un límite de presupuesto y permisos de solo lectura para empezar.
- Cuando falle, y fallará, convierte el fallo en un caso de prueba. Esa es la parte de auto-mejora, y eres tú y el bucle juntos.
Sube un peldaño a la vez. Las personas que obtienen resultados excepcionales de estos sistemas no encontraron un modelo secreto. Encontraron una tarea que valía la pena poner en bucle, definieron "terminado" y construyeron una verificación en la que confían.
Una última cosa
La era de los mensajes entrenó a todos para hacer mejores preguntas. La era de los bucles te pide algo diferente: definir resultados con suficiente precisión para que una máquina pueda perseguirlos mientras tú estás en otro lado, y diseñar las verificaciones que mantengan esa búsqueda honesta.
Esa es una habilidad real, y no es escribir mensajes. Está más cerca de la gestión. Un objetivo, un estándar de "terminado", las herramientas adecuadas, un presupuesto, una verificación en la que confíes y una ruta de escalamiento para decisiones de juicio. Cada laboratorio en este artículo, desde una empresa de tres billones de dólares hasta una startup de dos personas en Telegram, está convergiendo en maquinaria que recompensa exactamente esa habilidad.
La forma lenta aún funciona, si escribir, esperar, arreglar y volver a preguntar es la relación que quieres con esta tecnología. Pero la manivela ahora es opcional, y los laboratorios han decidido colectivamente hacia dónde va esto. La unidad de trabajo es el bucle. La persona que define el bucle eres tú.
Empieza con uno. Define "terminado". Confía, pero verifica. Luego suelta la manivela.
Fuentes
Todo lo anterior fue verificado contra fuentes primarias en la semana que terminó el 25 de julio de 2026. Agrupado por laboratorio:
El concepto de bucle
- Anthropic, Getting started with loops: claude.com/blog/getting-started-with-loops
- OpenAI, A practical guide to building agents: openai.com/business/guides-and-resources/a-practical-guide-to-building-ai-agents
- Anthropic, Building effective agents: anthropic.com/engineering/building-effective-agents and Effective context engineering: anthropic.com/engineering/effective-context-engineering-for-ai-agents
Anthropic
- Claude Fable 5: anthropic.com/claude/fable y publicación de lanzamiento: anthropic.com/news/claude-fable-5-mythos-5
- Claude Opus 5 (24 de julio de 2026): anthropic.com/news/claude-opus-5
- Routines: code.claude.com/docs/en/routines · Dynamic workflows: code.claude.com/docs/en/workflows
OpenAI
- GPT-5.6: openai.com/index/gpt-5-6 · Work and Codex: help.openai.com/en/articles/20001275 · ChatGPT agent discontinued: help.openai.com/en/articles/11752874 · Agents guide: developers.openai.com/api/docs/guides/agents· Auto-review: alignment.openai.com/auto-review
- Deep Research Max announcement: blog.google · Deep Research docs: ai.google.dev/gemini-api/docs/deep-research
Meta
- Muse Spark 1.1 announcement: ai.meta.com/blog/introducing-muse-spark-meta-model-api · Coding agents guide: dev.meta.ai/docs/guides/coding-agents
xAI
- Grok 4.5: x.ai/news/grok-4-5 · Docs: docs.x.ai/developers/grok-4-5
Mira
- Product site: mira.tg · Milestone post: mira.tg/blog/mira-1-million-monthly-users
Ola de código abierto
- Kimi K3 independent evaluation and weights timeline: TechTimes, 24 de julio de 2026 · launch: VentureBeat, 16 de julio de 2026
- Qwen3.8-Max preview: MarkTechPost, 19 de julio de 2026
- OpenRouter, The Open Weight Models that Matter, June 2026: openrouter.ai/blog
- Thinking Machines Inkling: TechCrunch, 15 de julio de 2026
- Independent scores: Artificial Analysis Intelligence Index v4.1, as reported July 24, 2026





