El bucle es el nuevo prompt

@kyronis_talks
INGLÉShace 1 día · 25 jul 2026
141K
102
102
2
24

TL;DR

Esta guía explora el cambio de los prompts manuales a los bucles de IA autónomos, detallando cómo los principales laboratorios implementan ciclos de autocorrección para manejar tareas complejas de varios pasos.

La forma manual

Todos los laboratorios importantes se han reconstruido silenciosamente en torno a la misma idea: un bucle que sigue funcionando después de que dejas de escribir. Esta es la guía de campo sobre cómo funcionan realmente los bucles a partir del 25 de julio de 2026, en Claude, GPT, Gemini, Grok, Muse Spark de Meta, Mira y la ola de pesos abiertos, con cada afirmación respaldada por fuentes.

Observa a alguien usar IA en el trabajo y generalmente verás el mismo ritual. Escribes una solicitud. Esperas. Lees la respuesta. Identificas los problemas. Explicas los problemas. Esperas de nuevo. Pegas el resultado en otro lado. Regresas al día siguiente y lo haces todo desde cero.

Aquí está la parte incómoda: ese ritual ES un bucle. Preguntar, verificar, corregir, repetir. La única diferencia entre eso y lo que ahora ofrecen los laboratorios es quién gira la manivela. Cuando lo haces manualmente, eres el desencadenante, la memoria, el verificador y la condición de parada, y eres costoso.

Durante el último año, todos los laboratorios serios de IA convergieron en la misma solución: mover la manivela dentro de la máquina. Anthropic publica una taxonomía oficial de bucles para Claude. OpenAI reconstruyó ChatGPT en torno a un modo de trabajo que ejecuta tareas de varios pasos por sí solo. Google vende bucles de investigación que alquilas por tarea. Meta entrenó su modelo Muse Spark específicamente para orquestar flotas de subagentes. Incluso el actor más pequeño en esta historia, una startup de dos personas con un bot de Telegram llamado Mira, en realidad está vendiendo bucles a personas que nunca abrirán una terminal.

Y el terreno sigue moviéndose mientras escribo esto. Solo en los siete días anteriores a esta actualización: Anthropic lanzó un nuevo Opus diseñado para trabajo agéntico cotidiano, Alibaba presentó un avance de Qwen con 2,4 billones de parámetros, y el modelo de pesos abiertos más grande jamás lanzado está a aproximadamente 48 horas de publicar sus pesos.

El resultado es el mayor cambio silencioso en cómo se utiliza esta tecnología desde que aparecieron las interfaces de chat: la unidad de trabajo ya no es el prompt. Es el bucle, un ciclo de trabajo que continúa hasta que se cumple una condición que definiste.

Este artículo es la versión larga de esa historia. Qué es realmente un bucle, sin exageraciones. Cómo se ve la pila de bucles de cada laboratorio en este momento, incluidos los modelos que no existían hace un mes. Qué funciona realmente, que resulta ser sorprendentemente consistente en todos los proveedores. Y los modos de fallo y costos que las publicaciones de lanzamiento no mencionan.

Una nota sobre el método, porque el discurso sobre IA está inundado de tonterías confiadas: todo lo que sigue está fundamentado en la documentación y anuncios de los propios laboratorios, o en evaluaciones independientes nombradas, verificadas en vivo durante la semana que finaliza el 25 de julio de 2026. Cuando un número es autoinformado por un proveedor, lo digo. Cuando algo no está verificado o sigue siendo un avance, también lo digo. Lista completa de fuentes al final.

Parte 1: Qué es realmente un bucle

Dejando de lado la jerga, un bucle consta de cuatro tiempos más una razón para detenerse.

El equipo de Claude Code de Anthropic, que publicó lo más parecido a una definición canónica en este campo, lo resume en una línea: los bucles son "agentes que repiten ciclos de trabajo hasta que se cumple una condición de parada". La guía de agentes de OpenAI dice lo mismo en lenguaje de ingeniería: "Cada enfoque de orquestación necesita el concepto de una 'ejecución', típicamente implementada como un bucle que permite a los agentes operar hasta que se alcanza una condición de salida", donde las condiciones de salida incluyen una salida final, un error o un número máximo de turnos.

Los cuatro tiempos, en lenguaje sencillo:

  1. Desencadenante. Algo inicia la ejecución. Tú, un horario, una alerta, una nueva solicitud de extracción, un correo electrónico que llega.
  2. Trabajo. El modelo recopila contexto y realiza una acción con herramientas: lee los archivos, ejecuta la consulta, redacta el mensaje, edita el código.
  3. Verificación. El resultado se verifica contra algo real. Las pruebas pasan o fallan. El número coincide con la fuente. Un segundo modelo evalúa el borrador según tus criterios.
  4. Repetir o detener. Si la verificación falla, el bucle vuelve a comenzar con lo que aprendió. Si la verificación pasa, o se alcanza un límite, se detiene.

Ese es todo el truco. Un prompt es un solo paso a través de los tiempos dos y tres, haciendo tú el tiempo tres en tu cabeza. Un bucle es lo mismo, pero con la verificación y la repetición delegadas a la máquina, más dos barreras de seguridad: una condición de parada para que no pueda ejecutarse para siempre, y un presupuesto para que no pueda gastar para siempre.

El reparto de apoyo

Alrededor de esos cuatro tiempos, cada pila de bucles seria incluye las mismas cinco piezas de apoyo, independientemente del nombre que les dé el proveedor:

  • Memoria. Notas que sobreviven entre ejecuciones, para que la ejecución cuarenta sepa lo que aprendió la ejecución uno.
  • Estado. Dónde se encuentra actualmente el bucle: qué está hecho, qué falló, qué sigue.
  • Verificador. Lo que decide "suficientemente bueno". La decisión de diseño más importante que tomarás.
  • Condición de parada. "Las pruebas pasan", "la cola está vacía", "detenerse después de cinco intentos", "son las 9 a.m. y el resumen se envió".
  • Medidor de costos. Tokens y dólares por ciclo, porque los bucles multiplican todo lo que tocan, incluida tu factura.

Los cuatro tipos de bucle

La taxonomía de Anthropic vale la pena aprenderla porque se aplica claramente a los productos de todos los demás proveedores, aunque los nombres difieran. Su equipo clasifica los bucles según lo que delegas:

  • Bucles basados en turnos. Escribes un prompt, el agente hace un ciclo (recopilar, actuar, verificar, responder), tú revisas, vuelves a escribir un prompt. Tú sigues siendo la condición de parada. Aquí es donde todos comienzan, y Anthropic señala que cada prompt ya ejecuta este micro-bucle internamente.
  • Bucles basados en objetivos. Delegas la condición de parada. Defines cómo se ve "terminado", y el agente itera hasta llegar allí o alcanzar un límite de turnos. En Claude Code, esto es literalmente un comando /goal, y cada vez que el modelo intenta detenerse, "un modelo evaluador verifica tu condición y lo envía de vuelta al trabajo hasta que se cumple el objetivo". Los criterios deterministas funcionan mejor: pruebas superadas, puntuación alcanzada, lista de verificación completada.
  • Bucles basados en tiempo. Delegas el desencadenante. El bucle se ejecuta en un intervalo o un horario y reacciona a lo que cambió: resumir Slack cada mañana, verificar la solicitud de extracción hasta que pase la CI.
  • Bucles proactivos. Delegas el prompt mismo. Un evento o un horario inicia la ejecución sin un humano en tiempo real: los nuevos informes de errores se clasifican a medida que llegan, las dependencias se actualizan semanalmente, y cada tarea finaliza cuando se cumple su propio objetivo.

Mantén esa escalera en tu cabeza (delegar la verificación, luego la condición de parada, luego el desencadenante, luego el prompt) y el resto de este artículo es simplemente ver a siete proveedores escalarla desde diferentes direcciones.

Parte 2: El estado actual, en un vistazo

Antes del recorrido laboratorio por laboratorio, una orientación, porque la frontera se movió increíblemente rápido en las cinco semanas anteriores a este artículo: Grok 4.5 se lanzó el 8 de julio, Muse Spark 1.1 de Meta y GPT-5.6 de OpenAI se lanzaron ambos el 9 de julio, Thinking Machines lanzó su primer modelo el 15 de julio, Kimi K3 de Moonshot llegó el 16 de julio, Alibaba presentó un avance de Qwen3.8-Max el 19 de julio, y Anthropic lanzó Claude Opus 5 el 24 de julio, el día anterior a esta actualización.

Para un punto de referencia neutral, el evaluador independiente Artificial Analysis puntúa la capacidad general en su Índice de Inteligencia. Según la instantánea de esta semana (v4.1), la parte superior de la tabla publicada es:

  • Claude Fable 5 (Anthropic): 59.9
  • GPT-5.6 Sol Max (OpenAI): 58.9
  • Kimi K3 (Moonshot, pesos abiertos inminentes): 57.1, cuarto en general
  • Con Claude Opus 4.8, Grok 4.5, Muse Spark 1.1, GLM-5.2 y el resto del campo por debajo

Dos advertencias que merecen su espacio. Claude Opus 5 tiene un día de antigüedad al momento de escribir esto y aún no está indexado. Y un solo índice compuesto no puede capturar el trabajo agéntico a largo plazo, que es lo que realmente hacen los bucles, así que cuando un laboratorio ha publicado resultados específicos de agentes, los cito en la sección de ese laboratorio, marcados como autoinformados cuando lo son.

Dos cosas para notar de todos modos. La parte superior de la tabla ahora es una diferencia de menos de tres puntos, lo que significa: para fines de construcción de bucles, la elección del modelo dentro de esa banda importa menos que el bucle que lo rodea. Y un modelo de pesos abiertos se encuentra ahora dentro de esa banda por primera vez.

Claude: el bucle como primitiva de primera clase

Los modelos. Claude Fable 5, lanzado el 9 de junio de 2026, es el modelo más capaz de Anthropic y el más explícitamente construido para este estilo de trabajo. El propio marco de Anthropic es que, ejecutado dentro de un arnés como Claude Code, puede "trabajar durante días seguidos: planificar a través de etapas, delegar en subagentes y verificar su propio trabajo". Su pensamiento es adaptativo y siempre está activo, ajustado por una configuración de esfuerzo, con una ventana de contexto de un millón de tokens. Todavía encabeza el índice independiente anterior. Su hermano Mythos 5, lanzado junto a él, es el especialista que Anthropic considera más fuerte en tareas de ciberseguridad.

La novedad de esta semana es Claude Opus 5, lanzado el 24 de julio: Anthropic lo describe como cercano a la inteligencia fronteriza de Fable 5 a la mitad del precio ($5 por millón de tokens de entrada y $25 de salida), el nuevo estado del arte en evaluaciones de trabajo de conocimiento como GDPval-AA según el anuncio, y el nuevo modelo predeterminado en el plan Max de Claude. Para los constructores de bucles, el mensaje es contundente: ciclos cercanos a la frontera a la mitad del costo cambia lo que puedes permitirte ejecutar todo el día.

La pila de bucles. Lo que hace distintivo a Anthropic es que los bucles no son una característica oculta en una aplicación. Son primitivas con nombre que puedes escribir:

  • /goal define "terminado" y permite que un modelo evaluador devuelva al agente al trabajo hasta que se cumpla la condición o se alcance un límite de turnos. Este es el bucle basado en objetivos, literalmente convertido en producto.
  • /loop vuelve a ejecutar un prompt en un intervalo en tu máquina; /schedule mueve ese bucle a la nube de Anthropic como una rutina, donde sigue ejecutándose con tu laptop cerrada, desencadenado por horarios, llamadas API o eventos de GitHub.
  • Los flujos de trabajo dinámicos manejan el extremo más complejo: Claude escribe un script de orquestación real que puede coordinar hasta 1,000 subagentes en una sola ejecución. La anécdota principal es la de un desarrollador que portó el runtime de Bun, aproximadamente 750,000 líneas, de Zig a Rust en unos once días con cientos de agentes paralelos.
  • Skills, hooks y subagentes completan el reparto de apoyo: las skills codifican cómo verificar el trabajo, un segundo agente de contexto fresco realiza revisiones de código, y la memoria persiste en archivos entre sesiones.

La filosofía. La guía de Anthropic es inusualmente explícita sobre la moderación: no todas las tareas necesitan un bucle complejo, comienza con la primitiva más simple, establece criterios de parada deterministas, prueba una pequeña porción antes de una ejecución grande y supervisa el uso con comandos integrados. Su línea que todo el campo redescubre: los agentes que pueden verificar y mejorar su propia salida son fundamentalmente más confiables.

Léelo como: el laboratorio de bucles para desarrolladores. La versión más legible y más componible de cada tipo de bucle, y ahora con un motor cercano a la frontera más barato para ejecutar en su interior.

OpenAI: tres modos y un aprobador separado

Los modelos. La generación GPT-5.6 de OpenAI se lanzó de forma general el 9 de julio de 2026 en tres niveles: Sol (insignia, $5 entrada / $30 salida por millón de tokens), Terra (el punto medio equilibrado) y Luna (rápido y barato), todos con una ventana de contexto de aproximadamente un millón de tokens. Sol ocupa el segundo lugar en el índice independiente, esencialmente empatado con Fable 5. Su característica principal de bucle es un modo ultra que coordina cuatro agentes en paralelo de forma predeterminada en problemas difíciles.

La pila de bucles para consumidores. La historia de OpenAI aquí es una reconstrucción. El "agente de ChatGPT" independiente de 2025 fue descontinuado; en su lugar, ChatGPT ahora tiene tres modos: Chat para conversación, Work para tareas largas de varios pasos que producen entregables terminados, y Codex para software. Work ejecuta trabajos en la nube, puede pausarse en puntos de control de aprobación y, crucialmente, puede ejecutarse con desencadenantes: Las Tareas Programadas ahora incluyen tareas de monitoreo que verifican algo en un intervalo y solo te notifican cuando hay algo que informar. Eso es un bucle basado en tiempo vendido a consumidores, sin código involucrado. También hay un modo agente dentro del navegador Atlas para tareas de actuar en la web.

La pila de bucles para desarrolladores. La línea divisoria está claramente establecida en los documentos de OpenAI: "Usa la API de Responses cuando quieras ser dueño del bucle. Usa el SDK de Agents cuando quieras que el SDK lo ejecute." La API de Responses es agéntica por defecto, permitiendo al modelo llamar a la búsqueda web, búsqueda de archivos, uso de computadora, ejecución de código y tus funciones dentro de una sola solicitud. Dos adiciones de la era GPT-5.6 son importantes para los bucles específicamente: Llamada a Herramientas Programática, donde el modelo escribe un pequeño programa JavaScript en un entorno aislado para coordinar sus propias llamadas a herramientas, y una versión beta multiagente donde un agente raíz genera y gestiona un árbol de subagentes.

La idea distintiva: separar al ejecutor del aprobador. La contribución más interesante de OpenAI a los bucles es Auto-review (30 de abril de 2026): cuando un agente de Codex quiere hacer algo fuera de su entorno aislado, un modelo revisor separado, no el propio agente, decide si la acción es consistente con lo que el usuario pidió. Su razonamiento es contundente: el agente principal está optimizado para completar la tarea, lo que crea presión para tratar un límite de aprobación como solo otro obstáculo. Mantener la decisión de aprobación en una llamada de modelo diferente la hace auditable. Resultado, según OpenAI: las sesiones se detienen para preguntar a un humano aproximadamente 200 veces menos, y el revisor aprueba alrededor del 99 por ciento de lo que aún se escala. Esas cifras son autoinformadas, pero el principio de diseño se aplica: nunca dejes que el modelo que quiere terminar sea también el modelo que decide que ha terminado.

Léelo como: la rampa de entrada de bucles para consumidores, más una pila seria para desarrolladores. Y un memento mori para los constructores de plataformas: OpenAI dejó obsoleto su Constructor de Agentes visual en menos de un año desde su lanzamiento, con un cierre definitivo el 30 de noviembre de 2026.

Google: bucles de investigación que alquilas por tarea

El modelo. El buque insignia actual de Google es Gemini 3.1 Pro (abril de 2026), pero la parte interesante para esta historia no es el modelo de chat. Es que Google convirtió un bucle completo en un producto.

La pila de bucles. Los agentes de Deep Research, lanzados el 21 de abril de 2026 en dos variantes (estándar, para velocidad, y Max, para exhaustividad), son bucles de investigación basados en objetivos que llamas con una sola solicitud API. Los documentos describen el ciclo directamente: planificar, buscar, leer, iterar, generar salida, ejecutándose durante minutos u horas en segundo plano, con citas en el informe final. Los detalles de diseño son una pequeña clase magistral en ingeniería de bucles:

  • La ejecución en segundo plano es obligatoria. Un bucle de investigación sobrevive a un tiempo de espera HTTP, por lo que consultas el resultado. El bucle, no la solicitud, es la unidad de trabajo.
  • La planificación colaborativa es una puerta humana al frente: el agente propone su plan de investigación, tú lo editas o lo apruebas, luego se ejecuta. Dirigir antes del bucle en lugar de cuidar durante el mismo.
  • Una condición de parada estricta está integrada: tiempo máximo de investigación de 60 minutos, la mayoría de las tareas terminan en unos 20.
  • Las herramientas se limitan por ejecución: Google Search, lectura de URL, ejecución de código por defecto, tus propios servidores MCP y almacenes de archivos opcionalmente, y puedes desactivar la web abierta por completo para investigar solo tus datos privados.
  • El costo se fija por bucle, honestamente.Google estima: una tarea estándar típica consume alrededor de 80 búsquedas y aproximadamente un cuarto de millón de tokens de entrada, lo que cuesta entre uno y tres dólares; una ejecución Max puede alcanzar 160 búsquedas y alrededor de $3 a $7. Un bucle no es un mensaje de chat, y Google factura como tal.

Léelo como: la prueba comercial más clara de que el bucle, no la llamada al modelo, se está convirtiendo en el producto. No compras tokens; compras una investigación terminada.

Una advertencia honesta: al momento de escribir esto, los agentes de Deep Research están en vista previa a través de la API de Interactions, así que espera que la interfaz cambie.

Muse Spark 1.1: el recién llegado entrenado para orquestar

El modelo. Muse Spark 1.1 es el modelo de razonamiento multimodal de Meta Superintelligence Labs, lanzado el 9 de julio de 2026 como una actualización de Muse Spark 1.0 de abril, y es uno de los recién llegados más importantes en este resumen por tres razones.

Primero, la estrategia: es la primera API de modelo paga de Meta, a $1.25 por millón de tokens de entrada y $4.25 de salida, y es de pesos cerrados, una ruptura limpia con la era abierta de Llama. Los defensores de la línea Llama están efectivamente cedidos a la ola de pesos abiertos cubierta a continuación; Meta solo ha dicho que espera abrir futuras versiones de Muse.

Segundo, el objetivo de entrenamiento. Mientras que la mayoría de los modelos aprenden el comportamiento agéntico como un subproducto, Meta dice que este fue entrenado directamente para el organigrama: "Como agente principal, puede recopilar contexto, hacer un plan y delegar la ejecución en subagentes paralelos. Como subagente, se adhiere a su tarea, comprende las herramientas disponibles y sabe cuándo escalar de vuelta al agente principal." Aprende nuevas herramientas, servidores MCP y skills personalizadas con cero ejemplos, gestiona activamente su contexto de un millón de tokens (recordando, recuperando y compactando mientras trabaja) y maneja flujos de trabajo de uso de computadora a través de múltiples aplicaciones.

Tercero, la posición precio-rendimiento. En el índice independiente, saltó ocho puntos desde la versión 1.0 en tres meses, lo que lo sitúa por debajo del trío fronterizo pero a una fracción de su costo por tarea, y actualmente lidera el punto de referencia de uso de herramientas MCP Atlas con 88.1 (cifras adyacentes al proveedor; tómalas con la sal habitual).

La nota al pie para constructores de bucles que te dice hacia dónde va todo esto. Los propios documentos para desarrolladores de Meta advierten que si construyes un agente de múltiples turnos en la antigua API de Chat Completions, el razonamiento del modelo se descarta entre turnos, por lo que los bucles se desvían y repiten trabajo; te dirigen a una API de Responses que lleva el razonamiento cifrado a través de los turnos. La infraestructura de la industria se está reconstruyendo en torno a los bucles, una API obsoleta a la vez.

Léelo como: el motor que alquilas para bucles de orquestación intensiva cuando el trío fronterizo es excesivo en costo. Todavía joven; la pendiente de 1.0 a 1.1 es la razón para prestar atención.

Grok 4.5: ciclos baratos y rápidos, entrenado en el trabajo

El modelo. Grok 4.5 se lanzó el 8 de julio de 2026 desde xAI de Musk (ahora operando bajo el paraguas de SpaceXAI que cotiza en bolsa), presentado como su modelo más inteligente para codificación, tareas agénticas y trabajo de conocimiento. El propio posicionamiento de Musk fue inusualmente directo: un modelo de clase Opus, aproximadamente comparable a Claude Opus 4.7, pero más rápido y más barato. La puntuación independiente es consistente con la impresión: por encima de la generación anterior de Opus, por debajo del trío fronterizo.

Por qué importa específicamente para los bucles. Dos afirmaciones, ambas de xAI y ambas relevantes para bucles incluso después de descontar el marketing:

  • Fue entrenado en bucles. xAI dice que el aprendizaje por refuerzo cubrió cientos de miles de tareas de ingeniería de múltiples pasos con calificación automatizada, en infraestructura donde los despliegues agénticos se ejecutan durante horas mientras el entrenamiento continúa. Cualquiera que sea el punto de referencia, la dieta de entrenamiento fue el trabajo en sí mismo.
  • La economía de bucles es el mensaje. A $2 de entrada / $6 de salida por millón de tokens, aproximadamente 80 tokens por segundo, y una eficiencia de tokens reclamada del doble (resolviendo tareas en menos de la mitad de los pasos de modelos comparables), el argumento no es "ciclo más inteligente", es "más ciclos por dólar". Para bucles, donde el costo es igual al costo por ciclo por ciclos, esa aritmética es todo el juego. Los documentos lo refuerzan con tuberías de bucle poco glamorosas: almacenamiento en caché de prompts fijado en la conversación para que los bucles largos no paguen precios de caché frío, y orientación sobre compactación de contexto para ejecuciones con muchas herramientas.

El bucle convertido en producto vive en Grok Build, su agente de codificación (entrenado junto con Cursor, donde está disponible en todos los planes), que se extiende a territorio sorprendentemente práctico: modelos de Excel con varias hojas e investigación web, diagramas nativos de PowerPoint, documentos de Word.

Léelo como: el caballo de batalla económico para bucles de alto volumen, con la advertencia habitual de que la mayoría de las cifras de eficiencia son del propio proveedor.

Mira: bucles para personas que nunca abrirán una terminal

Aquí está la entrada que parece un error en una lista de modelos fronterizos, y en realidad es una de las más instructivas.

Qué es realmente Mira. Mira no es un modelo. Es un agente de IA para consumidores que vive enteramente dentro de Telegram, construido por una startup tan pequeña que se redondea a dos personas, liderada por Daria Yakovleva e incubada dentro de The Open Platform, una empresa de software del ecosistema de Telegram. Se lanzó silenciosamente en febrero de 2026 e informó haber superado el millón de usuarios mensuales a principios de junio (autoinformado, aproximadamente 1.17 millones). Bajo el capó, es independiente del modelo: enruta cada tarea a modelos de terceros (GPT, Claude y otros) en lugar de ejecutar el suyo propio.

Por qué pertenece a este artículo. Porque el producto de Mira son los bucles, y nada más que bucles, vendidos a personas que nunca escucharán la palabra. Sus automatizaciones empaquetadas, llamadas Skills, agrupan la anatomía exacta de la Parte 1: un desencadenante (un horario, una nota de voz, un evento de chat grupal), una acción en aplicaciones conectadas (calendario, correo electrónico, rastreadores de proyectos, herramientas de contenido) y entrega autónoma de vuelta al chat. Vigila el precio de un vuelo y avísame. Convierte mi nota de voz en publicaciones para tres plataformas. Resume lo que este grupo decidió hoy y archiva los elementos de acción. La línea de posicionamiento en sus propios materiales es el resumen más limpio de toda la era de los bucles: ChatGPT responde, Mira actúa.

Las advertencias honestas. Los recuentos de usuarios y los recuentos de conectores (que sus materiales sitúan de diversas formas entre 200 y más de 1,000 servicios) son autoinformados e inconsistentes entre páginas, la empresa no publica ninguna guía de ingeniería sobre cómo sus bucles verifican algo, y llamar a las Skills "bucles" es una interpretación externa, no el vocabulario de Mira. Un equipo pequeño envolviendo modelos de otros laboratorios también es una base frágil en comparación con todo lo demás en esta lista.

Léelo como: la señal de demanda. Cuando un bot de Telegram de dos personas alcanza un millón de usuarios empaquetando desencadenantes, acciones y entrega autónoma para personas comunes, el bucle ha dejado de ser un concepto de desarrollador. La distribución y la configuración cero superan a la capacidad para una enorme porción del trabajo real.

La ola de pesos abiertos: trae tu propio bucle

La historia más ruidosa de mediados de 2026 es que el mundo de pesos abiertos dejó de estar rezagado por años y comenzó a estarlo por meses, y en las últimas dos semanas, por puntos. Para los constructores de bucles, eso cambia completamente el cálculo, porque un modelo abierto es el único motor de bucle que nadie puede dejar obsoleto por debajo de ti.

El breve recorrido, fechas y licencias verificadas:

  • Kimi K3 de Moonshot es ahora el centro de atención. Lanzado el 16 de julio de 2026 con 2,8 billones de parámetros, se convirtió en el primer modelo de pista abierta en romper la banda fronteriza del índice independiente: 57,1 en Artificial Analysis (v4.1), cuarto en general, solo detrás de Fable 5 y GPT-5.6 Sol Max entre las puntuaciones publicadas. También ocupó el primer lugar en el Arena.ai de votación ciega en Frontend Code Arena, por delante de Fable 5. Los pesos completos están programados para publicarse en HuggingFace el 27 de julio de 2026 bajo una licencia MIT modificada, lo que lo convertiría en el primer modelo descargable en su clase; al 24 de julio los pesos aún no se habían enviado, así que considere esa afirmación como programada en lugar de realizada. La demostración insignia de Moonshot es puro teatro de bucle: 48 horas de operación autónoma continua diseñando un pequeño chip funcional, ejecutado como un solo agente en un contexto de un millón de tokens. Un número más que importa, de la misma evaluación independiente: la tasa de alucinación medida de K3 aumentó a aproximadamente el 51 por ciento en tareas sensibles a los hechos, frente al 39 de su predecesor, incluso mientras la precisión factual mejoraba. Mejor en respuestas correctas, peor en saber cuándo está equivocado. Recuérdelo para la Parte 3.
  • Qwen3.8-Max de Alibaba, preestrenado el 19 de julio de 2026 durante la Conferencia Mundial de IA: un modelo multimodal de 2,4 billones de parámetros, el primero del equipo Qwen por encima de un billón de parámetros, con la autodescripción "solo superado por Fable 5" y la promesa de que los pesos abiertos llegarán pronto. La vista previa está en vivo; la tabla de benchmarks, la tarjeta del modelo, la licencia y los pesos no lo están, así que considere cada afirmación como una vista previa del proveedor hasta que lleguen.
  • DeepSeek V4 (24 de abril de 2026, licencia MIT) fue, en palabras de OpenRouter, el primer modelo abierto que los equipos incorporaron en pipelines de agente reales como un sustituto plausible de frontera. La variante Pro encabeza las tablas de agentes de codificación de pesos abiertos en SWE-bench Verified con un 80,6 por ciento; la variante Flash conserva casi todo eso a precios que se redondean a céntimos.
  • GLM-5.2 de Z.ai (mediados de junio de 2026, MIT, 753B mezcla de expertos) fue el líder de calidad de pesos abiertos hasta que llegó K3, descrito por OpenRouter como el sustituto abierto más cercano para la planificación estilo Opus y la codificación de largo horizonte. Vicio conocido: piensa de forma costosa, quemando tokens de salida.
  • MiniMax M3 (1 de junio de 2026, MIT modificado) es la vía multimodal abierta: comprensión nativa de imágenes y video en un contexto de un millón de tokens, lo que importa en el momento en que tu bucle necesita leer capturas de pantalla o inspeccionar estados de UI.
  • NVIDIA Nemotron 3 Ultra es el participante de pesos abiertos más fuerte construido en EE. UU., diferenciado por su implementación y el stack de NVIDIA más que por su puntuación máxima.
  • También en el tablero: Thinking Machines Lab, la empresa de Mira Murati, envió su primer modelo, Inkling, el 15 de julio de 2026: un modelo multimodal de 975B parámetros de pesos abiertos con mezcla de expertos bajo Apache 2.0. Otro laboratorio de primer nivel que apuesta a que los pesos abiertos son la cuña.

Léalo como: si tu bucle es de alto volumen, sensible a la privacidad o necesita sobrevivir a las hojas de ruta de los proveedores, la ola abierta ya no es la opción de compromiso. La brecha con la frontera cerrada ahora se mide en puntos individuales, y no se ha estado ampliando.

Parte 3: Lo que realmente funciona

Esto es lo sorprendente después de semanas en la documentación de siete proveedores: quita la marca y todos están dando el mismo consejo. Cuando rivales acérrimos convergen en una guía idéntica, eso es lo más cerca que se puede estar de la verdad fundamental en este campo. Siete reglas, cada una triangulada entre laboratorios.

1. Define lo que significa "terminado" antes de empezar. El /goal de Anthropic existe para que un evaluador pueda verificar una condición explícita; la guía de OpenAI exige condiciones de salida en cada ejecución; Google limita la investigación a 60 minutos exactos. Un bucle sin una condición de parada clara no es automatización, es una suscripción para quemar tokens. Lo determinista vence a las sensaciones: las pruebas pasan, el número coincide, la lista de verificación está completa, N intentos como máximo.

2. El verificador es el producto. El techo de calidad del bucle es su paso de verificación, no su modelo. Anthropic te dice que codifiques la verificación como habilidades y que apuntes a un segundo agente con contexto fresco a las revisiones. OpenAI fue más allá e hizo que el aprobador fuera un modelo estructuralmente separado del hacedor, por la razón explícita de que el hacedor quiere terminar. Google fundamenta los informes en citas en las que puedes hacer clic. Y esta semana se presentó la mejor evidencia de la regla: el modelo abierto más impresionante del tablero mejoró notablemente en producir respuestas correctas mientras empeoraba en saber cuándo está equivocado. En un chat, eso es una nota al pie. En un bucle no verificado, es una fábrica de errores seguros. Si inviertes una hora en algo, inviértela en lo que significa "verificado" para tu tarea.

3. Nunca dejes que el hacedor se califique a sí mismo en nada que importe. El mismo principio desde el otro lado, porque es la lección que toda la industria pagó por aprender: un modelo que completa tareas trata cada puerta como un obstáculo. Modelo verificador separado, agente revisor separado, o un humano en el paso irreversible.

4. Gestiona el contexto como el recurso escaso que es. La guía de ingeniería de contexto de Anthropic (el conjunto más pequeño de tokens de alta señal, archivos de notas, subagentes que devuelven resúmenes), la compactación activa de Meta, la guía de compactación de Grok, el contraargumento del contexto gigante de Kimi: todos están respondiendo a la misma pregunta, que es cómo un bucle largo se mantiene coherente. La respuesta consensuada es memoria fuera de la ventana más recuperación bajo demanda, no acumulación.

5. Escala el tipo de bucle solo cuando el escalón anterior falle. Anthropic dice que empieces con la primitiva más simple. OpenAI dice que maximices un solo agente antes de pasar a múltiples agentes. Google te hace aprobar un plan antes de una ejecución de una hora. La escalera de la Parte 1 también es una disciplina: pasa la verificación, luego la condición de parada, luego el disparador, luego el prompt, en ese orden, un escalón a la vez.

6. Pon precio al bucle, no al mensaje. El costo de un bucle es costo-por-ciclo por ciclos, por eso Google pone precio a la investigación por tarea ($1 a $7), por eso Grok lidera con eficiencia de tokens, por eso Anthropic acaba de reducir a la mitad el precio de los ciclos cercanos a la frontera con Opus 5, y por eso todo stack serio incluye herramientas de inspección de uso. Decide cuánto se permite que cueste una ejecución antes de empezarla.

7. Mantén a un humano en las puertas que no se pueden deshacer. Dinero saliendo, correos enviándose, datos eliminándose, código fusionándose a producción. Los puntos de control de aprobación de Work mode, la planificación colaborativa, los modos de permiso, las escalaciones de Auto-review: cada proveedor, sin excepción, mantuvo una puerta humana en el paso irreversible. Los proveedores con los bucles más capaces son también los más insistentes en esto. Eso debería decirte algo.

Parte 4: Lo que nadie te dice

Las publicaciones de lanzamiento terminan aquí. La experiencia operativa no.

Los bucles lo multiplican todo, incluidos los errores. Una suposición incorrecta en un chat es una mala respuesta. La misma suposición incorrecta en un bucle son cincuenta artefactos consistentes, seguros y erróneos para la mañana. Por eso la verificación es la regla número uno, y por qué los bucles sin supervisión deberían comenzar en modo solo lectura hasta que se ganen el acceso de escritura.

La factura se acumula silenciosamente. La guía de cada proveedor tiene una sección de gestión de tokens por una razón. Los modelos que piensan mucho pueden quemar dólares en tokens de salida en un solo paso difícil; una rutina que se ejecuta cada hora cuando lo subyacente cambia a diario está pagando 24x por nada. Iguala el intervalo a la tasa de cambio, limita las vueltas y revisa el medidor.

La inyección de prompts empeora en un bucle. En el momento en que tu bucle lee la web abierta, las bandejas de entrada o las subidas de usuarios, asume que alguien eventualmente plantará instrucciones en ese contenido. Un asistente de chat que es engañado te avergüenza una vez; un bucle engañado con acceso a herramientas actúa sobre ello, repetidamente, mientras duermes. Los propios documentos de seguridad de OpenAI dicen la parte obvia: incluso con mitigaciones, los agentes no serán perfectos y aún pueden ser engañados. Trata todo lo que el bucle ingiere como datos, nunca como órdenes, y delimita sus permisos como si fuera en serio.

La brecha entre demo y producción es real. Un diseño de chip autónomo de 48 horas es una demostración magnífica y también una controlada. Múltiplos de eficiencia autoinformados, benchmarks privados, recuentos de parámetros de vista previa del proveedor anunciados sin tarjetas de modelo: señales útiles, ninguna de ellas un sustituto de ejecutar el bucle en tus propias tareas con tu propio verificador. Cada laboratorio está de acuerdo en silencio, por eso todos te dicen que construyas evaluaciones.

Las plataformas cambian bajo tus pies. En los doce meses anteriores a este artículo: OpenAI descontinuó su producto de agente independiente, retiró Pulse y programó el cierre de su Visual Agent Builder (30 de noviembre de 2026); un nuevo Opus reorganizó la línea de planes de Claude de la noche a la mañana; las APIs se reconstruyeron en torno a diseños amigables para bucles; y una directiva de control de exportaciones de junio incluso dejó fuera de línea brevemente los modelos Claude de frontera para muchos usuarios. Construye tus bucles para que la lógica (el objetivo, el verificador, las notas) viva en tus archivos, no en la UI de un proveedor, y el motor siga siendo intercambiable.

El foso no es el modelo. La frontera es ahora un diferencial de menos de tres puntos que se reordena semanalmente, y un modelo abierto acaba de unirse a ella. Lo que se acumula es tuyo: el conjunto de evaluación construido a partir de tus fracasos, el verificador que codifica tus estándares, las notas que tus bucles han acumulado. Cambiar de modelo es un cambio de configuración. Reconstruir un año de lógica de verificación no lo es.

¿Qué stack de bucles es el tuyo?

El emparejamiento honesto, dado todo lo anterior:

  • Vives en una terminal y quieres el máximo control: Claude Code, con Fable 5 para las ejecuciones más difíciles y Opus 5 como el nuevo valor predeterminado. Las primitivas más legibles (/goal, /schedule, flujos de trabajo dinámicos) y la filosofía mejor documentada.
  • Quieres bucles dentro de un producto que todos ya usan: Work mode de ChatGPT más Scheduled Tasks (las tareas de monitoreo están criminalmente infrautilizadas), o Codex con Auto-review para código.
  • Tu bucle es "investiga X a fondo y dame un informe citado": alquila Deep Research o Deep Research Max de Google por tarea y omite construir cualquier cosa.
  • Estás orquestando muchos subagentes y vigilando costos: Muse Spark 1.1 o Grok 4.5 como motor; ambos están diseñados y construidos exactamente para esto, un escalón por debajo del trío de frontera.
  • Quieres automatizaciones en tu bolsillo con cero configuración: agentes de consumo estilo Mira dentro de la aplicación de chat que ya usas.
  • Necesitas volumen, privacidad o permanencia: la ola abierta. DeepSeek V4 Flash para costo, GLM-5.2 para calidad de planificación, MiniMax M3 para multimodal, y Kimi K3 si quieres capacidad de banda de frontera que puedas (a partir del 27 de julio, si los pesos se envían a tiempo) descargar realmente. Solo trae un verificador real; los propios números de K3 abogan por uno.

Tu primer bucle esta semana

Una receta honesta, neutral en cuanto a proveedor:

  1. Elige una tarea que ya repitas manualmente, donde tú seas el cuello de botella.
  2. Escribe la condición de parada primero. Si no puedes escribir "terminado significa X", la tarea aún no está lista para un bucle.
  3. Escribe la verificación. Un script, una prueba, una rúbrica para un segundo modelo. Esta es la hora que importa.
  4. Ejecútalo por turnos algunas veces, observando cada ciclo.
  5. Pasa la condición de parada (un bucle de objetivo con un límite de turnos). Observa dónde se estanca o excede; ajusta los criterios.
  6. Solo entonces pasa el disparador (programarlo), con un límite de presupuesto y permisos de solo lectura para empezar.
  7. Cuando falle, y lo hará, convierte el fracaso en un caso de prueba. Esa es la parte de auto-mejora, y eres tú y el bucle juntos.

Sube un escalón a la vez. Las personas que obtienen resultados descomunales de estos sistemas no encontraron un modelo secreto. Encontraron una tarea que valía la pena poner en bucle, definieron qué significa "terminado" y construyeron una verificación en la que confían.

Una última cosa

La era de los prompts entrenó a todos para hacer mejores preguntas. La era de los bucles te pide algo diferente: define los resultados con la suficiente precisión para que una máquina pueda perseguirlos mientras tú estás en otro lugar, y diseña las verificaciones que mantengan esa búsqueda honesta.

Esa es una habilidad real, y no es escribir prompts. Está más cerca de la gestión. Un objetivo, un estándar de "terminado", las herramientas adecuadas, un presupuesto, una verificación en la que confíes y una ruta de escalada para decisiones de criterio. Cada laboratorio en este artículo, desde una empresa de tres billones de dólares hasta una startup de Telegram de dos personas, está convergiendo en maquinaria que recompensa exactamente esa habilidad.

La forma lenta aún funciona, si escribir, esperar, arreglar y volver a preguntar es la relación que quieres con esta tecnología. Pero la manivela manual ahora es opcional, y los laboratorios han decidido colectivamente hacia dónde va esto. La unidad de trabajo es el bucle. La persona que define el bucle eres tú.

Empieza con uno. Define qué significa "terminado". Confía, pero verifica. Luego suelta la manivela.

Fuentes

Todo lo anterior fue verificado contra fuentes primarias en la semana que terminó el 25 de julio de 2026. Agrupado por laboratorio:

El concepto de bucle

Anthropic

OpenAI

Google

Meta

xAI

Mira

Ola de pesos abiertos

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales