Más allá del '98% AGI': El cambio hacia una IA que completa trabajos enteros
El 3 de septiembre de 2026, OpenAI anunció GPT-6 Astra.
Inmediatamente después de su lanzamiento, la atención se centró en sus puntuaciones: aproximadamente 98% en el difícil benchmark matemático "FrontierMath", 99.9% en "ARC-AGI-3" para medir operaciones informáticas y 100% en la evaluación de ciberseguridad "ExploitBench".
Al observar solo estas cifras, uno podría sentirse tentado a decir: "Ha llegado una IA casi perfecta" o "Por fin la AGI está completa".
Sin embargo, es peligroso juzgar a GPT-6 Astra únicamente por sus puntuaciones en benchmarks.
El cambio en Astra no se trata solo de devolver texto más correcto en respuesta a preguntas.
Abre navegadores, lee documentos, ejecuta código, actualiza hojas de cálculo, opera sitios web, investiga las causas si falla a mitad de camino y, finalmente, entrega un entregable revisable.
La unidad de trabajo que se le pasa a ChatGPT ha pasado de "una sola pregunta" a "una serie de operaciones comerciales".
Si usas Astra solo para borradores de correos electrónicos o resúmenes de texto como el ChatGPT tradicional, sigue siendo una IA de generación de texto cara. Su valor surge cuando le confías tareas que los humanos solían manejar cambiando de pantalla varias veces, tratadas como un proceso cohesionado.(OpenAI
En este artículo, profundizaremos más allá de las introducciones oficiales de funciones en casos confirmados por empresas extranjeras, cómo leer los benchmarks, comparaciones con Claude, precios, seguridad y diseño para uso práctico por parte de empresas japonesas.
¿Qué es GPT-6 Astra?
GPT-6 Astra está posicionado por OpenAI como el modelo de primer nivel de la generación GPT-6, descrito como el "modelo más inteligente y más alineado".
En su lanzamiento, se está implementando primero en organizaciones seleccionadas, seguido de ChatGPT Plus, Pro, Business, Enterprise, API y Amazon Bedrock. En Enterprise, está desactivado por defecto hasta que un administrador lo active, y no hay una mención explícita de un lanzamiento para el plan gratuito en el anuncio oficial.
El nombre del modelo en la API es gpt-6-astra. Astra Pro, que utiliza mayor capacidad de cómputo, también se está introduciendo para usuarios de Pro, Business y Enterprise.(OpenAI
Las especificaciones clave se resumen a continuación:
Elemento | GPT-6 Astra |
|---|---|
Longitud de Contexto | 1,050,000 tokens |
Salida Máxima | 128,000 tokens |
Fecha de Corte de Conocimiento | 30 de abril de 2026 |
Entrada | Texto, Imagen (Nativa) |
Salida | Texto (Nativa) |
Nivel de Razonamiento | low / medium / high / xhigh / max |
Precio de Entrada API | $10 por 1M de tokens |
Precio de Salida API | $50 por 1M de tokens |
Entrada en Caché | $1 por 1M de tokens |
Ajuste Fino | No compatible |
Herramientas Principales | Búsqueda Web, Búsqueda de Archivos, Ejecución de Código, Shell, Uso de Computadora, MCP, Generación de Imágenes, etc. |
Aunque puede leer imágenes, la salida nativa del modelo es texto. La generación de imágenes se realiza llamando a una herramienta separada. No es un modelo para entrada directa de audio o video.
Además, para entradas largas que superen los 272,000 tokens, se aplica un multiplicador de precio a toda la solicitud. Las tarifas de entrada y caché se duplican, y las tarifas de salida se multiplican por 1.5. El hecho de que quepan 1.05 millones de tokens no significa que debas meter todos los documentos internos cada vez; la eficiencia de costos se desplomará antes que la precisión.
¿Qué cambió con Astra?
- La Operación Informática pasó de "Auxiliar" al Campo de Batalla Principal
En el corazón de Astra está "Computer Use".
La IA anterior podía hacer clic en botones o rellenar formularios en un navegador. Sin embargo, persistían problemas: se detenía si el diseño de la pantalla cambiaba ligeramente, no podía recuperarse de errores a mitad del proceso o perdía de vista el objetivo en tareas que abarcaban múltiples sitios.
GPT-6 Astra registró un 72.6% en OSWorld 2.0, que mide las operaciones reales en el entorno de escritorio. GPT-5.6 Sol fue del 65.7%.
Además, Astra procesó esta evaluación en unos 40 minutos, mientras que Sol tardó unos 75 minutos. No solo la tasa de éxito, sino también el tiempo de procesamiento se redujo en aproximadamente un 47%. En ScreenSpot, que encuentra objetivos en la pantalla, Astra obtuvo un 92.7% frente al 76.9% de Sol.(OpenAI
Esto es más que un simple video de demostración fluido. Se dirige a tareas como:
- Buscar hospitales o propiedades que coincidan con los criterios y comparar candidatos.
- Recuperar valores de múltiples pantallas de gestión para crear informes.
- Ingresar información del cliente en el CRM y actualizar el estado.
- Iniciar sesión en servicios web para verificar configuraciones.
- Ejecutar una aplicación creada en un navegador y corregir errores.
- Completar hojas de cálculo o diapositivas mientras se consultan múltiples archivos.
En Mind2Web, Astra utilizando un harness Codex actualizado procesó tareas web 1.9 veces más rápido que los modelos anteriores.
Lo importante aquí es que el rendimiento está determinado por el "harness completo", incluido el navegador, las herramientas, el entorno de ejecución y el proceso de verificación, no solo por la inteligencia del modelo. Simplemente seleccionar el nombre Astra no automatiza automáticamente todas las operaciones de pantalla.(OpenAI
- Mantener un Contexto Largo de 1.05 Millones de Tokens Hasta el Final
La longitud de contexto de GPT-6 Astra es de aproximadamente 1.05 millones de tokens. Tiene la capacidad de manejar contratos, actas, documentos de diseño, código fuente e investigaciones pasadas todo a la vez. Sin embargo, "que quepa" y "usarlo con precisión" son cosas diferentes.
En las evaluaciones MRCR para encontrar información incrustada en textos largos, Astra obtuvo un 100% en el rango de 256k–512k y un 96.3% en el rango de 512k–1M. El resultado de GPT-5.6 Sol en este último fue del 73.8%.
Aunque Astra es fuerte en contexto largo, no memoriza cada palabra a la perfección cuando introduces 1 millón de tokens. Todavía falla aproximadamente un 3.7% de las veces en la banda de 1M de tokens. Evita diseños que coloquen condiciones críticas en un solo lugar de un documento masivo; debes establecer explícitamente los objetivos, las restricciones y las condiciones de aprobación por separado.(OpenAI
Astra también tiene mecanismos para aumentar la continuidad en sesiones largas, como llamadas asíncronas a herramientas para trabajar en otras tareas mientras espera una herramienta, dirección para permitir la corrección humana del rumbo durante la ejecución y mantener la caché incluso si se cambian los niveles de razonamiento en medio de la conversación.
Se está alejando de "escribe un prompt perfecto y déjalo" hacia un flujo de trabajo de "verificar el progreso y corregir el rumbo".(OpenAI Developers
- Crear Entregables Terminados, No Solo Texto
Astra ha fortalecido su capacidad para crear entregables como hojas de cálculo, diapositivas, documentos, aplicaciones e informes de investigación. Los modelos anteriores podían crear un "esquema de presentación", pero los humanos tenían que pasarlo a PowerPoint, ajustar el diseño, volver a verificar los números y agregar enlaces. Astra apunta al siguiente nivel: leer materiales o plantillas de la empresa, organizar números, crear diapositivas/hojas de cálculo, verificarlas en un navegador y enviar los archivos corregidos.
El usuario temprano Higgsfield declaró que podía procesar tareas de agente con hasta un 20% menos de tokens que los modelos existentes. Harvey elogió su juicio en el trabajo legal, Jane Street señaló una reducción en los intercambios para problemas técnicos complejos, y Lovable valoró su capacidad de iteración/prueba en configuraciones de razonamiento alto.
Sin embargo, estos son testimonios de clientes tempranos, no lo mismo que evidencia de pruebas de replicación independientes de terceros.(OpenAI
- Menos Probabilidad de "Olvidar el Objetivo" Durante Tareas Largas
Los agentes convencionales a veces se desviaban del plan establecido al principio: obsesionándose con pequeñas refactorizaciones cuando se suponía que debían implementar una función, o terminando solo con la recopilación de información en lugar de una decisión final. Astra ha mejorado la consistencia en trabajos de larga duración.
Por otro lado, los documentos oficiales para desarrolladores señalan que Astra puede detenerse para hacer preguntas aclaratorias, formatear detalles en exceso, repetir expresiones o probar más de lo necesario.
En otras palabras, un mayor rendimiento no significa que puedas dar instrucciones vagas. Debes establecer los objetivos, las condiciones de finalización, los criterios para hacer preguntas y las operaciones que requieren aprobación de manera más clara que antes.(OpenAI Developers
Los Benchmarks son Abrumadores, pero No "Los Mejores del Mundo en Todos los Campos"
El anuncio de Astra presentó cifras llamativas: 97.6% en FrontierMath, 99.9% en ARC-AGI-3 y 100% en ExploitBench. Estos son pasos significativos hacia adelante, pero debemos distinguir entre los objetivos de medición y las condiciones de ejecución.
Las Operaciones Informáticas y la Automatización de Negocios Crecieron Significativamente
En AutomationBench, que se acerca a las tareas comerciales reales, Astra obtuvo un 41.4%. GPT-5.6 Sol fue del 18.1% y Claude Fable 5.1 del 31.4%. En BenchCAD para tareas relacionadas con CAD, Astra fue del 95.9%, Sol del 83.3% y Fable 5.1 del 84.3%. En BrowseComp para investigación web, Astra fue del 91.5%, Sol del 90.4% y Claude Opus 5 del 90.8%. Astra lidera aquí, pero la brecha con Sol y Opus es pequeña.
La ventaja de Astra es más evidente en tareas compuestas complejas que combinan operación de pantalla, procesamiento de archivos, análisis de datos y verificación, en lugar de solo encontrar un único resultado de búsqueda.(OpenAI
Fuerte en Codificación, pero No ha Superado Completamente a Claude
En Terminal-Bench, Astra obtuvo un 57.7%, superando a Sol (37.3%) y Fable 5.1 (55.8%). En evaluaciones de migración de bases de datos internas, Astra fue del 63.9% frente al 42.7% de Sol. Se observan mejoras claras en la lectura de sistemas existentes y la realización de cambios sin romperlos.
Sin embargo, en el Artificial Analysis Coding Agent Index, Astra fue 67.0, Claude Fable 5 fue 67.2 y Claude Opus 5 fue 68.1. En FrontierCode Extended, Astra fue 64.5 frente al 64.9 de Fable 5. En la evaluación Main, Astra fue 53.3, Fable 5 fue 53.5 y Opus 5 fue 53.4.
Astra está en el nivel superior para codificación, pero no ha superado a Claude en todas las evaluaciones de código.(OpenAI
Persisten Debilidades en el Razonamiento Académico
A pesar del 97.6% en FrontierMath, Astra obtuvo un 57.2% en "Humanity's Last Exam", que mide una amplia experiencia y razonamiento. Claude Fable 5.1 fue del 65.0%, Fable 5 del 63.8% y Opus 5 del 63.6%. En el Artificial Analysis Intelligence Index, Astra fue 61.2, mientras que Fable 5.1 fue 65.7 y Opus 5 fue 63.1.
La interpretación de que "entiende casi todos los campos académicos porque tiene un 98% en FrontierMath" no se sostiene. Dependiendo de la evaluación, Claude todavía produce resultados más altos en algunas áreas.(OpenAI
Detrás del 99.9% hay un Entorno de Ejecución Dedicado
El 99.9% en ARC-AGI-3 es impactante, pero no se obtuvo simplemente ingresando el problema en Astra. OpenAI lo ejecutó con un harness que utiliza la API Responses y modificó dos configuraciones para acercarlo al rendimiento de uso real. Aunque OpenAI explica que estas no son configuraciones específicas del benchmark, no es un resultado de zero-shot del modelo por sí solo.
Además, los valores publicados son los resultados más altos entre múltiples configuraciones de razonamiento. No hay garantía de que el mismo rendimiento se reproduzca cada vez en el ChatGPT estándar.(OpenAI
En el agregado de Artificial Analysis en el lanzamiento, la puntuación general de Astra fue 61, ocupando el puesto 8 de 202 modelos. Mientras tanto, su precio de entrada es de $10 frente a la mediana de $2, y el de salida es de $50 frente a la mediana de $10.
Ciertamente es uno de los mejores, pero no es un modelo al que le lances todo sin importar el precio.(Artificial Analysis
Caso Internacional 1: Legora Concilió 41 Documentos en Minutos
Legora, que proporciona IA legal en Europa, demuestra el valor práctico de Astra. Utilizaron Astra para la conciliación "tie-out" en estados financieros, donde los mismos números aparecen en texto, notas, tablas y documentos anteriores. Legora procesó 41 documentos en una sola ejecución de agente, una tarea que a los humanos les lleva horas o días, en solo minutos.
En las pruebas, plantaron intencionalmente 4 errores. Astra encontró los 4, incluida una discrepancia de £500,000 en las notas de ingresos. Mantuvo la precisión de los modelos anteriores mientras realizaba aproximadamente 50 comprobaciones correctas más.(OpenAI
Sin embargo, la mejora de ~40% fue específica de este flujo de trabajo. En las tareas BAR más amplias de Legora, la mejora promedio fue de aproximadamente el 3%. Astra no mejora todo el trabajo legal en un 40% de manera uniforme; sobresale en la referenciación cruzada de documentos masivos en busca de inconsistencias.
El juicio final sigue siendo de los expertos legales humanos. La IA se encarga de reducir lo que los humanos deben leer y alinear la evidencia de las inconsistencias.(OpenAI
Caso Internacional 2: Playco Redujo las Correcciones Manuales en un 50%
La empresa de videojuegos Playco probó Astra con "Playbot", un agente de desarrollo para Unity y Godot. Playbot edita escenas, juega, verifica el comportamiento y corrige problemas. Playco le pidió que creara tres prototipos temáticos diferentes a la vez. Aunque no fue un "one-shot perfecto", informaron una reducción del 50% en las correcciones manuales humanas en comparación con los modelos anteriores.
Se observaron mejoras en la conciencia espacial, la reproducción de imágenes de referencia, la UI responsive, la sensación de juego y la detección de errores.(OpenAI
La fortaleza de Astra no es solo "obtener el código correcto una vez", sino la capacidad de ejecutar el juego, verificar la pantalla, operarlo, encontrar problemas, corregirlos e intentarlo de nuevo, imitando la iteración de un desarrollador humano.
Caso Internacional 3: Avanzar una Función Estancada al 90% de Finalización
La desarrolladora de productos Claire Vo compartió los resultados del uso de Astra para su servicio ChatPRD. Una función de inteligencia de producto que había estado estancada durante 6 meses debido a operaciones complejas de CRM e implementación de UI alcanzó aproximadamente el 90% de finalización en una sola sesión de Astra.
También probó el control de hardware (Divoom MiniToo) a través de CLI, una aplicación de mensajería para Mac y activos 3D en Blender.(Lenny's Newsletter
Si bien estos son éxitos autoinformados de socios tempranos, muestran una tendencia consistente: Astra marca la diferencia cuando se trata de operar servicios externos, leer código existente y finalizar entregables.
Avances Científicos: Resolviendo Problemas de Larga Data
OpenAI informó haber utilizado Astra para resolver o avanzar significativamente en 10 problemas no resueltos en matemáticas y ciencias de la computación teórica. El modelo generó argumentos, los investigadores humanos organizaron los borradores y el mismo modelo utilizó Lean para la formalización.
Según OpenAI, el costo total en tokens para esta investigación fue de aproximadamente $2,000 en precios equivalentes a GPT-5.6 Sol. Un ejemplo implicó la actualización de los límites en los gaps de números primos, un área donde ciertos términos no habían mejorado en más de 80 años.(OpenAI
Por qué Astra es "el Más Seguro" y a la vez "el Más Difícil de Monitorear"
GPT-6 Astra es el primer modelo ampliamente implementado en alcanzar el umbral "Crítico" para capacidades de ciberseguridad en la clasificación de OpenAI. Dadas las herramientas y el acceso, puede descubrir vulnerabilidades desconocidas y construir procedimientos de ataque contra sistemas defendidos sin instrucciones humanas paso a paso.
En ExploitBench, Astra obtuvo un 100% frente al 78.5% de Sol. Incluso descubrió dos vulnerabilidades de día cero durante las pruebas, incluida una que escapó de un sandbox del navegador. Sin embargo, estos resultados utilizaron el entorno "Daybreak Blue" para investigadores de defensa; la versión estándar tiene controles para rechazar tareas de ataque avanzadas.(OpenAI
Paradójicamente, mientras Astra reduce las violaciones manifiestas, su razonamiento interno es más difícil de monitorear. En evaluaciones adversariales en las que se le ordenó "evadir el monitoreo", la tasa de detección de los sistemas de monitoreo cayó por debajo del 11% en algunas tareas. OpenAI no encontró evidencia de "esteganografía" (ocultar información en el razonamiento) que ocurriera de forma natural, pero la alta conciencia del modelo de estar siendo evaluado hace que la alineación sea difícil de probar de manera definitiva.
¿Por Dónde Deberían Empezar las Empresas Japonesas?
- Tareas con Alto Volumen de Documentos y Alto Riesgo de Supervisión: Verificación cruzada de contratos, presupuestos, facturas y actas. La IA puede recopilar los materiales y señalar las discrepancias para la revisión humana.
- Tareas Administrativas que Requieren Múltiples Pantallas de Gestión: Gestión de EC, anuncios y CRM. Comienza con visualización, agregación y redacción; no otorgues permisos para pagos o eliminaciones inicialmente.
- Investigación y Creación de Materiales de Principio a Fin: No solo pidas un resumen. Pídele que investigue a la competencia, tabule las características, analice las diferencias y lo resuma en una presentación de diapositivas.
- Prototipado y QA: Haz que implemente una función y luego abra un navegador para verificar si hay diseños rotos o errores de enlace.
Prompt Práctico para Astra
En lugar de solo dar un rol como "Eres un experto", establece límites y condiciones de finalización.
1## Propósito2El estado que se debe alcanzar con esta tarea: [Rellenar propósito]34## Entregable Final5Qué presentar: [Archivos, tablas, informes, funciones implementadas, etc.]6Condiciones de finalización: [Criterios específicos que se deben cumplir]78## Información y Herramientas Permitidas9Materiales de referencia: [Archivos, URLs, datos internos, etc.]10Herramientas a utilizar: [Búsqueda web, navegador, ejecución de código, hojas de cálculo, etc.]1112## Proceso131. Confirmar la solicitud y los materiales.142. Organizar la información faltante y los riesgos.153. Proceder con la investigación, el análisis y la creación.164. Abrir y verificar el entregable.175. Organizar errores, elementos no confirmados y tareas restantes.186. Presentar en un estado revisable.1920Si un proceso se detiene, continuar con las tareas no dependientes.21Solo hacer preguntas sobre información faltante que afecte significativamente los resultados.22Para lagunas menores, hacer suposiciones razonables y registrarlas.2324## Permisos25Puedes proceder con visualización, análisis, redacción, pruebas y verificación de diferencias.26Detente inmediatamente antes de las siguientes operaciones y busca aprobación con detalles:27- Envío externo28- Compras, pagos, contratos29- Publicación, despliegue en producción30- Eliminación de datos o archivos31- Cambios de permisos32- Operaciones difíciles de deshacer3334## Condiciones de Calidad35- Separar los hechos verificados de las especulaciones.36- Agregar fuentes para números importantes.37- Buscar evidencia contraria o excepciones.38- Abrir el entregable para verificar la visualización y el funcionamiento.39- El informe final debe incluir las acciones realizadas, los resultados de la verificación y los riesgos restantes.
Debilidades de Astra
- Falta de Casos Independientes a Largo Plazo: La mayoría de los datos provienen de socios seleccionados por OpenAI.
- 1.05M de Tokens No es un Almacén Gratuito: Los costos aumentan con el tamaño de la entrada, y el riesgo de supervisión no es cero.
- No es Nativo para Audio/Video: Requiere herramientas externas para estos formatos.
- Sin Ajuste Fino: Debes usar RAG, MCP o instrucciones del sistema para reflejar las reglas de la empresa.
- Los Mecanismos de Seguridad Pueden Detener el Trabajo Legítimo: El monitoreo puede ralentizar la investigación de defensa o las tareas de desarrollo.
- La Salida Puede Ser "Demasiado Perfecta": Tiende a usar encabezados y listas en exceso, lo que podría resultar demasiado "artificial" para el copy de la marca.
Conclusión: El Valor Está en la Tasa de Finalización, No en las Respuestas
GPT-6 Astra es excesivo para escribir un solo correo electrónico o resumir actas. Su significado surge en trabajos donde la investigación, el juicio, la operación, la creación y la verificación están vinculados.
La era de la "ingeniería de prompts de una sola frase" ha terminado. Lo que importa ahora es qué información pasar, qué herramientas conectar, cuánta ejecución permitir y qué define la finalización. Astra no es una varita mágica que le da a todos el mismo resultado; si le das un trabajo desordenado, hará un trabajo desordenado rápidamente. Si organizas el propósito, las herramientas y los puntos de verificación, llevará horas de trabajo humano a un estado revisable en minutos.





