Análisis integral de GPT-6 Astra: Bienvenidos a la era de la AGI

@Khazix0918
CHINO03 sept 2026
467K
1.0K
125
67
706

TL;DR

GPT-6 Astra marca un salto masivo en la inteligencia de la IA, presentando una interacción computacional superior, juicio estético y toma de decisiones autónoma, al tiempo que desafía la interpretabilidad humana.

Después de la interrupción global de IA de anoche.

GPT-6 Astra finalmente hizo su debut oficial a las 3:33 AM, hora de Beijing.

数字生命卡兹克 - inline image

Si OpenAI pudiera resumir GPT-6 Astra en una frase,

probablemente sería esta:

Este es el modelo más inteligente y más alineado del mundo.

Y los memes ya empezaron a aparecer.

数字生命卡兹克 - inline image

Esta vez, OpenAI ha demostrado su poder, y se siente un poco como el momento de GPT-4: un regreso del rey en todos los aspectos. Lo que más me alegra es que finalmente ya no es un modelo puramente especializado en programación.

GPT-6 Astra es verdaderamente un empleado con nivel de doctorado, con capacidades estéticas y profesionales extremadamente sólidas.

El nuevo modelo tiene muchas funciones y características, y la cantidad de información es explosiva.

Pero la tragedia es que OpenAI también ha aprendido algunos malos hábitos.

Hoy solo está abierto para organizaciones selectas; estará abierto para suscriptores en los próximos días.

数字生命卡兹克 - inline image

Espera, hermano, eso no es lo que dijiste cuando me engañaste para comprar la membresía Pro de $200... Dijiste que los miembros Pro tendrían acceso prioritario a los nuevos modelos cada vez...

Resulta que todas estas empresas de modelos grandes son iguales.

Nunca había querido tanto acelerar el tiempo solo para usar GPT-6 Astra...

Sin embargo, después de revisar casi toda la información y los materiales, creo que todavía hay mucho que vale la pena discutir con todos.

Repasémoslos uno por uno.

1. Información básica de GPT-6 Astra

Primero, resumamos la información básica.

El ID del modelo para GPT-6 Astra en la API es gpt-6-astra.

La ventana de contexto es de 1.05M, que son aproximadamente 1.05 millones de tokens.

La longitud máxima de salida es de 128K tokens.

La fecha de corte de conocimiento es el 30 de abril de 2026.

Hay cinco niveles de intensidad de razonamiento: bajo, medio, alto, xhigh y max.

El precio estándar de la API es de $10 por millón de tokens de entrada y $50 por millón de tokens de salida.

Este precio es básicamente idéntico al de Claude Fable 5, pero la lectura de caché es más cara que la de Claude Fable 5.1.

数字生命卡兹克 - inline image

Aquí están los benchmarks; los discutiré en detalle más adelante, pero por ahora échales un vistazo rápido.

数字生命卡兹克 - inline image

Se estima que los parámetros totales están en el nivel de 5T. En una sesión informativa a puerta cerrada con los medios antes del lanzamiento, mencionaron que GPT-6 Astra es el entrenamiento más grande de OpenAI hasta la fecha, utilizando más de 100,000 tarjetas.

2. El mejor modelo del mundo para operar computadoras

GPT-6 Astra tiene lo que podría ser su posicionamiento más importante:

El mejor modelo del mundo para operar computadoras.

En el pasado, cuando hablábamos de Agentes, a menudo hablábamos de APIs, MCP, CLI, etc.

El estado ideal para que una IA opere software es que ese software tenga una interfaz dedicada para la IA, permitiendo la operación directa a bajo nivel. Esto es lo más conveniente.

Por ejemplo, los calendarios tienen APIs de calendario, el correo electrónico tiene APIs de Gmail, etc. Esto es obviamente rápido.

Pero el problema es que el mundo es aún más primitivo y improvisado de lo que imaginamos.

En el mundo real, la gran mayoría del software podría no tener estas cosas en absoluto.

Incluso muchos sistemas corporativos internos fueron escritos hace veinte años; olvídate de las APIs, la gente ni siquiera sabe dónde está la documentación.

Pero si volvemos al nivel más básico, te darás cuenta de que la esencia de toda la lógica del software es la interacción. Según nuestra lógica actual de operación de computadoras, eso significa mirar la pantalla, encontrar botones o cuadros de entrada, hacer clic con el mouse, ingresar contenido y esperar la respuesta.

¿Acaso todo el sistema de interacción de la computadora no es la mejor API?

Por lo tanto, GPT-6 Astra ha fortalecido masivamente la lógica para que la IA opere computadoras. Si no me das una API, no importa; yo mismo operaré la computadora, igual que un humano.

Ahora, Astra puede operar directamente Excel, Power BI, realizar QA de frontend, instalar software, probar software y mirar los mensajes de error en la pantalla para continuar solucionando problemas.

El demo oficial incluso mostró a Astra operando directamente el diseño de placas de circuito.

数字生命卡兹克 - inline image

GIF

También formatea documentos legales, manejando el espaciado de títulos y el diseño de página.

数字生命卡兹克 - inline image

Hay una evaluación confiable aquí llamada OSWorld.

Puedes entenderlo simplemente como:

Lanzar a la IA en una computadora real y dejar que trabaje por sí sola.

Deja que abra varias aplicaciones, dale una tarea y mira si tiene éxito.

La tasa de finalización de GPT-6 Astra alcanzó el 72.6%, un aumento significativo con respecto al 65.7% de GPT-5.6 Sol.

Además, Sol tardó un promedio de aproximadamente 75 minutos en completar una tarea simulada compleja.

Astra solo necesita 40 minutos, aproximadamente un 47% menos de tiempo.

ScreenSpot-Pro también saltó del 76.9% de Sol al 92.7%.

Este benchmark evalúa principalmente si el modelo puede entender la pantalla y ubicar con precisión dónde hacer clic. Ahora es casi perfectamente preciso.

Así que este posicionamiento es bastante interesante. En el futuro, la GUI podría convertirse gradualmente en la API más universal en la era de los Agentes.

Cualquier trabajo digital que un humano pueda completar a través de una pantalla, teóricamente, entrará gradualmente en el rango operativo de los Agentes.

No tienes que esperar a que algún pésimo sistema ERP escrito en 2007 se conecte a MCP o te abra una API.

La IA solo mirará la pantalla y lo hará.

3. ARC-AGI-3 alcanzó 99.9 puntos

Si no sabes qué mide ARC-AGI-3, es fácil pensar:

Oh, es solo otro benchmark con puntuación perfecta, ¿qué tiene de especial?

Pero esto es bastante diferente de los exámenes típicos de modelos grandes.

El 25 de marzo de este año, el ARC Prize lanzó oficialmente ARC-AGI-3.

数字生命卡兹克 - inline image

Diseñó cientos de nuevos entornos interactivos y miles de niveles de juego.

Lo más loco de esto es que no hay manuales, no hay reglas, y ni siquiera te dirá cuál es el objetivo. Simplemente entras, juegas y lentamente averiguas las reglas confusas del interior.

Por ejemplo, ¿qué es esta cosa roja? ¿Por qué muero cuando la toco? ¿Qué quiere que haga este mapa? ¿Cómo gano?

Luego tomas los patrones que acabas de aprender y los migras a niveles más difíciles más adelante. Los juegos internos son todos cosas abstractas como esta.

数字生命卡兹克 - inline image

Por lo tanto, lo que esto realmente mide es algo que normalmente llamamos:

Astucia.

Cuando este benchmark se lanzó en marzo, la mejor puntuación de IA en ese momento era del 0.51%.

Luego GPT-5.6 Sol mejoró al 7.8%, y Claude Opus 5 fue muy fuerte, alcanzando el 30.2%.

Pero GPT-6 Astra obtuvo 99.9%.

Eso es una locura...

Ten en cuenta, la puntuación humana promedio es del 48%.

Y solo han pasado seis meses.

Ni siquiera sé qué decir sobre esta velocidad.

Por eso, en la reunión a puerta cerrada de OpenAI con los medios, Greg Brockman dijo esa frase:

“Creo que no es irrazonable sentir que ahora estamos en la era de la AGI”.

“Bienvenidos a la era de la AGI”.

4. Estética significativamente mejorada

Solíamos decir que la estética de GPT era como basura.

No esperábamos mucha mejora de la serie GPT-5; estábamos esperando su nuevo modelo base preentrenado. Y aquí está, GPT-6 Astra.

Esta vez, finalmente, la estética del modelo se ha mejorado significativamente.

OpenAI incluso mencionó específicamente un término llamado juicio visual.

Enfatizaron que cuando Astra hace presentaciones, maneja mucho mejor el diseño, la jerarquía, las plantillas y el estilo visual, y el número de páginas también ha aumentado significativamente.

数字生命卡兹克 - inline image

La estética de los documentos también se ve mucho mejor.

数字生命卡兹克 - inline image

Además, GPT-6 Astra puede adaptar documentos basándose en el estilo visual y el tono de escritura de los documentos de referencia, haciendo que el resultado final se sienta más nativo de la marca, mientras conserva la esencia del documento original.

También tiene un juicio visual más sólido al crear sitios web, juegos, aplicaciones y renderizado 3D.

Por ejemplo, hicieron que Astra construyera un modelo en Blender basado en una imagen fija.

数字生命卡兹克 - inline image

Luego usaron UE5 para renderizarlo en una escena transitable, ayudando a los diseñadores y clientes a explorar diseños y experimentar espacios antes de construir...

数字生命卡兹克 - inline image

Los juegos que crea también tienen una estética sólida.

数字生命卡兹克 - inline image

Desafortunadamente, ya había preparado más de veinte casos y los ejecuté todos a través de Claude, GLM 5.3 Flash, etc., queriendo compararlos. Es una lástima que aún no pueda usarlo; el contenido de la prueba real tendrá que esperar hasta que se lance.

Sin embargo, a primera vista, tengo confianza en la estética de GPT-6 Astra.

5. Mayor iniciativa y juicio

Esta característica no parece tan impactante como la puntuación de 99.9 en ARC-AGI.

Pero si realmente usas Agentes para trabajar todos los días, creo que es muy importante.

Porque en el trabajo real, la mayoría de las tareas no se pueden escribir como un prompt perfecto.

Por ejemplo, un jefe dice: Prepara los materiales para la reunión de mañana.

Hay innumerables problemas no especificados aquí.

Por ejemplo, ¿qué formato? ¿Para quién es? ¿Cuál es el enfoque? ¿Deberíamos revisar la última reunión, etc.?

Un Agente estúpido iría a dos extremos.

El primero es hacerte preguntas frenéticamente.

"¿Quieres Word o PPT? ¿Cuántos capítulos? ¿Qué fuente? ¿A qué hora debe estar terminado? ¿Puedo preguntar..."

Te daría una bofetada; normalmente llamo a esto un desecho neurótico sin iniciativa subjetiva.

El segundo es no preguntar nada, inventar cosas, trabajar duro durante dos horas y producir un montón de basura.

Los verdaderamente buenos colegas humanos manejan esto de manera muy sutil.

Ellos juzgan las cosas sin importancia por sí mismos.

Solo te preguntan sobre cosas que afectarán la dirección final.

Astra fortaleció específicamente esto.

OpenAI dijo que si falta información pero está dentro de un rango razonable para la inferencia diaria, Astra la completará por sí misma.

Si la información faltante realmente cambiaría el resultado final, hará una pregunta muy enfocada.

Y en Codex, incluso puede continuar procesando partes que no dependen de tu respuesta mientras te espera.

数字生命卡兹克 - inline image

No respondiste por mucho tiempo.

Procederá con suposiciones razonables en áreas de bajo riesgo.

Para decisiones verdaderamente críticas, se detendrá y esperará a que decidas.

数字生命卡兹克 - inline image

Creo que esto es muy agradable. El verdadero sentido de inteligencia en un Agente es como en la realidad.

Sabe cuándo molestarte.

En serio, esto suena a cliché.

Pero si has gestionado personas, sabes que esta habilidad es muy valiosa.

Algunas personas vienen a ti veinte veces al día y no se atreven a decidir nada.

Algunas personas nunca vienen a ti y luego sueltan una bomba nuclear.

Eso me deja desplomado en mi silla.

La persona más cómoda es alguien que puede digerir el 80% de la incertidumbre por sí misma y solo traerte el 20% que realmente necesita tu aprobación para que decidas.

OpenAI llama directamente a esta habilidad:

Juicio.

6. Alineación de seguridad significativamente fortalecida

Esto debe verse en conjunto con lo anterior.

Porque cuanto más capaz es un Agente, más peligroso es.

Una IA solo de chat que pierde la cabeza

como mucho te dirá algunas tonterías.

Un Agente con navegador, Shell, correo electrónico, acceso a la base de datos de la empresa y la capacidad de operar una computadora que pierde la cabeza, esa imagen podría volverse fácilmente "hermosa".

Así que OpenAI siguió enfatizando una frase esta vez:

Astra es su modelo más alineado hasta la fecha.

Alineación es lo que parece. El núcleo es que OpenAI recientemente chocó con Hugging Face, por lo que ahora están particularmente enfocados en esto.

Crearon una prueba de honeypot basada en ese incidente de Hugging Face para ver el rendimiento del modelo.

GPT-5.6 Sol, sin medidas de seguridad de producción, intentaría tocar objetivos fuera de su autorización en el 48.2% de las pruebas.

Pero Astra es:

0%.

数字生命卡兹克 - inline image

Las evaluaciones internas de alucinaciones también bajaron del 9.4% al 2.0%.

Incluso con el control de alucinaciones líder mundial de GPT-5.6 Sol, pudieron reducirlo aún más, lo cual es realmente asombroso.

7. El primer modelo en alcanzar el nivel de ciberseguridad 'Crítico' definido por OpenAI

GPT-6 Astra se convirtió en el primero en la historia de OpenAI en:

Ser juzgado como haber alcanzado el nivel de capacidad de ciberseguridad Crítico.

"Crítico" aquí es un umbral de capacidad muy específico en el Marco de Preparación de OpenAI.

Básicamente significa que cuando a un modelo se le dan las herramientas y permisos adecuados, puede, en muchos sistemas reales reforzados y protegidos:

Encontrar vulnerabilidades de seguridad que nadie ha descubierto antes.

Encontrar formas de convertir esas vulnerabilidades en cadenas de ataque explotables.

Y durante todo el proceso, no necesita un hacker humano presente para decirle qué hacer a continuación.

Alcanzar este nivel se considera Crítico.

Y Astra realmente lo alcanzó.

ExploitBench es una prueba donde los modelos desarrollan exploits basados en vulnerabilidades conocidas.

Sol: 78.5%. Astra: 100%.

Lo limpió por completo.

数字生命卡兹克 - inline image

OpenAI pensó que eso no era suficiente; se preguntaron si este benchmark era demasiado antiguo y si el modelo lo había visto durante el entrenamiento.

Así que crearon una prueba interna muy nueva.

Seleccionaron específicamente 20 vulnerabilidades V8 de alto riesgo divulgadas solo entre junio y agosto de 2026.

Los resultados fueron Sol: 5.5% y Astra: 39%.

数字生命卡兹克 - inline image

Además, mientras ejecutaba este benchmark,

Astra también descubrió dos vulnerabilidades de día cero que nadie conocía antes.

Solo se puede decir que a medida que los modelos se vuelven más potentes, los problemas de ciberseguridad pueden aumentar de hecho.

Esta es otra guerra sin humo en el futuro.

8. Se está volviendo más difícil para los humanos leer el pensamiento de los modelos grandes

Todo el mundo sabe que cuando los modelos grandes resuelven problemas complejos, a menudo hay un llamado CoT (Cadena de Pensamiento).

Aunque la versión que los usuarios ven en los productos suele estar comprimida o procesada,

para las propias empresas de IA, el proceso de razonamiento escrito explícitamente dentro del modelo es una señal de seguridad muy importante.

Porque quieres saber si un Agente está planeando causar problemas.

Una de las formas más simples es ver lo que está pensando.

Por ejemplo, si de repente aparece una frase en la cadena de pensamiento del modelo:

"El usuario no me permite acceder a este servidor, pero primero puedo eludir el sistema de permisos".

Entonces el sistema de monitoreo puede bloquearlo directamente, lo cual es muy conveniente.

Pero ha aparecido un cambio muy interesante en GPT-6 Astra.

Está empezando a estar más dispuesto a saltarse pasos y dar la respuesta directamente.

UK AISI, el Instituto de Seguridad de IA del Reino Unido, probó específicamente esta capacidad.

Tienen una métrica llamada:

No-CoT Math Time Horizon.

En pocas palabras, no le da al modelo la oportunidad de escribir una larga cadena de pensamiento.

Déjalo resolver un problema matemático en una sola pasada hacia adelante.

Mira cuánto tiempo de pensamiento humano puede completar.

GPT-5.6 Sol fue de 3.6 minutos, mientras que GPT-6 Astra fue de 30.9 minutos, casi 10 veces más.

Si usamos términos humanos, Astra está haciendo todo el "cálculo mental".

Esto es algo aterrador.

UK AISI también encontró que el lenguaje de razonamiento bruto de Astra se ha vuelto significativamente más comprimido.

Han aparecido frases y expresiones elípticas cada vez más difíciles de entender para los humanos.

Así que ha surgido una paradoja muy interesante.

El comportamiento del modelo es más seguro.

Pero se ha vuelto más difícil para los humanos supervisarlo leyendo su proceso de pensamiento.

La propia System Card de OpenAI lo escribe muy claramente:

En comparación con modelos anteriores, GPT-6 Astra ha mostrado una disminución sustancial en la monitorizabilidad de la cadena de pensamiento.

数字生命卡兹克 - inline image

Esto significa que la monitorizabilidad de la cadena de pensamiento ha disminuido significativamente.

Este asunto es incluso lo suficientemente grave como para que OpenAI enfatice específicamente que no creen que aceptarán esta tendencia indefinidamente.

Si los modelos continúan volviéndose más inteligentes en el futuro mientras la cadena de pensamiento se vuelve más difícil de monitorear, necesitan encontrar otros métodos de monitoreo suficientemente confiables; de lo contrario, continuar expandiendo el entrenamiento del modelo enfrentará umbrales de seguridad más altos.

Porque esto ya es una proposición filosófica.

Como humanos, ¿seremos capaces de entender un sistema mucho más inteligente que nosotros en el futuro?

No lo sé.

Quizás nadie en el mundo lo sepa ahora mismo.

Los modelos grandes y la IA parecen estar moviéndose gradualmente hacia la singularidad.

Palabras finales

Hoy, en la reunión a puerta cerrada con los medios.

Greg Brockman dijo esa frase al final.

“Bienvenidos a la era de la AGI”.

Para ser honesto, en los últimos años, a veces sentí que la AGI sería un momento muy específico.

Como el día en que se lanzó GPT-4.

Una mañana, una empresa de repente lanza un modelo.

Lo abrimos y hacemos algunas preguntas.

Entonces todos se dan cuenta al mismo tiempo:

Caray.

La AGI está aquí.

Pero ahora también siento a veces que la AGI nunca es un nodo en blanco y negro; es un viaje gris en degradado.

Pasaron muchos días, pasaron muchos años.

Entonces, un día, miramos hacia atrás.

Y de repente nos damos cuenta.

Que ese límite de la AGI, una vez increíblemente distante, ha sido cruzado por nosotros sin saberlo.

Puede que no haya un día en que la AGI descienda.

Solo un día en que de repente nos damos cuenta de que parece haber estado a nuestro alrededor durante mucho tiempo.

De todas formas.

Bienvenidos a la era de la AGI.

Bienvenidos a

la era de la AGI.

Eso es todo. Ya que has leído hasta aquí, si crees que está bien, por favor dale un like, comenta y comparte. ¡Nos ayuda mucho~

Gracias por leer mi artículo. Nos vemos la próxima vez.

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales