Cómo piensa realmente GPT 6 Astra

@Mikadzyki_NFT
INGLÉS08 sept 2026
955K
83
16
16
142

TL;DR

GPT 6 Astra introduce una arquitectura de transformador en bucle que permite al modelo reutilizar pesos y procesar estados internos varias veces antes de generar texto. Esto desacopla el recuento de parámetros de la profundidad computacional, permitiendo una computación adaptativa durante la inferencia.

**

OpenAI describe a GPT 6 Astra como su modelo más capaz y alineado hasta la fecha.

Greg Brockman fue más allá, diciendo que sería razonable considerar a Astra como una forma temprana de inteligencia general artificial.

El modelo también se convirtió en el primero en cruzar el umbral Crítico de OpenAI para ciberseguridad. Según la empresa, puede descubrir vulnerabilidades previamente desconocidas y construir exploits funcionales con guía humana limitada.

Esas afirmaciones son dramáticas, pero no son la parte más importante del lanzamiento.

El cambio real es arquitectónico.

Un modelo de lenguaje convencional pasa información a través de una secuencia fija de bloques transformadores y genera el siguiente token. Astra puede procesar su estado interno a través de los mismos bloques computacionales múltiples veces antes de mostrar al usuario una sola palabra.

No simplemente genera una cadena de pensamiento más larga.

Dedica más tiempo a pensar antes de responder.

1 Cómo funcionan los modelos de lenguaje modernos

Imagina escribir:

El Everest es...

El modelo tiene que predecir lo que viene a continuación.

Su mecanismo de atención determina qué partes del contexto importan. La palabra Everest activa conceptos relacionados como montañas, altitud, el Himalaya, Nepal, Tíbet, escalada y expediciones.

El modelo luego combina esas asociaciones con el contexto circundante. En la mayoría de los casos, una continuación como la montaña más alta de la Tierra se vuelve altamente probable.

Dentro de un transformador convencional, esta representación se mueve a través de una secuencia de bloques. Cada bloque la transforma una vez y pasa el resultado al siguiente.

Si un modelo contiene 40 bloques, el estado oculto se mueve a través de los 40 en secuencia. La representación final se convierte en una distribución de probabilidad para el siguiente token.

Más bloques generalmente significan mayor profundidad computacional. Un modelo más profundo puede realizar más transformaciones antes de comprometerse con una respuesta.

Pero agregar bloques también aumenta la cantidad de parámetros, los requisitos de memoria y el costo de entrenamiento.

La suposición habitual ha sido simple: si quieres un modelo más profundo, necesitas construir una pila más grande de capas.

Una arquitectura en bucle cambia ese principio.

2 Qué cambia una arquitectura en bucle

Según informes de The Information, GPT 6 Astra utiliza una arquitectura de transformador en bucle.

OpenAI no ha publicado una especificación técnica completa, por lo que la implementación exacta sigue siendo privada. Pero el mecanismo general ya se comprende bien a partir de la investigación pública.

En lugar de enviar el estado oculto a través de cada bloque solo una vez, el modelo puede devolver el resultado a un bloque computacional y procesarlo nuevamente.

Piénsalo como un borrador interno.

El modelo produce una representación preliminar, la envía a través de los mismos pesos nuevamente, la refina y repite el proceso varias veces. Solo después de que el bucle se completa aparece el siguiente token visible.

Mikadzyki🌙 - inline image

El recuento de parámetros se mantiene igual. Los pesos permanecen dentro de un bloque, el cómputo crece con el número de bucles y solo se emite el token final.

El detalle clave es que la cantidad de parámetros no necesariamente aumenta.

Los mismos pesos se reutilizan en cada pasada.

Lo que aumenta es la cantidad de cómputo.

En un transformador convencional, un token viaja a través de una secuencia de diferentes bloques. En un transformador en bucle, puede viajar a través de la misma estructura compartida múltiples veces.

El modelo se vuelve más profundo a través del cómputo sin volverse más grande a través del recuento de parámetros.

Esto crea una nueva compensación:

  • Más parámetros requieren más memoria
  • Más bucles requieren más cómputo
  • Un modelo puede gastar diferentes cantidades de cómputo en diferentes tareas

El último punto es especialmente importante. La profundidad computacional puede cambiar sin crear un nuevo modelo.

3 Cómo se entrena la profundidad recurrente

Simplemente colocar un bloque transformador dentro de un bucle no es suficiente.

Si un modelo siempre realiza exactamente 32 pasadas durante el entrenamiento, puede aprender a depender de la posición de cada paso. La primera pasada podría aprender una función, la décima otra, y la trigésima segunda podría convertirse en una capa de salida fija.

El resultado sería una red convencional de 32 capas disfrazada de bucle.

Los investigadores resuelven este problema variando el número de pasadas recurrentes durante el entrenamiento.

Una de las demostraciones más claras provino del modelo de profundidad recurrente Huginn. Sus creadores entrenaron una red de 3.5 mil millones de parámetros en aproximadamente 800 mil millones de tokens.

En cada paso de entrenamiento, el número de bucles se muestreaba de una distribución con una media cercana a 32. Un ejemplo podría recibir cuatro pasadas, otro 17, otro 40 y otro cerca de 90.

El modelo no podía saber de antemano cuál sería su última pasada.

Por lo tanto, tenía que aprender algo más general que una secuencia fija de operaciones.

Tenía que aprender cómo mejorar su estado interno actual.

Mikadzyki🌙 - inline image

Resumen del artículo de Profundidad Recurrente en arXiv

Entrenar a través de docenas de pasos recurrentes crea otro problema: la memoria.

La retropropagación estándar requeriría almacenar las activaciones intermedias de cada bucle. Con suficientes repeticiones, el costo de memoria se vuelve enorme.

Los investigadores de Huginn utilizaron un compromiso práctico. La pasada hacia adelante podía ejecutarse durante muchos bucles, pero los gradientes se calculaban solo a través de los ocho finales.

Las pasadas anteriores aún influían en el resultado final, pero su historial completo de activación no tenía que permanecer en la memoria.

Esto es similar a la retropropagación truncada a través del tiempo. La diferencia es que la recurrencia ocurre a través de la profundidad computacional en lugar de a través de palabras en una secuencia.

Mikadzyki🌙 - inline image

El número de bucles se muestrea en cada paso de entrenamiento, mientras que el gradiente se calcula solo a través de las ocho pasadas finales.

El modelo no está siendo enseñado a realizar una secuencia rígida de 32 operaciones.

Está siendo enseñado a mover su estado oculto hacia una respuesta útil independientemente de cuándo se detenga el proceso.

Eso cambia lo que significa profundidad.

La profundidad ya no es solo una propiedad elegida por los ingenieros antes del entrenamiento. Puede convertirse en una variable durante la inferencia.

4 Cómputo adaptativo durante la inferencia

La mayoría de los controles de razonamiento actuales operan a nivel de tokens visibles.

Si se le pide a un modelo que piense más tiempo, genera una cadena de pensamiento más larga, usa más tokens de salida o crea texto intermedio adicional.

Una arquitectura en bucle ofrece un mecanismo diferente.

El número de pasadas internas puede cambiar sin modificar los pesos y sin obligar al modelo a escribir una explicación más larga.

Una tarea simple podría recibir cuatro bucles.

Una demostración matemática difícil podría recibir 32.

Un problema de codificación complejo podría recibir 64.

El modelo sigue siendo el mismo. Solo cambia la cantidad de cómputo interno.

Mikadzyki🌙 - inline image

Los pesos permanecen fijos. Solo cambia el número de pasadas internas utilizadas para procesar cada token.

Los experimentos públicos de profundidad recurrente ya muestran el patrón esperado.

El rendimiento mejora rápidamente durante los primeros bucles. Las ganancias luego se vuelven más pequeñas hasta que las curvas se acercan a una meseta.

Esto sugiere que el estado oculto está convergiendo.

Las pasadas tempranas hacen grandes correcciones. Las pasadas posteriores refinan detalles más pequeños. Eventualmente, el cómputo adicional deja de producir mejoras significativas.

Un sistema futuro podría detectar ese momento automáticamente.

En lugar de asignar a cada indicación un recuento fijo de bucles, el modelo podría continuar procesando hasta que su estado oculto se vuelva lo suficientemente estable. Los tokens fáciles serían baratos. Los tokens difíciles recibirían más cómputo.

Eso crearía una profundidad computacional adaptativa genuina.

Pensar más tiempo ya no tendría que significar escribir más.

5 Investigación y resultados prácticos tempranos

Reutilizar capas de transformadores no es una idea nueva.

Los Transformadores Universales introdujeron el procesamiento recurrente en 2018. ALBERT redujo los recuentos de parámetros compartiendo pesos entre capas. Mixture of Recursions exploró el enrutamiento de tokens a través de diferentes cantidades de cómputo.

El modelo abierto Nanbeige4.2 3B proporciona un ejemplo especialmente directo.

Su configuración contiene 22 capas y num_loops: 2. En efecto, el modelo viaja a través de esas capas dos veces. Tiene aproximadamente el recuento de parámetros de una red de 22 capas pero aproximadamente la profundidad computacional de una red de 44 capas.

Mikadzyki🌙 - inline image

Configuración de Nanbeige4.2 3B en Hugging Face

Veintidós capas, num_loops: 2 y una licencia Apache 2.0. El mecanismo ya es visible en una configuración de modelo abierto.

Durante años, los diseños de transformadores recurrentes siguieron siendo ideas de investigación interesantes en lugar del enfoque dominante.

El ingrediente faltante era una evidencia sólida de escalado.

El 1 de septiembre, un grupo de investigadores publicó SMELT, un estudio diseñado para comparar transformadores en bucle y convencionales bajo condiciones equivalentes.

Controlaron el recuento de parámetros, el cómputo de entrenamiento y el tamaño de la caché KV. Bajo esas restricciones, los modelos en bucle requirieron entre un 6.8% y un 18% menos de cómputo de entrenamiento para alcanzar el mismo nivel de rendimiento.

Las mayores ganancias aparecieron en código.

Mikadzyki🌙 - inline image

Resumen del artículo SMELT en arXiv

Con cómputo, parámetros y caché KV igualados, el bucle ahorra entre un 6.8% y un 18% del cómputo de entrenamiento, con las ganancias más fuertes en código.

Los investigadores también observaron un cambio en el comportamiento de atención.

En los transformadores convencionales, los primeros tokens en una secuencia a menudo se convierten en sumideros de atención. Reciben una cantidad desproporcionada de atención incluso cuando su importancia semántica es limitada.

Después de una segunda pasada a través de los mismos bloques, la atención del modelo se desplazó hacia tokens más relevantes.

El segundo bucle no simplemente repitió el primero. Usó el resultado de la primera pasada como base para un procesamiento más selectivo.

SMELT no prueba que todos los modelos futuros deban ser recurrentes. Sí muestra que el bucle sigue siendo competitivo después de que las principales condiciones experimentales se igualan.

La pregunta ya no es si la profundidad recurrente puede funcionar.

La pregunta es hasta dónde puede escalar.

6 Interpretabilidad y control

La misma característica arquitectónica que hace atractivos los bucles también complica el monitoreo del modelo.

Con el razonamiento explícito de cadena de pensamiento, al menos algunos pasos intermedios aparecen como texto legible. Los investigadores pueden inspeccionarlos, buscar patrones sospechosos y comparar el razonamiento declarado con la respuesta final.

Un modelo recurrente puede realizar más procesamiento dentro de activaciones ocultas sin generar ningún texto.

Buck Shlegeris y Ryan Greenblatt han argumentado que esto podría reducir la utilidad del monitoreo de la cadena de pensamiento. Si más procesamiento se traslada al cómputo oculto, la explicación visible puede revelar menos sobre cómo el modelo alcanzó su resultado.

Sebastian Raschka ofreció un contrapunto importante.

Reutilizar pesos no crea automáticamente cognición secreta o inaccesible. Las activaciones internas aún pueden estudiarse con herramientas de interpretabilidad. La principal diferencia es que el modelo puede necesitar menos tokens intermedios visibles porque más cómputo ocurre antes de que comience la generación.

El científico jefe de OpenAI, Jakub Pachocki, también ha dicho que el gráfico computacional de Astra permanece dentro de aproximadamente un factor de dos de la profundidad de GPT 4 y que el bucle fue deliberadamente limitado para preservar las capacidades de monitoreo.

Eso sugiere una implementación restringida en lugar de un proceso recurrente ilimitado.

Una cadena de pensamiento no está garantizada para ser una transcripción fiel del cómputo interno de un modelo en primer lugar. El sistema es recompensado por producir respuestas útiles, no por proporcionar un informe científicamente preciso de cada operación oculta.

La investigación que involucra a OpenAI, Anthropic y Google DeepMind muestra que la explicación de un modelo puede omitir factores importantes, racionalizar una decisión después del hecho o presentar un camino más limpio que el que realmente influyó en el resultado.

Una arquitectura en bucle hace que esta distinción sea más difícil de ignorar.

El razonamiento visible puede ser una interfaz.

El cómputo principal puede ocurrir dentro del modelo antes de que aparezca cualquier texto.

7 Resultados de GPT 6 Astra

El resultado de referencia más espectacular de GPT 6 Astra es una puntuación del 99.9% en ARC AGI 3.

Ese número suena casi definitivo, pero depende en gran medida de cómo se ejecuta la prueba.

Simon Willison destacó que el resultado del 99.9% provino del arnés personalizado Provider Adapter de OpenAI. Bajo el arnés estándar de ARC Prize, el mismo modelo obtuvo un 62.7%.

El modelo no cambió.

El entorno de evaluación sí lo hizo.

Mikadzyki🌙 - inline image

El mismo modelo produce dos puntuaciones diferentes a dos costos de ejecución diferentes.

La ejecución de OpenAI costó aproximadamente $19,000. La ejecución estándar costó aproximadamente $26,000.

La puntuación significativamente más alta también fue producida por la configuración más barata.

Eso no necesariamente invalida el resultado. Un adaptador personalizado puede interactuar con el modelo de manera más efectiva o exponer capacidades que un marco de evaluación genérico pasa por alto.

Pero el número del titular no puede interpretarse por separado de las condiciones que lo produjeron.

Mikadzyki🌙 - inline image

GPT 6 Astra en ARC AGI 3

Un modelo, dos arneses de evaluación y una brecha de 37.2 puntos porcentuales.

Otras evaluaciones son menos dramáticas.

En el Índice de Inteligencia de Artificial Analysis, Astra obtiene una puntuación aproximadamente a la par con GPT 5.6 Sol y unos cinco puntos por debajo de Claude Fable 5.1.

Su ventaja más práctica puede ser la eficiencia en tareas de agente, donde puede alcanzar un rendimiento competitivo a un costo menor.

Los puntos de referencia muestran lo que un modelo puede lograr. La arquitectura ayuda a explicar de dónde provienen esas capacidades y cómo podrían desarrollarse.

8 Qué significa esto para el futuro de la IA

Durante años, escalar modelos de lenguaje significó principalmente agregar parámetros, agregar datos y construir pilas fijas más grandes de bloques transformadores.

Cada nueva generación se volvió más grande, más costosa y más exigente de ejecutar.

GPT 6 Astra apunta hacia otro camino.

Un modelo puede reutilizar los mismos parámetros, asignar más cómputo a tareas difíciles y refinar su representación interna antes de producir su primera palabra.

Esto separa el tamaño del modelo de la profundidad de su razonamiento.

En lugar de seguir una ruta computacional fija, el sistema puede ajustar la cantidad de trabajo a la dificultad de un problema específico.

Eso podría cambiar tanto el rendimiento del modelo como la economía de usar IA. La misma inteligencia podría operar en un modo rápido y económico para solicitudes simples, luego aumentar su profundidad computacional cuando una tarea realmente requiere más razonamiento.

La recurrencia está regresando a los modelos de lenguaje. Esta vez, opera no principalmente entre palabras, sino dentro del proceso que las crea.

La próxima generación de sistemas puede no volverse más poderosa solo porque contiene más parámetros.

Su ventaja definitoria puede ser saber cuándo ya se ha encontrado una buena respuesta y cuándo vale la pena dar una vuelta más al bucle interno.

Fuentes

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales