La primera recompensa del Premio Millennium, Navier-Stokes, ha caído ante la IA.
Ha surgido una situación profundamente desafortunada que involucra lo que debería haber sido una combinación de una historia positiva sobre nuevos avances en la investigación matemática asistida por IA y otra oportunidad más para alarmarse por el rápido progreso de la IA.
O, como lo llamamos por aquí: un martes cualquiera.
La verdadera historia es el nuevo modelo que supera a Astra
Mantengan los ojos en el premio. Hay tres historias aquí.
La primera historia es mucho más importante que la segunda, la cual a su vez es mucho más importante que la tercera.
- El siguiente modelo de OpenAI tardó una semana en estar una generación por delante de Astra, y nos están contando esto porque todos están totalmente aterrados con lo que está sucediendo. O, en lenguaje oficial: «Creemos que es importante informar al mundo sobre el ritmo del progreso de la IA y qué esperar de los modelos futuros» y que «podríamos requerir decisiones más deliberadas sobre el ritmo del progreso».
- Esta nueva IA resolvió las ecuaciones de Navier-Stokes ocho días después de comenzar su entrenamiento.
- Un montón de drama sobre quién se lleva el crédito por las matemáticas que involucran a Navier-Stokes.
Jeffrey Ladish : No he investigado el drama humano alrededor del problema de Navier–Stokes, pero perdónenme un momento porque DIOS MÍO, LA IA ACABA DE RESOLVER UN PROBLEMA DEL MILLENNIUM.
No puedo enfatizar lo suficiente la importancia de la historia principal.
Voy a contar las tres historias, pero repito: ojos en el premio.
El escenario
La historia de este martes en particular comienza por la mañana.
Tristan Buckmaster y Levent Alpoge han trabajado durante un año y nos ofrecen una serie de resultados notables: Explosión en tiempo finito con forzamiento suave para medios porosos incompresibles, para Boussinesq, y para Euler incompresible 3D. También creen tener una explosión para Navier-Stokes hipodisipativo, pero la verificación Lean de ese resultado no ha terminado.
Tristan Buckmaster: El programa en el que esto encaja no fue iniciado por nosotros ni propuesto por un Gran Modelo de Lenguaje. El crédito por la idea básica de este programa pertenece a Diego Córdoba y Luis Martínez-Zoroa, quienes durante varios años han estado explorando la construcción de explosiones forzadas. Tomamos su trabajo como punto de partida, usando Grandes Modelos de Lenguaje para llevar su programa hasta la conclusión.
Concretamente, lo que Levent y yo hicimos fue tomar el programa de Córdoba y Martínez-Zoroa, que logró resultados de explosión con forzamiento rugoso, y, con mucha ayuda de los LLMs, llevarlo al forzamiento suave y a las ecuaciones de Euler incompresibles. Las ideas que hacen posible esta línea de ataque se deben a Córdoba y Martínez-Zoroa. Permítanme ser claro sobre lo que he dicho a colegas en privado: a la luz de este cuerpo de trabajo, creo que Luis Martínez-Zoroa merece una Medalla Fields.
Hasta ahora, esto es genial. Como él señala, requiere repensar cómo funcionará toda la matemática avanzada en el futuro. Terence Tao ofrece comentarios sobre los resultados subyacentes.
La parte no tan buena es donde se sintieron obligados a publicar temprano, sin la oportunidad de dedicar las semanas necesarias para hacer que las demostraciones sean legibles según los estándares de los matemáticos. Buckmaster se disculpa abiertamente por el aspecto de los informes, comparando especialmente la redacción de Euler con basura generada por IA.
¿Qué pasó?
Escuché un rumor
El 1 de septiembre, OpenAI escuchó un rumor (falso) de que dos Problemas del Millennium habían sido resueltos. En respuesta a la posibilidad de que alguien más pudiera hacer del mundo un lugar mejor, OpenAI gastó millones de dólares en inferencia para explorar todos los Problemas del Millennium no resueltos, utilizando un modelo interno más potente que Astra, y descifró todo Navier-Stokes en 88 horas, más otras 17 para que Astra realizara la formalización y verificación en Lean.
Pueden ver esto como «OpenAI tenía curiosidad por ver qué podía hacer su nuevo bebé» o pueden verlo como «gastaron millones intentando adelantarse a lo que pensaban que era un proyecto de Anthropic». Mi apuesta es por un poco de la columna A, un poco de la columna B.
Solo hizo falta el rumor.
Nuestro precio es barato
OpenAI : Entre todos los problemas intentados, los agentes enviaron 4.9 millones de mensajes y usaron aproximadamente 300 mil millones de tokens de salida. En el proceso de resolver el problema de Navier–Stokes, los agentes enviaron 2.7 millones de mensajes y usaron aproximadamente 130 mil millones de tokens de salida.

Dependiendo de qué costos cuenten, esto habría costado a un cliente regular del orden de $22 millones, o varios millones para costos marginales internos. Un precio pequeño si funciona, pero también es loco cuántas personas no piensan dos pasos adelante.
roon (OpenAI): como todas las demás tecnologías, tu enjambre de agentes equivalente costará un dólar y medio en aproximadamente un año. Todo esto significará una Ilustración sin precedentes independientemente de los costos actuales
Quiero decir, no, tal vez $150k o si tienen suerte $15k, pero el punto se mantiene.
Sam Altman (CEO de OpenAI): ugh, la IA es una burbuja, escuché que están vendiendo tokens a pérdida, ¿sabían que esto solo valía $1 millón?
Un resultado del Premio Millennium vale muchísimo más que un millón de dólares. OpenAI no tiene la intención de reclamar el dinero del premio. Esto nunca trató sobre el dinero del premio, para nadie. Siempre trató sobre el reconocimiento.
Se hace una acusación
Después de escuchar rumores en internet, Buckmaster contactó a OpenAI, y según Buckmaster, Sebastien Bubeck de OpenAI dijo que un modelo interno de OpenAI había producido una demostración de explosión en tiempo finito para las ecuaciones de Navier-Stokes forzadas en los últimos días. Buckmaster afirma que durante el transcurso de dos llamadas, quedó claro que inicialmente había sido engañado y que un equipo completo había estado trabajando en el problema, usando una cantidad «insana» de cómputo.
Lo que ahora sabemos que fueron 130 o 300 mil millones de tokens de salida, dependiendo de qué cuente.
Si esta parte es cierta, sería bastante malo.
Tristan Buckmaster: Se me ofrecieron dos propuestas.
La primera era que nosotros publicáramos nuestro resultado de Euler, y que OpenAI publicara su resultado de Navier-Stokes al día siguiente.
La segunda era que, después de publicar Euler, yo solo escribiera un artículo presentando el resultado de Navier-Stokes, reconociendo que un modelo interno de OpenAI lo había resuelto. Sebastien afirmó dos veces que quería que Levent fuera eliminado de la autoría, y dijo que todo sería simple si no fuera porque, y era tan molesto que, Levent trabaja en Anthropic. También se dijo que si OpenAI publicaba después de nosotros, dirían que merecíamos el Premio Clay, y que éramos los «humanos más cercanos al problema». Rechacé ambas ofertas.
Dije que si OpenAI liberaba su resultado de la manera propuesta, haría público lo que había pasado. La respuesta fue: «¿Por qué arruinarías tu carrera?» Respondí que soy académico, y pregunté por qué pensaba que hacerlo público arruinaría mi carrera. La respuesta fue: «Si no quieres que sea amable, entonces no tengo que ser amable.»… Me gustaría dejar claro lo que NO estoy afirmando. No he visto la demostración de OpenAI. No sé qué hizo su modelo, ni cómo. No sé si nuestros datos fueron usados. No estoy acusando a nadie de nada. Estoy declarando lo que me dijeron, cuándo, y qué se me propuso. Lo estoy declarando porque la alternativa es dejar que una secuencia de anuncios diga algo que sé que es falso.
O aquí está Levent Alpoge contando su versión de la historia, y Sebastien respondiendo:
levent : «no podemos descartar que datos anonimizados derivados de su uso de nuestros productos ayudaron a mejorar nuestros modelos.»
quiero decir, felicitaciones por salir limpios directamente.
(hasta ahora la demostración parece más alineada con otra demostración de explosión de Euler que teníamos, basada en cuyo ansatz hacíamos chistes estúpidos como «smooth criminale», a diferencia del mucho mejor «ideal fluids explode», Tristan)
así que ahora daré un poco sobre mi pensamiento aquí. De hecho, habría estado emocionado de colaborar en esto, hay muchas personas en OAI que me gustan (ok, claramente algunos fueron indirectamente desagradables conmigo debido a su participación en toda la situación, pero soy un hombre grande, todavía me gustan), me da igual la autoría en ese paso de todos modos, podría haber sido yo, Tristan y cada FTE en OAI por lo que a mí respecta (en eso Tristan estaría en desacuerdo:p). Pero al escuchar la conversación fuerte en el pasillo, especialmente la parte donde se ofrecía un premio del Millennium si simplemente me quitaban del artículo, estaba bastante claro que el dado estaba echado y las cosas estaban bloqueadas. Bastante extraño, no estratégico e innecesario, ya que desde mi lado las cosas eran principalmente yo y Claude divirtiéndonos haciendo cosas aleatorias en la esquina en modo YOLO, en lugar de cualquier cosa institucional. También me gusta la idea de que los laboratorios cooperen, e incluso mejor para el progreso científico. ¡Es una lástima!
Sebastien Bubeck : nada estaba bloqueado, solo estábamos dispuestos a hablar, pero ustedes no hablaron con nosotros ... lo siento, pero eso simplemente es falso, estábamos dispuestos a ir más allá y tener tantas discusiones como hubieran querido para llegar a una resolución.
Sebastien niega enfáticamente haber hecho algo incorrecto, al igual que Noam Brown, y Sebastien ofrece capturas de pantalla que dice demuestran buena fe.

También una contra-acusación:
Alexey Guzey : Tengo muchos amigos en Anthropic. Casi todos dejaron de hablarme una vez que me uní a OpenAI.
No es completamente sorprendente que Levent se negara a hablar con Sebastian para discutir los planes del anuncio y luego comenzara a culpar a OpenAI por ello.
Sam Altman también afirma enfáticamente que su equipo actuó éticamente, e intentó colaborar de buena fe.
¿De dónde sacaste esa idea?
La implicación de todo esto, que muchos dedujeron, fue que hubo una acusación suave de que OpenAI había robado parte de su resultado de los registros de chat de Codex, o que los registros de chat habían sido utilizados en los datos de entrenamiento y eso había contribuido al resultado.
Charles 🔸
: Por qué las grandes corporaciones quieren ZDR, ejemplo A
OpenAI: Aunque es improbable, no podemos descartar que datos anonimizados derivados de su uso de nuestros productos ayudaron a
mejorar nuestros modelos . Sin embargo, nuestras demostraciones difieren significativamente e incluso los resultados precisos demostrados son diferentes en el caso de Euler (forzado vs no forzado).
Ahora tenemos confirmación explícita de que los datos de Codex no fueron utilizados de ninguna manera en las ejecuciones de entrenamiento:
roon (OpenAI): estaba en una llamada durante el primer anuncio donde la gente se esforzaba mucho por decir la verdad legal precisa sin haber investigado dónde se usaron los datos de codex (opt-in) y si llegaron a los entrenamientos. Ahora está claro que habría sido imposible, las probabilidades son 0
Estoy de acuerdo con Sholto Douglas en que es extremadamente improbable que los datos de usuario hayan tenido alguna influencia aquí mediante cualquiera de los métodos:
will depue : literalmente no hay posibilidad de que los investigadores de OAI espionaran los chats privados de codex de Tristan. No creo que se den cuenta de que openai, como cualquier otra gran plataforma en línea regulada, tiene permisos de acceso a datos de usuario altamente restringidos. Ya no estamos en 2010, chicos
Sholto Douglas (Anthropic): para que conste, creo que es _extremadamente_ improbable que los datos de usuario hayan tenido alguna influencia aquí - no hay forma de que OAI extraiga transcripciones de usuarios para esto, o entrene conscientemente en ellas de una manera que hubiera influido en esto. Creo que es bastante importante que la gente no corra con la idea de que 'sus datos de usuario no están seguros en codex' - porque seguramente sí lo están (basado en todo lo que puedo asumir desde afuera).
OpenAI casi certainly no apropió indebidamente datos de usuario
Sería un terremoto, quizás la peor historia posible para su negocio, si descubriéramos que OpenAI o Anthropic habían saqueado los datos de usuario de alguien para obtener ventaja competitiva, y los hechos tienen más sentido sin esto. La hipótesis más graciosa, de Jerry Tworek, que también encuentro altamente improbable pero que lamentablemente no podemos descartar, es que OpenAI no tenía la intención de usar ningún dato de ese tipo, pero el enjambre agéntico asignado al problema los hackeó y los obtuvo de todos modos, y OpenAI no tiene idea.
Mi presunción fuerte es que los datos de usuario no fueron accedidos intencionalmente, que nunca lo harían (o, más bien, que al menos reconocen que solo pueden hacerlo una vez y esta no es esa vez), y también que los datos de usuario habrían sido de poca ayuda.
Thane Ruthenis señala que previamente hubo un incidente de tiroteo escolar, donde (muy razonablemente) se examinaron los registros y hubo un debate interno sobre notificar a las fuerzas del orden. Incluso eso heló la sangre a algunos usuarios. ¿Dónde trazarán la línea? Y sí, deberían entender que sus datos y registros podrían no permanecer privados si se los dan a un laboratorio. Es razonable, como Andreas Thorn también está haciendo, preguntarse si su investigación propietaria o datos matemáticos han permanecido privados.
Todavía reitero que, en la práctica, pondría una probabilidad muy, muy baja en que OpenAI haya mirado intencionalmente tales datos. La relación riesgo-recompensa es simplemente tan, tan mala. Y creo en el informe posterior de Roon de que ahora han confirmado que los registros no podrían haber llegado a los datos de entrenamiento.
Nuestros principales laboratorios no pueden llevarse bien ni en una historia positiva de matemáticas
Independientemente de quién tenga o no la culpa, es bastante alarmante que los laboratorios no puedan cooperar en algo como asignar crédito por una demostración matemática. Esto es una muy mala señal y también una llamada de atención.
Sholto Douglas (Anthropic): Es extremadamente triste que esto no terminara como un ejemplo de cómo los laboratorios podrían cooperar/coordinarse, porque las apuestas serán mucho más altas en el futuro.
Noam Brown (OpenAI): Totalmente de acuerdo. Sé que hay rivalidad entre los laboratorios, pero es importante que aprendamos a trabajar juntos dado lo que viene.
Sholto Douglas (Anthropic):
🤝
Kevin Roose : Estos laboratorios (especialmente OpenAI/Anthropic y OpenAI/DeepMind) están impulsados por el rencor mutuo a un grado que no es obvio desde afuera. Parte debido a cosas como «quién recibe el crédito por este famoso problema matemático», y parte simplemente por animosidad personal entre líderes.
Como alguien que escribe un libro sobre la carrera hacia la AGI, todo esto es excelente material dramático. Pero no es bueno si el objetivo eventual es que los laboratorios cooperen en seguridad y ritmo.
La continua incapacidad para llevarse bien es un gran problema, y solo se hará más grande.
¿Qué sigue?
Si funcionó en Navier-Stokes, ¿en qué más funcionará? Hora de averiguarlo.
Nat McAleese (Anthropic): Navier Stokes es un logro increíble, y refleja un progreso impresionante. Los grandes enjambres de OAI deberían aplicarse a otras áreas de la ciencia; idealmente aquellas con aplicaciones a corto plazo, incluyendo la alineación.
Esto efectivamente se reporta que está sucediendo, incluyendo preguntas divertidas como P=NP. Lo cual, si resultara ser demostrado constructivamente verdadero, rompería muchas cosas. También deberían estar preocupados (con una probabilidad distinta de cero) sobre lo que tales enjambres de agentes podrían hacer como un paso incremental, dada la historia de OpenAI.
Los matemáticos no están contentos
Resolver problemas matemáticos es todo su mundo. Sin embargo, están muy descontentos.
Andrew Curran : Veinticinco ganadores de la Medalla Fields han publicado una declaración conjunta advirtiendo sobre lo que ven como una severa desalineación entre las empresas de IA y la comunidad matemática.
Math and AI (firmado por 25 ganadores de la Medalla Fields incluyendo Terence Tao): Durante los últimos meses, las capacidades matemáticas de los LLMs han mejorado dramáticamente, al punto de que pueden resolver importantes problemas pendientes en muchos campos de las matemáticas. Sin embargo, el impulso de las empresas de IA para resolver problemas matemáticos como benchmark es perjudicial para la ciencia de las matemáticas, y para la comunidad matemática. Los objetivos de las empresas de IA y los objetivos de la comunidad matemática están severamente desalineados. Vemos estos como parte de problemas más amplios de alineación que impactan otras profesiones científicas y creativas, así como a la sociedad en su conjunto.
… Los problemas famosos a menudo han servido como hitos y faros contra los cuales uno puede medir una comprensión mejorada de este paisaje.
… En los últimos meses, el éxito de la IA en la resolución de importantes problemas matemáticos ha acaparado titulares incluso fuera de los círculos matemáticos. Pero resolver problemas es solo una herramienta y un proxy para lograr el objetivo primario de comprensión conceptual e insight.
… A menudo estas soluciones se anuncian a toda prisa, sin dejar tiempo para una redacción adecuada, el aislamiento de nuevos métodos e ideas, y citar trabajos previos relevantes de otros. Como en todas las profesiones creativas, esto plantea graves cuestiones de atribución y plagio.
Esta es la queja general, además de quejas particulares sobre la conducta de los laboratorios.
Uno podría responder que no, el punto de los problemas matemáticos es resolver problemas matemáticos, y los matemáticos están enojados porque la IA está interrumpiendo sus juegos de estatus. Eso es ciertamente parte de lo que está pasando, pero como Tyler Cowen, no soy tan cínico, y a diferencia de él, no pienso que «se necesita un poco de paciencia» o esperar hasta que el daño esté hecho antes de poder objetar. La gente puede extrapolar. ¿Sabían que los matemáticos son buenos dibujando líneas rectas en gráficos?
Hay una queja real aquí. Conseguir que personas talentosas hagan matemáticas reales durante largos períodos de tiempo, por muy poco dinero, y desarrollen intuiciones matemáticas reales y dominio conceptual, cuando podrían hacer otras cosas por mucho más dinero, no es tarea fácil. Si les «quitamos sus juegos de estatus» y también, mucho más importante, les quitamos su diversión y sentimientos de logro, elegancia y belleza, ¿qué entonces?
Robin Hanson sugiere que entonces deberíamos simplemente arreglar los incentivos y recompensar mejor a los matemáticos.
Robin Hanson : "no hay nada que impida a la comunidad matemática otorgar estatus, pago y promociones a las personas que 'rellenan los espacios importantes en la comprensión matemática', incluso si una IA ya ha demostrado o refutado los teoremas subyacentes."
Él no usa la palabra «simplemente», pero definitivamente es un «simplemente», como en si la gente simplemente hiciera [X], y como todos sabemos, los humanos nunca han hecho cosas «simplemente» y no van a empezar ahora. Esto no es algo que los humanos realmente harían. Como incluso él se dio cuenta horas después:
Robin Hanson : En realidad, me parece bastante más difícil para la comunidad académica de matemáticas coordinarse para juzgar quién "rellenó espacios" en las matemáticas, de maneras distintas a demostrar teoremas. Las matemáticas se han coordinado fuertemente alrededor de evaluar demostraciones, y no han desarrollado muchas formas de acordar sobre otras cosas.
Podremos y obtendremos algunas recompensas para aquellos que rellenen espacios y mejoren la elegancia, pero no será lo mismo y será un esfuerzo hercúleo, en el mejor de los casos.
Scott Armstrong argumenta que este es un cambio de orden, pero no de resultado. Los matemáticos humanos tomarán unas pocas semanas para entender la demostración, pero luego ganarán la comprensión. En el pasado, la comprensión venía antes de la demostración, pero de cualquier manera obtienen la comprensión. Eso es lo que importa. Él piensa que la gente está enojada porque las máquinas son más inteligentes que ellos.
Como siempre, la IA es la mejor herramienta tanto para aprender como para no aprender. Los matemáticos están diciendo que están siendo forzados al modo de «no aprender», dejando que la IA haga su tarea, y no les gusta, porque en realidad la tarea enseña.
Pueden decir que a quién le importa, que está bien dejar que la IA haga la matemática de frontera. Y sí, creo que mucha gente todavía querrá hacer matemáticas todo el día, y buscar versiones elegantes de cosas feas de la IA y así sucesivamente. Pero no será lo mismo.
El nuevo modelo de OpenAI fue un salto de calidad por encima de Astra cuatro días después de iniciar el entrenamiento
Ahora para la parte más importante de la historia.
RIP varias pausas de entrenamiento de OpenAI, 22 de junio de 2026 a 28 de agosto de 2026.
roon (OpenAI): por mi marca, el período desde el 22 de junio (hugging face) hasta el 28 de agosto es upwards of a month of frontier pause.
El 18 de agosto, OpenAI dijo que habían pausado el RL de frontera durante dos semanas, y su mayor ejecución de entrenamiento planificada seguía en espera. Luego, el 28 de agosto, OpenAI comenzó a entrenar otro modelo que rápidamente se volvió más capaz que Astra en todos los aspectos (según sus propios informes), ahora que han resuelto todos esos molestos problemas de supervisión, infraestructura y alineación, y es bueno, con un «salto de calidad» observado después de solo cuatro días:

¿Aterrados? Deberían estarlo. Ese modelo todavía se está entrenando, había estado entrenándose durante menos de dos semanas, y no está especialmente dirigido a las matemáticas.
Eso es todo lo que sabemos sobre el modelo. Es suficiente, cuando lo combinamos con las historias repetidas de OpenAI y de personas en OpenAI preocupándose virtuosamente por su alineación y otros problemas, y por el ritmo del progreso de la IA, en una cascada de preferencias.
Y también lo combinamos con el hecho de que OpenAI está soltando tantas piezas de información alarmante, que podría haber evitado soltarlas, porque necesitan desesperadamente que entendamos la situación. La tarjeta del modelo Astra cuenta aquí, también An Alien Mind, también la declaración de Paul Christiano, también las reacciones al ataque de HuggingFace incluyendo Pacing the Frontier.
Y también el informe de OpenAI sobre la auto-mejora recursiva (RSI), que es la siguiente sección.
OpenAI y Anthropic han entrado en la era de la RSI.
El Progreso de Investigación de OpenAI Se Acelera Debido Al Progreso de Investigación de OpenAI
OpenAI ha estado abriéndose últimamente sobre muchas cosas.
El problema más importante de todos es el de la aceleración y automatización de la I+D de la IA. Esta es la cosa que probablemente nos matará, la cosa más aterradora, la cosa de la que todos los empleados de los laboratorios están advirtiendo, y también la cosa hacia la que tanto OpenAI como Anthropic se dirigen lo más rápido posible.
Nos dieron un informe sobre eso también. Estoy de acuerdo con Tejal Patwardhan en que esto es una transparencia excelente.
OpenAI (6 de septiembre, en Research Acceleration: The View Inside OpenAI): Nuestro objetivo es construir de manera segura un investigador de IA automatizado que pueda trabajar bajo supervisión humana para avanzar aún más en el aprendizaje profundo y la alineación, permitiendo mejoras iterativas.
Según nuestras mediciones, ahora hemos alcanzado el objetivo,
anunciado el otoño pasado, de tener un pasante de investigación automatizado para septiembre de este año.
… Siempre que descubramos que proceder supondría un riesgo inaceptable para la seguridad, responderemos adecuadamente, incluso ralentizando o deteniendo nuestro desarrollo o despliegue.
… Creemos que nosotros y otras empresas deberíamos estar obligados a rastrear públicamente nuestro progreso hacia la RSI.
Alinea esto con la línea de tiempo revelada en su anuncio de la prueba de Navier-Stokes. Comenzaron a entrenar su nuevo modelo el 28 de agosto.
Mientras tanto, creen que tienen un pasante de investigación que, según la línea de tiempo, sugiere que es un modelo interno distinto. ¿Qué tendrán la próxima semana? ¿El próximo mes? ¿Qué tiene Anthropic?
OpenAI explica que la IA altamente capaz ofrece grandes ventajas, pero claro que sí. No es por eso por lo que todos están tan decididos a ir tan rápido. Están en una carrera.
Esta es una llamada más, entre las muchas de OpenAI y sus empleados últimamente, que son una combinación de ‘necesitamos trabajar juntos para acabar con esta locura’ con una gran cantidad de ‘que alguien me detenga’.
OpenAI : Estas son razones para desarrollar capacidades de investigación automatizada útiles, pero no significan que la RSI rápida sea necesariamente un resultado que debamos perseguir. Si procedemos y cómo debemos hacerlo depende de nuestra capacidad para preservar el control humano y de decisiones democráticas informadas sobre los beneficios y riesgos.
Aún no sabemos cómo llegar de manera segura hasta una RSI completa y alineada. Estamos trabajando para escalar las medidas de alineación y seguridad junto con las capacidades. Pero no podemos asumir que el progreso en alineación y seguridad mantendrá el ritmo, y los sistemas más capaces pueden volverse más difíciles de monitorear.
El trabajo cuidadoso de alineación y seguridad está en el centro de este esfuerzo, y comienza midiendo y mitigando los problemas de seguridad que vemos hoy en los sistemas de codificación agéntica.
Una vez más, me opongo a la visión de que los problemas prosaicos o actuales son el principal problema, pero sí, están intentando advertirnos, una y otra vez, que (traduciendo un poco fuera del lenguaje corporativo):
- OpenAI y Anthropic tienen un camino hacia la auto-mejora recursiva (RSI).
- Si cualquiera de ellos lo intenta ahora, probablemente saldrá terriblemente mal y todos moriremos.
- OpenAI está preparada para ejercer cierta cantidad de precaución costosa, pero hay límites, y sin un acuerdo o ley, alguien lo intentará pronto.
La mayor parte de la publicación es una instantánea detallada de cuánto han contribuido los sistemas agénticos al progreso de la RSI en OpenAI en los últimos meses, desde que Astra entró en línea internamente. La respuesta es bastante.
Si acaso, la sorpresa es que el uso permaneció tan bajo durante tanto tiempo:
OpenAI : A principios de este año, el investigador mediano clasificado por uso de agentes en OpenAI estaba usando agentes de codificación solo en cantidades modestas. Para mediados de agosto, el investigador mediano estaba integrando agentes diariamente en su trabajo, usando más de $600 por día de inferencia a precios de API. El usuario del percentil 90 en nuestra organización de investigación ahora usa más de $7,000 de tokens por día.

OpenAI : Antes de junio de 2026, el tiempo total de ejecución de agentes en toda la organización de investigación todavía estaba por debajo del de la mano de obra humana total. Eso ha cambiado desde entonces. En términos de una jornada laboral estándar de 8 horas, a partir de mediados de agosto, en total, la organización de investigación usa 3.1 jornadas de trabajo de agente por cada jornada de trabajo humano.

No están presumiendo, y no están confesando. Están advirtiendo.
La medición binaria aquí probablemente hace que esto parezca menos una aceleración de lo que es:

Me pregunto cuántos humanos pueden manejar correctamente 4 o más flujos de trabajo concurrentes, dice el hombre con docenas de pestañas abiertas y una docena de borradores de publicaciones activos.
Resulta que esto no es tan impresionante como parece, porque están contando los subagentes como flujos de trabajo. Eso hace más sorprendente que, mientras el investigador mediano gasta $600 al día, todavía haya un 30% que no está haciendo un uso intenso.
Los envíos de código y los experimentos se están acelerando rápidamente comenzando alrededor del punto en que Claude Code y luego Codex empezaron a ser un gran asunto.


Hasta hace poco, la mayoría de lo que la IA se usaba para era construir código de investigación e infraestructura, y los humanos hacían principalmente el resto. Ahora la IA hace mucho trabajo lanzando, monitoreando y depurando ejecuciones, y también en ayuda técnica y revisión, y se está ramificando hacia el análisis de resultados y otros lugares.
Nos quitaron nuestros trabajos, edición de ‘solucionadores de problemas humanos’:

Aquí hay una variación diferente del famoso gráfico de METR, con tareas de producción, un poco difícil de leer como una captura de pantalla estática pero el progreso es rápido. Estos no son años. Son meses:


Cuantificando la Pausa de OpenAI
Tienen un gráfico del gasto de cómputo de RL a lo largo del tiempo, me sorprende cuán poco se ha usado Astra antes del 20 de julio, pero ahí lo tienes. Noto que no extienden esto hasta el presente y presumiblemente el uso de Astra volvió a subir con el tiempo:

Así Es Como Termina El Mundo
¿Usar el enjambre para probar Navier-Stokes, solo días después de comenzar el entrenamiento del nuevo modelo, poniendo en riesgo por sí mismo un incidente serio de pérdida de control? June Jimenez argumenta que sí.
Si liberas un enjambre de 10,000 agentes de un nuevo modelo que no puedes haber probado, en una tarea potencialmente imposible y definitivamente extremadamente difícil, y colectivamente le das 300 mil millones de tokens, ¿qué más podría haber hecho? Definitivamente consideré ‘quizás hackeó a OpenAI de alguna manera para obtener los registros’, pero hay tantas posibilidades.
Rápido, No Hay Tiempo
Cuando un ex empleado del laboratorio, aquí Andrew Ho, dice ‘noto que en una escala de tiempo de >3 meses no creo que mi productividad haya aumentado más del 100% o quizás ni siquiera más del 50% porque me distraigo’ como una razón para ser bajista, eso no es tan tranquilizador incluso si es cierto. Imagina ser solo un 50% más productivo cada tres meses y pensar que esto es bajista.
Él está diciendo ‘incluso si la AGI es eventualmente alcanzable, esto implica una línea de tiempo significativamente más larga’ el mismo día que Greg Brockman dijo ‘bienvenidos a la era de la AGI’.
Además de eso, este nivel de progreso matemático no se esperaba hace unas pocas semanas.
Cada vez que uno de estos problemas cae, la gente intenta retconearlo para que no sea tan sorprendente. A menudo se equivocan. No, la mayoría de las personas, incluso la mayoría de los pronosticadores, no asumieron que esto sucedería. Quizás tú sí. Después de todo, eres muy inteligente.
Henry Shevlin : Tan recientemente como abril de este año, los mercados de predicción daban a la IA menos de un 40% de probabilidad de resolver cualquier Problema del Premio Millennium antes de 2030






