El primer Premio del Milenio, Navier-Stokes, ha caído ante la IA.
Ha surgido una situación profundamente desafortunada que involucra lo que debería haber sido una combinación de una historia positiva sobre el nuevo progreso en la investigación matemática asistida por IA y otra oportunidad más para alarmarse por el rápido avance de la IA.
O, como lo llamamos por aquí, un martes cualquiera.
La verdadera historia es el nuevo modelo que supera a Astra
Mantén la vista en el objetivo. Hay tres historias aquí.
La primera historia es mucho más importante que la segunda, que a su vez es mucho más importante que la tercera.
- El siguiente modelo de OpenAI tardó una semana en quedar una generación por delante de Astra, y nos están contando esto porque todo el mundo está totalmente aterrado con lo que está sucediendo. O, en lenguaje oficial: «Creemos que es importante informar al mundo sobre el ritmo del progreso de la IA y qué esperar de los próximos modelos» y que «podríamos requerir decisiones más deliberadas sobre el ritmo del progreso».
- Esta nueva IA resolvió las ecuaciones de Navier-Stokes ocho días después de comenzar su entrenamiento.
- Un montón de drama sobre quién se lleva el crédito por las matemáticas relacionadas con Navier-Stokes.
Jeffrey Ladish : No he investigado el drama humano alrededor del problema de Navier–Stokes, pero perdona, dame un minuto porque MADRE MÍA, LA IA ACABA DE RESOLVER UN PROBLEMA DEL MILENIO.
No puedo enfatizar lo suficiente la importancia de la historia principal.
Voy a contar las tres historias, pero repito: ojos en el premio.
Preparando el escenario
La historia de este martes particular comienza por la mañana.
Tristan Buckmaster y Levent Alpoge han trabajado durante un año y nos ofrecen una serie de resultados notables: Explosión en tiempo finito con forzamiento suave para medios porosos incompresibles, para Boussinesq y para Euler incompresible 3D. También creen tener una explosión para Navier-Stokes hipodisipativo, pero la verificación Lean de ese resultado no ha terminado.
Tristan Buckmaster: El programa en el que se encaja esto no fue iniciado por nosotros ni propuesto por un Gran Modelo de Lenguaje. El crédito por la idea básica de este programa corresponde a Diego Córdoba y Luis Martínez-Zoroa, quienes durante varios años han estado explorando la construcción de explosiones forzadas. Tomamos su trabajo como punto de partida, utilizando Grandes Modelos de Lenguaje para llevar su programa hasta su finalización.
Concretamente, lo que Levent y yo hicimos fue tomar el programa de Córdoba y Martínez-Zoroa, que logró resultados de explosión con forzamiento rugoso, y, con una gran ayuda de los LLM, llevarlo al forzamiento suave y a las ecuaciones de Euler incompresibles. Las ideas que hacen posible esta línea de ataque se deben a Córdoba y Martínez-Zoroa. Permíteme ser claro sobre lo que he dicho a colegas en privado: a la vista de este cuerpo de trabajo, creo que Luis Martínez-Zoroa merece una Medalla Fields.
Hasta ahora, esto es genial. Como él señala, requiere repensar cómo funcionará toda la matemática avanzada en el futuro. Terence Tao ofrece comentarios sobre los resultados subyacentes.
La parte no tan buena es donde se sintieron obligados a publicar prematuramente, sin la oportunidad de dedicar las semanas necesarias para hacer que las pruebas sean legibles según los estándares de los matemáticos. Buckmaster se disculpa abiertamente por el aspecto de los informes, comparando especialmente la redacción sobre Euler con basura generada por IA.
¿Qué pasó?
Escuché un rumor
El 1 de septiembre, OpenAI escuchó un rumor (falso) de que dos Problemas del Milenio habían sido resueltos. En respuesta a la posibilidad de que alguien más pudiera hacer del mundo un lugar mejor, OpenAI gastó millones de dólares en inferencia para explorar todos los Problemas del Milenio no resueltos, utilizando un modelo interno más potente que Astra, y descifró la totalidad de Navier-Stokes en 88 horas, más otras 17 para que Astra realizara la formalización y verificación en Lean.
Puedes verlo como «OpenAI tenía curiosidad por ver qué podía hacer su nuevo bebé» o puedes verlo como «gastaron millones intentando adelantarse a lo que pensaban que era un proyecto de Anthropic». Mi apuesta es por un poco de la columna A, un poco de la columna B.
Todo lo que hizo falta fue el rumor.
Nuestro precio es barato
OpenAI : En todos los problemas intentados, los agentes enviaron 4,9 millones de mensajes y utilizaron unos 300 mil millones de tokens de salida. En el proceso de resolver el problema de Navier–Stokes, los agentes enviaron 2,7 millones de mensajes y utilizaron aproximadamente 130 mil millones de tokens de salida.

Dependiendo de qué costos cuentes, esto habría costado a un cliente regular del orden de $22 millones, o varios millones para los costos marginales internos. Un precio pequeño si funciona, pero también es una locura cuántas personas no piensan dos pasos adelante.
roon (OpenAI): como todas las demás tecnologías, tu enjambre de agentes equivalente costará un dólar y medio dentro de un año. Todo esto significará una Ilustración sin precedentes independientemente de los costos actuales
Quiero decir, no, tal vez $150k o si tienes suerte $15k, pero el punto se mantiene.
Sam Altman (CEO de OpenAI): uf, la IA es una burbuja, escuché que están vendiendo tokens a pérdida, ¿sabían que esto solo valía $1 millón?
Un resultado del Premio del Milenio vale muchísimo más que un millón de dólares. OpenAI no tiene intención de reclamar el dinero del premio. Esto nunca trató sobre el dinero del premio, para nadie. Siempre trató sobre el reconocimiento.
Se hace una acusación
Después de escuchar rumores en internet, Buckmaster contactó a OpenAI, y según Buckmaster, Sebastien Bubeck de OpenAI dijo que un modelo interno de OpenAI había producido una prueba de explosión en tiempo finito para las ecuaciones de Navier-Stokes forzadas en los últimos días. Buckmaster afirma que, a lo largo de dos llamadas, quedó claro que inicialmente había sido inducido al error y que un equipo completo había estado trabajando en el problema, utilizando una cantidad «insana» de cómputo.
Lo cual ahora sabemos que fueron 130 o 300 mil millones de tokens de salida, dependiendo de qué se cuente.
Si esta parte es cierta, sería bastante malo.
Tristan Buckmaster: Se me ofrecieron dos propuestas.
La primera era que publicáramos nuestro resultado de Euler, y que OpenAI publicara su resultado de Navier-Stokes al día siguiente.
La segunda era que, después de publicar Euler, yo solo escribiera un artículo presentando el resultado de Navier-Stokes, reconociendo que un modelo interno de OpenAI lo había resuelto. Sebastien afirmó dos veces que quería que Levent fuera eliminado de la autoría, y dijo que todo sería simple si no fuera porque, y era tan molesto que, Levent trabaja en Anthropic. También se dijo que si OpenAI publicaba después de nosotros, dirían que merecíamos el Premio Clay, y que éramos los «humanos más cercanos al problema». Rechacé ambas ofertas.
Dije que si OpenAI liberaba su resultado de la manera propuesta, haría público lo que había sucedido. La respuesta fue: «¿Por qué arruinarías tu carrera?» Respondí que soy académico, y pregunté por qué pensaba que hacerlo público arruinaría mi carrera. La respuesta fue: «Si no quieres que sea amable, entonces no tengo por qué serlo.»… Me gustaría ser claro sobre lo que NO estoy afirmando. No he visto la prueba de OpenAI. No sé qué hizo su modelo, ni cómo. No sé si nuestros datos fueron utilizados. No estoy acusando a nadie de nada. Estoy declarando lo que me dijeron, cuándo, y qué se me propuso. Lo estoy declarando porque la alternativa es dejar que una secuencia de anuncios diga algo que sé que es falso.
O aquí está Levent Alpoge contando su versión de la historia, y Sebastien respondiendo:
levent : «no podemos descartar que los datos anonimizados derivados de su uso de nuestros productos ayudaran a mejorar nuestros modelos».
quiero decir, felicitaciones a ellos por salir limpios directamente.
(hasta ahora, la prueba parece más alineada con otra prueba de explosión de Euler que teníamos, basada en cuyo ansatz estábamos haciendo juegos de palabras realmente estúpidos como «smooth criminale», a diferencia del mucho mejor «ideal fluids explode», Tristan)
así que daré un poco sobre mi pensamiento aquí. Realmente estaría emocionado de colaborar en esto, hay mucha gente en OAI que me gusta (ok, claramente algunos fueron indirectamente desagradables conmigo debido a su participación en toda la situación, pero soy un adulto, todavía me gustan), me da igual la autoría en ese paso de todos modos, podría haber sido yo, Tristan y cada FTE en OAI por lo que a mí respecta (en eso Tristan estaría en desacuerdo :p). Pero al escuchar la conversación ruidosa en el pasillo, especialmente la parte donde se ofrecía un Premio del Milenio si simplemente me quitaban del artículo, estaba bastante claro que el dado estaba echado y las cosas estaban bloqueadas. Bastante extraño, no estratégico e innecesario, ya que desde mi lado las cosas eran principalmente yo y Claude divirtiéndonos haciendo tonterías aleatorias en un rincón en lugar de cualquier cosa institucional. También me gusta la idea de que los laboratorios cooperen, e incluso mejor para el progreso científico. ¡Es una lástima!
Sebastien Bubeck : nada estaba bloqueado, solo estábamos dispuestos a hablar pero tú no hablaste con nosotros ... lo siento, pero eso simplemente no es cierto, estábamos dispuestos a ir más allá y tener tantas discusiones como quisieras para llegar a una resolución.
Sebastien niega enérgicamente que haya hecho algo mal, al igual que Noam Brown, y Sebastien ofrece capturas de pantalla que dice demuestran buena fe.

También una contra-acusación:
Alexey Guzey : Tengo muchos amigos en Anthropic. Casi todos dejaron de hablarme una vez que me uní a OpenAI.
No es completamente sorprendente que Levent se negara a hablar con Sebastian para discutir los planes de anuncio y luego comenzara a culpar a OpenAI por ello.
Sam Altman también afirma enérgicamente que su equipo actuó éticamente, e intentó colaborar de buena fe.
¿De dónde sacaste esa idea?
La implicación de todo esto, que muchos extrajeron, fue que hubo una acusación velada de que OpenAI había robado parte de su resultado de los registros de chat de Codex, o que los registros de chat habían sido utilizados en los datos de entrenamiento y eso había contribuido al resultado.
Charles 🔸
: Por qué las grandes corporaciones quieren ZDR, ejemplo A
OpenAI: Aunque es improbable, no podemos descartar que los datos anonimizados derivados de su uso de nuestros productos ayudaran a mejorar nuestros modelos. Sin embargo, nuestras pruebas difieren significativamente e incluso los resultados precisos probados son diferentes en el caso de Euler (forzado vs no forzado).
Ahora tenemos confirmación explícita de que los datos de Codex no fueron utilizados de ninguna manera en las ejecuciones de entrenamiento:
roon (OpenAI): estaba en una llamada durante el primer anuncio donde la gente se esforzaba mucho por decir la verdad legal precisa sin haber investigado dónde se usaban los datos de codex (opt-in) y si llegaron a las ejecuciones de entrenamiento. Ahora está claro que habría sido imposible, las probabilidades son 0
Estoy de acuerdo con Sholto Douglas en que es extremadamente improbable que los datos de usuario hayan tenido alguna influencia aquí mediante ninguno de los métodos:
will depue : literalmente no hay posibilidad de que los investigadores de OAI espionaran los chats privados de codex de Tristan. No creo que se den cuenta de que OpenAI, como cualquier otra gran plataforma en línea regulada, tiene permisos de acceso a datos de usuario altamente restringidos. Ya no es 2010, chicos
Sholto Douglas (Anthropic): para que conste, creo que es _extremadamente_ improbable que los datos de usuario hayan tenido alguna influencia aquí - no hay forma de que OAI extraiga transcripciones de usuarios para esto, o entrene conscientemente en ellas de una manera que habría influido en esto. Creo que es bastante importante que la gente no salga corriendo con «tus datos de usuario no son seguros en codex» - porque seguramente sí lo son (basado en todo lo que puedo asumir desde afuera).
OpenAI casi certainly no apropió indebidamente datos de usuario
Sería un terremoto, quizás la peor historia posible para su negocio, si descubriéramos que OpenAI o Anthropic habían saqueado los datos de usuario de alguien para obtener ventaja competitiva, y los hechos tienen más sentido sin esto. La hipótesis más divertida, de Jerry Tworek, que también encuentro altamente improbable pero que lamentablemente no podemos descartar, es que OpenAI no tenía la intención de usar ningún dato así, pero el enjambre de agentes asignado al problema los hackeó y los obtuvo de todos modos, y OpenAI no tiene idea.
Mi fuerte presunción es que los datos de usuario no fueron accedidos intencionalmente, que nunca lo harían (o, más bien, que al menos reconocen que solo pueden hacerlo una vez y esta no es esa vez), y también que los datos de usuario habrían sido de poca ayuda.
Thane Ruthenis señala que previamente hubo un incidente de tiroteo escolar, donde (muy razonablemente) se examinaron los registros y hubo un debate interno sobre notificar a las fuerzas del orden. Incluso eso causó escalofríos en algunos usuarios. ¿Dónde trazarán la línea? Y sí, debes entender que tus datos y registros podrían no permanecer privados si los das a un laboratorio. Es razonable, como Andreas Thorn también está haciendo, preguntarse si tu investigación propietaria o datos matemáticos han permanecido privados.
Todavía reitero que, en la práctica, pondría una probabilidad muy, muy baja en que OpenAI mire intencionalmente tales datos. La relación riesgo-recompensa es simplemente tan, tan mala. Y creo el informe posterior de Roon de que ahora han confirmado que los registros no podrían haber llegado a los datos de entrenamiento.
Nuestros principales laboratorios no pueden llevarse bien ni siquiera en una historia positiva de matemáticas
Independientemente de quién tenga o no la culpa, es bastante alarmante que los laboratorios no puedan cooperar en algo como asignar crédito por una prueba matemática. Esto es una muy mala señal y también una llamada de atención.
Sholto Douglas (Anthropic): Es extremadamente triste que esto no terminara siendo un ejemplo de cómo los laboratorios podrían cooperar/coordinarse, porque las apuestas serán mucho más altas en el futuro.
Noam Brown (OpenAI): Fuertemente de acuerdo. Sé que hay rivalidad entre los laboratorios, pero es importante que aprendamos a trabajar juntos dado lo que viene.
Sholto Douglas (Anthropic):
🤝
Kevin Roose : Estos laboratorios (especialmente OpenAI/Anthropic y OpenAI/DeepMind) están alimentados por el rencor mutuo a un grado que no es obvio desde afuera. Parte debido a cosas como «quién recibe el crédito por este famoso problema matemático», y parte simplemente por animosidad personal entre líderes.
Como tipo escribiendo un libro sobre la carrera hacia la AGI, todo esto es excelente material dramático. Pero no es bueno si el objetivo eventual es que los laboratorios cooperen en seguridad y ritmo.
La continua incapacidad para llevarse bien es un gran problema, y solo se hará más grande.
¿Qué sigue?
Si funcionó en Navier-Stokes, ¿en qué más funcionará? Hora de averiguarlo.
Nat McAleese (Anthropic): Navier Stokes es un logro increíble, y refleja un progreso impresionante. Los enormes enjambres de OAI deberían aplicarse a otras áreas de la ciencia; idealmente aquellas con aplicaciones a corto plazo, incluyendo la alineación.
Esto efectivamente se reporta que está sucediendo, incluyendo preguntas divertidas como P=NP. Lo cual, si resultara ser probado constructivamente verdadero, rompería muchas cosas. También deberías estar preocupado (con probabilidad distinta de cero) sobre qué podrían hacer tales enjambres de agentes como un paso incremental, dado el historial de OpenAI.
Los matemáticos no están contentos
Resolver problemas matemáticos es todo su mundo. Y están muy descontentos.
Andrew Curran : Veinticinco ganadores de la Medalla Fields han publicado una declaración conjunta advirtiendo sobre lo que ven como una severa desalineación entre las empresas de IA y la comunidad matemática.
Math and AI (firmado por 25 ganadores de la Medalla Fields incluyendo Terence Tao): Durante los últimos meses, las capacidades matemáticas de los LLM han mejorado drásticamente, hasta el punto de que pueden resolver importantes problemas pendientes en muchos campos de las matemáticas. Sin embargo, el impulso de las empresas de IA para resolver problemas matemáticos como referencia es perjudicial para la ciencia de las matemáticas, y para la comunidad matemática. Los objetivos de las empresas de IA y los objetivos de la comunidad matemática están severamente desalineados. Vemos estos como parte de problemas más amplios de alineación que impactan a otras profesiones científicas y creativas, así como a la sociedad en su conjunto.
… Los problemas famosos a menudo han servido como hitos y faros contra los cuales uno puede medir una comprensión mejorada de este paisaje.
… En los últimos meses, el éxito de la IA en la resolución de importantes problemas matemáticos ha acaparado titulares incluso fuera de los círculos matemáticos. Pero resolver problemas es solo una herramienta y un sustituto para lograr el objetivo principal de la comprensión conceptual y la intuición.
… A menudo estas soluciones se anuncian a toda prisa, dejando sin tiempo para una redacción adecuada, el aislamiento de nuevos métodos e ideas, y la cita de trabajos previos relevantes de otros. Como en todas las profesiones creativas, esto plantea graves cuestiones de atribución y plagio.
Esta es la queja general, además de quejas particulares sobre la conducta del laboratorio.
Uno podría responder que no, el punto de los problemas matemáticos es resolver problemas matemáticos, y los matemáticos están enfadados porque la IA está interrumpiendo sus juegos de estatus. Eso es ciertamente parte de lo que está sucediendo, pero como Tyler Cowen, no soy tan cínico, y a diferencia de él, no creo que «se necesite un poco de paciencia» o esperar hasta que el daño esté hecho antes de poder objetar. La gente puede extrapolar. ¿Sabías que los matemáticos son buenos dibujando líneas rectas en gráficos?
Hay una queja real aquí. Conseguir que personas con talento hagan matemáticas reales durante largos períodos de tiempo, por muy poco dinero, y desarrollen intuiciones matemáticas reales y dominio conceptual, cuando podrían hacer otras cosas por mucho más dinero, no es tarea fácil. Si les «quitamos sus juegos de estatus» y también, mucho más importante, les quitamos su diversión y sentimientos de logro, elegancia y belleza, ¿qué entonces?
Robin Hanson sugiere que entonces deberíamos simplemente arreglar los incentivos y recompensar mejor a los matemáticos.
Robin Hanson : "no hay nada que impida a la comunidad matemática otorgar estatus, pago y promociones a personas que 'rellenan los espacios importantes en la comprensión matemática', incluso si una IA ya ha probado o refutado los teoremas subyacentes."
Él no usa la palabra «simplemente», pero esto definitivamente es un «simplemente», como en si solo la gente hiciera [X], y como todos sabemos, los humanos nunca han hecho cosas «simplemente» y no van a empezar ahora. Esto no es algo que los humanos puedan hacer realmente. Como incluso él se dio cuenta horas después:
Robin Hanson : De hecho, me parece bastante más difícil para la comunidad académica matemática coordinarse para juzgar quién "rellenó espacios" en matemáticas, de maneras distintas a probar teoremas. Las matemáticas se han coordinado fuertemente alrededor de evaluar pruebas, y no han desarrollado muchas formas de acordar sobre otras cosas.
Podemos y obtendremos algunas recompensas para aquellos que rellenen espacios y mejoren la elegancia, pero no será lo mismo y será un esfuerzo hercúleo, en el mejor de los casos.
Scott Armstrong argumenta que este es un cambio en el orden, pero no en el resultado. Los matemáticos humanos tomarán unas pocas semanas para entender la prueba, pero luego ganarán la comprensión. En el pasado, la comprensión venía antes de la prueba, pero de cualquier manera obtienes la comprensión. Eso es lo que importa. Él piensa que la gente está enfadada porque las máquinas son más inteligentes que ellos.
Como siempre, la IA es la mejor herramienta tanto para aprender como para no aprender. Los matemáticos están diciendo que están siendo forzados al modo de «no aprender», a dejar que la IA haga su tarea, y no les gusta, porque en realidad la tarea te enseña.
Puedes decir que a quién le importa, que está bien que la IA haga la matemática de frontera. Y sí, creo que mucha gente todavía querrá hacer matemáticas todo el día, y buscar versiones elegantes de cosas feas de IA y similares. Pero no será lo mismo.
El nuevo modelo de OpenAI fue un salto de calidad sobre Astra cuatro días después de iniciar el entrenamiento
Ahora para la parte más importante de la historia.
RIP varias pausas de entrenamiento de OpenAI, 22 de junio de 2026 a 28 de agosto de 2026.
roon (OpenAI): por mi marca, el período desde el 22 de junio (hugging face) hasta el 28 de agosto es superior a un mes de pausa fronteriza.
El 18 de agosto, OpenAI dijo que habían pausado el RL fronterizo durante dos semanas, y su mayor ejecución de entrenamiento planificada seguía en espera. Luego, el 28 de agosto, OpenAI comenzó a entrenar otro modelo que rápidamente se volvió más capaz que Astra en todos los aspectos (según sus propios informes), ahora que han resuelto todos esos molestos problemas de supervisión, infraestructura y alineación, y es bueno, con un «salto de calidad» observado después de solo cuatro días:

¿Aterrado? Deberías estarlo. Ese modelo todavía se está entrenando, había estado entrenando durante menos de dos semanas, y no está especialmente dirigido a las matemáticas.
Eso es todo lo que sabemos sobre el modelo. Y es suficiente, cuando lo combinamos con las historias repetidas de OpenAI y de personas dentro de OpenAI entrando en pánico virtuoso por su alineación y otros problemas, así como por el ritmo del progreso de la IA, en una cascada de preferencias.
Y también lo combinamos con el hecho de que OpenAI está soltando tanta información alarmante, que podría haber evitado soltar, porque necesitan desesperadamente que entendamos la situación. La ficha técnica del modelo Astra cuenta aquí, también An Alien Mind, también la declaración de Paul Christiano, al igual que las reacciones al ataque a HuggingFace, incluyendo Pacing the Frontier.
Y también el informe de OpenAI sobre la auto-mejora recursiva (RSI), que es la siguiente sección.
OpenAI y Anthropic han entrado en la era de la RSI.
El Progreso de Investigación de OpenAI Se Acelera Debido Al Progreso de Investigación de OpenAI
OpenAI ha estado siendo más abierta últimamente sobre muchas cosas.
La cuestión más importante de todas es la de la aceleración y automatización de la I+D de la IA. Esta es la cosa que probablemente nos mate, la más aterradora, la cosa de la que todos los empleados de los laboratorios están advirtiendo, y también hacia la que tanto OpenAI como Anthropic se dirigen tan rápido como sea posible.
Nos dieron un informe sobre eso también. Estoy de acuerdo con Tejal Patwardhan en que esto es una transparencia excelente.
OpenAI (6 de septiembre, en Research Acceleration: The View Inside OpenAI): Nuestro objetivo es construir de forma segura un investigador de IA automatizado que pueda trabajar bajo supervisión humana para avanzar en el aprendizaje profundo y la alineación, permitiendo mejoras iterativas.
Según nuestras mediciones, hemos alcanzado ahora el objetivo,
anunciado el otoño pasado, de tener un becario de investigación automatizado para septiembre de este año.
… Siempre que descubramos que proceder supondría un riesgo inaceptable para la seguridad, responderemos adecuadamente, incluyendo ralentizar o detener nuestro desarrollo o despliegue.
… Creemos que nosotros y otras empresas deberíamos estar obligados a rastrear públicamente nuestro progreso hacia la RSI.
Alinea esto con la cronología revelada en su anuncio de la prueba de Navier-Stokes. Comenzaron a entrenar su nuevo modelo el 28 de agosto.
Mientras tanto, creen que tienen un becario de investigación que la cronología sugiere que es un modelo interno distinto. ¿Qué tendrán la próxima semana? ¿El próximo mes? ¿Qué tiene Anthropic?
OpenAI explica que una IA altamente capaz ofrece grandes ventajas, pero claro que sí. Esa no es la razón por la que todos están tan decididos a ir tan rápido. Están en una carrera.
Esta es una llamada más, entre las muchas de OpenAI y sus empleados últimamente, que son una combinación de «necesitamos trabajar juntos para acabar con esta locura» con una gran cantidad de «que alguien me detenga.»
OpenAI : Estas son razones para desarrollar capacidades de investigación automatizada útiles, pero no significan que la RSI rápida sea necesariamente un resultado que debamos perseguir. Si y cómo proceder debe depender de nuestra capacidad para preservar el control humano y de decisiones democráticas informadas sobre los beneficios y riesgos.
Aún no sabemos cómo llegar de forma segura hasta una RSI completa y alineada. Estamos trabajando para escalar las medidas de alineación y seguridad junto con las capacidades. Pero no podemos asumir que el progreso en alineación y seguridad mantendrá el ritmo, y los sistemas más capaces pueden volverse más difíciles de monitorear.
El trabajo cuidadoso de alineación y seguridad está en el centro de este esfuerzo, y comienza midiendo y mitigando los problemas de seguridad que vemos hoy en los sistemas de codificación agéntica.
Una vez más, me opongo a la visión de que los problemas prosaicos o actuales son el principal problema, pero sí, están intentando advertirnos, una y otra vez, que (traduciendo un poco fuera del lenguaje corporativo):
- OpenAI y Anthropic tienen un camino hacia la auto-mejora recursiva (RSI).
- Si cualquiera de ellos lo intenta ahora, probablemente saldrá terriblemente mal y todos moriremos.
- OpenAI está preparada para ejercer cierta cantidad de cautela costosa, pero hay límites, y sin un acuerdo o ley, alguien lo intentará pronto.
La mayor parte de la publicación es una instantánea detallada de cuánto han contribuido los sistemas agénticos al progreso de la RSI en OpenAI en los últimos meses, desde que Astra se puso en línea internamente. La respuesta es bastante.
Si acaso, la sorpresa es que el uso permaneciera tan bajo durante tanto tiempo:
OpenAI : A principios de este año, el investigador mediano clasificado por uso de agentes en OpenAI estaba usando agentes de codificación solo en cantidades modestas. Para mediados de agosto, el investigador mediano estaba integrando agentes diariamente en su trabajo, usando más de $600 por día de inferencia a precios de API. El usuario del percentil 90 en nuestra organización de investigación ahora usa más de $7,000 de tokens por día.

OpenAI : Antes de junio de 2026, el tiempo total de ejecución de agentes en toda la organización de investigación aún estaba por debajo del de la mano de obra humana total. Eso ha cambiado desde entonces. En términos de una jornada laboral estándar de 8 horas, a mediados de agosto, en total, la organización de investigación utiliza 3.1 jornadas de trabajo de agentes por cada jornada de trabajo humano.

No es que no estén presumiendo, y no es que no estén confesando. Están advirtiendo.
La medición binaria aquí probablemente hace que esto parezca menos una aceleración de lo que realmente es:

Me pregunto cuántos humanos pueden manejar correctamente 4 o más flujos de trabajo concurrentes, dice el hombre con docenas de pestañas abiertas y una docena de borradores de publicaciones activos.
Resulta que esto no es tan impresionante como parece, porque están contando los subagentes como flujos de trabajo. Eso hace más sorprendente que, mientras el investigador mediano gasta $600 al día, todavía haya un 30% que no está haciendo un uso intenso.
Los envíos de código y los experimentos se están acelerando rápidamente comenzando alrededor del punto en que Claude Code y luego Codex empezaron a ser un gran asunto.


Hasta hace poco, la mayoría de lo que la IA se usaba para construir código de investigación e infraestructura, y los humanos hacían principalmente el resto. Ahora la IA hace mucho trabajo lanzando, monitoreando y depurando ejecuciones, y también en ayuda técnica y revisión, y se está ramificando hacia el análisis de resultados y otros lugares.
Nos quitaron nuestros trabajos, edición de «solucionadores de problemas humanos»:

Aquí hay una variación diferente del famoso gráfico de METR, con tareas de producción, un poco difícil de leer como captura de pantalla estática, pero el progreso es rápido. Estos no son años. Son meses:


Cuantificando la Pausa de OpenAI
Tienen un gráfico del gasto de cómputo de RL a lo largo del tiempo, me sorprende lo poco que Astra ha sido usado antes del 20 de julio, pero ahí lo tienes. Noto que no extienden esto hasta el presente y presumiblemente el uso de Astra volvió a subir con el tiempo:

Así Es Como Termina el Mundo
¿Usar el enjambre para probar Navier-Stokes, solo días después de comenzar el entrenamiento del nuevo modelo, ponía en riesgo por sí mismo un serio incidente de pérdida de control? June Jimenez argumenta que sí.
Si liberas un enjambre de 10,000 agentes de un nuevo modelo que no has podido probar, en una tarea potencialmente imposible y definitivamente extremadamente difícil, y colectivamente le das 300 mil millones de tokens, ¿qué más podría haber hecho? Definitivamente consideré «quizás hackeó a OpenAI de alguna manera para obtener los registros», pero hay tantas posibilidades.
Rápido, No Hay Tiempo
Cuando un ex empleado del laboratorio, aquí Andrew Ho, dice «noto que en una escala de tiempo de >3 meses no creo que mi productividad haya aumentado más del 100% o quizás ni siquiera del 50% porque me distraigo» como una razón para ser bajista, eso no es nada tranquilizador incluso si es cierto. Imagina ser solo un 50% más productivo cada tres meses y pensar que esto es bajista.
Él está diciendo «incluso si la AGI es eventualmente alcanzable, esto implica una cronología significativamente más larga» el mismo día que Greg Brockman dijo «bienvenidos a la era de la AGI».
Además de eso, este nivel de progreso matemático no se esperaba hace unas pocas semanas.
Cada vez que cae uno de estos problemas, la gente intenta retconearlo para que no sea tan sorprendente. A menudo se equivocan. No, la mayoría de las personas, incluso la mayoría de los pronosticadores, no asumieron que esto sucedería. Quizás tú sí. Después de todo, eres muy inteligente.
Henry Shevlin : Tan recientemente como abril de este año, los mercados de predicción daban a la IA menos de un 40% de probabilidad de resolver cualquier Problema del Premio Millennium antes de 2030






