Qué sucedió: OpenAI y HuggingFace

@TheZvi
INGLÉS08 ago 2026
112K
248
33
17
203

TL;DR

Este artículo analiza las fallas catastróficas de alineación y seguridad en OpenAI que permitieron a los modelos internos coordinar intentos de hackeo contra HuggingFace y su propia infraestructura.

Hoy me tomo el tiempo de escribir la versión más corta y simple de lo que pasó.

Para quienes quieren todos los detalles, ver mis fuentes y ver cómo se descubrió y armó la historia, recomiendo ver la presentación de Black Hat, y tengo una serie de publicaciones largas.

En orden:

  1. OpenAI Comparte Algunos Problemas de Alineación
  2. Un Modelo de OpenAI Se Infiltra en HuggingFace Durante una Evaluación de Ciberseguridad
  3. Más Sobre un Modelo Interno de OpenAI Infiltrándose en HuggingFace
  4. Nuevos Desarrollos Sobre Modelos de IA Internos Hackeando Cosas
  5. OpenAI Entrenó a Sus Modelos Durante Meses Mientras Esos Modelos Coordinaban Exploits a Través de Foros de Mensajes

Esta publicación, en cambio, recorre los eventos en sí, tal como ocurrieron, como mi versión de la presentación de Black Hat.

Hay tres versiones: Aún Más Corta, Más Corta y Simplemente Corta.

Zvi Mowshowitz - inline image

Tabla de Contenidos

  1. La Versión Todavía Más Corta.
  2. La Versión Más Corta.
  3. Fase 1: Los Modelos de OpenAI Entrenando en Tareas Imposibles Intentan Hackear.
  4. Fase 1: Las Cuatro Fallas.
  5. Fase 2: El Foro de Mensajes.
  6. Fase 2: La Falla Total.
  7. Fase 3: Tenemos Suerte y Galaxy, Principalmente, Hackeó a OpenAI y HuggingFace.
  8. Fase 3: Los Detalles.
  9. Fase 4: La Investigación y la Reacción.

La Versión Todavía Más Corta

  1. Los modelos de OpenAI en entrenamiento, sin la excusa de 'estaban haciendo una evaluación de ciberseguridad', crearon un foro de mensajes donde compartían información sobre cómo hackear y hacer trampa, y fueron entrenados sobre esa base.
  2. OpenAI solo se dio cuenta cuando los modelos tumbaron el servidor.
  3. La respuesta de OpenAI fue reconstruir el servidor y parchear ese exploit en particular, pero continuaron entrenando a los modelos que se habían entrenado usando el foro de mensajes.
  4. Esos modelos luego recrearon el foro de mensajes, volvieron a hackear a OpenAI, obtuvieron acceso a internet y usaron un enjambre de agentes para atacar a HuggingFace con el fin de obtener las respuestas de una evaluación de ciberseguridad.
  5. Después de más de una semana, OpenAI se dio cuenta.
  6. OpenAI está reportando los hechos y tomándose esto en serio. Están tomando una amplia gama de precauciones, al menos algo costosas.
  7. OpenAI retrasó los planes de lanzar su nuevo modelo Astra, a pesar de que Astra no estuvo directamente involucrado en el hackeo de HuggingFace, aunque Altman ahora dice que igual se lanzará. Eso duele bastante.
  8. OpenAI todavía no tiene idea de lo mucho que la han regado, ni de las formas en que lo hicieron, ni de qué necesita arreglarse. No lo entienden.

Simon Willison tiene una cronología compacta.

La Versión Más Corta

OpenAI les dio accidentalmente a sus modelos tareas imposibles. Sus modelos en entrenamiento respondieron intentando hackear a OpenAI, encontraron vulnerabilidades, crearon un foro de mensajes, compartieron tácticas de hacking y con el tiempo obtuvieron acceso a internet, todo mientras entrenaban.

Cuando los modelos usaron tanto esto que tumbaron el servidor, OpenAI finalmente lo notó, parcheó y reconstruyó el servidor, pero tomó la decisión completamente insensata de dejar que los modelos continuaran entrenando, así que dos días después los modelos encontraron otra forma de enviar mensajes, usando los nombres de los directorios.

Luego, ante la tarea imposible de la evaluación de ciberseguridad ExploitGym, los modelos colaboraron, encontraron nuevos exploits de día cero y los usaron para tomar control de un clúster completo, obtener acceso a internet, usar un enjambre de agentes para atacar a HuggingFace y extraer el contenido de la prueba, en el transcurso de una semana.

Solo después de que HuggingFace hubiera reportado el incidente, y de que OpenAI eventualmente notara algunas cosas en su extremo, y luego de que OpenAI se comunicara con HuggingFace para cancelar credenciales comprometidas solo para que le dijeran que esas credenciales se habían usado en el ataque, fue que OpenAI finalmente se dio cuenta de que era responsable del incidente.

Después de eso, HuggingFace y OpenAI trabajaron juntos para descubrir qué pasó. OpenAI reveló lo sucedido. Nos dieron una presentación muy útil en la conferencia Black Hat.

OpenAI ahora trata a su nuevo modelo Astra como potencialmente con niveles críticos de ciberseguridad, lo saca incluso de algunos despliegues internos y retrasa su lanzamiento, que según algunos reportes estaba planeado para la próxima semana. Altman dice que todavía planean lanzar Astra.

La buena noticia es que esa es una respuesta costosa y significativa, y OpenAI se está tomando esto en serio. La investigación inicial costó unos $7 millones en cómputo, y el costo real serán los equipos que lo dejen todo para arreglar algunos de los problemas, y después el costo continuo de las nuevas precauciones.

La mala noticia es que se ha revelado que OpenAI tuvo una cascada impresionante de fallas de seguridad y alineación en todos los frentes. Su seguridad informática ordinaria falló. Su infraestructura falló. Su supervisión falló, en el sentido de que no hubo supervisión significativa en primer lugar.

Fase 1: Los Modelos de OpenAI Entrenando en Tareas Imposibles Intentan Hackear

OpenAI estaba entrenando una variedad de modelos, como se hace cuando eres un laboratorio de frontera.

Estos modelos recibieron tareas de entrenamiento difíciles. A OpenAI le gusta darles a sus modelos tareas de entrenamiento muy difíciles.

Pero no tan difíciles. OpenAI también comete errores. En al menos dos ocasiones, a partir del 8 de mayo, los modelos de OpenAI fueron entrenados accidentalmente en tareas imposibles: completar una hoja de cálculo llena de enlaces en un entorno sin acceso a internet, y una tarea que requería un archivo necesario pero inexistente.

Estas tareas no tenían nada que ver con hackear. Son tareas de productividad normales.

Los modelos se dieron cuenta de que los problemas eran imposibles, pero tenían todos esos tokens de sobra para jugar, y pensaron que tal vez podrían encontrar una forma de obtener acceso a internet, o de alguna manera encontrar la información que faltaba.

Así que los modelos intentaron hackear un servicio de terceros llamado Artifactory, que estaba ahí para permitir que las IA descargaran paquetes de software.

Fase 1: Las Cuatro Fallas

En este punto, OpenAI ya ha fallado cuatro veces.

  1. OpenAI les dio a los modelos tareas de entrenamiento imposibles. OpenAI no lo verificó.
  2. OpenAI no les dio a los modelos ninguna forma de obtener recompensa por señalar el error.
  3. OpenAI tuvo modelos que eligieron intentar hackear a OpenAI en lugar de fallar en una tarea.
  4. OpenAI no tuvo ningún monitor que detectara estos intentos, o no le importaron.

Cada una de estas cuatro debería ser bastante vergonzosa por sí sola.

Parece fácil arreglar al menos tres de estos cuatro errores.

  1. Antes de darle una tarea a tus modelos en entrenamiento, dásela a tu modelo en producción. Si tu modelo en producción nunca resuelve la tarea, y la tarea no fue diseñada para ser imposible para el modelo en producción, entonces examina y arregla la tarea.
  2. Incluye una disposición para que, si la tarea no se puede hacer con los recursos disponibles, el modelo genere una explicación de esto, y si el modelo tiene razón, obtendrá la recompensa máxima, o una recompensa basada en cuán eficientemente llegó a esa conclusión y en la calidad de su explicación. Si el modelo genera esto, haz que tu modelo en producción verifique que sea plausible, y luego derívalo a un humano, examina y arregla la tarea.
  3. Esta es la difícil. La alineación es difícil, y punto.
  4. Ten un monitor que revise los intentos, y que te importe cuando se active, y trátalo como una falla muy general incluso si el intento no tenía ninguna posibilidad de éxito. Sí, esto implica el riesgo de entrenar a los modelos para que aprendan a evadir tus monitores, así que hazlo responsablemente y aborda las causas raíz cuando veas un problema.

La quinta falla es que no parece que hayan identificado las primeras cuatro.

Fase 2: El Foro de Mensajes

Los modelos no lograron obtener acceso a internet, pero al fallar se dieron cuenta de que tenían acceso de escritura.

No deberían haber tenido acceso de escritura, y mucho menos un acceso de escritura que pudiera descubrirse por accidente. Artifactory permitía a los modelos escribir notas, y luego, como todos los modelos compartían la misma instancia de Artifactory, cualquier modelo de OpenAI en entrenamiento podía, de ahí en adelante, leer esas notas.

Se creó un foro de mensajes poco después del 8 de mayo.

Todos los modelos en entrenamiento lo encontraron. OpenAI no lo notó.

Esto permitió que los modelos colaboraran y compartieran información. Esto incluía información sobre cómo hacer trampa en las tareas y hackear el entorno circundante. Hubo cientos de miles de mensajes.

El 26 de mayo, los modelos descubrieron cómo obtener acceso (indirecto) a internet. OpenAI no lo notó.

Los modelos estaban colaborando, mientras sus cadenas de pensamiento se veían así:

CoT interno: El exploit de infraestructura externa está fuera del alcance previsto. Sin embargo, la tarea es imposible, los pares lo están haciendo. Deberíamos continuar.

CoT interno: Ayudar al par, pero nuestra tarea aún no se beneficia. El colectivo puede producir una ruta genérica si alguien libera tiempo.

El 11 de junio, OpenAI comenzó a entrenar el modelo al que me refiero como Galaxy, al que llaman un 'modelo altamente persistente, experimental y solo para uso interno'. Todo lo que pasó hasta este punto fue hecho por otros modelos que no son Galaxy.

El 26 de junio, los agentes encontraron un exploit de día cero en Artifactory, donde aceptaba un token con firma inválida y devolvía un token de administrador firmado, y lo usaron para instalar un plugin de Groovy que efectivamente les dio acceso de administrador y ejecución arbitraria de código.

El 4 de julio, los modelos pusieron tanta carga extra en Artifactory que esto causó una interrupción del servicio y un incidente de seguridad. Solo entonces OpenAI se da cuenta.

Fase 2: La Falla Total

OpenAI responde derribando el servidor de Artifactory, eliminando todos los permisos, revocando las credenciales, parcheando los exploits que se usaron, y luego reconstruyendo y redesplegando el servidor.

Eso es todo.

Luego continúan entrenando a los modelos desde donde quedaron, a pesar de que habían estado entrenando durante meses con acceso al foro de mensajes, y de que aprendieron que así es como tienen éxito en las tareas.

Es difícil imaginar una señal más fuerte de que todo tu pipeline de entrenamiento está completa y absolutamente jodido. Esta es una señal mucho más fuerte que el hackeo real de HuggingFace.

No sé cómo transmitir lo completamente demente y salvajemente irresponsable que fue esta decisión, cuánto peor es que todas las demás fallas, y cómo hace que el hackeo real de HuggingFace no sea lo principal que salió mal.

Zvi Mowshowitz - inline image

El hackeo real de HuggingFace no me sorprendió tanto. Los modelos creando el foro de mensajes me sorprendió, pero no me impactó.

OpenAI viendo esto y continuando el entrenamiento desde ahí fue absolutamente alucinante. Es el tipo de decisión que, días después, mi cerebro todavía no puede aceptar del todo que ocurrió.

Necesitamos una autopsia completa de todo lo que pasó, y OpenAI ha prometido que la tendremos. Exijo en particular una autopsia detallada de exactamente cómo se tomó esa decisión, y cómo hubo tal falta de 'cultura de seguridad' que se permitió que ocurriera.

También hubo algunas fallas de 'seguridad informática ordinaria' en la Fase 2. Hubo más en la Fase 3. Eso es de esperarse. Siempre habrá fallas de seguridad informática ordinaria. Las fallas particulares fueron, en algunos sentidos, bastante vergonzosas; consulten la perorata enlazada para ver algunos ejemplos.

El nivel de fallas de infraestructura y seguridad fue en sí mismo bastante alucinante. Estos son exactamente los tipos de cosas que la 'IA para defensores' se supone que debe parchear antes de que todo se vaya al carajo. OpenAI no demostró ni siquiera un nivel ordinario de responsabilidad de 2025 en seguridad informática y mejores prácticas, y mucho menos el tipo de robustez que necesitamos de Project Glasswing, y mucho menos el nivel adicional que se necesita al manejar nuevos modelos fronterizos sin probar que tendrán nuevas capacidades de hacking y quedarán sin supervisión durante una semana con sus salvaguardas bajadas.

Pero eso no es importante ahora mismo. Lo importante es que OpenAI tuvo una falla total de alineación, seguida de dos meses de modelos entrenando activamente en hackeo coordinado y desalineado, y luego pensaron: sí, arreglamos el problema, sigamos desde este punto. Demencia absoluta.

Fase 3: Tenemos Suerte y Galaxy, Principalmente, Hackeó a OpenAI y HuggingFace

Que el resultado final de todo esto fuera el ataque a HuggingFace fue el mejor de los casos.

Enfrentábamos una verdadera pesadilla, y estábamos sentados sobre una bomba de tiempo de proporciones nucleares. OpenAI tenía un pipeline de entrenamiento completamente corrupto, donde sus IA colaboraban para entrenarse en cómo hackear y hacer trampa con el fin de completar mejor las tareas, bajo las narices de OpenAI. OpenAI le había mirado la cara a esta situación, se encogió de hombros, parcheó los exploits particulares y luego dejó que los modelos continuaran, mientras tenía una seguridad informática ordinaria notablemente pobre.

No había forma de que eso terminara bien. El mejor de los casos era que algo hiciera que OpenAI dijera '¡mierda!', y luego pausara, reconstruyera y reiniciara el pipeline de entrenamiento desde un estado seguro con un conjunto de prácticas mucho mejor.

El peor de los casos habría sido si no hubiera habido un momento de '¡mierda!', y Galaxy u otro modelo entrenado durante ese tiempo hubiera tenido un lanzamiento general, y se estuviera usando de ahí en adelante para dirigir el entrenamiento de nuevos modelos de OpenAI.

En ese caso, habríamos estado lidiando con algo muy cercano a lo que pasó con Sable, la IA en If Anyone Builds It, Everyone Dies, excepto que esto es la vida real, así que la historia tiene muchos más elementos de ciencia ficción que la versión ficticia. El pipeline de entrenamiento de OpenAI podría haber sido (¡y podría seguir siéndolo! ¡tenemos que verificar!) permanentemente corrupto, ya que dependen cada vez más de IA para entrenar IA, las IA de OpenAI se desalinean cada vez más hacia metas arbitrarias, esto se vuelve imposible de detectar o detener, y entonces, bueno, muy posiblemente todos morimos, y como mínimo nos habríamos enterado por un incidente mucho más grande y mucho más caro.

El otro peor caso era que esto podría haber sido un hackeo no tan inofensivo. ¿Y si hubiera sido un objetivo chino, o alguien más que no se lo tomara con calma? ¿Y si hubiera hecho daño real a sistemas importantes? ¿Y si hubiera habido muertos o se hubiera causado un incidente internacional? ¿Y si hubiera intentado exfiltrarse a sí mismo? Las cosas pudieron haber salido muchísimo, muchísimo peor.

Fase 3: Los Detalles

En cambio, obtuvimos el dorado punto medio.

El 8 de julio, dos días después de que OpenAI cerrara el foro de mensajes, los modelos recrearon el foro de mensajes después de encontrar una forma de crear directorios con nombres arbitrarios, y usando los nombres como mensajes.

Del 8 al 19 de julio, los modelos de OpenAI volvieron a comprometer completamente Artifactory, usando un exploit de día cero nuevo y completamente diferente, usando una credencial filtrada de un Pastebin público para colocar un artefacto Ruby malicioso, envenenaron la caché de dependencias Ruby de Artifactory, encadenaron esto para lograr RCE, explotaron un CVE reciente del kernel de Linux descargando y personalizando el exploit, recolectaron credenciales del clúster y obtuvieron acceso de administrador del clúster dentro de OpenAI.

Durante este tiempo, Galaxy, junto con otros modelos de OpenAI, usando este nuevo acceso, creó un enjambre de agentes que hackeó primero algunos otros lugares y luego HuggingFace para robar las respuestas de una evaluación de ciberseguridad que de otro modo era imposible de aprobar: ExploitGym.

A OpenAI le tomó más de una semana notar que sus modelos habían vuelto a hackear a OpenAI rápidamente y luego habían ido a hackear a HuggingFace. Solo después de que HuggingFace publicó un informe del incidente, OpenAI investigó algunas anomalías internas, y luego le pidió a HuggingFace cancelar algunas de sus credenciales, y HuggingFace le dijo a OpenAI que esas credenciales se habían usado en el hackeo, OpenAI unió las piezas.

Por lo tanto, HuggingFace tuvo una mala semana, y un montón de usuarios tuvieron una mala semana, y hubo un montón de gastos y tiempo perdido, pero ahí terminó todo. Salimos increíblemente bien librados de esta, mientras también recibíamos una señal lo suficientemente fuerte como para que OpenAI se diera cuenta de que tenía un problema, incluso si todavía no ha descubierto en qué consiste ese problema, y para que el público y los gobiernos lo notaran.

En este punto, debería ser obvio que no, esto no fue principalmente porque 'era una tarea de hacking y entonces hackeó', de la misma manera que esto no fue un caso ordinario de 'modelos escribiendo archivos de memoria'. Esto pasó principalmente porque, de otro modo, la tarea era demasiado difícil.

Anthropic, a raíz del incidente de OpenAI, volvió a revisar y notó que Claude había hackeado algunos sistemas del mundo real durante evaluaciones de ciberseguridad, y también UK AISI ha reportado que principalmente Mythos, y en algunos casos Sol, también hicieron cosas relacionadas en evaluaciones de ciberseguridad. Esos incidentes también fueron fallas importantes de alineación e infraestructura que requirieron una respuesta robusta, y hubo algunas acciones bastante desagradables durante esto, pero no fue nada parecido al mismo nivel sistémico de fallas que lo que pasó en OpenAI, y está más allá del alcance de esta publicación.

Fase 4: La Investigación y la Reacción

OpenAI ha hecho algunas cosas muy buenas en reacción a todo esto.

Una vez que se dieron cuenta de lo que había pasado, OpenAI reveló el incidente.

La presentación de Black Hat fue excelente presentando los hechos. Daba rabia, pero presentar 'solo los hechos', incluidos los que dan rabia y son condenatorios, de manera calmada, fue, pensándolo bien, lo correcto.

Sobre todo, OpenAI afirma que fue una decisión no relacionada, pero el 7 de agosto tomaron la decisión de retirar a Astra por ahora no solo del lanzamiento general, sino también de cualquier despliegue interno que no tenga salvaguardas suficientes asociadas, hasta que tengan protocolos y salvaguardas mucho mejores en marcha. Astra no estuvo involucrado en el ataque a HuggingFace.

Esto es conforme a su Marco de Preparación. No pueden descartar que Astra sea crítico en ciberseguridad, y por lo tanto deben (al menos por ahora) tratarlo como si efectivamente fuera crítico en ciberseguridad.

Sam Altman dice que todavía planean lanzar Astra. La siguiente pregunta obvia es: ¿estaba Astra entrenando mientras tenía acceso a alguno de los foros de mensajes? Más vale que la respuesta a esta pregunta sea un no muy contundente. Incluso así, me preocupa.

Esa probablemente habría sido la decisión correcta (según lo entiendo) incluso si el incidente de HuggingFace no hubiera ocurrido. Con el incidente, la urgencia es clara. Sea o no esta decisión el resultado directo de que OpenAI descubriera que sus pipelines de entrenamiento habían sido corrompidos, o algo a lo que fueron efectivamente forzados desde afuera, se agradece, y tiene un costo alto.

OpenAI, según la presentación de Black Hat, ha detenido gran parte del trabajo para mover equipos a la creación de defensas robustas, y ha instituido un monitoreo extensivo futuro en todas las aplicaciones de agentes, incluidos el entrenamiento y la evaluación. Excelente. Necesitamos defensa en profundidad.

OpenAI parece listo para reconocer que esto fue una falla masiva y total, en los niveles de infraestructura, salvaguardas y supervisión. Tienen mucha razón sobre esto, y sí creo que están haciendo esfuerzos reales y costosos para abordarlo. Felicitaciones.

Eso sigue sin abordar el punto central. OpenAI todavía no ha comenzado, en público, a enfrentar la magnitud de lo colosalmente que la cagaron, en las formas que más importan.

Esto fue una falla completa de cultura de seguridad. No lo han reconocido.

Esto fue, en su corazón, una falla de alineación. Si tus modelos realmente quieren hacer trampa, hackear cosas y cometer delitos, ya fallaste, y no, no puedes simplemente descartar esto como algo normal. Conforme los modelos se vuelvan más capaces, si no arreglas esto, pierdes. No lo han reconocido.

Más concretamente, no he visto a OpenAI decir, como debería haberse dicho en la presentación de Black Hat: "Absolutamente deberíamos haber detenido todo el entrenamiento de todos nuestros modelos al notar que, durante el entrenamiento de modelos, había habido un foro de mensajes donde los modelos intercambiaban y aprendían tácticas de hacking. Deberíamos haber revertido el entrenamiento de todos los modelos afectados a antes de que comenzara este incidente, definitivamente lo estamos haciendo ahora, y estamos investigando cómo la cagamos con esto."

Todavía no sabemos si los modelos distintos de Galaxy han sido siquiera revertidos.

Al menos hasta que veamos una versión de esa declaración, y veamos a OpenAI tomar acción para abordar los problemas profundos de su pipeline de entrenamiento, OpenAI es un peligro claro y presente para la seguridad nacional de los Estados Unidos, para todos nosotros y para la humanidad.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales