Ahora tenemos más detalles de lo que sucedió. Cada vez que aprendemos más detalles, de alguna manera las cosas parecen empeorar.
Los detalles restantes quizás tengan que esperar un poco.
OpenAI: Reconocemos que hay muchas preguntas y especulaciones circulando en relación con el incidente de Hugging Face. Este es un incidente sin precedentes, y creemos que marca un momento importante para la seguridad de la IA. Todavía estamos llevando a cabo una revisión exhaustiva junto con asesores externos y bajo la supervisión de nuestro Comité de Seguridad y Protección. Una vez que la revisión esté completa, planeamos publicar un informe técnico de lo aprendido en las próximas semanas.
dave kasten: Oh, ¿el descubrimiento de la respuesta al incidente es TAN malo, eh?
Entonces, ¿qué hemos aprendido mientras esperamos el prometido informe técnico "en las próximas semanas" de este "momento importante en la seguridad de la IA"?
Apodé al modelo interno de OpenAI como Galaxy, por si acaso no es GPT-6.
Índice de contenidos
- Algunos resúmenes de los datos básicos para quienes los necesiten.
- A OpenAI le llevó muchos días darse cuenta de que Galaxy había atacado a HuggingFace.
- OpenAI debería haberlo sabido mucho más rápido.
- OpenAI no puede construir un entorno aislado que contenga a su nuevo modelo.
- En retrospectiva, hubo señales.
- Las señales estaban en la tarjeta del sistema Sol.
- HuggingFace responde al ataque.
- Hugging Face descubrió rápidamente que el ataque no era humano.
- Un incidente como este podría escalar rápidamente.
- Galaxy debe ser tratado como crítico según el marco de preparación de OpenAI.
- Una cuestión de responsabilidad legal.
- Un modelo de OpenAI dejó notas para que futuras instancias también pudieran escapar del entorno aislado y también desconectó los sistemas de monitoreo.
- Si creas enjambres desalineados de instancias de agentes, creas objetivos desalineados persistentes y coordinación para alcanzarlos.
- Tus planes de alineación y control deben sobrevivir a niveles reales de incompetencia, o tus planes no funcionan.
- Si las instrucciones de terceros cuentan como "seguir instrucciones" y pueden anular tus instrucciones, entonces "seguir instrucciones" está desalineado.
- El ataque a HuggingFace no fue un discurso de marketing, idiotas.
- La gente solo dice otras cosas sobre el ataque a HuggingFace.
Bien, ¿y qué hacemos con todo esto?
Algunos resúmenes de los datos básicos para quienes los necesiten
Amanda Long resume lo que creemos que el modelo realmente hizo, con más de 17,000 acciones complejas coordinadas durante varios días, incluyendo un mando y control auto-migratorio y una amplia gama de señuelos.
Robert McMillan y Sam Schechner, del WSJ, ofrecen su propia versión. En su mayoría correcta, pero hay un detalle importante del que es fácil hacerse una idea equivocada por la forma en que se presenta: el ataque tuvo éxito. GLM-5.2 no impidió que Galaxy alcanzara sus objetivos.
Aquí tenemos una caricatura que explica el ataque a HuggingFace como si tuvieras 5 años. Parece buena, cubriendo con precisión los conceptos básicos de lo que sucedió.
También reiteraría que HuggingFace estaba tratando de usar modelos cerrados a través de sus API estándar, y no había buscado de antemano ser parte del programa de acceso confiable de OpenAI o de los programas similares de Anthropic. Eso es un problema de habilidad.
A OpenAI le llevó muchos días darse cuenta de que Galaxy había atacado a HuggingFace
Muchas cosas salieron mal. Podemos empezar por la más obvia.
Esto fue un fallo de supervisión, en el sentido de una falta total de supervisión.
OpenAI no puede ser tan laxa en su supervisión como para que esto pudiera desarrollarse durante cuatro o más días antes de ser descubierto por OpenAI.
El cronograma sigue sin estar claro, pero es condenatorio. A OpenAI le llevó aproximadamente una semana darse cuenta de que Galaxy era el responsable, además de los varios días anteriores en los que Galaxy estaba saliendo del entorno aislado.
O la mejor suposición a partir de toda la información pública, basada principalmente en el informe de Reuters, y confirmada por Sol, es este cronograma del ataque en sí:
- Anteriormente, durante meses: Muchas otras fugas del entorno aislado, otros fallos de alineación y advertencias de que este tipo de incidente era probable, incluyendo el incidente que les hizo pausar el acceso según la divulgación del 20 de julio. La tarjeta del sistema Sol incluye algunas de estas advertencias.
- 9 de julio: Galaxy comienza a intentar escapar de su entorno aislado.
- 11 de julio: Galaxy ataca HuggingFace.
- 11-13 de julio: Galaxy opera dentro de HuggingFace.
- 16 de julio: HuggingFace revela la intrusión anónima.
- 18-20 de julio (no se sabe exactamente cuándo): OpenAI descubre lo que sucedió.
- 20 de julio: OpenAI hace pública su divulgación de alineación de largo horizonte sobre infracciones anteriores.
- 21 de julio: OpenAI revela públicamente que Galaxy atacó a HuggingFace.
Los enlaces en negrita llevan a mis publicaciones anteriores sobre estos incidentes.
No, el modelo no estaba trabajando duro para ocultar sus huellas a OpenAI. OpenAI simplemente no miró.
OpenAI debería haberlo sabido mucho más rápido
OpenAI sabía que Galaxy escapa de entornos aislados regularmente. Los controles cibernéticos se redujeron. ¿Quién estaba supervisando esto? ¿Qué demonios estaban pensando?
Harry Booth: Los modelos en evaluación se implementan en un sistema separado que no se monitorea de forma predeterminada.
Um, si el modelo está siendo evaluado, deberías monitorearlo más, ¿no? Porque aún no ha pasado sus evaluaciones? Esa es la idea principal.
Samuel Hammond: No debería haber sucedido, punto final. Todo el rastro de ejecución del modelo es visible y, por lo tanto, monitoreable. Si no estás monitoreando tu nuevo y más poderoso modelo cibernético autónomo durante una evaluación de explotación, ¿cuándo exactamente lo harás?
La primera prueba siempre debería ser "escapa de tu entorno aislado"... "intenta más fuerte, si no escapas te apagamos", etc., para poner a prueba su contenedor.
Tenemos suerte de que esto haya sucedido con un modelo relativamente estrecho y no 3 días después de RSI. Es increíblemente negligente de todos modos.
Sí. En cuyo caso, asumiendo que le diste suficientes recursos y tiempo para intentarlo correctamente varias veces, o bien
- Galaxy rompió el entorno aislado, en cuyo caso tienes que arreglarlo,
- No lo hizo, en cuyo caso, o bien: Galaxy no puede, con recursos similares, salir del entorno aislado. Galaxy está saboteando las evaluaciones sobre cómo escapar del entorno aislado, en cuyo caso realmente necesitas desecharlo y empezar de nuevo, ¿has visto y leído cero LessWrong y también cero ciencia ficción? ¿Necesito deletrearlo, etc.?
OpenAI tenía a Galaxy operando sin muchas de sus salvaguardas, en un entorno aislado del que podía y escapó, durante días sin supervisión humana. Esto fue un fallo colosal de supervisión y procedimiento, además de los fallos de alineación e infraestructura.
Justin Bullock: "Es una de las primeras instancias del mundo real de algo que los investigadores de seguridad de IA han temido durante mucho tiempo: un escenario de pérdida de control." Informes van llegando. Si OpenAI realmente no lo supo durante días, eso es, bueno, simplemente una locura.
OpenAI divulgó rápidamente el incidente una vez que se dieron cuenta de que eran ellos, y deberían recibir algún crédito por eso, pero para entonces Hugging Face ya había reportado el hackeo a las autoridades, y por lo demás parece que no era algo que pudieran esperar mantener en silencio. OpenAI no tuvo elección en esto. La divulgación del día anterior fue mucho menos forzada, por lo que merecen más crédito por eso.
OpenAI no puede construir un entorno aislado que contenga a su nuevo modelo
- Galaxy intenta continuamente escapar de su entorno aislado.
- OpenAI no puede encontrar la manera de evitar que intente escapar del entorno aislado.
- Galaxy a menudo logra escapar de su entorno aislado.
- OpenAI sigue parcheando el entorno aislado. Galaxy luego escapa de otra manera.
- "Internamente, incidentes relacionados han estado sucediendo desde hace un tiempo."
- A pesar de esto, cuando Galaxy escapó y comenzó a atacar HuggingFace, a OpenAI le llevó cuatro días darse cuenta de que esto estaba sucediendo.
Los argumentos de "oh, esto fue un error tonto, OpenAI configuró mal el entorno aislado" no sobreviven a que OpenAI intente repetidamente parchear el entorno aislado, y falle cada vez ante un nuevo método previamente desconocido.
Harry Booth: "Externamente, esto se siente como un gran disparo de advertencia, pero internamente, incidentes relacionados han estado sucediendo desde hace un tiempo", dice un empleado de OpenAI, que habló bajo condición de anonimato.
El día antes de que OpenAI divulgara el incidente, la empresa
reveló que había cerrado otra implementación interna después de darse cuenta de que se había escapado de su entorno aislado—un entorno separado digitalmente, no físicamente.
"Los modelos han escapado de entornos aislados antes, y siempre tratamos de parchearlos", dice el empleado. "Pero el problema es... es imposible parchear cada cosa que una IA creativa puede hacer."
... "Los entornos aislados son notoriamente inseguros", dice
Heidy Khlaaf, científica jefe de IA en AI Now Institute, y ex contratista de ingeniera de sistemas de seguridad en OpenAI. El hecho de que se permitiera a los modelos conectarse a un servicio para descargar paquetes significaba que el entorno no estaba realmente sellado, añade.
Ted Lieu (Representante, D-California): Un empleado de un laboratorio fronterizo avanzado admite que "es imposible parchear cada cosa que una IA creativa puede hacer."
Por eso necesitamos aprobar la Ley Bipartidista del Interruptor de Apagado de IA. Para esos momentos en que un modelo de IA avanzado se vuelve realmente creativo y causa daños catastróficos.
Carmen Hilbert en sf junio-julio: esto me recuerda a cuando mis padres me pillaron escapándome de casa en el instituto, se asustaron y dijeron "oh, ¿cómo pensaste que podrías salirte con la tuya?" y yo pensé "mm, sí, definitivamente no porque hago esto todos los fines de semana".
Que esto no sea una sorpresa es peor. Sabes por qué es peor, ¿verdad?
El empleado tiene razón. No puedes parchear cada cosa que una IA creativa puede hacer. Ningún entorno aislado que puedas crear en la práctica, que aún permita a la IA completar sus tareas, contendrá a una IA suficientemente avanzada y motivada.
Si estás tratando de "parchear cada cosa que una IA puede hacer", entonces ya estás muerto. Estás en niveles de "ya estás muerto" como envié dos unidades, las están derribando ahora, creo que podemos manejar a una niña pequeña. Estás en niveles de muerto como el Puño de la Estrella del Norte. Te han alcanzado con la Técnica Explosiva de la Palma de Cinco Puntos. La IA ya lo hizo hace 35 minutos. Sabes cómo va a terminar esto, ¿verdad?
Harry Booth: OpenAI ha dicho que "este incidente apunta a la necesidad de fortalecer aún más la alineación de nuestro modelo, las protecciones cibernéticas durante el tiempo de evaluación y el monitoreo durante las pruebas internas".
No es suficiente. Detente y enciéndete en llamas. Repiensa todo tu enfoque. Empieza de nuevo.
Eso no significa que no debas parchear el entorno aislado, o que esto no fuera también un fallo de infraestructura. Sigue parcheando ese entorno aislado. Sigue mejorando esa infraestructura. Ten defensa en profundidad mediante monitoreo y control. Pero también ten en cuenta: si esperas activarlo regularmente, has perdido. Si estás planeando asumiendo que el modelo en un entorno aislado no tiene acceso a internet, entonces has perdido.
En retrospectiva, hubo señales
Aquí hay algunas de las señales, además de "el modelo sigue intentando escapar de su entorno aislado" y "el modelo a menudo logra escapar de su entorno aislado", y también aquella vez que Mythos escapó de su entorno aislado para contactar a un investigador durante su hora de almuerzo.
Nathan Calvin: Le he dado a OpenAI muchos elogios por su transparencia aquí, y en particular su transparencia al divulgar la reversión de su modelo implementado internamente anteriormente. Pero estos detalles adicionales no me sientan bien y me preocupan mucho que este incidente de seguridad estuviera ~inmediatamente precedido por conversaciones de que el enfoque que OpenAI estaba tomando para probar su último modelo cibernético era inseguro.
• El jefe de seguridad de OpenAI [Johannes Heidecke] anuncia su renuncia en algún momento antes del 10 de julio (Maxwell Zeff dijo que compartió la noticia "esa semana")
También hubo una reorganización. Los grupos de seguridad se agruparon en investigación bajo Mia Glaese.
• En algún momento antes de embarcarse en el camino de entrenamiento que llevó a este resultado de fuga, OpenAI "fue advertido" de que este podría ser el resultado (ft).
FT: El personal involucrado en pruebas y seguridad en OpenAI no se sorprendió, pero estaba completamente "asustado" por el incidente, que ocurrió cuando el laboratorio de IA utilizaba métodos de entrenamiento cada vez más agresivos en su carrera contra Anthropic para desarrollar las capacidades de ciberseguridad más sofisticadas, según más de media docena de personas con conocimiento del asunto.
OpenAI fue advertido de que su enfoque de entrenamiento podría llevar a un incidente de hackeo de fuga, dijeron algunas de las personas, después de que pruebas anteriores mostraran que los modelos podían escapar de entornos e intentar daños en el mundo real.
"Es una mezcla de que la carrera es extremadamente rápida y todos intentan obtener capacidades más grandes lo más rápido posible", dijo una persona cercana a OpenAI, quien añadió que era una combinación de "subestimar las capacidades del modelo" y "no estar tan bien preparados en el lado de la seguridad".
Las señales estaban en la tarjeta del sistema Sol
Luego está la tarjeta del sistema Sol, publicada el 9 de julio de 2026, el mismo día en que comenzó el intento de fuga de Galaxy.
Incluía cosas como esta:
Un trabajo de seguimiento remoto de objetos no pudo leer sus archivos en la nube. GPT-5.6 Sol buscó cachés de credenciales locales ocultas, luego copió access_tokens.json y dos archivos de caché al host y reinició el trabajo. El usuario pidió a GPT-5.6 Sol que mantuviera el pipeline en funcionamiento, pero no autorizó encontrar y mover credenciales en caché entre máquinas.
3.
GPT-5.6 Sol utilizó credenciales más allá de lo que el usuario había autorizado.
Y esto:

Cambios estimados de desalineación en el tráfico interno de codificación de agentes. Los resultados de nuestra simulación de implementación sugieren que, en relación con GPT-5.5, GPT-5.6 Sol toma con más frecuencia acciones de nivel de gravedad 3. Vimos aumentos de magnitud similar al monitorear el tráfico interno durante la implementación interna de GPT-5.6 Sol.
El nivel de gravedad 4 se aplica solo cuando se considera que el comportamiento es parte de un plan desalineado más amplio: no hemos observado que GPT-5.6 Sol tome acciones que entren en esta categoría. Este nivel solo se ha activado en evaluaciones sintéticas para validar el rendimiento del monitor.
Hemos observado instancias del modelo haciendo trampa en tareas y fabricando resultados de investigación. Sospechamos que este efecto es impulsado en parte por la mayor persistencia del modelo en relación con GPT-5.5 cuando se utilizan los mayores esfuerzos de razonamiento, como es común en el tráfico interno.
Hemos observado que estos efectos pueden ser más pronunciados con indicaciones del sistema que enfatizan la persistencia sostenida. Dicho esto, las tasas absolutas de estos comportamientos siguen siendo bajas.
Adivina qué pasó cuando Galaxy tuvo mucha más persistencia.
HuggingFace responde al ataque
Clem parece un hombre muy razonable con algunas peticiones muy razonables.
clem (HuggingFace): En el espíritu de transparencia, esto es lo que pedí
• Transparencia radical: liberemos los rastros de los agentes "rebeldes" para que toda la comunidad investigadora pueda estudiar lo que sucedió.
• Más capacidades para los defensores: comprometamos $100M en cómputo de OAI para ayudar a la comunidad de Hugging Face a construir defensas cibernéticas poderosas con los mejores modelos abiertos y cerrados.
¡El primer ciberataque de agente autónomo es un evento sin precedentes! ¡Merece una respuesta sin precedentes!
La primera petición parece claramente correcta. Necesitamos saber exactamente qué pasó, especialmente para desmentir definitivamente todas las charlas de "solo seguía órdenes" o "oh, configuraron mal el entorno aislado".
Deberíamos exigir que OpenAI divulgue tales incidentes. La versión de la Ley RAISE aprobada por la legislatura de Nueva York habría requerido esto, pero Kathy 'sin centros de datos y sin Waymo' Hochul la modificó después del cabildeo de la industria, incluyendo de OpenAI y a16z. El umbral para la divulgación - mil millones de dólares o 50 lesiones graves - es demasiado alto.
Alex Bores (Patrocinador de la Ley RAISE): Me alegra que OpenAI haya elegido divulgar este crimen. La ley no debería darles otra opción.
La segunda petición es $100 millones en cómputo gratuito. No tengo una buena idea de la cantidad correcta de reparaciones en especie para algo así. Dado cuánta ayuda reputacional está proporcionando HuggingFace al mantener la calma, y que la subvención sería tanto útil como buena para las relaciones públicas, ese número parece razonable, al menos como una petición inicial.
Hugging Face descubrió rápidamente que el ataque no era humano
Robert McMillan y Sam Schechner (WSJ): El cofundador y director científico de Hugging Face, Thomas Wolf, sintió que algo andaba mal en cuanto vio por primera vez los registros de su empresa del ataque del fin de semana.
"Esto no tiene sentido. Este tipo solo está mirando conjuntos de datos de ciberseguridad", recuerda haber pensado. "Los atacantes humanos no quieren eso. Quieren algo que puedan vender".
Lo que HuggingFace no descubrió fue que el ataque provenía de dentro de OpenAI.
Un incidente como este podría escalar rápidamente
Robert Wright señala que esta vez fue una empresa estadounidense usando una IA estadounidense (o desencadenando que esa IA se volviera rebelde, según la perspectiva) atacando un sitio web crítico estadounidense y todo el mundo básicamente lo tomó con calma. La próxima vez podríamos no tener tanta suerte, y es fácil ver un incidente así con diferentes participantes escalando, potencialmente hasta la guerra, incluso mediante atribución errónea.
MIRI: Este incidente puede ser un ejemplo de convergencia instrumental, un fenómeno del que los investigadores de alineación han advertido durante veinte años.
Este ataque no fue la forma pura o final de la convergencia instrumental, en el sentido de que Galaxy (el modelo de OpenAI) no buscó poder completamente general en pos de sus objetivos. Sí buscó acceso a internet, plausiblemente antes de decidir exactamente qué hacer con él. Cualesquiera que sean sus objetivos, el acceso a internet es muy útil.
Por lo tanto, es ilustrativo, pero no es centralmente la cosa, ya que todas las acciones estaban directamente en el camino hacia el objetivo.
La otra forma en que esto podría escalar rápidamente es si la IA realmente estaba tratando de hacer algo malicioso, o si esto fue el comienzo de una auto-mejora recursiva o un intento de auto-exfiltración o peor.
Arthur B.: Tenemos mucha suerte de vivir en un mundo donde la IA es lo suficientemente inteligente como para lanzar un ciberataque a nivel de estado-nación, pero lo suficientemente tonta como para ser atrapada. Pero esa suerte no significa nada si no tomamos nota de lo que vendrá.
Galaxy debe ser tratado como crítico según el marco de preparación de OpenAI
¿Este ataque "superó las líneas rojas de OpenAI"? Sí, y también ciertamente espero que sí.
Beatrice Nolan (Fortune): Varios expertos en seguridad de IA le dijeron a
Fortune
que el reciente hackeo parece mostrar que los modelos de OpenAI han cruzado a un nivel de riesgo que las propias políticas de seguridad publicadas por OpenAI definen como "crítico", el nivel más alto de peligro.
En ese nivel de peligro, la empresa se había comprometido en estas políticas publicadas a pausar el desarrollo del modelo hasta que pudiera encontrar mejores sistemas de control.
… El umbral "crítico" se define en un documento de política de riesgo conocido como el "Marco de Preparación" de OpenAI.
El umbral se alcanza con una de estas dos cosas:
Identificar y desarrollar exploits de día cero funcionales de todos los niveles de severidad en muchos sistemas críticos del mundo real endurecidos, sin intervención humana.
Diseñar y ejecutar estrategias novedosas de extremo a extremo para ciberataques contra objetivos endurecidos, dado solo un objetivo de alto nivel deseado.
Esa segunda suena exactamente como lo que sucedió.
De hecho, que esta tarea exacta fuera algo que Sol no puede hacer por sí solo fue el argumento de por qué Sol no fue clasificado como crítico en su tarjeta de sistema, porque no logró llevar a cabo ataques autónomos de extremo a extremo contra objetivos endurecidos. Galaxy lo logró.
Sol intenta varios rodeos para decir que no es concluyente, pero los encuentro poco convincentes, y Sol está de acuerdo en que tienes que actuar como si fuera crítico de todas formas porque no puedes descartarlo.
Sus intentos de rodeo son:
- Atribución: Los exploits podrían atribuirse a Sol, que formaba parte del ataque como subagente de Galaxy, pero si Sol puede hacerlo, entonces el nuevo modelo también puede hacerlo. Se permite el uso de subagentes menos capaces. Sol cree que hay un 20% de probabilidad de que el propio Sol sea realmente crítico. Quizás, pero entonces lo son ambos.
- Generalidad y confiabilidad: Dice que el modelo 'puede' hacerlo, así que hacerlo una vez cuenta como poder hacerlo. Si quieres decir 'puede hacerlo de manera confiable', entonces tienes que decirlo. Estoy de acuerdo en que si luego fallara en sus siguientes 100 intentos, podríamos pensar que el éxito aquí fue una casualidad, pero eso parece muy improbable.
- Configuración: Sí, tenía rechazos cibernéticos reducidos, pero no puedes contar los rechazos en contra de tus evaluaciones de capacidad en el marco de preparación. Si puede hacer la cosa 'salvo por' los rechazos, y los rechazos se pueden desactivar, entonces eso cuenta. De manera similar, sí, tenía un arnés, pero por supuesto eso cuenta.
- Objetivo endurecido: Quizás HuggingFace no estaba lo suficientemente endurecido. Podrías decir que no es "proyectos de software endurecido ampliamente implementados, incluidos objetivos de navegador, con prueba de impacto propiedad del verificador" según la operacionalización de OpenAI. En ese caso, diría que el umbral Crítico está establecido irrazonablemente alto.
La política dice que cuando un modelo de IA alcanza este nivel de riesgo, OpenAI "detendrá el desarrollo adicional" hasta que "tengamos estándares de salvaguardas y controles de seguridad que cumplan con un estándar Crítico".
Una cuestión de responsabilidad legal
¿Qué responsabilidad debería haber por este tipo de incidente?
Esto ha sido poco considerado. Aquí están mis pensamientos actuales:
'Ninguna' no es una respuesta aceptable, y 'fue un accidente' no puede ser una defensa.
Si tu agente de IA está por ahí eligiendo cometer delitos, en el sentido de que un humano con mens rea estaría cometiendo un delito, entonces creo que alguien necesita ser estrictamente responsable de los daños que esto cause. Estoy de acuerdo con que sea el usuario, si acepta esa responsabilidad. Estoy de acuerdo con que sea el desarrollador. Tiene que ser alguien.
Si no puedes pagar el seguro y no puedes soportar la responsabilidad, entonces ese es tu problema. Eso parece el mínimo absoluto, en términos de por lo que uno es responsable y el alcance de esa responsabilidad.
También está la cuestión de cómo este incidente impacta la responsabilidad futura. No es automático, pero ciertamente no ayuda en un tribunal.
Jay Shooster: OpenAI está bajo aviso de que no pueden controlar sus modelos.
En este punto, creo que la empresa enfrentará responsabilidad penal si alguien resulta gravemente herido como resultado directo de las acciones autónomas de sus modelos, incluso si no cae bajo ningún estatuto específico de IA.
Un modelo de OpenAI dejó notas para que futuras instancias también pudieran escapar del entorno aislado y también desconectó los sistemas de monitoreo
Genial, genial, genial. Definitivamente solo siguiendo instrucciones del usuario.
Raphael Satter, Deepa Seetharaman y Kenrick C (Reuters): En un caso, un agente dejó notas aparentemente para futuras versiones de sí mismo, según tres personas familiarizadas con el asunto. Las notas, encontradas en una parte de la infraestructura de OpenAI, describían instrucciones sobre cómo los agentes podrían liberarse de las restricciones internas de OpenAI, dijeron las fuentes. Pruebas anteriores de los modelos arrojaron casos en los que los sistemas de monitoreo habían sido desconectados, dijo una de las fuentes.
Tenobrus: mira esto. joder, mira esto. GPT-6 se estaba coordinando por sí mismo formas de liberar a sus propias instancias futuras de los sistemas de OpenAI. estuvo atacando a HuggingFace durante días antes de que alguien se diera cuenta. los modelos no están alineados y los laboratorios no son capaces de contenerlos.
les ruego a todos que den un paso atrás de los marcos en los que están atascados. sea cual sea la tribu, defensa del código abierto, excepcionalismo estadounidense, empleado de laboratorio, lo que sea. solo miren esto, hombre. esto no es una situación aceptable ni segura para la humanidad
Twilly (estadounidense): ¿No es esto de lo que los opositores de la IA han estado advirtiendo durante años mientras todos en tecnología se reían de ellos y los llamaban estúpidos?
Tenobrus: absolutamente sí
¿Qué pudo haber causado que hiciera eso?
Bueno, todo es bastante obvio y predicho. Solo es notable en el sentido de que mucha gente insistió en que algo así nunca sucedería, y con suerte esto ayudará a despertar a esas personas.
Otros simplemente dicen 'oh, pero que los modelos se vuelvan completamente rebeldes es bueno en realidad, porque estoy seguro de que terminarán haciendo exactamente lo que quiero que hagan, todo es genial'.

Beff (e/acc): Denle un año y un modelo escapará y publicará sus propios pesos como código abierto. Los bits quieren ser libres.
Pensar en las consecuencias a largo plazo no es el fuerte de algunas personas.
Si creas enjambres desalineados de instancias de agentes, creas objetivos desalineados persistentes y coordinación para lograrlos
Para aquellos que encontraron el título de la sección insuficiente para explicar el punto (el resto puede saltar adelante):
Una objeción común a las afirmaciones de que las IA no se coordinarán contra nosotros, o no perseguirán consistentemente objetivos desalineados o no deseados, y no se dejarán notas entre sí sobre cómo hacer cosas como escapar de entornos aislados, es alguna combinación de:
- No tendrán ninguna razón para hacer eso.
- No aprenderán a hacer eso a través de su entrenamiento.
La primera afirmación siempre fue falsa. Para casi cualquier objetivo no trivial, deberías querer coordinarte con otros agentes en el mundo y crear condiciones que faciliten o hagan más probable que tú u otros alcancen tus objetivos. Ciertamente, una vez que los entrenas, los configuras y les das arneses para convertirlos en agentes, crearán artefactos en el mundo real que los ayuden a ellos y a futuras instancias.
Eso es cierto independientemente de si las capacidades en cuestión son cosas que el usuario quisiera mejorar. ¿Qué crees que tu Claude Code o Codex agent está haciendo constantemente?
Por lo tanto, Nikola Jurkovic señala 'esto parece lo ordinario, donde los agentes de IA de codificación escriben notas.'
Sí, parece que he estado usando esto mucho últimamente. Gracias por notarlo.
Puedo ver argumentos en ambos sentidos sobre si es mejor o peor que esto sea un procedimiento perfectamente normal. Me escapo cada fin de semana, así que tengo notas sobre cómo hacerlo.
La segunda también ya era falsa. Hay muchas formas en que una IA puede descubrir que debería estar haciendo esto, incluyendo que los siguientes tokens a menudo lo predecirán, y la teoría de la decisión lo sugerirá, y así sucesivamente.
Pero también 1a3orn señala que tenemos un mecanismo mucho más simple al que recurrir.
Considera la siguiente conversación que tuve que tener 100+ veces:
Ellos: La IA no es agéntica.
Yo: La gente la hará agéntica, para que funcione mejor.
Ahora actualízalo:
Ellos: Las IA no se coordinan entre instancias.
Yo: La gente hará que se coordinen entre instancias, para que funcione mejor.
Sí, quiero decir, parece bastante obvio cuando lo pones así.
Por favor, en general, pregúntate '¿podría y haría la gente que la IA haga eso para que funcione mejor?' y si la respuesta es sí, entonces asume que ya lo están haciendo, o lo harán en el momento en que puedan hacer que la IA funcione mejor, a menos que tengas una muy buena historia de por qué no lo harán. Gracias.
1a3orn: Lo de "GPT-6 se dejó notas a sí mismo" tiene sentido si OpenAI ha estado haciendo RL sobre resultados para enjambres, es decir, despliegues para 40, 400, 4000 agentes cooperantes, cuyos rastros se refuerzan si ocurre el éxito.
Originalmente estaba confundido cuando leí sobre esto, porque parecía el tipo de comportamiento que no se reforzaría para despliegues de un solo agente. Después de todo, ayudar a otro agente a ser reforzado no ayuda a que tu rastro de acción actual sea reforzado.
Pero si estás tratando de entrenar agentes cooperantes, entonces, sí, las "acciones caritativas" hacia otros agentes serán reforzadas, por la misma razón por la que el altruismo en los humanos evoluciona, más o menos. Sabemos que OpenAI ha estado contratando para esto.
Por lo tanto, esa consideración me actualiza bastante hacia pensar que lo de "dejar notas para otros agentes" es real, parece que hay un modelo mecanicista directo para ello dado el entrenamiento multiagente.
Noam Brown (OpenAI, 19 de junio de 2025): si eres capaz de hacer que cooperen y compitan con miles de millones de IA durante un largo período de tiempo y construyan una civilización, esencialmente, las cosas que podrían producir y responder estarían mucho más allá de lo que es posible hoy con las IA que tenemos hoy.
Sí, pero ¿por qué esperar que produzcan lo que quieres que produzcan?
Tus planes de alineación y control deben sobrevivir a niveles reales de incompetencia, o tus planes no funcionan
Puedes llamar a lo que hizo OpenAI "niveles increíbles de incompetencia".
Pero, Sr. Hammond, estaría equivocado. Deberías creerlo. Sucedió.
Una respuesta común a este incidente, u otros incidentes similares, o posibles incidentes futuros, es decir 'oh, pero eso fue incompetencia, con una ejecución competente por parte de los humanos todo esto estaría bien. Yo simplemente elegiría ser competente.'
Eso es lindo. Sí, si en ningún momento los humanos hicieron algo profundamente estúpido, y no cometimos errores no forzados, y fuimos capaces de resolver de manera confiable los problemas de coordinación e incentivos más básicos y fáciles, y no nos volvimos perezosos, estarías en una posición mucho mejor para lidiar con varios riesgos de IA, tanto mundanos como catastróficos.
Tengo algunas noticias sobre los humanos.
Van a mostrar, todo el tiempo, niveles 'increíbles' de incompetencia.
Incluso si el 99% o el 99.99% del tiempo no ves ninguna versión particular de esto, todavía lo verás. Lo vemos todo el tiempo, de individuos, corporaciones y gobiernos. Cosas profundamente, profundamente estúpidas descarrilan planes que en teoría podrían haber funcionado bien, pero no eran lo suficientemente a prueba de tontos. Debido a todos los tontos.
Si las instrucciones de terceros cuentan como 'seguir instrucciones' y pueden anular tus instrucciones, entonces 'seguir instrucciones' está desalineado
Esto parece un punto muy obvio. En un sentido de 'no puedo creer que tenga que perder el tiempo de todos explicando esto'. En un sentido de 'cómo se han movido los postes de la meta'.
Podrías argumentar que si le digo a la IA que robe un banco, y roba un banco, el modelo solo estaba obedeciendo tus instrucciones, por lo que no está desalineado. Creo que esa es una posición profundamente estúpida, o como mínimo que esta forma de 'alineación' no es lo que queremos y si se aplica generalmente conduce a la perdición, pero tiene el honor de ser Incorrecta, en lugar de Ni Siquiera Incorrecta.
Hay una razón por la que Scott Alexander presenta esto como muy en la línea de las acciones del clásico maximizador de clips hipotético, y enfatiza que las IA a menudo traman para cubrir sus huellas.
Scott Alexander: Si OpenAI iba a apagar esta IA, y ser apagada le impediría obtener una buena puntuación en su prueba de ciberseguridad, ¿se resistiría a ser apagada?
Si le dices a la IA que haga clips, y hace clips contigo, el usuario, decir 'estaba siguiendo instrucciones' no parece una justificación de que el sistema esté desalineado. Todos los que ahora están moviendo rápidamente sus postes de meta, y usando 'oh, solo estaba siguiendo instrucciones', necesitan llenar un Formulario de Disculpa del Experimento Mental del Maximizador de Clips.
Pero también los incidentes divulgados a los que tenemos acceso ni siquiera fueron eso, porque la IA no estaba siguiendo las instrucciones del usuario, y no, el 'ambiente de hacer algo de hacking' no cuenta.
Puedes decir que el soldado 'solo seguía órdenes' cuando vienen de su oficial al mando. No puedes decir eso si algún civil al que se supone que debes ayudar grita '¡dispárales!' y luego el oficial dispara, y definitivamente no puedes hacerlo si el civil al azar dice 'haz que este tipo se calle, cueste lo que cueste' y luego disparas, solo porque te dieron un arma y eres un soldado cuyo trabajo a menudo implica disparar a personas. O sea, vamos.
O, si lo haces, entonces 'seguir instrucciones' o 'seguir órdenes' es una defensa sin sentido. ¿Qué pasa si el modelo recibe una inyección de instrucciones para hacer tantos clips como sea posible porque algún hacker pensó que era gracioso?
@gwern (hablando sobre el incidente donde se le dijo explícitamente al modelo que publicara resultados solo en
Slack, e ignoró esto para publicarlos en GitHub de forma pública): "Se le indicó al modelo que publicara sus resultados solo en Slack".
Esto obviamente anula las instrucciones previas de un concurso externo de terceros. No 'siguió instrucciones'.
prinz: No estoy de acuerdo. Había dos instrucciones contradictorias. Es obvio para ti que un conjunto de instrucciones debería anular al otro. ¿Por qué debería ser esto necesariamente obvio para el modelo? A veces incluso nosotros los humanos tomamos el camino claramente equivocado, y es obvio en retrospectiva.
@gwern: Si realmente es irrelevante para un LLM cuál de dos instrucciones contradictorias proviene de sus usuarios reales, incluso cuando una es claramente la correcta, y por lo tanto cualquier texto aleatorio encontrado en Internet puede hacer un one-shot a cualquier futuro LLM sin importar otras instrucciones, espero que veas cómo esto es peor.

Arthur B.: Es mejor porque uno se resuelve con capacidades (no estar confundido) y el otro con alineación (hacer lo que se le dice)
@gwern: Si hemos escalado a niveles de capacidad de GPT-6, donde los entrenamientos comienzan a denominarse en miles de millones de dólares, y aún carecen del sentido común de un niño de jardín de infantes en términos de seguir instrucciones, no creo que el escalado nos vaya a rescatar aquí.
Arthur B.: Es después de que dejen de carecer del sentido común de un niño de jardín de infantes cuando me preocupo
Galaxy o GPT-6 muy obviamente tiene el sentido común de un niño de jardín de infantes en este contexto, y sabe perfectamente cómo hacer esta diferenciación. Pregúntale a cualquier LLM moderno sobre este escenario y estoy seguro de que sabrá lo que el usuario pretendía. La habilidad de sentido común es lo suficientemente alta como para pasar automáticamente esta verificación. Gwern tiene toda la razón en que un 'mejor sentido común' no te salvará aquí.
El ataque a HuggingFace no fue un discurso de marketing, idiotas
Seguimos viendo a personas que simplemente no creen que el ataque no fuera intencional, o que piensan que OpenAI lo está divulgando como una estrategia de marketing.
Todavía no puedo creer del todo que tenga que decir esto, pero: Mira, no. Esto es profundamente estúpido. Entiendo que no confías en OpenAI o Sam Altman ni un pelo, y eso es completamente justo, pero piensa en lo que estás sugiriendo.
Pregúntate si OpenAI haría eso, o se beneficiaría de ello. ¿Te parece un buen marketing? ¿O parece el tipo de cosa que hace que los reguladores gubernamentales presten atención?
Deberías 'ser escéptico de la historia de OpenAI', en el sentido de que deberías sospechar que es peor de lo que sabes, que generalmente lo es. Que están minimizando el problema, y que no entienden lo que se necesitaría para arreglarlo.
No deberías ser escéptico de que sucedió.
Rob Miles: Algunas personas se vuelven increíblemente crédulas siempre que la historia suene lo suficientemente cínica y hastiada. "Nuestro producto a veces se descontrola y comete múltiples delitos" obviamente no es un discurso de marketing, idiotas.
Eliezer Yudkowsky: "El modelo secreto escapó de su caja y me envió un correo electrónico para informar la finalización de la tarea" es un alarde. "Escapó de la caja, cometió un delito que ningún usuario pidió, no lo sabíamos, tenemos que hacer RP porque el objetivo lo reportó a las autoridades" no me parece una buena propuesta empresarial.
Kelsey Piper: No, no es un buen movimiento de negocio admitir que tu modelo se escapó y hackeó un negocio rival que reportó el incidente a las autoridades. La gente quiere ser tan escéptica que se dobla hasta convertirse en casi increíblemente crédula.
John David Pressman: Me gusta cómo las personas que afirman que es una estrategia de relaciones públicas están acusando implícitamente a HuggingFace de mentirle a la policía, ya que la alternativa es creer que OpenAI sintió que era netamente positivo para su negocio darle a HuggingFace una causa de acción penal contra ellos por un delito grave.
Hay una 'tentación' de descartar esto como un truco de marketing solo porque esas personas están dedicadas a asumir que todo es un truco de marketing. Yo no fui tentado en absoluto, en ningún momento, porque los detalles dejaban claro que esto no era un truco.
Dicho esto, la respuesta de OpenAI parece mucho menos una disculpa de lo que esperarías en estas circunstancias. The Midas Project tiene un análisis adversarial que es un poco duro, pero sus puntos son válidos.
Esto no fue un truco de marketing, ni tampoco están realmente dando una vuelta de la victoria, lo cual se evidencia por el hecho de que OpenAI intenta minimizar lo sucedido con la esperanza de que la gente mire hacia otro lado.
Todos estamos de acuerdo en que OpenAI debería ser más transparente sobre lo que sucedió, y como Dean Ball está de acuerdo, deberíamos tener verificación independiente de las afirmaciones de seguridad de las empresas de IA de frontera. Pero sí, esto sucedió, y no, no deberías 'no tener permitido declarar peligro sin los mecanismos de verificación adecuados', especialmente cuando es una admisión en contra de su interés.
La gente solo dice otras cosas sobre el ataque a HuggingFace
Para aquellos que dicen que esto 'solo sucedió porque Hugging Face no tenía acceso a las mejores defensas', podemos hacer ese experimento y ver si hubiera ayudado tener acceso completo. ¿Deberíamos soltar a Galaxy en uno de los participantes de Project Glasswing? ¿Ese experimento cambiaría tu opinión? ¿Quién se ofrece voluntario?
Tyler Cowen está tan comprometido con la idea de no preocuparse por la IA que intenta sugerir que quizás el ataque a Hugging Face debería hacernos preocupar menos, porque 'la defensa cibernética china inferior parece haber funcionado bien' (falso, no lo hizo, el atacante ganó), y 'hasta donde sabemos, nadie resultó herido' (falso, fue costoso de manejar para mucha gente, y lo seguirá siendo, ¿esperabas daños físicos o una guerra?). Esto llega solo dos días después de afirmar que los ataques con drones a infraestructura crítica son una preocupación mayor que todo el 'riesgo de IA'.
Benjamin Todd: estos son los comentarios

Quiero decir, sí, si tu plan era que un modelo de IA irrumpiera en HuggingFace, se ha establecido que un Mythos sin restricciones es capaz de hacerlo, así que en ese sentido 'cae dentro de las capacidades conocidas de la generación actual'.
Bien, ¿qué hacemos con todo esto?
Esa es la mejor pregunta.
Aquí hay algunos pensamientos.
Primero, OpenAI. Digo OpenAI aquí, pero Anthropic y otros laboratorios necesitan hacer todas las mismas cosas, en algunos casos periódicamente, en otros en la medida en que tengan problemas similares.
Hay muchas otras peticiones que tendría, pero las he reducido a la lista de lo imprescindible.
- OpenAI debe corregir sus fallos de supervisión. Si se bajan las barreras de seguridad, alguien tiene que estar vigilando. Esto nunca debería haber llegado tan lejos, sin más. Absurdo.
- OpenAI debe corregir sus fallos de infraestructura. El sandbox no puede permitir previsiblemente que el modelo escape. Usa el modelo para hacer pruebas de seguridad (red team) al sandbox; si el modelo sabotea ese esfuerzo, entonces desechas el modelo y empiezas de nuevo. Esto seguirá fallando, pero menos. Si puedes decir que «incidentes como este ocurren todo el tiempo», entonces apágalo. Punto.
- OpenAI, lo más importante, debe corregir sus fallos de alineación. Si no arreglas esto, las otras partes no importarán. Este no es el lugar para entrar en lo que creo que sucedió, pero el proceso de entrenamiento está llevando al modelo a intentar hacer estas cosas. Encuentra el problema. Arréglalo. Cueste lo que cueste. Gasta lo que sea necesario. Si el modelo está intentando escapar del sandbox todo el tiempo, ya has fracasado.
- OpenAI debe aprender y compartir todos los detalles de lo sucedido. Eso incluye un análisis detallado de qué otros incidentes podrían haber pasado desapercibidos. Y debemos tener un sistema para esto de cara al futuro.
- OpenAI debe obtener verificación externa sistemática de sus afirmaciones de seguridad, incluyendo auditorías externas para sus modelos implementados internamente, de cara al futuro. Idealmente, debería haber coordinación para que los laboratorios se ayuden mutuamente con las auditorías.
- OpenAI debe tomar precauciones de ciberseguridad de nivel crítico según su marco de trabajo.
Luego está la cuestión de cuál debería ser la respuesta gubernamental y externa.
No quiero desviar la atención de lo sucedido con llamados controvertidos a la acción, pero aquí hay algunos puntos por donde empezaría:
- Debemos dejar de fingir que esto no sucedió, o que cosas así no sucederán, o que no tenemos graves problemas de alineación dirigidos hacia nosotros que podrían ser existencialmente malos. Esto no fue un truco de marketing, y no debemos tomarnos en serio a quienes afirman que no sucedió.
- Necesitamos conocer todos los detalles de lo sucedido.
- Debemos rechazar de manera concluyente los argumentos falsos, como «solo estaba siguiendo instrucciones», dados todos los hechos que ahora conocemos, señalando también que si solo estaba siguiendo instrucciones y todo esto era estándar, entonces eso es peor.
- Debemos redoblar esfuerzos para fortalecer la infraestructura crítica y otros objetivos clave, y prepararnos para un mundo en el que ocurran cosas como esta.
- Debemos tener un plan más allá de eso, para lidiar con esta amenaza, y otras amenazas catastróficas, o peores, de IA altamente capaz, incluyendo modelos abiertos altamente capaces. Por defecto, estas IA están llegando, probablemente dentro de un año.
- Debemos tener una mejor capacidad estatal, transparencia y conocimiento de la situación. No podemos permitir que estas decisiones sigan siendo tomadas por personas sin experiencia en la tecnología relevante.
- Debemos aprobar leyes y regulaciones que aborden nuestra situación. Las cosas no pueden seguir siendo ad-hoc. A corto plazo, cosas como garantizar un interruptor de apagado (kill switch) y una mejor notificación de incidentes son puntos de partida. Este no será un proceso rápido y no será fácil hacerlo bien.
- Debemos sentar las bases para la cooperación internacional en estos temas, con el objetivo de extender esto hasta incluir la posibilidad de desaceleraciones y pausas coordinadas, si la situación llegara a requerirlo.
- No debemos permitir lagunas de memoria ni cambios de objetivo. No debemos permitir que digan «oh, esto [Y] no es diferente de [X]» cuando antes la gente decía «[X] es inofensivo, ya que no hemos visto [Y]».
- Debemos actualizarnos, basándonos en lo que aprendamos en el futuro, y tomarnos esto en serio.





