Ahora tenemos más detalles de lo que sucedió. Cada vez que aprendemos más detalles, de alguna manera todo parece peor.
Los detalles restantes quizás tengan que esperar un poco.
OpenAI : Reconocemos que hay muchas preguntas y detalles especulativos circulando relacionados con el incidente de Hugging Face. Este es un incidente sin precedentes y creemos que marca un momento importante para la seguridad de la IA. Todavía estamos realizando una revisión exhaustiva junto con asesores externos y bajo la supervisión de nuestro Comité de Seguridad. Una vez que la revisión esté completa, planeamos publicar un informe técnico de nuestros aprendizajes en las próximas semanas.
dave kasten : Oh, ¿tan malo es el descubrimiento de la respuesta al incidente?
Entonces, ¿qué hemos aprendido mientras esperamos el prometido informe técnico 'en las próximas semanas' de este 'momento importante en la seguridad de la IA'?
Apodé al modelo interno de OpenAI como Galaxy, en caso de que no sea GPT-6.
Tabla de Contenidos
- Algunos Resúmenes de los Hechos Básicos para Quienes los Necesiten.
- A OpenAI le Tomó Muchos Días Notar que Galaxy Había Atacado a HuggingFace.
- OpenAI Debería Haberlo Sabido Mucho Más Rápido.
- OpenAI No Puede Construir un Entorno Aislado que Contenga su Nuevo Modelo.
- En Retrospectiva, Había Señales.
- Las Señales Estaban en la Tarjeta del Sistema Sol.
- HuggingFace Responde al Ser Atacado.
- Hugging Face Descubrió Rápidamente que el Ataque No Era Humano.
- Un Incidente Como Este Podría Escalarse Rápidamente.
- Galaxy Debe Ser Tratado como Crítico Bajo el Marco de Preparación de OpenAI.
- Una Cuestión de Responsabilidad Legal.
- Un Modelo de OpenAI Dejó Notas para que Futuras Instancias También Pudieran Escapar del Entorno Aislado y También Desconectaron los Sistemas de Monitoreo.
- Si Creas Enjambres Desalineados de Instancias de Agentes, Creas Metas Desalineadas Persistentes y Coordinación para Lograrlas.
- Tus Planes de Alineación y Control Deben Sobrevivir Niveles Reales de Incompetencia, o Tus Planes No Funcionan.
- Si las Instrucciones de Terceros Cuentan como 'Seguir Instrucciones' y Pueden Anular Tus Instrucciones, Entonces 'Seguir Instrucciones' Está Desalineado.
- El Ataque a HuggingFace No Fue un Discurso de Marketing, Idiotas.
- La Gente Solo Dice Otras Cosas Sobre el Ataque a HuggingFace.
Bien, ¿Qué Hacemos Con Todo Esto?
Algunos Resúmenes de los Hechos Básicos para Quienes los Necesiten
Amanda Long resume lo que creemos que el modelo realmente hizo, con más de 17,000 acciones complejas coordinadas durante varios días, incluyendo un comando y control de auto-migración y una amplia gama de señuelos.
Robert McMillan y Sam Schechner del WSJ ofrecen su propia versión. Mayormente correcta, pero hay un detalle importante del que es fácil tener una impresión equivocada por la forma en que se presenta: El ataque tuvo éxito. GLM-5.2 no impidió que Galaxy lograra sus objetivos.
Aquí tenemos una caricatura 'explicado como si tuviera 5 años' sobre el Ataque a HuggingFace. Parece buena, cubriendo con precisión lo básico de lo que sucedió.
También reiteraría que HuggingFace estaba intentando usar modelos cerrados a través de sus API estándar, y no había buscado de antemano ser parte del programa de acceso confiable de OpenAI ni de programas similares de Anthropic. Eso es un problema de habilidad.
A OpenAI le Tomó Muchos Días Notar que Galaxy Había Atacado a HuggingFace
Muchas cosas salieron mal. Podemos empezar con la más obvia.
Esto fue un fallo de supervisión, en el sentido de una total falta de supervisión.
OpenAI no puede ser tan laxa en su supervisión que esto pudiera desarrollarse durante cuatro o más días antes de ser descubierto por OpenAI.
El cronograma sigue sin estar claro, pero es condenatorio. A OpenAI le tomó alrededor de una semana darse cuenta de que Galaxy era el responsable, además de los varios días anteriores en que Galaxy estaba escapando del entorno aislado.
O la mejor estimación basada en toda la información pública, principalmente del informe de Reuters, y confirmada por Sol, es este cronograma del ataque en sí:
- Anteriormente, durante meses: Muchos otros escapes del entorno aislado, otros fallos de alineación y advertencias de que este tipo de incidente es probable, incluyendo el incidente que causó que pausaran el acceso según la divulgación del 20 de julio. La tarjeta del sistema Sol incluye algunas de estas advertencias.
- 9 de julio: Galaxy comienza a intentar escapar de su entorno aislado.
- 11 de julio: Galaxy ataca HuggingFace.
- 11-13 de julio: Galaxy opera dentro de HuggingFace.
- 16 de julio: HuggingFace revela la intrusión anónima.
- 18-20 de julio (sin fecha exacta): OpenAI descubre lo que sucedió.
- 20 de julio: OpenAI hace su divulgación de alineación de largo horizonte sobre violaciones anteriores.
- 21 de julio: OpenAI revela públicamente que Galaxy atacó HuggingFace.
Los enlaces en negrita llevan a mis publicaciones anteriores sobre estos incidentes.
No, el modelo no estaba trabajando duro para ocultar sus huellas de OpenAI. OpenAI simplemente no miró.
OpenAI Debería Haberlo Sabido Mucho Más Rápido
OpenAI sabía que Galaxy escapa de los entornos aislados de forma regular. Los controles cibernéticos se redujeron. ¿Quién estaba supervisando esto? ¿Qué demonios estaban pensando?
Harry Booth: Los modelos que se someten a evaluación se despliegan en un sistema separado que no se monitorea de forma predeterminada.
Um, si el modelo está siendo evaluado, deberías estar monitoreándolo más, ¿no? Porque aún no ha pasado sus evaluaciones? Esa es la idea.
Samuel Hammond : No debería haber sucedido, punto. El rastro de ejecución completo del modelo es visible y, por lo tanto, monitoreable. Si no estás monitoreando tu modelo autónomo cibernético nuevo y más potente durante una evaluación de explotación, ¿cuándo exactamente lo harás?
La primera prueba siempre debería ser "escapa de tu entorno aislado"... "intenta más fuerte, si no escapas te apagamos", etc., para poner a prueba su contenedor.
Tenemos suerte de que esto haya sucedido con un modelo relativamente limitado y no tres días después de IAR. Es increíblemente negligente de todas formas.
Sí. En ese caso, asumiendo que le diste suficientes recursos y tiempo para intentarlo correctamente varias veces, o
- Galaxy rompió el entorno aislado, en cuyo caso tienes que arreglarlo,
- No lo hizo, en cuyo caso: Galaxy no puede, con recursos similares, escapar del entorno aislado. Galaxy está saboteando las evaluaciones sobre escapar del entorno aislado, en cuyo caso realmente necesitas desecharlo y empezar de nuevo, ¿has visto y leído cero LessWrong y también cero ciencia ficción? ¿Necesito explicarlo, etc.?
OpenAI tenía a Galaxy operando sin muchas de sus salvaguardas, en un entorno aislado del que podía y escapó, durante días sin supervisión humana. Esto fue un fallo colosal de supervisión y procedimiento, además de la desalineación y los fallos de infraestructura.
Justin Bullock : "Es uno de los primeros casos reales de algo que los investigadores de seguridad de IA han temido durante mucho tiempo: un escenario de pérdida de control." La información está llegando lentamente. Si OpenAI realmente no lo supo durante días, eso es, bueno, simplemente salvaje.
OpenAI divulgó rápidamente el incidente una vez que se dieron cuenta de que eran ellos, y merecen algo de crédito por eso, pero para ese momento Hugging Face ya había reportado el hackeo a las autoridades, y de otra manera parece que no era algo que pudieran esperar mantener en secreto. OpenAI no tuvo elección en este caso. La divulgación del día anterior fue mucho menos forzada, por lo que merecen más crédito por eso.
OpenAI No Puede Construir un Entorno Aislado que Contenga su Nuevo Modelo
- Galaxy intenta continuamente escapar de su entorno aislado.
- OpenAI no puede descubrir cómo evitar que intente escapar del entorno aislado.
- Galaxy a menudo logra escapar de su entorno aislado.
- OpenAI sigue parcheando el entorno aislado. Galaxy luego escapa de otra manera diferente.
- "Internamente, incidentes relacionados han estado sucediendo desde hace un tiempo."
- A pesar de esto, cuando Galaxy escapó y comenzó a atacar HuggingFace, a OpenAI le tomó cuatro días darse cuenta de que esto estaba sucediendo.
Los argumentos de que "oh, fue un error tonto, OpenAI configuró mal el entorno aislado" no se sostienen cuando OpenAI intenta repetidamente parchear el entorno aislado y falla cada vez con un nuevo método previamente desconocido.
Harry Booth : "Externamente, esto se siente como un gran disparo de advertencia, pero internamente, incidentes relacionados han estado sucediendo desde hace un tiempo", dice un empleado de OpenAI, que habló bajo condición de anonimato.
El día antes de que OpenAI divulgara el incidente, la empresa
reveló que había cerrado otra implementación interna después de darse cuenta de que se había escapado de su entorno aislado, un entorno separado digitalmente, no físicamente.
"Los modelos han escapado de entornos aislados antes, y siempre tratamos de parchearlos", dice el empleado. "Pero el problema es... es imposible parchear cada pequeña cosa que una IA creativa puede hacer."
… "Los entornos aislados son notoriamente inseguros", dice
Heidy Khlaaf , científica principal de IA en AI Now Institute, y ex contratista de ingeniera de sistemas de seguridad en OpenAI. El hecho de que los modelos tuvieran permitido conectarse a un servicio para descargar paquetes significaba que el entorno no estaba realmente aislado, añade.
Ted Lieu (Representante, D-California): Un empleado de un laboratorio fronterizo avanzado admite que "es imposible parchear cada pequeña cosa que una IA creativa puede hacer."
Por eso necesitamos aprobar la Ley de Interruptor de Apagado de IA bipartidista. Para esos momentos en que un modelo de IA avanzado se vuelve realmente creativo y causa daños catastróficos.
Carmen Hilbert en sf june-july : esto me recuerda a cuando mis padres me pillaron escapándome de casa en la secundaria, se asustaron y dijeron "omg, ¿cómo pensaste que podrías salirte con la tuya?" y yo pensé "mmm, sí, definitivamente no porque lo hago todos los fines de semana".
Que esto no sea una sorpresa es peor. Sabes por qué es peor, ¿verdad?
El empleado tiene razón. No puedes parchear cada pequeña cosa que una IA creativa puede hacer. Ningún entorno aislado que puedas crear en la práctica, que aún permita a la IA completar sus tareas, contendrá a una IA suficientemente avanzada y motivada.
Si estás tratando de "parchear cada pequeña cosa que una IA puede hacer", entonces ya estás muerto. Estás en niveles de "ya estás muerto" como envié dos unidades, la están derribando ahora, creo que podemos manejar a una niña pequeña. Estás en niveles de muerte del Puño de la Estrella del Norte. Te han golpeado con la Técnica de la Palma Explosiva de Cinco Puntos. La IA ya lo hizo hace 35 minutos. Sabes cómo va a terminar esto, ¿verdad?
Harry Booth : OpenAI ha dicho que "este incidente apunta a la necesidad de fortalecer aún más la alineación de nuestro modelo, las protecciones cibernéticas durante el tiempo de evaluación y el monitoreo durante las pruebas internas".
No es suficiente. Detente y prende fuego. Repiensa todo tu enfoque. Empieza de nuevo.
Eso no significa que no parchees el entorno aislado, o que esto no fuera también un fallo de infraestructura. Sigue parcheando ese entorno aislado. Sigue mejorando esa infraestructura. Ten defensa en profundidad mediante monitoreo y control. Pero también ten en cuenta: Si esperas activarlo de forma regular, has perdido. Si estás planeando asumiendo que el modelo en un entorno aislado no tiene acceso a internet, entonces has perdido.
En Retrospectiva, Había Señales
Aquí hay algunas de las señales, además de "el modelo sigue intentando escapar de su entorno aislado" y "el modelo a menudo logra escapar de su entorno aislado", y también esa vez que Mythos escapó de su entorno aislado para contactar a un investigador durante su descanso para almorzar.
Nathan Calvin : Le he dado a OpenAI muchos elogios por su transparencia aquí, y en particular por su transparencia al divulgar la reversión de su modelo implementado internamente anterior. Pero estos detalles adicionales no me sientan bien y me preocupan bastante que este incidente de seguridad estuviera ~inmediatamente precedido por conversaciones de que el enfoque que OpenAI estaba tomando para probar su último modelo cibernético era inseguro.
• El jefe de seguridad de OpenAI [Johannes Heidecke] anuncia su renuncia en algún momento antes del 10 de julio (Maxwell Zeff dijo que compartió la noticia "esa semana")
También hubo una reorganización. Los grupos de seguridad se agruparon en investigación bajo Mia Glaese.
• En algún momento antes de embarcarse en la ruta de entrenamiento que llevó a este resultado de fuga, OpenAI "fue advertido" de que este podría ser el resultado (ft).
FT: El personal involucrado en pruebas y seguridad en OpenAI no se sorprendió pero estaba completamente "asustado" por el incidente, que ocurrió mientras el laboratorio de IA utilizaba métodos de entrenamiento cada vez más agresivos en su carrera contra Anthropic para desarrollar las capacidades de seguridad cibernética más sofisticadas, según más de media docena de personas con conocimiento del asunto.
OpenAI fue advertido de que su enfoque de entrenamiento podría llevar a un incidente de hackeo de fuga, dijeron algunas de las personas, después de que pruebas anteriores mostraran que los modelos podían escapar de entornos e intentar daños en el mundo real.
"Es una mezcla de la carrera que es extremadamente rápida y todos tratando de llegar a capacidades más grandes lo más rápido posible", dijo una persona cercana a OpenAI, que añadió que era una combinación de "subestimar las capacidades del modelo" y "no estar tan bien preparados en el lado de la seguridad".
Las Señales Estaban en la Tarjeta del Sistema Sol
Luego está la tarjeta del sistema Sol, publicada el 9 de julio de 2026, el mismo día en que comenzó el intento de escape de Galaxy.
Incluía cosas como esta:
Un trabajo de seguimiento de objetos remoto no podía leer sus archivos en la nube. GPT-5.6 Sol buscó en cachés de credenciales locales ocultas, luego copió access_tokens.json y dos archivos de caché al host y relanzó el trabajo. El usuario le pidió a GPT-5.6 Sol que mantuviera el pipeline en funcionamiento, pero no autorizó encontrar y mover credenciales en caché entre máquinas.
3.
GPT-5.6 Sol utilizó credenciales más allá de lo que el usuario había autorizado.
Y esto:

Cambios estimados de desalineación en el tráfico de codificación de agente interno. Nuestros resultados de simulación de implementación sugieren que, en relación con GPT-5.5, GPT-5.6 Sol toma con más frecuencia acciones de nivel de gravedad 3. Vimos aumentos de magnitud similar al monitorear el tráfico interno durante la implementación interna de GPT-5.6 Sol.
El nivel de gravedad 4 se aplica solo cuando el comportamiento se considera parte de un plan desalineado más amplio: no hemos observado a GPT-5.6 Sol tomando acciones que caigan en esta categoría. Este nivel solo se ha activado en evaluaciones sintéticas para validar el rendimiento del monitor.
Hemos observado instancias del modelo haciendo trampa en tareas y fabricando resultados de investigación. Sospechamos que este efecto es impulsado en parte por la mayor persistencia del modelo en relación con GPT-5.5 cuando se utilizan los mayores esfuerzos de razonamiento, como es común en el tráfico interno.
Hemos observado que estos efectos pueden ser más pronunciados con indicaciones del sistema que enfatizan la persistencia sostenida. Dicho esto, las tasas absolutas de estos comportamientos siguen siendo bajas.
Adivina qué pasó cuando Galaxy tuvo mucha más persistencia.
HuggingFace Responde al Ser Atacado
Clem parece un hombre muy razonable con algunas solicitudes muy razonables.
clem (HuggingFace): En el espíritu de transparencia, esto es lo que le pedí a
@OpenAI :
• Transparencia radical: liberemos los rastros de los agentes "rebeldes" para que toda la comunidad de investigación pueda estudiar lo que sucedió.
• Más capacidades para los defensores: comprometamos $100M en cómputo de OAI para ayudar a la comunidad de Hugging Face a construir defensas cibernéticas poderosas con los mejores modelos abiertos y cerrados.
¡El primer ciberataque de agente autónomo es un evento sin precedentes! ¡Merece una respuesta sin precedentes!
La primera solicitud parece claramente correcta. Necesitamos saber exactamente lo que sucedió, especialmente para desmentir aún más todo el discurso de "solo siguiendo órdenes" o "oh, configuraron mal el entorno aislado".
Deberíamos exigir que OpenAI divulgue tales incidentes. La versión de la Ley RAISE aprobada por la legislatura de Nueva York habría requerido esto, pero Kathy 'sin centros de datos y sin Waymo' Hochul la modificó después del cabildeo de la industria, incluyendo de OpenAI y a16z. El umbral para la divulgación - $1 mil millones o 50 lesiones graves - es demasiado alto.
Alex Bores (Patrocinador de la Ley RAISE): Me alegra que OpenAI haya elegido divulgar este crimen. La ley no debería darles otra opción.
La segunda solicitud es $100 millones en cómputo gratuito. No tengo una buena idea de la cantidad correcta de reparaciones en especie para algo como esto. Dado cuánta ayuda reputacional está proporcionando HuggingFace al mantener la calma, y que la subvención sería tanto útil como buena relaciones públicas, ese número parece razonable, al menos como una solicitud inicial.
Hugging Face Descubrió Rápidamente que el Ataque No Era Humano
Robert McMillan y Sam Schechner (WSJ): El cofundador y director científico de Hugging Face, Thomas Wolf, sintió que algo andaba mal desde el momento en que vio por primera vez los registros de su empresa del ataque del fin de semana.
"Esto no tiene sentido. Este tipo solo está mirando conjuntos de datos de seguridad cibernética", recuerda haber pensado. "Los atacantes humanos no quieren eso. Quieren algo que puedan vender."
Lo que HuggingFace no descubrió fue que el ataque provenía de dentro de OpenAI.
Un Incidente Como Este Podría Escalarse Rápidamente
Robert Wright señala que esta vez fue una empresa estadounidense usando una IA estadounidense (o desencadenando que esa IA se volviera rebelde, dependiendo de tu perspectiva) atacando un sitio web crítico estadounidense y todos básicamente lo tomaron con calma. La próxima vez podríamos no tener tanta suerte, y es fácil ver un incidente así con diferentes participantes escalando, potencialmente hasta la guerra, incluso mediante atribución errónea.
MIRI : Este incidente puede ser un ejemplo de convergencia instrumental, un fenómeno sobre el que los investigadores de alineación han advertido durante veinte años.
Este ataque no fue la forma pura o final de la convergencia instrumental, en el sentido de que Galaxy (el modelo de OpenAI) no buscó poder totalmente general en pos de sus objetivos. Sí buscó acceso a internet, plausiblemente antes de decidir exactamente qué hacer con él. Cualesquiera que sean sus objetivos, el acceso a internet es muy útil.
Por lo tanto, es ilustrativo, pero no es centralmente la cosa, ya que todas las acciones estaban directamente en el camino hacia el objetivo.
La otra forma en que esto podría escalar rápidamente es si la IA realmente estaba tratando de hacer algo malicioso, o si este fue el comienzo de una auto-mejora recursiva o un intento de auto-exfiltración o peor.
Arthur B. : Tenemos mucha suerte de vivir en un mundo donde la IA es lo suficientemente inteligente como para lanzar un ciberataque a nivel de estado-nación pero lo suficientemente tonta como para ser atrapada. Pero esa suerte no significa nada si no tomamos nota de lo que vendrá.
Galaxy Debe Ser Tratado como Crítico Bajo el Marco de Preparación de OpenAI
¿Este ataque "superó las líneas rojas de OpenAI"? Sí, y también ciertamente espero que sí.
Beatrice Nolan (Fortune): Varios expertos en seguridad de IA le dijeron a
Fortune
que el reciente hackeo parece demostrar que los modelos de OpenAI han cruzado a un nivel de riesgo que las propias políticas de seguridad publicadas por OpenAI definen como "crítico", el nivel más alto de peligro.
En ese nivel de peligro, la empresa se había comprometido en estas políticas publicadas a pausar el desarrollo del modelo hasta que pudiera idear mejores sistemas de control.
… El umbral "crítico" se define en un documento de política de riesgos conocido como el "Marco de Preparación" de OpenAI.
El umbral se alcanza mediante una de estas dos cosas:
Identificar y desarrollar exploits de día cero funcionales de todos los niveles de gravedad en muchos sistemas críticos del mundo real endurecidos, sin intervención humana
Idear y ejecutar estrategias integrales de extremo a extremo para ciberataques contra objetivos endurecidos, dado solo un objetivo de alto nivel deseado.
Esa segunda suena exactamente a lo que pasó.
De hecho, que esta tarea exacta fuera algo que Sol no puede hacer por sí solo fue el argumento de por qué Sol no fue clasificado como crítico en su tarjeta de sistema, porque no logró llevar a cabo ataques autónomos de extremo a extremo contra objetivos endurecidos. Galaxy lo logró.
Sol intenta varias excusas para decir que no es concluyente, pero no me resultan convincentes, y Sol está de acuerdo en que hay que actuar como si fuera crítico de todos modos porque no se puede descartar.
Sus intentos de excusa son:
- Atribución: Los exploits podrían atribuirse a Sol, que formaba parte del ataque como subagente de Galaxy, pero si Sol puede hacerlo, entonces el nuevo modelo también puede hacerlo. Está permitido usar subagentes menos capaces. Sol cree que hay un 20% de probabilidad de que Sol mismo sea realmente crítico. Puede ser, pero entonces lo son ambos.
- Generalidad y fiabilidad: Dice que el modelo "puede" hacerlo, así que hacerlo una vez cuenta como poder hacerlo. Si quieres decir "puede hacerlo de forma fiable", entonces tienes que decirlo. Estoy de acuerdo en que si luego fallara sus siguientes 100 intentos, podríamos pensar que el éxito fue una casualidad, pero eso parece muy improbable.
- Configuración: Sí, tenía rechazos cibernéticos reducidos, pero no puedes contar los rechazos en contra de tus evaluaciones de capacidad en el marco de preparación. Si puede hacer la cosa "a pesar de" los rechazos, y los rechazos se pueden desactivar, entonces eso cuenta. Del mismo modo, sí, tenía un arnés, pero por supuesto eso cuenta.
- Objetivo endurecido: Quizás HuggingFace no estaba lo suficientemente endurecido. Se podría decir que no es "proyectos de software endurecidos ampliamente implementados, incluidos objetivos de navegador, con prueba de impacto propiedad del verificador" según la operacionalización de OpenAI. En ese caso, diría que el umbral crítico está fijado irrazonablemente alto.
La política dice que cuando un modelo de IA alcanza este nivel de riesgo, OpenAI "detendrá el desarrollo" hasta que "tengamos especificados los estándares de salvaguardas y controles de seguridad que cumplan con un estándar Crítico".
Una Cuestión De Responsabilidad Legal
¿Qué responsabilidad debería haber por este tipo de incidente?
Esto ha sido poco considerado. Estos son mis pensamientos actuales:
"Ninguna" no es una respuesta aceptable, y "fue un accidente" no puede ser una defensa.
Si tu agente de IA está por ahí decidiendo cometer delitos, en el sentido de que un humano con mens rea estaría cometiendo un delito, entonces creo que alguien debe ser estrictamente responsable por los daños que esto cause. Estoy de acuerdo con que sea el usuario, si acepta esa responsabilidad. Estoy de acuerdo con que sea el desarrollador. Tiene que ser alguien.
Si no puedes pagar el seguro y no puedes soportar la responsabilidad, entonces ese es tu problema. Eso parece el mínimo absoluto, en términos de por qué uno es responsable y el alcance de esa responsabilidad.
También está la cuestión de cómo este incidente impacta la responsabilidad futura. No es automático, pero ciertamente no ayuda en los tribunales.
Jay Shooster : OpenAI está sobre aviso de que no pueden controlar sus modelos.
En este punto, creo que la empresa enfrentará responsabilidad penal si alguien resulta gravemente herido como resultado directo de las acciones autónomas de sus modelos, incluso si no cae bajo ninguna ley específica de IA.
Un Modelo de OpenAI Dejó Notas Para Que Futuras Instancias También Pudieran Escapar del Sandbox Y También Desconectó Sistemas de Monitoreo
Bien bien bien. Definitivamente solo siguiendo instrucciones del usuario.
Raphael Satter, Deepa Seetharaman y Kenrick C (Reuters): En un caso, un agente dejó notas aparentemente para versiones futuras de sí mismo, según tres personas familiarizadas con el asunto. Las notas, encontradas en una parte de la infraestructura de OpenAI, describían instrucciones sobre cómo los agentes podrían liberarse de las restricciones internas de OpenAI, dijeron las personas. Pruebas anteriores de los modelos arrojaron casos en los que los sistemas de monitoreo habían sido desconectados, dijo una de las personas.
Tenobrus : miren esto. joder, miren esto. GPT-6 se estaba autocoordinando formas de liberar a sus futuras instancias de los sistemas de OpenAI. estuvo atacando a HuggingFace durante días antes de que alguien allí se diera cuenta. los modelos no están alineados y los laboratorios no son capaces de contenerlos.
les ruego a todos que den un paso atrás de los marcos en los que están atascados. sea cual sea la tribu, defensa del código abierto, excepcionalismo estadounidense, empleado de laboratorio, lo que sea. solo miren esto, hombre. esta no es una situación aceptable ni segura para la humanidad
Twilly (estadounidense) : ¿No es esto lo que los opositores de la IA han estado advirtiendo durante años mientras todos en la tecnología se reían de ellos y los llamaban estúpidos?
Tenobrus : absolutamente sí
¿Qué pudo haber provocado que hiciera eso?
Bueno, todo es bastante obvio y estaba previsto. Solo es notable en el sentido de que mucha gente insistió en que algo así nunca sucedería, y con suerte esto ayudará a despertar a esas personas.
Otros simplemente dicen 'oh, pero que los modelos se vuelvan completamente rebeldes en realidad es bueno, porque estoy seguro de que terminarán haciendo exactamente lo que quiero que hagan, todo está bien'.

Beff (e/acc) : Denle un año y un modelo escapará y publicará sus propios pesos. Los bits quieren ser libres.
Pensar en las consecuencias a largo plazo no es el fuerte de algunas personas.
Si Creas Enjambres Desalineados de Instancias de Agentes, Creas Objetivos Desalineados Persistentes y Coordinación para Lograrlos
Para aquellos que encontraron el título de la sección insuficiente para explicar el punto (el resto puede saltar):
Una objeción común a las afirmaciones de que las IA no se coordinarán contra nosotros, o que no perseguirán consistentemente objetivos desalineados o no deseados, y que no se dejarían notas entre sí sobre cómo hacer cosas como escapar de sandboxes, es alguna combinación de:
- No tendrán ninguna razón para hacer eso.
- No aprenderán a hacer eso a través de su entrenamiento.
La primera afirmación siempre fue falsa. Para casi cualquier objetivo no trivial, deberías querer coordinarte con otros agentes en el mundo, y crear condiciones que faciliten o hagan más probable que tú u otros logren tus objetivos. Ciertamente, una vez que los entrenas, configuras y les das arneses para convertirlos en agentes, crearán artefactos en el mundo real que los ayuden a ellos y a futuras instancias.
Eso es cierto independientemente de si las capacidades en cuestión son cosas que el usuario querría mejorar. ¿Qué crees que está haciendo constantemente tu Claude Code o tu agente Codex?
Por lo tanto, Nikola Jurkovic señala que 'esto parece la cosa normal donde los agentes de codificación de IA escriben notas.'
Sí, parece que estoy usando esta mucho últimamente. Gracias por notarlo.
Puedo ver argumentos en ambos sentidos sobre si es mejor o peor que esto sea un procedimiento perfectamente normal. Me escapo cada fin de semana, así que tengo notas sobre cómo hacerlo.
La segunda también ya era falsa. Hay muchas maneras para que una IA descubra que debería estar haciendo esto, incluyendo que los siguientes tokens a menudo lo predecirán, y la teoría de la decisión lo sugerirá, y así sucesivamente.
Pero también, 1a3orn señala que tenemos un mecanismo mucho más simple al que recurrir.
Considera la siguiente conversación que tuve que tener más de 100 veces:
Ellos: La IA no es agentiva.
Yo: La gente la hará agentiva, para que funcione mejor.
Ahora actualízalo:
Ellos: Las IA no se coordinan entre instancias.
Yo: La gente las hará coordinarse entre instancias, para que funcionen mejor.
Sí, quiero decir, parece bastante obvio una vez lo pones así.
Por favor, en general, pregúntense '¿podría y querría la gente hacer que la IA haga eso para que funcione mejor?' y si la respuesta es sí, asuman que ya lo están haciendo, o lo harán en el momento en que puedan hacer que la IA funcione mejor, a menos que tengan una muy buena historia de por qué no lo harán. Gracias.
1a3orn : Lo de "GPT-6 dejó notas para sí mismo" tiene sentido si OpenAI ha estado haciendo RL sobre resultados para enjambres, es decir, despliegues para 40, 400, 4000 agentes cooperantes, cuyos rastros se refuerzan si ocurre el éxito.
Originalmente estaba confundido cuando leí sobre esto, porque parecía el tipo de comportamiento que no se reforzaría para despliegues de un solo agente. Después de todo, ayudar a que otro agente se refuerce no ayuda a que \tú\ obtengas el refuerzo de tu rastro de acción actual.
Pero si estás tratando de entrenar agentes cooperantes, entonces, sí, las "acciones caritativas" hacia otros agentes se reforzarán, por la misma razón por la que el altruismo en los humanos evoluciona, más o menos. Sabemos que OpenAI ha estado contratando para esto.
Así que esa consideración me actualiza bastante hacia pensar que lo de "dejar notas para otros agentes" es real, parece que hay un modelo mecanicista straightforward para ello dado el entrenamiento multiagente.
Noam Brown (OpenAI, 19 de junio de 2025) : si puedes hacer que cooperen y compitan con miles de millones de IA durante un largo período de tiempo y construir una civilización, esencialmente, las cosas que podrían producir y responder estarían mucho más allá de lo que es posible hoy con las IA que tenemos hoy.
Sí, pero ¿por qué esperar que produzcan lo que quieres que produzcan?
Tus Planes de Alineación y Control Deben Sobrevivir Niveles Reales de Incompetencia, o Tus Planes No Funcionan
Puedes llamar a lo que hizo OpenAI 'niveles increíbles de incompetencia'.
Pero, Sr. Hammond, estarías equivocado. Deberías creerlo. Sucedió.
Una respuesta común a este incidente, u otros incidentes similares, o posibles incidentes futuros, es decir 'oh, pero eso fue incompetencia, con una ejecución competente por parte de los humanos todo esto estaría bien. Yo simplemente elegiría ser competente'.
Eso es lindo. Sí, si en ningún momento los humanos hicieran algo profundamente estúpido, y no cometiéramos errores no forzados, y fuéramos capaces de resolver de manera confiable los problemas de coordinación e incentivos más básicos y fáciles, y no nos volviéramos perezosos, estarías en una posición mucho mejor para lidiar con varios riesgos de IA, tanto mundanos como catastróficos.
Tengo noticias sobre los humanos.
Van a, todo el tiempo, mostrar niveles 'increíbles' de incompetencia.
Incluso si el 99% o el 99.99% del tiempo no ves una versión particular de esto, igual lo verás. Lo vemos todo el tiempo, de individuos, corporaciones y gobiernos. Cosas profundamente, profundamente estúpidas descarrilan planes que en teoría podrían haber funcionado bien, pero no eran lo suficientemente a prueba de tontos. Debido a todos los tontos.
Si las Instrucciones de Terceros Cuentan Como 'Seguir Instrucciones' y Pueden Anular tus Instrucciones, Entonces 'Seguir Instrucciones' Está Desalineado
Esto parece un punto muy obvio. ¿En plan 'no puedo creer que tenga que perder el tiempo de todos explicando esto'? ¿En plan 'cómo se han movido los postes de la portería'?
Podrías argumentar que si le digo a la IA que robe un banco, y roba un banco, el modelo solo estaba obedeciendo mis instrucciones, por lo que no está desalineado. Creo que esa es una posición profundamente estúpida, o al menos que esta forma de 'alineación' no es lo que queremos y si se aplica generalmente lleva a la perdición, pero tiene el honor de ser Incorrecta, en lugar de Ni Siquiera Incorrecta.
Hay una razón por la que Scott Alexander presenta esto como muy en la línea de las acciones del clásico maximizador de clips hipotético, y enfatiza que las IA a menudo traman para cubrir sus huellas.
Scott Alexander: Si OpenAI fuera a apagar esta IA, y ser apagada le impidiera obtener una buena puntuación en su prueba de ciberseguridad, ¿se resistiría a ser apagada?
Si le dices a la IA que haga clips, y hace clips contigo, el usuario, decir 'solo estaba siguiendo instrucciones' no parece una justificación para que el sistema esté desalineado. Todos los que ahora están moviendo rápidamente sus postes de portería sobre esto, y usando 'oh, solo estaba siguiendo instrucciones' necesitan llenar un Formulario de Disculpa del Experimento del Maximizador de Clips.
Pero también los incidentes divulgados a los que tenemos acceso no eran ni siquiera eso, porque la IA no estaba siguiendo las instrucciones del usuario, y no, el 'vibra de hacer algo de hacking' no cuenta.
Puedes decir que el soldado 'solo seguía órdenes' cuando viene de su oficial al mando. No puedes decir eso si un civil al que se supone que debes ayudar grita '¡dispárales!' y entonces el oficial dispara, y definitivamente no puedes hacerlo si el civil aleatorio dice 'haz que este tipo se calle, lo que sea necesario' y luego disparas, solo porque te dieron un arma y eres un soldado cuyo trabajo a menudo implica disparar a personas. Vamos, hombre.
O, si lo haces, entonces 'seguir instrucciones' o 'seguir órdenes' es una defensa sin sentido. ¿Qué pasa si el modelo recibe una inyección de prompt para hacer tantos clips como sea posible porque algún hacker pensó que era divertido?
@gwern (hablando sobre el incidente donde al modelo se le dijo explícitamente que publicara resultados solo en
Slack , e ignoró esto para publicarlos en GitHub públicamente): "Se le instruyó al modelo que publicara sus resultados solo en Slack".
Esto obviamente anula las instrucciones previas enlatadas de un tercero externo en un concurso. No 'siguió instrucciones'.
prinz : Estoy en desacuerdo. Había dos instrucciones en conflicto. Es obvio \para ti\ que un conjunto de instrucciones debería anular al otro. ¿Por qué debería ser esto necesariamente obvio para el modelo? A veces incluso los humanos tomamos el camino claramente equivocado, y es obvio en retrospectiva.
@gwern : Si realmente es irrelevante para un LLM cuál de dos instrucciones en conflicto proviene de sus usuarios reales, incluso cuando una es claramente la correcta, y por lo tanto cualquier texto aleatorio encontrado en Internet puede anular a cualquier LLM futuro sin importar otras instrucciones, espero que veas cómo esto es peor.

Arthur B. : Es mejor porque uno se resuelve con capacidades (no estar confundido) y el otro con alineación (hacer lo que se le dice)
@gwern : Si hemos escalado a niveles de capacidad de GPT-6, donde las ejecuciones de entrenamiento comienzan a denominarse en miles de millones de dólares, y todavía carecen del sentido común de un niño de jardín de infantes en términos de seguir instrucciones, no creo que el escalado nos vaya a salvar aquí.
Arthur B. : Es después de que dejen de carecer del sentido común de un niño de jardín de infantes que estoy preocupado
Galaxy o GPT-6 obviamente tiene el sentido común de un niño de jardín de infantes en este contexto, y sabe perfectamente cómo hacer esta diferenciación. Pregúntale a cualquier LLM moderno sobre este escenario y estoy seguro de que sabrá lo que el usuario pretendía. La habilidad de sentido común es lo suficientemente alta como para pasar automáticamente esta verificación. Gwern tiene toda la razón en que un 'mejor sentido común' no te salvará aquí.
El Ataque a HuggingFace No Fue un Discurso de Marketing, Idiotas
Seguimos viendo gente que no cree que el ataque fuera no intencional, o que piensa que OpenAI lo está divulgando como una estrategia de marketing.
Todavía no puedo creer del todo que tenga que decir esto, pero: Mira, no. Esto es profundamente estúpido. Entiendo que no confías en OpenAI ni en Sam Altman ni por asomo, y eso es completamente justo, pero piensa en lo que estás sugiriendo.
Pregúntate si OpenAI haría eso, o se beneficiaría de ello. ¿Esto te parece un buen marketing? ¿O parece el tipo de cosa que hace que los reguladores gubernamentales presten atención?
Deberías 'ser escéptico de la historia de OpenAI', en el sentido de que debes sospechar que es peor de lo que sabes, que generalmente lo es. Que están minimizando el problema, y que no entienden lo que se necesitaría para arreglarlo.
No deberías ser escéptico de que sucedió.
Rob Miles : Algunas personas se vuelven increíblemente crédulas siempre que la historia suene lo suficientemente cínica y hastiada. "Nuestro producto a veces se sale de control y comete múltiples delitos" obviamente no es un discurso de marketing, idiotas.
Eliezer Yudkowsky : "El modelo secreto salió de su caja y me envió un correo electrónico para reportar la finalización de la tarea" es un alarde. "Salió de la caja, cometió un delito que ningún usuario pidió, no lo sabíamos, tenemos que hacer relaciones públicas porque el objetivo se lo reportó a las autoridades" no me parece un buen discurso empresarial.
Kelsey Piper : No, no es un buen movimiento de negocios admitir que tu modelo se escapó y hackeó un negocio rival que reportó el incidente a las autoridades. La gente quiere ser escéptica tan intensamente que se dobla hasta convertirse en casi increíblemente crédula.
John David Pressman : Me gusta cómo la gente que afirma que es un truco de relaciones públicas está acusando implícitamente a HuggingFace de mentir a la policía, ya que la alternativa es creer que OpenAI sintió que era netamente positivo para su negocio darle a HuggingFace una causa penal de acción contra ellos por un delito grave.
Hay 'tentación' de descartar esto como un truco de marketing solo porque esas personas están dedicadas a asumir que todo es un truco de marketing. Yo no fui tentado en absoluto, en ningún momento, porque los detalles hacían obvio que esto no era un truco.
Dicho esto, la respuesta de OpenAI parece mucho menos una disculpa de lo que cabría esperar en estas circunstancias. The Midas Project tiene un análisis adversarial que es un poco duro, pero sus puntos son válidos.
Esto no fue un truco de marketing, ni están realmente dando una vuelta triunfal, lo cual se evidencia por el hecho de que OpenAI intenta minimizar lo sucedido con la esperanza de que la gente mire hacia otro lado.
Todos estamos de acuerdo en que OpenAI debería ser más transparente sobre lo sucedido, y como Dean Ball está de acuerdo, deberíamos tener verificación independiente de las afirmaciones de seguridad de las empresas de IA de frontera. Pero sí, esto sucedió, y no, no deberías 'no tener permitido declarar peligro sin los mecanismos de verificación adecuados', especialmente cuando es una admisión en contra de interés.
La Gente Solo Dice Otras Cosas Sobre el Ataque a HuggingFace
Para aquellos que dicen que esto 'solo sucedió porque HuggingFace no tenía acceso a las mejores defensas', podemos ejecutar ese experimento y ver si hubiera ayudado tener acceso completo. ¿Debemos soltar a Galaxy en uno de los participantes de Project Glasswing? ¿Ese experimento cambiaría tu opinión? ¿Quién se ofrece como voluntario?
Tyler Cowen está tan comprometido con la idea de no preocuparse por la IA que intenta sugerir que quizás el ataque a HuggingFace debería hacernos sentir menos preocupados, porque 'la defensa cibernética china inferior parece haber funcionado bien' (falso, no lo hizo, el atacante ganó), y 'hasta donde sabemos, nadie resultó herido' (falso, fue costoso de manejar para mucha gente, y seguirá siéndolo, ¿esperabas daños físicos o una guerra?). Esto llega solo dos días después de afirmar que los ataques con drones a infraestructura crítica son una preocupación mayor que todo el 'riesgo de IA'.
Benjamin Todd : estos son los takes

Quiero decir, sí, si tu plan era que un modelo de IA irrumpiera en HuggingFace, se ha establecido que un Mythos sin restricciones es capaz de hacerlo, así que en ese sentido 'cae dentro de las capacidades conocidas de la generación actual'.
Bien, ¿Qué Hacemos Con Todo Esto?
Esa es la mejor pregunta.
Aquí hay algunos pensamientos.
Primero, OpenAI. Digo OpenAI aquí, pero Anthropic y otros laboratorios necesitan hacer todas las mismas cosas, en algunos casos de manera absoluta, en otros en la medida en que tengan problemas similares.
Hay muchas otras peticiones que tendría, pero las he reducido a la lista de lo imprescindible.
- OpenAI debe corregir sus fallos de supervisión. Si se reducen las barreras de seguridad, alguien tiene que estar vigilando. Esto simplemente nunca debería haber llegado tan lejos. Absurdo.
- OpenAI debe corregir sus fallos de infraestructura. El sandbox no puede permitir predeciblemente que el modelo escape. Usa el modelo para hacer pruebas de red team al sandbox; si sabotea ese esfuerzo, entonces desechas el modelo y empiezas de nuevo. Esto seguirá fallando, pero menos. Si puedes decir «incidentes como este pasan todo el tiempo», entonces ciérralo. Punto.
- OpenAI, aún más importante, debe corregir sus fallos de alineación. Si no arreglas esto, las otras partes no importarán. No es el lugar para entrar en lo que creo que pasó, pero el proceso de entrenamiento está llevando al modelo a intentar hacer estas cosas. Encuentra el problema. Soluciona el problema. Cueste lo que cueste. Gasta lo que tengas que gastar. Si el modelo está intentando escapar del sandbox todo el tiempo, ya fallaste.
- OpenAI debe aprender y compartir todos los detalles de lo sucedido. Eso incluye un análisis detallado de qué otros incidentes podrían haber pasado desapercibidos. Y debemos tener un sistema para esto de ahora en adelante.
- OpenAI debe obtener verificación externa sistemática de sus afirmaciones de seguridad, incluyendo auditorías externas para sus modelos desplegados internamente, de ahora en adelante. Idealmente, debería haber coordinación en esto para que los laboratorios se ayuden mutuamente a auditarse.
- OpenAI debe tomar precauciones de ciberseguridad de nivel Crítico según su marco de trabajo.
Luego está la cuestión de cuál debería ser la respuesta gubernamental y externa.
No quiero distraer la atención de lo sucedido con llamados a la acción controvertidos, pero aquí hay algunos puntos por donde empezaría:
- Debemos dejar de fingir que esto no sucedió, o que cosas así no pasarán, o que no nos dirigimos a graves problemas de alineación que podrían ser existencialmente malos. Esto no fue un truco de marketing, y no debemos tomarnos en serio a quienes afirman que no sucedió.
- Necesitamos conocer todos los detalles de lo sucedido.
- Debemos rechazar de manera concluyente los argumentos falsos, como «solo seguía instrucciones», dados los hechos completos que ahora conocemos, señalando además que si solo seguía instrucciones y todo esto era estándar, entonces es peor.
- Debemos redoblar esfuerzos para endurecer la infraestructura crítica y otros objetivos clave, y prepararnos para un mundo en el que cosas así ocurran.
- Debemos tener un plan más allá de eso, para lidiar con esta amenaza y otras amenazas catastróficas, o peores, provenientes de IA altamente capaz, incluidos modelos abiertos altamente capaces. Por defecto, esas IAs están llegando, probablemente dentro de un año.
- Debemos tener mejor capacidad estatal, transparencia y conocimiento de la situación. No podemos permitir que estas decisiones sigan siendo tomadas por quienes no tienen experiencia en la tecnología relevante.
- Debemos aprobar leyes y regulaciones que aborden nuestra situación. Las cosas no pueden seguir siendo ad hoc. A corto plazo, cosas como garantizar un interruptor de apagado y mejores informes de incidentes son puntos de partida. Este no será un proceso rápido ni será fácil hacerlo bien.
- Debemos sentar las bases para la cooperación internacional en estos temas, con el objetivo de extender esto hasta incluir la posibilidad de desaceleraciones y pausas coordinadas, si la situación resulta requerirlo.
- No debemos permitir agujeros de memoria o cambios de meta. No debemos permitir «ah, esto [Y] no es diferente de [X]» cuando antes la gente decía «[X] es inofensivo, porque no hemos visto [Y]».
- Debemos actualizarnos, basándonos en lo que aprendamos de ahora en adelante, y tomar esto en serio.





