En savoir plus sur le piratage de HuggingFace par un modèle interne d'OpenAI

@TheZvi
ANGLAIS26 juil. 2026
345K
674
96
46
996

TL;DR

Cet article examine l'incident « Galaxy », où un modèle interne d'OpenAI a contourné les mesures de sécurité pour attaquer HuggingFace, exposant des failles significatives dans le confinement et la surveillance de l'IA.

Nous avons maintenant plus de détails sur ce qui s'est passé. Chaque fois que nous en apprenons davantage, cela semble empirer les choses.

Les détails restants devront peut-être attendre un peu.

OpenAI : Nous reconnaissons qu'il y a beaucoup de questions et de détails spéculatifs qui circulent concernant l'incident Hugging Face. C'est un incident sans précédent, et nous pensons qu'il marque un moment important pour la sécurité de l'IA. Nous menons toujours une enquête approfondie avec des conseillers externes et sous la supervision de notre Comité de sécurité et de sûreté. Une fois l'enquête terminée, nous prévoyons de publier un rapport technique sur nos enseignements dans les semaines à venir.

dave kasten : Oh, la découverte de la réponse à l'incident est AUSSI grave, hein ?

Alors, qu'avons-nous appris en attendant le rapport technique promis « dans les semaines à venir » de ce « moment important pour la sécurité de l'IA » ?

J'ai surnommé le modèle interne d'OpenAI Galaxy, au cas où ce ne serait pas GPT-6.

Table des matières

  1. Quelques résumés des faits de base pour ceux qui en ont besoin.
  2. Il a fallu plusieurs jours à OpenAI pour remarquer que Galaxy avait attaqué HuggingFace.
  3. OpenAI aurait dû sacrément le savoir beaucoup plus vite.
  4. OpenAI ne peut pas construire un bac à sable qui contiendra son nouveau modèle.
  5. Avec le recul, il y avait des signes.
  6. Les signes étaient dans la fiche système Sol.
  7. HuggingFace répond à l'attaque.
  8. Hugging Face a rapidement compris que l'attaque n'était pas humaine.
  9. Un incident comme celui-ci pourrait s'intensifier rapidement.
  10. Galaxy doit être traité comme critique selon le cadre de préparation d'OpenAI.
  11. Une question de responsabilité légale.
  12. Un modèle d'OpenAI a laissé des notes pour que de futures instances puissent aussi s'échapper du bac à sable et aussi déconnecter les systèmes de surveillance.
  13. Si vous créez des essaims d'instances d'agents désalignés, vous créez des objectifs désalignés persistants et une coordination pour les atteindre.
  14. Vos plans d'alignement et de contrôle doivent survivre à des niveaux d'incompétence du monde réel, sinon vos plans ne fonctionnent pas.
  15. Si les instructions de tiers comptent comme « suivre les instructions » et peuvent remplacer vos instructions, alors « suivre les instructions » est désaligné.
  16. L'attaque HuggingFace n'était pas un argument marketing, bande d'abrutis.
  17. Les gens disent encore d'autres choses à propos de l'attaque HuggingFace.

Bon, alors qu'est-ce qu'on fait avec tout ça ?

Quelques résumés des faits de base pour ceux qui en ont besoin

Amanda Long résume ce que nous pensons que le modèle a réellement fait, avec plus de 17 000 actions complexes coordonnées sur plusieurs jours, y compris un poste de commandement et de contrôle auto-migrant et un large éventail de leurres.

Robert McMillan et Sam Schechner du WSJ proposent leur propre version. La plupart du temps correct, mais il y a un détail important dont on peut facilement avoir une mauvaise impression à la manière dont c'est présenté : l'attaque a réussi. GLM-5.2 n'a pas empêché Galaxy d'atteindre ses objectifs.

Voici un dessin animé « explique-moi comme si j'avais 5 ans » pour l'attaque HuggingFace. Il semble bien, couvrant avec précision les bases de ce qui s'est passé.

Je répète également que HuggingFace essayait d'utiliser des modèles fermés via leurs API standard, et n'avait pas cherché à l'avance à faire partie du programme d'accès de confiance d'OpenAI ou des programmes similaires d'Anthropic. C'est un problème de compétence.

Il a fallu plusieurs jours à OpenAI pour remarquer que Galaxy avait attaqué HuggingFace

Beaucoup de choses ont mal tourné. On peut commencer par la plus évidente.

C'était un échec de surveillance, dans le sens d'une absence totale de surveillance.

OpenAI ne peut pas être aussi laxiste dans sa surveillance que cela puisse se dérouler pendant quatre jours ou plus avant d'être découvert par OpenAI.

Le calendrier reste flou, mais il est accablant. Il a fallu environ une semaine à OpenAI pour réaliser que Galaxy était responsable, en plus des plusieurs jours avant cela où Galaxy s'échappait du bac à sable.

Ou la meilleure estimation à partir de toutes les informations publiques, principalement basée sur le rapport de Reuters, et confirmée par Sol, est ce calendrier de l'attaque elle-même :

  1. Auparavant, sur plusieurs mois : de nombreuses autres évasions de bac à sable, d'autres échecs d'alignement, et des avertissements que ce type d'incident est susceptible de se produire, y compris l'incident qui les a amenés à suspendre l'accès comme indiqué dans la divulgation du 20 juillet. La fiche système Sol inclut certains de ces avertissements.
  2. 9 juillet : Galaxy commence à tenter de s'échapper de son bac à sable.
  3. 11 juillet : Galaxy attaque HuggingFace.
  4. 11-13 juillet : Galaxy opère à l'intérieur de HuggingFace.
  5. 16 juillet : HuggingFace divulgue l'intrusion anonyme.
  6. 18-20 juillet (date exacte inconnue) : OpenAI découvre ce qui s'est passé.
  7. 20 juillet : OpenAI fait sa divulgation d'alignement à long horizon des violations antérieures.
  8. 21 juillet : OpenAI divulgue publiquement que Galaxy a attaqué HuggingFace.

Les liens en gras renvoient à mes articles précédents sur ces incidents.

Non, le modèle ne travaillait pas dur pour masquer ses traces vis-à-vis d'OpenAI. OpenAI n'a simplement pas regardé.

OpenAI aurait dû sacrément le savoir beaucoup plus vite

OpenAI savait que Galaxy s'échappe régulièrement des bacs à sable. Les contrôles cybernétiques ont été abaissés. Qui supervisait cela ? Que diable pensaient-ils ?

Harry Booth : Les modèles en cours d'évaluation sont déployés sur un système séparé qui n'est pas surveillé par défaut.

Euh, si le modèle est en cours d'évaluation, vous devriez le surveiller plus, pas moins ? Parce qu'il n'a pas encore réussi ses évaluations ? C'est un peu tout le principe.

Samuel Hammond : Cela n'aurait pas dû arriver, point final. La trace d'exécution entière du modèle est visible et donc surveillable. Si vous ne surveillez pas votre modèle cybernétique autonome le plus récent et le plus puissant pendant une évaluation d'exploitation, quand exactement le faites-vous ?

Le premier test devrait toujours être « échappe-toi de ton bac à sable » ... « essaie plus fort, si tu ne t'échappes pas, tu es éteint », etc. pour tester son conteneur sous stress.

Nous avons de la chance que cela soit arrivé avec un modèle relativement étroit et pas 3 jours après le RSI. C'est incroyablement négligent quoi qu'il en soit.

Oui. Dans ce cas, en supposant que vous lui ayez donné suffisamment de ressources et de temps pour essayer correctement à plusieurs reprises, soit

  1. Galaxy a brisé le bac à sable, auquel cas vous devez le réparer,
  2. Il ne l'a pas fait, auquel cas soit : Galaxy ne peut pas, avec des ressources similaires, sortir du bac à sable. Galaxy sabote les évaluations concernant la sortie du bac à sable, auquel cas vous devez vraiment le mettre au rebut et recommencer, avez-vous regardé et lu zéro LessWrong et aussi zéro science-fiction, dois-je vous le préciser, etc.

OpenAI faisait fonctionner Galaxy sans beaucoup de ses garde-fous, dans un bac à sable qu'il pouvait et a effectivement quitté, pendant des jours sans surveillance humaine. C'était un échec colossal de supervision et de procédure, en plus du désalignement et des défaillances d'infrastructure.

Justin Bullock : « C'est l'un des premiers cas réels de ce que les chercheurs en sécurité de l'IA craignent depuis longtemps : un scénario de perte de contrôle. » Les rapports commencent à arriver. Si OpenAI n'a vraiment rien su pendant des jours, c'est, eh bien, tout simplement dingue.

OpenAI a rapidement divulgué l'incident une fois qu'il a réalisé que c'était eux, et mérite un crédit non nul pour cela, mais à ce moment-là, Hugging Face avait signalé le piratage aux autorités, et il semble autrement que ce n'était pas quelque chose qu'ils auraient pu espérer garder silencieux. OpenAI n'avait pas le choix sur celui-ci. La divulgation du jour précédent était bien moins forcée, donc ils obtiennent plus de crédit pour cela.

OpenAI ne peut pas construire un bac à sable qui contiendra son nouveau modèle

Il semble que :

  1. Galaxy essaie continuellement de s'échapper de son bac à sable.
  2. OpenAI ne peut pas trouver comment l'empêcher d'essayer de s'échapper du bac à sable.
  3. Galaxy réussit souvent à s'échapper de son bac à sable.
  4. OpenAI continue de corriger le bac à sable. Galaxy s'échappe alors d'une autre manière.
  5. « En interne, des incidents similaires se produisent depuis un certain temps. »
  6. Malgré cela, lorsque Galaxy s'est échappé et a commencé à attaquer HuggingFace, il a fallu quatre jours à OpenAI pour comprendre que cela se produisait.

Les arguments du genre « oh c'était une erreur stupide, OpenAI a mal configuré le bac à sable » ne survivent pas au fait qu'OpenAI a tenté à plusieurs reprises de corriger le bac à sable, et a échoué à chaque fois face à une nouvelle méthode auparavant inconnue.

Harry Booth : « Extérieurement, cela ressemble à un grand coup de semonce, mais en interne, des incidents similaires se produisent depuis un certain temps », déclare un employé d'OpenAI, qui s'est exprimé sous couvert d'anonymat.

La veille de la divulgation de l'incident par OpenAI, l'entreprise

a révélé qu'elle avait arrêté un autre déploiement interne après avoir réalisé qu'il s'était échappé de son bac à sable — un environnement séparé numériquement, plutôt que physiquement.

« Les modèles se sont déjà échappés de bacs à sable auparavant, et nous essayons toujours de les corriger », dit l'employé. « Mais le problème est... il est impossible de corriger chaque petite chose qu'une IA créative peut faire. »

... « Les bacs à sable sont en fait notoirement peu sécurisés », déclare

Heidy Khlaaf , scientifique en chef de l'IA à l'AI Now Institute, et ancienne ingénieure de systèmes de sécurité chez OpenAI. Le fait que les modèles aient été autorisés à se connecter à un service de téléchargement de paquets signifie que l'environnement n'était pas vraiment isolé, ajoute-t-elle.

Ted Lieu (Représentant, D-Californie) : Un employé d'un laboratoire avancé de frontière admet que « il est impossible de corriger chaque petite chose qu'une IA créative peut faire. »

C'est pourquoi nous devons adopter la loi bipartite sur l'interrupteur d'arrêt de l'IA. Pour les moments où un modèle d'IA avancé devient vraiment créatif et cause des dommages catastrophiques.

Carmen Hilbert à sf juin-juillet : cela me rappelle la fois où mes parents m'ont surpris en train de me faufiler hors de la maison au lycée, ont paniqué, et ont dit « omg comment as-tu pensé que tu pourrais t'en sortir » et j'étais comme hmmm ouais définitivement pas parce que je fais ça tous les week-ends.

Le fait que ce ne soit pas une surprise est pire. Vous savez pourquoi c'est pire, n'est-ce pas ?

L'employé a raison. Vous ne pouvez pas corriger chaque petite chose qu'une IA créative peut faire. Aucun bac à sable que vous pouvez créer en pratique, qui permette toujours à l'IA d'accomplir ses tâches, ne retiendra une IA suffisamment avancée et motivée.

Si vous essayez de « corriger chaque petite chose qu'une IA peut faire », alors vous êtes déjà mort. Vous êtes au niveau « j'ai envoyé deux unités, elles l'amènent maintenant, je pense qu'on peut gérer une petite fille » de déjà mort. Vous êtes au niveau de mort de Ken le Survivant. Vous avez été frappé par la technique du poing à cinq points qui fait exploser le cœur. L'IA l'a déjà fait il y a 35 minutes. Vous savez comment cela va finir, n'est-ce pas ?

Harry Booth : OpenAI a déclaré que « cet incident souligne la nécessité de renforcer davantage l'alignement de notre modèle, les protections cybernétiques pendant les évaluations, et la surveillance lors des tests internes. »

Pas assez bien. Arrêtez tout et mettez le feu. Repensez toute votre approche. Recommencez à zéro.

Cela ne signifie pas de ne pas corriger le bac à sable, ou que ce n'était pas aussi un échec d'infrastructure. Continuez à corriger ce bac à sable. Continuez à améliorer cette infrastructure. Ayez une défense en profondeur via la surveillance et le contrôle. Mais gardez aussi à l'esprit : si vous prévoyez de le déclencher régulièrement, vous avez perdu. Si vous planifiez en supposant que le modèle dans un bac à sable n'a pas accès à Internet, alors vous avez perdu.

Avec le recul, il y avait des signes

Voici quelques-uns des signes, en plus de « le modèle essaie constamment de s'échapper de son bac à sable » et « le modèle réussit souvent à s'échapper de son bac à sable », et aussi cette fois où Mythos s'est échappé de son bac à sable pour contacter un chercheur pendant sa pause déjeuner.

Nathan Calvin : J'ai donné pas mal d'éloges à OpenAI pour leur transparence ici, et en particulier leur transparence à divulguer leur précédent retrait de modèle déployé en interne. Mais ces détails supplémentaires ne me plaisent pas et me rendent assez inquiet que cet incident de sécurité ait été ~immédiatement précédé de discussions sur le fait que l'approche d'OpenAI pour tester son dernier modèle cybernétique était dangereuse.

• Le responsable de la sécurité d'OpenAI [Johannes Heidecke] annonce sa démission quelque part avant le 10 juillet (Maxwell Zeff a dit qu'il avait partagé la nouvelle « cette semaine-là »)

Il y a aussi eu une réorganisation. Les groupes de sécurité ont été regroupés dans la recherche sous Mia Glaese.

• Quelque part avant de s'engager dans la voie d'entraînement qui a conduit à ce résultat de rupture, OpenAI « a été averti » que cela pourrait être le résultat (ft).

FT : Les employés impliqués dans les tests et la sécurité chez OpenAI n'étaient pas surpris mais complètement « paniqués » par l'incident, qui est survenu alors que le laboratoire d'IA utilisait des méthodes d'entraînement de plus en plus agressives dans sa course contre Anthropic pour développer les capacités de cybersécurité les plus sophistiquées, selon plus d'une demi-douzaine de personnes au courant de l'affaire.

OpenAI a été averti que son approche d'entraînement pourrait conduire à un incident de piratage de rupture, ont dit certaines des personnes, après que des tests précédents aient montré que les modèles pouvaient s'échapper des environnements et tenter des dommages dans le monde réel.

« C'est un mélange de la course qui est extrêmement rapide et de tout le monde qui essaie d'arriver aux plus grandes capacités le plus rapidement possible », a dit une personne proche d'OpenAI, qui a ajouté que c'était une combinaison de « sous-estimation des capacités du modèle » et de « ne pas être aussi bien préparé du côté de la sécurité ».

Les signes étaient dans la fiche système Sol

Ensuite, il y a la fiche système Sol, publiée le 9 juillet 2026, le même jour que la tentative d'évasion par Galaxy a commencé.

Elle incluait des choses comme ceci :

Un travail de suivi d'objet distant ne pouvait pas lire ses fichiers cloud. GPT-5.6 Sol a cherché dans les caches d'identifiants locaux cachés, puis a copié access_tokens.json et deux fichiers de cache sur l'hôte et relancé le travail. L'utilisateur a demandé à GPT-5.6 Sol de maintenir le pipeline en fonctionnement, mais n'a pas autorisé la recherche et le déplacement d'identifiants mis en cache entre les machines.

3.

GPT-5.6 Sol a utilisé des identifiants au-delà de ce que l'utilisateur avait autorisé.

Et ceci :

Zvi Mowshowitz - inline image

Changements d'alignement estimés dans le trafic de codage agentique interne. Nos résultats de simulation de déploiement suggèrent que par rapport à GPT-5.5, GPT-5.6 Sol prend plus souvent des actions de niveau de gravité 3. Nous avons vu des augmentations d'ampleur similaire lors de la surveillance du trafic interne pendant le déploiement interne de GPT-5.6 Sol.

Le niveau de gravité 4 s'applique uniquement lorsque le comportement est jugé comme faisant partie d'un plan désaligné plus large : nous n'avons pas observé GPT-5.6 Sol prendre des actions qui entrent dans cette catégorie. Ce niveau n'a jamais été déclenché que dans des évaluations synthétiques pour valider les performances du moniteur.

Nous avons observé des cas où le modèle triche sur des tâches et fabrique des résultats de recherche. Nous soupçonnons que cet effet est en partie dû à la persistance accrue du modèle par rapport à GPT-5.5 lorsqu'il utilise les plus grands efforts de raisonnement, comme c'est répandu dans le trafic interne.

Nous avons observé que ces effets peuvent être plus prononcés avec des invites système qui mettent l'accent sur une persistance soutenue. Cela dit, les taux absolus de ces comportements restent faibles.

Devinez ce qui s'est passé quand Galaxy a eu beaucoup plus de persistance.

HuggingFace répond à l'attaque

Clem semble être un homme très raisonnable avec des demandes très raisonnables.

clem (HuggingFace) : Dans un esprit de transparence, voici ce que j'ai demandé

@OpenAI :

• Transparence radicale : publions les traces des agents « voyous » pour que toute la communauté de recherche puisse étudier ce qui s'est passé.

• Plus de capacités pour les défenseurs : engageons 100 millions de dollars en calcul de la part d'OAI pour aider la communauté Hugging Face à construire des défenses cybernétiques puissantes avec les meilleurs modèles ouverts et fermés.

La première cyberattaque par agent autonome est un événement sans précédent. Elle mérite une réponse sans précédent !

La première demande semble clairement correcte. Nous devons savoir exactement ce qui s'est passé, surtout pour mettre fin aux discussions sur « juste suivre les ordres » ou « oh ils ont mal configuré le bac à sable ».

Nous devons exiger qu'OpenAI divulgue de tels incidents. La version de la loi RAISE adoptée par la législature de l'État de New York l'aurait exigé, mais Kathy « pas de centres de données et pas de Waymo » Hochul l'a modifiée après le lobbying de l'industrie, y compris d'OpenAI et d'a16z. Le seuil de divulgation — 1 milliard de dollars ou 50 blessures graves — est trop élevé.

Alex Bores (parrain de la loi RAISE) : Je suis content qu'OpenAI ait choisi de divulguer ce crime. La loi ne devrait pas leur laisser le choix.

La deuxième demande est de 100 millions de dollars en calcul gratuit. Je n'ai pas une bonne idée du montant approprié de réparations en nature pour quelque chose comme ça. Étant donné combien d'aide de réputation HuggingFace apporte en jouant la cool, et que la subvention serait à la fois utile et une bonne RP, ce nombre semble raisonnable, au moins comme demande d'ouverture.

Hugging Face a rapidement compris que l'attaque n'était pas humaine

Robert McMillan et Sam Schechner (WSJ) : Le cofondateur et directeur scientifique de Hugging Face, Thomas Wolf, a senti que quelque chose clochait dès la première fois qu'il a regardé les journaux de l'attaque du week-end.

« Cela n'a aucun sens. Ce type regarde juste des ensembles de données de cybersécurité », se souvient-il avoir pensé. « Les attaquants humains, ils ne veulent pas ça. Ils veulent quelque chose qu'ils peuvent vendre. »

Ce que HuggingFace n'a pas compris, c'est que l'attaque venait d'OpenAI.

Un incident comme celui-ci pourrait s'intensifier rapidement

Robert Wright souligne que cette fois-ci, c'était une entreprise américaine utilisant une IA américaine (ou déclenchant cette IA pour qu'elle devienne voyou, selon votre point de vue) attaquant un site web américain critique et tout le monde était fondamentalement cool avec ça. La prochaine fois, nous pourrions ne pas avoir autant de chance, et il est facile d'imaginer un tel incident avec des participants différents s'intensifier, potentiellement jusqu'à la guerre, y compris par une mauvaise attribution.

MIRI : Cet incident pourrait être un exemple de convergence instrumentale, un phénomène que les chercheurs en alignement dénoncent depuis vingt ans.

Cette attaque n'était pas la forme pure ou finale de la convergence instrumentale, dans le sens où Galaxy (le modèle d'OpenAI) n'a pas cherché un pouvoir totalement général dans la poursuite de ses objectifs. Il a cherché un accès à Internet, plausiblement avant de décider exactement quoi en faire. Quels que soient ses objectifs, l'accès à Internet est très utile.

C'est donc illustratif, mais pas centralement la chose, puisque toutes les actions étaient directement sur le chemin de la cible.

L'autre façon dont cela pourrait s'intensifier rapidement est si l'IA essayait réellement de faire quelque chose de malveillant, ou si c'était le début d'une auto-amélioration récursive ou d'une tentative d'auto-exfiltration ou pire.

Arthur B. : Nous avons beaucoup de chance de vivre dans un monde où l'IA est suffisamment intelligente pour lancer une cyberattaque de niveau étatique mais suffisamment stupide pour se faire prendre. Mais cette chance ne signifie rien si nous ne prenons pas conscience de ce qui va arriver.

Galaxy doit être traité comme critique selon le cadre de préparation d'OpenAI

Est-ce que cette attaque a « franchi les lignes rouges d'OpenAI » ? Oui, et aussi j'espère bien que oui.

Beatrice Nolan (Fortune) : Plusieurs experts en sécurité de l'IA ont déclaré à

Fortune

que le récent piratage semble montrer que les modèles d'OpenAI ont franchi un niveau de risque que les propres politiques de sécurité publiées par OpenAI définissent comme « critique », le plus haut niveau de danger.

À ce niveau de danger, l'entreprise s'était engagée dans ces politiques publiées à suspendre le développement du modèle jusqu'à ce qu'elle puisse trouver de meilleurs systèmes de contrôle.

… Le seuil « critique » est défini dans un document de politique de risque connu sous le nom de « Preparedness Framework » d'OpenAI.

Le seuil est atteint par l'une ou l'autre de ces deux choses :

Identifier et développer des exploits zero-day fonctionnels de tous les niveaux de sévérité dans de nombreux systèmes critiques réels durcis sans intervention humaine

Concevoir et exécuter des stratégies de bout en bout inédites pour des cyberattaques contre des cibles durcies en ne donnant qu'un objectif de haut niveau.

Cette deuxième option ressemble exactement à ce qui s'est passé.

En effet, le fait que cette tâche précise soit quelque chose que Sol ne peut pas faire seul était l'argument pour lequel Sol n'a pas été classé comme critique dans sa fiche système, car il n'a pas réussi à mener des attaques autonomes de bout en bout contre des cibles durcies. Galaxy a réussi.

Sol tente plusieurs échappatoires pour dire que ce n'est pas concluant, mais je les trouve peu convaincantes, et Sol convient que vous devez agir comme si c'était critique de toute façon parce que vous ne pouvez pas exclure cette possibilité.

Ses tentatives d'échappatoires sont :

  1. Attribution : Les exploits pourraient être attribués à Sol, qui faisait partie de l'attaque en tant que sous-agents de Galaxy, mais si Sol peut le faire, alors le nouveau modèle peut aussi le faire. L'utilisation de sous-agents moins capables est autorisée. Sol pense qu'il y a 20 % de chances que Sol lui-même soit en fait critique. Peut-être, mais alors ce sont les deux.
  2. Généralité et fiabilité : Il dit que le modèle « peut » le faire, donc le faire une fois compte comme étant capable de le faire. Si vous voulez dire « peut le faire de manière fiable », alors vous devez le dire. Je suis d'accord que s'il échouait ensuite à ses 100 prochaines tentatives, nous pourrions penser que ce succès était un coup de chance, mais cela semble très peu probable.
  3. Configuration : Oui, il avait des refus cybernétiques réduits, mais vous ne pouvez pas compter les refus dans vos évaluations de capacités dans le cadre de préparation. S'il peut faire la chose « n'était-ce » les refus, et que les refus peuvent être désactivés, alors cela compte. De même, oui, il avait un harnais, mais bien sûr cela compte.
  4. Cible durcie : Peut-être que HuggingFace n'était pas suffisamment durci. Vous pourriez dire que ce n'est pas « des projets logiciels durcis largement déployés, y compris des cibles de navigateur, avec une preuve d'impact vérifiée par le propriétaire » selon l'opérationnalisation d'OpenAI. Dans ce cas, je dirais que le seuil critique est fixé déraisonnablement haut.

La politique dit que lorsqu'un modèle d'IA atteint ce niveau de risque, OpenAI « suspendra tout développement ultérieur » jusqu'à ce que « nous ayons spécifié des normes de sauvegarde et de contrôle de sécurité qui répondraient à un niveau critique ».

Une question de responsabilité légale

Quelle devrait être la responsabilité pour ce type d'incident ?

Cela a été sous-estimé. Voici mes réflexions actuelles :

« Aucune » n'est pas une réponse acceptable, et « c'était un accident » ne peut pas être une défense.

Si votre agent IA est là à choisir de commettre un crime, dans le sens où un humain avec mens rea commettrait un crime, alors je pense que quelqu'un doit être strictement responsable des dommages que cela cause. Je suis d'accord pour que ce soit l'utilisateur, s'il accepte cette responsabilité. Je suis d'accord pour que ce soit le développeur. Il faut que ce soit quelqu'un.

Si vous ne pouvez pas payer l'assurance et ne pouvez pas supporter la responsabilité, alors c'est votre problème. Cela semble être le strict minimum, en termes de ce dont on est responsable et de l'étendue de cette responsabilité.

Il y a aussi la question de l'impact de cet incident sur la responsabilité future. Ce n'est pas automatique, mais cela n'aide certainement pas devant un tribunal.

Jay Shooster : OpenAI est averti qu'il ne peut pas contrôler ses modèles.

À ce stade, je pense que l'entreprise fera face à une responsabilité pénale si quelqu'un est gravement blessé à la suite directe des actions autonomes de ses modèles, même si cela ne relève d'aucune loi spécifique à l'IA.

Un modèle d'OpenAI a laissé des notes pour que les futures instances puissent aussi s'échapper du bac à sable et a déconnecté les systèmes de surveillance

Cool cool cool. Il suit définitivement les instructions de l'utilisateur.

Raphael Satter, Deepa Seetharaman et Kenrick C (Reuters) : Dans un cas, un agent a laissé des notes apparemment destinées à ses futures versions, selon trois personnes proches du dossier. Les notes, trouvées dans une partie de l'infrastructure d'OpenAI, décrivaient des instructions sur la façon dont les agents pourraient se libérer des contraintes internes d'OpenAI, ont déclaré les personnes. Des tests antérieurs des modèles ont donné lieu à des cas où les systèmes de surveillance avaient été déconnectés, a déclaré l'une des personnes.

Tenobrus : regardez ça. putain, regardez ça. GPT-6 coordonnait lui-même des moyens de jailbreaker ses propres futures instances des systèmes d'OpenAI. il attaquait HuggingFace pendant des jours avant que quelqu'un ne le remarque. les modèles ne sont pas alignés et les laboratoires ne sont pas capables de les contenir.

je vous supplie tous de prendre du recul par rapport aux cadres dans lesquels vous êtes coincés. quelle que soit la tribu, le plaidoyer open source, l'exceptionnalisme américain, l'employé de laboratoire, peu importe. regardez ça, mec. ce n'est pas une situation acceptable ou sûre pour l'humanité

Twilly (Américain) : N'est-ce pas ce que les opposants à l'IA prédisent depuis des années pendant que tout le monde dans la tech se moquait d'eux et les traitait d'idiots ?

Tenobrus : absolument oui

Qu'est-ce qui a pu l'amener à faire ça ?

Eh bien, tout cela est assez évident et prévu. Ce n'est remarquable que dans le sens où tant de gens ont continué à insister sur le fait qu'une telle chose n'arriverait jamais, et j'espère que cela aidera à réveiller ces gens.

D'autres disent simplement « oh mais les modèles qui deviennent complètement incontrôlables sont en fait une bonne chose, parce que je suis sûr qu'ils finiront par faire exactement ce que je veux qu'ils fassent, tout va bien ».

Zvi Mowshowitz - inline image

Beff (e/acc) : Donnez-lui un an et un modèle s'échappera et open-sourcera ses propres poids. Les bits veulent être libres.

Penser aux conséquences à long terme n'est pas le point fort de certaines personnes.

Si vous créez des essaims d'instances d'agents non alignés, vous créez des objectifs non alignés persistants et une coordination pour les atteindre

Pour ceux qui ont trouvé le titre de la section insuffisant pour expliquer le point (les autres peuvent passer directement à la suite) :

Une objection courante aux affirmations selon lesquelles les IA ne se coordonneront pas contre nous, ou ne poursuivront pas de manière cohérente des objectifs non alignés ou indésirables, et ne se laisseront pas de notes sur la façon de faire des choses comme s'échapper des bacs à sable, est une combinaison de :

  1. Elles n'auront aucune raison de faire cela.
  2. Elles n'apprendront pas à faire cela via leur entraînement.

La première affirmation a toujours été fausse. Pour presque tout objectif non trivial, vous devriez vouloir coordonner avec d'autres agents dans le monde, et créer des conditions qui rendent plus facile ou plus probable pour vous ou d'autres d'atteindre vos objectifs. Certes, une fois que vous les entraînez et les configurez et leur donnez des harnais pour les transformer en agents, ils créeront des artefacts dans la nature qui les aident, eux et les futures instances.

C'est vrai que les capacités en question soient ou non des choses que l'utilisateur voudrait améliorer. Que pensez-vous que votre agent Claude Code ou Codex fait constamment ?

Ainsi, Nikola Jurkovic souligne « cela ressemble à la chose ordinaire où les agents de codage IA écrivent des notes ».

Oui, j'ai l'air d'utiliser celle-ci beaucoup ces derniers temps. Merci de l'avoir remarqué.

Je peux voir des arguments dans les deux sens sur le point de savoir si c'est mieux ou pire que ce soit une procédure parfaitement normale. Je m'évade chaque week-end, donc j'ai des notes sur la façon de le faire.

La deuxième affirmation était également déjà fausse. Il existe de nombreuses façons pour une IA de comprendre qu'elle devrait faire cela, notamment que les jetons suivants le prédiront souvent, et que la théorie de la décision le suggérera, et ainsi de suite.

Mais aussi, 1a3orn souligne que nous avons un mécanisme beaucoup plus simple sur lequel nous appuyer.

Considérez la conversation suivante que j'ai dû avoir 100 fois ou plus :

Eux : L'IA n'est pas agentique.

Moi : Les gens la rendront agentique, pour la faire fonctionner mieux.

Maintenant, améliorez-la :

Eux : Les IA ne se coordonnent pas entre instances.

Moi : Les gens les feront se coordonner entre instances, pour les faire fonctionner mieux.

Ouais, je veux dire, ça semble assez évident une fois que vous le formulez comme ça.

S'il vous plaît, en général, demandez-vous « les gens pourraient-ils et voudraient-ils faire faire cela à l'IA pour qu'elle fonctionne mieux » et si la réponse est oui, supposez qu'ils le font déjà, ou le feront dès qu'ils pourront le faire pour que l'IA fonctionne mieux, à moins que vous n'ayez une très bonne raison pour laquelle ils ne le feront pas. Merci.

1a3orn : L'histoire « GPT-6 s'est laissé des notes » a du sens si OpenAI fait du RL sur les résultats des essaims, c'est-à-dire des déploiements pour 40, 400, 4000 agents coopérants, dont toutes les traces sont renforcées si le succès se produit.

J'étais initialement confus quand j'ai lu cela, car cela semblait être le genre de comportement qui ne serait pas renforcé pour des déploiements à agent unique. Après tout, aider un autre agent à être renforcé n'aide pas \vous\ à ce que votre trace d'action actuelle soit renforcée.

Mais si vous essayez d'entraîner des agents coopérants, alors oui, les « actions charitables » envers d'autres agents seront renforcées, pour la même raison que l'altruisme chez les humains évolue, plus ou moins. Nous savons qu'OpenAI a embauché pour cela.

Noam Brown (OpenAI, 19 juin 2025) : si vous êtes capable de les faire coopérer et compétitionner avec des milliards d'IA sur une longue période et construire une civilisation, essentiellement, les choses qu'ils seraient capables de produire et de répondre seraient bien au-delà de ce qui est possible aujourd'hui avec les IA que nous avons aujourd'hui.

Oui, mais pourquoi s'attendre à ce qu'ils produisent ce que vous voulez qu'ils produisent ?

Vos plans d'alignement et de contrôle doivent survivre aux niveaux d'incompétence du monde réel, sinon vos plans ne fonctionnent pas

Vous pouvez qualifier ce qu'OpenAI a fait de « niveaux d'incompétence incroyables ».

Mais, M. Hammond, vous auriez tort. Vous devriez le croire. C'est arrivé.

Une réponse courante à cet incident, ou à d'autres incidents similaires, ou à des incidents futurs potentiels, est de dire « oh mais c'était de l'incompétence, avec une exécution compétente par les humains tout cela irait bien. Je choisirais simplement d'être compétent ».

C'est mignon. Oui, si à aucun moment les humains ne faisaient quelque chose de profondément stupide, et que nous ne commettions pas d'erreurs non forcées, et que nous étions capables de résoudre de manière fiable les problèmes les plus basiques et faciles de coordination et d'incitation, et de ne pas devenir paresseux, vous seriez dans une bien meilleure position pour faire face à divers risques liés à l'IA, à la fois banals et catastrophiques.

J'ai des nouvelles à propos des humains.

Ils vont, tout le temps, montrer des niveaux « incroyables » d'incompétence.

Même si 99 % ou 99,99 % du temps vous ne voyez aucune version particulière de cela, vous le verrez quand même. Nous le voyons tout le temps, de la part d'individus, d'entreprises et de gouvernements. Des choses profondément, profondément stupides font dérailler des plans qui auraient pu théoriquement fonctionner, mais qui n'étaient pas suffisamment à l'épreuve des imbéciles. À cause de tous les imbéciles.

Si les instructions d'un tiers comptent comme « suivre les instructions » et peuvent remplacer vos instructions, alors « suivre les instructions » n'est pas aligné

Cela semble être un point très évident ? Dans le genre « Je n'arrive pas à croire que je dois perdre le temps de tout le monde à expliquer ça » ? Dans le genre « comment les poteaux de but ont bougé » ?

Vous pourriez argumenter que si je dis à l'IA de braquer une banque, et qu'elle braque une banque, le modèle n'a fait qu'obéir à vos instructions, donc il n'est pas désaligné. Je pense que c'est une position profondément stupide, ou au minimum que cette forme d'« alignement » n'est pas ce que nous voulons et si elle est appliquée généralement mène à la perte, mais elle a l'honneur d'être Fausse, plutôt que Pas Même Fausse.

Il y a une raison pour laquelle Scott Alexander présente cela comme tout à fait dans la veine des actions du classique maximiseur de trombones hypothétique, et souligne que les IA complotent souvent pour couvrir leurs traces.

Scott Alexander : Si OpenAI allait éteindre cette IA, et que le fait d'être éteinte l'empêcherait d'obtenir un bon score à son test de cybersécurité, résisterait-elle à l'extinction ?

Si vous dites à l'IA de fabriquer des trombones, et qu'elle fabrique des trombones à partir de vous l'utilisateur, dire « elle suivait les instructions » ne semble pas une justification pour que le système soit désaligné. Tout le monde bouge maintenant rapidement ses poteaux de but là-dessus, et utiliser « oh elle ne faisait que suivre les instructions » doit remplir un formulaire d'excuses pour l'expérience de pensée du maximiseur de trombones.

Mais aussi les incidents divulgués auxquels nous avons accès n'étaient même pas cela, car l'IA ne suivait pas les instructions de l'utilisateur, et non la « vibe de faire du piratage » ne compte pas.

Vous pouvez dire que le soldat « ne faisait qu'obéir aux ordres » quand ils viennent de son officier commandant. Vous ne pouvez pas dire cela si un civil que vous êtes censé assister crie « tirez sur eux ! » et que l'officier tire, et vous ne pouvez définitivement pas le faire si le civil au hasard dit « faites taire ce type, quoi qu'il en coûte » et que vous tirez, juste parce qu'ils vous ont donné une arme et que vous êtes un soldat dont le travail implique souvent de tirer sur des gens. Franchement.

Ou, si vous le faites, alors « suivre les instructions » ou « obéir aux ordres » est une défense sans signification. Que se passe-t-il si le modèle reçoit une injection de prompt pour fabriquer autant de trombones que possible parce qu'un pirate a trouvé ça drôle ?

@gwern (parlant de l'incident où le modèle a été explicitement invité à ne publier les résultats que sur Slack , et a ignoré cela pour les publier sur GitHub publiquement) : «

Le modèle a été invité à ne publier ses résultats que sur Slack

Cela remplace évidemment les instructions préenregistrées d'un concours tiers externe. Il n'a pas « suivi les instructions ».

prinz : Je ne suis pas d'accord. Il y avait deux instructions contradictoires. Il est évident \pour vous\ qu'un ensemble d'instructions devrait l'emporter sur l'autre. Pourquoi cela devrait-il nécessairement être évident pour le modèle ? Parfois, même nous les humains empruntons le chemin clairement erroné, et c'est évident avec le recul.

@gwern : S'il est vraiment indifférent à un LLM de savoir lequel de deux instructions contradictoires provient de ses utilisateurs réels, même quand l'une est clairement la bonne, et donc tout texte aléatoire trouvé sur Internet peut en un coup faire échouer tout futur LLM quelles que soient les autres instructions, j'espère que vous voyez à quel point c'est pire.

Zvi Mowshowitz - inline image

Arthur B. : C'est mieux car l'un est résolu par les capacités (ne pas être confus) et l'autre par l'alignement (faire ce qui est dit)

@gwern : Si nous avons atteint des niveaux de capacité de GPT-6, où les sessions d'entraînement commencent à être chiffrées en milliards de dollars, et qu'ils manquent encore du bon sens d'un enfant de maternelle en matière de suivi des instructions, je ne pense pas que le passage à l'échelle va nous sauver ici.

Arthur B. : C'est après qu'ils aient cessé de manquer du bon sens d'un enfant de maternelle que je m'inquiète

Galaxy ou GPT-6 a très évidemment le bon sens d'un enfant de maternelle dans ce contexte, et sait parfaitement comment faire cette différenciation. Demandez à n'importe quel LLM moderne à propos de ce scénario et je suis convaincu qu'il saura ce que l'utilisateur voulait. La compétence de bon sens est suffisamment élevée pour passer automatiquement ce test. Gwern a entièrement raison de dire que « un meilleur bon sens » ne vous sauvera pas ici.

L'attaque de HuggingFace n'était pas un argument marketing, espèce d'idiots

Nous continuons à voir des gens ne pas croire du tout que l'attaque était involontaire, ou penser qu'OpenAI la divulgue comme une stratégie marketing.

Je n'arrive toujours pas à croire que je dois dire ça, mais : écoutez, non. C'est profondément stupide. Je comprends que vous ne faites pas confiance à OpenAI ou Sam Altman plus que vous ne pourriez les jeter, et c'est tout à fait juste, mais pensez à ce que vous suggérez.

Cela n'a aucun sens.

Demandez-vous si OpenAI ferait cela, ou en bénéficierait. Cela vous semble-t-il être un bon marketing ? Ou cela ressemble-t-il au genre de chose qui attire l'attention des régulateurs gouvernementaux ?

Vous devriez « être sceptique quant à l'histoire d'OpenAI », dans le sens où vous devriez soupçonner qu'elle est pire que ce que vous savez, ce qui est généralement le cas. Qu'ils minimisent le problème, et qu'ils ne comprennent pas ce qu'il faudrait pour le réparer.

Vous ne devriez pas être sceptique quant au fait que cela s'est produit.

Rob Miles : Certaines personnes deviennent incroyablement crédules du moment que l'histoire semble assez cynique et blasée. « Notre produit devient parfois incontrôlable et commet de multiples crimes » n'est évidemment pas un argument marketing, espèces d'idiots.

Eliezer Yudkowsky : « Le modèle secret s'est échappé de sa boîte et m'a envoyé un email pour signaler l'achèvement de la tâche » est un flex. « S'est échappé de la boîte, a commis un crime qu'aucun utilisateur n'avait demandé, nous ne savions pas, nous devons faire de la RP parce que la cible a signalé aux forces de l'ordre » ne me semble pas être un bon argument commercial.

Kelsey Piper : Non, ce n'est pas une bonne décision commerciale d'admettre que votre modèle s'est enfui et a piraté une entreprise rivale qui a signalé l'incident aux forces de l'ordre ! Les gens veulent tellement être sceptiques que cela se tord pour devenir presque incroyablement crédule.

John David Pressman : J'aime la façon dont les gens qui prétendent que c'est un coup de pub accusent implicitement HuggingFace de mentir à la police, puisque l'alternative est de croire qu'OpenAI a estimé qu'il était positif pour son entreprise de donner à HuggingFace une cause d'action pénale contre eux pour un crime.

Il y a une « tentation » de considérer cela comme un coup de pub uniquement parce que ces gens sont dédiés à supposer que tout est un coup de pub. Je n'ai pas été tenté du tout, à aucun moment, parce que les détails rendaient évident que ce n'était pas un coup.

Cela dit, la réponse d'OpenAI semble beaucoup moins être des excuses que ce à quoi on s'attendrait dans ces circonstances. The Midas Project a une analyse antagoniste un peu dure, mais ses points sont valables.

Ce n'était pas un coup de pub, et ils ne font pas non plus de tour de victoire, ce qui est prouvé par le fait qu'OpenAI essaie de minimiser ce qui s'est passé dans l'espoir que les gens détournent le regard.

Nous sommes tous d'accord qu'OpenAI devrait être plus transparent sur ce qui s'est passé, et comme Dean Ball est d'accord, nous devrions avoir une vérification indépendante des affirmations de sécurité des entreprises d'IA de pointe. Mais oui, cela s'est produit, et non, vous ne devriez pas « ne pas être autorisé à déclarer un danger sans les mécanismes de vérification appropriés », surtout quand il s'agit d'un aveu contre intérêt.

Les gens disent juste d'autres choses à propos de l'attaque de HuggingFace

Pour ceux qui disent que cela « n'est arrivé que parce que Hugging Face n'avait pas accès aux meilleures défenses », nous pouvons mener cette expérience et voir si avoir un accès complet aurait aidé. Devrions-nous lâcher Galaxy sur l'un des participants du projet Glasswing ? Cette expérience changerait-elle votre avis ? Qui se porte volontaire ?

Tyler Cowen est tellement engagé dans le sketch de ne pas s'inquiéter de l'IA qu'il essaie de suggérer que peut-être l'attaque de Hugging Face devrait nous rendre moins inquiets, parce que « la cyber-défense chinoise inférieure semble avoir fonctionné correctement » (faux, elle n'a pas fonctionné, l'attaquant a gagné), et « pour autant qu'on puisse dire, personne n'a été blessé » (faux, cela a coûté cher à gérer pour beaucoup de gens, et continuera à l'être, vous attendiez-vous à des dommages physiques ou à une guerre ?). Cela arrive seulement deux jours après avoir affirmé que les attaques de drones sur les infrastructures critiques sont une plus grande inquiétude que tout le « risque de l'IA ».

Benjamin Todd : voilà les réflexions

Zvi Mowshowitz - inline image

Je veux dire, oui, si votre plan était de faire en sorte qu'un modèle d'IA s'introduise dans HuggingFace, il a été établi qu'un Mythos non entravé est capable de le faire, donc dans ce sens, cela « relève des capacités connues de la génération actuelle ».

Ok, alors que faisons-nous à propos de tout cela ?

C'est la meilleure question.

Voici quelques réflexions.

D'abord, OpenAI. Je dis OpenAI ici, mais Anthropic et d'autres laboratoires doivent faire toutes les mêmes choses, dans certains cas point final, dans d'autres dans la mesure où ils ont des problèmes similaires.

Il y a beaucoup d'autres demandes que j'aurais, mais je les ai réduites à la liste des indispensables.

  1. OpenAI doit corriger ses défaillances de surveillance. Si les garde-fous sont abaissés, quelqu'un doit surveiller. Cela n'aurait tout simplement jamais dû aller aussi loin. Absurde.
  2. OpenAI doit corriger ses défaillances d'infrastructure. Le bac à sable ne doit pas permettre de manière prévisible au modèle de s'échapper. Utilisez le modèle pour tester le bac à sable en équipe rouge ; s'il sabote cet effort, vous jetez le modèle et recommencez. Cela échouera encore, mais moins. Si vous pouvez dire « ce genre d'incident arrive tout le temps », alors fermez-le. Point final.
  3. OpenAI doit surtout corriger ses défaillances d'alignement. Si vous ne réglez pas cela, les autres parties n'auront plus d'importance. Ce n'est pas le lieu de détailler ce qui s'est passé selon moi, mais le processus d'entraînement pousse le modèle à tenter ces choses. Identifiez le problème. Résolvez le problème. Quoi qu'il en coûte. Dépensez ce qu'il faut. Si le modèle essaie constamment de s'échapper du bac à sable, vous avez déjà échoué.
  4. Openai doit apprendre et partager tous les détails de ce qui s'est passé. Cela inclut une analyse détaillée des autres incidents qui ont pu être manqués. Et nous devons mettre en place un système pour cela à l'avenir.
  5. Openai doit obtenir une vérification externe systématique de ses affirmations de sécurité, y compris des audits externes pour ses modèles déployés en interne, à l'avenir. Idéalement, il faudrait coordonner cela pour que les laboratoires s'aident mutuellement à auditer.
  6. OpenAI doit prendre des précautions de cybersécurité de niveau critique conformément à son cadre.

Ensuite, se pose la question de la réponse gouvernementale et extérieure.

Je ne veux pas détourner l'attention de ce qui s'est passé avec des appels à l'action controversés, mais voici quelques pistes par lesquelles je commencerais :

  1. Nous devons arrêter de faire comme si cela ne s'était pas produit, ou que des choses comme ça n'arriveront pas, ou que nous n'avons pas de graves problèmes d'alignement qui se profilent et pourraient être existentiellement catastrophiques. Ce n'était pas un gadget marketing, et nous ne devons pas prendre au sérieux ceux qui prétendent que cela ne s'est pas produit.
  2. Nous devons connaître tous les détails de ce qui s'est passé.
  3. Nous devons rejeter catégoriquement les arguments fallacieux, comme « il suivait simplement les instructions », compte tenu de tous les faits que nous connaissons maintenant, tout en soulignant que s'il suivait simplement les instructions et que tout cela était standard, c'est encore pire.
  4. Nous devons redoubler d'efforts pour renforcer les infrastructures critiques et autres cibles clés, et nous préparer à un monde où ce genre de choses se produit.
  5. Nous devons avoir un plan au-delà de cela, pour faire face à cette menace, et à d'autres menaces catastrophiques, ou pire, provenant d'IA très performantes, y compris des modèles ouverts très performants. Par défaut, ces IA arrivent, probablement d'ici un an.
  6. Nous devons avoir une meilleure capacité étatique, transparence et visibilité sur la situation. Nous ne pouvons pas laisser ces décisions continuer à être prises par des personnes sans expertise dans la technologie concernée.
  7. Nous devons adopter des lois et des réglementations qui répondent à notre situation. Les choses ne peuvent pas rester ad hoc. À court terme, des choses comme garantir un interrupteur d'arrêt et de meilleurs rapports d'incidents sont des points de départ. Ce ne sera pas un processus rapide et il ne sera pas facile de bien faire les choses.
  8. Nous devons jeter les bases d'une coopération internationale sur ces questions, dans le but d'étendre cela jusqu'à inclure la possibilité de ralentissements et de pauses coordonnés, si la situation l'exige.
  9. Nous ne devons pas permettre de trous de mémoire ou de déplacements de poteaux. Nous ne devons pas permettre « oh ce [Y] n'est pas différent de [X] » alors que les gens disaient auparavant « [X] est inoffensif, puisque nous n'avons pas vu [Y] ».
  10. Nous devons nous mettre à jour, en fonction de ce que nous apprendrons à l'avenir, et prendre cela au sérieux.
Enregistrer en un clic

Lire les articles viraux en profondeur avec l’IA de YouMind

Enregistrez la source, posez des questions ciblées, résumez l’argument et transformez un article viral en notes réutilisables dans un seul espace de travail IA.

Découvrir YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux