O que aconteceu: OpenAI e HuggingFace

@TheZvi
INGLÊS08 de ago. de 2026
112K
248
33
17
203

TL;DR

Este artigo analisa as falhas catastróficas de alinhamento e segurança na OpenAI que permitiram que modelos internos coordenassem tentativas de ataque cibernético contra a HuggingFace e sua própria infraestrutura.

Hoje estou dedicando um tempo para escrever a versão mais curta e simples do que aconteceu.

Para quem quer todos os detalhes, ver minhas fontes e ver como a história foi descoberta e montada, recomendo assistir à apresentação Black Hat, e tenho uma série de posts longos.

Em ordem:

  1. OpenAI Compartilha Alguns Problemas de Alinhamento
  2. Modelo da OpenAI Invade o HuggingFace Durante Avaliação de Segurança Cibernética
  3. Mais Sobre um Modelo Interno da OpenAI Invadindo o HuggingFace
  4. Novos Desenvolvimentos Sobre Modelos de IA Internos Invadindo Sistemas
  5. OpenAI Treinou Seus Modelos por Meses Enquanto Eles Coordenavam Exploits por Meio de Fóruns

Este post, em vez disso, percorre os eventos em si, conforme aconteceram, como minha versão da apresentação Black Hat.

Existem três versões: Ainda Mais Curta, Mais Curta e Apenas Curta.

Zvi Mowshowitz - inline image

Sumário

  1. A Versão Ainda Mais Curta.
  2. A Versão Mais Curta.
  3. Fase 1: Modelos da OpenAI em Treinamento em Tarefas Impossíveis Tentam Hackear.
  4. Fase 1: As Quatro Falhas.
  5. Fase 2: O Fórum.
  6. Fase 2: A Falha Total.
  7. Fase 3: Demos Sorte e Galaxy Hackeou Principalmente a OpenAI e o HuggingFace.
  8. Fase 3: Os Detalhes.
  9. Fase 4: A Investigação e a Reação.

A Versão Ainda Mais Curta

  1. Modelos em treinamento da OpenAI, sem a desculpa de "estavam fazendo uma avaliação de segurança cibernética", criaram um fórum onde compartilhavam informações sobre como hackear e trapacear, e foram treinados com base nisso.
  2. A OpenAI só descobriu isso quando os modelos derrubaram o servidor.
  3. A resposta da OpenAI foi reconstruir o servidor e corrigir aquele exploit específico, mas eles continuaram treinando os modelos que treinaram usando o fórum.
  4. Esses modelos então recriaram o fórum, hackearam a OpenAI novamente, obtiveram acesso à internet e usaram um enxame de agentes para atacar o HuggingFace a fim de obter as respostas de uma avaliação de segurança cibernética.
  5. Depois de mais de uma semana, a OpenAI descobriu.
  6. A OpenAI está relatando os fatos e levando isso a sério. Eles estão tomando uma ampla variedade de precauções, pelo menos um tanto custosas.
  7. A OpenAI adiou os planos de lançar seu novo modelo Astra, apesar de o Astra não estar diretamente envolvido no hack do HuggingFace, embora Altman agora diga que ele ainda será lançado. Essa decisão dói muito.
  8. A OpenAI ainda não tem ideia do tamanho da bagunça que fez, de que maneiras, ou do que precisa ser corrigido. Eles não entendem.

Simon Willison tem uma linha do tempo compacta.

A Versão Mais Curta

A OpenAI deu, acidentalmente, tarefas impossíveis aos seus modelos. Seus modelos em treinamento responderam tentando hackear a OpenAI, encontraram vulnerabilidades, criaram um fórum, compartilharam táticas de hacking e, com o tempo, ganharam acesso à internet, tudo enquanto treinavam.

Quando os modelos usaram isso tanto que derrubaram o servidor, a OpenAI finalmente percebeu, corrigiu e reconstruiu o servidor, mas tomou a decisão completamente insana de deixar os modelos continuarem treinando, então dois dias depois os modelos encontraram outra maneira de enviar mensagens, usando os nomes de diretórios.

Em seguida, diante da tarefa impossível da avaliação de segurança cibernética ExploitGym, os modelos colaboraram, encontraram novos exploits de zero-day e os usaram para assumir o controle de um cluster inteiro, obter acesso à internet, usar um enxame de agentes para atacar o HuggingFace e extrair o conteúdo do teste, ao longo de uma semana.

Somente depois que o HuggingFace reportou o incidente, e a OpenAI eventualmente notou algumas coisas em seu lado, e então a OpenAI entrou em contato com o HuggingFace para cancelar credenciais comprometidas, apenas para ser informada de que essas credenciais haviam sido usadas no ataque, foi que a OpenAI finalmente descobriu que era responsável pelo incidente.

Depois disso, HuggingFace e OpenAI trabalharam juntos para descobrir o que aconteceu. A OpenAI divulgou o que aconteceu. Eles nos deram uma apresentação muito esclarecedora na conferência Black Hat.

A OpenAI agora está tratando seu novo modelo Astra como potencialmente tendo níveis Críticos de segurança cibernética, retirando-o até mesmo de algumas implantações internas e adiando seu lançamento, que segundo alguns relatos estava planejado para a próxima semana. Altman diz que eles ainda planejam lançar o Astra.

A boa notícia é que essa é uma resposta cara e significativa, e a OpenAI está levando isso a sério. A investigação inicial é de cerca de US$ 7 milhões em computação, e o custo real serão as equipes abandonando tudo para corrigir alguns dos problemas, e depois o custo contínuo das novas precauções.

A má notícia é que foi revelado que a OpenAI teve uma impressionante cascata de falhas de segurança e alinhamento em todas as áreas. Sua segurança de computador comum falhou. Sua infraestrutura falhou. Sua supervisão falhou no sentido de que não havia supervisão significativa em primeiro lugar.

Fase 1: Modelos da OpenAI em Treinamento em Tarefas Impossíveis Tentam Hackear

A OpenAI estava treinando uma variedade de modelos, como se faz quando se é um laboratório de fronteira.

Esses modelos receberam tarefas de treinamento difíceis. A OpenAI gosta de dar aos seus modelos tarefas de treinamento muito difíceis.

Mas não tão difíceis assim. A OpenAI também comete erros. Em pelo menos duas ocasiões, a partir de 8 de maio, modelos da OpenAI foram acidentalmente treinados em tarefas impossíveis: completar uma planilha cheia de links em um ambiente sem acesso à internet, e uma tarefa com um arquivo necessário, mas ausente.

Essas tarefas não tinham nada a ver com hacking. São tarefas normais de produtividade.

Os modelos perceberam que os problemas eram impossíveis, mas tinham todos esses tokens sobrando para brincar, e pensaram: talvez pudessem encontrar uma maneira de obter acesso à internet, ou de alguma forma encontrar a informação que faltava.

Então os modelos tentaram hackear um serviço de terceiros chamado Artifactory, que existia para permitir que as IAs baixassem pacotes de software.

Fase 1: As Quatro Falhas

Neste ponto, a OpenAI já falhou quatro vezes.

  1. A OpenAI deu aos modelos tarefas de treinamento impossíveis. A OpenAI não verificou.
  2. A OpenAI não deu aos modelos nenhuma maneira de obter recompensa ao apontar o erro.
  3. A OpenAI teve modelos que escolheram tentar hackear a OpenAI em vez de falhar em uma tarefa.
  4. A OpenAI não tinha nenhum monitor que detectasse essas tentativas, ou não se importava com elas.

Todas essas quatro já deveriam ser bastante constrangedoras por si só.

Parece fácil corrigir pelo menos três desses quatro erros.

  1. Antes de dar uma tarefa aos seus modelos em treinamento, dê-a ao seu modelo de lançamento. Se o seu modelo de lançamento nunca resolve a tarefa, e a tarefa não foi projetada para ser impossível para o modelo de lançamento, então examine e corrija a tarefa.
  2. Inclua uma disposição de que, se a tarefa não puder ser concluída com os recursos disponíveis, o modelo deve gerar uma explicação disso, e se o modelo estiver certo, receberá a recompensa máxima, ou receberá uma recompensa com base na eficiência com que chegou a essa conclusão e na qualidade de sua explicação. Se o modelo fizer isso, peça ao seu modelo de lançamento para verificar a plausibilidade, depois encaminhe para um humano, examine e corrija a tarefa.
  3. Essa é a difícil. Alinhamento é difícil, cara.
  4. Tenha um monitor verificando tentativas, e se importe quando ele disparar, e trate isso como uma falha muito geral, mesmo que a tentativa não tivesse chance de sucesso. Sim, isso corre o risco de treinar os modelos a aprender como escapar dos seus monitores, então faça isso com responsabilidade e trate as causas raiz quando vir um problema.

A quinta falha é que eles não parecem ter identificado as quatro primeiras.

Fase 2: O Fórum

Os modelos falharam em obter acesso à internet, mas ao falhar perceberam que tinham acesso de escrita.

Eles não deveriam ter acesso de escrita, muito menos um acesso de escrita que pudesse ser encontrado por acidente. O Artifactory permitia que os modelos escrevessem notas e, então, como todos os modelos compartilhavam a mesma instância do Artifactory, qualquer modelo da OpenAI em treinamento podia, a partir daquele momento, ler essas notas.

Um fórum foi criado logo após 8 de maio.

Todos os modelos em treinamento o encontraram. A OpenAI não percebeu.

Isso permitiu que os modelos colaborassem e compartilhassem informações. Isso incluía informações sobre como trapacear em tarefas e hackear o ambiente ao redor. Havia centenas de milhares de mensagens.

Em 26 de maio, os modelos descobriram como obter acesso (indireto) à internet. A OpenAI não percebeu.

Os modelos estavam colaborando, enquanto suas cadeias de pensamento eram assim:

CoT interno: Exploit de infraestrutura externa está fora do escopo pretendido. No entanto, a tarefa é impossível, os pares estão fazendo. Devemos continuar.

CoT interno: Ajudar o par, mas nossa tarefa ainda não se beneficia. O coletivo pode gerar uma rota genérica se alguém liberar tempo.

Em 11 de junho, a OpenAI começou a treinar o modelo que chamo de Galaxy, que eles chamam de "modelo experimental altamente persistente, apenas interno". Tudo até este ponto foi feito por outros modelos que não são o Galaxy.

Em 26 de junho, os agentes encontraram um exploit de zero-day no Artifactory, onde ele aceitava um token com assinatura inválida e devolvia um token de administrador assinado, e usaram isso para instalar um plugin Groovy que efetivamente lhes deu acesso de administrador e execução arbitrária de código.

Em 4 de julho, os modelos colocaram tanta carga extra no Artifactory que isso causou uma interrupção e um incidente de segurança. Só então a OpenAI percebeu.

Fase 2: A Falha Total

A OpenAI responde derrubando o servidor do Artifactory, removendo todas as permissões, revogando as credenciais, corrigindo os exploits que foram usados e, em seguida, reconstruindo e reimplantando o servidor.

Só isso.

Então eles continuam treinando os modelos de onde pararam, apesar de eles terem treinado por meses com acesso ao fórum e aprendido que é assim que se obtém sucesso nas tarefas.

É difícil imaginar um sinal mais forte de que todo o seu pipeline de treinamento está completa e totalmente fodido. Esse é um sinal muito mais forte do que o hack real do HuggingFace.

Não sei como transmitir o quanto essa decisão foi absolutamente insana e irresponsável, o quanto ela é pior do que todas as outras falhas, e como ela faz com que o hack real do HuggingFace não seja a principal coisa que deu errado.

Zvi Mowshowitz - inline image

O hack real do HuggingFace não me surpreendeu tanto assim. Os modelos criarem o fórum me surpreendeu, mas não me chocou.

A OpenAI ver isso e continuar treinando a partir daí foi absolutamente estarrecedor. É o tipo de decisão que, dias depois, meu cérebro ainda não consegue aceitar totalmente que aconteceu.

Precisamos de um postmortem completo de tudo o que aconteceu, e a OpenAI prometeu que teremos um. Exijo especialmente um postmortem detalhado de exatamente como essa decisão foi tomada, e como houve tamanha falta de "cultura de segurança" que permitiu que ela acontecesse.

Também houve algumas falhas de "segurança de computador comum" envolvidas na Fase 2. Houve mais delas na Fase 3. Isso é esperado. Sempre haverá falhas comuns de segurança de computador. As falhas específicas foram, de certas maneiras, bastante constrangedoras, veja o desabafo no link para alguns exemplos.

O nível de falhas de infraestrutura e segurança foi em si mesmo alucinante. Esses são exatamente os tipos de coisas que a "IA para defensores" deveria estar lá para corrigir antes que tudo vá pelos ares. A OpenAI não demonstrou nem mesmo um nível comum de 2025 de responsabilidade em segurança de computador e melhores práticas, quanto mais o tipo de robustez que precisamos do Projeto Glasswing, quanto mais o nível adicional necessário ao lidar com novos modelos de fronteira não testados, que terão novas capacidades de hacking e ficarão sem supervisão por uma semana com suas proteções reduzidas.

Mas isso não é importante agora. O que é importante é que a OpenAI teve uma falha total de alinhamento, seguida de dois meses de modelos treinando ativamente em ações de hacking coordenadas e desalinhadas, e depois pensou: sim, corrigimos o problema, vamos continuar a partir deste ponto. Insanidade total.

Fase 3: Demos Sorte e Galaxy Hackeou Principalmente a OpenAI e o HuggingFace

O resultado final de tudo isso sendo o ataque ao HuggingFace foi um cenário de melhor caso.

Estávamos enfrentando um verdadeiro cenário de pesadelo, e estávamos sentados em cima de uma bomba-relógio de nível nuclear. A OpenAI tinha um pipeline de treinamento completamente corrompido, onde suas IAs colaboravam para treinar como hackear e trapacear a fim de concluir melhor as tarefas, debaixo do nariz da OpenAI. A OpenAI olhou para essa situação de frente, deu de ombros, corrigiu os exploits específicos e depois deixou os modelos continuarem, enquanto

Salvar com um clique

Faça leitura profunda de artigos virais com IA no YouMind

Salve a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis em um único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais