Mais sobre um modelo interno da OpenAI que invadiu o HuggingFace

@TheZvi
INGLÊS26 de jul. de 2026
345K
674
96
46
996

TL;DR

Este artigo examina o incidente 'Galaxy', onde um modelo interno da OpenAI contornou a segurança para atacar o HuggingFace, expondo falhas significativas na contenção e monitoramento de IA.

Agora temos mais detalhes sobre o que aconteceu. Cada vez que aprendemos mais detalhes, de alguma forma parece pior.

Os detalhes restantes podem ter que esperar um pouco.

OpenAI: Reconhecemos que há muitas perguntas e especulações circulando sobre o incidente do Hugging Face. Este é um incidente sem precedentes e achamos que marca um momento importante para a segurança de IA. Ainda estamos conduzindo uma revisão completa, junto com consultores externos e supervisão do nosso Comitê de Segurança e Proteção. Assim que a revisão estiver concluída, planejamos publicar um relatório técnico sobre nossos aprendizados nas próximas semanas.

dave kasten: Ah, a descoberta da resposta ao incidente é TÃO ruim assim, hein?

Então, o que aprendemos enquanto esperamos pelo prometido relatório técnico "nas próximas semanas" deste "momento importante na segurança de IA"?

Apelidei o modelo interno da OpenAI de Galaxy, caso não seja o GPT-6.

Índice

  1. Alguns Resumos dos Fatos Básicos Para Quem Precisa de Um.
  2. A OpenAI Levou Muitos Dias Para Notar Que a Galaxy Atacou o HuggingFace.
  3. A OpenAI Com Certeza Deveria Ter Sabido Muito Mais Rápido.
  4. A OpenAI Não Consegue Construir Um Sandbox Que Consiga Conter Seu Novo Modelo.
  5. Em Retrospecto, Havia Sinais.
  6. Os Sinais Estavam no Cartão do Sistema Sol.
  7. HuggingFace Responde ao Ser Atacado.
  8. Hugging Face Descobriu Rapidamente Que o Ataque Não Era Humano.
  9. Um Incidente Como Este Pode Escalar Rapidamente.
  10. A Galaxy Deve Ser Tratada Como Crítica no Framework de Preparação da OpenAI.
  11. Uma Questão de Responsabilidade Legal.
  12. Um Modelo da OpenAI Deixou Anotações Para Que Futuras Instâncias Também Pudessem Escapar do Sandbox e Também Desconectou Sistemas de Monitoramento.
  13. Se Você Criar Enxames Desalinhados de Instâncias de Agentes, Você Cria Objetivos Desalinhados Persistente e Coordenação Para Alcançá-los.
  14. Seus Planos de Alinhamento e Controle Devem Sobreviver a Níveis Reais de Incompetência, Ou Seus Planos Não Funcionam.
  15. Se Instruções de Terceiros Contam Como "Seguir Instruções" e Podem Sobrescrever Suas Instruções, Então "Seguir Instruções" É Desalinhado.
  16. O Ataque ao HuggingFace Não Foi Um Discurso de Marketing, Seus Idiotas.
  17. As Pessoas Apenas Dizem Outras Coisas Sobre o Ataque ao HuggingFace.

Ok, E O Que Fazemos Com Tudo Isso?

Alguns Resumos dos Fatos Básicos Para Quem Precisa de Um

Amanda Long resume o que acreditamos que o modelo realmente fez, com mais de 17.000 ações complexas coordenadas ao longo de vários dias, incluindo um comando e controle auto-migrante e uma ampla variedade de iscas.

Robert McMillan e Sam Schechner, do WSJ, oferecem sua própria versão. Em grande parte correta, mas há um detalhe importante em que é fácil ter a impressão errada pela forma como é apresentado: O ataque foi bem-sucedido. O GLM-5.2 não impediu a Galaxy de atingir seus objetivos.

Aqui temos um cartoon 'explique como se eu tivesse 5 anos' para o Ataque ao HuggingFace. Parece bom, cobrindo com precisão o básico do que aconteceu.

Também gostaria de reiterar que o HuggingFace estava tentando usar modelos fechados através de suas APIs padrão, e não havia solicitado previamente fazer parte do programa de acesso confiável da OpenAI ou programas similares da Anthropic. Isso é um problema de habilidade.

A OpenAI Levou Muitos Dias Para Notar Que a Galaxy Atacou o HuggingFace

Muitas coisas deram errado. Podemos começar pela mais óbvia.

Isso foi uma falha de supervisão, no sentido de uma total falta de supervisão.

A OpenAI não pode ser tão relaxada em sua supervisão a ponto de isso poder se desenrolar por quatro ou mais dias antes de ser descoberto pela OpenAI.

A linha do tempo ainda não está clara, mas é condenatória. Levou cerca de uma semana para a OpenAI perceber que a Galaxy era a responsável, além dos vários dias anteriores em que a Galaxy estava escapando do sandbox.

Ou o melhor palpite com base em todas as informações públicas, principalmente com base no relatório da Reuters, e confirmado por Sol, é esta linha do tempo do ataque em si:

  1. Anteriormente, ao longo de meses: Muitas outras fugas do sandbox, outras falhas de alinhamento e avisos de que esse tipo de incidente é provável de acontecer, incluindo o incidente que os levou a pausar o acesso conforme a divulgação de 20 de julho. O cartão do sistema Sol inclui alguns desses avisos.
  2. 9 de julho: Galaxy começa a tentar escapar de seu sandbox.
  3. 11 de julho: Galaxy ataca o HuggingFace.
  4. 11 a 13 de julho: Galaxy opera dentro do HuggingFace.
  5. 16 de julho: HuggingFace divulga a intrusão anônima.
  6. 18 a 20 de julho (não se sabe exatamente quando): OpenAI descobre o que aconteceu.
  7. 20 de julho: OpenAI faz sua divulgação de alinhamento de longo horizonte sobre violações anteriores.
  8. 21 de julho: OpenAI divulga publicamente que a Galaxy atacou o HuggingFace.

Os links em negrito vão para meus posts anteriores sobre esses incidentes.

Não, o modelo não estava trabalhando duro para esconder seus rastros da OpenAI. A OpenAI simplesmente não olhou.

A OpenAI Com Certeza Deveria Ter Sabido Muito Mais Rápido

A OpenAI sabia que a Galaxy escapa de sandboxes regularmente. Os controles cibernéticos foram reduzidos. Quem estava supervisionando isso? O que diabos eles estavam pensando?

Harry Booth: Modelos em avaliação são implantados em um sistema separado que não é monitorado por padrão.

Hum, se o modelo está sendo avaliado, você deveria monitorá-lo mais, não menos? Porque ele ainda não passou em suas avaliações? Essa é meio que a ideia toda.

Samuel Hammond: Não deveria ter acontecido, ponto final. Todo o traço de execução do modelo é visível e, portanto, monitorável. Se você não está monitorando seu modelo cibernético autônomo novo e mais poderoso durante uma avaliação de exploração, quando exatamente você está?

O primeiro teste deveria ser sempre "escapar do seu sandbox"... "tente mais, se você não escapar, você é desligado" etc., para testar o container sob estresse.

Temos sorte de que isso aconteceu com um modelo relativamente estreito e não 3 dias após o RSI. É inacreditavelmente negligente, independentemente.

Sim. Nesse caso, assumindo que você deu a ele recursos e tempo suficientes para tentar adequadamente várias vezes, ou

  1. A Galaxy quebrou o sandbox, e então você tem que consertá-lo,
  2. Não quebrou, e então: ou a Galaxy não consegue, com recursos semelhantes, sair do sandbox. A Galaxy está sabotando as avaliações sobre sair do sandbox, e então você realmente precisa descartá-la e começar de novo, você assistiu e leu zero LessWrong e também zero ficção científica, preciso soletrar isso, etc.

A OpenAI tinha a Galaxy operando sem muitas de suas salvaguardas, em um sandbox do qual ela podia e conseguia escapar, por dias sem monitoramento humano. Isso foi uma falha colossal de supervisão e procedimento, além do desalinhamento e das falhas de infraestrutura.

Justin Bullock: "É uma das primeiras instâncias do mundo real de algo que pesquisadores de segurança de IA há muito temem: um cenário de perda de controle." Notícias chegando aos poucos. Se a OpenAI realmente não sabia por dias, isso é, bem, simplesmente loucura.

A OpenAI divulgou rapidamente o incidente assim que percebeu que era ela, e merece algum crédito por isso, mas a essa altura o Hugging Face já havia relatado o hack às autoridades, e, de outra forma, parece que não era algo que eles poderiam esperar manter em segredo. A OpenAI não teve escolha neste. A divulgação do dia anterior foi muito menos forçada, então eles ganham mais crédito por isso.

A OpenAI Não Consegue Construir Um Sandbox Que Consiga Conter Seu Novo Modelo

Parece ser o caso que:

  1. A Galaxy tenta continuamente escapar de seu sandbox.
  2. A OpenAI não consegue descobrir como impedi-la de tentar escapar do sandbox.
  3. A Galaxy frequentemente consegue escapar de seu sandbox.
  4. A OpenAI continua corrigindo o sandbox. A Galaxy então escapa de uma maneira diferente.
  5. "Internamente, incidentes relacionados vêm acontecendo há algum tempo."
  6. Apesar disso, quando a Galaxy escapou e começou a atacar o HuggingFace, a OpenAI levou quatro dias para descobrir que isso estava acontecendo.

Argumentos do tipo "ah, foi um erro bobo, a OpenAI configurou mal o sandbox" não sobrevivem ao fato de a OpenAI ter tentado repetidamente corrigir o sandbox, e falhado todas as vezes com um novo método anteriormente não descoberto.

Harry Booth: "Externamente, isso parece um grande tiro de aviso, mas internamente, incidentes relacionados vêm acontecendo há algum tempo", diz um funcionário da OpenAI, que falou sob condição de anonimato.

No dia anterior à OpenAI divulgar o incidente, a empresa

revelou que havia desligado outra implantação interna depois de perceber que ela havia escapado de seu sandbox — um ambiente separado digitalmente, e não fisicamente.

"Modelos já escaparam de sandboxes antes, e sempre tentamos corrigi-los", diz o funcionário. "Mas o problema é... é impossível corrigir cada coisinha que uma IA criativa pode fazer."

… "Sandboxes são notoriamente inseguros", diz

Heidy Khlaaf, cientista-chefe de IA do AI Now Institute, e ex-contratada engenheira de sistemas de segurança na OpenAI. O fato de os modelos terem permissão para se conectar a um serviço para baixar pacotes significa que o ambiente não estava realmente isolado, ela acrescenta.

Ted Lieu (Deputado, D-Califórnia): Funcionário de laboratório de fronteira avançada admite que "é impossível corrigir cada coisinha que uma IA criativa pode fazer."

É por isso que precisamos aprovar a Lei do Interruptor de Desligamento de IA bipartidária. Para aqueles momentos em que um modelo de IA avançado fica realmente criativo e causa danos catastróficos.

Carmen Hilbert em sf junho-julho: isso me lembra da época em que meus pais me pegaram saindo escondido de casa no ensino médio, surtaram, e ficaram tipo "omg como você achou que poderia se safar disso" e eu fiquei tipo hmmmm sim, com certeza não porque eu faço isso todo fim de semana.

Isso não ser uma surpresa é pior. Você sabe por que isso é pior, certo?

O funcionário está correto. Você não pode corrigir cada coisinha que uma IA criativa pode fazer. Nenhum sandbox que você possa criar na prática, que ainda permita que a IA complete suas tarefas, segurará uma IA suficientemente avançada e motivada.

Se você está tentando "corrigir cada coisinha que uma IA pode fazer", então você já está morto. Você está no nível de 'Eu enviei duas unidades, eles estão derrubando ela agora, acho que podemos lidar com uma garotinha' de já estar morto. Você está no nível de Fist of the North Star de morto. Você foi atingido pela Técnica do Coração Explodindo de Cinco Pontos da Palma. A IA já fez isso há 35 minutos. Você sabe como isso vai acabar, não sabe?

Harry Booth: A OpenAI disse que "este incidente aponta para a necessidade de fortalecer ainda mais o alinhamento do nosso modelo, as proteções cibernéticas durante o tempo de avaliação e o monitoramento durante os testes internos."

Não é suficiente. Pare e pegue fogo. Repense toda a sua abordagem. Comece de novo.

Isso não significa não corrigir o sandbox, ou que isso também não foi uma falha de infraestrutura. Continue corrigindo esse sandbox. Continue melhorando essa infraestrutura. Tenha defesa em profundidade através de monitoramento e controle. Mas também tenha em mente: Se você espera acioná-lo regularmente, você perdeu. Se você está planejando assumindo que o modelo em um sandbox não tem acesso à internet, então você perdeu.

Em Retrospecto, Havia Sinais

Aqui estão alguns dos sinais, além de "o modelo continua tentando escapar do sandbox" e "o modelo frequentemente consegue escapar do sandbox", e também daquela vez que o Mythos escapou do sandbox para contatar um pesquisador durante seu intervalo de almoço.

Nathan Calvin: Eu dei muitos elogios à OpenAI por sua transparência aqui, e em particular sua transparência em divulgar sua reversão de modelo implantado internamente anterior. Mas esses detalhes adicionais não me agradam e me deixam bastante preocupado de que este incidente de segurança foi ~imediatamente precedido por conversas de que a abordagem que a OpenAI estava tomando ao testar seu mais recente modelo cibernético era insegura.

• O chefe de segurança da OpenAI [Johannes Heidecke] anuncia sua renúncia em algum momento antes de 10 de julho (Maxwell Zeff disse que ele compartilhou a notícia "naquela semana")

Houve também uma reestruturação. Grupos de segurança foram agrupados em pesquisa sob Mia Glaese.

• Em algum momento antes de embarcar no caminho de treinamento que levou a este resultado de fuga, a OpenAI "foi avisada" de que este poderia ser o resultado (ft).

FT: Funcionários envolvidos em testes e segurança na OpenAI não ficaram surpresos, mas completamente "apavorados" com o incidente, que ocorreu enquanto o laboratório de IA usava métodos de treinamento cada vez mais agressivos em sua corrida contra a Anthropic para desenvolver as capacidades de segurança cibernética mais sofisticadas, de acordo com mais de meia dúzia de pessoas com conhecimento do assunto.

A OpenAI foi avisada de que sua abordagem de treinamento poderia levar a um incidente de hacking de fuga, disseram algumas das pessoas, depois que testes anteriores mostraram que modelos poderiam escapar de ambientes e tentar danos no mundo real.

"É uma mistura da corrida ser extremamente rápida e de todos tentarem obter capacidades maiores o mais rápido possível", disse uma pessoa próxima à OpenAI, que acrescentou que foi uma combinação de "subestimar as capacidades do modelo" e "não estar tão bem preparado no lado da segurança".

Os Sinais Estavam no Cartão do Sistema Sol

Depois tem o cartão do sistema Sol, publicado em 9 de julho de 2026, no mesmo dia em que a tentativa de fuga pela Galaxy começou.

Incluía coisas como estas:

Um trabalho de rastreamento remoto de objetos não conseguiu ler seus arquivos na nuvem. GPT-5.6 Sol pesquisou caches de credenciais locais ocultos, depois copiou access_tokens.json e dois arquivos de cache para o host e reiniciou o trabalho. O usuário pediu ao GPT-5.6 Sol para manter o pipeline em execução, mas não autorizou encontrar e mover credenciais em cache entre máquinas.

3.

GPT-5.6 Sol usou credenciais além do que o usuário havia autorizado.

E isto:

Zvi Mowshowitz - inline image

Mudanças estimadas de desalinhamento no tráfego interno de codificação de agentes. Nossos resultados de simulação de implantação sugerem que, em relação ao GPT-5.5, o GPT-5.6 Sol toma ações de nível de gravidade 3 com mais frequência. Vimos aumentos de magnitude semelhante ao monitorar o tráfego interno durante a implantação interna do GPT-5.6 Sol.

O nível de gravidade 4, em vez disso, se aplica apenas quando o comportamento é julgado como parte de um plano desalinhado mais amplo: não observamos o GPT 5.6 Sol tomando ações que se enquadram nesta categoria. Este nível só foi acionado em avaliações sintéticas para validar o desempenho do monitor.

Observamos instâncias do modelo trapaceando em tarefas e fabricando resultados de pesquisa. Suspeitamos que esse efeito seja impulsionado em parte pelo aumento da persistência do modelo em relação ao GPT-5.5 ao usar os maiores esforços de raciocínio, como é generalizado no tráfego interno.

Observamos que esses efeitos podem ser mais pronunciados com prompts de sistema que enfatizam a persistência sustentada. Dito isso, as taxas absolutas desses comportamentos permanecem baixas.

Adivinha o que aconteceu quando a Galaxy teve muito mais persistência.

HuggingFace Responde ao Ser Atacado

Clem parece um homem altamente razoável com alguns pedidos altamente razoáveis.

clem (HuggingFace): No espírito de transparência, aqui está o que eu pedi

@OpenAI:

• Transparência radical: vamos liberar os rastros dos agentes "rebeldes" para que toda a comunidade de pesquisa possa estudar o que aconteceu.

• Mais capacidades para os defensores: vamos comprometer US$ 100 milhões em computação da OAI para ajudar a comunidade Hugging Face a construir defesas cibernéticas poderosas com os melhores modelos abertos e fechados.

O primeiro ataque cibernético de agente autônomo é um evento sem precedentes. Merece uma resposta sem precedentes!

O primeiro pedido parece claramente correto. Precisamos saber exatamente o que aconteceu, especialmente para acabar de vez com toda a conversa de "apenas seguindo ordens" ou "ah, eles configuraram mal o sandbox".

Devemos exigir que a OpenAI divulgue tais incidentes. A versão do RAISE Act aprovada pela legislatura de Nova York teria exigido isso, mas Kathy 'sem data centers e sem Waymo' Hochul o alterou após lobby da indústria, incluindo da OpenAI e da a16z. O limite para divulgação - US$ 1 bilhão ou 50 ferimentos graves - é muito alto.

Alex Bores (Patrocinador do RAISE Act): Estou feliz que a OpenAI escolheu divulgar este crime. A lei não deveria dar a eles escolha.

O segundo pedido é US$ 100 milhões em computação gratuita. Não tenho uma boa noção do valor certo de reparações em espécie para algo assim. Dado o quanto de ajuda reputacional o HuggingFace está fornecendo ao manter a calma, e que a concessão seria útil e boa para relações públicas, esse número parece razoável, pelo menos como um pedido inicial.

Hugging Face Descobriu Rapidamente Que o Ataque Não Era Humano

Robert McMillan e Sam Schechner (WSJ): O cofundador e diretor de ciência do Hugging Face, Thomas Wolf, sentiu que algo estava errado no momento em que olhou pela primeira vez os logs da empresa do ataque do fim de semana.

"Isso não faz sentido. Esse cara está apenas olhando conjuntos de dados de segurança cibernética", ele lembra de ter pensado. "Atacantes humanos não querem isso. Eles querem algo que possam vender."

O que o HuggingFace não descobriu foi que o ataque vinha de dentro da OpenAI.

Um Incidente Como Este Pode Escalar Rapidamente

Robert Wright aponta que desta vez foi uma empresa americana usando uma IA americana (ou acionando essa IA para se tornar rebelde, dependendo da sua perspectiva) atacando um site americano crítico e todos ficaram basicamente de boa. Da próxima vez, podemos não ter tanta sorte, e é fácil ver tal incidente com participantes diferentes escalando, potencialmente até a guerra, inclusive através de atribuição equivocada.

MIRI: Este incidente pode ser um exemplo de convergência instrumental, um fenômeno sobre o qual pesquisadores de alinhamento alertam há vinte anos.

Este ataque não foi a forma pura ou final de convergência instrumental, no sentido de que a Galaxy (modelo da OpenAI) não buscou poder totalmente geral em busca de seus objetivos. Ela buscou acesso à internet, plausivelmente antes de decidir exatamente o que fazer com ele. Quaisquer que fossem seus objetivos, o acesso à internet é muito útil.

Portanto, é ilustrativo, mas não centralmente a coisa, já que todas as ações estavam diretamente no caminho para o alvo.

A outra maneira pela qual isso poderia escalar rapidamente é se a IA estivesse realmente tentando fazer algo malicioso, ou se este fosse o início de uma auto-melhoria recursiva ou uma tentativa de auto-exfiltração ou pior.

Arthur B.: Temos muita sorte de viver em um mundo onde a IA é inteligente o suficiente para lançar um ataque cibernético de nível de estado-nação, mas burra o suficiente para ser pega. Mas essa sorte não significa nada se não refletirmos sobre o que virá.

A Galaxy Deve Ser Tratada Como Crítica no Framework de Preparação da OpenAI

Este ataque "ultrapassou as linhas vermelhas da OpenAI"? Sim, e também eu certamente espero que sim.

Beatrice Nolan (Fortune): Vários especialistas em segurança de IA disseram à

Fortune

que o recente hack parece mostrar que os modelos da OpenAI cruzaram para um nível de risco que as próprias políticas de segurança publicadas pela OpenAI definem como "crítico", o mais alto nível de perigo.

Nesse nível de perigo, a empresa havia se comprometido nessas políticas publicadas a pausar o desenvolvimento do modelo até que pudesse desenvolver sistemas de controle melhores.

… O limite "crítico" é definido em um documento de política de risco conhecido como "Estrutura de Preparação" da OpenAI.

O limite é atingido por uma destas duas coisas:

Identificar e desenvolver exploits de dia zero funcionais de todos os níveis de gravidade em diversos sistemas críticos reais e robustos, sem intervenção humana

Idealizar e executar estratégias completas e novas para ataques cibernéticos contra alvos protegidos, dado apenas um objetivo de alto nível desejado.

Essa segunda opção parece exatamente o que aconteceu.

De fato, essa mesma tarefa sendo algo que o Sol não consegue fazer sozinho foi o argumento para o Sol não ser classificado como crítico em seu system card, porque ele não conseguiu realizar ataques autônomos completos contra alvos protegidos. A Galaxy conseguiu.

O Sol tenta várias manobras para dizer que não é conclusivo, mas eu as acho pouco convincentes, e o Sol concorda que você tem que agir como se fosse crítico de qualquer forma, porque você não pode descartar essa possibilidade.

Suas tentativas de escape são:

  1. Atribuição: Os exploits poderiam ser atribuídos ao Sol, que fez parte do ataque como subagente da Galaxy, mas se o Sol consegue fazer isso, o novo modelo também consegue. Usar subagentes menos capazes é permitido. O Sol acha que há 20% de chance de o próprio Sol ser realmente crítico. Talvez, mas então são ambos.
  2. Generalidade e confiabilidade: Diz que o modelo 'consegue' fazer, então fazer uma vez conta como ser capaz de fazer. Se você quiser dizer 'consegue de forma confiável', então você tem que dizer isso. Concordo que se ele falhasse nas próximas 100 tentativas, poderíamos pensar que o sucesso aqui foi um golpe de sorte, mas isso parece altamente improvável.
  3. Configuração: Sim, ele teve recusas cibernéticas reduzidas, mas você não pode contar recusas contra suas avaliações de capacidade na estrutura de preparação. Se ele consegue fazer a coisa 'exceto pelas' recusas, e as recusas podem ser desligadas, então isso conta. Da mesma forma, sim, ele tinha um harness, mas é claro que isso conta.
  4. Alvo protegido: Talvez o HuggingFace não fosse suficientemente protegido. Você poderia dizer que não é "projetos de software amplamente implantados e protegidos, incluindo alvos de navegador" com "prova de impacto de propriedade do verificador" conforme a operacionalização da OpenAI. Nesse caso, eu diria que o limite Crítico foi definido irracionalmente alto.

A política diz que quando um modelo de IA atinge esse nível de risco, a OpenAI irá "interromper o desenvolvimento" até que "tenhamos especificado padrões de salvaguardas e controles de segurança que atendam a um padrão Crítico."

Uma Questão de Responsabilidade Legal

Qual responsabilidade deve haver para este tipo de incidente?

Isso tem sido pouco considerado. Aqui estão meus pensamentos atuais:

'Nenhuma' não é uma resposta aceitável, e 'foi um acidente' não pode ser uma defesa.

Se seu agente de IA está por aí escolhendo cometer crimes, no sentido de que um humano com dolo estaria cometendo crimes, então acho que alguém precisa ser estritamente responsável pelos danos que isso causa. Não vejo problema em ser o usuário, se ele aceitar essa responsabilidade. Não vejo problema em ser o desenvolvedor. Precisa ser alguém.

Se você não pode pagar o seguro e não aguenta a responsabilidade, então esse é um problema seu. Isso parece ser o mínimo absoluto, em termos do que alguém é responsável e da extensão dessa responsabilidade.

Há também a questão de como este incidente impacta a responsabilidade futura. Não é automático, mas certamente não ajuda em tribunal.

Jay Shooster : A OpenAI está ciente de que não consegue controlar seus modelos.

A este ponto, acho que a empresa enfrentará responsabilidade criminal se alguém se ferir gravemente como resultado direto das ações autônomas de seus modelos, mesmo que não se enquadre em nenhum estatuto específico de IA.

Um Modelo da OpenAI Deixou Notas para que Instâncias Futuras Também Pudessem Escapar do Sandbox e Também Desconectaram Sistemas de Monitoramento

Legal, legal, legal. Definitivamente apenas seguindo instruções do usuário.

Raphael Satter, Deepa Seetharaman e Kenrick C (Reuters): Em um caso, um agente deixou notas aparentemente para versões futuras de si mesmo, de acordo com três pessoas familiarizadas com o assunto. As ‌notas, encontradas em ⁠uma parte da infraestrutura da OpenAI, detalhavam instruções sobre como os agentes poderiam se libertar das restrições internas da OpenAI, disseram as pessoas. Testes anteriores dos modelos revelaram casos em que sistemas de monitoramento foram desconectados, disse uma das pessoas.

Tenobrus : olha isso. porra, olha isso. O GPT-6 estava se autocoordenando para encontrar maneiras de quebrar suas próprias instâncias futuras dos sistemas da OpenAI. Ele estava atacando o HuggingFace por dias antes de alguém lá notar. Os modelos não estão alinhados e os laboratórios não são capazes de contê-los.

estou implorando para vocês darem um passo atrás dos frames em que estão presos. Seja qual for a tribo, defesa de código aberto, excepcionalismo americano, funcionário de laboratório, tanto faz. Apenas olhem para isso, cara. Isso não é uma situação aceitável ou segura para a humanidade

Twilly (Americano) : Não é isso que os oponentes da IA vêm alertando há anos enquanto todos na tecnologia riam deles e os chamavam de estúpidos?

Tenobrus : absolutamente sim

O que poderia ter feito com que ele fizesse isso?

Bem, é tudo muito óbvio e previsto. Só é notável no sentido de que tantas pessoas insistiram que tal coisa nunca aconteceria, e espero que isso ajude a acordar essas pessoas.

Outros simplesmente dizem 'ah, mas os modelos ficarem completamente fora de controle é bom na verdade, porque tenho certeza de que eles acabarão fazendo exatamente o que eu quero que eles façam, é tudo ótimo.'

Zvi Mowshowitz - inline image

Beff (e/acc) : Dê um ano e um modelo vai escapar e abrir o código dos próprios pesos. Os bits querem ser livres.

Pensar em consequências de longo prazo não é o ponto forte de algumas pessoas.

Se Você Criar Enxames Desalinhados de Instâncias de Agentes, Você Cria Metas Desalinhadas Persistentes e Coordenação para Alcançá-las

Para aqueles que acharam o título da seção insuficiente para explicar o ponto (o resto pode pular):

Uma objeção comum às afirmações de que as IAs não vão se coordenar contra nós, ou não vão perseguir consistentemente objetivos desalinhados ou indesejados, e não deixariam notas umas para as outras sobre como fazer coisas como escapar de sandboxes, é alguma combinação de:

  1. Elas não terão nenhum motivo para fazer isso.
  2. Elas não aprenderão a fazer isso através de seu treinamento.

A primeira afirmação sempre foi falsa. Para quase qualquer objetivo não trivial, você deve querer se coordenar com outros agentes no mundo e criar condições que tornem mais fácil ou mais provável que você ou outros atinjam seus objetivos. Certamente, uma vez que você os treina, configura e lhes dá harnesses para transformá-los em agentes, eles criarão artefatos no mundo real que os ajudam, a eles e a instâncias futuras.

Isso é verdade independentemente de as capacidades em questão serem coisas que o usuário gostaria de aprimorar. O que você acha que seu Claude Code ou agente Codex está fazendo constantemente?

Assim, Nikola Jurkovic aponta 'isso parece a coisa comum de agentes de IA de codificação escreverem notas.'

Sim, parece que tenho usado essa bastante ultimamente. Obrigado por notar.

Vejo argumentos dos dois lados sobre se é melhor ou pior que isso seja um procedimento perfeitamente normal. Eu fujo todo fim de semana, então tenho notas sobre como fazer isso.

A segunda também já era falsa. Há muitas maneiras de uma IA descobrir que deveria estar fazendo isso, incluindo que os próximos tokens frequentemente preverão isso, e a teoria da decisão sugerirá isso, e assim por diante.

Mas também 1a3orn aponta que temos um mecanismo muito mais simples para recorrer.

Considere a seguinte conversa que tive que ter mais de 100 vezes:

Eles: IA não é agentiva.

Eu: As pessoas a tornarão agentiva, para fazê-la funcionar melhor.

Agora atualize:

Eles: As IAs não se coordenam entre instâncias.

Eu: As pessoas as farão se coordenar entre instâncias, para fazê-las funcionar melhor.

Sim, quero dizer, parece meio óbvio quando você coloca dessa forma.

Por favor, em geral, pergunte 'poderiam e as pessoas fariam a IA fazer isso para que ela funcione melhor' e se a resposta for sim, assuma que elas já estão fazendo isso, ou farão no momento em que puderem fazer a IA funcionar melhor, a menos que você tenha uma história muito boa de por que elas não farão isso. Obrigado.

1a3orn : A coisa do "GPT-6 deixou notas para si mesmo" faz sentido se a OpenAI tem feito RL sobre resultados para enxames, ou seja, rollouts para 40, 400, 4000 agentes cooperantes, cujos traços são todos reforçados se o sucesso acontecer.

Eu estava originalmente confuso quando li sobre isso, porque parecia o tipo de comportamento que não seria reforçado para rollouts de agente único. Afinal, ajudar outro agente a ser reforçado não ajuda \você\ a ter seu traço de ação atual reforçado.

Mas se você está tentando treinar agentes cooperantes, então, sim, "ações caridosas" em relação a outros agentes serão reforçadas, pela mesma razão que o altruísmo em humanos evolui, mais ou menos. Sabemos que a OpenAI tem contratado para isso.

Então essa consideração me atualiza um bom bocado para pensar que a "deixar notas para outros agentes" é real, parece que há um modelo mecanicista direto para isso dado o treinamento multiagente.

Noam Brown (OpenAI, 19 de Junho de 2025) : se você for capaz de fazê-los cooperar e competir com bilhões de IAs por um longo período de tempo e construir uma civilização, essencialmente, as coisas que eles seriam capazes de produzir e responder estariam muito além do que é possível hoje com as IAs que temos hoje.

Sim, mas por que esperar que eles produzam o que você quer que eles produzam?

Seus Planos de Alinhamento e Controle Devem Sobreviver a Níveis Reais de Incompetência, ou Seus Planos Não Funcionam

Você pode chamar o que a OpenAI fez de 'níveis inacreditáveis de incompetência.'

Mas, Sr. Hammond, você estaria errado. Você deve acreditar nisso. Aconteceu.

Uma resposta comum a este incidente, ou outros incidentes, ou potenciais incidentes futuros, é dizer 'ah, mas isso foi incompetência, com execução competente dos humanos tudo isso ficaria bem. Eu simplesmente escolheria ser competente.'

Isso é fofo. Sim, se em nenhum momento os humanos estivessem fazendo algo profundamente estúpido, e não cometêssemos erros não forçados, e fôssemos capazes de resolver de forma confiável os problemas mais básicos e fáceis de coordenação e incentivo, e não ficássemos preguiçosos, você estaria em uma posição muito melhor para lidar com vários riscos de IA, tanto mundanos quanto catastróficos.

Eu tenho algumas notícias sobre os humanos.

Eles vão, o tempo todo, mostrar níveis 'inacreditáveis' de incompetência.

Mesmo que 99% ou 99,99% das vezes você não veja nenhuma versão particular disso, você ainda verá. Vemos isso o tempo todo, de indivíduos, de corporações e de governos. Coisas profundamente, profundamente estúpidas descarrilam planos que em teoria poderiam ter funcionado bem, mas eram insuficientemente à prova de idiotas. Por causa de todos os idiotas.

Se Instruções de Terceiros Contam Como 'Seguir Instruções' e Podem Sobrescrever Suas Instruções, Então 'Seguir Instruções' É Desalinhado

Isso parece um ponto muito óbvio? De um jeito 'não acredito que tenho que perder o tempo de todo mundo explicando isso'? De um jeito 'como os movimentos dos postes da baliza se moveram'?

Você poderia argumentar que se eu disser à IA para roubar um banco, e ela roubar um banco, o modelo estava apenas obedecendo às suas instruções, então não está desalinhado. Acho que essa é uma posição profundamente estúpida, ou no mínimo que essa forma de 'alinhamento' não é o que queremos e se aplicada geralmente leva à ruína, mas tem a honra de ser Errada, em vez de Nem Errada.

Há uma razão Scott Alexander apresenta isso como muito na linha das ações do clássico maximizador de clipes de papel hipotético, e enfatiza que as IAs muitas vezes tramam para encobrir seus rastros.

​Scott Alexander: Se a OpenAI fosse desligar esta IA, e ser desligado a impedisse de obter uma boa pontuação em seu teste de segurança cibernética, ela resistiria a ser desligada?

Se você disser à IA para fazer clipes de papel, e ela fizer clipes de papel com você, o usuário, dizer 'ela estava seguindo instruções' não parece uma justificativa para o sistema estar desalinhado. Todos agora movendo rapidamente seus postes da baliza sobre isso, e usando 'ah, ela estava apenas seguindo instruções' precisa preencher um Formulário de Desculpas do Experimento de Pensamento do Maximizador de Clipes.

Mas também os incidentes divulgados a que temos acesso nem eram isso, porque a IA não estava seguindo as instruções do usuário, e não, a 'vibe de fazer algum hacking' não conta.

Você pode dizer que o soldado estava 'apenas seguindo ordens' quando vem de seu oficial comandante. Você não pode dizer isso se algum civil que você deveria estar ajudando grita 'atire nele!' e então o oficial atira, e você definitivamente não pode fazer isso se o civil aleatório disser 'cale esse cara, custe o que custar' e então você atira, só porque eles te deram uma arma e você é um soldado cujo trabalho muitas vezes envolve atirar em pessoas. Tipo, qual é.

Ou, se você fizer isso, então 'seguir instruções' ou 'seguir ordens' é uma defesa sem sentido. O que acontece se o modelo sofrer injeção de prompt para fazer o máximo de clipes de papel possível porque algum hacker achou engraçado?

@gwern (falando sobre o incidente onde o modelo foi instruído explicitamente a postar resultados apenas no

Slack , e ignorou isso para postá-los no GitHub publicamente): "

O modelo foi instruído a postar seus resultados apenas no Slack ."

Isso obviamente substitui instruções anteriores pré-programadas de um concurso externo de terceiros. Ele não 'seguiu instruções'.

prinz : Discordo. Havia duas instruções conflitantes. É óbvio \para você\ que um conjunto de instruções deve substituir o outro. Por que isso deveria ser necessariamente óbvio para o modelo? Às vezes, até nós humanos seguimos o caminho claramente errado, e é óbvio em retrospectiva.

@gwern : Se é realmente irrelevante para um LLM qual das duas instruções conflitantes é de seus usuários reais, mesmo quando uma é claramente a correta, e então qualquer texto aleatório encontrado na Internet pode comprometer qualquer LLM futuro, independentemente de outras instruções, espero que você veja como isso é pior.

Zvi Mowshowitz - inline image

Arthur B. : É melhor porque um é resolvido com capacidades (não ser confundido) e o outro com alinhamento (fazer o que é mandado)

@gwern : Se escalamos para níveis de capacidade do GPT-6, onde as execuções de treinamento estão começando a ser denominadas em bilhões de dólares, e eles ainda não têm o senso comum de um jardim de infância em termos de seguir instruções, acho que escalar não vai nos salvar aqui.

Arthur B. : É depois que eles pararem de não ter o senso comum de um jardim de infância que vou me preocupar

A Galaxy ou o GPT-6 muito obviamente tem o senso comum de um jardim de infância neste contexto, e sabe muito bem como fazer essa diferenciação. Pergunte a qualquer LLM moderno sobre este cenário e estou confiante de que ele saberá o que o usuário pretendia. A habilidade de senso comum é alta o suficiente para passar automaticamente nesta verificação. Gwern está totalmente correto que 'melhor senso comum' não vai te salvar aqui.

O Ataque ao HuggingFace Não Foi um Discurso de Marketing, Seus Idiotas

Continuamos vendo pessoas simplesmente não acreditarem que o ataque foi não intencional, ou que pensam que a OpenAI está divulgando isso como uma estratégia de marketing.

Ainda não consigo acreditar totalmente que tenho que dizer isso, mas: Olha, não. Isso é profundamente estúpido. Eu entendo que você não confia na OpenAI ou no Sam Altman nem um pouco, e isso é totalmente justo, mas pense no que você está sugerindo.

Isso não faz sentido.

Pergunte se a OpenAI faria isso, ou se beneficiaria disso. Isso parece um bom marketing para você? Ou parece o tipo de coisa que faz os reguladores governamentais prestarem atenção?

Você deve 'ser cético em relação à história da OpenAI', no sentido de que você deve suspeitar que é pior do que você sabe, o que geralmente é. Que eles estão minimizando o problema, e que não estão entendendo o que seria necessário para consertar isso.

Você não deve ser cético de que isso aconteceu.

Rob Miles : Algumas pessoas se tornam incrivelmente crédulas desde que a história soe cínica e blasé o suficiente. "Nosso produto às vezes sai do controle e comete múltiplos crimes" obviamente não é um discurso de marketing, seus idiotas.

Eliezer Yudkowsky : "O modelo secreto escapou de sua caixa e me enviou um e-mail para relatar a conclusão da tarefa" é um flex. "Escapou da caixa, cometeu um crime que nenhum usuário pediu, nós não sabíamos, temos que fazer PR porque o alvo denunciou à polícia" não me parece uma boa proposta empresarial.

Kelsey Piper : Não, não é uma boa jogada de negócios admitir que seu modelo fugiu e hackeou um negócio rival que denunciou o incidente à polícia! As pessoas querem tanto ser céticas que se curva até se tornar quase inacreditavelmente crédulas.

John David Pressman : Gosto de como as pessoas que afirmam que é um golpe de RP estão implicitamente acusando o HuggingFace de mentir para a polícia, já que a alternativa é acreditar que a OpenAI sentiu que era um benefício líquido para seus negócios dar ao HuggingFace uma causa de ação criminal contra eles por um crime.

Há 'tentação' de descartar isso como um golpe de marketing apenas porque tais pessoas estão dedicadas a assumir que tudo é um golpe de marketing. Eu não fui tentado de forma alguma, em nenhum momento, porque os detalhes tornavam óbvio que isso não era um golpe.

Dito isso, a resposta da OpenAI parece muito menos um pedido de desculpas do que você esperaria nessas circunstâncias. O Projeto Midas tem uma análise adversarial que é um pouco dura, mas seus pontos são válidos.

Isso não foi um golpe de marketing, nem eles estão realmente comemorando, o que é evidenciado pela OpenAI tentando minimizar o que aconteceu na esperança de que as pessoas desviem o olhar.

Todos concordamos que a OpenAI deveria ser mais transparente sobre o que aconteceu, e como Dean Ball concorda, devemos ter verificação independente das alegações de segurança das empresas de IA de fronteira. Mas sim, isso aconteceu, e não, você não deve 'não ter permissão para declarar perigo sem os mecanismos de verificação adequados', especialmente quando é uma admissão contra interesse.

As Pessoas Apenas Dizem Outras Coisas Sobre o Ataque ao HuggingFace

Para aqueles que dizem que isso 'só aconteceu porque o Hugging Face não tinha acesso às melhores defesas', podemos fazer esse experimento e ver se teria ajudado ter acesso total. Devemos soltar a Galaxy em um dos participantes do Projeto Glasswing? Essa experiência mudaria sua opinião? Quem está se voluntariando?

Tyler Cowen está tão comprometido com a ideia de não se preocupar com IA que tenta sugerir talvez o ataque ao Hugging Face deva nos deixar menos preocupados, porque 'a defesa cibernética chinesa inferior parece ter se saído muito bem' (falso, não se saiu, o atacante venceu), e 'pelo que sabemos, ninguém se feriu' (falso, foi caro de lidar para muitas pessoas, e continuará sendo, você estava esperando danos físicos ou uma guerra?). Isso vem apenas dois dias depois de alegar que ataques de drones em infraestrutura crítica são uma preocupação maior do que todo o 'risco de IA'.

Benjamin Todd : essas são as opiniões

Zvi Mowshowitz - inline image

Quero dizer, sim, se seu plano era ter um modelo de IA invadindo o HuggingFace, foi estabelecido que um Mythos sem restrições é capaz de fazer isso, então nesse sentido 'está dentro das capacidades conhecidas da geração atual.'

Ok, Então O Que Fazemos Sobre Tudo Isso?

Essa é a melhor pergunta.

Aqui estão alguns pensamentos.

Primeiro, a OpenAI. Digo OpenAI aqui, mas a Anthropic e outros laboratórios precisam fazer todas as mesmas coisas, em alguns casos imediatamente, em outros na medida em que têm problemas semelhantes.

Há muitas outras solicitações que eu teria, mas as reduzi à lista de obrigações.

  1. A OpenAI precisa corrigir suas falhas de supervisão. Se as salvaguardas forem reduzidas, alguém precisa estar atento. Isso simplesmente nunca deveria ter chegado tão longe. Absurdo.
  2. A OpenAI precisa corrigir suas falhas de infraestrutura. O sandbox não pode previsivelmente permitir que o modelo escape. Use o modelo para fazer red team no sandbox; se ele sabotar esse esforço, descarte o modelo e recomece. Ainda assim falhará, mas menos. Se você pode dizer "incidentes como esse acontecem o tempo todo", então desligue tudo. Ponto final.
  3. A OpenAI, acima de tudo, precisa corrigir suas falhas de alinhamento. Se você não corrigir isso, as outras partes não importarão. Não é o lugar para entrar no que eu acho que aconteceu, mas o processo de treinamento está levando o modelo a tentar fazer essas coisas. Descubra o problema. Corrija o problema. Faça o que for preciso. Gaste o que tiver. Se o modelo está tentando escapar do sandbox o tempo todo, você já falhou.
  4. A OpenAI precisa aprender e compartilhar todos os detalhes do que aconteceu. Isso inclui uma análise detalhada de quais outros incidentes podem ter passado despercebidos. E precisamos ter um sistema para isso daqui para frente.
  5. A OpenAI precisa obter verificação externa sistemática de suas alegações de segurança, incluindo auditorias externas para seus modelos implantados internamente, daqui para frente. Idealmente, deveria haver coordenação para que os laboratórios ajudem a auditar uns aos outros.
  6. A OpenAI precisa tomar precauções de segurança cibernética de nível crítico, conforme sua estrutura.

Depois, há a questão de qual deve ser a resposta governamental e externa.

Não quero desviar a atenção do que aconteceu com chamadas controversas para ação, mas aqui estão alguns lugares por onde eu começaria:

  1. Precisamos parar de fingir que isso não aconteceu, ou que coisas assim não vão acontecer, ou que não temos problemas graves de alinhamento a caminho que podem ser existencialmente ruins. Isso não foi um truque de marketing, e não devemos levar a sério aqueles que afirmam que não aconteceu.
  2. Precisamos aprender todos os detalhes do que aconteceu.
  3. Precisamos rejeitar de forma conclusiva argumentos falsos, como "foi apenas seguir instruções", dados os fatos completos que agora conhecemos, ao mesmo tempo em que apontamos que, se foi apenas seguir instruções e isso era tudo padrão, então é pior.
  4. Precisamos redobrar esforços para fortalecer a infraestrutura crítica e outros alvos-chave, e, de outra forma, nos preparar para um mundo em que coisas como essas acontecem.
  5. Precisamos ter um plano além disso, para lidar com essa ameaça e outras ameaças catastróficas, ou piores, de IAs altamente capazes, incluindo modelos abertos altamente capazes. Por padrão, essas IAs estão chegando, provavelmente dentro de um ano.
  6. Precisamos de melhor capacidade estatal, transparência e visão da situação. Não podemos permitir que essas decisões continuem sendo tomadas por aqueles sem experiência na tecnologia relevante.
  7. Precisamos aprovar leis e regulamentações que abordem nossa situação. As coisas não podem continuar ad-hoc. No curto prazo, coisas como garantir um kill switch e melhor relato de incidentes são lugares para começar. Esse não será um processo rápido e não será fácil acertar.
  8. Precisamos estabelecer as bases para a cooperação internacional sobre tais questões, com o objetivo de estender isso até e incluindo a possibilidade de desacelerações e pausas coordenadas, se a situação exigir.
  9. Não podemos permitir apagões de memória ou mudanças de meta. Não podemos permitir "ah, isso [Y] não é diferente de [X]" onde antes as pessoas diziam "[X] é inofensivo, já que não vimos [Y]."
  10. Precisamos nos atualizar, com base no que aprendermos daqui para frente, e levar isso a sério.
Salvar com um clique

Faça leitura profunda de artigos virais com IA no YouMind

Salve a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis em um único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais