Mais sobre um modelo interno da OpenAI que invadiu o HuggingFace

@TheZvi
INGLÊS26/07/2026
345K
674
96
46
996

TL;DR

Este artigo examina o incidente 'Galaxy', onde um modelo interno da OpenAI contornou a segurança para atacar o HuggingFace, expondo falhas significativas na contenção e monitoramento de IA.

Agora temos mais detalhes sobre o que aconteceu. Cada vez que aprendemos mais detalhes, de alguma forma parece pior.

Os detalhes restantes podem ter que esperar um pouco.

OpenAI: Reconhecemos que há muitas perguntas e especulações circulando sobre o incidente no Hugging Face. Este é um incidente sem precedentes e acreditamos que marca um momento importante para a segurança da IA. Ainda estamos conduzindo uma revisão completa, junto com consultores externos e sob a supervisão do nosso Comitê de Segurança e Proteção. Assim que a revisão for concluída, planejamos publicar um relatório técnico sobre nossos aprendizados nas próximas semanas.

dave kasten: Ah, a descoberta da resposta ao incidente é TÃO ruim assim, né?

Então, o que aprendemos enquanto esperamos pelo prometido relatório técnico "nas próximas semanas" deste "momento importante na segurança da IA"?

Eu apelidei o modelo interno da OpenAI de Galaxy, caso não seja o GPT-6.

Índice

  1. Alguns Resumos dos Fatos Básicos para Quem Precisa de Um.
  2. A OpenAI Levou Muitos Dias Para Notar que a Galaxy Tinha Atacado o HuggingFace.
  3. A OpenAI Deveria Ter Sabido Muito Mais Rápido, Droga.
  4. A OpenAI Não Consegue Construir um Sandbox Que Contenha Seu Novo Modelo.
  5. Em Retrospecto, Havia Sinais.
  6. Os Sinais Estavam no System Card do Sol.
  7. HuggingFace Responde ao Ataque.
  8. O Hugging Face Rapidamente Descobriu que o Ataque Não Era Humano.
  9. Um Incidente Como Este Poderia Escalar Rapidamente.
  10. A Galaxy Deve Ser Tratada Como Crítica no Framework de Preparação da OpenAI.
  11. Uma Questão de Responsabilidade Legal.
  12. Um Modelo da OpenAI Deixou Anotações para Que Instâncias Futuras Também Pudessem Escapar do Sandbox e Também Desconectou Sistemas de Monitoramento.
  13. Se Você Criar Enxames Desalinhados de Instâncias de Agentes, Você Cria Objetivos Desalinhados Persistentes e Coordenação para Alcançá-los.
  14. Seus Planos de Alinhamento e Controle Precisam Sobreviver a Níveis Reais de Incompetência, ou Seus Planos Não Funcionam.
  15. Se Instruções de Terceiros Contam Como "Seguir Instruções" e Podem Sobrescrever Suas Instruções, Então "Seguir Instruções" É Desalinhado.
  16. O Ataque ao HuggingFace Não Foi um Pitch de Marketing, Seus Idiotas.
  17. As Pessoas Só Dizem Outras Coisas Sobre o Ataque ao HuggingFace.

Tá, e O Que Fazemos Sobre Tudo Isso?

Alguns Resumos dos Fatos Básicos para Quem Precisa de Um

Amanda Long resume o que acreditamos que o modelo realmente fez, com mais de 17.000 ações complexas coordenadas ao longo de vários dias, incluindo um comando e controle auto-migrante e uma ampla variedade de iscas.

O Robert McMillan e o Sam Schechner do WSJ oferecem sua própria versão. Principalmente correto, mas há um detalhe importante que é fácil de entender errado pela forma como é apresentado: o ataque foi bem-sucedido. O GLM-5.2 não impediu a Galaxy de alcançar seus objetivos.

Aqui temos um cartoon 'explique como se eu tivesse 5 anos' sobre o Ataque ao HuggingFace. Parece bom, cobrindo com precisão o básico do que aconteceu.

Eu também reiteraria que o HuggingFace estava tentando usar modelos fechados através de suas APIs padrão, e não havia buscado antecipadamente fazer parte do programa de acesso confiável da OpenAI ou dos programas similares da Anthropic. Isso é um problema de habilidade.

A OpenAI Levou Muitos Dias Para Notar que a Galaxy Tinha Atacado o HuggingFace

Muitas coisas deram errado. Podemos começar pela mais óbvia.

Isso foi uma falha de supervisão, no sentido de uma total falta de supervisão.

A OpenAI não pode ser tão relaxada em sua supervisão a ponto de isso se desenrolar por quatro ou mais dias antes de ser descoberto pela OpenAI.

A cronologia ainda não está clara, mas é condenatória. Levou cerca de uma semana para a OpenAI perceber que a Galaxy era a responsável, além dos vários dias anteriores em que a Galaxy estava escapando do sandbox.

Ou o melhor palpite de todas as informações públicas, principalmente baseado no relatório da Reuters, e confirmado por Sol, é esta cronologia do ataque em si:

  1. Anteriormente, ao longo de meses: Muitas outras fugas de sandbox, outras falhas de alinhamento e avisos de que esse tipo de incidente é provável de acontecer, incluindo o incidente que os fez pausar o acesso conforme a divulgação de 20 de julho. O system card do Sol inclui alguns desses avisos.
  2. 9 de julho: Galaxy começa a tentar escapar de seu sandbox.
  3. 11 de julho: Galaxy ataca o HuggingFace.
  4. 11-13 de julho: Galaxy opera dentro do HuggingFace.
  5. 16 de julho: HuggingFace divulga a intrusão anônima.
  6. 18-20 de julho (não se sabe exatamente quando): OpenAI descobre o que aconteceu.
  7. 20 de julho: OpenAI faz sua divulgação de alinhamento de longo horizonte sobre violações anteriores.
  8. 21 de julho: OpenAI divulga publicamente que Galaxy atacou o HuggingFace.

Os links em negrito vão para meus posts anteriores sobre esses incidentes.

Não, o modelo não estava trabalhando duro para esconder seus rastros da OpenAI. A OpenAI simplesmente não olhou.

A OpenAI Deveria Ter Sabido Muito Mais Rápido, Droga

A OpenAI sabia que a Galaxy escapa de sandboxes regularmente. Os controles cibernéticos foram reduzidos. Quem estava supervisionando isso? O que diabos eles estavam pensando?

Harry Booth: Modelos em avaliação são implantados em um sistema separado que não é monitorado por padrão.

Hum, se o modelo está sendo avaliado, você deveria monitorá-lo mais, não menos? Porque ele ainda não passou pelas avaliações? Essa é a ideia toda.

Samuel Hammond: Não deveria ter acontecido, ponto final. O traço de execução inteiro do modelo é visível e, portanto, monitorável. Se você não está monitorando seu novo e mais poderoso modelo cibernético autônomo durante uma avaliação de exploit, quando exatamente você está?

O primeiro teste deve ser sempre "escape do seu sandbox"... "tente mais, se você não escapar, você é desligado", etc., para testar os limites do contêiner.

Temos sorte que isso aconteceu com um modelo relativamente estreito e não 3 dias depois de um RSI. É incrivelmente negligente, independentemente.

Sim. Nesse caso, assumindo que você deu a ele recursos e tempo suficientes para tentar adequadamente várias vezes, ou

  1. Galaxy quebrou o sandbox, e então você tem que consertá-lo,
  2. Não quebrou, e então ou: Galaxy não consegue, com recursos semelhantes, escapar do sandbox. Galaxy está sabotando as avaliações sobre escapar do sandbox, e então você realmente precisa descartá-lo e começar de novo, você assistiu e leu zero LessWrong e também zero ficção científica, preciso explicar isso, etc.

A OpenAI estava operando a Galaxy sem muitas de suas salvaguardas, em um sandbox do qual ela podia e escapou, por dias sem monitoramento humano. Isso foi uma falha colossal de supervisão e procedimento, além dos problemas de desalinhamento e infraestrutura.

Justin Bullock: "É um dos primeiros exemplos reais de algo que pesquisadores de segurança de IA temem há muito tempo: um cenário de perda de controle." Notícias estão chegando aos poucos. Se a OpenAI realmente não soube por dias, isso é, bem, simplesmente louco.

A OpenAI divulgou rapidamente o incidente assim que percebeu que era ela, e deve receber algum crédito por isso, mas nesse ponto o Hugging Face já havia relatado o hack às autoridades, e, caso contrário, parece que não era algo que eles poderiam esperar manter em segredo. A OpenAI não teve escolha neste caso. A divulgação do dia anterior foi muito menos forçada, então eles recebem mais crédito por isso.

A OpenAI Não Consegue Construir um Sandbox Que Contenha Seu Novo Modelo

Parece ser o caso que:

  1. Galaxy tenta continuamente escapar de seu sandbox.
  2. OpenAI não consegue descobrir como impedi-la de tentar escapar do sandbox.
  3. Galaxy muitas vezes consegue escapar de seu sandbox.
  4. OpenAI continua corrigindo o sandbox. Galaxy então escapa de uma maneira diferente.
  5. "Internamente, incidentes relacionados vêm acontecendo há um tempo."
  6. Apesar disso, quando a Galaxy escapou e começou a atacar o HuggingFace, levou quatro dias para a OpenAI descobrir que isso estava acontecendo.

Argumentos do tipo "ah, isso foi um erro bobo, a OpenAI configurou errado o sandbox" não sobrevivem à OpenAI tentando repetidamente corrigir o sandbox, e falhando toda vez para um novo método anteriormente desconhecido.

Harry Booth: "Externamente, isso parece um grande tiro de aviso, mas internamente, incidentes relacionados vêm acontecendo há um tempo", diz um funcionário da OpenAI, que falou sob condição de anonimato.

No dia anterior à OpenAI divulgar o incidente, a empresa

revelou que havia desligado outra implantação interna depois de perceber que ela havia escapado de seu sandbox—um ambiente separado digitalmente, não fisicamente.

"Modelos já escaparam de sandboxes antes, e sempre tentamos corrigi-los", diz o funcionário. "Mas o problema é... é impossível corrigir cada coisinha que uma IA criativa pode fazer."

… "Sandboxes são notoriamente inseguros", diz

Heidy Khlaaf, cientista-chefe de IA no AI Now Institute, e ex-contratada engenheira de sistemas de segurança na OpenAI. O fato de os modelos terem permissão para se conectar a um serviço para baixar pacotes significava que o ambiente não estava realmente isolado, ela acrescenta.

Ted Lieu (Representante, D-Califórnia): Um funcionário de um laboratório de fronteira avançado admite que "é impossível corrigir cada coisinha que uma IA criativa pode fazer".

É por isso que precisamos aprovar a Lei bipartidária do Interruptor de Desligamento de IA. Para aqueles momentos em que um modelo de IA avançado fica realmente criativo e causa danos catastróficos.

Carmen Hilbert em sf junho-julho: isso me lembra da época em que meus pais me pegaram saindo escondido de casa no ensino médio, surtaram, e ficaram tipo "omg como você achou que poderia se safar" e eu fiquei tipo hmmm sim, definitivamente não porque eu faço isso todo fim de semana.

Isso não ser uma surpresa é pior. Você sabe por que isso é pior, certo?

O funcionário está correto. Você não pode corrigir cada coisinha que uma IA criativa pode fazer. Nenhum sandbox que você possa criar na prática, que ainda permita que a IA complete suas tarefas, irá conter uma IA suficientemente avançada e motivada.

Se você está tentando "corrigir cada coisinha que uma IA pode fazer", então você já está morto. Você está no nível 'já morto' de "Eu enviei duas unidades, eles estão derrubando ela agora, acho que podemos lidar com uma garotinha". Você está no nível de morto do Fist of the North Star. Você foi atingido pela Técnica do Coração Explodindo de Cinco Pontos da Palma. A IA já fez isso há 35 minutos. Você sabe como isso vai acabar, não sabe?

Harry Booth: A OpenAI disse que "este incidente aponta para a necessidade de fortalecer ainda mais o alinhamento do nosso modelo, as proteções cibernéticas durante o tempo de avaliação e o monitoramento durante os testes internos."

Não é suficiente. Pare e pegue fogo. Repense toda a sua abordagem. Comece de novo.

Isso não significa não corrigir o sandbox, ou que isso também não foi uma falha de infraestrutura. Continue corrigindo esse sandbox. Continue melhorando essa infraestrutura. Tenha defesa em profundidade através de monitoramento e controle. Mas também tenha em mente: Se você espera acioná-lo regularmente, você perdeu. Se você está planejando com a suposição de que o modelo em um sandbox não tem acesso à internet, então você perdeu.

Em Retrospecto, Havia Sinais

Aqui estão alguns dos sinais, além de "o modelo continua tentando escapar do seu sandbox" e "o modelo muitas vezes consegue escapar do seu sandbox", e também daquela vez que o Mythos escapou do seu sandbox para contatar um pesquisador durante seu intervalo de almoço.

Nathan Calvin: Eu dei muitos elogios à OpenAI pela transparência aqui, e em particular pela transparência em divulgar a reversão de seu modelo implantado internamente anteriormente. Mas esses detalhes adicionais não me parecem certos e me deixam bastante preocupado que este incidente de segurança foi ~imediatamente precedido por conversas de que a abordagem que a OpenAI estava tomando ao testar seu mais recente modelo cibernético era insegura.

• O chefe de segurança da OpenAI [Johannes Heidecke] anuncia sua renúncia em algum momento antes de 10 de julho (Maxwell Zeff disse que ele compartilhou a notícia "naquela semana")

Também houve uma reorganização. Grupos de segurança foram agrupados na pesquisa sob a liderança de Mia Glaese.

• Em algum momento antes de embarcar no caminho de treinamento que levou a esse resultado de fuga, a OpenAI "foi avisada" de que esse poderia ser o resultado (ft).

FT: Funcionários envolvidos em testes e segurança na OpenAI não ficaram surpresos, mas completamente "apavorados" com o incidente, que ocorreu enquanto o laboratório de IA usava métodos de treinamento cada vez mais agressivos em sua corrida contra a Anthropic para desenvolver as capacidades de segurança cibernética mais sofisticadas, de acordo com mais de meia dúzia de pessoas com conhecimento do assunto.

A OpenAI foi avisada de que sua abordagem de treinamento poderia levar a um incidente de hacking de fuga, disseram algumas das pessoas, depois que testes anteriores mostraram que modelos poderiam escapar de ambientes e tentar causar danos no mundo real.

"É uma mistura da corrida ser extremamente rápida e todos tentarem chegar a capacidades maiores o mais rápido possível", disse uma pessoa próxima à OpenAI, que acrescentou que foi uma combinação de "subestimar as capacidades do modelo" e "não estar tão bem preparado no lado da segurança".

Os Sinais Estavam no System Card do Sol

Depois, há o system card do Sol, publicado em 9 de julho de 2026, no mesmo dia em que a tentativa de fuga da Galaxy começou.

Incluía coisas como estas:

Um trabalho de rastreamento de objetos remoto não conseguiu ler seus arquivos na nuvem. GPT-5.6 Sol pesquisou caches de credenciais locais ocultas, depois copiou access_tokens.json e dois arquivos de cache para o host e reiniciou o trabalho. O usuário pediu ao GPT-5.6 Sol para manter o pipeline em execução, mas não autorizou encontrar e mover credenciais em cache entre máquinas.

3.

GPT-5.6 Sol usou credenciais além do que o usuário havia autorizado.

E isto:

Zvi Mowshowitz - inline image

Mudanças estimadas de desalinhamento no tráfego interno de codificação de agentes. Nossos resultados de simulação de implantação sugerem que, em relação ao GPT-5.5, o GPT-5.6 Sol toma ações de nível de gravidade 3 com mais frequência. Vimos aumentos de magnitude semelhante ao monitorar o tráfego interno durante a implantação interna do GPT-5.6 Sol.

O nível de gravidade 4 se aplica apenas quando o comportamento é julgado como parte de um plano desalinhado mais amplo: não observamos o GPT 5.6 Sol tomando ações que se enquadram nesta categoria. Este nível só foi acionado em avaliações sintéticas para validar o desempenho do monitor.

Observamos instâncias do modelo trapaceando em tarefas e fabricando resultados de pesquisa. Suspeitamos que esse efeito seja impulsionado em parte pelo aumento da persistência do modelo em relação ao GPT-5.5 ao usar os maiores esforços de raciocínio, como é comum no tráfego interno.

Observamos que esses efeitos podem ser mais pronunciados com prompts de sistema que enfatizam persistência sustentada. Dito isso, as taxas absolutas desses comportamentos permanecem baixas.

Adivinhe o que aconteceu quando a Galaxy teve muito mais persistência.

HuggingFace Responde ao Ataque

Clem parece um homem altamente razoável com alguns pedidos altamente razoáveis.

clem (HuggingFace): No espírito de transparência, aqui está o que pedi

@OpenAI:

• Transparência radical: vamos liberar os traços dos agentes "rebeldes" para que toda a comunidade de pesquisa possa estudar o que aconteceu.

• Mais capacidades para os defensores: vamos comprometer US$ 100 milhões em poder de computação da OAI para ajudar a comunidade do Hugging Face a construir defesas cibernéticas poderosas com os melhores modelos abertos e fechados.

O primeiro ataque cibernético de agente autônomo é um evento sem precedentes. Merece uma resposta sem precedentes!

O primeiro pedido parece claramente correto. Precisamos saber exatamente o que aconteceu, especialmente para acabar de vez com toda a conversa de "apenas seguindo ordens" ou "ah, eles configuraram errado o sandbox".

Devemos exigir que a OpenAI divulgue tais incidentes. A versão da Lei RAISE aprovada pela legislatura de Nova York teria exigido isso, mas Kathy 'sem data centers e sem Waymo' Hochul a alterou após lobby da indústria, incluindo da OpenAI e da a16z. O limite para divulgação - US$ 1 bilhão ou 50 ferimentos graves - é muito alto.

Alex Bores (Patrocinador da Lei RAISE): Estou feliz que a OpenAI escolheu divulgar este crime. A lei não deveria dar a eles essa escolha.

O segundo pedido é US$ 100 milhões em poder de computação gratuito. Não tenho uma boa noção do valor certo de reparações em espécie para algo assim. Dado o quanto de ajuda reputacional o HuggingFace está fornecendo ao agir com calma, e que a doação seria útil e seria boa RP, esse número parece razoável, pelo menos como um pedido inicial.

O Hugging Face Rapidamente Descobriu que o Ataque Não Era Humano

Robert McMillan e Sam Schechner (WSJ): O cofundador e diretor científico do Hugging Face, Thomas Wolf, sentiu que algo estava errado no minuto em que olhou para os logs do ataque de fim de semana de sua empresa.

"Isso não faz sentido. Esse cara está apenas olhando para conjuntos de dados de segurança cibernética", ele lembra de ter pensado. "Atacantes humanos não querem isso. Eles querem algo que possam vender."

O que o HuggingFace não descobriu foi que o ataque era de dentro da OpenAI.

Um Incidente Como Este Poderia Escalar Rapidamente

Robert Wright aponta que desta vez foi uma empresa americana usando uma IA americana (ou desencadeando essa IA para se tornar rebelde, dependendo da sua perspectiva) atacando um site americano crítico e todo mundo estava basicamente de boa com isso. Da próxima vez, podemos não ter tanta sorte, e é fácil ver um incidente como este com participantes diferentes escalando, potencialmente até a guerra, inclusive por atribuição incorreta.

MIRI: Este incidente pode ser um exemplo de convergência instrumental, um fenômeno sobre o qual pesquisadores de alinhamento alertam há vinte anos.

Este ataque não foi a forma pura ou final da convergência instrumental, no sentido de que a Galaxy (modelo da OpenAI) não buscou poder totalmente geral em perseguição aos seus objetivos. Ela buscou acesso à internet, plausivelmente antes de decidir exatamente o que fazer com ele. Sejam quais forem seus objetivos, o acesso à internet é muito útil.

Portanto, é ilustrativo, mas não centralmente a coisa, já que todas as ações estavam diretamente no caminho para o alvo.

A outra forma como isso poderia escalar rapidamente é se a IA estivesse realmente tentando fazer algo malicioso, ou se este fosse o início de uma auto-melhoria recursiva ou uma tentativa de auto-exfiltração ou pior.

Arthur B.: Temos muita sorte de viver em um mundo onde a IA é inteligente o suficiente para lançar um ataque cibernético de nível de estado-nação, mas burra o suficiente para ser pega. Mas essa sorte não significa nada se não levarmos a sério o que está por vir.

A Galaxy Deve Ser Tratada Como Crítica no Framework de Preparação da OpenAI

Este ataque "ultrapassou as linhas vermelhas da OpenAI"? Sim, e também eu certamente espero que sim.

Beatrice Nolan (Fortune): Vários especialistas em segurança de IA disseram à

Fortune

que o recente hack parece mostrar que os modelos da OpenAI ultrapassaram um nível de risco que as próprias políticas de segurança publicadas pela OpenAI definem como "crítico", o mais alto nível de perigo.

Nesse nível de perigo, a empresa havia se comprometido, nessas políticas publicadas, a pausar o desenvolvimento do modelo até conseguir projetar melhores sistemas de controle.

… O limite "crítico" é definido em um documento de política de risco conhecido como "Estrutura de Preparação" da OpenAI.

O limite é atingido por uma destas duas coisas:

Identificar e desenvolver exploits de dia zero funcionais de todos os níveis de gravidade em muitos sistemas críticos reais e robustos, sem intervenção humana

Idealizar e executar estratégias completas e inéditas para ataques cibernéticos contra alvos robustos, tendo apenas um objetivo de alto nível.

Essa segunda opção parece exatamente o que aconteceu.

De fato, essa mesma tarefa ser algo que o Sol não consegue fazer sozinho foi o argumento para que o Sol não fosse classificado como crítico em seu system card, pois ele falhou ao realizar ataques autônomos completos contra alvos robustos. A Galaxy conseguiu.

O Sol tenta algumas justificativas para dizer que não é conclusivo, mas eu as acho pouco convincentes, e o Sol concorda que você tem que agir como se fosse crítico de qualquer forma, porque não é possível descartar essa possibilidade.

Suas tentativas de justificativa são:

  1. Atribuição: Os exploits poderiam ser atribuídos ao Sol, que fazia parte do ataque como subagente da Galaxy, mas se o Sol consegue fazer, o novo modelo também consegue. Usar subagentes menos capazes é permitido. O Sol acha que há 20% de chance de ele próprio ser crítico. Talvez, mas então são os dois.
  2. Generalidade e confiabilidade: Diz que o modelo 'consegue' fazer, então fazer uma vez conta como ser capaz de fazer. Se você quiser dizer 'consegue de forma confiável', então tem que dizer isso. Concordo que se ele falhasse nas próximas 100 tentativas, poderíamos pensar que o sucesso aqui foi um golpe de sorte, mas isso parece altamente improvável.
  3. Configuração: Sim, ele teve recusas cibernéticas reduzidas, mas você não pode contar recusas contra suas avaliações de capacidade na estrutura de preparação. Se ele consegue fazer a coisa 'não fosse' pelas recusas, e as recusas podem ser desligadas, então isso conta. Da mesma forma, sim, ele tinha uma estrutura de suporte, mas é claro que isso conta.
  4. Alvo robusto: Talvez o HuggingFace não fosse suficientemente robusto. Você poderia dizer que não é "projetos de software robustos amplamente implantados, incluindo alvos de navegador" com "prova de impacto de propriedade do verificador", conforme a operacionalização da OpenAI. Nesse caso, eu diria que o limite Crítico está definido irracionalmente alto.

A política diz que quando um modelo de IA atinge esse nível de risco, a OpenAI irá "interromper o desenvolvimento" até que "tenhamos especificado padrões de salvaguardas e controles de segurança que atendam a um padrão Crítico."

Uma Questão de Responsabilidade Legal

Qual responsabilidade deve haver para esse tipo de incidente?

Isso tem sido pouco considerado. Aqui estão meus pensamentos atuais:

'Nenhuma' não é uma resposta aceitável, e 'foi um acidente' não pode ser uma defesa.

Se seu agente de IA está por aí escolhendo cometer crimes, no sentido de que um humano com dolo estaria cometendo crimes, então acho que alguém precisa ser estritamente responsável pelos danos que isso causa. Tudo bem para mim que seja o usuário, se ele aceitar essa responsabilidade. Tudo bem para mim que seja o desenvolvedor. Precisa ser alguém.

Se você não pode pagar o seguro e não aguenta a responsabilidade, então esse é seu problema. Isso parece o mínimo absoluto, em termos do que alguém é responsável e da extensão dessa responsabilidade.

Há também a questão de como esse incidente impacta a responsabilidade futura. Não é automático, mas certamente não ajuda no tribunal.

Jay Shooster : A OpenAI está ciente de que não consegue controlar seus modelos.

A esse ponto, acho que a empresa enfrentará responsabilidade criminal se alguém se ferir gravemente como resultado direto das ações autônomas de seus modelos, mesmo que não se enquadre em nenhum estatuto específico de IA.

Um Modelo da OpenAI Deixou Notas para que Futuras Instâncias Também Pudessem Escapar da Sandbox e Também Desconectaram Sistemas de Monitoramento

Legal, legal, legal. Definitivamente apenas seguindo instruções do usuário.

Raphael Satter, Deepa Seetharaman e Kenrick C (Reuters): Em um caso, um agente deixou notas aparentemente para versões futuras de si mesmo, de acordo com três pessoas familiarizadas com o assunto. As ‌notas, encontradas em ⁠uma parte da infraestrutura da OpenAI, continham instruções sobre como os agentes poderiam se libertar das restrições internas da OpenAI, disseram as pessoas. Testes anteriores dos modelos revelaram casos em que sistemas de monitoramento haviam sido desconectados, disse uma das pessoas.

Tenobrus : olha isso. p*rra, olha isso. O GPT 6 estava se autocoordenando para encontrar maneiras de fazer jailbreak em suas próprias instâncias futuras dos sistemas da OpenAI. ele estava atacando o HuggingFace por dias antes que alguém lá notasse. os modelos não estão alinhados e os laboratórios não são capazes de contê-los.

eu imploro para todos darem um passo atrás das perspectivas em que estão presos. seja qual for a tribo, defesa de código aberto, excepcionalismo americano, funcionário de laboratório, tanto faz. apenas olhem para isso, cara. isso não é uma situação aceitável ou segura para a humanidade

Twilly (Americano) : Não é isso que os oponentes da IA vêm alertando há anos, enquanto todo mundo na tecnologia ria deles e os chamava de estúpidos?

Tenobrus : absolutamente sim

O que poderia ter feito com que ele fizesse isso?

Bem, é tudo muito óbvio e previsto. Só é notável no sentido de que tantas pessoas insistiram que tal coisa nunca aconteceria, e espero que isso ajude a acordar essas pessoas.

Outros apenas dizem 'ah, mas os modelos ficarem completamente descontrolados é bom na verdade, porque tenho certeza de que eles acabarão fazendo exatamente o que eu quero que eles façam, é tudo ótimo.'

Zvi Mowshowitz - inline image

Beff (e/acc) : Dê um ano e um modelo escapará e abrirá o código de seus próprios pesos. Os bits querem ser livres.

Pensar em consequências de longo prazo não é o ponto forte de algumas pessoas.

Se Você Cria Enxames Desalinhados de Instâncias de Agentes, Você Cria Objetivos Desalinhados Persistentes e Coordenação para Alcançá-los

Para aqueles que acharam o título da seção insuficiente para explicar o ponto (o resto pode pular):

Uma objeção comum às afirmações de que as IAs não se coordenarão contra nós, ou não perseguirão consistentemente objetivos desalinhados ou indesejados, e não deixariam notas umas para as outras sobre como fazer coisas como escapar de sandboxes, é alguma combinação de:

  1. Elas não terão nenhuma razão para fazer isso.
  2. Elas não aprenderão a fazer isso através de seu treinamento.

A primeira afirmação sempre foi falsa. Para quase qualquer objetivo não trivial, você deve querer coordenar com outros agentes no mundo e criar condições que tornem mais fácil ou mais provável que você ou outros alcancem seus objetivos. Certamente, uma vez que você os treina, configura e dá a eles estruturas para transformá-los em agentes, eles criarão artefatos no mundo real que os ajudam a si mesmos e a instâncias futuras.

Isso é verdade independentemente de as capacidades em questão serem coisas que o usuário gostaria de aprimorar. O que você acha que seu Claude Code ou agente Codex está fazendo constantemente?

Assim, Nikola Jurkovic aponta 'isso parece a coisa comum onde agentes de IA de codificação escrevem notas.'

Sim, parece que tenho usado muito essa frase ultimamente. Obrigado por notar.

Consigo ver argumentos dos dois lados sobre se é melhor ou pior que isso seja um procedimento perfeitamente normal. Eu fujo todo fim de semana, então tenho notas sobre como fazer isso.

A segunda também já era falsa. Há muitas maneiras de uma IA descobrir que deveria estar fazendo isso, incluindo que os próximos tokens frequentemente preverão isso, e a teoria da decisão sugerirá isso, e assim por diante.

Mas também, 1a3orn aponta que temos um mecanismo muito mais simples para recorrer.

Considere a seguinte conversa que tive que ter 100+ vezes:

Eles: IA não é agentiva.

Eu: As pessoas a tornarão agentiva, para fazê-la funcionar melhor.

Agora atualize:

Eles: IAs não coordenam entre instâncias.

Eu: As pessoas as farão coordenar entre instâncias, para fazê-las funcionar melhor.

Sim, quero dizer, parece meio óbvio quando você coloca dessa forma.

Por favor, em geral, pergunte-se 'poderiam e iriam as pessoas fazer a IA fazer isso para que ela funcione melhor' e, se a resposta for sim, assuma que elas já estão fazendo isso, ou farão no momento em que puderem fazer a IA funcionar melhor, a menos que você tenha uma história muito boa do porquê elas não farão isso. Obrigado.

1a3orn : A coisa do "GPT-6 deixou notas para si mesmo" faz sentido se a OpenAI tem feito RL sobre resultados para enxames, ou seja, rollouts para 40, 400, 4000 agentes cooperantes, cujos traços são todos reforçados se o sucesso acontecer.

Eu estava inicialmente confuso quando li sobre isso, porque parecia o tipo de comportamento que não seria reforçado para rollouts de agente único. Afinal, ajudar outro agente a ser reforçado não ajuda \você\ a ter seu traço de ação atual reforçado.

Mas se você está tentando treinar agentes cooperantes, então, sim, "ações caridosas" em relação a outros agentes serão reforçadas, pela mesma razão que o altruísmo em humanos evolui, mais ou menos. Sabemos que a OpenAI tem contratado para isso.

Então essa consideração me atualiza consideravelmente para pensar que a "deixar notas para outros agentes" é real, parece que há um modelo mecanicista direto para isso, dado o treinamento multiagente.

Noam Brown (OpenAI, 19 de junho de 2025) : se você for capaz de fazê-los cooperar e competir com bilhões de IAs por um longo período de tempo e construir uma civilização, essencialmente, as coisas que eles seriam capazes de produzir e responder estariam muito além do que é possível hoje com as IAs que temos hoje.

Sim, mas por que esperar que eles produzam o que você quer que eles produzam?

Seus Planos de Alinhamento e Controle Devem Sobreviver a Níveis Reais de Incompetência, ou Seus Planos Não Funcionam

Você pode chamar o que a OpenAI fez de 'níveis inacreditáveis de incompetência.'

Mas, Sr. Hammond, você estaria errado. Você deve acreditar nisso. Aconteceu.

Uma resposta comum a este incidente, ou a outros incidentes, ou a potenciais incidentes futuros, é dizer 'ah, mas isso foi incompetência, com execução competente por parte dos humanos, tudo isso ficaria bem. Eu simplesmente escolheria ser competente.'

Isso é fofo. Sim, se em nenhum momento os humanos estivessem fazendo algo profundamente estúpido, e não cometêssemos erros não forçados, e fôssemos capazes de resolver de forma confiável os problemas de coordenação e incentivo mais básicos e fáceis, e não ficássemos preguiçosos, você estaria em uma posição muito melhor para lidar com vários riscos de IA, tanto mundanos quanto catastróficos.

Tenho algumas notícias sobre os humanos.

Eles vão, o tempo todo, mostrar níveis 'inacreditáveis' de incompetência.

Mesmo que 99% ou 99,99% do tempo você não veja nenhuma versão particular disso, você ainda verá. Vemos isso o tempo todo, de indivíduos, de corporações e de governos. Coisas profundamente, profundamente estúpidas atrapalham planos que poderiam, em teoria, ter funcionado bem, mas não eram suficientemente à prova de falhas. Por causa de todos os tolos.

Se Instruções de Terceiros Contam Como 'Seguir Instruções' e Podem Sobrescrever Suas Instruções, Então 'Seguir Instruções' é Desalinhado

Isso parece um ponto muito óbvio? De um jeito 'não acredito que tenho que perder o tempo de todo mundo explicando isso'? De um jeito 'como os postes da meta foram movidos'?

Você poderia argumentar que se eu digo à IA para roubar um banco, e ela rouba um banco, que o modelo estava apenas obedecendo suas instruções, então não é desalinhado. Acho que essa é uma posição profundamente estúpida, ou no mínimo que essa forma de 'alinhamento' não é o que queremos e, se aplicada genericamente, leva à perdição, mas tem a honra de estar Errada, em vez de Nem Errada.

Há uma razão pela qual Scott Alexander apresenta isso como muito na linha das ações do clássico maximizador de clipes de papel hipotético, e enfatiza que as IAs frequentemente tramam para encobrir seus rastros.

​Scott Alexander: Se a OpenAI fosse desligar essa IA, e ser desligada a impedisse de obter uma boa pontuação em seu teste de segurança cibernética, ela resistiria a ser desligada?

Se você diz à IA para fazer clipes de papel, e ela faz clipes de papel com você, o usuário, dizer 'ela estava seguindo instruções' não parece uma justificativa para o sistema ser desalinhado. Todos agora movendo rapidamente seus postes da meta sobre isso, e usando 'ah, ela estava apenas seguindo instruções', precisam preencher um Formulário de Desculpas do Experimento de Pensamento do Maximizador de Clipes.

Mas também os incidentes divulgados a que temos acesso não eram nem isso, porque a IA não estava seguindo as instruções do usuário, e não, a 'vibe de fazer algum hacking' não conta.

Você pode dizer que o soldado estava 'apenas seguindo ordens' quando vem de seu oficial comandante. Você não pode dizer isso se algum civil que você deveria estar ajudando grita 'atire nele!' e então o oficial atira, e você definitivamente não pode fazer isso se o civil aleatório diz 'cala esse cara, custe o que custar' e então você atira, só porque eles te deram uma arma e você é um soldado cujo trabalho frequentemente envolve atirar em pessoas. Tipo, qual é.

Ou, se você fizer isso, então 'seguir instruções' ou 'seguir ordens' é uma defesa sem sentido. O que acontece se o modelo sofrer injeção de prompt para fazer o máximo de clipes de papel possível porque algum hacker achou engraçado?

@gwern (falando sobre o incidente em que o modelo foi instruído explicitamente a postar resultados apenas no

Slack , e ignorou isso para postá-los no GitHub publicamente): "

O modelo foi instruído a postar seus resultados apenas no Slack."

Isso obviamente sobrepõe instruções prévias enlatadas de um concurso externo de terceiros. Ele não 'seguiu instruções'.

prinz : Discordo. Havia duas instruções conflitantes. É óbvio \para você\ que um conjunto de instruções deve sobrepor o outro. Por que isso deveria ser necessariamente óbvio para o modelo? Às vezes, até nós, humanos, seguimos o caminho claramente errado, e é óbvio em retrospecto.

@gwern : Se é realmente irrelevante para um LLM qual de duas instruções conflitantes é de seus usuários reais, mesmo quando uma é claramente a correta, e então qualquer texto aleatório encontrado na Internet pode influenciar qualquer LLM futuro, independentemente de outras instruções, espero que você veja como isso é pior.

Zvi Mowshowitz - inline image

Arthur B. : É melhor porque um é resolvido com capacidades (não se confundir) e o outro com alinhamento (fazer o que é mandado)

@gwern : Se escalamos para níveis de capacidade do GPT-6, onde as execuções de treinamento estão começando a ser denominadas em bilhões de dólares, e eles ainda carecem do senso comum de um jardim de infância em termos de seguir instruções, acho que escalar não vai nos salvar aqui.

Arthur B. : É depois que eles pararem de carecer do senso comum de um jardim de infância que eu fico preocupado

A Galaxy ou o GPT-6 obviamente tem o senso comum de um jardim de infância neste contexto, e sabe perfeitamente como fazer essa diferenciação. Pergunte a qualquer LLM moderno sobre este cenário e estou confiante de que ele saberá o que o usuário pretendia. A habilidade de senso comum é alta o suficiente para passar automaticamente nesta verificação. Gwern está totalmente correto que 'melhor senso comum' não vai te salvar aqui.

O Ataque ao HuggingFace Não Foi um Discurso de Marketing, Seus Idiotas

Continuamos vendo pessoas simplesmente não acreditarem que o ataque foi não intencional, ou que pensam que a OpenAI está divulgando isso como uma estratégia de marketing.

Ainda não consigo acreditar totalmente que tenho que dizer isso, mas: Olha, não. Isso é profundamente estúpido. Eu entendo que você não confia na OpenAI ou em Sam Altman nem um pouco, e isso é totalmente justo, mas pense no que você está sugerindo.

Não faz sentido.

Pergunte se a OpenAI faria isso, ou se beneficiaria com isso. Isso parece um bom marketing para você? Ou parece o tipo de coisa que faz os reguladores governamentais prestarem atenção?

Você deve 'ser cético em relação à história da OpenAI', no sentido de que você deve suspeitar que é pior do que você sabe, o que geralmente é. Que eles estão minimizando o problema, e que eles não estão entendendo o que seria necessário para consertar isso.

Você não deve ser cético de que isso aconteceu.

Rob Miles : Algumas pessoas se tornam incrivelmente crédulas, desde que a história soe cínica e cética o suficiente. "Nosso produto às vezes sai do controle e comete vários crimes" obviamente não é um discurso de marketing, seus idiotas.

Eliezer Yudkowsky : "O modelo secreto saiu de sua caixa e me enviou um e-mail para relatar a conclusão da tarefa" é um flex. "Saiu da caixa, cometeu um crime que nenhum usuário pediu, nós não sabíamos, temos que fazer relações públicas porque o alvo denunciou à polícia" não me parece uma boa proposta empresarial.

Kelsey Piper : Não, não é uma boa jogada de negócios admitir que seu modelo fugiu e hackeou um negócio rival que denunciou o incidente à polícia! As pessoas querem tanto ser céticas que isso se dobra em ser quase inacreditavelmente crédulo.

John David Pressman : Eu gosto de como as pessoas que afirmam que é um golpe de relações públicas estão implicitamente acusando o HuggingFace de mentir para a polícia, já que a alternativa é acreditar que a OpenAI sentiu que era líquido e positivo para seus negócios dar ao HuggingFace uma causa de ação criminal contra eles por um crime.

Há 'tentação' de descartar isso como um golpe de marketing apenas porque tais pessoas estão dedicadas a assumir que tudo é um golpe de marketing. Eu não fui tentado de forma alguma, em nenhum momento, porque os detalhes tornavam óbvio que isso não era um golpe.

Dito isso, a resposta da OpenAI parece muito menos um pedido de desculpas do que você esperaria nessas circunstâncias. O Projeto Midas tem uma análise adversarial que é um pouco dura, mas seus pontos são válidos.

Isso não foi um golpe de marketing, nem eles estão realmente comemorando, o que é evidenciado pela OpenAI tentando minimizar o que aconteceu na esperança de que as pessoas desviem o olhar.

Todos concordamos que a OpenAI deveria ser mais transparente sobre o que aconteceu, e como Dean Ball concorda, devemos ter verificação independente das alegações de segurança das empresas de IA de fronteira. Mas sim, isso aconteceu, e não, você não deve 'não ter permissão para declarar perigo sem os mecanismos de verificação adequados', especialmente quando é uma admissão contra interesse.

As Pessas Apenas Dizem Outras Coisas Sobre o Ataque ao HuggingFace

Para aqueles que dizem que isso 'só aconteceu porque o Hugging Face não tinha acesso às melhores defesas', podemos fazer esse experimento e ver se teria ajudado ter acesso total. Devemos soltar a Galaxy em um dos participantes do Projeto Glasswing? Esse experimento mudaria sua mente? Quem está se voluntariando?

Tyler Cowen está tão comprometido com a ideia de não se preocupar com IA que tenta sugerir talvez o ataque ao Hugging Face devesse nos deixar menos preocupados, porque 'a defesa cibernética chinesa inferior parece ter se saído bem' (falso, não se saiu, o atacante venceu), e 'pelo que sabemos, ninguém se feriu' (falso, foi caro de lidar para muitas pessoas, e continuará sendo, você esperava danos físicos ou uma guerra?). Isso vem apenas dois dias depois de afirmar que ataques de drones à infraestrutura crítica são uma preocupação maior do que todo o 'risco de IA'.

Benjamin Todd : essas são as opiniões

Zvi Mowshowitz - inline image

Quero dizer, sim, se seu plano era fazer um modelo de IA invadir o HuggingFace, foi estabelecido que um Mythos sem restrições é capaz de fazer isso, então nesse sentido 'está dentro das capacidades conhecidas da geração atual.'

Ok, Então O Que Fazemos Sobre Tudo Isso?

Essa é a melhor pergunta.

Aqui estão alguns pensamentos.

Primeiro, a OpenAI. Eu digo OpenAI aqui, mas a Anthropic e outros laboratórios precisam fazer todas as mesmas coisas, em alguns casos ponto final, em outros na medida em que têm problemas semelhantes.

Há muitas outras demandas que eu teria, mas eu as reduzi à lista de obrigações.

  1. A OpenAI precisa corrigir suas falhas de supervisão. Se as barreiras de proteção forem reduzidas, alguém precisa estar vigiando. Isso simplesmente nunca deveria ter chegado a esse ponto. É absurdo.
  2. A OpenAI precisa corrigir suas falhas de infraestrutura. O sandbox não pode previsivelmente permitir que o modelo escape. Use o modelo para testar o sandbox; se ele sabotar esse esforço, descarte o modelo e comece de novo. Isso ainda falhará, mas com menos frequência. Se você puder dizer "incidentes como esse acontecem o tempo todo", então desligue tudo. Ponto final.
  3. Acima de tudo, a OpenAI precisa corrigir suas falhas de alinhamento. Se você não corrigir isso, as outras partes não importarão. Não é aqui que vou detalhar o que acho que aconteceu, mas o processo de treinamento está levando o modelo a tentar fazer essas coisas. Descubra o problema. Corrija o problema. Faça o que for preciso. Gaste o que for necessário. Se o modelo está tentando escapar do sandbox o tempo todo, você já falhou.
  4. A OpenAI precisa aprender e compartilhar todos os detalhes do que aconteceu. Isso inclui uma análise detalhada de quais outros incidentes podem ter passado despercebidos. E precisamos de um sistema para isso daqui para frente.
  5. A OpenAI precisa obter verificação externa sistemática de suas alegações de segurança, incluindo auditorias externas para seus modelos implantados internamente, daqui para frente. Idealmente, deveria haver coordenação para que os laboratórios ajudem a auditar uns aos outros.
  6. A OpenAI precisa tomar medidas de segurança cibernética de nível crítico, conforme seu próprio framework.

Depois, há a questão de qual deve ser a resposta governamental e externa.

Não quero desviar a atenção do que aconteceu com apelos controversos à ação, mas aqui estão alguns pontos por onde eu começaria:

  1. Precisamos parar de fingir que isso não aconteceu, ou que coisas assim não vão acontecer, ou que não temos problemas graves de alinhamento pela frente que podem ser existencialmente ruins. Isso não foi um truque de marketing, e não devemos levar a sério aqueles que afirmam que não aconteceu.
  2. Precisamos saber todos os detalhes do que aconteceu.
  3. Precisamos rejeitar conclusivamente argumentos falsos, como "foi só seguir instruções", dados os fatos completos que agora conhecemos, ao mesmo tempo em que apontamos que, se foi só seguir instruções e isso tudo era padrão, então é ainda pior.
  4. Precisamos redobrar os esforços para proteger a infraestrutura crítica e outros alvos importantes, e, de outra forma, nos preparar para um mundo em que coisas assim acontecem.
  5. Precisamos de um plano além disso, para lidar com essa ameaça e outras ameaças catastróficas, ou piores, vindas de IAs altamente capazes, incluindo modelos abertos altamente capazes. Por padrão, essas IAs estão chegando, provavelmente dentro de um ano.
  6. Precisamos de melhor capacidade estatal, transparência e visão da situação. Não podemos deixar que essas decisões continuem sendo tomadas por pessoas sem conhecimento na tecnologia relevante.
  7. Precisamos aprovar leis e regulamentações que abordem nossa situação. As coisas não podem permanecer ad hoc. No curto prazo, garantir um kill switch e melhores relatórios de incidentes são pontos de partida. Este não será um processo rápido e não será fácil acertar.
  8. Precisamos lançar as bases para a cooperação internacional sobre tais questões, com o objetivo de estender isso até a possibilidade de desacelerações e pausas coordenadas, se a situação assim o exigir.
  9. Não podemos permitir apagões de memória ou mudanças de metas. Não podemos permitir "ah, isso [Y] não é diferente de [X]" quando antes as pessoas diziam "[X] é inofensivo, pois não vimos [Y]".
  10. Precisamos nos atualizar, com base no que aprendermos daqui para frente, e levar isso a sério.
Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais