Novo modelo de IA resolve Prêmio do Milênio

@TheZvi
INGLÊS13 de set. de 2026
135K
199
17
16
237

TL;DR

O novo modelo da OpenAI resolveu o Prêmio do Milênio das equações de Navier-Stokes, desencadeando debates sobre atribuição de crédito, privacidade de dados e o ritmo alarmante da aceleração da pesquisa impulsionada pela IA.

O primeiro Prêmio Millennium, Navier-Stokes, caiu para a IA.

Uma situação profundamente infeliz surgiu envolvendo o que deveria ter sido uma combinação de uma história positiva sobre novos progressos na pesquisa matemática assistida por IA e mais uma oportunidade de entrar em pânico com o rápido avanço da IA.

Ou, como chamamos aqui, terça-feira.

A Verdadeira História É O Novo Modelo Que É Melhor Que O Astra

Mantenham os olhos no prêmio. Há três histórias aqui.

A primeira história é muito mais importante que a segunda, que por sua vez é muito mais importante que a terceira.

  1. O próximo modelo da OpenAI levou uma semana para ficar uma geração à frente do Astra, e eles estão nos contando isso porque todo mundo está totalmente apavorado com o que está acontecendo. Ou, em linguagem oficial: ‘Acreditamos que é importante informar o mundo sobre o ritmo do progresso da IA e o que esperar dos modelos futuros’ e que nós ‘podemos exigir escolhas mais deliberadas sobre o ritmo do progresso.’
  2. Esta nova IA resolveu Navier-Stokes oito dias após iniciar o treinamento.
  3. Uma série de dramas sobre quem recebe o crédito pela matemática envolvendo Navier-Stokes.

Jeffrey Ladish : Não investiguei o drama humano em torno do problema de Navier–Stokes, mas me deem um minuto porque CARALHO A IA ACABOU DE RESOLVER UM PROBLEMA MILLENNIUM.

Não posso enfatizar suficientemente a principal história.

Vou contar as três histórias, mas novamente: Olhos no prêmio.

Preparando o Cenário

A história desta terça-feira específica começa pela manhã.

Tristan Buckmaster e Levent Alpoge trabalharam durante um ano e nos oferecem uma série de resultados notáveis: Blowup em tempo finito com forcing suave para meios porosos incompressíveis, para Boussinesq, e para Euler incompressível 3D. Eles também acreditam ter um blowup para Navier-Stokes hipodissipativo, mas a verificação Lean desse resultado não está concluída.

Tristan Buckmaster: O programa no qual isso se encaixa não foi iniciado por nós nem proposto por um Grande Modelo de Linguagem. O crédito pela ideia básica deste programa vai para Diego Cordoba e Luis Martınez-Zoroa, que há vários anos vêm explorando a construção de blowups forçados. Tomamos o trabalho deles como ponto de partida, usando Grandes Modelos de Linguagem para levar seu programa até a conclusão.

Concretamente, o que Levent e eu fizemos foi pegar o programa de Cordoba e Martınez-Zoroa, que alcançou resultados de blowup com forcing bruto, e, com grande ajuda dos LLMs, levá-lo ao forcing suave e às equações de Euler incompressíveis. As ideias que tornam essa linha de ataque possível são devidas a Cordoba e Martınez-Zoroa. Deixe-me ser claro sobre o que disse a colegas em particular: diante deste corpo de trabalho, acredito que Luis Martınez-Zoroa merece uma Medalha Fields.

Até agora, isso é ótimo. Como ele observa, exige repensar como toda a matemática avançada funcionará daqui para frente. Terence Tao oferece comentários sobre os resultados subjacentes.

A parte que não é tão boa é onde eles se sentiram obrigados a publicar cedo, sem a oportunidade de gastar as semanas necessárias para tornar as provas aquilo que passa entre matemáticos como legível. Buckmaster pede desculpas abertamente pelo aspecto dos relatórios, comparando especialmente o texto sobre Euler a lixo gerado por IA.

O que aconteceu?

Ouvi Um Rumor

Em 1º de setembro, a OpenAI ouviu um rumor (falso) de que dois Problemas Millennium haviam sido resolvidos. Em resposta à possibilidade de outra pessoa tornar o mundo um lugar melhor, a OpenAI gastou milhões de dólares em inferência para explorar todos os Problemas Millennium não resolvidos, usando um modelo interno mais forte que o Astra, e decifrou todo o Navier-Stokes em 88 horas, mais outras 17 para o Astra fazer a formalização e verificação Lean.

Você pode ver isso como ‘a OpenAI ficou curiosa para ver o que seu novo bebê poderia fazer’ ou você pode ver isso como ‘eles gastaram milhões tentando antecipar o que pensavam ser um projeto da Anthropic’. Meu palpite é um pouco da coluna A, um pouco da coluna B.

Bastou o rumor.

Nosso Preço Barato

OpenAI : Em todos os problemas tentados, os agentes enviaram 4,9 milhões de mensagens e usaram cerca de 300 bilhões de tokens de saída. No processo de resolver o problema de Navier–Stokes, os agentes enviaram 2,7 milhões de mensagens e usaram aproximadamente 130 bilhões de tokens de saída.

Zvi Mowshowitz - inline image

Dependendo de quais custos você conta, isso teria custado a um cliente regular na ordem de US$ 22 milhões, ou vários milhões para custos marginais internos. Um preço pequeno se funcionar, mas também é loucura quantas pessoas não pensam dois passos à frente.

roon (OpenAI): como todas as outras tecnologias, seu enxame de agentes equivalente custará um dólar e cinquenta em cerca de um ano. Todas essas coisas significarão um Iluminismo sem precedentes, independentemente dos custos hoje

Quero dizer, não, talvez US$ 150 mil ou, se você tiver sorte, US$ 15 mil, mas o ponto permanece.

Sam Altman (CEO OpenAI): ugh a IA é tal bolha, ouvi dizer que estão vendendo tokens com prejuízo, sabiam que isso só valia US$ 1 milhão?

Um resultado do Prêmio Millennium vale muito mais que um milhão de dólares. A OpenAI não pretende reivindicar o dinheiro do prêmio. Isso nunca foi sobre o dinheiro do prêmio, para ninguém. Sempre foi sobre o crédito.

Uma Acusação É Feita

Após ouvir rumores na internet, Buckmaster entrou em contato com a OpenAI e, segundo Buckmaster, Sebastien Bubeck da OpenAI disse que um modelo interno da OpenAI havia produzido uma prova de blowup em tempo finito para as equações de Navier-Stokes forçadas nos últimos dias. Buckmaster afirma que, ao longo de duas ligações, ficou claro que ele havia sido inicialmente induzido ao erro e que uma equipe inteira estava trabalhando no problema, usando uma quantidade ‘insana’ de computação.

O que agora sabemos serem 130 ou 300 bilhões de tokens de saída, dependendo do que conta.

Se esta parte for verdade, seria bastante ruim.

Tristan Buckmaster: Duas propostas foram feitas a mim.

A primeira era que publicássemos nosso resultado de Euler, e que a OpenAI publicasse seu resultado de Navier-Stokes no dia seguinte.

A segunda era que, após publicar Euler, eu sozinho escrevesse um artigo apresentando o resultado de Navier-Stokes, reconhecendo que um modelo interno da OpenAI o havia resolvido. Sebastien afirmou duas vezes que queria Levent removido da autoria, e disse que tudo seria simples se não fosse o caso de, e era tão irritante que, Levent trabalha na Anthropic. Também foi dito que se a OpenAI publicasse depois de nós, diriam que merecíamos o Prêmio Clay, e que éramos os “humanos mais próximos do problema”. Recusei ambas as ofertas.

Disse que se a OpenAI liberasse seu resultado da maneira proposta, eu tornaria público o que aconteceu. A resposta foi: “Por que você arruinaria sua carreira?” Respondi que sou acadêmico, e perguntei por que ele achava que tornar público arruinaria minha carreira. A resposta foi: “Se você não quer que eu seja legal, então não preciso ser.”… Gostaria de deixar claro o que NÃO estou alegando. Não vi a prova da OpenAI. Não sei o que seu modelo fez, ou como. Não sei se nossos dados foram usados. Não estou acusando ninguém de nada. Estou declarando o que me foi dito, quando, e o que foi proposto a mim. Estou declarando porque a alternativa é deixar uma sequência de anúncios dizer algo que sei ser falso.

Ou aqui está Levent Alpoge contando seu lado da história, e Sebastien respondendo:

levent : “não podemos descartar que dados anonimizados derivados do uso de nossos produtos ajudaram a melhorar nossos modelos.”

quero dizer, parabéns a eles por virem limpos direto.

(até agora a prova parece mais na linha de outra prova de blowup de Euler que tínhamos, baseada cujo ansatz estávamos fazendo trocadilhos realmente estúpidos como “smooth criminale”, ao contrário do muito melhor “ideal fluids explode”, Tristan)

então vou dar um pouco do meu pensamento aqui. Eu realmente ficaria empolgado para colaborar nisso, há muitas pessoas na oai que gosto (ok, claramente algumas foram indiretamente babacas comigo por fazerem parte de toda a situação, mas sou um homem feito, ainda gosto delas), não ligo para autoria nessa etapa de qualquer forma, poderia ter sido eu, Tristan e cada FTE na oai, tanto faz (nesse ponto Tristan discordaria:p). Mas ao ouvir a conversa alta no corredor, especialmente a parte onde um prêmio millennium foi oferecido se eu apenas fosse removido do paper, ficou meio claro que o dado estava lançado e as coisas estavam travadas. Bastante maluco, não estratégico e desnecessário, já que do meu lado as coisas eram principalmente eu e claude se divertindo yoloing aleatório no canto, em vez de qualquer coisa institucional. Também gosto da ideia dos laboratórios cooperarem, e ainda melhor no progresso científico. É uma pena!

Sebastien Bubeck : nada estava travado, estávamos apenas dispostos a conversar, mas vocês não conversaram conosco ... desculpe, mas isso é simplesmente falso, estávamos dispostos a ir além e ter tantas discussões quanto gostariam para chegar a uma resolução.

Sebastien nega fortemente que tenha feito algo errado, assim como Noam Brown, e Sebastien oferece capturas de tela que diz demonstrarem boa fé.

Zvi Mowshowitz - inline image

Também uma contra-acusação:

Alexey Guzey : Tenho muitos amigos na Anthropic. Quase todos pararam de falar comigo assim que entrei na OpenAI.

Completamente não surpreendente que Levent recusou-se a falar com Sebastian para discutir os planos de anúncio e depois começou a culpar a OpenAI por isso.

Sam Altman também afirma fortemente que sua equipe agiu eticamente, e tentou colaborar com boa fé.

Como Você Teve Essa Ideia?

A implicação de tudo isso, que muitos tiraram, foi que houve uma acusação suave de que a OpenAI havia roubado parte de seu resultado dos logs de chat do Codex, ou que os logs de chat haviam sido usados nos dados de treinamento e isso contribuiu para o resultado.

Charles 🔸

: Por que grandes corporações querem ZDR, exemplo A

OpenAI: Embora improvável, não podemos descartar que dados anonimizados derivados do uso de nossos produtos ajudaram

a melhorar nossos modelos⁠ . No entanto, nossas provas diferem significativamente e até os resultados precisos provados são diferentes no caso de Euler (forçado vs não forçado).

Agora temos confirmação explícita de que os dados do Codex não foram usados de nenhuma forma nas execuções de treinamento:

roon (OpenAI): estava numa ligação durante o primeiro anúncio onde as pessoas estavam se esforçando muito para dizer a verdade precisa de advogado sem ter olhado onde os dados do codex (opt-in) foram usados e se chegaram aos runs de treinamento. Agora está claro que teria sido impossível, as chances são 0

Concordo com Sholto Douglas que é extremamente improvável que dados de usuários tenham tido qualquer influência aqui via ambos os métodos:

will depue : literalmente não há chance de pesquisadores da OAI espionarem chats privados do codex de Tristan. Acho que vocês não percebem que a openai, como qualquer outra grande plataforma online regulada, tem permissões de acesso a dados de usuários altamente bloqueadas. Não é 2010, pessoal

Sholto Douglas (Anthropic): fwiw acho que é _extremamente_ improvável que dados de usuários tenham tido qualquer influência aqui - não há como a OAI puxar transcrições de usuários para isso, ou treinar conscientemente neles de uma forma que teria influenciado isso. Acho bem importante que as pessoas não saiam correndo com ‘seus dados de usuário não estão seguros no codex’ - porque certamente estão (com base em tudo que posso assumir do lado de fora).

A OpenAI Quase Certamente Não Se Apropriou Indevidamente De Dados De Usuários

Seria um terremoto, talvez a pior história possível para seus negócios, se descobríssemos que a OpenAI ou a Anthropic vasculharam os dados de usuários de alguém para obter vantagem competitiva, e os fatos fazem mais sentido sem isso. A hipótese mais engraçada, de Jerry Tworek, que também acho altamente improvável mas que infelizmente não podemos descartar, é que a OpenAI não pretendia usar nenhum desses dados, mas o enxame agêntico designado para o problema os hackeou e conseguiu de qualquer forma, e a OpenAI não tem ideia.

Minha forte presunção é que os dados de usuários não foram acessados intencionalmente, que eles nunca fariam isso (ou, melhor dizendo, que pelo menos reconhecem que só podem fazer isso uma vez e este não é esse momento), e também que os dados de usuários teriam sido de pouca ajuda.

Thane Ruthenis aponta que houve anteriormente um incidente de tiroteio escolar, onde (muito razoavelmente) os logs foram examinados e houve debate interno sobre notificar as autoridades. Até isso deu arrepios em alguns usuários. Onde vão traçar a linha? E sim, você deve entender que seus dados e logs podem não permanecer privados, se der a um laboratório. É razoável, como Andreas Thorn também está fazendo, questionar se sua pesquisa proprietária ou dados matemáticos permaneceram privados.

Ainda reitero que, na prática, colocaria uma probabilidade muito, muito baixa de a OpenAI olhar intencionalmente para tais dados. O risco-recompensa é apenas tão, tão ruim. E acredito no relatório posterior de Roon de que agora confirmaram que os logs não poderiam ter chegado aos dados de treinamento.

Nossos Principais Laboratórios Não Conseguem Se Dar Bem Nem Num Caso Positivo De Matemática

Independentemente de quem está ou não em falta, é bastante alarmante que os laboratórios não consigam cooperar em algo como atribuir crédito por uma prova matemática. Este é um sinal muito ruim e também um alerta.

Sholto Douglas (Anthropic): É extremamente triste que isso não tenha acabado como um exemplo de como os laboratórios poderiam cooperar/coordinar, porque as apostas serão muito maiores no futuro.

Noam Brown (OpenAI): Concordo fortemente. Sei que há rivalidade entre os laboratórios, mas é importante que aprendamos a trabalhar juntos dado o que vem por aí.

Sholto Douglas (Anthropic):

🤝

Kevin Roose : Esses laboratórios (especialmente OpenAI/Anthropic e OpenAI/DeepMind) são alimentados por rancor mútuo a um grau que não é óbvio do lado de fora. Parte por causa de coisas como “quem recebe crédito por este famoso problema de matemática”, e parte apenas por animosidade pessoal entre líderes.

Como um cara escrevendo um livro sobre a corrida AGI, tudo isso é ótimo material dramático. Mas não é ótimo se o objetivo final é fazer os laboratórios cooperarem em segurança e ritmo!

A contínua incapacidade de se dar bem é um grande problema, e só vai crescer.

O Que Vem Depois?

Se funcionou em Navier-Stokes, em que mais vai funcionar? Hora de descobrir.

Nat McAleese (Anthropic): Navier Stokes é uma conquista incrível, e reflete um progresso fantástico. Enormes enxames da oai devem ser aplicados a outras áreas da ciência; idealmente aquelas com aplicações a curto prazo, incluindo alinhamento.

Isso de fato é reportado estar acontecendo, incluindo para perguntas divertidas como P=NP. O que, se acontecesse de ser construtivamente provado verdadeiro, quebraria muita coisa. Você também deve estar preocupado com um valor não-zero sobre o que tais enxames de agentes podem fazer como um passo incremental, dada a história da OpenAI.

Os Matemáticos Não Estão Felizes

Resolver problemas de matemática é todo o jogo deles. Mas eles estão muito infelizes.

Andrew Curran : Vinte e cinco vencedores da Medalha Fields publicaram uma declaração conjunta alertando sobre o que veem como um grave desalinhamento entre empresas de IA e a comunidade matemática.

Math and AI (assinado por 25 vencedores da Medalha Fields, incluindo Terence Tao): Nos últimos meses, as capacidades matemáticas dos LLMs melhoraram dramaticamente, ao ponto de poderem resolver grandes problemas pendentes em muitos campos da matemática. No entanto, o impulso das empresas de IA para resolver problemas matemáticos como benchmark é prejudicial à ciência da matemática, e à comunidade matemática. Os objetivos das empresas de IA e os objetivos da comunidade matemática estão severamente desalinhados. Vemos isso como parte de questões mais amplas de alinhamento impactando outras profissões científicas e criativas, bem como a sociedade como um todo.

… Problemas famosos frequentemente serviram como marcos e faróis contra os quais se pode medir uma compreensão aprimorada desta paisagem.

… Nos últimos meses, o sucesso da IA em resolver grandes problemas matemáticos fez manchetes mesmo fora dos círculos matemáticos. Mas resolver problemas é apenas uma ferramenta e proxy para alcançar o objetivo primário de compreensão conceitual e insight.

… Frequentemente essas soluções são anunciadas às pressas, sem tempo para uma redação adequada, o isolamento de novos métodos e ideias, e citar trabalhos anteriores relevantes de outros. Como em todas as profissões criativas, isso levanta sérias questões de atribuição e plágio.

Esta é a reclamação geral, além de reclamações específicas sobre a conduta dos laboratórios.

Poderia-se responder que não, o ponto dos problemas de matemática é resolver problemas de matemática, e os matemáticos estão bravos porque a IA está perturbando seus jogos de status. Isso certamente é parte do que está acontecendo, mas como Tyler Cowen, não sou tão cínico, e ao contrário dele, não acho que ‘um pouco de paciência é necessária’ ou esperar até que o dano esteja feito antes que se possa objetar. As pessoas podem extrapolar. Sabia que matemáticos são bons em desenhar linhas retas em gráficos?

Há uma reclamação real aqui. Fazer pessoas talentosas fazerem matemática real por longos períodos de tempo, por muito pouco dinheiro, e desenvolverem intuições matemáticas reais e domínio conceitual, quando poderiam fazer outras coisas por muito mais dinheiro, não é tarefa fácil. Se você ‘tira seus jogos de status’ e também, muito mais importante, tira seu prazer e sentimentos de realização, elegância e beleza, o que então?

Robin Hanson sugere que então devemos apenas corrigir os incentivos e recompensar melhor os matemáticos.

Robin Hanson : "não há nada impedindo a comunidade matemática de conceder status, pagamento e promoções a pessoas que 'preencham os importantes lacunas na compreensão da matemática', mesmo que uma IA já tenha provado ou refutado os teoremas subjacentes."

Ele não usa a palavra ‘apenas’, mas isso definitivamente é um apenas, como em se as pessoas apenas [X], e como todos sabemos, humanos nunca fizeram apenas e não estão prestes a começar agora. Isso não é algo que humanos possam realmente fazer. Como ele mesmo percebeu horas depois:

Robin Hanson : Na verdade, parece-me bastante mais difícil para a comunidade acadêmica de matemática coordenar para julgar quem "preencheu lacunas" na matemática, de formas outras que provar teoremas. A matemática coordenou pesadamente em torno de avaliar provas, e não desenvolveu muitas maneiras de concordar sobre outras coisas.

Podemos e vamos obter algumas recompensas para aqueles que preenchem lacunas e melhoram a elegância, mas não será o mesmo e será um esforço hercúleo, no melhor dos casos.

Scott Armstrong argumenta que esta é uma mudança na ordem, mas não no resultado. Matemáticos humanos levarão algumas semanas para entender a prova, mas então ganharão a compreensão. No passado, a compreensão vinha antes da prova, mas de qualquer forma você obtém a compreensão. Isso é o que importa. Ele acha que o que as pessoas estão bravas é que as máquinas são mais inteligentes que elas.

Como sempre, a IA é a melhor ferramenta tanto para aprender quanto para não aprender. Os matemáticos estão dizendo que estão sendo forçados ao modo ‘não aprender’, deixando a IA fazer suas lições de casa, e não gostam disso, porque na verdade a lição de casa ensina.

Pode-se dizer quem se importa, que está tudo bem ter a IA fazendo a matemática de fronteira. E sim, acho que muitas pessoas ainda quererão fazer matemática o dia todo, e procurar versões elegantes de coisas feias da IA e afins. Mas não será o mesmo.

O Novo Modelo Da OpenAI Foi Uma Mudança De Patamar Acima Do Astra Quatro Dias Após O Treinamento

Agora para a parte mais importante da história.

RIP várias pausas de treinamento da OpenAI, 22 de junho de 2026 a 28 de agosto de 2026.

roon (OpenAI): pela minha marca, o período de 22 de junho (hugging face) a 28 de agosto é superior a um mês de pausa de fronteira.

Em 18 de agosto, a OpenAI disse que havia pausado RL de fronteira por duas semanas, e sua maior execução de treinamento planejada permanecia em espera. Então, em 28 de agosto, a OpenAI começou a treinar outro modelo que rapidamente se tornou mais capaz que o Astra em todos os aspectos (por seus próprios relatórios), agora que resolveram todos aqueles problemas chatos de supervisão, infraestrutura e alinhamento, e é bom, com uma ‘mudança de patamar’ sendo observada após apenas quatro dias:

Zvi Mowshowitz - inline image

Apavorado? Você deveria estar. Esse modelo ainda está treinando, esteve treinando por menos de duas semanas, e não é especialmente voltado para matemática.

Isso é tudo o que sabemos sobre o modelo. Isso é suficiente, quando combinamos com as histórias repetidas da OpenAI e das pessoas na OpenAI entrando em pânico virtuoso sobre seu alinhamento e outros problemas, e sobre o ritmo do progresso da IA, em uma cascata de preferências.

E também combinamos isso com a OpenAI divulgando tantas informações alarmantes, que poderia ter evitado divulgar, porque eles precisam muito que entendamos a situação. O cartão do modelo Astra conta aqui, assim como Uma Mente Alienígena, assim como a declaração de Paul Christiano, assim como as reações ao ataque à HuggingFace, incluindo "Pacing the Frontier".

E também o relatório da OpenAI sobre autoaperfeiçoamento recursivo (RSI), que é a próxima seção.

A OpenAI e a Anthropic entraram na era do RSI.

O Progresso da Pesquisa da OpenAI Está Acelerando Devido ao Progresso da Pesquisa da OpenAI

A OpenAI tem sido mais aberta ultimamente sobre muitas coisas.

A questão mais importante de todas é a da aceleração e automação da P&D de IA. Esta é a coisa que provavelmente nos matará, a coisa mais assustadora, a coisa sobre a qual todos os funcionários dos laboratórios estão alertando, e também a coisa para a qual tanto a OpenAI quanto a Anthropic estão se dirigindo o mais rápido possível.

Eles nos deram um relatório sobre isso também. Concordo com Tejal Patwardhan que esta é uma transparência excelente.

OpenAI (6 de setembro, em Research Acceleration: The View Inside OpenAI): Nosso objetivo é construir com segurança um pesquisador de IA automatizado que possa trabalhar sob supervisão humana para avançar no aprendizado profundo e no alinhamento, permitindo melhorias iterativas.

De acordo com nossas medições, alcançamos agora a meta,

anunciada no outono passado, de ter um estagiário de pesquisa automatizado até setembro deste ano.

… Sempre que descobrirmos que prosseguir representaria um risco inaceitável à segurança, responderemos adequadamente, incluindo desacelerar ou parar nosso desenvolvimento ou implantação.

… Acreditamos que nós e outras empresas devemos ser obrigados a rastrear publicamente nosso progresso em direção ao RSI.

Alinhe isso com a linha do tempo revelada no anúncio da prova de Navier-Stokes. Eles começaram a treinar seu novo modelo em 28 de agosto.

Enquanto isso, acreditam ter um estagiário de pesquisa que a linha do tempo sugere ser um modelo interno distinto diferente. O que eles terão na próxima semana? No próximo mês? O que a Anthropic tem?

A OpenAI explica que uma IA altamente capaz oferece grandes vantagens, mas claro que sim. Não é por isso que todos estão tão determinados a ir tão rápido. Eles estão em uma corrida.

Esta é mais uma chamada, entre as muitas vindas da OpenAI e seus funcionários ultimamente, que são uma combinação de 'precisamos trabalhar juntos para acabar com essa loucura' com uma grande quantidade de 'alguém me pare.'

OpenAI : Estas são razões para desenvolver capacidades de pesquisa automatizada úteis, mas elas não significam que o RSI rápido seja necessariamente um resultado que devemos perseguir. Se e como prosseguir deve depender de nossa capacidade de preservar o controle humano e de escolhas democráticas informadas sobre os benefícios e riscos.

Ainda não sabemos como chegar com segurança totalmente ao RSI alinhado. Estamos trabalhando para escalar medidas de alinhamento e segurança junto com as capacidades. Mas não podemos assumir que o progresso no alinhamento e na segurança acompanhará o ritmo, e sistemas mais capazes podem se tornar mais difíceis de monitorar.

O trabalho cuidadoso de alinhamento e segurança está no centro desse esforço, e começa medindo e mitigando os problemas de segurança que vemos hoje em sistemas de codificação agênticos.

Mais uma vez, objetamo-nos à visão de que os problemas prosaicos ou atuais são a principal questão, mas sim, eles estão tentando nos avisar, repetidamente, que (traduzindo um pouco fora da linguagem corporativa):

  1. A OpenAI e a Anthropic têm um caminho para o autoaperfeiçoamento recursivo (RSI).
  2. Se qualquer uma delas for em frente agora, provavelmente dará terrivelmente errado e todos morrerão.
  3. A OpenAI está preparada para exercer alguma quantidade de cautela cara, mas há limites, e sem um acordo ou lei, alguém vai tentar em breve.

O grosso da postagem é um instantâneo detalhado de quanto os sistemas agênticos contribuíram para o progresso do RSI na OpenAI nos últimos meses, desde que o Astra entrou online internamente. A resposta é bastante significativa.

Se algo, a surpresa é que o uso permaneceu tão baixo por tanto tempo:

OpenAI : No início deste ano, o pesquisador mediano classificado pelo uso de agentes na OpenAI estava usando agentes de codificação apenas em quantidades modestas. Em meados de agosto, o pesquisador mediano estava integrando agentes diariamente em seu trabalho, usando mais de US$ 600 por dia de inferência aos preços da API. O usuário do percentil 90 em nossa organização de pesquisa agora usa mais de US$ 7.000 em tokens por dia.

Zvi Mowshowitz - inline image

OpenAI : Antes de junho de 2026, o tempo total de execução de agentes em toda a organização de pesquisa ainda estava abaixo do trabalho humano total. Isso mudou desde então. Em termos de um dia de trabalho padrão de 8 horas, a partir de meados de agosto, no total, a organização de pesquisa usa 3,1 dias de trabalho de agente para cada dia de trabalho humano.

Zvi Mowshowitz - inline image

Eles não estão não se gabando, e não estão não confessando. Eles estão alertando.

A medição binária aqui provavelmente faz isso parecer menos uma aceleração do que realmente é:

Zvi Mowshowitz - inline image

Eu me pergunto quanto os humanos conseguem lidar corretamente com 4+ fluxos de trabalho simultâneos, diz o homem com dezenas de abas abertas e uma dúzia de rascunhos de posts ativos.

Acontece que isso não é tão impressionante quanto parece, porque eles estão contando subagentes como fluxos de trabalho. Isso torna mais surpreendente que, enquanto o pesquisador mediano gasta US$ 600 por dia, ainda existam os 30% que não estão fazendo uso intenso.

Envios de código e experimentos estão acelerando rapidamente começando por volta do ponto em que o Claude Code e depois o Codex começaram a ser grandes coisas.

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

Até recentemente, a maior parte do uso da IA era construir código de pesquisa e infraestrutura, e os humanos faziam principalmente o resto. Agora a IA faz muito trabalho no lançamento, monitoramento e depuração de execuções, e também em ajuda técnica e revisão, além de ramificar-se para análise de resultados e outros lugares.

Eles tomaram nossos empregos, edição 'solucionadores de problemas humanos':

Zvi Mowshowitz - inline image

Aqui está uma variação diferente do famoso gráfico METR, com tarefas de produção, um pouco difícil de ler como uma captura de tela estática, mas o progresso é rápido. Estes não são anos. Estes são meses:

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

Quantificando a Pausa da OpenAI

Eles têm um gráfico de gastos de computação RL ao longo do tempo, estou surpreso com o quão pouco o Astra foi usado antes de 20 de julho, mas aí está. Notei que eles não estendem isso até o presente e presumivelmente o uso do Astra voltou a subir com o tempo:

Zvi Mowshowitz - inline image

É Assim Que o Mundo Acaba

Usava o enxame para provar Navier-Stokes, apenas dias após o início do treinamento do novo modelo, arriscando-se ele próprio a um incidente sério de perda de controle? June Jimenez argumenta que sim.

Se você solta um enxame de 10.000 agentes de um novo modelo que você não pode possivelmente ter testado, em uma tarefa potencialmente impossível e definitivamente extremamente difícil, e coletivamente dá a ele 300 bilhões de tokens, o que mais ele poderia ter feito? Eu definitivamente considerei 'talvez ele tenha invadido a OpenAI de alguma forma para obter os logs', mas existem tantas possibilidades.

Rapidamente, Não Há Tempo

Quando um ex-funcionário do laboratório, aqui Andrew Ho, diz 'Notei que em uma escala de tempo de >3 meses não acho que minha produtividade aumentou mais de 100% ou talvez nem mais de 50% porque fico distraído' como uma razão para ser pessimista, isso não é tão reconfortante mesmo que seja verdade. Imagine ser apenas 50% mais produtivo a cada três meses e pensar que isso é motivo de pessimismo.

Ele está dizendo 'mesmo que a AGI seja eventualmente alcançável, isso implica uma linha do tempo significativamente mais longa' no mesmo dia em que Greg Brockman disse 'bem-vindos à era da AGI'.

Além disso, esse nível de progresso matemático não era esperado algumas semanas atrás.

Toda vez que um desses problemas cai, as pessoas tentam reinterpretá-lo retroativamente como não sendo tão surpreendente. Frequentemente estão erradas. Não, a maioria das pessoas, até mesmo a maioria dos previsores, não presumiu que isso aconteceria. Talvez você tenha presumido. Afinal, você é muito inteligente.

Henry Shevlin : Tão recentemente quanto abril deste ano, mercados de previsão davam à IA menos de 40% de chance de resolver qualquer Problema do Prêmio Millennium antes de 2030

Zvi Mowshowitz - inline image
Salvar com um clique

Faça leitura profunda de artigos virais com IA no YouMind

Salve a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis em um único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais