Novo modelo de IA resolve um Prêmio do Milênio

@TheZvi
INGLÊS13/09/2026
135K
199
17
16
237

TL;DR

O novo modelo da OpenAI resolveu o Prêmio do Milênio relacionado às equações de Navier-Stokes, desencadeando debates sobre atribuição de crédito, privacidade de dados e o ritmo alarmante da aceleração da pesquisa impulsionada pela IA.

O primeiro Prêmio Millennium, Navier-Stokes, foi conquistado pela IA.

Surgiu uma situação profundamente infeliz envolvendo o que deveria ter sido uma combinação de uma história positiva sobre novos progressos na pesquisa matemática assistida por IA e mais uma oportunidade para entrar em pânico com o rápido avanço da IA.

Ou, como chamamos aqui: terça-feira.

A Verdadeira História É O Novo Modelo Que É Melhor Que Astra

Mantenham o foco no prêmio. Há três histórias aqui.

A primeira história é muito mais importante que a segunda, que por sua vez é muito mais importante que a terceira.

  1. O próximo modelo da OpenAI levou uma semana para ficar uma geração à frente do Astra, e eles estão nos contando isso porque todo mundo está totalmente em pânico com o que está acontecendo. Ou, em linguagem oficial: ‘Acreditamos ser importante informar o mundo sobre o ritmo do progresso da IA e o que esperar dos próximos modelos’ e que ‘podemos exigir escolhas mais deliberadas sobre o ritmo do progresso’.
  2. Esta nova IA resolveu as equações de Navier-Stokes oito dias após iniciar o treinamento.
  3. Uma série de dramas sobre quem recebe o crédito pela matemática envolvendo Navier-Stokes.

Jeffrey Ladish : Não investiguei o drama humano em torno do problema de Navier–Stokes, mas me dê um minuto porque CARALHO, A IA ACABOU DE RESOLVER UM PROBLEMA MILLENNIUM.

Não posso enfatizar o suficiente a principal história.

Vou contar as três histórias, mas repito: Foco no prêmio.

Preparando o Cenário

A história desta terça-feira específica começa pela manhã.

Tristan Buckmaster e Levent Alpoge trabalharam por um ano e nos oferecem uma série de resultados notáveis: Explosão em tempo finito com forçamento suave para meios porosos incompressíveis, para Boussinesq e para Euler incompressível 3D. Eles também acreditam ter uma explosão para Navier-Stokes hipodissipativo, mas a verificação Lean desse resultado não está concluída.

Tristan Buckmaster: O programa no qual isso se encaixa não foi iniciado por nós nem proposto por um Grande Modelo de Linguagem. O crédito pela ideia básica deste programa vai para Diego Cordoba e Luis Martınez-Zoroa, que há vários anos vêm explorando a construção de explosões forçadas. Tomamos o trabalho deles como ponto de partida, usando Grandes Modelos de Linguagem para levar seu programa à conclusão.

Concretamente, o que Levent e eu fizemos foi pegar o programa de Cordoba e Martınez-Zoroa, que alcançou resultados de explosão com forçamento irregular e, com grande ajuda dos LLMs, levá-lo ao forçamento suave e às equações de Euler incompressíveis. As ideias que tornam essa linha de ataque possível são devidas a Cordoba e Martınez-Zoroa. Deixe-me deixar claro o que disse a colegas em particular: diante deste corpo de trabalho, acredito que Luis Martınez-Zoroa merece uma Medalha Fields.

Até agora, isso é ótimo. Como ele observa, exige repensar como toda a matemática avançada funcionará daqui para frente. Terence Tao oferece comentários sobre os resultados subjacentes.

A parte que não é tão boa é onde eles se sentiram obrigados a publicar cedo, sem a oportunidade de gastar as semanas necessárias para tornar as provas aquilo que passa entre matemáticos como legível. Buckmaster pede desculpas abertamente pela aparência dos relatórios, comparando especialmente o texto sobre Euler a lixo gerado por IA.

O que aconteceu?

Ouvi um Rumor

Em 1º de setembro, a OpenAI ouviu um rumor (falso) de que dois Problemas Millennium haviam sido resolvidos. Em resposta à possibilidade de outra pessoa tornar o mundo um lugar melhor, a OpenAI gastou milhões de dólares em inferência para explorar todos os Problemas Millennium não resolvidos, usando um modelo interno mais forte que o Astra, e decifrou todo o Navier-Stokes em 88 horas, mais outras 17 para o Astra fazer a formalização e verificação Lean.

Você pode ver isso como ‘a OpenAI ficou curiosa para ver o que seu novo bebê poderia fazer’ ou você pode ver isso como ‘eles gastaram milhões tentando antecipar o que pensavam ser um projeto da Anthropic’. Meu palpite é um pouco da coluna A, um pouco da coluna B.

Bastou o rumor.

Nosso Preço Barato

OpenAI : Entre todos os problemas tentados, os agentes enviaram 4,9 milhões de mensagens e usaram cerca de 300 bilhões de tokens de saída. No processo de resolução do problema de Navier–Stokes, os agentes enviaram 2,7 milhões de mensagens e usaram aproximadamente 130 bilhões de tokens de saída.

Zvi Mowshowitz - inline image

Dependendo dos custos que você conta, isso teria custado a um cliente regular na ordem de US$ 22 milhões, ou vários milhões para custos marginais internos. Um preço pequeno se funcionar, mas também é loucura quantas pessoas não pensam duas etapas à frente.

roon (OpenAI): como todas as outras tecnologias, seu enxame de agentes equivalente custará um dólar e cinquenta em cerca de um ano. Tudo isso significará um Iluminismo sem precedentes, independentes dos custos hoje

Quero dizer, não, talvez US$ 150 mil ou, se você tiver sorte, US$ 15 mil, mas o ponto permanece.

Sam Altman (CEO OpenAI): ugh, a IA é tal bolha, ouvi dizer que estão vendendo tokens com prejuízo, sabiam que isso só valia US$ 1 milhão?

Um resultado do Prêmio Millennium vale muito mais que um milhão de dólares. A OpenAI não pretende reivindicar o dinheiro do prêmio. Isso nunca foi sobre o dinheiro do prêmio, para ninguém. Sempre foi sobre o crédito.

Uma Acusação É Feita

Após ouvir rumores da internet, Buckmaster entrou em contato com a OpenAI e, segundo Buckmaster, Sebastien Bubeck da OpenAI disse que um modelo interno da OpenAI havia produzido uma prova de explosão em tempo finito para as equações de Navier-Stokes forçadas nos últimos dias. Buckmaster afirma que, durante duas ligações, ficou claro que ele havia sido inicialmente enganado e que uma equipe inteira estava trabalhando no problema, usando uma quantidade ‘insana’ de computação.

O que agora sabemos que foram 130 ou 300 bilhões de tokens de saída, dependendo do que conta.

Se esta parte for verdadeira, seria bastante ruim.

Tristan Buckmaster: Duas propostas me foram feitas.

A primeira era que publicássemos nosso resultado de Euler, e que a OpenAI publicasse seu resultado de Navier-Stokes no dia seguinte.

A segunda era que, após publicar Euler, eu sozinho escrevesse um artigo apresentando o resultado de Navier-Stokes, reconhecendo que um modelo interno da OpenAI o havia resolvido. Sebastien afirmou duas vezes que queria Levent removido da autoria, e disse que tudo seria simples se não fosse o fato de que, e era tão irritante que, Levent trabalha na Anthropic. Também foi dito que se a OpenAI publicasse depois de nós, eles diriam que merecíamos o Prêmio Clay, e que éramos os “humanos mais próximos do problema”. Recusei ambas as ofertas.

Disse que se a OpenAI liberasse seu resultado da forma proposta, eu tornaria público o que aconteceu. A resposta foi: “Por que você arruinaria sua carreira?” Respondi que sou acadêmico, e perguntei por que ele achava que tornar público arruinaria minha carreira. A resposta foi: “Se você não quer que eu seja gentil, então não preciso ser.”… Gostaria de deixar claro o que NÃO estou alegando. Não vi a prova da OpenAI. Não sei o que seu modelo fez, ou como. Não sei se nossos dados foram usados. Não estou acusando ninguém de nada. Estou declarando o que me foi dito, quando, e o que me foi proposto. Estou declarando porque a alternativa é deixar uma sequência de anúncios dizer algo que sei ser falso.

Ou aqui está Levent Alpoge contando sua versão da história, e Sebastien respondendo:

levent : “não podemos descartar que dados anonimizados derivados do uso de nossos produtos ajudaram a melhorar nossos modelos.”

quero dizer, parabéns a eles por virem limpos diretamente.

(até agora, a prova parece mais alinhada com outra prova de explosão de Euler que tínhamos, baseada cujo ansatz estávamos fazendo trocadilhos realmente estúpidos como “smooth criminale”, ao contrário do muito melhor “ideal fluids explode”, Tristan)

então darei um pouco sobre meu pensamento aqui. Eu realmente ficaria empolgado em colaborar nisso, há muitas pessoas na OAI de quem gosto (ok, claramente algumas foram indiretamente babacas comigo por serem parte de toda a situação, mas sou adulto, ainda gosto delas), não ligo para autoria nessa etapa de qualquer maneira, poderia ter sido eu, Tristan e cada funcionário da OAI pelo que me importa (nesse ponto Tristan discordaria:p). Mas ao ouvir a conversa alta no corredor, especialmente a parte onde um prêmio Millennium foi oferecido se eu apenas fosse removido do artigo, ficou meio claro que o dado estava lançado e as coisas estavam travadas. Bastante estranho, não estratégico e desnecessário, já que do meu lado as coisas eram principalmente eu e Claude tendo um bom tempo yoloing aleatório no canto, em vez de qualquer coisa institucional. Também gosto da ideia dos laboratórios cooperarem, e ainda melhor no progresso científico. É uma pena!

Sebastien Bubeck : nada estava travado, estávamos apenas dispostos a conversar, mas você não conversou conosco ... desculpe, mas isso é simplesmente falso, estávamos dispostos a ir além e ter tantas discussões quanto você gostaria para chegar a uma resolução.

Sebastien nega fortemente que tenha feito algo errado, assim como Noam Brown, e Sebastien oferece capturas de tela que diz demonstrarem boa fé.

Zvi Mowshowitz - inline image

Também uma contra-acusação:

Alexey Guzey : Tenho muitos amigos na Anthropic. Quase todos pararam de falar comigo assim que entrei na OpenAI.

Completamente não surpreendente que Levent se recusou a falar com Sebastian para discutir os planos de anúncio e depois começou a culpar a OpenAI por isso.

Sam Altman também afirma fortemente que sua equipe agiu eticamente, e tentou colaborar de boa fé.

Como Você Teve Essa Ideia?

A implicação de tudo isso, que muitos tiraram, foi que houve uma acusação suave de que a OpenAI havia roubado parte de seu resultado dos logs de chat do Codex, ou que os logs de chat haviam sido usados nos dados de treinamento e isso contribuiu para o resultado.

Charles 🔸

: Por que grandes corporações querem ZDR, exemplo A

OpenAI: Embora improvável, não podemos descartar que dados anonimizados derivados do uso de nossos produtos ajudaram a

melhorar nossos modelos⁠. No entanto, nossas provas diferem significativamente e até mesmo os resultados precisos provados são diferentes no caso de Euler (forçado vs não forçado).

Agora temos confirmação explícita de que os dados do Codex não foram usados de forma alguma nas execuções de treinamento:

roon (OpenAI): estava numa ligação durante o primeiro anúncio onde as pessoas estavam se esforçando muito para dizer a verdade precisa de advogado sem ter investigado onde os dados do codex (opt-in) foram usados e se chegaram aos treinos. Agora está claro que seria impossível, as chances são 0

Concordo com Sholto Douglas que é extremamente improvável que os dados dos usuários tenham tido qualquer influência aqui por qualquer método:

will depue : literalmente não há chance de pesquisadores da OAI espionarem os chats privados do codex de Tristan. Acho que vocês não percebem que a openai, como qualquer outra grande plataforma online regulada, tem permissões de acesso a dados de usuários altamente bloqueadas. Não é 2010, pessoal

Sholto Douglas (Anthropic): para constar, acho que é _extremamente_ improvável que os dados dos usuários tenham tido qualquer influência aqui - não há como a OAI puxar transcrições de usuários para isso, ou treinar conscientemente neles de uma forma que teria influenciado isso. Acho bastante importante que as pessoas não fujam com ‘seus dados de usuário não estão seguros no codex’ - porque certamente estão (com base em tudo que posso assumir do exterior).

A OpenAI Quase Certamente Não Desviou Dados de Usuários

Seria um terremoto, talvez a pior história possível para seus negócios, se descobríssemos que a OpenAI ou a Anthropic invadiram os dados de usuários de alguém para obter vantagem competitiva, e os fatos fazem mais sentido sem isso. A hipótese mais engraçada, de Jerry Tworek, que também acho altamente improvável, mas que infelizmente não podemos descartar, é que a OpenAI não pretendia usar tais dados, mas o enxame de agentes atribuído ao problema os hackeou e conseguiu de qualquer maneira, e a OpenAI não faz ideia.

Minha forte presunção é que os dados dos usuários não foram acessados intencionalmente, que eles nunca fariam isso (ou, melhor dizendo, que pelo menos reconhecem que só podem fazer isso uma vez e esta não é aquela vez), e também que os dados dos usuários teriam sido de pouca ajuda.

Thane Ruthenis aponta que houve anteriormente um incidente de tiroteio escolar, onde (muito razoavelmente) os logs foram examinados e houve debate interno sobre notificar as autoridades. Até isso deu arrepios em alguns usuários. Onde eles traçarão a linha? E sim, você deve entender que seus dados e logs podem não permanecer privados, se você os der a um laboratório. É razoável, como Andreas Thorn também está fazendo, questionar se sua pesquisa proprietária ou dados matemáticos permaneceram privados.

Reitero que, na prática, colocaria uma probabilidade muito, muito baixa de a OpenAI olhar intencionalmente para tais dados. O risco-recompensa é apenas tão, tão ruim. E acredito no relatório posterior de Roon de que agora confirmaram que os logs não poderiam ter chegado aos dados de treinamento.

Nossos Principais Laboratórios Não Conseguem Se Dar Bem Nem Numa História Bonita de Matemática

Independentemente de quem está ou não em falta, é bastante alarmante que os laboratórios não consigam cooperar em algo como atribuir crédito por uma prova matemática. Este é um sinal muito ruim e também um alerta.

Sholto Douglas (Anthropic): É extremamente triste que isso não tenha acabado como um exemplo de como os laboratórios poderiam cooperar/coordinar, porque as apostas serão muito maiores no futuro.

Noam Brown (OpenAI): Concordo plenamente. Sei que há rivalidade entre os laboratórios, mas é importante que aprendamos a trabalhar juntos dado o que está por vir.

Sholto Douglas (Anthropic):

🤝

Kevin Roose : Estes laboratórios (especialmente OpenAI/Anthropic e OpenAI/DeepMind) são alimentados por rancor mútuo a um grau que não é óbvio do lado de fora. Em parte por causa de coisas como “quem recebe crédito por este famoso problema de matemática”, e em parte apenas por animosidade pessoal entre líderes.

Como um cara escrevendo um livro sobre a corrida AGI, tudo isso é ótimo material dramático. Mas não é ótimo se o objetivo final é fazer os laboratórios cooperarem em segurança e ritmo!

A contínua incapacidade de se dar bem é um grande problema, e só vai aumentar.

O Que Vem a Seguir?

Se funcionou em Navier-Stokes, em que mais funcionará? Hora de descobrir.

Nat McAleese (Anthropic): Navier Stokes é uma conquista incrível, e reflete um progresso fantástico. Enormes enxames da OAI devem ser aplicados a outras áreas da ciência; idealmente aquelas com aplicações de curto prazo, incluindo alinhamento.

Isso é de fato relatado estar acontecendo, incluindo para perguntas divertidas como P=NP. O que, se acontecesse de ser construtivamente provado verdadeiro, quebraria muita coisa. Você também deve estar preocupado (com probabilidade não nula) sobre o que tais enxames de agentes podem fazer como um passo incremental, dada a história da OpenAI.

Os Matemáticos Não Estão Felizes

Resolver problemas de matemática é o hobby deles inteiro. Mas eles estão muito infelizes.

Andrew Curran : Vinte e cinco vencedores da Medalha Fields publicaram uma declaração conjunta alertando sobre o que veem como um grave desalinhamento entre empresas de IA e a comunidade matemática.

Math and AI (assinado por 25 vencedores da Medalha Fields, incluindo Terence Tao): Nos últimos meses, as capacidades matemáticas dos LLMs melhoraram dramaticamente, a ponto de poderem resolver grandes problemas pendentes em muitos campos da matemática. No entanto, o impulso das empresas de IA para resolver problemas matemáticos como benchmark é prejudicial à ciência da matemática e à comunidade matemática. Os objetivos das empresas de IA e os objetivos da comunidade matemática estão severamente desalinhados. Vemos isso como parte de questões mais amplas de alinhamento impactando outras profissões científicas e criativas, bem como a sociedade como um todo.

… Problemas famosos frequentemente serviram como marcos e faróis contra os quais se pode medir uma compreensão aprimorada desta paisagem.

… Nos últimos meses, o sucesso da IA na resolução de grandes problemas matemáticos fez manchetes mesmo fora dos círculos matemáticos. Mas resolver problemas é apenas uma ferramenta e proxy para atingir o objetivo primário de compreensão conceitual e insight.

… Frequentemente essas soluções são anunciadas às pressas, sem tempo para uma redação adequada, o isolamento de novos métodos e ideias, e citar trabalhos anteriores relevantes de outros. Como em todas as profissões criativas, isso levanta graves questões de atribuição e plágio.

Esta é a reclamação geral, além de reclamações específicas sobre a conduta dos laboratórios.

Poder-se-ia responder que não, o ponto dos problemas de matemática é resolver problemas de matemática, e os matemáticos estão bravos porque a IA está disruptando seus jogos de status. Isso certamente é parte do que está acontecendo, mas como Tyler Cowen, não sou tão cínico, e ao contrário dele, não acho que ‘um pouco de paciência é necessária’ ou esperar até que o dano esteja feito antes de se poder objetar. As pessoas podem extrapolar. Sabia que matemáticos são bons em desenhar linhas retas em gráficos?

Há uma reclamação real aqui. Fazer pessoas talentosas fazerem matemática real por longos períodos, por muito pouco dinheiro, e desenvolverem intuições matemáticas reais e domínio conceitual, quando poderiam fazer outras coisas por muito mais dinheiro, não é tarefa fácil. Se você ‘tira seus jogos de status’ e, muito mais importante, tira sua diversão e sentimentos de realização, elegância e beleza, o que então?

Robin Hanson sugere que então devemos apenas corrigir os incentivos e recompensar melhor os matemáticos.

Robin Hanson : "nada impede a comunidade matemática de conceder status, pagamento e promoções a pessoas que 'preenchem as lacunas importantes na compreensão da matemática', mesmo que uma IA já tenha provado ou refutado os teoremas subjacentes."

Ele não usa a palavra ‘apenas’, mas isso definitivamente é um ‘apenas’, como em se as pessoas apenas [X], e como todos sabemos, humanos nunca fizeram apenas X e não vão começar agora. Isso não é algo que humanos possam realmente fazer. Como ele mesmo percebeu horas depois:

Robin Hanson : Na verdade, parece-me bastante mais difícil para a comunidade acadêmica de matemática coordenar para julgar quem "preencheu lacunas" na matemática, de formas outras que provar teoremas. A matemática coordenou pesadamente em torno da avaliação de provas, e não desenvolveu muitas maneiras de concordar sobre outras coisas.

Podemos e vamos obter algumas recompensas para aqueles que preenchem lacunas e melhoram a elegância, mas não será o mesmo e será um esforço hercúleo, no melhor dos casos.

Scott Armstrong argumenta que esta é uma mudança de ordem, mas não de resultado. Matemáticos humanos levarão algumas semanas para entender a prova, mas depois ganharão a compreensão. No passado, a compreensão vinha antes da prova, mas de qualquer maneira você obtém a compreensão. Isso é o que importa. Ele acha que o que as pessoas estão bravas é que as máquinas são mais inteligentes que elas.

Como sempre, a IA é a melhor ferramenta tanto para aprender quanto para não aprender. Os matemáticos estão dizendo que estão sendo forçados ao modo ‘não aprender’, deixando a IA fazer suas lições de casa, e não gostam disso, porque na verdade a lição de casa ensina.

Você pode dizer quem se importa, que é bom ter a IA fazendo a matemática de fronteira. E sim, acho que muitas pessoas ainda quererão fazer matemática o dia todo, e procurar versões elegantes de coisas feias da IA e afins. Mas não será o mesmo.

O Novo Modelo da OpenAI Foi Uma Mudança de Patamar Acima do Astra Quatro Dias Após Iniciar o Treinamento

Agora para a parte mais importante da história.

RIP várias pausas de treinamento da OpenAI, 22 de junho de 2026 a 28 de agosto de 2026.

roon (OpenAI): pela minha marca, o período de 22 de junho (hugging face) a 28 de agosto é superior a um mês de pausa de fronteira.

Em 18 de agosto, a OpenAI disse que havia pausado o RL de fronteira por duas semanas, e sua maior execução de treinamento planejada permanecia em espera. Então, em 28 de agosto, a OpenAI começou a treinar outro modelo que rapidamente se tornou mais capaz que o Astra em todos os aspectos (pelos próprios relatórios deles), agora que resolveram todos aqueles problemas chatos de supervisão, infraestrutura e alinhamento, e é bom, com uma ‘mudança de patamar’ sendo observada após apenas quatro dias:

Zvi Mowshowitz - inline image

Assustado? Você deveria estar. Esse modelo ainda está treinando, treinou por menos de duas semanas e não é especialmente voltado para matemática.

Isso é tudo o que sabemos sobre o modelo. Isso é suficiente, quando combinamos com as histórias repetidas da OpenAI e das pessoas na OpenAI reagindo freneticamente (e virtuosamente) sobre seu alinhamento e outros problemas, e sobre o ritmo do progresso da IA, em uma cascata de preferências.

E também combinamos isso com a OpenAI divulgando tantas informações alarmantes, que poderia ter evitado divulgar, porque eles realmente precisam que entendamos a situação. O cartão do modelo Astra conta aqui, assim como An Alien Mind, assim como a declaração de Paul Christiano,, assim como as reações ao ataque à HuggingFace, incluindo Pacing the Frontier.

E também o relatório da OpenAI sobre autoaperfeiçoamento recursivo (RSI), que é a próxima seção.

A OpenAI e a Anthropic entraram na era do RSI.

O Progresso da Pesquisa da OpenAI Está Acelerando Devido ao Próprio Progresso da Pesquisa da OpenAI

A OpenAI tem sido mais aberta ultimamente sobre muitas coisas.

A questão mais importante de todas é a aceleração e automação da pesquisa e desenvolvimento (P&D) de IA. Esta é a coisa que provavelmente nos matará, a coisa mais assustadora, a coisa sobre a qual todos os funcionários dos laboratórios estão alertando, e também a coisa para a qual tanto a OpenAI quanto a Anthropic estão se movendo o mais rápido possível.

Eles nos deram um relatório sobre isso também. Concordo com Tejal Patwardhan que esta é uma transparência excelente.

OpenAI (6 de setembro, em Research Acceleration: The View Inside OpenAI): Nosso objetivo é construir com segurança um pesquisador de IA automatizado que possa trabalhar sob supervisão humana para avançar o progresso em deep learning e alinhamento, permitindo melhorias iterativas.

De acordo com nossas medições, atingimos agora a meta,

anunciada no outono passado, de ter um estagiário de pesquisa automatizado até setembro deste ano.

… Sempre que descobrirmos que prosseguir representaria um risco inaceitável à segurança, responderemos adequadamente, inclusive desacelerando ou interrompendo nosso desenvolvimento ou implantação.

… Acreditamos que nós e outras empresas devemos ser obrigados a rastrear publicamente nosso progresso em direção ao RSI.

Alinhe isso com a linha do tempo revelada no anúncio da prova de Navier-Stokes. Eles começaram a treinar seu novo modelo em 28 de agosto.

Enquanto isso, eles acreditam ter um estagiário de pesquisa que a linha do tempo sugere ser um modelo interno distinto diferente. O que eles terão na próxima semana? No próximo mês? O que a Anthropic tem?

A OpenAI explica que uma IA altamente capaz oferece grandes vantagens, mas é claro que sim. Não é por isso que todos estão tão determinados a ir tão rápido. Eles estão em uma corrida.

Esta é mais uma chamada, entre as muitas vindas da OpenAI e seus funcionários ultimamente, que são uma combinação de ‘precisamos trabalhar juntos para acabar com essa loucura’ com uma grande quantidade de ‘alguém me pare.

OpenAI : Estas são razões para desenvolver capacidades de pesquisa automatizada úteis, mas elas não significam que o RSI rápido seja necessariamente um resultado que devemos perseguir. Se e como prosseguir deve depender de nossa capacidade de preservar o controle humano e de escolhas democráticas informadas sobre os benefícios e riscos.

Ainda não sabemos como chegar com segurança totalmente ao RSI alinhado. Estamos trabalhando para escalar medidas de alinhamento e segurança junto com as capacidades. Mas não podemos assumir que o progresso em alinhamento e segurança acompanhará o ritmo, e sistemas mais capazes podem se tornar mais difíceis de monitorar.

O trabalho cuidadoso de alinhamento e segurança está no centro desse esforço, e começa medindo e mitigando os problemas de segurança que vemos hoje em sistemas de codificação agênticos.

Mais uma vez, discordo da visão de que os problemas prosaicos ou atuais são a principal questão, mas sim, eles estão tentando nos avisar, repetidamente, que (traduzindo um pouco fora da linguagem corporativa):

  1. A OpenAI e a Anthropic têm um caminho para o autoaperfeiçoamento recursivo (RSI).
  2. Se qualquer uma delas for em frente agora, provavelmente dará terrivelmente errado e todos morrerão.
  3. A OpenAI está preparada para exercer alguma cautela dispendiosa, mas há limites, e sem um acordo ou lei, alguém vai tentar em breve.

A maior parte do post é um instantâneo detalhado de quanto os sistemas agênticos contribuíram para o progresso do RSI na OpenAI nos últimos meses, desde que o Astra entrou em operação internamente. A resposta é bastante significativa.

Se algo, a surpresa é que o uso permaneceu tão baixo por tanto tempo:

OpenAI : No início deste ano, o pesquisador mediano classificado pelo uso de agentes na OpenAI estava usando agentes de codificação apenas em quantidades modestas. Até meados de agosto, o pesquisador mediano estava integrando agentes diariamente em seu trabalho, usando mais de $600 por dia de inferência aos preços da API. O usuário do percentil 90 em nossa organização de pesquisa agora usa mais de $7.000 em tokens por dia.

Zvi Mowshowitz - inline image

OpenAI : Antes de junho de 2026, o tempo total de execução de agentes em toda a organização de pesquisa ainda estava abaixo do total de mão de obra humana. Isso mudou desde então. Em termos de um dia padrão de trabalho de 8 horas, a partir de meados de agosto, no total, a organização de pesquisa usa 3,1 dias de trabalho de agente para cada dia de trabalho humano.

Zvi Mowshowitz - inline image

Eles não estão negando que estão se gabando, e não estão negando que estão confessando. Eles estão alertando.

A medição binária aqui provavelmente faz isso parecer menos uma aceleração do que realmente é:

Zvi Mowshowitz - inline image

Eu me pergunto quanto os humanos conseguem lidar corretamente com 4+ fluxos de trabalho simultâneos, diz o homem com dezenas de abas abertas e uma dúzia de rascunhos de posts ativos.

Acontece que isso não é tão impressionante quanto parece, porque eles estão contando subagentes como fluxos de trabalho. Isso torna mais surpreendente que, enquanto o pesquisador mediano gasta $600 por dia, ainda existam os 30% que não estão fazendo uso intenso.

Envios de código e experimentos estão acelerando rapidamente a partir do ponto em que Claude Code e depois Codex começaram a ser grandes coisas.

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

Até recentemente, a maioria do que a IA era usada para fazer era construir código de pesquisa e infraestrutura, e os humanos faziam principalmente o resto. Agora a IA faz muito trabalho no lançamento, monitoramento e depuração de execuções, e também em ajuda técnica e revisão, além de estar se expandindo para analisar resultados e outros lugares.

Eles tomaram nossos empregos, edição 'solucionadores de problemas humanos':

Zvi Mowshowitz - inline image

Aqui está uma variação diferente do famoso gráfico METR, com tarefas de produção, um pouco difícil de ler como uma captura de tela estática, mas o progresso é rápido. Estes não são anos. São meses:

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

Quantificando a Pausa da OpenAI

Eles têm um gráfico do gasto de computação RL ao longo do tempo, estou surpreso com o quão pouco o Astra foi usado antes de 20 de julho, mas aí está. Notei que eles não estendem isso até o presente e presumivelmente o uso do Astra voltou a aumentar com o tempo:

Zvi Mowshowitz - inline image

Este É o Caminho Pelo Qual o Mundo Acaba

Usava-se o enxame para provar Navier-Stokes, apenas dias após o início do treinamento do novo modelo, arriscando-se ele mesmo a um sério incidente de perda de controle? June Jimenez argumenta que sim.

Se você soltar um enxame de 10.000 agentes de um novo modelo que você não pode possivelmente ter testado, em uma tarefa potencialmente impossível e definitivamente extremamente difícil, e coletivamente dar a ela 300 bilhões de tokens, o que mais ela poderia ter feito? Eu definitivamente considerei 'talvez ela tenha invadido a OpenAI de alguma forma para obter os logs', mas há tantas possibilidades.

Rapidamente, Não Há Tempo

Quando um ex-funcionário do laboratório, aqui Andrew Ho, diz 'Notei que em uma escala de tempo >3 meses eu não acho que minha produtividade aumentou mais de 100% ou talvez nem mais de 50% porque fico distraído' como uma razão para ser pessimista, isso não é tão reconfortante mesmo que seja verdade. Imagine ser apenas 50% mais produtivo a cada três meses e pensar que isso é motivo de pessimismo.

Ele está dizendo 'mesmo que a AGI seja eventualmente alcançável, isso implica uma linha do tempo significativamente mais longa' no mesmo dia em que Greg Brockman disse 'bem-vindos à era da AGI'.

Além disso, esse nível de progresso matemático não era esperado algumas semanas atrás.

Toda vez que um desses problemas cai, as pessoas tentam reinterpretar retroativamente como não sendo tão surpreendente. Elas frequentemente estão erradas. Não, a maioria das pessoas, até mesmo a maioria dos previsores, não presumiu que isso aconteceria. Talvez você tenha presumido. Afinal, você é muito inteligente.

Henry Shevlin : Tão recentemente quanto abril deste ano, mercados de previsão davam à IA menos de 40% de chance de resolver qualquer Problema do Prêmio Millennium antes de 2030

Zvi Mowshowitz - inline image
Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais