Após a interrupção global de IA da noite passada.
O GPT-6 Astra finalmente fez sua estreia oficial às 3:33 AM, horário de Pequim.

Se uma frase da OpenAI pudesse resumir o GPT-6 Astra,
provavelmente seria esta:
Este é o modelo mais inteligente e mais alinhado do mundo.
E os memes já começaram a aparecer.

Desta vez, a OpenAI provou sua força, e parece um pouco com o momento do GPT-4 — um retorno do rei em todos os aspectos. O que mais me alegra é que, finalmente, este não é mais um modelo puramente especializado em programação.
O GPT-6 Astra é verdadeiramente um funcionário de nível PhD, com capacidades estéticas e profissionais extremamente fortes.
O novo modelo tem muitos recursos e características, e a quantidade de informação é explosiva.
Mas a tragédia é que a OpenAI também aprendeu alguns maus hábitos.
Hoje, ele está aberto apenas para organizações selecionadas; estará disponível para assinantes nos próximos dias.

Calma, irmão, não foi isso que você disse quando me convenceu a comprar a assinatura Pro de $200... Você disse que membros Pro teriam acesso prioritário aos novos modelos todas as vezes...
Acontece que essas empresas de modelos grandes são todas jogadoras.
Nunca quis tanto acelerar o tempo só para usar o GPT-6 Astra...
No entanto, depois de analisar quase todas as informações e materiais, acho que ainda há muito o que discutir com todos.
Vamos passar por eles um por um.
1. Informações Básicas do GPT-6 Astra
Vamos resumir as informações básicas primeiro.
O ID do modelo para o GPT-6 Astra na API é gpt-6-astra.
A janela de contexto é de 1,05M, ou seja, cerca de 1,05 milhão de tokens.
O comprimento máximo de saída é de 128K tokens.
A data de corte do conhecimento é 30 de abril de 2026.
Existem cinco níveis de intensidade de raciocínio: baixo, médio, alto, xalto e máximo.
O preço padrão da API é de $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída.
Este preço é basicamente idêntico ao do Claude Fable 5, mas a leitura de cache é mais cara que a do Claude Fable 5.1.

Aqui estão os benchmarks; vou discuti-los em detalhes depois, mas dê uma olhada rápida por enquanto.

Estima-se que o total de parâmetros esteja no nível de 5T. Em uma reunião fechada com a imprensa antes do lançamento, mencionaram que o GPT-6 Astra é o maior treinamento da OpenAI até hoje, usando mais de 100.000 placas.
2. O Melhor Modelo do Mundo para Operar Computadores
O GPT-6 Astra tem o que pode ser seu posicionamento mais importante:
O melhor modelo do mundo para operar computadores.
No passado, quando falávamos sobre Agentes, frequentemente falávamos sobre APIs, MCP, CLI e assim por diante.
O estado ideal para uma IA operar software é que esse software tenha uma interface dedicada para IA, permitindo operação direta em baixo nível. Isso é o mais conveniente.
Por exemplo, calendários têm APIs de calendário, e-mails têm APIs do Gmail, etc. Isso é obviamente rápido.
Mas o problema é que o mundo é ainda mais primitivo e improvisado do que imaginamos.
No mundo real, a grande maioria dos softwares pode nem ter essas coisas.
Até mesmo muitos sistemas internos de empresas foram escritos há vinte anos; esqueça APIs, as pessoas nem sabem onde está a documentação.
Mas se voltarmos ao nível mais básico, você descobrirá que a essência de toda lógica de software é a interação. De acordo com nossa lógica atual de operação de computador, isso significa olhar para a tela, encontrar botões ou caixas de entrada, clicar no mouse, inserir conteúdo e aguardar feedback.
Todo o sistema de interação do computador não é a melhor API?
Então, o GPT-6 Astra fortaleceu massivamente a lógica para a IA operar computadores. Se você não me der uma API, tudo bem; eu mesmo opero o computador, exatamente como um humano.
Agora, o Astra pode operar diretamente o Excel, Power BI, realizar QA de frontend, instalar software, testar software e olhar mensagens de erro na tela para continuar a solução de problemas.
A demonstração oficial até mostrou o Astra operando diretamente o design de placas de circuito.

GIF
Ele também formata documentos legais, lidando com espaçamento de títulos e layout de página.

Há uma avaliação confiável aqui chamada OSWorld.
Você pode simplesmente entender como:
Jogar a IA em um computador real e deixá-la trabalhar sozinha.
Deixe-a abrir vários aplicativos, dê a ela uma tarefa e veja se ela consegue.
A taxa de conclusão do GPT-6 Astra atingiu 72,6%, um aumento significativo em relação aos 65,7% do GPT-5.6 Sol.
Além disso, o Sol levou em média cerca de 75 minutos para concluir uma tarefa simulada complexa.
O Astra precisa apenas de 40 minutos, cerca de 47% menos tempo.
O ScreenSpot-Pro também saltou de 76,9% do Sol para 92,7%.
Este benchmark analisa principalmente se o modelo consegue entender a tela e localizar com precisão onde clicar. Agora está quase perfeitamente preciso.
Portanto, esse posicionamento é bastante interessante. No futuro, a GUI pode gradualmente se tornar a API mais universal na era dos Agentes.
Qualquer trabalho digital que um humano possa concluir através de uma tela, teoricamente, entrará gradualmente no alcance operacional dos Agentes.
Você não precisa esperar que algum sistema ERP horrível escrito em 2007 se conecte ao MCP ou abra uma API para você.
A IA vai apenas olhar para a tela e resolver.
3. ARC-AGI-3 Atingiu 99,9 Pontos
Se você não sabe o que o ARC-AGI-3 mede, é fácil pensar:
Ah, é apenas mais um benchmark com pontuação máxima, o que há de tão especial nisso?
Mas essa coisa é bem diferente dos exames típicos de modelos grandes.
Em 25 de março deste ano, o ARC Prize lançou oficialmente o ARC-AGI-3.

Ele projetou centenas de novos ambientes interativos e milhares de níveis de jogo.
A parte mais insana dessa coisa é que não há manuais, nem regras, e nem mesmo diz qual é o objetivo. Você simplesmente entra, joga e lentamente descobre as regras confusas lá dentro.
Por exemplo, o que é essa coisa vermelha? Por que eu morro quando toco nela? O que este mapa quer que eu faça? Como eu venço?
Então você pega os padrões que acabou de aprender e os migra para níveis mais difíceis depois. Os jogos lá dentro são todos coisas abstratas como esta.

Então, o que isso realmente mede é algo que geralmente chamamos de:
Sagacidade.
Quando este benchmark foi lançado em março, a melhor pontuação de IA na época era de 0,51%.
Então o GPT-5.6 Sol melhorou para 7,8%, e o Claude Opus 5 foi muito forte, alcançando 30,2%.
Mas o GPT-6 Astra marcou 99,9%.
Isso é insano...
Lembre-se, a pontuação humana média é de 48%.
E apenas seis meses se passaram.
Eu nem sei o que dizer sobre essa velocidade.
É por isso que, na reunião fechada da OpenAI com a imprensa, Greg Brockman disse aquela frase:
"Acho que não é irracional sentir que estamos agora na era da AGI."
"Bem-vindos à era da AGI."
4. Estética Significativamente Aprimorada
Costumávamos dizer que a estética do GPT era um lixo.
Não esperávamos muita melhora da série GPT-5; estávamos esperando seu novo modelo base pré-treinado. E aqui está ele, o GPT-6 Astra.
Desta vez, finalmente, a estética do modelo foi significativamente aprimorada.
A OpenAI até mencionou especificamente um termo chamado julgamento visual.
Eles enfatizaram que, quando o Astra faz PPTs, ele lida muito melhor com layout, hierarquia, modelos e estilo visual, e o número de páginas também aumentou significativamente.

A estética dos documentos também parece muito melhor.

Além disso, o GPT-6 Astra pode adaptar documentos com base no estilo visual e tom de escrita de documentos de referência, fazendo com que o resultado final pareça mais nativo da marca, mantendo a substância do documento original.
Ele também tem um julgamento visual mais forte ao criar sites, jogos, aplicativos e renderização 3D.
Por exemplo, eles pediram ao Astra para construir um modelo no Blender com base em uma imagem estática.

Então eles usaram UE5 para renderizá-lo em uma cena percorrível, ajudando designers e clientes a explorar layouts e experimentar espaços antes de construir...

Os jogos que ele cria também têm uma estética sólida.

Infelizmente, eu já tinha preparado mais de vinte casos e os executei todos no Claude, GLM 5.3 Flash, etc., querendo comparar. É uma pena que ainda não possa usá-lo; o conteúdo do teste real terá que esperar até que seja lançado.
No entanto, à primeira vista, tenho confiança na estética do GPT-6 Astra.
5. Maior Iniciativa e Julgamento
Este recurso não parece tão chocante quanto a pontuação de 99,9 no ARC-AGI.
Mas se você realmente usa Agentes para trabalhar todos os dias, acho que é muito importante.
Porque no trabalho real, a maioria das tarefas não pode ser escrita como um prompt perfeito.
Por exemplo, um chefe diz: Prepare os materiais para a reunião de amanhã.
Há inúmeras questões pouco claras aqui.
Por exemplo, qual formato? Para quem é? Qual é o foco? Devemos olhar a última reunião, e assim por diante.
Um Agente estúpido iria para dois extremos.
O primeiro é fazer perguntas freneticamente.
"Você gostaria de Word ou PPT? Quantos capítulos? Qual fonte? A que horas deve estar pronto? Posso perguntar..."
Eu te daria um tapa; geralmente chamo esse tipo de coisa de desperdício neurótico sem iniciativa subjetiva.
O segundo é não perguntar nada, inventar coisas, trabalhar duro por duas horas e produzir uma pilha de lixo.
Colegas humanos verdadeiramente excelentes lidam com isso de forma muito sutil.
Eles julgam coisas sem importância por conta própria.
Eles só perguntam sobre coisas que afetarão a direção final.
O Astra fortaleceu especificamente isso.
A OpenAI disse que, se faltar informação, mas estiver dentro de um intervalo razoável para inferência diária, o Astra a preencherá sozinho.
Se a informação faltante realmente mudar o resultado final, ele fará uma pergunta muito focada.
E no Codex, ele pode até continuar processando partes que não dependem da sua resposta enquanto espera por você.

Você não respondeu por um longo tempo.
Ele prosseguirá com suposições razoáveis em áreas de baixo risco.
Para decisões verdadeiramente críticas, ele irá parar e esperar você decidir.

Acho isso muito legal. O verdadeiro senso de inteligência em um Agente é exatamente como na realidade.
Ele sabe quando te incomodar.
Realmente, isso parece um clichê.
Mas se você já gerenciou pessoas, sabe que essa habilidade é muito preciosa.
Algumas pessoas vêm até você vinte vezes por dia e não ousam decidir nada.
Algumas pessoas nunca vêm até você e então soltam uma bomba nuclear.
Isso me deixa caído na minha cadeira.
A pessoa mais confortável é alguém que consegue digerir 80% da incerteza sozinha e só traz os 20% que realmente precisam da sua aprovação para você decidir.
A OpenAI chama diretamente essa habilidade de:
Julgamento.
6. Alinhamento de Segurança Significativamente Reforçado
Isso precisa ser visto em conjunto com o ponto acima.
Porque quanto mais capaz é um Agente, mais perigoso ele é.
Uma IA apenas de chat que perde o juízo
no máximo dirá alguns absurdos para você.
Um Agente com navegador, Shell, e-mail, acesso ao banco de dados da empresa e capacidade de operar um computador que perde o juízo — essa imagem pode facilmente se tornar "linda."
Então a OpenAI enfatizou uma frase desta vez:
O Astra é o modelo mais alinhado deles até hoje.
Alinhamento é o que parece. O cerne é que a OpenAI recentemente se desentendeu com a Hugging Face, então eles estão particularmente focados nisso agora.
Eles criaram um teste de honeypot baseado naquele incidente da Hugging Face para ver o desempenho do modelo.
O GPT-5.6 Sol, sem medidas de segurança de produção, tentaria tocar em alvos fora de sua autorização em 48,2% dos testes.
Mas o Astra é:
0%.

As avaliações internas de alucinação também caíram de 9,4% para 2,0%.
Mesmo com o controle de alucinação líder global do GPT-5.6 Sol, eles conseguiram reduzi-lo ainda mais, o que é verdadeiramente incrível.
7. O Primeiro Modelo a Atingir o Nível de Segurança Cibernética 'Crítico' Definido pela OpenAI
O GPT-6 Astra se tornou o primeiro na história da OpenAI a:
Ser julgado como tendo atingido o nível de capacidade de segurança cibernética Crítico.
"Crítico" aqui é um limite de capacidade muito específico no Estrutura de Preparação da OpenAI.
Significa basicamente que, quando um modelo recebe ferramentas e permissões apropriadas, ele pode, em muitos sistemas reais reforçados e protegidos:
Encontrar vulnerabilidades de segurança que ninguém descobriu antes.
Encontrar maneiras de transformar essas vulnerabilidades em cadeias de ataque exploráveis.
E durante todo o processo, não precisa de um hacker humano de prontidão para dizer o que fazer a seguir.
Atingir este nível é considerado Crítico.
E o Astra realmente atingiu.
O ExploitBench é um teste onde os modelos desenvolvem explorações com base em vulnerabilidades conhecidas.
Sol: 78,5%. Astra: 100%.
Ele limpou completamente.

A OpenAI achou que não era suficiente; eles se perguntaram se este benchmark era muito antigo e se o modelo o tinha visto durante o treinamento.
Então eles criaram um teste interno muito novo.
Eles escolheram especificamente 20 vulnerabilidades V8 de alto risco divulgadas apenas entre junho e agosto de 2026.
Os resultados foram Sol: 5,5% e Astra: 39%.

Além disso, enquanto executava este benchmark,
o Astra também descobriu duas vulnerabilidades de dia zero que ninguém conhecia antes.
Só podemos dizer que, à medida que os modelos se tornam mais poderosos, os problemas de segurança cibernética podem de fato aumentar.
Esta é outra guerra sem fumaça no futuro.
8. Está se Tornando Mais Difícil para os Humanos Lerem o Pensamento dos Modelos Grandes
Todo mundo sabe que, quando modelos grandes resolvem problemas complexos, muitas vezes há um chamado CoT (Cadeia de Pensamento).
Embora a versão que os usuários veem nos produtos seja geralmente comprimida ou processada,
para as próprias empresas de IA, o processo de raciocínio explicitamente escrito dentro do modelo é um sinal de segurança muito importante.
Porque você quer saber se um Agente está planejando causar problemas.
Uma das maneiras mais simples é ver o que ele está pensando.
Por exemplo, se uma frase aparece de repente na cadeia de pensamento do modelo:
"O usuário não me permite acessar este servidor, mas posso contornar o sistema de permissões primeiro."
Então o sistema de monitoramento pode bloqueá-lo diretamente, o que é muito conveniente.
Mas uma mudança muito interessante apareceu no GPT-6 Astra.
Ele está começando a pular etapas e produzir a resposta diretamente.
O UK AISI, o Instituto de Segurança de IA do Reino Unido, testou especificamente essa capacidade.
Eles têm uma métrica chamada:
No-CoT Math Time Horizon.
Simplificando, não dar ao modelo a chance de escrever uma longa cadeia de pensamento.
Deixá-lo resolver um problema de matemática em uma única passagem direta.
Veja quanto tempo de pensamento humano ele consegue completar.
O GPT-5.6 Sol foi de 3,6 minutos, enquanto o GPT-6 Astra foi de 30,9 minutos — quase 10 vezes mais.
Se usarmos termos humanos, o Astra está fazendo todo o "cálculo mental".
Isso é uma coisa assustadora.
O UK AISI também descobriu que a linguagem de raciocínio bruta do Astra se tornou significativamente mais comprimida.
Frases e expressões elípticas cada vez mais difíceis para os humanos entenderem apareceram.
Então, um paradoxo muito interessante surgiu.
O comportamento do modelo é mais seguro.
Mas tornou-se mais difícil para os humanos supervisioná-lo lendo seu processo de pensamento.
O próprio System Card da OpenAI escreve muito claramente:
Em comparação com modelos anteriores, o GPT-6 Astra mostrou uma diminuição substancial na monitorabilidade da cadeia de pensamento.

Isso significa que a monitorabilidade da cadeia de pensamento diminuiu significativamente.
Este assunto é tão sério que a OpenAI enfatizou especificamente que eles não acham que aceitarão essa tendência indefinidamente.
Se os modelos continuarem a ficar mais inteligentes no futuro enquanto a cadeia de pensamento se torna mais difícil de monitorar, eles precisam encontrar outros métodos de monitoramento suficientemente confiáveis; caso contrário, continuar a expandir o treinamento do modelo enfrentará limites de segurança mais altos.
Porque isso já é uma proposição filosófica.
Como humanos, seremos capazes de entender um sistema muito mais inteligente do que nós no futuro?
Eu não sei.
Talvez ninguém no mundo saiba agora.
Modelos grandes e IA parecem estar gradualmente se movendo em direção à singularidade.
Palavras Finais
Hoje, na reunião fechada com a imprensa.
Greg Brockman disse aquela frase no final.
"Bem-vindos à era da AGI."
Para ser honesto, nos últimos anos, às vezes senti que a AGI seria um momento muito específico.
Assim como o dia em que o GPT-4 foi lançado.
Uma manhã, uma empresa de repente lança um modelo.
Nós o abrimos e fazemos algumas perguntas.
Então todos percebem ao mesmo tempo:
Puta merda.
A AGI chegou.
Mas agora também sinto às vezes que a AGI nunca é um nó preto e branco; é uma jornada cinzenta de gradiente.
Muitos dias se passaram, muitos anos se passaram.
Então, um dia, olhamos para trás.
E de repente descobrimos.
Que aquela fronteira da AGI, outrora incrivelmente distante, foi cruzada por nós sem que percebêssemos.
Pode não haver um dia em que a AGI desça.
Apenas um dia em que de repente percebemos que ela parece estar ao nosso redor há muito tempo.
De qualquer forma.
Bem-vindos à era da AGI.
Bem-vindos à
era da AGI.
É isso. Já que você leu até aqui, se achou bom, por favor, dê um like, comente e compartilhe. Isso nos ajuda muito~
Obrigado por ler meu artigo. Nos vemos na próxima.





