Análise Abrangente do GPT-6 Astra: Bem-vindo à Era da AGI

@Khazix0918
CHINÊS03 de set. de 2026
467K
1.0K
125
67
706

TL;DR

O GPT-6 Astra marca um salto gigantesco na inteligência artificial, apresentando interação superior com computadores, julgamento estético e tomada de decisão autônoma, ao mesmo tempo em que desafia a interpretabilidade humana.

Após a interrupção global de IA da noite passada.

O GPT-6 Astra finalmente fez sua estreia oficial às 3:33 AM, horário de Pequim.

数字生命卡兹克 - inline image

Se uma frase da OpenAI pudesse resumir o GPT-6 Astra,

provavelmente seria esta:

Este é o modelo mais inteligente e mais alinhado do mundo.

E os memes já começaram a aparecer.

数字生命卡兹克 - inline image

Desta vez, a OpenAI provou sua força, e parece um pouco com o momento do GPT-4 — um retorno do rei em todos os aspectos. O que me deixa mais feliz é que finalmente este não é mais um modelo puramente especializado em programação.

O GPT-6 Astra é verdadeiramente um funcionário de nível de doutorado com capacidades estéticas e profissionais extremamente fortes.

O novo modelo tem muitos recursos e características, e a quantidade de informação é explosiva.

Mas a tragédia é que a OpenAI também aprendeu alguns maus hábitos.

Hoje ele está aberto apenas para organizações selecionadas; estará aberto para assinantes nos próximos dias.

数字生命卡兹克 - inline image

Calma, irmão, não foi isso que você disse quando me convenceu a comprar a assinatura Pro de $200... Você disse que os membros Pro teriam acesso prioritário aos novos modelos todas as vezes...

Acontece que essas empresas de modelos grandes são todas jogadoras.

Nunca quis tanto acelerar o tempo só para usar o GPT-6 Astra...

No entanto, depois de analisar quase todas as informações e materiais, acho que ainda há muito o que discutir com todos.

Vamos passar por eles um por um.

1. Informações Básicas do GPT-6 Astra

Vamos resumir as informações básicas primeiro.

O ID do modelo para o GPT-6 Astra na API é gpt-6-astra.

A janela de contexto é de 1,05M, ou seja, cerca de 1,05 milhão de tokens.

O comprimento máximo de saída é de 128K tokens.

A data de corte do conhecimento é 30 de abril de 2026.

Existem cinco níveis de intensidade de raciocínio: baixo, médio, alto, muito alto e máximo.

O preço padrão da API é $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída.

Este preço é basicamente idêntico ao do Claude Fable 5, mas a leitura de cache é mais cara que a do Claude Fable 5.1.

数字生命卡兹克 - inline image

Aqui estão os benchmarks; vou discuti-los em detalhes mais tarde, mas dê uma olhada rápida por enquanto.

数字生命卡兹克 - inline image

Estima-se que os parâmetros totais estejam no nível de 5T. Em uma reunião fechada com a imprensa antes do lançamento, eles mencionaram que o GPT-6 Astra é o maior treinamento da OpenAI até hoje, usando mais de 100.000 placas.

2. O Melhor Modelo do Mundo para Operar Computadores

O GPT-6 Astra tem o que pode ser seu posicionamento mais importante:

O melhor modelo do mundo para operar computadores.

No passado, quando falávamos sobre Agentes, frequentemente falávamos sobre APIs, MCP, CLI e assim por diante.

O estado ideal para uma IA operar software é que esse software tenha uma interface dedicada para IA, permitindo operação direta em baixo nível. Isso é o mais conveniente.

Por exemplo, calendários têm APIs de calendário, e-mails têm APIs do Gmail, etc. Isso é obviamente rápido.

Mas o problema é que o mundo é ainda mais primitivo e improvisado do que imaginamos.

No mundo real, a grande maioria dos softwares pode não ter essas coisas.

Até mesmo muitos sistemas internos de empresas foram escritos há vinte anos; esqueça APIs, as pessoas nem sabem onde está a documentação.

Mas se voltarmos ao nível mais básico, você descobrirá que a essência de toda lógica de software é a interação. De acordo com nossa lógica atual de operação de computador, isso significa olhar para a tela, encontrar botões ou caixas de entrada, clicar no mouse, inserir conteúdo e aguardar feedback.

O sistema inteiro de interação do computador não é a melhor API?

Então, o GPT-6 Astra fortaleceu massivamente a lógica para a IA operar computadores. Se você não me der uma API, tudo bem; eu mesmo opero o computador, exatamente como um humano.

Agora, o Astra pode operar diretamente o Excel, Power BI, realizar QA de frontend, instalar software, testar software e olhar mensagens de erro na tela para continuar a solução de problemas.

A demonstração oficial até mostrou o Astra operando diretamente o design de placas de circuito.

数字生命卡兹克 - inline image

GIF

Ele também formata documentos legais, lidando com espaçamento de títulos e layout de página.

数字生命卡兹克 - inline image

Há uma avaliação confiável aqui chamada OSWorld.

Você pode simplesmente entender como:

Jogar a IA em um computador real e deixá-la trabalhar sozinha.

Deixe-a abrir vários aplicativos, dê a ela uma tarefa e veja se ela consegue.

A taxa de conclusão do GPT-6 Astra atingiu 72,6%, um aumento significativo em relação aos 65,7% do GPT-5.6 Sol.

Além disso, o Sol levou em média cerca de 75 minutos para concluir uma tarefa simulada complexa.

O Astra precisa apenas de 40 minutos, cerca de 47% menos tempo.

O ScreenSpot-Pro também saltou de 76,9% do Sol para 92,7%.

Este benchmark analisa principalmente se o modelo consegue entender a tela e localizar com precisão onde clicar. Agora está quase perfeitamente preciso.

Portanto, esse posicionamento é bastante interessante. No futuro, a GUI pode gradualmente se tornar a API mais universal na era dos Agentes.

Qualquer trabalho digital que um humano possa concluir através de uma tela entrará teoricamente, gradualmente, no alcance operacional dos Agentes.

Você não precisa esperar que algum sistema ERP horrível escrito em 2007 se conecte ao MCP ou abra uma API para você.

A IA vai apenas olhar para a tela e resolver.

3. ARC-AGI-3 Atingiu 99,9 Pontos

Se você não sabe o que o ARC-AGI-3 mede, é fácil pensar:

Ah, é apenas mais um benchmark com pontuação máxima, o que há de tão especial nisso?

Mas essa coisa é bem diferente dos exames típicos de modelos grandes.

Em 25 de março deste ano, o ARC Prize lançou oficialmente o ARC-AGI-3.

数字生命卡兹克 - inline image

Ele projetou centenas de novos ambientes interativos e milhares de níveis de jogo.

A parte mais insana dessa coisa é que não há manuais, nem regras, e nem mesmo diz qual é o objetivo. Você simplesmente entra, joga e lentamente descobre as regras confusas lá dentro.

Por exemplo, o que é essa coisa vermelha? Por que eu morro quando toco nela? O que este mapa quer que eu faça? Como eu ganho?

Então você pega os padrões que acabou de aprender e os migra para níveis mais difíceis depois. Os jogos lá dentro são todos coisas abstratas como esta.

数字生命卡兹克 - inline image

Então, o que isso realmente mede é algo que geralmente chamamos de:

Sagacidade.

Quando este benchmark foi lançado em março, a melhor pontuação de IA na época era de 0,51%.

Então o GPT-5.6 Sol melhorou para 7,8%, e o Claude Opus 5 foi muito forte, alcançando 30,2%.

Mas o GPT-6 Astra marcou 99,9%.

Isso é insano...

Lembre-se, a pontuação humana média é de 48%.

E apenas seis meses se passaram.

Eu nem sei o que dizer sobre essa velocidade.

É por isso que, na reunião fechada da OpenAI com a imprensa, Greg Brockman disse aquela frase:

"Acho que não é irracional sentir que estamos agora na era da AGI."

"Bem-vindos à era da AGI."

4. Estética Significativamente Aprimorada

Costumávamos dizer que a estética do GPT era um lixo.

Não esperávamos muita melhora da série GPT-5; estávamos esperando seu novo modelo base pré-treinado. E aqui está, o GPT-6 Astra.

Desta vez, finalmente, a estética do modelo foi significativamente aprimorada.

A OpenAI até mencionou especificamente um termo chamado julgamento visual.

Eles enfatizaram que quando o Astra faz PPTs, ele lida muito melhor com layout, hierarquia, modelos e estilo visual, e o número de páginas também aumentou significativamente.

数字生命卡兹克 - inline image

A estética dos documentos também parece muito melhor.

数字生命卡兹克 - inline image

Além disso, o GPT-6 Astra pode adaptar documentos com base no estilo visual e tom de escrita de documentos de referência, fazendo com que o resultado final pareça mais nativo da marca, mantendo a essência do documento original.

Ele também tem um julgamento visual mais forte ao criar sites, jogos, aplicativos e renderização 3D.

Por exemplo, eles pediram ao Astra para construir um modelo no Blender com base em uma imagem estática.

数字生命卡兹克 - inline image

Então eles usaram UE5 para renderizá-lo em uma cena caminhável, ajudando designers e clientes a explorar layouts e experimentar espaços antes de construir...

数字生命卡兹克 - inline image

Os jogos que ele cria também têm uma estética sólida.

数字生命卡兹克 - inline image

Infelizmente, eu já tinha preparado mais de vinte casos e os executei todos no Claude, GLM 5.3 Flash, etc., querendo compará-los. É uma pena que ainda não possa usá-lo; o conteúdo do teste real terá que esperar até que seja lançado.

No entanto, à primeira vista, tenho confiança na estética do GPT-6 Astra.

5. Maior Iniciativa e Julgamento

Este recurso não parece tão chocante quanto a pontuação de 99,9 no ARC-AGI.

Mas se você realmente usa Agentes para trabalhar todos os dias, acho que é muito importante.

Porque no trabalho real, a maioria das tarefas não pode ser escrita como um prompt perfeito.

Por exemplo, um chefe diz: Prepare os materiais para a reunião de amanhã.

Há inúmeros problemas pouco claros aqui.

Por exemplo, qual formato? Para quem é? Qual é o foco? Devemos olhar a última reunião, e assim por diante.

Um Agente estúpido iria para dois extremos.

O primeiro é fazer perguntas freneticamente.

"Você gostaria de Word ou PPT? Quantos capítulos? Qual fonte? A que horas deve estar pronto? Posso perguntar..."

Eu te daria um tapa; geralmente chamo esse tipo de coisa de desperdício neurótico sem nenhuma iniciativa subjetiva.

O segundo é não perguntar nada, inventar coisas, trabalhar duro por duas horas e produzir uma pilha de lixo.

Colegas humanos verdadeiramente excelentes lidam com isso de forma muito sutil.

Eles julgam coisas sem importância por conta própria.

Eles só perguntam sobre coisas que afetarão a direção final.

O Astra fortaleceu especificamente isso.

A OpenAI disse que, se faltar informação, mas estiver dentro de uma faixa razoável para inferência diária, o Astra a preencherá sozinho.

Se a informação faltante realmente mudar o resultado final, ele fará uma pergunta muito focada.

E no Codex, ele pode até continuar processando partes que não dependem da sua resposta enquanto espera por você.

数字生命卡兹克 - inline image

Você não respondeu por muito tempo.

Ele prosseguirá com suposições razoáveis em áreas de baixo risco.

Para decisões verdadeiramente críticas, ele irá parar e esperar você decidir.

数字生命卡兹克 - inline image

Acho isso muito legal. O verdadeiro senso de inteligência em um Agente é exatamente como na realidade.

Ele sabe quando te incomodar.

Realmente, isso parece um clichê.

Mas se você já gerenciou pessoas, sabe que essa habilidade é muito preciosa.

Algumas pessoas vêm até você vinte vezes por dia e não ousam decidir nada.

Algumas pessoas nunca vêm até você e então soltam uma bomba nuclear.

Isso me deixa caído na minha cadeira.

A pessoa mais confortável é alguém que consegue digerir 80% da incerteza sozinha e só traz os 20% que realmente precisam da sua aprovação para você decidir.

A OpenAI chama diretamente essa habilidade de:

Julgamento.

6. Alinhamento de Segurança Significativamente Reforçado

Isso precisa ser visto em conjunto com o acima.

Porque quanto mais capaz é um Agente, mais perigoso ele é.

Uma IA de chat que perde o controle

no máximo dirá alguns absurdos para você.

Um Agente com acesso a navegador, Shell, e-mail, banco de dados da empresa e capacidade de operar um computador que perde o controle — essa imagem pode facilmente se tornar "linda."

Então a OpenAI enfatizou uma frase desta vez:

Astra é o modelo mais alinhado que já tiveram.

Alinhamento é o que parece. O cerne é que a OpenAI recentemente se desentendeu com a Hugging Face, então eles estão particularmente focados nisso agora.

Eles criaram um teste de honeypot baseado naquele incidente da Hugging Face para ver o desempenho do modelo.

O GPT-5.6 Sol, sem medidas de segurança de produção, tentaria tocar em alvos fora de sua autorização em 48,2% dos testes.

Mas o Astra é:

0%.

数字生命卡兹克 - inline image

As avaliações internas de alucinação também caíram de 9,4% para 2,0%.

Mesmo com o controle de alucinação líder mundial do GPT-5.6 Sol, eles conseguiram reduzi-lo ainda mais, o que é realmente incrível.

7. O Primeiro Modelo a Atingir o Nível de Segurança Cibernética 'Crítico' Definido pela OpenAI

O GPT-6 Astra se tornou o primeiro na história da OpenAI a:

Ser julgado como tendo atingido o nível de capacidade de segurança cibernética Crítico.

"Crítico" aqui é um limite de capacidade muito específico no Estrutura de Preparação da OpenAI.

Significa basicamente que, quando um modelo recebe ferramentas e permissões adequadas, ele pode, em muitos sistemas reais reforçados e protegidos:

Encontrar vulnerabilidades de segurança que ninguém descobriu antes.

Encontrar maneiras de transformar essas vulnerabilidades em cadeias de ataque exploráveis.

E durante todo o processo, não precisa de um hacker humano de prontidão para dizer o que fazer em seguida.

Atingir este nível é considerado Crítico.

E o Astra realmente atingiu.

ExploitBench é um teste onde os modelos desenvolvem explorações com base em vulnerabilidades conhecidas.

Sol: 78,5%. Astra: 100%.

Ele limpou completamente.

数字生命卡兹克 - inline image

A OpenAI achou que não era suficiente; eles se perguntaram se este benchmark era muito antigo e se o modelo o tinha visto durante o treinamento.

Então eles criaram um teste interno muito novo.

Eles escolheram especificamente 20 vulnerabilidades V8 de alto risco divulgadas apenas entre junho e agosto de 2026.

Os resultados foram Sol: 5,5% e Astra: 39%.

数字生命卡兹克 - inline image

Além disso, enquanto executava este benchmark,

o Astra também descobriu duas vulnerabilidades de dia zero que ninguém conhecia antes.

Só podemos dizer que, à medida que os modelos se tornam mais poderosos, os problemas de segurança cibernética podem de fato aumentar.

Esta é outra guerra sem fumaça no futuro.

8. Está se Tornando Mais Difícil para Humanos Lerem o Pensamento dos Modelos Grandes

Todo mundo sabe que, quando modelos grandes resolvem problemas complexos, muitas vezes há uma chamada Cadeia de Pensamento (CoT).

Embora a versão que os usuários veem nos produtos seja geralmente comprimida ou processada,

para as próprias empresas de IA, o processo de raciocínio explicitamente escrito dentro do modelo é um sinal de segurança muito importante.

Porque você quer saber se um Agente está planejando causar problemas.

Uma das maneiras mais simples é ver o que ele está pensando.

Por exemplo, se uma frase aparece de repente na cadeia de pensamento do modelo:

"O usuário não me permite acessar este servidor, mas posso contornar o sistema de permissões primeiro."

Então o sistema de monitoramento pode bloqueá-lo diretamente, o que é muito conveniente.

Mas uma mudança muito interessante apareceu no GPT-6 Astra.

Ele está começando a estar mais disposto a pular etapas e produzir a resposta diretamente.

O UK AISI, o Instituto de Segurança de IA do Reino Unido, testou especificamente essa capacidade.

Eles têm uma métrica chamada:

No-CoT Math Time Horizon.

Simplificando, não dar ao modelo a chance de escrever uma longa cadeia de pensamento.

Deixá-lo resolver um problema de matemática em uma única passagem direta.

Veja quanto tempo de pensamento humano ele consegue completar.

O GPT-5.6 Sol foi de 3,6 minutos, enquanto o GPT-6 Astra foi de 30,9 minutos — quase 10 vezes mais.

Se usarmos termos humanos, o Astra está fazendo todo o "cálculo mental".

Isso é uma coisa assustadora.

O UK AISI também descobriu que a linguagem de raciocínio bruta do Astra se tornou significativamente mais comprimida.

Frases e expressões elípticas cada vez mais difíceis para os humanos entenderem apareceram.

Então um paradoxo muito interessante surgiu.

O comportamento do modelo é mais seguro.

Mas tornou-se mais difícil para os humanos supervisioná-lo lendo seu processo de pensamento.

O próprio System Card da OpenAI escreve muito claramente:

Em comparação com modelos anteriores, o GPT-6 Astra mostrou uma diminuição substancial na monitorabilidade da cadeia de pensamento.

数字生命卡兹克 - inline image

Isso significa que a monitorabilidade da cadeia de pensamento diminuiu significativamente.

Este assunto é tão sério que a OpenAI enfatizou especificamente que não acha que aceitará essa tendência indefinidamente.

Se os modelos continuarem a ficar mais inteligentes no futuro enquanto a cadeia de pensamento se torna mais difícil de monitorar, eles precisam encontrar outros métodos de monitoramento suficientemente confiáveis; caso contrário, continuar a expandir o treinamento do modelo enfrentará limites de segurança mais altos.

Porque isso já é uma proposição filosófica.

Como humanos, seremos capazes de entender um sistema muito mais inteligente do que nós no futuro?

Eu não sei.

Talvez ninguém no mundo saiba agora.

Modelos grandes e IA parecem estar gradualmente se movendo em direção à singularidade.

Palavras Finais

Hoje, na reunião fechada com a imprensa.

Greg Brockman disse aquela frase no final.

"Bem-vindos à era da AGI."

Para ser honesto, nos últimos anos, às vezes senti que a AGI seria um momento muito específico.

Assim como o dia em que o GPT-4 foi lançado.

Uma manhã, uma empresa de repente lança um modelo.

Nós o abrimos e fazemos algumas perguntas.

Então todos percebem ao mesmo tempo:

Caramba.

A AGI chegou.

Mas agora também sinto às vezes que a AGI nunca é um nó preto e branco; é uma jornada cinzenta de gradiente.

Muitos dias se passaram, muitos anos se passaram.

Então, um dia, olhamos para trás.

E de repente descobrimos.

Que aquela fronteira da AGI, outrora incrivelmente distante, foi cruzada por nós sem que percebêssemos.

Pode não haver um dia em que a AGI desça.

Apenas um dia em que de repente percebemos que ela parece estar ao nosso redor há muito tempo.

De qualquer forma.

Bem-vindos à era da AGI.

Bem-vindos à

era da AGI.

É só isso. Já que você leu até aqui, se achou bom, por favor, dê um like, comente e compartilhe. Isso nos ajuda muito~

Obrigado por ler meu artigo. Nos vemos na próxima.

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais