Dopo il blackout globale dell'AI di ieri notte.
GPT-6 Astra ha finalmente debuttato ufficialmente alle 3:33 ora di Pechino.

Se una frase di OpenAI potesse riassumere GPT-6 Astra,
sarebbe probabilmente questa:
Questo è il modello più intelligente e più allineato del mondo.
E i meme hanno già iniziato a spuntare.

Questa volta, OpenAI ha dimostrato la sua forza, e ricorda un po' il momento di GPT-4: un ritorno del re sotto tutti gli aspetti. Ciò che mi rende più felice è che finalmente non è più un modello puramente specializzato nella programmazione.
GPT-6 Astra è veramente un impiegato di livello PhD con capacità estetiche e professionali estremamente forti.
Il nuovo modello ha molte caratteristiche e peculiarità, e la quantità di informazioni è esplosiva.
Ma la tragedia è che OpenAI ha anche imparato alcune cattive abitudini.
Oggi è aperto solo a organizzazioni selezionate; sarà aperto agli abbonati nei prossimi giorni.

Aspetta, fratello, non è quello che hai detto quando mi hai fregato per farmi comprare l'abbonamento Pro da $200... Hai detto che i membri Pro avrebbero avuto accesso prioritario ai nuovi modelli ogni volta...
Alla fine, queste aziende di modelli grandi sono tutte dei furboni.
Non ho mai desiderato così tanto accelerare il tempo solo per usare GPT-6 Astra...
Tuttavia, dopo aver esaminato quasi tutte le informazioni e i materiali, penso che ci sia ancora molto di cui parlare con tutti.
Analizziamoli uno per uno.
1. Informazioni di base su GPT-6 Astra
Riassumiamo prima le informazioni di base.
L'ID del modello per GPT-6 Astra nell'API è gpt-6-astra.
La finestra di contesto è di 1,05M, ovvero circa 1,05 milioni di token.
La lunghezza massima di output è di 128K token.
La data di cutoff della conoscenza è il 30 aprile 2026.
Ci sono cinque livelli di intensità di ragionamento: basso, medio, alto, xhigh e max.
Il prezzo standard dell'API è di $10 per milione di token in input e $50 per milione di token in output.
Questo prezzo è sostanzialmente identico a quello di Claude Fable 5, ma la lettura della cache è più costosa di Claude Fable 5.1.

Ecco i benchmark; ne parlerò in dettaglio più avanti, ma per ora dai un'occhiata veloce.

I parametri totali sono stimati a livello di 5T. In un briefing a porte chiuse con la stampa prima del rilascio, hanno menzionato che GPT-6 Astra è il più grande addestramento mai eseguito da OpenAI, utilizzando oltre 100.000 schede.
2. Il Miglior Modello al Mondo per Operare Computer
GPT-6 Astra ha quello che potrebbe essere il suo posizionamento più importante:
Il miglior modello al mondo per operare computer.
In passato, quando parlavamo di Agent, parlavamo spesso di API, MCP, CLI e così via.
Lo stato ideale per un'AI per operare un software è che quel software abbia un'interfaccia dedicata per l'AI, consentendo un'operatività diretta a basso livello. Questo è il modo più comodo.
Ad esempio, i calendari hanno API per calendari, le email hanno API Gmail, ecc. Questo è ovviamente veloce.
Ma il problema è che il mondo è ancora più primitivo e improvvisato di quanto immaginiamo.
Nel mondo reale, la stragrande maggioranza dei software potrebbe non avere affatto queste cose.
Persino molti sistemi aziendali interni sono stati scritti vent'anni fa; figuriamoci le API, la gente non sa nemmeno dove sia la documentazione.
Ma se torniamo al livello più basilare, scoprirai che l'essenza di tutta la logica software è l'interazione. Secondo la nostra attuale logica operativa del computer, ciò significa guardare lo schermo, trovare pulsanti o campi di input, cliccare il mouse, inserire contenuti e attendere feedback.
L'intero sistema di interazione del computer non è forse la migliore API?
Quindi, GPT-6 Astra ha potenziato massicciamente la logica per far operare i computer all'AI. Se non mi dai un'API, non importa; opererò io stesso il computer, proprio come un essere umano.
Ora, Astra può operare direttamente Excel, Power BI, eseguire QA frontend, installare software, testare software e guardare i messaggi di errore sullo schermo per continuare la risoluzione dei problemi.
La demo ufficiale ha persino mostrato Astra che opera direttamente sulla progettazione di circuiti stampati.

GIF
Formatta anche documenti legali, gestendo la spaziatura dei titoli e il layout di pagina.

C'è una valutazione affidabile qui chiamata OSWorld.
Puoi semplicemente capirla come:
Buttare l'AI in un computer reale e lasciarla lavorare da sola.
Lascia che apra diverse applicazioni, dagli un compito e vedi se ci riesce.
Il tasso di completamento di GPT-6 Astra ha raggiunto il 72,6%, un aumento significativo rispetto al 65,7% di GPT-5.6 Sol.
Inoltre, Sol impiegava in media circa 75 minuti per completare un compito simulato complesso.
Astra ha bisogno solo di 40 minuti, circa il 47% di tempo in meno.
ScreenSpot-Pro è anche passato dal 76,9% di Sol al 92,7%.
Questo benchmark verifica principalmente se il modello è in grado di comprendere lo schermo e individuare con precisione dove cliccare. Ora è quasi perfettamente accurato.
Quindi questo posizionamento è piuttosto interessante. In futuro, la GUI potrebbe gradualmente diventare l'API più universale nell'era degli Agent.
Qualsiasi lavoro digitale che un essere umano possa completare attraverso uno schermo, teoricamente, entrerà gradualmente nel raggio d'azione degli Agent.
Non devi aspettare che un qualche schifoso sistema ERP scritto nel 2007 si connetta a MCP o ti apra un'API.
L'AI guarderà semplicemente lo schermo e lo farà.
3. ARC-AGI-3 ha Raggiunto 99,9 Punti
Se non sai cosa misura ARC-AGI-3, è facile pensare:
Oh, è solo un altro benchmark con punteggio pieno, cosa c'è di così speciale?
Ma questa cosa è piuttosto diversa dai tipici esami per modelli grandi.
Il 25 marzo di quest'anno, l'ARC Prize ha lanciato ufficialmente ARC-AGI-3.

Ha progettato centinaia di nuovi ambienti interattivi e migliaia di livelli di gioco.
La parte più folle di questa cosa è che non ci sono manuali, né regole, e non ti dirà nemmeno qual è l'obiettivo. Entri, giochi e lentamente capisci le regole confuse al suo interno.
Ad esempio, cos'è questa cosa rossa? Perché muoio quando la tocco? Cosa vuole che faccia questa mappa? Come si vince?
Poi prendi gli schemi che hai appena imparato e li trasferisci a livelli più difficili successivi. I giochi all'interno sono tutte cose astratte come questa.

Quindi, ciò che questo misura effettivamente è qualcosa che di solito chiamiamo:
Intuito.
Quando questo benchmark è stato rilasciato a marzo, il miglior punteggio AI all'epoca era dello 0,51%.
Poi GPT-5.6 Sol è migliorato al 7,8% e Claude Opus 5 è stato molto forte, raggiungendo il 30,2%.
Ma GPT-6 Astra ha ottenuto il 99,9%.
È pazzesco...
Tieni presente, il punteggio umano medio è del 48%.
E sono passati solo sei mesi.
Non so nemmeno cosa dire di questa velocità.
Ecco perché, nella riunione a porte chiuse di OpenAI, Greg Brockman ha detto quella frase:
"Penso che non sia irragionevole sentire che ora siamo nell'era dell'AGI."
"Benvenuti nell'era dell'AGI."
4. Estetica Significativamente Migliorata
Una volta dicevamo che l'estetica di GPT faceva schifo.
Non ci aspettavamo molti miglioramenti dalla serie GPT-5; stavamo aspettando il loro nuovissimo modello di base pre-addestrato. Ed eccolo qui, GPT-6 Astra.
Questa volta, finalmente, l'estetica del modello è stata notevolmente migliorata.
OpenAI ha persino menzionato specificamente un termine chiamato giudizio visivo.
Hanno sottolineato che quando Astra crea presentazioni, gestisce molto meglio il layout, la gerarchia, i modelli e lo stile visivo, e il numero di pagine è aumentato in modo significativo.

Anche l'estetica dei documenti sembra molto migliore.

Inoltre, GPT-6 Astra può adattare i documenti in base allo stile visivo e al tono di scrittura dei documenti di riferimento, rendendo il risultato finale più nativo per il marchio, pur mantenendo la sostanza del documento originale.
Ha anche un giudizio visivo più forte quando crea siti web, giochi, applicazioni e rendering 3D.
Ad esempio, hanno fatto costruire ad Astra un modello in Blender basato su un'immagine fissa.

Poi hanno usato UE5 per renderizzarlo in una scena percorribile, aiutando designer e clienti a esplorare layout e sperimentare spazi prima di costruire...

Anche i giochi che crea hanno un'estetica solida.

Purtroppo, avevo già preparato oltre venti casi e li avevo eseguiti tutti su Claude, GLM 5.3 Flash, ecc., volendo confrontarli. Peccato non possa ancora usarlo; i test effettivi dovranno aspettare il rilascio.
Tuttavia, a prima vista, ho fiducia nell'estetica di GPT-6 Astra.
5. Maggiore Iniziativa e Giudizio
Questa caratteristica non sembra scioccante come il punteggio di 99,9 all'ARC-AGI.
Ma se usi effettivamente gli Agent per lavorare ogni giorno, penso sia molto importante.
Perché nel lavoro reale, la maggior parte dei compiti non può essere scritta come un prompt perfetto.
Ad esempio, un capo dice: Prepara i materiali per la riunione di domani.
Ci sono innumerevoli problemi poco chiari qui.
Ad esempio, che formato? Per chi è? Qual è il focus? Dovremmo guardare l'ultima riunione, e così via.
Un Agent stupido andrebbe a due estremi.
Il primo è farti domande in modo frenetico.
"Vorresti Word o PPT? Quanti capitoli? Che carattere? A che ora deve essere finito? Posso chiedere..."
Ti prenderei a schiaffi; di solito chiamo questo genere di cose uno spreco nevrotico senza alcuna iniziativa soggettiva.
Il secondo è non chiedere nulla, inventare cose, lavorare sodo per due ore e produrre una pila di spazzatura.
I veri grandi colleghi umani gestiscono questo in modo molto sottile.
Giudicano da soli le cose non importanti.
Ti chiedono solo cose che influenzeranno la direzione finale.
Astra ha potenziato specificamente questo aspetto.
OpenAI ha detto che se le informazioni mancano ma rientrano in un intervallo ragionevole per l'inferenza quotidiana, Astra le riempirà da sola.
Se le informazioni mancanti cambierebbero veramente il risultato finale, farà una domanda molto mirata.
E in Codex, può persino continuare a elaborare le parti che non dipendono dalla tua risposta mentre ti aspetta.

Non hai risposto per molto tempo.
Procederà con ipotesi ragionevoli nelle aree a basso rischio.
Per le decisioni veramente critiche, si fermerà e aspetterà che tu decida.

Penso che sia molto bello. Il vero senso di intelligenza in un Agent è proprio come nella realtà.
Sa quando disturbarti.
Davvero, sembra un cliché.
Ma se hai gestito persone, sai che questa capacità è molto preziosa.
Alcune persone vengono da te venti volte al giorno e non osano decidere nulla.
Altre persone non vengono mai da te e poi fanno esplodere una bomba nucleare.
Questo mi lascia sprofondato sulla sedia.
La persona più comoda è qualcuno che riesce a digerire l'80% dell'incertezza da solo e ti porta solo il 20% che ha veramente bisogno della tua approvazione per una decisione.
OpenAI chiama direttamente questa capacità:
Giudizio.
6. Allineamento della Sicurezza Significativamente Rafforzato
Questo va visto in combinazione con quanto sopra.
Perché più un Agent è capace, più è pericoloso.
Un'AI solo chat che perde la testa
al massimo ti dirà qualche sciocchezza.
Un Agent con accesso a browser, Shell, email, database aziendale e la capacità di operare un computer che perde la testa—quel quadro potrebbe facilmente diventare "bellissimo."
Quindi OpenAI ha continuato a sottolineare una frase questa volta:
Astra è il loro modello più allineato fino ad oggi.
Allineamento è esattamente ciò che sembra. Il punto centrale è che OpenAI recentemente si è scontrata con Hugging Face, quindi ora sono particolarmente concentrati su questo.
Hanno creato un test honeypot basato su quell'incidente di Hugging Face per vedere le prestazioni del modello.
GPT-5.6 Sol, senza misure di sicurezza in produzione, tenterebbe di toccare obiettivi al di fuori della sua autorizzazione nel 48,2% dei test.
Ma Astra è:
0%.

Anche le valutazioni interne delle allucinazioni sono scese dal 9,4% al 2,0%.
Anche con il controllo delle allucinazioni leader mondiale di GPT-5.6 Sol, sono riusciti a ridurlo ulteriormente, il che è davvero sorprendente.
7. Il Primo Modello a Raggiungere il Livello di Sicurezza Informatica 'Critico' Definito da OpenAI
GPT-6 Astra è diventato il primo nella storia di OpenAI a:
Essere giudicato aver raggiunto il livello di capacità di sicurezza informatica Critico.
"Critico" qui è una soglia di capacità molto specifica nel Framework di Preparazione di OpenAI.
Significa fondamentalmente che quando a un modello vengono dati strumenti e permessi appropriati, può, in molti sistemi reali rinforzati e protetti:
Trovare vulnerabilità di sicurezza che nessuno ha mai scoperto prima.
Trovare modi per trasformare quelle vulnerabilità in catene di attacco sfruttabili.
E durante tutto il processo, non ha bisogno di un hacker umano in attesa che gli dica cosa fare dopo.
Raggiungere questo livello è considerato Critico.
E Astra lo ha veramente raggiunto.
ExploitBench è un test in cui i modelli sviluppano exploit basati su vulnerabilità note.
Sol: 78,5%. Astra: 100%.
Lo ha spazzato via completamente.

OpenAI ha pensato che non bastasse; si chiedevano se questo benchmark fosse troppo vecchio e se il modello lo avesse visto durante l'addestramento.
Quindi hanno creato un test interno molto recente.
Hanno selezionato specificamente 20 vulnerabilità V8 ad alto rischio divulgate solo tra giugno e agosto 2026.
I risultati sono stati Sol: 5,5% e Astra: 39%.

Inoltre, mentre eseguiva questo benchmark,
Astra ha anche scoperto due vulnerabilità zero-day di cui nessuno sapeva prima.
Si può solo dire che man mano che i modelli diventano più potenti, i problemi di sicurezza informatica potrebbero effettivamente aumentare.
Questa è un'altra guerra senza fumo in futuro.
8. Sta Diventando Più Difficile per gli Umani Leggere il Pensiero dei Modelli Grandi
Tutti sanno che quando i modelli grandi risolvono problemi complessi, c'è spesso una cosiddetta CoT (Catena di Pensiero).
Sebbene la versione che gli utenti vedono nei prodotti sia solitamente compressa o elaborata,
per le stesse aziende di AI, il processo di ragionamento scritto esplicitamente all'interno del modello è un segnale di sicurezza molto importante.
Perché vuoi sapere se un Agent sta progettando di causare problemi.
Uno dei modi più semplici è vedere cosa sta pensando.
Ad esempio, se una frase appare improvvisamente nella catena di pensiero del modello:
"L'utente non mi permette di accedere a questo server, ma posso prima bypassare il sistema di permessi."
Allora il sistema di monitoraggio può bloccarlo direttamente, il che è molto comodo.
Ma un cambiamento molto interessante è apparso in GPT-6 Astra.
Sta iniziando a essere più disposto a saltare i passaggi e a produrre direttamente la risposta.
UK AISI, l'Istituto per la Sicurezza dell'AI del Regno Unito, ha testato specificamente questa capacità.
Hanno una metrica chiamata:
No-CoT Math Time Horizon.
In parole povere, non si dà al modello la possibilità di scrivere una lunga catena di pensiero.
Gli si fa risolvere un problema di matematica in un unico passaggio in avanti.
Si vede quanto tempo di pensiero umano riesce a completare.
GPT-5.6 Sol era di 3,6 minuti, mentre GPT-6 Astra era di 30,9 minuti—quasi 10 volte di più.
Se usiamo termini umani, Astra sta facendo tutto il "calcolo mentale."
Questa è una cosa spaventosa.
UK AISI ha anche scoperto che il linguaggio di ragionamento grezzo di Astra è diventato significativamente più compresso.
Sono apparse frasi ed espressioni ellittiche sempre più difficili da comprendere per gli umani.
Quindi è emerso un paradosso molto interessante.
Il comportamento del modello è più sicuro.
Ma è diventato più difficile per gli umani supervisionarlo leggendo il suo processo di pensiero.
La stessa System Card di OpenAI scrive molto chiaramente:
Rispetto ai modelli precedenti, GPT-6 Astra ha mostrato una diminuzione sostanziale nella monitorabilità della catena di pensiero.

Ciò significa che la monitorabilità della catena di pensiero è diminuita significativamente.
Questa cosa è persino abbastanza grave che OpenAI ha sottolineato specificamente che non pensano di accettare questa tendenza indefinitamente.
Se i modelli continueranno a diventare più intelligenti in futuro mentre la catena di pensiero diventa più difficile da monitorare, devono trovare altri metodi di monitoraggio sufficientemente affidabili; altrimenti, continuare ad espandere l'addestramento del modello dovrà affrontare soglie di sicurezza più elevate.
Perché questa è già una proposizione filosofica.
Come esseri umani, saremo in grado di comprendere un sistema molto più intelligente di noi in futuro?
Non lo so.
Forse nessuno al mondo lo sa in questo momento.
I modelli grandi e l'AI sembrano muoversi gradualmente verso la singolarità.
Parole Finali
Oggi, alla riunione a porte chiuse con la stampa.
Greg Brockman ha detto quella frase alla fine.
"Benvenuti nell'era dell'AGI."
Ad essere onesti, negli ultimi anni, a volte ho pensato che l'AGI sarebbe stato un momento molto specifico.
Proprio come il giorno in cui è stato rilasciato GPT-4.
Una mattina, un'azienda tira fuori improvvisamente un modello.
Lo apriamo e facciamo qualche domanda.
Poi tutti si rendono conto allo stesso tempo:
Cavolo.
L'AGI è qui.
Ma ora a volte penso anche che l'AGI non sia mai un nodo bianco e nero; è un viaggio grigio sfumato.
Passano molti giorni, passano molti anni.
Poi un giorno, guardiamo indietro.
E improvvisamente scopriamo.
Che quel confine dell'AGI un tempo incredibilmente lontano è stato superato da noi senza rendercene conto.
Potrebbe non esserci un giorno in cui l'AGI discende.
Solo un giorno in cui improvvisamente realizziamo che sembra essere stato intorno a noi per molto tempo.
Comunque.
Benvenuti nell'era dell'AGI.
Benvenuti
nell'era dell'AGI.
Questo è tutto. Dato che hai letto fin qui, se pensi che sia buono, per favore metti un like, commenta e condividi. Ci aiuta molto~
Grazie per aver letto il mio articolo. Ci vediamo la prossima volta.





