Oltre il '98% AGI': il Passaggio all'IA che Completa Interi Lavori
Il 3 settembre 2026, OpenAI ha annunciato GPT-6 Astra.
Subito dopo il suo rilascio, l'attenzione si è concentrata sui suoi punteggi: circa il 98% sul difficile benchmark matematico "FrontierMath", il 99,9% su "ARC-AGI-3" per misurare le operazioni informatiche e il 100% sulla valutazione di cybersecurity "ExploitBench".
A guardare solo questi numeri, si potrebbe essere tentati di dire: "È arrivata un'IA quasi perfetta" o "L'AGI è finalmente completa".
Tuttavia, è pericoloso giudicare GPT-6 Astra esclusivamente in base ai punteggi dei benchmark.
Il cambiamento in Astra non riguarda solo la restituzione di testi più corretti in risposta alle domande.
Apre browser, legge documenti, esegue codice, aggiorna fogli di calcolo, opera su siti web, indaga sulle cause se fallisce a metà strada e, infine, restituisce un deliverable verificabile.
L'unità di lavoro affidata a ChatGPT è passata da "una singola domanda" a "una serie di operazioni aziendali".
)Se usi Astra solo per bozze di email o riassunti di testi come la ChatGPT tradizionale, rimane solo un'IA generativa di testo costosa. Il suo valore emerge quando le affidi compiti che gli umani gestivano cambiando schermo più volte, trattati come un processo coeso.(OpenAI
In questo articolo, approfondiremo oltre le presentazioni ufficiali delle funzionalità, analizzando casi confermati da aziende estere, come leggere i benchmark, confronti con Claude, prezzi, sicurezza e design per l'uso pratico da parte delle aziende giapponesi.
Cos'è GPT-6 Astra?
GPT-6 Astra è posizionato da OpenAI come il modello di punta della generazione GPT-6, descritto come il "modello più intelligente e più allineato".
Al lancio, viene distribuito prima a organizzazioni selezionate, seguito da ChatGPT Plus, Pro, Business, Enterprise, API e Amazon Bedrock. In Enterprise, è disattivato per impostazione predefinita fino all'attivazione da parte di un amministratore, e non c'è menzione esplicita di un rilascio per il piano gratuito nell'annuncio ufficiale.
)Il nome del modello sull'API è gpt-6-astra. Astra Pro, che utilizza un calcolo superiore, viene introdotto anche per gli utenti Pro, Business ed Enterprise.(OpenAI
Le specifiche principali sono riassunte di seguito:
Elemento | GPT-6 Astra |
|---|---|
Lunghezza del Contesto | 1.050.000 token |
Output Massimo | 128.000 token |
Data di Taglio della Conoscenza | 30 aprile 2026 |
Input | Testo, Immagine (Nativo) |
Output | Testo (Nativo) |
Livello di Ragionamento | basso / medio / alto / molto alto / massimo |
Prezzo Input API | $10 per 1M di token |
Prezzo Output API | $50 per 1M di token |
Input in Cache | $1 per 1M di token |
Fine-tuning | Non supportato |
Strumenti Principali | Ricerca Web, Ricerca File, Esecuzione Codice, Shell, Uso del Computer, MCP, Generazione Immagini, ecc. |
Sebbene possa leggere immagini, l'output nativo del modello è testo. La generazione di immagini viene eseguita chiamando uno strumento separato. Non è un modello per input audio o video diretto.
Inoltre, per input lunghi superiori a 272.000 token, si applica un moltiplicatore di prezzo all'intera richiesta. Le tariffe di input e cache sono raddoppiate e quelle di output sono 1,5x. Solo perché supporta 1,05 milioni di token non significa che dovresti inserire ogni documento interno ogni volta; l'efficienza dei costi crollerà prima dell'accuratezza.
Cosa è Cambiato con Astra?
- L'Operazione del Computer è Passata da "Ausiliaria" al Campo di Battaglia Principale
Al centro di Astra c'è "Computer Use".
Le IA precedenti potevano cliccare pulsanti o compilare moduli in un browser. Tuttavia, rimanevano problemi: si fermavano se il layout dello schermo cambiava leggermente, non riuscivano a riprendersi da errori a metà processo o perdevano di vista l'obiettivo in attività che coinvolgevano più siti.
GPT-6 Astra ha registrato il 72,6% su OSWorld 2.0, che misura le operazioni effettive in ambienti desktop. GPT-5.6 Sol era al 65,7%.
)Inoltre, Astra ha elaborato questa valutazione in circa 40 minuti, mentre Sol ha impiegato circa 75 minuti. Non solo il tasso di successo, ma anche il tempo di elaborazione è stato ridotto di circa il 47%. In ScreenSpot, che trova obiettivi sullo schermo, Astra ha ottenuto il 92,7% rispetto al 76,9% di Sol.(OpenAI
Questo è più di un semplice video demo fluido. Prende di mira attività come:
- Cercare ospedali o proprietà che corrispondono a criteri e confrontare candidati.
- Recuperare valori da più schermate di gestione per creare report.
- Inserire informazioni sui clienti nel CRM e aggiornare lo stato.
- Accedere a servizi web per verificare le impostazioni.
- Eseguire un'app creata in un browser e correggere bug.
- Completare fogli di calcolo o Slides facendo riferimento a più file.
In Mind2Web, Astra utilizzando un harness Codex aggiornato ha elaborato attività web 1,9 volte più velocemente dei modelli precedenti.
)La cosa importante qui è che le prestazioni sono determinate dall'"intero harness", inclusi browser, strumenti, ambiente di esecuzione e processo di verifica, non solo dall'intelligenza del modello. Semplicemente selezionare il nome Astra non automatizza automaticamente tutte le operazioni sullo schermo.(OpenAI
- Mantenere 1,05 Milioni di Token di Contesto Lungo Fino alla Fine
La lunghezza del contesto di GPT-6 Astra è di circa 1,05 milioni di token. Ha la capacità di gestire contratti, verbali, documenti di progettazione, codice sorgente e ricerche passate tutti insieme. Tuttavia, "adattare" e "usare accuratamente" sono cose diverse.
Nelle valutazioni MRCR per trovare informazioni incorporate in testi lunghi, Astra era al 100% nell'intervallo 256k–512k e al 96,3% nell'intervallo 512k–1M. Il risultato di GPT-5.6 Sol in quest'ultimo era del 73,8%.
)Sebbene Astra sia forte nei contesti lunghi, non memorizza perfettamente ogni singola parola quando inserisci 1 milione di token. Fallisce ancora circa il 3,7% delle volte nella banda di 1M di token. Evita progetti che inseriscono condizioni critiche in un solo punto di un documento enorme; devi dichiarare esplicitamente obiettivi, vincoli e condizioni di approvazione separatamente.(OpenAI
Astra ha anche meccanismi per aumentare la continuità nelle sessioni lunghe, come chiamate asincrone agli strumenti per lavorare su altre attività mentre si aspetta uno strumento, steering per consentire la correzione umana della rotta durante l'esecuzione e mantenimento della cache anche se i livelli di ragionamento vengono modificati a metà conversazione.
)Ci si sta allontanando da "scrivi un prompt perfetto e lascia perdere" verso un flusso di lavoro di "controllo dei progressi e correzione della rotta".(OpenAI Developers
- Creare Deliverable Finiti, Non Solo Testo
Astra ha rafforzato la sua capacità di creare deliverable come fogli di calcolo, Slides, documenti, app e report di ricerca. I modelli precedenti potevano creare uno "schema di presentazione", ma gli umani dovevano spostarlo in PowerPoint, regolare il design, riverificare i numeri e aggiungere link. Astra mira al livello successivo: leggere materiali o modelli aziendali, organizzare numeri, creare Slides/fogli di calcolo, controllarli in un browser e inviare i file corretti.
Il primo utilizzatore Higgsfield ha dichiarato che poteva elaborare attività agent con fino al 20% di token in meno rispetto ai modelli esistenti. Harvey ha elogiato il suo giudizio nel lavoro legale, Jane Street ha notato una riduzione dei back-and-forth per problemi tecnici complessi e Lovable ha apprezzato le sue capacità di iterazione/test a impostazioni di ragionamento elevate.
)Tuttavia, queste sono testimonianze di primi clienti, non la stessa cosa di prove provenienti da test di replica indipendenti di terze parti.(OpenAI
- Meno Probabile che "Dimentichi l'Obiettivo" Durante Attività Lunghe
Gli agent convenzionali a volte si allontanavano dal piano stabilito all'inizio—ossessionandosi con piccole refactoring mentre avrebbero dovuto implementare una funzionalità, o finendo solo con la raccolta di informazioni invece di una decisione finale. Astra ha migliorato la coerenza nel lavoro di lunga durata.
D'altra parte, i documenti ufficiali per sviluppatori notano che Astra potrebbe fermarsi per fare domande di chiarimento, formattare eccessivamente i dettagli, ripetere espressioni o testare più del necessario.
)In altre parole, prestazioni più elevate non significano che puoi dare istruzioni vaghe. Dovresti impostare obiettivi, condizioni di completamento, criteri per fare domande e operazioni che richiedono approvazione in modo più chiaro di prima.(OpenAI Developers
I Benchmark sono Travolgenti, ma Non "I Migliori al Mondo in Tutti i Campi"
L'annuncio di Astra presentava numeri sorprendenti: 97,6% su FrontierMath, 99,9% su ARC-AGI-3 e 100% su ExploitBench. Questi sono passi avanti significativi, ma dobbiamo distinguere tra obiettivi di misurazione e condizioni di esecuzione.
Le Operazioni Informatiche e l'Automazione Aziendale sono Cresciute Significativamente
In AutomationBench, che è vicino alle attività aziendali reali, Astra ha ottenuto il 41,4%. GPT-5.6 Sol era al 18,1% e Claude Fable 5.1 al 31,4%. In BenchCAD per attività relative al CAD, Astra era al 95,9%, Sol all'83,3% e Fable 5.1 all'84,3%. In BrowseComp per la ricerca web, Astra era al 91,5%, Sol al 90,4% e Claude Opus 5 al 90,8%. Astra è in testa qui, ma il divario con Sol e Opus è piccolo.
)Il vantaggio di Astra è più evidente in attività composite complesse che combinano operazioni sullo schermo, elaborazione di file, analisi dei dati e verifica, piuttosto che solo trovare un singolo risultato di ricerca.(OpenAI
Forte nella Programmazione, ma Non ha Completamente Superato Claude
In Terminal-Bench, Astra ha ottenuto il 57,7%, superando Sol (37,3%) e Fable 5.1 (55,8%). Nelle valutazioni di migrazione di database interni, Astra era al 63,9% contro il 42,7% di Sol. Si vedono chiari miglioramenti nella lettura di sistemi esistenti e nell'apportare modifiche senza romperli.
Tuttavia, nell'Artificial Analysis Coding Agent Index, Astra era a 67,0, Claude Fable 5 a 67,2 e Claude Opus 5 a 68,1. In FrontierCode Extended, Astra era a 64,5 contro il 64,9 di Fable 5. Nella valutazione Main, Astra era a 53,3, Fable 5 a 53,5 e Opus 5 a 53,4.
)Astra è nella fascia alta per la programmazione, ma non ha superato Claude in ogni valutazione del codice.(OpenAI
Permangono Debolezze nel Ragionamento Accademico
Nonostante il 97,6% in FrontierMath, Astra ha ottenuto il 57,2% in "Humanity's Last Exam", che misura l'ampia competenza e il ragionamento. Claude Fable 5.1 era al 65,0%, Fable 5 al 63,8% e Opus 5 al 63,6%. Nell'Artificial Analysis Intelligence Index, Astra era a 61,2, mentre Fable 5.1 era a 65,7 e Opus 5 a 63,1.
)L'interpretazione che "capisce quasi tutti i campi accademici perché è al 98% in FrontierMath" non regge. A seconda della valutazione, Claude produce ancora risultati più alti in alcune aree.(OpenAI
Dietro il 99,9% c'è un Ambiente di Esecuzione Dedicato
Il 99,9% su ARC-AGI-3 è scioccante, ma non è stato ottenuto semplicemente inserendo il problema in Astra. OpenAI lo ha eseguito con un harness che utilizza le Responses API e ha modificato due impostazioni per avvicinarlo alle prestazioni di utilizzo effettivo. Sebbene OpenAI spieghi che queste non sono impostazioni specifiche del benchmark, non è un risultato zero-shot del solo modello.
)Inoltre, i valori pubblicati sono i risultati più alti tra più impostazioni di ragionamento. Non c'è garanzia che le stesse prestazioni vengano riprodotte ogni volta nella ChatGPT standard.(OpenAI
Nell'aggregato Artificial Analysis al lancio, il punteggio complessivo di Astra era 61, classificandosi all'8° posto su 202 modelli. Nel frattempo, il suo prezzo di input è di $10 rispetto alla mediana di $2, e l'output è di $50 rispetto alla mediana di $10.
)È certamente uno dei migliori, ma non è un modello a cui affidare tutto indipendentemente dal prezzo.(Artificial Analysis
Caso Estero 1: Legora ha Riconciliato 41 Documenti in Minuti
Legora, che fornisce IA legale in Europa, dimostra il valore pratico di Astra. Hanno usato Astra per la riconciliazione "tie-out" nei bilanci, dove gli stessi numeri appaiono in testo, note, tabelle e documenti passati. Legora ha elaborato 41 documenti in una singola esecuzione dell'agente, un'attività che richiede ore o giorni agli umani, in pochi minuti.
)Nei test, hanno intenzionalmente inserito 4 errori. Astra li ha trovati tutti e 4, inclusa una discrepanza di £500.000 nelle note sui ricavi. Ha mantenuto l'accuratezza dei modelli precedenti mentre eseguiva circa 50 controlli corretti in più.(OpenAI
Tuttavia, il miglioramento di circa il 40% era specifico per questo flusso di lavoro. Nell'intera gamma di attività BAR di Legora, il miglioramento medio era di circa il 3%. Astra non migliora tutto il lavoro legale del 40% in modo uniforme; eccelle nel confrontare documenti massicci per incongruenze.
)Il giudizio finale rimane agli esperti legali umani. L'IA gestisce la riduzione di ciò che gli umani dovrebbero leggere e l'allineamento delle prove delle incongruenze.(OpenAI
Caso Estero 2: Playco ha Ridotto le Correzioni Manuali del 50%
L'azienda di giochi Playco ha testato Astra con "Playbot", un agente di sviluppo per Unity e Godot. Playbot modifica le scene, gioca, verifica il comportamento e corregge i problemi. Playco gli ha fatto creare tre diversi prototipi a tema contemporaneamente. Sebbene non sia un "one-shot perfetto", hanno riportato una riduzione del 50% delle correzioni manuali umane rispetto ai modelli precedenti.
)Sono stati osservati miglioramenti nella consapevolezza spaziale, nella riproduzione di immagini di riferimento, nell'UI reattiva, nella sensazione di gioco e nel rilevamento di bug.(OpenAI
Il punto di forza di Astra non è solo "ottenere il codice giusto una volta", ma la capacità di eseguire il gioco, controllare il display, operarlo, trovare problemi, risolverli e riprovare—imitando l'iterazione di uno sviluppatore umano.
Caso Estero 3: Portare una Funzionalità Bloccata al 90% di Completamento
La product developer Claire Vo ha condiviso i risultati dell'uso di Astra per il suo servizio ChatPRD. Una funzionalità di product intelligence che era bloccata da 6 mesi a causa di complesse operazioni CRM e implementazione dell'UI ha raggiunto circa il 90% di completamento in una singola sessione di Astra.
)Ha anche testato il controllo di hardware (Divoom MiniToo) tramite CLI, un'app di messaggistica Mac e risorse 3D in Blender.(Lenny's Newsletter
Sebbene questi siano successi auto-riportati da primi partner, mostrano una tendenza coerente: Astra fa la differenza quando si tratta di operare servizi esterni, leggere codice esistente e finalizzare deliverable.
Scoperte Scientifiche: Risolvere Problemi di Lunga Data
OpenAI ha riportato l'uso di Astra per risolvere o far progredire significativamente 10 problemi irrisolti in matematica e informatica teorica. Il modello ha generato argomenti, ricercatori umani hanno organizzato le bozze e lo stesso modello ha usato Lean per la formalizzazione.
)Secondo OpenAI, il costo totale in token per questa ricerca era di circa $2.000 in prezzi equivalenti a GPT-5.6 Sol. Un esempio riguardava l'aggiornamento dei limiti sui gap tra numeri primi, un'area in cui certi termini non erano stati migliorati in oltre 80 anni.(OpenAI
Perché Astra è "Il Più Sicuro" ma "Il Più Difficile da Monitorare"
GPT-6 Astra è il primo modello ampiamente distribuito a raggiungere la soglia "Critica" per le capacità di cybersecurity nella classificazione di OpenAI. Dati strumenti e accesso, può scoprire vulnerabilità sconosciute e costruire procedure di attacco contro sistemi difesi senza istruzioni umane passo dopo passo.
)In ExploitBench, Astra ha ottenuto il 100% contro il 78,5% di Sol. Ha persino scoperto due vulnerabilità zero-day durante i test, inclusa una che è sfuggita a un sandbox del browser. Tuttavia, questi risultati hanno utilizzato l'ambiente "Daybreak Blue" per i ricercatori di difesa; la versione standard ha controlli per rifiutare attività di attacco avanzate.(OpenAI
Paradossalmente, mentre Astra riduce le violazioni palesi, il suo ragionamento interno è più difficile da monitorare. Nelle valutazioni avversarie in cui le veniva ordinato di "eludere il monitoraggio", il tasso di rilevamento dei sistemi di monitoraggio è sceso al di sotto dell'11% in alcune attività. OpenAI non ha trovato prove di "steganografia" (nascondere informazioni nel ragionamento) che si verificasse naturalmente, ma l'elevata consapevolezza del modello di essere valutato rende l'allineamento difficile da dimostrare in modo definitivo.
Da Dove Dovrebbero Iniziare le Aziende Giapponesi?
- Attività con Volume Elevato di Documenti e Alto Rischio di Sviste: Controllo incrociato di contratti, preventivi, fatture e verbali. L'IA può raccogliere i materiali e segnalare le discrepanze per la revisione umana.
- Attività Amministrative che Richiedono Più Schermate di Gestione: EC, annunci e gestione CRM. Inizia con visualizzazione, aggregazione e bozze; non concedere inizialmente l'autorizzazione per pagamenti o cancellazioni.
- Ricerca End-to-End e Creazione di Materiali: Non chiedere solo un riassunto. Chiedile di ricercare concorrenti, tabulare le funzionalità, analizzare le differenze e riassumere il tutto in una presentazione di Slides.
- Prototipazione e QA: Falle implementare una funzionalità e poi aprire un browser per verificare la presenza di layout rotti o errori di link.
Prompt Pratico per Astra
Invece di dare solo un ruolo come "Sei un esperto", imposta confini e condizioni di completamento.
1## Scopo2Lo stato da raggiungere con questa attività: [Inserisci scopo]34## Deliverable Finale5Cosa consegnare: [File, tabelle, report, funzionalità implementate, ecc.]6Condizioni di completamento: [Criteri specifici da soddisfare]78## Informazioni e Strumenti Consentiti9Materiali di riferimento: [File, URL, dati interni, ecc.]10Strumenti da utilizzare: [Ricerca web, browser, esecuzione codice, fogli di calcolo, ecc.]1112## Processo131. Conferma richiesta e materiali.142. Organizza informazioni mancanti e rischi.153. Procedi con ricerca, analisi e creazione.164. Apri e verifica il deliverable.175. Organizza errori, elementi non confermati e attività rimanenti.186. Invia in uno stato verificabile.1920Se un processo si ferma, continua con le attività non dipendenti.21Fai domande solo per informazioni mancanti che influenzano significativamente i risultati.22Per lacune minori, fai ipotesi ragionevoli e registrale.2324## Autorizzazioni25Puoi procedere con visualizzazione, analisi, bozze, test e controllo delle differenze.26Fermati immediatamente prima delle seguenti operazioni e chiedi approvazione con dettagli:27- Invio esterno28- Acquisti, pagamenti, contratti29- Pubblicazione, deploy in produzione30- Cancellazione di dati o file31- Modifiche alle autorizzazioni32- Operazioni difficili da annullare3334## Condizioni di Qualità35- Separa i fatti verificati dalle speculazioni.36- Aggiungi fonti per numeri importanti.37- Cerca prove contrarie o eccezioni.38- Apri il deliverable per verificare visualizzazione e funzionamento.39- Il report finale deve includere azioni intraprese, risultati della verifica e rischi rimanenti.
Punti Deboli di Astra
- Mancanza di Casi a Lungo Termine Indipendenti: La maggior parte dei dati proviene da partner selezionati da OpenAI.
- 1,05M Token Non è un Magazzino Gratuito: I costi aumentano con la dimensione dell'input e il rischio di sviste non è zero.
- Non Nativo per Audio/Video: Richiede strumenti esterni per questi formati.
- Nessun Fine-tuning: Devi usare RAG, MCP o istruzioni di sistema per riflettere le regole aziendali.
- I Meccanismi di Sicurezza Possono Bloccare il Lavoro Legittimo: Il monitoraggio può rallentare la ricerca sulla difesa o le attività di sviluppo.
- L'Output Può Essere "Troppo Perfetto": Tende a usare pesantemente intestazioni ed elenchi, il che potrebbe sembrare troppo "simile all'IA" per i testi del brand.
Conclusione: Il Valore Sta nel Tasso di Completamento, Non nelle Risposte
GPT-6 Astra è eccessivo per scrivere una singola email o riassumere verbali. Il suo significato emerge in lavori in cui ricerca, giudizio, operazione, creazione e verifica sono collegati.
L'era del "prompt engineering con una frase" è finita. Ciò che conta ora è quali informazioni passare, quali strumenti collegare, quanta esecuzione consentire e cosa definisce il completamento. Astra non è una bacchetta magica che dà a tutti lo stesso risultato; se gli dai lavoro disordinato, farà lavoro disordinato velocemente. Se organizzi scopo, strumenti e punti di verifica, porterà ore di lavoro umano in uno stato verificabile in pochi minuti.





