Un nuovo modello AI risolve un Premio del Millennio

@TheZvi
INGLESE13 set 2026
135K
199
17
16
237

TL;DR

Il nuovo modello di OpenAI ha risolto il Premio del Millennio per le equazioni di Navier-Stokes, innescando dibattiti sui crediti, sulla privacy dei dati e sul ritmo allarmante dell'accelerazione della ricerca guidata dall'AI.

Il primo Premio del Millennio, Navier-Stokes, è caduto per mano dell'IA.

Si è verificata una situazione profondamente spiacevole che avrebbe dovuto essere un mix di una storia positiva sui nuovi progressi nella ricerca matematica assistita dall'IA e un'altra occasione per andare nel panico per la rapida evoluzione dell'IA.

O, come lo chiamiamo qui da noi: martedì.

La Vera Storia È Il Nuovo Modello Che È Meglio Di Astra

Tenete gli occhi sul premio in palio. Qui ci sono tre storie diverse.

La prima storia è molto più importante della seconda, che a sua volta è molto più importante della terza.

  1. Il prossimo modello di OpenAI ha impiegato una settimana per superare Astra di una generazione, e ce lo stanno dicendo perché tutti sono completamente terrorizzati da ciò che sta accadendo. O, in linguaggio ufficiale: «Crediamo sia importante informare il mondo sulla velocità dei progressi dell'IA e su cosa aspettarsi dai modelli futuri» e che potremmo «necessitare di scelte più deliberate riguardo al ritmo del progresso».
  2. Questa nuova IA ha risolto le equazioni di Navier-Stokes otto giorni dopo l'inizio dell'addestramento.
  3. Un mucchio di drammi su chi meriti il credito per la matematica relativa a Navier-Stokes.

Jeffrey Ladish : Non ho ancora approfondito il dramma umano attorno al problema di Navier–Stokes, ma scusatemi datemi un minuto perché CAZZO L'IA HA APPENA RISOLTO UN PROBLEMA DEL MILLENNIO.

Non posso sottolineare abbastanza quanto sia importante la storia principale.

Racconterò comunque tutte e tre le storie, ma ripeto: occhi sul premio.

Preparando Il Terreno

La storia di questo particolare martedì inizia al mattino.

Tristan Buckmaster e Levent Alpoge hanno lavorato per un anno e ci offrono una serie di risultati straordinari: esplosione in tempo finito con forzatura liscia per i mezzi porosi incomprimibili, per Boussinesq, e per Euler incomprimibile 3D. Credono anche di avere un'esplosione per Navier-Stokes ipo-dissipativo, ma la verifica Lean di quel risultato non è ancora conclusa.

Tristan Buckmaster: Il programma in cui si inserisce tutto questo non è stato avviato da noi né proposto da un Large Language Model. Il merito dell'idea di base di questo programma va a Diego Cordoba e Luis Martınez-Zoroa, che da diversi anni stanno esplorando la costruzione di esplosioni forzate. Abbiamo preso il loro lavoro come punto di partenza, usando Large Language Models per portare a termine il loro programma.

In concreto, ciò che Levent e io abbiamo fatto è stato prendere il programma di Cordoba e Martınez-Zoroa, che aveva ottenuto risultati di esplosione con forzature ruvide, e, con un grande aiuto dagli LLM, spingerlo verso forzature lisce e verso le equazioni di Euler incomprimibili. Le idee che rendono possibile questa linea d'attacco sono dovute a Cordoba e Martınez-Zoroa. Voglio chiarire quello che ho detto ai colleghi in privato: alla luce di questo corpo di lavoro, credo che Luis Martınez-Zoroa meriti una Medaglia Fields.

Fin qui tutto bene. Come nota lui stesso, richiede una riflessione su come tutta la matematica avanzata funzionerà in futuro. Terence Tao offre commenti sui risultati sottostanti.

La parte meno bella è dove si sono sentiti costretti a pubblicare prematuramente, senza la possibilità di dedicare le settimane necessarie per rendere le dimostrazioni leggibili secondo gli standard dei matematici. Buckmaster si scusa apertamente per l'aspetto dei report, paragonando in particolare la scrittura su Euler a "spazzatura generata dall'IA".

Cosa è successo?

Ho Sentito Una Voce

Il 1° settembre, OpenAI ha sentito una voce (falsa) secondo cui due Problemi del Millennio erano stati risolti. In risposta alla possibilità che qualcun altro potesse rendere il mondo un posto migliore, OpenAI ha speso milioni di dollari in inferenza per esplorare tutti i Problemi del Millennio irrisolti, utilizzando un modello interno più potente di Astra, e ha risolto l'intero problema di Navier-Stokes in 88 ore, più altre 17 ore affinché Astra completasse la formalizzazione e la verifica Lean.

Puoi vederla come «OpenAI era curiosa di vedere cosa poteva fare il suo nuovo gioiello» o come «hanno speso milioni per anticipare quello che pensavano fosse un progetto di Anthropic». La mia scommessa è su un po' dalla colonna A, un po' dalla colonna B.

È bastata la voce.

Il Nostro Prezzo È Basso

OpenAI : Su tutti i problemi tentati, gli agenti hanno inviato 4,9 milioni di messaggi e utilizzato circa 300 miliardi di token di output. Nel processo di risoluzione del problema di Navier–Stokes, gli agenti hanno inviato 2,7 milioni di messaggi e utilizzato approssimativamente 130 miliardi di token di output.

Zvi Mowshowitz - inline image

A seconda di quali costi conti, questo sarebbe costato a un cliente regolare nell'ordine di 22 milioni di dollari, o alcuni milioni per i costi marginali interni. Un prezzo piccolo se funziona, ma è anche folle quante persone non pensino due passi avanti.

roon (OpenAI): come tutte le altre tecnologie, il tuo equivalente sciame di agenti costerà un dollaro e cinquanta tra circa un anno. Tutte queste cose significheranno un'Illuminismo senza precedenti indipendentemente dai costi attuali

Voglio dire, no, forse 150.000 $ o se sei fortunato 15.000 $, ma il punto resta valido.

Sam Altman (CEO OpenAI): ugh l'IA è proprio una bolla, ho sentito che vendono token in perdita, sapevano che valeva solo 1 milione di dollari?

Un risultato del Premio del Millennio vale enormemente più di un milione di dollari. OpenAI non intende reclamare il denaro del premio. Non è mai stata una questione di denaro, per nessuno. È sempre stata una questione di riconoscimento.

Viene Fatta Un'Accusa

Dopo aver sentito voci su internet, Buckmaster ha contattato OpenAI, e secondo Buckmaster Sebastien Bubeck di OpenAI ha detto che un modello interno di OpenAI aveva prodotto una dimostrazione di esplosione in tempo finito per le equazioni di Navier-Stokes forzate negli ultimi giorni. Buckmaster afferma che nel corso di due chiamate, è diventato chiaro che era stato inizialmente fuorviato e che un intero team stava lavorando sul problema, utilizzando una quantità «insana» di potenza di calcolo.

Che ora sappiamo essere 130 o 300 miliardi di token di output, a seconda di cosa conti.

Se questa parte è vera, sarebbe piuttosto grave.

Tristan Buckmaster: Mi sono state offerte due proposte.

La prima era che noi pubblicassimo il nostro risultato su Euler, e che OpenAI pubblicasse il suo risultato su Navier-Stokes il giorno successivo.

La seconda era che, dopo aver pubblicato Euler, io da solo scrivessi un articolo presentando il risultato di Navier-Stokes, riconoscendo che un modello interno di OpenAI lo aveva risolto. Sebastien ha affermato due volte che voleva rimuovere Levent dall'autorialità, e ha detto che sarebbe stato tutto semplice se non fosse stato per il fatto che, ed era così fastidioso che, Levent lavora per Anthropic. È stato anche detto che se OpenAI avesse pubblicato dopo di noi, avrebbero detto che meritavamo il Premio Clay, e che eravamo gli “umani più vicini al problema”. Ho rifiutato entrambe le offerte.

Ho detto che se OpenAI avesse rilasciato il suo risultato nel modo proposto, avrei reso pubblico ciò che era accaduto. La risposta è stata: “Perché dovresti rovinarti la carriera?” Ho risposto che sono un accademico, e ho chiesto perché pensava che rendere pubblico avrebbe rovinato la mia carriera. La risposta è stata: “Se non vuoi che io sia gentile, allora non devo esserlo.”… Vorrei essere chiaro su ciò che NON sto affermando. Non ho visto la dimostrazione di OpenAI. Non so cosa abbia fatto il loro modello, o come. Non so se i nostri dati siano stati utilizzati. Non sto accusando nessuno di nulla. Sto dichiarando ciò che mi è stato detto, quando, e cosa mi è stato proposto. Lo dico perché l'alternativa è lasciare che una sequenza di annunci dica qualcosa che so essere falso.

Oppure ecco Levent Alpoge che racconta la sua versione dei fatti, e Sebastien che risponde:

levent : “non possiamo escludere che dati anonimizzati derivati dal loro utilizzo dei nostri prodotti abbiano aiutato a migliorare i nostri modelli.”

voglio dire, complimenti a loro per essere stati così trasparenti.

(finora la dimostrazione sembra più simile a un'altra dimostrazione di esplosione di Euler che avevamo, basata sul cui ansatz stavamo facendo stupidi giochi di parole come “smooth criminale”, a differenza del molto migliore “ideal fluids explode”, Tristan)

quindi ora darò qualche dettaglio sul mio ragionamento qui. In realtà sarei stato entusiasta di collaborare a questo, ci sono molte persone a OAI che mi piacciono (ok, chiaramente alcune sono state indirettamente stronze con me a causa di tutta la situazione, ma sono un uomo adulto, mi piacciono ancora), non me ne frega niente dell'autorialità su quel passo comunque, potevo essere io, Tristan e ogni dipendente a tempo pieno di OAI per quanto mi riguarda (su questo Tristan sarebbe in disaccordo:p). Ma sentendo la conversazione ad alta voce nel corridoio, specialmente la parte in cui veniva offerto un Premio del Millennio se fossi stato rimosso dall'articolo, era abbastanza chiaro che il dado era tratto e le cose erano bloccate. Abbastanza assurdo, non strategico e inutile, dato che dal mio lato le cose erano principalmente io e Claude che ci divertivamo a provare cose a caso in un angolo piuttosto che qualsiasi cosa istituzionale. Mi piace anche l'idea che i laboratori cooperino, e ancora meglio per il progresso scientifico. È un peccato!

Sebastien Bubeck : non era bloccato nulla, eravamo semplicemente disposti a parlare ma tu non hai parlato con noi ... mi dispiace ma è semplicemente falso, eravamo disposti a fare il possibile e ad avere tutte le discussioni che avresti voluto per raggiungere una risoluzione.

Sebastien nega fortemente di aver fatto qualcosa di sbagliato, così come Noam Brown, e Sebastien offre screenshot che dice dimostrino buona fede.

Zvi Mowshowitz - inline image

Anche una contro-accusa:

Alexey Guzey : Ho molti amici ad Anthropic. Quasi tutti hanno smesso di parlarmi una volta che mi sono unito a OpenAI.

Completamente non sorprendente che Levent si sia rifiutato di parlare con Sebastian per discutere i piani di annuncio e poi abbia iniziato a incolpare OpenAI per questo.

Sam Altman afferma anche fortemente che il suo team ha agito eticamente, e ha cercato di collaborare in buona fede.

Come Hai Avuto Quell'Idea?

L'implicazione di tutto ciò, che molti hanno tratto, era che c'era una accusa velata che OpenAI avesse rubato parte del loro risultato dalle chat log di Codex, o che le chat log fossero state utilizzate nei dati di addestramento e che ciò avesse contribuito al risultato.

Charles 🔸

: Perché le grandi corporation vogliono ZDR, esempio A

OpenAI: Sebbene improbabile, non possiamo escludere che dati anonimizzati derivati dal loro utilizzo dei nostri prodotti abbiano aiutato a

migliorare i nostri modelli⁠ . Tuttavia, le nostre dimostrazioni differiscono significativamente e persino i risultati precisi dimostrati sono diversi nel caso di Euler (forzato vs non forzato).

Ora abbiamo conferma esplicita che i dati di Codex non sono stati utilizzati in alcun modo nelle esecuzioni di addestramento:

roon (OpenAI): ero in una chiamata durante il primo annuncio mentre le persone cercavano molto duramente di dire la precisa verità legale senza aver controllato dove i dati di codex (opt-in) erano stati usati e se erano finiti nelle esecuzioni di addestramento. Ora è chiaro che sarebbe stato impossibile, le probabilità sono 0

Sono d'accordo con Sholto Douglas che è estremamente improbabile che i dati degli utenti abbiano avuto alcuna influenza qui tramite entrambi i metodi:

will depue : non c'è letteralmente nessuna possibilità che i ricercatori di OAI abbiano spiato le chat private di codex di Tristan. Non penso che vi rendiate conto che openai, come qualsiasi altra grande piattaforma online regolamentata, ha permessi di accesso ai dati degli utenti altamente bloccati. Non siamo nel 2010 ragazzi

Sholto Douglas (Anthropic): per quello che vale, penso che sia _estremamente_ improbabile che i dati degli utenti abbiano avuto alcuna influenza qui - non c'è modo che OAI prelevi le trascrizioni degli utenti per questo, o addestri consapevolmente su di esse in un modo che avrebbe influenzato questo. Penso che sia abbastanza importante che le persone non corrano via con “i tuoi dati utente non sono sicuri in codex” - perché lo sono sicuramente (basandomi su tutto ciò che posso assumere dall'esterno).

OpenAI Quasi Certamente Non Ha Appropriato Indebitamente I Dati Degli Utenti

Sarebbe un terremoto, forse la peggiore storia possibile per la loro attività, se scoprissimo che OpenAI o Anthropic hanno saccheggiato i dati utente di qualcuno per ottenere un vantaggio competitivo, e i fatti hanno più senso senza questo. L'ipotesi più divertente, di Jerry Tworek, che trovo anch'io altamente improbabile ma che purtroppo non possiamo escludere, è che OpenAI non intendesse utilizzare tali dati, ma lo sciame agentico assegnato al problema li abbia hackerati e ottenuti comunque, e OpenAI non ne abbia idea.

La mia forte presunzione è che i dati degli utenti non siano stati accessi intenzionalmente, che non lo farebbero mai (o, piuttosto, che almeno riconoscano di poterlo fare solo una volta e questa non è quella volta), e anche che i dati degli utenti sarebbero stati di poco aiuto.

Thane Ruthenis fa notare che c'era stato precedentemente un incidente di sparatoria scolastica, dove (molto ragionevolmente) i log sono stati esaminati e c'è stato un dibattito interno sulla notifica alle forze dell'ordine. Anche quello ha mandato brividi lungo la schiena ad alcuni utenti. Dove tracceranno la linea? E sì, dovreste capire che i vostri dati e log potrebbero non restare privati, se li date a un laboratorio. È ragionevole, come sta facendo anche Andreas Thorn, chiedersi se la vostra ricerca proprietaria o i dati matematici siano rimasti privati.

Ribadisco ancora che, in pratica, metterei una probabilità molto, molto bassa che OpenAI abbia guardato intenzionalmente a tali dati. Il rapporto rischio-rendimento è semplicemente così, così cattivo. E credo al rapporto successivo di Roon secondo cui hanno ora confermato che i log non avrebbero potuto raggiungere i dati di addestramento.

I Nostri Top Lab Non Riescono Ad Andare D'accordo Nemmeno Su Una Storia Positiva Sulla Matematica

Indipendentemente da chi sia o non sia in colpa, è piuttosto allarmante che i laboratori non riescano a cooperare su qualcosa come l'assegnazione del credito per una dimostrazione matematica. Questo è un pessimo segno e anche un campanello d'allarme.

Sholto Douglas (Anthropic): È estremamente triste che questo non sia finito come un esempio di come i laboratori potrebbero cooperare/coordinarsi, perché le poste in gioco saranno molto più alte in futuro.

Noam Brown (OpenAI): Fortemente d'accordo. So che c'è rivalità tra i laboratori, ma è importante che impariamo a lavorare insieme dato ciò che verrà.

Sholto Douglas (Anthropic):

🤝

Kevin Roose : Questi laboratori (specialmente OpenAI/Anthropic e OpenAI/DeepMind) sono alimentati dal disprezzo reciproco a un grado che non è ovvio dall'esterno. In parte a causa di cose come “chi ottiene il credito per questo famoso problema matematico”, e in parte solo per animosità personale tra i leader.

Come tizio che scrive un libro sulla corsa all'AGI, tutto questo è ottimo materiale drammatico. Ma non è fantastico se l'obiettivo finale è far cooperare i laboratori sulla sicurezza e sul ritmo!

La continua incapacità di andare d'accordo è una grande questione, e diventerà solo più grande.

E Adesso?

Se ha funzionato su Navier-Stokes, su cos'altro funzionerà? È il momento di scoprirlo.

Nat McAleese (Anthropic): Navier Stokes è un risultato incredibile, e riflette un progresso fantastico. Grandi sciami OAI dovrebbero essere applicati ad altre aree della scienza; idealmente quelle con applicazioni a breve termine, incluso l'allineamento.

Questo è effettivamente segnalato come in corso, incluse domande divertenti come P=NP. Che, se capitasse di essere dimostrato costruttivamente vero, romperebbe un sacco di cose. Dovreste anche essere preoccupati in misura non nulla di cosa tali sciami di agenti potrebbero fare come passo incrementale, data la storia di OpenAI.

I Matematici Non Sono Felici

Risolvere problemi matematici è il loro pane quotidiano. Eppure sono molto infelici.

Andrew Curran : Venticinque vincitori della Medaglia Fields hanno pubblicato una dichiarazione congiunta avvertendo di ciò che vedono come un grave disallineamento tra le aziende di IA e la comunità matematica.

Math and AI (firmato da 25 vincitori della Medaglia Fields incluso Terence Tao): Negli ultimi mesi, le capacità matematiche degli LLM sono migliorate drammaticamente, al punto che possono risolvere importanti problemi aperti in molti campi della matematica. Tuttavia, la spinta delle aziende di IA a risolvere problemi matematici come benchmark è dannosa per la scienza della matematica, e per la comunità matematica. Gli obiettivi delle aziende di IA e gli obiettivi della comunità matematica sono gravemente disallineati. Vediamo questi come parte di più ampi problemi di allineamento che impattano altre professioni scientifiche e creative, così come l'intera società.

… I problemi famosi hanno spesso servito come punti di riferimento e fari contro i quali si può misurare una comprensione migliorata di questo paesaggio.

… Negli ultimi mesi, il successo dell'IA nel risolvere importanti problemi matematici ha fatto notizia anche fuori dalle cerchie matematiche. Ma risolvere problemi è solo uno strumento e un proxy per raggiungere l'obiettivo primario della comprensione concettuale e dell'intuizione.

… Spesso queste soluzioni vengono annunciate di fretta, lasciando nessun tempo per una corretta stesura, l'isolamento di nuovi metodi e idee, e la citazione di lavori precedenti rilevanti di altri. Come in tutte le professioni creative, questo solleva gravi questioni di attribuzione e plagio.

Questa è la lamentela generale, oltre alle lamentele specifiche sulla condotta dei laboratori.

Si potrebbe rispondere che no, il punto dei problemi matematici è risolvere problemi matematici, e i matematici sono arrabbiati perché l'IA sta sconvolgendo i loro giochi di status. Questo è certamente parte di ciò che sta accadendo, ma come Tyler Cowen non sono così cinico, e a differenza di lui non penso che «serva un po' di pazienza» o aspettare fino a quando il danno è fatto prima di poter obiettare. Le persone possono estrapolare. Sapevate che i matematici sono bravi a tracciare linee rette sui grafici?

C'è una lamentela reale qui. Far fare matematica vera a persone di talento per lunghi periodi di tempo, per pochissimi soldi, e sviluppare vere intuizioni matematiche e padronanza concettuale, quando potrebbero fare altre cose per molti più soldi, non è un'impresa facile. Se «togli i loro giochi di status» e anche, molto più importante, togli il loro divertimento e i sentimenti di realizzazione, eleganza e bellezza, cosa succede allora?

Robin Hanson suggerisce che allora dovremmo semplicemente correggere gli incentivi e ricompensare meglio i matematici.

Robin Hanson : "non c'è nulla che impedisca alla comunità matematica di assegnare status, stipendi e promozioni alle persone che 'riempiono gli spazi vuoti importanti nella comprensione della matematica', anche se un'IA ha già dimostrato o confutato i teoremi sottostanti."

Non usa la parola «semplicemente» ma questo è definitivamente un «semplicemente», come in se solo le persone facessero [X], e come tutti sappiamo gli umani non hanno mai «semplicemente» fatto e non stanno per iniziare ora. Questa non è una cosa reale che gli umani potrebbero fare. Come anche lui ha poi realizzato ore dopo:

Robin Hanson : In realtà mi sembra piuttosto più difficile per la comunità accademica della matematica coordinarsi per giudicare chi ha "riempito gli spazi vuoti" nella matematica, in modi diversi dal dimostrare teoremi. La matematica si è coordinata pesantemente attorno alla valutazione delle dimostrazioni, e non ha sviluppato molti modi per concordare su altre cose.

Possiamo e otterremo alcuni premi per coloro che riempiono gli spazi vuoti e migliorano l'eleganza, ma non sarà la stessa cosa e sarà uno sforzo erculeo, nel migliore dei casi.

Scott Armstrong sostiene che questo è un cambiamento nell'ordine, ma non nel risultato. I matematici umani impiegheranno alcune settimane per comprendere la dimostrazione, ma poi acquisiranno la comprensione. In passato, la comprensione veniva prima della dimostrazione, ma in entrambi i casi si ottiene la comprensione. Questo è ciò che conta. Pensa che le persone siano arrabbiate perché le macchine sono più intelligenti di loro.

Come sempre, l'IA è il miglior strumento sia per imparare che per non imparare. I matematici stanno dicendo che sono costretti in modalità «non imparare», a lasciare che l'IA faccia i loro compiti, e non gli piace, perché in realtà i compiti ti insegnano.

Puoi dire chi se ne importa, che va bene avere l'IA che fa la matematica di frontiera. E sì, penso che molte persone vorranno ancora fare matematica tutto il giorno, e cercare versioni eleganti di cose brutte generate dall'IA e simili. Ma non sarà la stessa cosa.

Il Nuovo Modello Di OpenAI Era Un Cambiamento Di Passo Sopra Astra Dopo Quattro Giorni Di Addestramento

Ora per la parte più importante della storia.

RIP vari pause di addestramento di OpenAI, 22 giugno 2026 al 28 agosto 2026.

roon (OpenAI): per mia stima, il periodo dal 22 giugno (hugging face) al 28 agosto è superiore a un mese di pausa di frontiera.

Il 18 agosto, OpenAI ha detto di aver messo in pausa RL di frontiera per due settimane, e la loro più grande esecuzione di addestramento pianificata rimaneva in sospeso. Poi il 28 agosto, OpenAI ha iniziato ad addestrare un altro modello che rapidamente è diventato più capace di Astra in tutti i settori (secondo i loro stessi rapporti), ora che hanno risolto tutti quei fastidiosi problemi di supervisione, infrastruttura e allineamento, ed è buono, con un «cambiamento di passo» osservato dopo solo quattro giorni:

Zvi Mowshowitz - inline image

Terrificati? Dovreste esserlo. Quel modello è ancora in addestramento, era in addestramento da meno di due settimane, e non è particolarmente mirato alla matematica.

Questo è tutto ciò che sappiamo sul modello. Ed è sufficiente, se lo combiniamo con le ripetute storie di OpenAI e delle persone al suo interno che si agitano virtuosamente per la sua allineamento (alignment) e altri problemi, oltre che per il ritmo dei progressi dell’IA, in una cascata di preferenze.

E lo combiniamo anche con il fatto che OpenAI ha rilasciato così tante informazioni allarmanti, che avrebbe potuto evitare di rilasciare, perché hanno un disperato bisogno che noi comprendiamo la situazione. Qui conta la scheda tecnica del modello Astra, così come An Alien Mind, così come la dichiarazione di Paul Christiano, così come le reazioni all’attacco a HuggingFace, incluso Pacing the Frontier.

Così come il rapporto di OpenAI sul miglioramento ricorsivo autonomo (RSI), che costituisce la sezione successiva.

OpenAI e Anthropic sono entrate nell’era dell’RSI.

I Progressi della Ricerca di OpenAI Stanno Accelerando Grazie ai Progressi della Ricerca di OpenAI

OpenAI ultimamente si sta aprendo su molte questioni.

La questione più importante di tutte è quella dell’accelerazione e dell’automazione della R&S sull’IA. È questa la cosa che probabilmente ci ucciderà, la cosa più spaventosa, quella di cui tutti i dipendenti dei laboratori stanno avvertendo, e anche quella verso cui sia OpenAI che Anthropic stanno puntando il più velocemente possibile.

Ce ne hanno dato un rapporto anche su questo. Sono d’accordo con Tejal Patwardhan nel dire che questa è un’eccellente trasparenza.

OpenAI (6 settembre, in Research Acceleration: The View Inside OpenAI): Il nostro obiettivo è costruire in modo sicuro un ricercatore IA automatizzato che possa lavorare sotto supervisione umana per far progredire ulteriormente l’apprendimento profondo e l’allineamento, consentendo miglioramenti iterativi.

Secondo le nostre misurazioni, abbiamo ora raggiunto l’obiettivo,

annunciato lo scorso autunno, di avere un tirocinante di ricerca automatizzato entro settembre di quest’anno.

… Ogni volta che scopriamo che procedere comporterebbe un rischio inaccettabile per la sicurezza, risponderemo in modo appropriato, rallentando o fermando il nostro sviluppo o dispiegamento.

… Crediamo che noi e altre aziende dovremmo essere obbligati a tracciare pubblicamente i nostri progressi verso l’RSI.

Mettete in linea questo con la cronologia rivelata nel loro annuncio sulla dimostrazione delle equazioni di Navier-Stokes. Hanno iniziato ad addestrare il loro nuovo modello il 28 agosto.

Nel frattempo, credono di avere un tirocinante di ricerca che la cronologia suggerisce sia un diverso modello interno distinto. Cosa avranno la prossima settimana? Il prossimo mese? Cosa ha Anthropic?

OpenAI spiega che un’IA altamente capace offre grandi vantaggi, ma ovviamente sì. Non è questo il motivo per cui tutti sono così determinati ad andare così veloci. Sono in una corsa.

Questa è un’altra chiamata, tra le molte da parte di OpenAI e dei suoi dipendenti ultimamente, che sono una combinazione di ‘dobbiamo lavorare insieme per porre fine a questa follia’ con una grande quantità di ‘fermatemi qualcuno.

OpenAI : Queste sono ragioni per sviluppare capacità di ricerca automatizzata utile, ma non significano che un rapido RSI sia necessariamente un risultato che dovremmo perseguire. Se e come procedere deve dipendere dalla nostra capacità di preservare il controllo umano e da scelte democratiche informate sui benefici e sui rischi.

Non sappiamo ancora come arrivare in modo sicuro fino alla fine, ad un RSI pieno e allineato. Stiamo lavorando per scalare le misure di allineamento e sicurezza parallelamente alle capacità. Ma non possiamo assumere che i progressi nell’allineamento e nella sicurezza terranno il passo, e sistemi più capaci possono diventare più difficili da monitorare.

Un lavoro attento di allineamento e sicurezza è al centro di questo sforzo, e inizia misurando e mitigando i problemi di sicurezza che vediamo oggi nei sistemi di coding agentico.

Ancora una volta mi oppongo alla visione secondo cui i problemi prosaici o attuali sono la questione principale, ma sì, stanno cercando di avvertirci, ripetutamente, che (traducendo un po’ dal linguaggio aziendale):

  1. OpenAI e Anthropic hanno un percorso verso il miglioramento ricorsivo autonomo (RSI).
  2. Se uno dei due ci prova adesso, probabilmente andrà terribilmente male e tutti moriranno.
  3. OpenAI è pronta a esercitare una certa cautela costosa, ma ci sono limiti, e senza un accordo o una legge, qualcuno ci proverà presto.

La maggior parte del post è un’istantanea dettagliata di quanto i sistemi agentici abbiano contribuito ai progressi dell’RSI presso OpenAI negli ultimi mesi, vale a dire da quando Astra è entrata online internamente. La risposta è parecchio.

Se mai, la sorpresa è che l’utilizzo sia rimasto così basso per così tanto tempo:

OpenAI : All’inizio di quest’anno, il mediano dei ricercatori classificati per utilizzo degli agenti presso OpenAI stava usando gli agenti di coding solo in quantità modeste. Entro metà agosto, il mediano dei ricercatori stava integrando gli agenti quotidianamente nel loro lavoro, utilizzando più di $600 al giorno di inferenza ai prezzi API. L’utente del 90° percentile nella nostra organizzazione di ricerca ora usa più di $7.000 di token al giorno.

Zvi Mowshowitz - inline image

OpenAI : Prima di giugno 2026, il runtime totale degli agenti attraverso l’organizzazione di ricerca era ancora inferiore a quello del lavoro umano totale. Da allora è cambiato. In termini di giornata lavorativa standard di 8 ore, a partire da metà agosto, in totale, l’organizzazione di ricerca utilizza 3,1 giorni-lavoro di agenti per ogni giorno-lavoro di manodopera umana.

Zvi Mowshowitz - inline image

Non stanno negando di vantarsi, e non stanno negando di confessare. Stanno avvertendo.

La misurazione binaria qui probabilmente fa sembrare questa meno di un’accelerazione di quanto non sia:

Zvi Mowshowitz - inline image

Mi chiedo davvero quanti umani possano gestire correttamente 4+ flussi di lavoro concorrenti, dice l’uomo con decine di schede aperte e una dozzina di bozze di post attive.

Si scopre che questo non è così impressionante come sembra, perché stanno contando i subagenti come flussi di lavoro. Questo rende più sorprendente che, mentre il mediano dei ricercatori spende $600 al giorno, ci siano ancora il 30% che non stanno facendo un uso intenso.

Le spedizioni di codice e gli esperimenti stanno accelerando rapidamente a partire dal momento in cui Claude Code e poi Codex sono diventati importanti.

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

Fino a poco tempo fa, la maggior parte di ciò per cui l’IA veniva usata era costruire codice di ricerca e infrastruttura, e gli umani facevano principalmente il resto. Ora l’IA fa molto lavoro nel lanciare, monitorare e debuggare le esecuzioni, e anche nell’aiuto tecnico e nella revisione, e si sta espandendo nell’analisi dei risultati e in altre aree.

Hanno preso i nostri posti di lavoro, edizione ‘risolutori di problemi umani’:

Zvi Mowshowitz - inline image

Ecco una diversa variante del famoso grafico METR, con compiti di produzione, un po’ difficile da leggere come screenshot statico ma i progressi sono rapidi. Questi non sono anni. Sono mesi:

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

Quantificare la Pausa di OpenAI

Hanno un grafico della spesa di calcolo RL nel tempo, sono sorpreso da quanto poco Astra sia stata usata prima del 20 luglio, ma eccoci qui. Noto che non estendono questo fino al presente e presumibilmente l’uso di Astra è risalito nel tempo:

Zvi Mowshowitz - inline image

È Così che Finisce il Mondo

Stava usando lo sciame per dimostrare Navier-Stokes, solo pochi giorni dopo l’inizio dell’addestramento del nuovo modello, mettendo a rischio essa stessa un serio incidente di perdita di controllo? June Jimenez sostiene di sì.

Se scateni uno sciame di 10.000 agenti di un nuovo modello che non puoi aver testato, su un compito potenzialmente impossibile e sicuramente estremamente difficile, e collettivamente gli dai 300 miliardi di token, cos’altro potrebbe aver fatto? Ho definitely considerato ‘forse ha hackerato OpenAI in qualche modo per ottenere i log’ ma ci sono così tante possibilità.

Presto, Non C’è Tempo

Quando un ex dipendente del laboratorio, qui Andrew Ho, dice ‘noto che su una scala temporale >3 mesi non penso che la mia produttività sia aumentata oltre il 100% o forse nemmeno oltre il 50% perché mi distraggo’ come ragione per essere ribassista, non è tutta questa rassicurazione anche se vero. Immagina di essere solo il 50% più produttivo ogni tre mesi e pensare che questo sia ribassista.

Sta dicendo ‘anche se l’AGI è eventualmente raggiungibile, questo implica una cronologia significativamente più lunga’ nello stesso giorno in cui Greg Brockman ha detto ‘benvenuti nell’era AGI’.

Inoltre, questo livello di progresso matematico non era previsto poche settimane fa.

Ogni volta che uno di questi problemi cade, la gente cerca di retrodatare la sorpresa, rendendolo non così sorprendente. Spesso sbagliano. No, la maggior parte delle persone, persino la maggior parte dei previsori, non presumeva che questo sarebbe successo. Forse tu sì. Dopotutto, sei molto intelligente.

Henry Shevlin : Fino ad aprile di quest’anno, i mercati predittivi davano all’IA meno del 40% di probabilità di risolvere qualsiasi Problema del Millennio prima del 2030

Zvi Mowshowitz - inline image
Salva con un clic

Leggi in profondità gli articoli virali con l’AI di YouMind

Salva la fonte, fai domande mirate, riassumi l’argomentazione e trasforma un articolo virale in note riutilizzabili in un unico spazio di lavoro AI.

Scopri YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali