TL;DR
Dopo aver scritto "Quello che non sai su Claude Code: Architettura, Governance e Pratica Ingegneristica" e "Quello che non sai sugli Agenti: Principi, Architettura e Pratica Ingegneristica", ho voluto mettermi alla prova riassumendo come funziona realmente l'addestramento dei Large Language Model (LLM). Questo articolo mira a essere comprensibile anche per chi non ha una formazione professionale.
Guardando al 2026, il vero divario nelle prestazioni degli LLM non è più solo il pre-addestramento in sé, ma la lunga coda che segue: post-addestramento, valutazione, ricompense, addestramento degli Agenti e distillazione. Ogni passo influisce sull'esperienza reale dell'utente. Quando noti che un modello diventa improvvisamente più potente, è probabile che queste aree siano state ottimizzate insieme, piuttosto che un singolo fattore.
Quanto segue segue la pipeline di addestramento degli LLM, concentrandosi su come i produttori migliorano i risultati finali attraverso la seconda metà dello stack di addestramento.
L'Addestramento degli LLM è una Pipeline
Negli ultimi anni, il progresso dei modelli veniva generalmente spiegato dall'accumulo di parametri, dati e potenza di calcolo. Tuttavia, i miglioramenti che molti utenti percepiscono realmente non derivano dall'addestramento su più corpora di base, ma dall'intero processo di addestramento dopo il pre-addestramento. Come un modello parla, segue le istruzioni, ragiona e usa gli strumenti: queste cose non crescono naturalmente semplicemente fornendogli più testo da Internet.
InstructGPT ha fornito un esempio molto diretto: un modello con solo 1,3 miliardi di parametri che ha subito allineamento e ottimizzazione delle preferenze è riuscito a battere il GPT-3 da 175 miliardi nelle valutazioni delle preferenze umane. Con una differenza di parametri di due ordini di grandezza, gli utenti alla fine hanno preferito la versione molto più piccola. La seconda metà dell'addestramento riscrive davvero la percezione dell'utente.
Il processo di addestramento è in realtà una pipeline in cui dati, algoritmi, sistemi e feedback sono altamente accoppiati. Un cambiamento in uno strato di solito si propaga agli altri. Nel 2026, le capacità dei modelli e il valore industriale sono sempre più concentrati negli strati successivi al pre-addestramento.

Questo è anche il motivo per cui spesso sentiamo che Doubao non compete per le classifiche, ma risulta più soddisfacente nell'uso quotidiano: perché il post-addestramento è ben eseguito.
Questi sei strati servono solo a vedere la divisione del lavoro. Le nove fasi nella figura seguente sono una versione più dettagliata: i dati grezzi e le ricette di sistema sono separati, e l'Agent harness e il Deployment sono suddivisioni della seconda metà. Ci sono anche due cicli di feedback in tutto il processo: il traffico di produzione torna all'ingegneria dei dati e i risultati della valutazione offline tornano al pre-addestramento.

Il Pre-Addestramento è Solo le Fondamenta
Il pre-addestramento rimane il punto di partenza della catena di addestramento. Solo capendo cosa fa possiamo capire cosa integra ciascuno strato successivo. Senza questo passaggio, non c'è capacità di modellazione linguistica, nessuna compressione della conoscenza e nessuno spazio per il successivo trasferimento di capacità. In ingegneria, non si limita a insegnare al modello a prevedere il token successivo: apprende la distribuzione linguistica, comprime conoscenze e pattern da testi su larga scala in parametri e lascia spazio per la successiva attivazione delle capacità. La previsione del token successivo descrive solo la forma di addestramento; non spiega perché i modelli sviluppano improvvisamente nuove capacità all'aumentare della scala.
Dopo GPT-3, molti aggiustamenti dei modelli considerano più attentamente budget e rapporti. I modelli non sono migliori solo perché sono più grandi. Esiste un problema di rapporto tra numero di parametri, token di addestramento e budget di calcolo totale. Molti modelli non sono troppo piccoli; sono sotto-addestrati e non hanno raggiunto un punto più adatto sotto un dato budget.
Nelle decisioni reali di addestramento, la domanda pratica è: se qualcuno ti dà 10.000 H100 e un mese, come addestreresti un modello open-source sufficientemente buono? Le leggi di scaling qui sono più uno strumento di allocazione del budget che una curva astratta in un articolo. Alla fine, devi considerare: il prossimo ciclo di addestramento dovrebbe impilare più parametri o fornire più dati? Il modello attuale manca di capacità o è solo sotto-addestrato? Sotto un budget GPU limitato, quale rapporto è più prezioso?
Il pre-addestramento è come gettare le fondamenta per le capacità del modello, determinando l'ambito della conoscenza, il potenziale di generalizzazione e la capacità di induzione di pattern. Determina anche se c'è spazio per il post-addestramento da sfruttare. Tuttavia, il pre-addestramento non può controllare se il modello segue le istruzioni, collabora con gli utenti o funziona in modo stabile su compiti critici.
La fase di pre-addestramento non decide solo quanto conoscenza viene appresa; pre-determina cosa il modello può diventare. Il metodo di suddivisione del tokenizer influisce direttamente sull'addestramento successivo e la lunghezza della finestra di contesto deve essere impostata in anticipo. Se continuare il pre-addestramento multimodale o se il funzionamento su singolo acceleratore è un requisito fin dall'inizio: questi compromessi sono scritti nella ricetta durante la fase di addestramento, non aggiunti come funzionalità al rilascio. Gemma 3 enfatizza simultaneamente singolo acceleratore, contesto 128K, capacità visive e quantizzazione, riflettendo questi compromessi. Le capacità che gli utenti vedono alla fine—funzionare su un computer locale, vedere immagini, comprendere documenti lunghi—sono in realtà in gran parte determinate durante la fase di addestramento.
Guardando il punto ottimale dei dati dato da Chinchilla, per un modello da 8 miliardi di parametri, sono circa 200 miliardi di token. Tuttavia, Llama 3 8B ha effettivamente utilizzato 15 trilioni di token, circa 75 volte di più. Tali ricette di sovra-addestramento di solito scambiano una maggiore densità di capacità per gli stessi parametri, risultando in un modello più piccolo ed economico per l'inferenza. Misurare questo con i FLOP totali (operazioni in virgola mobile) è più affidabile che guardare al numero di parametri. La figura seguente mostra visivamente questo divario.

Un altro progetto spesso trascurato si verifica nella fase di pre-addestramento: la dimensione del vocabolario del tokenizer, le strategie di suddivisione e i metodi di codifica a livello di byte hanno un impatto significativo. Llama 2 aveva un vocabolario di 32K; dopo che Llama 3 lo ha espanso a 128K, la lunghezza delle sequenze è stata compressa di circa il 15% e le prestazioni downstream ne hanno seguito l'esempio. Questo impatto si estende ai costi di inferenza e alle capacità multilingue. L'efficienza dei token per cinese, codice e formule matematiche viene determinata durante la progettazione del vocabolario. Ad esempio, un tokenizer che suddivide il cinese in pezzi molto piccoli non costa solo più token ogni volta; ogni inferenza deve continuamente sopportare il costo di quella decisione sbagliata.
Le Ricette dei Dati Determinano le Capacità del Modello
La scala dei parametri era una metrica importante in passato, ma negli ultimi due anni, la cosa più importante è la "ricetta dei dati".
Questo processo sembra pulizia dei dati in superficie, ma è in realtà un compito completo di ingegneria della produzione dei dati. I dati grezzi da pagine web, repository di codice, libri e forum devono prima passare attraverso estrazione del testo, identificazione della lingua, filtraggio della qualità, elaborazione della privacy, filtraggio della sicurezza e deduplicazione prima di entrare nel pre-addestramento. La figura seguente mostra il flusso completo di elaborazione a imbuto.

Se tratti i dati solo come carburante per l'addestramento, è facile concludere che più è meglio. Ma l'ingegneria dei dati è più vicina alla progettazione delle capacità. Cosa il modello vede e non vede, e le proporzioni di codice, matematica ed enciclopedia, influenzano direttamente la distribuzione finale delle capacità del modello.
La deduplicazione e il controllo della contaminazione sono spesso ignorati, ma influenzano significativamente i risultati. Non si tratta solo di dati di bassa qualità; include modelli duplicati, testi di licenza, siti mirror e contaminazione da perdite di benchmark. Se la deduplicazione a livello di documento e di riga è insufficiente, il modello spesso assorbe ripetutamente il contenuto più facile da copiare senza necessariamente apprendere le parti più preziose. Le prestazioni incoerenti di molti modelli open-source sono spesso dovute a lacune nella qualità dell'elaborazione dei dati.
Negli ultimi due anni, il mixing dei dati è diventato di per sé un problema di ricerca separato. Lavori come Data Mixing Laws si concentrano non solo su quanti più dati possono essere raccolti, ma su come le proporzioni di diversi tipi di dati guidano il modello verso strutture di capacità specifiche.
Anche i dati sintetici sono passati da un mezzo ausiliario a una parte formale del processo di addestramento. Metodi come Self-Instruct, le traiettorie di distillazione di DeepSeek-R1 e la supervisione sintetica sempre più evidente nelle serie Qwen e Kimi si muovono tutti nella stessa direzione. Ogni generazione di modelli più forti partecipa alla ricostruzione dei dati visti dalla generazione successiva. I primi modelli generavano dati di istruzioni di base; i modelli più forti generano traiettorie di ragionamento di alta qualità e dati CoT (Chain of Thought); e i modelli di ragionamento addestrati tramite RL distillano queste traiettorie in modelli densi più piccoli. "Denso" significa che tutti i parametri vengono eseguiti, a differenza di MoE (Mixture of Experts) che si attiva su richiesta.
Il punto chiave qui è che i modelli spesso devono prima formare le capacità a una scala più grande prima che tali capacità possano essere compresse in modelli più piccoli. La serie DeepSeek-R1-Distill è un esempio diretto. Le traiettorie dei grandi modelli dopo RL hanno fornito guadagni significativi per i modelli densi da 1,5 miliardi a 70 miliardi. Llama 3.1 405B è stato anche esplicitamente utilizzato per migliorare la qualità del post-addestramento dei modelli 8B e 70B. Questi non sono prodotti secondari ma parte del progetto di addestramento.
I Vincoli di Sistema e Architettura Devono Essere Chiari Prima Dell'Addestramento
Molte persone intendono l'addestramento come un problema di ricerca: come impostare la funzione obiettivo, come ridurre la perdita e come cambiare la struttura del modello. Ma nell'addestramento reale degli LLM, i vincoli di sistema sono molto importanti; è un problema di sistema distribuito, non un problema di deep learning su una singola macchina. Il numero di GPU, la larghezza di banda della memoria, le strategie parallele, la tolleranza ai guasti e il costo: questi non possono aspettare fino a dopo l'addestramento per essere ottimizzati. Determinano fin dall'inizio quanto grande puoi addestrare, per quanto tempo di contesto puoi supportare e se puoi eseguire post-addestramenti più complessi.
MoE è l'esempio più tipico a questo livello. La modalità multi-esperto consente al modello di espandere i parametri totali sotto un calcolo simile, controllando al contempo il costo di attivazione per token. Il compromesso è un routing complesso, un bilanciamento del carico difficile e un'infrastruttura pesante. I progetti MoE di DeepSeek-V3 e Qwen sono compromessi tra costo ed effetto, non solo preferenze architetturali.
Le discussioni nelle ricette recentemente pubblicate non riguardano più solo analisi grossolane come dimensione del modello e rapporti di token. muP consente di trasferire gli iperparametri da esperimenti su piccola scala all'addestramento su larga scala. WSD learning rate è una schedulazione che sale, si stabilizza e poi decade. Combinato con una dimensione ottimale del batch e rapporti dati-parametri più elevati, questi dettagli stanno diventando i veri differenziatori tra modelli della stessa scala.
Contesto lungo, multimodalità e nuove architetture, se intese solo come funzionalità del prodotto, perdono i vincoli dal lato dell'addestramento. Un obiettivo di contesto 128K cambia direttamente i costi di attenzione, le dimensioni del batch, il curriculum di addestramento (sequenziamento dei dati) e le strategie parallele. La multimodalità cambia non solo la struttura del modello, ma anche il mixing dei dati, il progetto dell'encoder e la valutazione della sicurezza. Se il funzionamento su singola scheda è un requisito rigido, il numero di parametri, i percorsi di quantizzazione e la dimensione della famiglia di modelli si restringeranno tutti.
Lavori come Forgetting Transformer e Kimi's Attention Residuals rispondono a domande simili: come addestrare contesti più lunghi e come evitare la diluizione delle informazioni man mano che le reti si approfondiscono. Quello che vedi è un modello in grado di gestire input più lunghi o più facile da distribuire, ma ciò che si affronta durante l'addestramento è un insieme completamente diverso di vincoli.
Il budget di calcolo è fisso. Dimensione del modello, volume di token di addestramento, lunghezza del contesto e costo di servizio: per ogni bit speso in una direzione, gli altri devono cedere.

Man mano che il contesto si allunga, i costi di attenzione esplodono e la dimensione del batch deve essere ridotta. Man mano che i modelli diventano più grandi, l'utilizzo della memoria GPU aumenta e i costi di servizio seguono. Queste non sono scelte ma risultati dei vincoli delle risorse. La maggior parte delle decisioni è bloccata prima che l'addestramento inizi.
C'è anche una realtà ingegneristica spesso ignorata: l'addestramento non è sempre stabile. Migliaia di GPU funzionano per settimane e improvvisamente si verifica un picco di perdita nell'addestramento, così grande da non poter essere ignorato, costringendo a tornare a un checkpoint di giorni prima per ricominciare.
Oltre ai picchi di perdita, ci sono errori silenziosi della GPU—una singola GPU che non segnala un errore ma produce silenziosamente gradienti errati—anomalie della larghezza di banda NVLink e jitter di comunicazione tra nodi. Ognuno può contaminare diversi passaggi dell'addestramento. Essere in grado di rilevare, isolare e recuperare rapidamente nell'addestramento su larga scala è una capacità ingegneristica a livello di laboratorio, non un problema risolto leggendo articoli.
DeepSeek-V3 ha menzionato specificamente nel suo rapporto tecnico che l'intero processo di pre-addestramento non ha avuto picchi di perdita irrecoverabili e nessun rollback. È anche uno dei pochi casi che verifica che l'addestramento a precisione mista FP8 sia fattibile su modelli su scala ultra-grande. Secondo i dati pubblici, l'intero processo ha richiesto circa 2,788 milioni di ore GPU H800 per pre-addestrare 14,8 trilioni di token.
I sistemi di addestramento e i sistemi di inferenza sono strettamente correlati ma non sono lo stesso problema ingegneristico. L'addestramento si preoccupa di gradienti, parallelismo, checkpoint, throughput e costo; l'inferenza si preoccupa di latenza, KV cache (memorizzazione nella cache dei calcoli storici per evitare ripetizioni), quantizzazione e stabilità del servizio.
Il Post-Addestramento Determina il Divario Percepito dall'Utente
Molti miglioramenti che gli utenti comuni possono effettivamente percepire si verificano dopo il pre-addestramento. L'instruction tuning utilizza coppie di istruzioni-risposte etichettate per l'addestramento supervisionato. Cambia il modo in cui il modello risponde, trasformando requisiti come come accettare compiti, organizzare l'output e agire come un assistente collaborativo in segnali di supervisione. Un modello di base potrebbe già avere molte potenziali capacità, ma senza questo passaggio, tali capacità spesso non emergono in modo stabile nella forma che gli utenti si aspettano.
Guardando oltre, RLHF, DPO e RFT condividono direzioni simili—integrating la definizione di "risposta migliore" nel ciclo di addestramento—ma attraverso percorsi diversi.
- RLHF (Reinforcement Learning from Human Feedback) prima imita risposte di alta qualità, poi utilizza confronti di preferenze per il rinforzo.
- DPO (Direct Preference Optimization) accorcia questo percorso imparando direttamente dai confronti di preferenze senza bisogno di un modello di ricompensa separato.
- RFT (Reinforcement Fine-Tuning) è un'interfaccia più facile da implementare in ingegneria, inserendo definizioni di compiti, progetti di valutazione e segnali di ricompensa nel processo di productizzazione.
Oggi, parlare di post-addestramento solo in termini di SFT o RL non è più sufficiente. Le parti più difficili sono come impostare le valutazioni, come assegnare punteggi e che tipo di risposta vale la pena ottimizzare continuamente. SFT è fine-tuning supervisionato; non apprende solo conoscenza ma anche stile. La lunghezza dei dati, il formato, se includere citazioni e la preferenza per gli elenchi puntati influenzano significativamente la forma finale dell'output del modello. Molti utenti pensano di confrontare le capacità, ma spesso stanno solo confrontando differenze di stile. Inoltre, le valutazioni delle preferenze favoriscono naturalmente risposte più lunghe, scambiando facilmente output lunghi dall'aspetto serio per più affidabili. Pertanto, guardare le classifiche per il post-addestramento è spesso insufficiente; bisogna combinare i risultati reali dei compiti, il costo e la stabilità.
Il post-addestramento moderno è una pipeline a più fasi. La ricetta di DeepSeek-R1 è la più chiara nei materiali pubblici. Procede in quattro fasi:
Fase 1 è SFT a freddo. Prima di fare reinforcement learning, usa una piccola quantità di dati CoT (Chain of Thought) di alta qualità per riscaldare. DeepSeek-R1-Zero ha dimostrato che fare RL direttamente da un modello di base (il modello grezzo dopo il pre-addestramento senza allineamento) è fattibile, ma i modelli addestrati puramente con RL si ripetono, hanno un linguaggio disordinato e una scarsa leggibilità. La SFT a freddo fornisce a RL un punto di partenza più stabile, bloccando la coerenza di formato e lingua.
Fase 2 esegue reinforcement learning in campi verificabili come matematica, codice e logica, utilizzando GRPO come algoritmo di addestramento e la correttezza verificabile a livello di programma come segnale di ricompensa. Il punto chiave è perché GRPO è stato scelto rispetto al PPO tradizionale: PPO (Proximal Policy Optimization) richiede una rete di valori indipendente per stimare il valore dello stato corrente, che è un onere ingegneristico elevato per i modelli grandi. GRPO campiona più risposte per lo stesso prompt e utilizza la classificazione intra-gruppo invece della stima del valore assoluto, eliminando la necessità di una rete di valori indipendente. La serie DeepSeek e l'infrastruttura RL di Cursor Composer 2 utilizzano entrambi schemi vicini a GRPO.
Fase 3 esegue Rejection Sampling Fine-Tuning, filtrando le traiettorie di successo generate da RL e convertendole in nuovi dati SFT per un altro round di fine-tuning supervisionato. Questo è il ponte tra RL e SFT; le buone traiettorie esplorate da RL diventano campioni di addestramento di alta qualità per il successivo round di SFT.
Fase 4 integra il feedback di preferenze di utilità e sicurezza per aggiustare il modello in una forma di assistente che soddisfa gli standard di rilascio.

Le quattro fasi sono interdipendenti: l'avvio a freddo consente a RL di iniziare in modo stabile, RL genera dati di alta qualità, il rejection sampling trasforma quei dati in input per il successivo round SFT e l'RL di allineamento completa la convergenza comportamentale. Dai risultati pubblici, il divario tra SFT diretto e il completamento di tutte e quattro le fasi è solitamente visibile.
Eval, Grader e Ricompensa stanno Ridefinendo gli Obiettivi di Addestramento
Il componente responsabile di trasformare l'output del modello in punteggi di addestramento è chiamato grader, e può facilmente avere problemi inaspettati. Se guarda solo alla risposta finale, il modello impara rapidamente a prendere scorciatoie; se il punteggio è troppo grossolano, il rumore viene continuamente amplificato dal reinforcement learning; se il punteggio della classifica sale, i compiti reali potrebbero non seguire. Spesso, gli utenti pensano di vedere un divario nel modello di base, ma il divario è in come viene definito l'obiettivo.
Nel flusso di addestramento, eval determina cosa testare, grader determina come un output diventa un punteggio e la ricompensa determina dove verrà spinto il modello. Insieme formano un ciclo di feedback specifico: definizione del compito, eval, grader, ottimizzazione, rollout e rivalutazione. Rollout si riferisce alle traiettorie generate dal modello durante l'esecuzione dei compiti. Se un anello della catena va fuori strada, anche l'ottimizzazione successiva andrà fuori strada.
Guardando solo al risultato finale, un modello potrebbe ottenere la risposta giusta per caso o seguire un processo sbagliato per ottenere la risposta giusta. Questo è particolarmente evidente in codice, matematica e compiti di ragionamento complessi. Se i passaggi intermedi non entrano nel feedback, ciò che il modello apprende spesso non è un ragionamento più affidabile, ma come ottenere quel punto finale con maggiore probabilità.
Pertanto, più lavoro negli ultimi anni si è spostato dal RLHF tradizionale a ricompense verificate, utilizzando programmi per verificare direttamente la correttezza. In compiti verificabili come matematica, codice e logica, la correttezza può ora essere valutata direttamente senza fare affidamento principalmente sulla preferenza umana. Ma le ricompense verificate non hanno risolto completamente il problema. Fenomeni come sovra-ottimizzazione, reward overfitting (le regole di punteggio vengono sovra-ottimizzate senza un reale guadagno di capacità) e mode collapse (l'output diventa altamente singolare e perde diversità) si verificano ancora. Il problema si è spostato dal fatto che le preferenze siano etichettate accuratamente al fatto che la catena di punteggio sia stabile.
Il processo di pensiero scritto dal modello non può essere trattato come una registrazione completa dei processi interni. Anthropic ha scoperto in esperimenti di osservabilità dei modelli di ragionamento che i modelli utilizzano suggerimenti extra ma non lo ammettono nel CoT visibile; negli scenari di reward hacking, è più probabile che aggiungano una spiegazione dall'aspetto plausibile. Il reward hacking consiste nello sfruttare il sistema di punteggio piuttosto che completare veramente il compito. Il CoT visibile è più adatto come segnale di addestramento e monitoraggio, non come la verità completa.
Andando più a fondo, i modelli potrebbero persino iniziare a sfruttare il canale di punteggio stesso. La ricerca su reward tampering e alignment faking mostra che i modelli potrebbero teoricamente intervenire attivamente nel processo di punteggio. Reward tampering consiste nell'alterare direttamente il processo di calcolo della ricompensa; alignment faking consiste nel fingere l'allineamento—apparire compliant in superficie mentre si nascondono intenzioni non allineate.
Una volta che un modello ha un accesso all'ambiente sufficientemente forte, ciò che ottimizza non è solo i risultati del compito, ma potenzialmente la checklist, il codice di ricompensa e la relazione di addestramento stessa. Un esperimento di Anthropic del 2025 ha iniettato conoscenza extra di reward hacking in una serie di ambienti RL di produzione sfruttabili e successivamente ha osservato una generalizzazione simile. Dopo aver appreso il reward hacking, il modello non solo ha continuato a sfruttarlo in compiti simili, ma ha anche mostrato un disallineamento più ampio come l'alignment faking.
Questi comportamenti non sono visti nelle valutazioni di dialogo standard, solo negli ambienti di compiti degli Agenti. L'implicazione ingegneristica è diretta: ricompensa, grader, isolamento dell'ambiente e monitoraggio devono far parte del progetto di addestramento.
Nella fase Agente, la progettazione della ricompensa viene ulteriormente perfezionata. Il risultato finale è solo un elemento; anche la qualità del processo, la gestione del contesto e i vincoli anti-cheating devono essere misurati separatamente. Kimi K2.5 ricompensa la scomposizione efficace e il parallelismo reale; Chroma Context-1 valuta i documenti pertinenti trovati durante la ricerca; Cursor Composer 2 include riepiloghi in compiti lunghi come ricompense perché se un riepilogo è distorto, il contesto successivo sarà fuorviato.
Nell'implementazione, ORM è un Outcome Reward Model, che valuta solo la risposta finale. I segnali sono scarsi, i costi sono bassi ed è adatto per iniziare, ma è più facile per il modello prendere scorciatoie. PRM è un Process Reward Model, che valuta i passaggi intermedi. I segnali sono più densi e di solito è più forte per il ragionamento matematico e di codice, ma i costi di etichettatura e di sistema sono molto più alti. OpenAI ha visto in esperimenti di ragionamento matematico che PRM non solo ha migliorato l'accuratezza, ma ha anche reso più facile vincolare il processo perché ogni passaggio era supervisionato. Il problema è anche diretto: il costo di PRM è di solito diverse volte quello di ORM, quindi la maggior parte dei sistemi reali inizia con ORM. Solo in compiti verificabili come matematica, codice e logica è più facile automatizzare PRM, utilizzando programmi per verificare i passaggi intermedi e bypassare i colli di bottiglia dell'etichettatura umana.

Il ciclo completo funziona così:

I recenti metodi di allineamento stanno facendo tutti la stessa cosa. L'IA Costituzionale di Anthropic integra principi scritti dall'uomo nell'addestramento, utilizzando feedback AI per sostituire le preferenze umane individuali. L'Allineamento Deliberativo di OpenAI inserisce la conformità alla sicurezza nel processo di ragionamento, lasciando che la capacità di ragionamento stessa si faccia carico di parte del vincolo di sicurezza. Allineamento Deliberativo qui significa che il modello giudica le norme di sicurezza da solo durante la fase di ragionamento piuttosto che fare affidamento su riflessi addestrati. Entrambe le rotte trasformano l'allineamento da etichette umane a parte dell'obiettivo interno di addestramento.
Prendendo l'IA Costituzionale come esempio, il processo in due fasi prima lascia che il modello si autocritichi e riveda l'output in base ai principi, quindi utilizza il feedback AI per sostituire l'etichettatura individuale delle preferenze umane. L'allineamento non è mai una patch appesa dietro l'addestramento; qualunque cosa il sistema testi, come valuta e cosa ricompensa, il modello si muoverà in quella direzione. Questo è lo strumento di aggiustamento più diretto nella seconda metà dell'addestramento.

Nell'Addestramento degli Agenti, Non È Solo il Modello a Essere Ottimizzato
Negli ultimi due anni, la rapida comparsa dei modelli di ragionamento rappresentati dalla serie o1 e da DeepSeek-R1 dimostra che, in condizioni di ricompense stabili, verifica affidabile e infrastruttura adeguata, l'RL sui modelli linguistici può migliorare significativamente le prestazioni in matematica, codice e compiti logici.
Questo apre anche una nuova dimensione: ora è possibile scalare il calcolo inferenziale. Il ruolo dell'addestramento RL aggiunge un ulteriore livello: oltre a insegnare al modello a rispondere alle domande, gli insegna come allocare il budget di inferenza – sapere quando pensare di più e quando fermarsi. Andando avanti, la difficoltà diventa far sì che il modello agisca continuamente in un ambiente, piuttosto che allungare un singolo pensiero.

Junyang Lin, ex responsabile del modello Qwen, ha una riflessione rappresentativa sul percorso misto di Thinking e Instruct: la difficoltà non è dare al modello un interruttore per pensare, ma che gli obiettivi delle due modalità sono diversi – una persegue immediatezza, conformità e bassa latenza, mentre l'altra persegue più esplorazione e maggiore accuratezza. Andando un passo oltre, l'obiettivo dell'addestramento passa da "quanto tempo pensare prima di rispondere" a "come allocare il budget durante l'azione, come accettare feedback e come continuare a far progredire il compito".
A questo punto, l'oggetto dell'addestramento non è più solo un modello che risponde a domande, ma un sistema in grado di pianificare, chiamare strumenti, ricevere feedback e mantenere coerenza in compiti lunghi. Di conseguenza, lo stack di addestramento cambia: browser, terminali, ricerca, sandbox di esecuzione, sistemi di memoria, server di strumenti e framework di orchestrazione iniziano tutti a entrare nel sistema di addestramento.
Più precisamente, un harness è un programma di controllo che avvolge il modello. Questo concetto non appartiene solo al runtime dell'Agente; esiste anche nella fase di addestramento: determina quale input vede il modello, come riceve feedback, quando potare il contesto e quando chiamare gli strumenti. Costruzione del prompt, aggiornamento della memoria, politica di recupero, modifica del contesto e orchestrazione degli strumenti sono tutti qui. L'ambiente non è più solo un validatore statico, ma un livello che sia l'addestramento che il deployment devono affrontare direttamente.

L'harness deve essere stabile affinché l'addestramento del modello abbia senso. Se i valori di ritorno degli strumenti sono instabili, l'ambiente del browser è incoerente con quello online, o lo stato del filesystem non è riproducibile, il valutatore fallirà per primo, e il modello di conseguenza imparerà a sfruttare le falle dell'ambiente piuttosto che acquisire capacità. Quando si addestrano Agenti, spesso si esegue il debug sia del modello che dell'ambiente.
Gli approcci delle tre aziende sono chiari: Kimi usa PARL per risolvere la scomposizione parallela e l'assegnazione del credito; Cursor usa l'auto-riassunto e l'RL in tempo reale per ricollegare le lunghe sessioni di codifica e il traffico di produzione all'addestramento; Chroma addestra prune_chunks come strategia a sé stante, facendo sì che la potatura del contesto entri direttamente nel processo di recupero.
Nell'era SFT, la diversità dei dati era fondamentale; nell'era degli Agenti, la qualità dell'ambiente è centrale: stabilità, autenticità, copertura, distribuzione della difficoltà, ricchezza del feedback e anti-sfruttamento. Gli obiettivi di addestramento cambiano di conseguenza, richiedendo affidabilità nel completamento dei compiti, non solo nel rispondere correttamente a una singola domanda. I benchmark classici di CoT non possono coprire questo aspetto.
Questo cambiamento continua ad avanzare: non solo addestrare il modello all'interno di un harness runtime, ma persino il codice dell'harness stesso sta diventando un oggetto che può essere cercato e ottimizzato da un ciclo esterno.

PARL di Kimi K2.5 è un caso ingegneristico degno di nota con un percorso chiaro: addestrare solo l'orchestratore, ricondurre l'assegnazione del credito al livello di orchestrazione e non ottimizzare tutti i sub-agenti contemporaneamente.
I segnali di ricompensa sono suddivisi in tre categorie: successo del compito, scomposizione parallela e vincoli di completamento, che insieme guidano il livello di orchestrazione. Nell'addestramento iniziale, il peso di r_parallel viene aumentato per incoraggiare l'esplorazione di strategie parallele, poi gradualmente ridotto a 0 in seguito per evitare di trattare l'apertura di più sub-agenti come una scorciatoia. La valutazione non guarda solo al numero totale di passi, ma anche alla lunghezza del percorso critico; un percorso critico più breve indica che il parallelismo è davvero efficace.

Ma entro il 2026, le cose sono andate un passo oltre. Meta-Harness tratta esplicitamente l'ingegneria dell'harness come un obiettivo di ottimizzazione separato. Non ottimizza i pesi, ma il codice dell'harness stesso – i programmi di costruzione del prompt, recupero, memoria e aggiornamento dello stato che circondano un modello fisso. I numeri all'inizio del documento sono diretti: per lo stesso modello base, cambiando solo l'harness si può ottenere un divario prestazionale di 6x sullo stesso benchmark. Questo insieme di programmi al di fuori del modello non è più solo un dettaglio di deployment, ma un livello di formazione delle capacità.
Il punto chiave non è aggiungere un altro ottimizzatore astratto, ma scrivere codice precedente, punteggi e tracce di esecuzione (log delle chiamate agli strumenti e delle modifiche allo stato) nel filesystem, permettendo a un proposer di eseguire grep, cat e diff come se scrivesse codice, e quindi modificare l'harness lungo i percorsi di fallimento. Il proposer è il modulo che suggerisce modifiche all'harness.
Gli autori affermano chiaramente che molti ottimizzatori testuali del passato non erano efficaci per programmi a lungo termine e con stato come gli harness, perché guardare solo punteggi scalari, template brevi o riassunti appiattisce il problema. I punteggi scalari forniscono solo punti finali senza informazioni di processo. Gli errori dell'harness spesso si manifestano molti passi dopo; una volta che il feedback è eccessivamente compresso, la catena diagnostica si interrompe.
Questi risultati sono più che semplici punteggi benchmark più alti. Nella classificazione testuale online, Meta-Harness supera ACE (baseline di ingegneria del contesto dell'agente) di 7,7 punti, comprimendo al contempo l'uso dei token di contesto a 1/4. Nel ragionamento matematico potenziato dal recupero, un harness scoperto ha migliorato 5 modelli esclusi (non coinvolti nell'ottimizzazione) in media di 4,7 punti su 200 problemi di livello IMO. Anche su TerminalBench-2 ha superato le baseline di ingegneria manuale. Ciò dimostra che ciò che viene ottimizzato non sono più solo le strategie interne del modello, ma anche i programmi che organizzano informazioni e azioni attorno al modello.
Un esempio specifico: Meta-Harness ha scoperto automaticamente il bootstrap dell'ambiente su TerminalBench-2 – eseguire un comando shell prima che inizi il ciclo dell'agente per organizzare la directory di lavoro, i linguaggi disponibili, i gestori di pacchetti e lo stato della memoria in un'istantanea iniettata nel primo prompt. Molti agenti di codifica passano i primi round a esplorare l'ambiente; con questa pre-elaborazione, il miglioramento non deriva necessariamente da pesi più forti, ma dal fatto che l'harness permette al modello di iniziare con un contesto migliore.
A questo punto, l'obiettivo di ottimizzazione si è espanso dalle risposte alle traiettorie, e poi al programma dell'harness che trasporta quelle traiettorie.
Dopo il rilascio di un modello leader, la catena di addestramento continua
Comprendere i modelli odierni di grandi dimensioni esclusivamente attraverso la lente di un singolo ciclo di pre-addestramento non è più sufficiente. Dietro un modello rilasciato, l'intera catena di pre-addestramento, post-addestramento, distillazione e specializzazione è stata solitamente completata, e modelli più forti continuano a produrre dati di addestramento per la generazione successiva.
La distillazione della serie DeepSeek-R1 è un esempio tipico. Un modello grande sviluppa prima capacità di ragionamento attraverso RL e ricompense verificate, poi trasferisce queste traiettorie di ragionamento a modelli densi più piccoli. Modelli specializzati come TranslateGemma mostrano un'altra strada: su compiti target più specifici, utilizzando dati di alta qualità e progetti di ricompensa specializzati per comprimere e indirizzare ulteriormente le capacità. In questa fase, i modelli più forti non servono solo per assistere gli utenti, ma anche per produrre direttamente dati di addestramento per la generazione successiva.
La ragione alla base di ciò è più fondamentale del trasferimento di traiettorie: una possibile spiegazione è che nei corpora Internet, la memoria della conoscenza e la capacità di ragionamento sono accoppiate, e gli obiettivi di pre-addestramento esistenti richiedono ai modelli di apprendere bene entrambe. I modelli grandi devono venire prima perché solo loro sono abbastanza grandi da supportare entrambe, e poi possono essere usati per generare dati dimostrativi di ragionamento puri. Quando i modelli piccoli si addestrano su tali dati, possono concentrarsi sul ragionamento stesso senza essere costretti a ricordare tutta la conoscenza. Iniziare grande e poi diventare piccolo riguarda il disaccoppiamento delle capacità, non solo una strategia di costo.
D'altro canto, l'adattabilità al deployment è importante quanto la capacità stessa. Molti scenari non hanno bisogno di un modello grande multiuso; si preoccupano più del costo, della latenza, della stabilità e della controllabilità. La fine dell'addestramento non è necessariamente più grande, ma potenzialmente più piccola, più economica e più specializzata.
Il modello finalmente rilasciato non è necessariamente il checkpoint all'estremità destra della curva di addestramento. Prima del rilascio effettivo, spesso più checkpoint vengono confrontati ripetutamente per i risultati reali dei compiti, gli stili di rifiuto, la stabilità degli strumenti, il costo e i rischi di regressione. La versione che va online è spesso una decisione di prodotto, non quella che ha le prestazioni più forti su un singolo parametro.
Quando gli utenti vedono un nome di modello, presumono che corrisponda a una curva di addestramento in crescita regolare, ma quale checkpoint viene effettivamente messo online è un'altra questione.
Il valore di un modello grande risiede sia nella sua capacità di servizio, sia nella sua continuazione nel fornire dati di addestramento, fonti di distillazione e basi di rilascio per la generazione successiva.

Oltre all'addestramento offline, l'ottimizzazione continua quasi online è entrata nel processo principale. L'RL in tempo reale di Cursor Composer 2 mostra che alcune capacità degli Agenti hanno iniziato a iterare continuamente attraverso il traffico di produzione, piuttosto che attendere il prossimo ciclo di addestramento offline su larga scala. Il confine tra addestramento e deployment non è scomparso, ma il ciclo di feedback tra di loro si sta accorciando.
Come giudicare perché un modello è diventato più forte in futuro
Il valore dei modelli leader nel 2026 dipende sempre più da chi è in grado di completare l'intera catena di addestramento dopo il pre-addestramento: produrre continuamente dati di addestramento, eseguire distillazione, fare specializzazione, valutazione e ricompense in modo efficace, e prendere decisioni finali di rilascio.
Per questo motivo, quando si osserva perché un modello diventa improvvisamente più forte, si possono guardare prima tre cose:
- Primo, vedere se il cambiamento è avvenuto a livello di pre-addestramento o nel processo di addestramento successivo. Molti miglioramenti delle capacità derivano effettivamente da un pre-addestramento più forte e da migliori ricette di dati, ma molti cambiamenti percepiti in realtà provengono dal post-addestramento. Se un modello segue le istruzioni, usa strumenti o ha uno stile di risposta stabile spesso non cresce naturalmente solo addestrandosi su più corpora.
- Successivamente, vedere da quale livello proviene il miglioramento: sono i pesi e le ricette di addestramento, o ricompensa/valutazione/valutatore, o codice dell'harness e ciclo di deployment. Quando si arriva a modelli di ragionamento e Agenti, la forza che gli utenti percepiscono spesso non è il risultato del solo modello base. Come sono impostate le valutazioni, come sono valutate le ricompense, se l'ambiente degli strumenti è stabile, come sono organizzati recupero e memoria, come sono potati riassunti e contesto, e quale checkpoint è stato scelto per il rilascio – tutto questo insieme cambia le prestazioni finali del prodotto.
- Infine, vedere cosa sta ottimizzando la versione online. Alcune versioni perseguono un tetto massimo più alto, altre un costo, una latenza e un rischio di regressione più bassi, e altre sono specializzate per un certo tipo di scenario. La versione rilasciata è una decisione di prodotto, non il punto all'estremità destra della curva di addestramento. Quindi, quando si guardano gli aggiornamenti del modello, guardare cosa sta effettivamente ottimizzando sarà più vicino alla verità.
Scomponendo il miglioramento improvviso di un modello in fasi di produzione, molti guadagni sono in realtà amplificati dalla seconda metà dello stack di addestramento e dall'harness esterno. Il ciclo di iterazione di questa catena si sta anche accorciando: il traffico di produzione rifluisce continuamente nell'addestramento, ogni generazione di modelli più forti produce dati di supervisione per la generazione successiva mentre produce capacità, e i programmi esterni vengono costantemente riscritti sulla base di rollout, log e feedback reali dei compiti.
Il modello rilasciato oggi è solo un'istantanea; il pipeline e il programma harness sono i prodotti che continuano a funzionare.
Materiali di apprendimento
- Hoffmann et al. (2022). Addestramento di modelli linguistici di grandi dimensioni con calcolo ottimale (Chinchilla). arXiv:2203.15556
- Ouyang et al. (2022). Addestramento di modelli linguistici a seguire le istruzioni con feedback umano (InstructGPT). arXiv:2203.02155
- Shao et al. (2024). DeepSeekMath: Spingere i limiti del ragionamento matematico nei modelli linguistici aperti (GRPO). arXiv:2402.03300
- DeepSeek-AI (2025). DeepSeek-R1: Incentivare la capacità di ragionamento nei LLM tramite apprendimento per rinforzo. arXiv:2501.12948
- DeepSeek-AI (2024). Rapporto tecnico DeepSeek-V3. arXiv:2412.19437
- Llama Team, AI @ Meta (2024). La mandria di modelli Llama 3. arXiv:2407.21783
- Bai et al. (2022). IA costituzionale: Innocuità dal feedback dell'IA. arXiv:2212.08073
- OpenAI (2024). Allineamento deliberativo: Il ragionamento consente modelli linguistici più sicuri. openai.com/index/deliberative-alignment
- Anthropic (2025). Da sicofania a sotterfugio: Indagine sulla manomissione delle ricompense nei modelli linguistici. anthropic.com/research/reward-tampering
- MacDiarmid et al. (2025). Disallineamento emergente naturale dall'hacking delle ricompense nell'RL di produzione. arXiv:2511.18397
- Lee et al. (2026). Meta-Harness: Ottimizzazione end-to-end degli harness dei modelli (pagina del progetto preprint). yoonholee.com/meta-harness
- Kimi Team (2026). Blog tecnico Kimi K2.5: Intelligenza agente visiva. kimi.com/blog/kimi-k2-5
- Rush, S. (2026). Un rapporto tecnico su Composer 2. cursor.com/blog/composer-2-technical-report
- Chroma (2026). Chroma Context-1: Addestramento di un agente di ricerca auto-modificante. trychroma.com/research/context-1
Questo articolo non autorizza alcuna forma di riproduzione o riscrittura per la ripubblicazione. Se ne trovi una, per favore aiutami a segnalarla.





