Anthropic ha recentemente rimosso circa l'80% del system prompt di Claude Code per i suoi modelli più recenti.
Il ragionamento è intuitivo: man mano che i modelli diventano più intelligenti, hanno bisogno di meno indicazioni, meno vincoli e meno esempi. Oltre un certo livello di capacità, gli esempi smettono di aiutare e iniziano a limitare il modello.
Crediamo che la decisione di Anthropic sia supportata dai dati, ma quelle prove valgono solo per i suoi modelli più recenti.
La domanda successiva è ovvia: funziona anche su un cavallo di battaglia popolare e comune come Deep Seek v4?
I modelli piccoli, veloci ed economici sono proprio quelli che ci si aspetterebbe abbiano bisogno di un supporto dettagliato. Taglia il loro prompt a metà, e il senso comune dice che dovrebbero crollare.
Noi abbiamo fatto l'esperimento, così non devi farlo tu.
L'impostazione
Il nostro agente di coding, Ante, include una modalità --short-prompt.
Consolida il system prompt da circa 5.000 a 2.300 caratteri e accorcia le descrizioni degli strumenti. Insieme, questi cambiamenti riducono il prompt completo per richiesta da circa 34.000 a 18.000 caratteri.
Abbiamo testato le due versioni con un A/B test su:
- Compiti: Suite completa di 89 task di Terminal-Bench 2.1
- Modello: DeepSeek V4 Flash
- Tentativi: Uno per task
- Variabile modificata: Un singolo flag CLI
Tutto il resto è rimasto costante: la stessa build dell'agente, il digest del dataset bloccato, il pool di sandbox, il livello di sforzo e i flag di runtime.
Il risultato

Prestazioni: parità. Il prompt breve ha effettivamente ottenuto un punteggio più alto di +2,3 punti, ma con un solo tentativo per task rientra nel rumore di fondo.
Token di input: 32% in meno nel sottoinsieme con lo stesso risultato.
Venti task hanno cambiato esito (passa/non passa) tra le esecuzioni, il che ha anche modificato la durata del lavoro degli agenti, rendendo i conteggi dei token un confronto poco valido. Escludiamo quei 20 task, lasciando i 69 il cui risultato è rimasto invariato, poi confrontiamo le due mediane indipendenti: 509.498 token di input con il prompt lungo contro 346.409 con il prompt breve. È il 32% in meno. Questo è un sottoinsieme deliberatamente selezionato, non una stima dei costi dell'intera suite.

I totali aggregati di token di input su tutti gli 89 task sono quasi piatti, ed è giusto essere onesti al riguardo: la cronologia della conversazione domina l'uso degli input, e in alcuni task in cui l'esecuzione con il prompt breve ha seguito un percorso di soluzione più lungo, i risparmi per richiesta vengono annullati nella somma. Anche il costo di esecuzione è cambiato solo leggermente, passando da $4,25 a $4,18.
Cosa abbiamo cercato e non trovato: un precipizio di capacità. Venti task hanno cambiato esito tra le esecuzioni — 11 nuovi superati, 9 nuovi falliti — ma questo turnover è una varianza caratteristica dei tentativi singoli su questo benchmark, non un pattern. Nessuna categoria di task è collassata.
Cosa questo esperimento non dimostra
Questo è stato:
- Un modello
- Un benchmark
- Un tentativo per task
Il risultato del 32% dei token proviene da un sottoinsieme selezionato con lo stesso risultato. La quantità di turnover dei task tra le esecuzioni dimostra anche perché sia importante la validazione multi-tentativo.
Con un rumore di fondo stimato di circa ±5 punti percentuali, una piccola regressione potrebbe ancora nascondersi in questi risultati. Eseguiremmo una valutazione multi-tentativo prima di cambiare il default per tutti.
Il messaggio chiave
Per questo modello, su questo benchmark, abbiamo tagliato il prompt circa a metà e non abbiamo misurato nulla di peggiore.
Tra i 69 task con lo stesso risultato, il conteggio mediano di token di input dell'esecuzione con prompt breve era circa un terzo inferiore.
Il risultato corrisponde alla direzione osservata da Anthropic un gradino più in alto:
Quando arriva una nuova generazione di modelli, la tua prima mossa non dovrebbe essere aggiungere al prompt. Dovrebbe essere cancellare.
Quanto del tuo system prompt è ancora lì perché un modello di due generazioni fa ne aveva bisogno?





