Claude Code ha ridotto il proprio system prompt dell'80%. Funziona anche per i modelli più piccoli?

@antigma_labs
INGLESE1 giorno fa · 26 lug 2026
230K
15
2
0
2

TL;DR

Testare la riduzione dei prompt su DeepSeek V4 Flash rivela che i modelli più piccoli non sempre necessitano di istruzioni prolisse, raggiungendo la parità di prestazioni con prompt molto più brevi.

Anthropic ha recentemente rimosso circa l'80% del system prompt di Claude Code per i suoi modelli più recenti.

Il ragionamento è intuitivo: man mano che i modelli diventano più intelligenti, hanno bisogno di meno indicazioni, meno vincoli e meno esempi. Oltre un certo livello di capacità, gli esempi smettono di aiutare e iniziano a limitare il modello.

Crediamo che la decisione di Anthropic sia supportata dai dati, ma quelle prove valgono solo per i suoi modelli più recenti.

La domanda successiva è ovvia: funziona anche su un cavallo di battaglia popolare e comune come Deep Seek v4?

I modelli piccoli, veloci ed economici sono proprio quelli che ci si aspetterebbe abbiano bisogno di un supporto dettagliato. Taglia il loro prompt a metà, e il senso comune dice che dovrebbero crollare.

Noi abbiamo fatto l'esperimento, così non devi farlo tu.

L'impostazione

Il nostro agente di coding, Ante, include una modalità --short-prompt.

Consolida il system prompt da circa 5.000 a 2.300 caratteri e accorcia le descrizioni degli strumenti. Insieme, questi cambiamenti riducono il prompt completo per richiesta da circa 34.000 a 18.000 caratteri.

Abbiamo testato le due versioni con un A/B test su:

  • Compiti: Suite completa di 89 task di Terminal-Bench 2.1
  • Modello: DeepSeek V4 Flash
  • Tentativi: Uno per task
  • Variabile modificata: Un singolo flag CLI

Tutto il resto è rimasto costante: la stessa build dell'agente, il digest del dataset bloccato, il pool di sandbox, il livello di sforzo e i flag di runtime.

Il risultato

Antigma - inline image

Prestazioni: parità. Il prompt breve ha effettivamente ottenuto un punteggio più alto di +2,3 punti, ma con un solo tentativo per task rientra nel rumore di fondo.

Token di input: 32% in meno nel sottoinsieme con lo stesso risultato.

Venti task hanno cambiato esito (passa/non passa) tra le esecuzioni, il che ha anche modificato la durata del lavoro degli agenti, rendendo i conteggi dei token un confronto poco valido. Escludiamo quei 20 task, lasciando i 69 il cui risultato è rimasto invariato, poi confrontiamo le due mediane indipendenti: 509.498 token di input con il prompt lungo contro 346.409 con il prompt breve. È il 32% in meno. Questo è un sottoinsieme deliberatamente selezionato, non una stima dei costi dell'intera suite.

Antigma - inline image

I totali aggregati di token di input su tutti gli 89 task sono quasi piatti, ed è giusto essere onesti al riguardo: la cronologia della conversazione domina l'uso degli input, e in alcuni task in cui l'esecuzione con il prompt breve ha seguito un percorso di soluzione più lungo, i risparmi per richiesta vengono annullati nella somma. Anche il costo di esecuzione è cambiato solo leggermente, passando da $4,25 a $4,18.

Cosa abbiamo cercato e non trovato: un precipizio di capacità. Venti task hanno cambiato esito tra le esecuzioni — 11 nuovi superati, 9 nuovi falliti — ma questo turnover è una varianza caratteristica dei tentativi singoli su questo benchmark, non un pattern. Nessuna categoria di task è collassata.

Cosa questo esperimento non dimostra

Questo è stato:

  • Un modello
  • Un benchmark
  • Un tentativo per task

Il risultato del 32% dei token proviene da un sottoinsieme selezionato con lo stesso risultato. La quantità di turnover dei task tra le esecuzioni dimostra anche perché sia importante la validazione multi-tentativo.

Con un rumore di fondo stimato di circa ±5 punti percentuali, una piccola regressione potrebbe ancora nascondersi in questi risultati. Eseguiremmo una valutazione multi-tentativo prima di cambiare il default per tutti.

Il messaggio chiave

Per questo modello, su questo benchmark, abbiamo tagliato il prompt circa a metà e non abbiamo misurato nulla di peggiore.

Tra i 69 task con lo stesso risultato, il conteggio mediano di token di input dell'esecuzione con prompt breve era circa un terzo inferiore.

Il risultato corrisponde alla direzione osservata da Anthropic un gradino più in alto:

Quando arriva una nuova generazione di modelli, la tua prima mossa non dovrebbe essere aggiungere al prompt. Dovrebbe essere cancellare.

Quanto del tuo system prompt è ancora lì perché un modello di due generazioni fa ne aveva bisogno?

Salva con un clic

Leggi in profondità gli articoli virali con l’AI di YouMind

Salva la fonte, fai domande mirate, riassumi l’argomentazione e trasforma un articolo virale in note riutilizzabili in un unico spazio di lavoro AI.

Scopri YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali