YouMind
Accedi

Opus 4.8: Stesso prezzo, rendimento raddoppiato

@shmidtqq
INGLESE30 mag 2026
1.2M
215
18
33
516

TL;DR

Opus 4.8 di Anthropic introduce significativi aggiornamenti operativi, tra cui il controllo dello sforzo e flussi di lavoro dinamici. Sebbene i benchmark mostrino guadagni modesti, il vero valore risiede nell'ottimizzazione dell'utilizzo dei token e della velocità per attività di programmazione complesse.

Stesso prezzo. La maggior parte delle persone si limiterà a cambiare modello e si perderà tutto il resto.

shmidt - inline image

Insieme a Opus 4.8, Anthropic ha rilasciato tre novità che cambiano il modo di lavorare in Claude Code più dei numeri dei benchmark: il controllo dello sforzo, i flussi di lavoro dinamici e la modalità veloce più economica. Chi le configura correttamente ottiene risultati migliori spendendo meno. Ecco i dettagli.

Il numero che conta di più

Non è il 69,2% nel coding. È che il 4.8 ha circa 4 volte meno probabilità di lasciar passare difetti nel codice che ha scritto.

I modelli più vecchi amavano dire con sicurezza "fatto, bug risolto" con prove fragili. Anthropic ha puntato sull'onestà: il 4.8 rallenta più spesso e segnala dove non è sicuro, invece di generare codice plausibile che silenziosamente rompe i casi limite. In una sessione lunga, questo si accumula. Un modello che ammette l'incertezza al turno 15 ti risparmia un paio d'ore di debugging al turno 40.

Cosa è cambiato: la versione breve

Coding.

SWE-bench Verified: 87,6% → 88,6% (vicino al massimo).

SWE-bench Pro (più difficile, meno contaminato): 64,3% → 69,2%, 10+ punti avanti a GPT-5.5.

Questo è il numero di punta per il coding.

Terminale.

Terminal-Bench 2.1: 66,1% → 74,6% (+8,5), ma GPT-5.5 è ancora in testa (78,2%). L'unico benchmark su sette in cui il 4.8 perde.

Lavoro intellettuale.

GDPval-AA: 1890 Elo contro 1769 di GPT-5.5. Il divario più ampio dell'intera tabella.

Uso del computer.

OSWorld-Verified: 83,4% (parte del guadagno è dovuta a un harness aggiornato, cosa che Anthropic segnala apertamente).

Scienza.

GPQA Diamond: 93,6%, sostanzialmente stabile (entrambi i modelli sono sopra il 93%, è saturazione, non una regressione).

shmidt - inline image

Anthropic stessa definisce il rilascio "un miglioramento modesto ma tangibile". I benchmark sono un plus. I cambiamenti operativi che seguono sono la vera novità.

Funzione 1. Controllo dello sforzo (la più sottovalutata)

Opus 4.8 è impostato di default su sforzo Alto. Ma ora puoi decidere tu quanto sforzo deve mettere in un compito. Pensalo come un cambio manuale per il ragionamento.

In claude.ai e Cowork, il cursore si trova accanto al selettore del modello, con cinque livelli: Basso, Medio, Alto (Default), Extra, Massimo, più un interruttore Pensiero separato. In Claude Code ci sono gli stessi livelli con nomi leggermente diversi, e c'è una modalità automatica:

Nota: "Extra" in claude.ai e "xhigh" in Claude Code sono lo stesso livello, solo etichette diverse su superfici diverse.

shmidt - inline image

La parte economica, per evitare confusione. NON c'è un sovrapprezzo separato per livello di sforzo. La tariffa è la stessa a ogni livello: $5 per 1M di token di input, $25 per 1M di output. La differenza non è il prezzo per token, ma quanti token il modello spende. Basso risponde brevemente e pensa poco, Massimo pensa a lungo e brucia diversi token in più. Quindi Massimo è "più caro" per il volume, non per la tariffa.

Una guida approssimativa alla spesa relativa per lo stesso compito (numeri indicativi, per intuizione):

Un esempio concreto. Diciamo che una risposta Alta costa circa $0,05. La stessa richiesta a Basso costa circa $0,005, e a Massimo può arrivare facilmente a $0,20-0,40. Se il 60% dei tuoi prompt sono piccoli ("cosa restituisce questa funzione?"), passarli da Alto a Basso riduce la spesa giornaliera di diverse volte, senza perdita di qualità dove conta.

Perché questo incide di più sulla bolletta. La maggior parte delle persone lascerà tutto su Alto (o lo porterà a Massimo "per sicurezza") e non toccherà mai il cursore. Chi instrada lo sforzo per compito ottiene gli stessi risultati spendendo notevolmente meno. Questa è la funzione più sottovalutata del rilascio.

Funzione 2. Modalità veloce (3 volte più economica)

La modalità veloce fa girare Opus a 2,5x la velocità con la stessa qualità, ed ora è 3 volte più economica di prima.

Attivala in Claude Code con /fast (una sessione attiva è contrassegnata da un'icona ↯). L'accesso API è limitato per ora (lista d'attesa su claude.com/fast-mode).

Usa la modalità veloce per: grandi refactoring multi-file, generazione di codice da specifiche, documentazione, generazione di test. Ovunque la velocità superi la profondità. Resta in modalità standard per: debugging complesso, decisioni architetturali, revisione della sicurezza. Ovunque la qualità del pensiero superi la velocità.

Funzione 3. Flussi di lavoro dinamici (la più importante)

Claude Code ora scrive uno script di orchestrazione JavaScript per il tuo compito e lo esegue in background mentre la tua sessione rimane reattiva. Il piano vive nel codice, non nel contesto del modello, quindi solo la risposta finale torna alla tua sessione.

Cosa sapere, dalla documentazione ufficiale:

  • Fino a 16 sottoagenti contemporaneamente, con un limite massimo di 1.000 totali per esecuzione.
  • Riprendibile: se il tuo portatile si scarica o chiudi il terminale, l'esecuzione riprende da dove si era fermata.
  • Richiede Claude Code v2.1.154+. Anteprima di ricerca.
  • Attivo per impostazione predefinita su Max, Team, Enterprise. Su Pro, attivalo in /config (e passa prima a Opus 4.8).
  • I sottoagenti girano in modalità acceptEdits ed ereditano la tua lista di permessi degli strumenti.

Attivalo con /effort ultracode (un'impostazione di Claude Code: xhigh più orchestrazione automatica del flusso di lavoro), o descrivi semplicemente un grande compito a parole:

shmidt - inline image

Utile per: migrazioni su oltre 200 file, audit di sicurezza su tutta la codebase, generazione di test a livello di progetto, grandi refactoring, ricerca su più repository. Non utile per: semplici correzioni di bug, modifiche a file singoli, domande veloci. Esagerato.

Sui costi. I flussi di lavoro consumano significativamente più token di una sessione normale. Il modo ufficiale per tenere sotto controllo la spesa è delimitare il compito: esegui prima un audit su una cartella, vedi quanti sottoagenti genera, poi calibra l'esecuzione grande di conseguenza.

Per disabilitare completamente i flussi di lavoro:

Esempio di configurazione di Claude Code (template iniziale)

Variabili d'ambiente (in ~/.zshrc o ~/.bashrc):

Poi arriva la parte utile: un file settings.json con permessi sicuri. Permette al modello di leggere e modificare il codice, eseguire test e fare commit, ma blocca rigidamente le cose pericolose: leggere .env e chiavi SSH, rm -rf, sudo e git push. L'agente lavora liberamente ma non può rompere nulla o perdere nulla.

shmidt - inline image

Il file settings.json pronto da incollare è nel mio canale Telegram (il formato è troppo grande per essere letto chiaramente qui): t.me/+JmDeelv5UCwwMTcy

shmidt - inline image

Prontuario dei comandi quotidiani

Installare Opus 4.8: tre modi

A. Browser o app. Su claude.ai, seleziona Claude Opus 4.8 nell'elenco dei modelli e imposta il cursore dello sforzo. Nessuna installazione necessaria.

B. API. ID modello claude-opus-4-8. Prezzo $5/$25 per 1M. Contesto fino a 1M (200k su Microsoft Foundry), fino a 128k di output. Il pensiero esteso a budget fisso non è supportato: usa il pensiero adattivo (thinking: {type: "adaptive"}) e il parametro effort.

C. Claude Code (terminale). L'installer nativo è ora il metodo consigliato (npm è legacy):

Poi esegui claude, accedi tramite browser e seleziona Opus 4.8 con /model.

Checklist di migrazione: da 4.7 a 4.8

  • Cambia l'ID modello in claude-opus-4-8
  • Esegui 10-20 dei tuoi compiti reali su 4.7 e 4.8 con prompt identici
  • Confronta: tasso di completamento, numero di passaggi, token, tasso di superamento test
  • Controlla i prompt ottimizzati per il comportamento del 4.7
  • Assegna livelli di sforzo per tipo di compito
  • Testa la modalità veloce dove la velocità è importante
  • Aggiorna Claude Code alla v2.1.154+ (per i flussi di lavoro)
  • Ricontrolla la fattura API dopo la prima settimana

Scheda riassuntiva: tutto in un posto

Modello: claude-opus-4-8 · rilasciato 2026-05-28

Prezzo: $5 / $25 per 1M · modalità veloce $10 / $50

Contesto: fino a 1M · fino a 128k di output

Punti chiave: SWE-bench Pro 64,3% → 69,2% (+10 su GPT-5.5) · SWE-bench Verified 88,6% · 4x meno bug sfuggiti · GDPval-AA 1890 Elo

Novità: controllo dello sforzo · modalità veloce 3x più economica · flussi di lavoro dinamici (16 contemporanei / 1.000 per esecuzione)

Grazie per aver letto. Se c'è una cosa da portare a casa, è "instrada lo sforzo per compito".

Il resto dei miei appunti su Claude e vibe coding si trovano qui: t.me/+JmDeelv5UCwwMTcy.

Ci vediamo lì.

@shmidtqq.

Salva con un clic

Leggi in profondità gli articoli virali con l’AI di YouMind

Salva la fonte, fai domande mirate, riassumi l’argomentazione e trasforma un articolo virale in note riutilizzabili in un unico spazio di lavoro AI.

Scopri YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali