Quali modelli valgono l'investimento? Abbiamo testato 14 modelli su attività di knowledge work reali per scoprirlo.

@andrewbusse
INGLESE1 giorno fa · 23 lug 2026
166K
11
3
1
8

TL;DR

Questa analisi di 14 modelli di IA rivela che i leader dei benchmark spesso falliscono nelle attività di knowledge work reali. Lo studio fornisce un framework per scegliere i modelli in base al giudizio e alla frequenza, classificandoli in sprinter, pesi medi e pesi massimi.

Il miglior modello per un lavoro non è quasi mai il miglior modello in classifica.

Nel mondo dell'IA, il Natale arriva circa una volta a settimana. Esce un nuovo modello, tutti fissano gli stessi grafici di benchmark con falsa precisione, e siamo tutti d'accordo che sia la cosa più rivoluzionaria dai tempi del pane a fette, fino alla settimana successiva, quando ricominciamo da capo.

Ma nessuno di quei grafici risponde all'unica domanda che conta. Il modello è davvero in grado di eseguire il tuo briefing quotidiano o inviare un preventivo a un cliente? Su Hyperagent, ti diamo accesso a tutti questi modelli, su un agente di prim'ordine. Quindi li abbiamo testati noi stessi. Quattordici modelli, quarantadue esecuzioni, sul vero lavoro di conoscenza che i nostri clienti affidano ogni giorno agli agenti. Tre cose sono emerse.

  • Il costo variava di 50x per lo stesso lavoro. La stessa batteria di test costava $1,48 su Qwen 3.7 Plus e $75,16 su Fable 5.
  • Il vincitore del benchmark non era il vincitore del lavoro. GPT 5.6 Sol ha dominato i nostri test di base, ma non è entrato tra i primi tre una volta che eseguiva lavori reali all'interno di Hyperagent. Grok 4.5 era nella media sui test di base, ma è arrivato primo per lavoro completato, velocità e costo.
  • E nessun modello ha vinto tutto. La scelta giusta cambiava in base al lavoro.

La morale non è un nuovo modello preferito. È un modo per decidere, lavoro per lavoro, quale merita il suo costo.

La mappa dei modelli IA per il lavoro di conoscenza

Ogni lavoro che affideresti a un agente si riduce a due domande: quanto giudizio richiede e con quale frequenza viene eseguito? Traccia questi due assi e il lavoro di conoscenza ricade in quattro territori, ognuno dei quali richiede un tipo diverso di modello.

Andrew Busse - inline image

Lavoro di volume (in alto a sinistra). Triage, monitoraggio, instradamento, sincronizzazione dati. Procedure chiare, esecuzione costante, e un errore è economico da correggere. Questo lavoro vuole qualcosa di veloce ed economico.

L'arte quotidiana (in alto a destra). Bozze, report, ricerca, comunicazioni con i clienti. Il lavoro di conoscenza ricorrente che riempie la maggior parte della settimana: richiede sintesi reale e una buona voce scritta, fatto in modo affidabile e frequente.

Alta posta in gioco (in basso a destra). Revisione contrattuale, decisioni sui prezzi, analisi approfondite. Raro, ma una risposta sbagliata costa un cliente, un contratto o il margine di un trimestre. È qui che il lato negativo supera di gran lunga il costo del modello, e dove i modelli più costosi guadagnano la loro tariffa.

Non ottimizzare (in basso a sinistra). La richiesta occasionale e semplice in cui qualsiasi modello capace supera la soglia e la differenza di prezzo è troppo piccola per meritare una decisione. È l'unico quadrato sulla mappa su cui diciamo alle persone di non pensarci.

Le tre classi di modelli

Dalla mappa emergono tre classi operative. Descrivono l'economia e il profilo di giudizio del lavoro, piuttosto che classificare un modello come buono o cattivo.

Sprinter sono costruiti per il lavoro di volume: veloci, economici e costanti quando la procedura è chiara e un errore è facile da correggere. Haiku 4.5, Gemini 3.5 Flash e DeepSeek V4 Pro.

Pesi medi gestiscono l'arte quotidiana. Sintetizzano fonti, mantengono un piano a più fasi e scrivono bene senza far pagare tariffe premium per ogni report. Sonnet 5, GPT 5.6 Terra, Grok 4.5 e GLM 5.2 – dove va la maggior parte del lavoro di conoscenza.

Pesi massimi si prendono le decisioni ad alta posta in gioco, portando un giudizio più forte e più tempo di ragionamento su lavori in cui una risposta sbagliata costa molto più del costo del modello. Opus 4.8, GPT 5.6 Sol e Fable 5.

L'istinto della maggior parte delle persone è iniziare dall'alto e scendere: esegui tutto su un Fable 5 o un Opus 4.8, ottieni l'output desiderato, poi prova modelli più economici finché la qualità non cala. Funziona, ma abbiamo scoperto che la maggior parte dei lavori non ne ha bisogno. Una volta che riesci a dare un nome al lavoro e posizionarlo sulla mappa, di solito puoi iniziare nella classe giusta fin dall'inizio. Per l'arte quotidiana, che è la maggior parte di ciò che fai, significa iniziare con un solido peso medio come Sonnet 5. Ricorri alla ricerca dall'alto verso il basso solo quando un lavoro si trova davvero nella fascia alta.

Il campo è più ampio di Claude, GPT e Gemini

La maggior parte dei team si affida ai pochi nomi di modelli che già conosce. È un punto di partenza ragionevole, ma lascia inesplorata gran parte del roster – e alcuni dei modelli che svolgono il lavoro più utile in Hyperagent non sono i nomi più noti. Queste sono le nostre impressioni operative dalla batteria di test e dall'uso quotidiano, oltre al lavoro che abbiamo visto eseguire dai clienti.

Grok 4.5 è ricerca veloce e in tempo reale. Si muove rapidamente attraverso ricerche che richiedono molti strumenti e ha performato particolarmente bene in abbinamento con la ricerca nativa Exa di Hyperagent. Ha anche una linea diretta con X, quindi una domanda sul sentiment in tempo reale può tornare con i post reali dietro la risposta. Ha guidato il nostro punteggio di lavoro completato a $9,71 per l'intera esecuzione.

Muse Spark 1.1 scrive in modo pulito e si controlla da solo. È arrivato secondo nella batteria, e la nostra impressione iniziale è una prosa concisa e ben strutturata, con l'utile abitudine di verificare il proprio lavoro prima di riconsegnarlo. È ancora nuovo, quindi lo inizieremmo su lavori quotidiani supervisionati prima di quelli lunghi e non presidiati.

Kimi K2.6 è ricerca approfondita a un prezzo da modello open. Esegue ricerche in parallelo e riunisce le prove in un'unica risposta senza far pagare tariffe da modello di punta, il che lo rende uno specialista della ricerca. Il suo unico vero limite è la dimensione dei documenti, con una finestra di contesto che arriva a 256.000 token.

GLM 5.2 è la scelta economica. Si è avvicinato sorprendentemente ai pesi medi chiusi in ricerca di routine, bozze e lavoro su documenti lunghi, a circa un terzo del prezzo, e la sua prosa è tra le più forti al di fuori di Sonnet e Opus. È diventato un driver quotidiano per molti del team Hyperagent.

Qwen 3.7 Plus è il lavoratore dello schermo. È particolarmente bravo a trovare pulsanti, campi e menu su pagine renderizzate, ed è economico per l'estrazione strutturata: ha prodotto l'esecuzione completa più economica nella nostra batteria. Ricorri a lui quando il lavoro riguarda un'interfaccia o lo spostamento di dati, non quando la voce conta.

DeepSeek V4 Pro è analisi strutturata a costo molto basso. È più forte in riconciliazioni, pulizia dati, lavoro numerico programmato e attività strutturate simili. La sua scrittura è letterale e stringata, il che serve bene le spiegazioni interne e male la prosa rivolta ai clienti. Uno specialista, e molto economico.

Dotare i tuoi agenti sempre attivi al prezzo giusto

Steve Juba gestisce un'agenzia di viaggi con sei persone. Ha costruito un agente per i briefing connesso a otto fonti dati in tempo reale che esegue più volte al giorno, e ha ridotto la raccolta mattutina di informazioni da oltre tre ore su otto schede a quindici minuti.

Un agente come questo legge molto più di quanto scrive e fa lo stesso lavoro centinaia di volte all'anno, quindi una piccola differenza di prezzo per esecuzione smette di essere un arrotondamento e diventa una vera voce di budget. Considera un briefing che legge 100.000 token e ne scrive 2.000 ogni giorno. Ai prezzi di listino di luglio 2026, un lavoro di questa forma costa circa:

  • $16 all'anno su Qwen 3.7 Plus (sprinter)
  • $38 all'anno su Kimi K2.6 (peso medio)
  • $40 all'anno su Haiku 4.5 (sprinter)
  • $80 all'anno su Sonnet 5 (peso medio)
Andrew Busse - inline image

Le opzioni open-weight cambiano i calcoli per lavori con molta lettura come questo. Kimi K2.6 offre ricerca e sintesi di qualità media per $38 su questo lavoro – meno della metà di Sonnet 5, e più o meno lo stesso costo dello sprinter Haiku. Non stai sacrificando il giudizio per il costo; stai ottenendo lavoro da peso medio a un prezzo da sprinter. Se il lavoro fosse pura estrazione senza giudizio, Qwen lo eseguirebbe per $16 – ma nel momento in cui serve una sintesi reale, Kimi te la offre a un prezzo simile.

Cambia il modello, tieni l'agente

Niente di tutto questo conta se cambiare modello significa ricostruire l'agente. All'interno di Hyperagent non è così, perché il modello è solo un'impostazione e il ruolo si trova al di sopra di esso. Cambia il modello e l'agente conserva tutto ciò che lo rende utile:

  • Le sue istruzioni e il suo ambito
  • Le sue competenze, script e procedure operative
  • La sua memoria delle correzioni
  • I suoi file di riferimento e il contesto aziendale
  • Le sue connessioni ai sistemi in cui vive il lavoro
  • Le sue rubriche per valutare la qualità
Andrew Busse - inline image

Questo trasforma la scelta del modello in un test, non in una migrazione. Lo stesso agente può eseguire lo stesso lavoro su due modelli senza essere ricostruito, così puoi trovare il più economico che supera la tua soglia invece di indovinare.

Permette anche che la parte costosa di un flusso di lavoro complesso si ripaghi da sola una volta. Quando un lavoro lo richiede davvero, usa un modello più pesante per progettare e debuggare il flusso di lavoro – poi codifica la procedura come competenza in modo che un peso medio o uno sprinter possa eseguirla ogni giorno a una frazione del costo.

C'è però un costo nascosto da tenere d'occhio. Un modello più economico con un conto basso non è economico se ogni output necessita di correzioni – il tempo di revisione umana e il costo di un errore fanno parte del prezzo reale. Chiamiamola tassa di revisione. Stabilisce il limite minimo su quanto leggero puoi andare. La differenza in Hyperagent è che la revisione non viene solo pagata, ma si accumula: mentre l'agente impara dalle tue correzioni attraverso la memoria, quello sforzo di revisione viene catturato dall'infrastruttura e produce un agente migliore all'esecuzione successiva.

I clienti già impostano gli agenti in questo modo. Ankit Das ha costruito un'operazione di marketing con un Growth Orchestrator su Sonnet 5 che prende le decisioni di giudizio e otto specialisti di canale su GLM 5.2 che producono il lavoro ricorrente del canale, con agenti di QA separati che controllano la conformità del brand e la qualità della scrittura – tutto avviato da un unico thread. Eli Weiss descrive la sua suddivisione più semplicemente: circa 85% Sonnet e 15% Opus tra le sue competenze e routine. La maggior parte del lavoro gira sul driver quotidiano; Opus riceve l'insieme più piccolo di lavori in cui il giudizio extra guadagna il suo costo.

Questo è il valore pratico della scelta del modello all'interno di Hyperagent. Spendi in modo deliberato tra i vari lavori e riserva i dollari extra per quei lavori in cui un giudizio extra cambia il risultato.

Scegli il modello dopo aver scelto il lavoro

Usa questa sequenza su un agente che già esegui:

  1. Dai un nome al lavoro. "Preparare il report del cliente del lunedì" è più utile di "aiutare con i report".
  2. Posizionalo sulla mappa. Decidi quanto giudizio richiede e con quale frequenza verrà eseguito.
  3. Inizia dove la mappa lo colloca. Per la maggior parte dei lavori, si tratta di un capace peso medio – usalo finché non capisci i casi limite del lavoro e codifichi il processo in competenze.
  4. Testa una classe più leggera per cinque esecuzioni reali. Mantieni invariate istruzioni, competenze, memoria, fonti e rubrica.
  5. Confronta il costo totale. Tieni traccia di qualità finale, coerenza, tempo, errori fattuali, costo del modello e tempo di revisione umana.
  6. Escalation mirata. Porta un peso massimo quando il carico di revisione o il costo di una risposta sbagliata superano il premio del modello.
  7. Usa un modello diverso per revisionare lavori importanti. Il modello che ha commesso l'errore è spesso il meno propenso a vederlo.

Tieni il modello meno costoso che supera in modo affidabile il tuo standard. Poi spendi la differenza sulle decisioni che lo meritano.

Rielabora in YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali