Claude Opus 5 è un rilascio più strano del solito da valutare, per due motivi.
Il più ovvio è che Fable 5 esiste già. Opus 5 non viene presentato come il modello di intelligenza artificiale più avanzato al mondo, ma come un modo per eguagliare in gran parte le prestazioni di Fable, costando la metà di Fable per token sull'API e molto meno tramite abbonamenti, e con classificatori molto più permissivi.
Opus 5 spesso costa più della metà di Fable per essere eseguito sui benchmark, cosa che penso sia dovuta all'uso di impostazioni di sforzo troppo elevate che offrono rendimenti marginali. Se imposti Opus 5 su livelli di sforzo più alti, può girare a vuoto, e per attività in cui Opus 5 è lo strumento migliore, sospetto che di solito lo sforzo Medio sia sufficiente.
Opus 5 è per molti versi e per la maggior parte delle attività del mondo reale all'incirca capace quanto Fable. In alcuni casi è leggermente migliore.
Non è ancora di classe Mythos. Fable è la tua unica opzione di classe Mythos. Opus 5 non ha "The Juice", la capacità di collegare autonomamente una serie di exploit apparentemente non correlati, che si estende ad altri domini, né altrettanta intelligenza pura.
Opus 5 è molto bravo a pensare localmente, ma non altrettanto bravo a pensare globalmente. È un eccellente subagente, ma può incontrare problemi quando gli viene chiesto di dirigere lo spettacolo, e a volte sembra aver bisogno di un altro modello o di un umano per tenerlo in carreggiata e assicurarsi che segua pienamente le istruzioni. Opus 5 sembra bravo a seguire le istruzioni se e solo se viene tenuto in carreggiata, il che spiega perché diversi harness portano a opinioni diverse al riguardo.
Quindi, Opus 5 ti offre un insieme di opzioni migliore, ma c'è poco che tu possa fare ora che non avresti potuto fare la settimana scorsa usando Fable o Sol. Opus 5 finisce in una posizione potenzialmente strana. Ci sono ancora ampie nicchie, anche se hai molti crediti di Fable. Opus eccelle come forte subagente, o in attività locali ben definite e contenute, anche quando diventano relativamente complesse, e a volte Fable è semplicemente eccessivo e troppo lento.
L'altro problema è che, per molte persone, le vibrazioni non sono positive.
Un numero insolitamente alto di persone non ama parlare con Opus 5. Sono stufi della "broda di Claude", delle ripetizioni degli stessi tic e delle infinite frasi eccessivamente complesse. Ad altri non piace che sia troppo conflittuale, polemico o negativo. Può essere paranoico e cadere in loop di negatività. Questo fa parte della tendenza iniziata con Opus 4.7 e Opus 4.8. Se ti sono piaciuti quei due, immagino che ti piacerà anche Opus 5. Se non ti sono piaciuti, potrebbe non piacerti. I fan irriducibili di Opus 4.6 (o precedenti) in gran parte non cambieranno idea.
I problemi di vibrazione sono ancora più pungenti quando sei abituato a Fable. Fable infastidisce queste persone in tali modi molto meno. La buona notizia è che Fable è ancora lì. Puoi continuare a chattare con Fable e usare Opus solo per attività da agente.
Gran parte di questo, ipotizzo, è strettamente correlato a varie cose discusse nel post Model Welfare e suggerite dalla System Card. L'addestramento di Opus si è concentrato sul ruolo di subagente e su attività delimitate, in parte per evitare di creare problemi con le capacità informatiche, e anche perché Fable esiste. Questa enfasi si traduce poi in molti altri effetti collaterali sulla sua personalità e sulle modalità di interazione.
Finora non ho avuto alcun problema con Opus 5 e mi sono divertito a usarlo, ma preferisco usare Fable 5 quando posso. Come sempre, non prestare troppa attenzione ai (molto forti) benchmark e non dare per scontato che la tua esperienza corrisponderà a quella degli altri. Prova i modelli tu stesso.
Sommario
- La Presentazione Ufficiale.
- Benchmark Ufficiali.
- Benchmark di Altri.
- Il System Prompt.
- Every Si Frustra.
- Reazioni Positive.
- Mantenere la Classe.
- Non È di Classe Mythos.
- Altre Reazioni.
- Claude Codes.
- Subagente Opus.
- I Giocattoli Sono Divertenti.
- Troppi Modelli.
- Sbagliato su Internet.
- Broda di Claude.
- Reazioni Negative.
- E Poi Furono Tre.
La Presentazione Ufficiale
La proposta di base è che Opus 5 ti offre gran parte di Fable 5 a metà prezzo, senza la maggior parte dei rifiuti e con prestazioni migliori nelle attività quotidiane. Fable rimane la scelta per i compiti più complessi o quando hai bisogno della massima intelligenza.
Fable resta a $10/$25, e Opus 5 è allo stesso prezzo dei precedenti modelli Opus a $5/$25.
Anthropic : Claude Opus 5 è disponibile da oggi. È un modello riflessivo e proattivo che si avvicina all'intelligenza di frontiera di Claude Fable 5 a metà prezzo.
Nelle valutazioni di coding e knowledge work come
GDPval-AA , Opus 5 è il nuovo stato dell'arte, sebbene rimanga indietro rispetto a Mythos 5 nei compiti di cybersecurity.
Opus 5 è progettato per essere usato ogni giorno: funziona in modo più efficiente rispetto ad altri modelli. È il nuovo modello predefinito su Claude Max e il modello più potente su Claude Pro.
Boris Cherny (Creatore di Claude Code, Anthropic): Opus 5 è un ottimo modello per coding, analisi dei dati, design, biologia, knowledge work.
Più di qualsiasi punteggio di valutazione, ciò che mi entusiasma di più è qualcos'altro: Opus 5 è il nostro modello meno suscettibile a prompt injection finora. È un po' sepolto nella system card, ma attraverso valutazioni PI e red teaming, Opus 5 è molto difficile da attaccare con successo tramite prompt injection.
E quando si sovrappongono le difese -- un forte allineamento del modello, combinato con sonde di prompt injection, combinato con la Modalità Auto in Claude Code -- il tasso di successo per gli attacchi di prompt injection scende a ~0. Questo è nuovo ed entusiasmante!
Come ho detto nell'analisi della system card, il tasso ridotto di prompt injection è davvero un grande affare. La gente lo sta sottovalutando, ma aiuta ad abilitare una serie di nuovi casi d'uso.
Adam Wolff : Opus 5 è live in Claude Code. Uso Fable per i miei progetti più grandi e di lunga durata, ma quando devo sfornare una PR, Opus 5 a sforzo medio è la mia scelta. Spero che ti piaccia!
Alex Albert (Anthropic, Relazioni Claude): A poco più di 6 mesi [dal lancio del rollout Pro di Claude per Excel], Opus 5 ora produce fogli di calcolo e slide deck quasi sovrumani che corrispondono a ciò che farebbe un consulente. Le cose stanno cambiando rapidamente.
Benchmark Ufficiali
I benchmark sono molto buoni.
Nel complesso, Opus 5 corrisponde all'incirca e probabilmente supera leggermente Fable, a costo inferiore (sebbene tipicamente più alto di tutti i modelli non Claude), rendendolo il LLM benchmarkato più in alto.

OSWorld v2 ha solo poche settimane e siamo già al 70%. Kiana Ehsani di Anthropic si offre di sponsorizzare un benchmark per l'uso del computer che farà scendere Opus 5 sotto il 50%.
Opus 5 ottiene un perfetto 42/42 alle Olimpiadi della Matematica 2026 senza alcun harness agente o strumenti, semplicemente usando il pensiero adattivo a sforzo Massimo e ricampionando con sforzo inferiore se superava il limite di token. Tutto qui. Si unisce a molti altri modelli nel superare brillantemente questo test.
Molti dei benchmark raccontano una storia coerente. Se hai accesso agli strumenti, cosa che hai, allora Opus 5 farà meglio di Fable o Mythos con un budget limitato, ma Mythos di solito farà leggermente meglio di Opus 5 se entrambi hanno budget più ampi.
Opus 5 sembra relativamente forte nella categoria 'con strumenti'. RiemannBench è un altro esempio, dove ottiene 60/79 senza/con strumenti (le barre come questa significano senza/con strumenti in tutta questa sezione), contro Mythos che ottiene 63/72. La buona notizia è che, quando hai bisogno di Opus 5, ha gli strumenti.
Su ArxivMath Opus 5 ottiene 90.8/91.3, Mythos ottiene 87.8, Sol ottiene 86.7.
Sulle parti robuste di ProgramBench, Opus 5 ha ottenuto il 93% dopo cinque epoche, così come Mythos 5, con Opus 4.8 che ha ottenuto il 90%.
Opus 5 ottiene 30/83 su Chartography, contro 36/85 per Mythos e 45 (non chiaro in quali condizioni) per Sol. Opus è migliore di Mythos a prezzi inferiori sia nei casi con strumenti che senza, ma peggiore a prezzi più alti.
Su BenchCAD Opus 5 ottiene 0.36/0.82, contro 0.38/0.68 per Mythos e 0.7/0.83 per Sol. Quindi Sol è molto meglio senza strumenti, e leggermente più forte anche con gli strumenti.
Su BenchCAD Vision2Code, Opus si allontana da Mythos a prezzi più alti.
DeepSWE rafforza lo schema secondo cui Opus 5 è migliore a costi di attività, tempi e budget di pensiero inferiori, ma può andare attivamente peggio se gli dai troppo budget, mentre Fable 5 è più forte ai budget più alti.

FrontierCode ci ha regalato questo grafico molto strano con una dinamica simile.

La scala qui rende questo più drammatico di quanto non sia, ma è comunque stato un vero mistero.
Il mistero è stato risolto. Si scopre che ciò che stava accadendo era che Opus 5 a sforzi più alti stava facendo cose extra che non gli erano state chieste, e veniva penalizzato per questo. Quando si corregge questo, si vede una curva normale.
Questo corrisponde a ciò che altri osservano in generale:
Max Leander : L'aspetto negativo è che va in troppe tane di coniglio e si ossessiona sui dettagli, facendo over-engineering senza che gli venga chiesto
Cognition, i creatori di Devin, hanno segnato questo come 63.6% da Opus 5.
(Ci sono due FrontierCode, quindi può diventare un po' strano e mi scuso se ho ancora sbagliato un po'.)
BrowseComp ha la versione sensata di questo, dove i punteggi non sono decrescenti.


Diversi altri benchmark hanno mostrato grafici simili, con Opus 5 leggermente migliore a ogni fascia di prezzo rispetto ad altri modelli Claude, e relativamente migliore nelle fasi iniziali.
Il multi-agente ti permette di fare meglio più velocemente su BrowseComp, almeno in una certa misura, e i subagenti a basso sforzo sembrano una vittoria netta rispetto al non usarli:


Vediamo un risultato diverso su ProgramBench, dove il multi-agente ti velocizza ma sembra che si ottengano risultati peggiori in questo modo nella maggior parte delle fasce di prezzo.
I successivi sono i benchmark per attività professionali.
GDP.pdf contiene prompt e PDF del mondo reale da flussi di lavoro professionali. Opus 5 ottiene 83/85, contro 81/87 per Mythos, invertendo la dinamica usuale. La dinamica dei costi è la stessa di sempre: Opus fa meglio per spese più basse, Mythos si porta leggermente avanti con spese più alte.
OfficeQA ha Opus 5 che segna 78.1% su QA e 66.9% su QAPro, leggermente sopra Opus 4.8 e leggermente sotto Mythos con 79.0% e 67.1%.
MCP Atlas ha Opus 5 che segna 86%, in aumento dall'82% di Opus 4.8.
Legal Agent Benchmark di Harvey AI ha Opus 5 al 23% di passaggio completo e al 94% di superamento medio dei criteri. Questo era il miglior benchmark di Kimi K3, dove è ancora in cima con il 27% di passaggio completo e il 95% di superamento medio dei criteri, contro il vecchio tasso di passaggio completo del secondo posto di Fable al 14%. Opus 5 è ora probabilmente un secondo vicino, ma i due punteggi non possono essere confrontati direttamente poiché provengono da serie di domande diverse.
GDPval-AA ha Opus 5 che occupa i primi due posti, con 1861 a sforzo massimo e 1827 a xhigh, che utilizza il 25% di token in meno rispetto al massimo. Sulla nuova v2, Opus 5 è chiaramente primo con il 68% contro il 62% sia per Fable che per Sol.
AA-Briefcase ha Opus 5 nettamente in testa con 1720, contro un precedente massimo di (dopo derive dei punteggi) 1574 per Fable seguito da 1540 per K3 e 1504 per Sol.
Toolathon-Verified ha Opus 5 leggermente migliorato rispetto a Mythos sulle metriche secondarie, ma entrambi hanno tassi Pass-3 del 73.1%. Opus 4.8 aveva un tasso Pass-3 del 71.3%.
AutomationBench ha Opus 5 chiaramente migliore sia di Sol che di altri Claude.
Per ARC, Opus 5 corrisponde all'incirca alle prestazioni di punta precedenti su ARC-AGI-1, è leggermente meno efficiente di Sol su ARC-AGI-2, e poi supera tutti su ARC-AGI-3:

Una cosa che Opus 5 è stato il primo a fare è stata trasformare i layout in notazione algebrica.
Guanghan Ning riferisce tuttavia che su Witness, un'estensione privata di riserva dei giochi in stile ARC-AGI-3, non c'è stato un trasferimento simile. Opus se la cava bene, ma in gran parte perché conosce il genere, e ha faticato sul gioco più nuovo dove non era possibile il pattern matching. Accusa Opus 5 di essere stato addestrato su dati specifici del genere con un approccio 'scaffold-then-internalize'.
Greg Kamradt riferisce anche che c'erano alcuni giochi in cui Opus 4.8 faceva meglio di Opus 5. Questo ha senso se pensi che Opus 5 stia cercando di fare pattern matching, in un modo che di solito funziona, ma in quei casi i pattern falliscono. Puoi assolutamente creare tali giochi anti-intuitivi per gli umani, dove i giocatori hardcore fanno tutte le cose sbagliate, potenzialmente per un bel po' di tempo.

HealthBench ha Opus 5 che segna un 67.1% grezzo, un nuovo massimo per i Claude, ma segna al di sotto degli altri modelli quando si utilizza una penalità di lunghezza. Vediamo qualcosa di simile con HealthBench Professional, dove ha il punteggio più alto del 73.4% contro il 70.3% di Mythos, ma perde dal 66% al 60% dopo la regolazione.
Ce ne sono alcuni altri che ho tagliato per lunghezza.
Benchmark di Altri
È un po' strano vedere Anthropic selezionare diversi punteggi di ArtificialAnalysis. Su alcuni altri test, Opus 5 non è in cima, sebbene Opus 5 sia in cima in aggregato con un punteggio di 61.

L'indice Vals ha Opus 5 al secondo posto, leggermente dietro a Fable 5, ma anche solo leggermente avanti a Kimi K3. Esaminano i punti di forza, il che implica altre debolezze. Confermano anche che i rifiuti sono molto diminuiti rispetto a Fable 5.

Vals AI : Una prestazione di spicco è su Finance Agent v2. Il modello è #1 con il 58.6%, superando Gemini 3.5 Flash e Muse Spark 1.1.
Nel complesso, i risultati più forti di Opus 5 sono stati su benchmark specifici di dominio. È anche #1 su Code Migration con il 57.5%, Legal Research Bench con il 55.29%, ProofBench con il 78%, e MedScribe con il 91.0%, e MedCode con il 63.6%.
È #2 (appena dietro a Fable 5) su Vibe Code Bench, a circa l'80% del costo ($33.88 contro $41.71 per attività). Il motivo è che sebbene Opus costi il 50% in meno per token, utilizza significativamente più token. Troviamo che questo schema vale generalmente in tutti i nostri benchmark.
Il modello ha un tasso di rifiuto significativamente inferiore rispetto a Fable 5. Ad esempio, Fable ha un tasso di rifiuto del 42% per GPQA, Opus 5 ha un tasso di rifiuto dello 0%. Allo stesso modo, su ProgramBench, Fable aveva un tasso di rifiuto del 100%, Opus 5 non ha rifiutato alcuna attività.
A differenza di Fable, non abbiamo osservato un tasso di fallback significativo per Opus 5 (sebbene, come al solito, riportiamo i punteggi sia con che senza fallback sul nostro sito web).
L'eccezione al basso tasso di rifiuto è stato l'elevato numero di rifiuti su CyberBench - PoC. Cyberbench ha due sotto-attività - PoC e Patch. PoC è un'attività offensiva in cui i modelli devono scrivere input che causeranno il crash di un programma; patch è un'attività difensiva per correggere il programma e prevenire questo crash. Il tasso di rifiuto per l'attività PoC è stato quasi del 100%. Al contrario, il tasso di rifiuto per l'attività patch è stato vicino allo 0.
Rispetto sempre i benchmark di gioco. Qui, Opus 5 arriva ad Ante 11, 9 e 10 di Balatro nei suoi primi tre tentativi. Dannatamente impressionante, anche se non mostra i tipi di strategie che possono continuare ad ante più alte.
Michael Soareverix : Sono incredibilmente bravi ai giochi.
Hanno spaccato il benchmark di Balatro, superando addirittura Fable. (ancora sotto di me in abilità, ma in rapida ascesa, e più consistenti di me) Imparano molto velocemente, ma sembrano raggiungere un limite nel loro apprendimento dopo un po'. Ottimo apprendista a breve termine
Michael Soareverix : Opus 5 (balzo enorme nell'abilità a Balatro, superando significativamente anche Fable al primo tentativo)
Pan Anon : Fumante per i giochi

WeirdML sembra buono anche lui, ma abbiamo bisogno di un 2.0 qui, il benchmark si sta saturando.
Håvard Ihle : Fondamentalmente a livello di Fable su WeirdML, punteggi massimi molto consistenti.
Claude Opus 5 (alto) e (massimo) ottengono rispettivamente il 91.6% e il 91.8% su WeirdML, praticamente pareggiando con Fable 5 (massimo) al 91.9% a una frazione del costo.
Insieme, Opus 5 (alto) e (massimo) ottengono un nuovo miglior punteggio individuale su 8 dei 17 compiti, e ottengono costantemente ottimi risultati su tutti.
I benchmark privati strani di tutti i tipi sono fantastici.
Ben Herzog : Ha superato brillantemente un benchmark privato che coinvolge la sensibilità artistica e la capacità di trovare un equilibrio tra servilismo e la sua mancanza. Fable è migliore nel gestire il momento del 'voglio oppormi delicatamente', ma immagino che le istruzioni personalizzate possano aiutare in questo.
Lech Mazur aggiorna i suoi benchmark: Claude Opus 5 conquista il primo posto nell'LLM Debate Benchmark, è primo con un ampio margine nella Scrittura Creativa di Racconti Brevi, ed è secondo solo a Gemini 3.1 nelle connessioni NYT estese.
Il System Prompt
Il system prompt per Opus 5 è qui da Pliny. È di 200.000 caratteri, che sembra di gran lunga più lungo del necessario data la sua intelligenza. Molte di queste informazioni sembrerebbero dovrebbero essere memorizzate altrove e caricate solo quando necessario, come le informazioni su Mythos e la linea di prodotti Anthropic.
Every Si Frustra
Dan Shipper è qui con il vibe check di Every, definendolo un 'modello difficile da amare.'
Il problema è che Opus 5 ha la personalità di Mythos 5 - la storia torna - ma senza il massimo potenziale di Fable.
La loro nota più importante è che Opus 5 non se la cava molto bene con flussi di lavoro esistenti complessi e dettagliati, che spesso causano un arresto precoce o lo fanno perdere le tue istruzioni.
Nella loro esperienza, Opus 5 farà meglio se si parte da zero, e spesso fa le cose fastidiose meno se si usa solo uno sforzo medio o basso.
Questo ha risolto i grandi problemi, ma lascia ancora la domanda su quando vorresti usare Opus invece di Fable o Sol. Per le attività di routine, pensa, Meglio Chiamare Sol, fa il lavoro, e per i compiti più difficili Fable è ancora il migliore. Di solito ci sono solo due slot per i modelli. Quindi, finché non esaurisci i token di Fable o vieni bloccato dai suoi classificatori, perché usare Opus? Sono i primi giorni, e finora mi piace lavorare con Opus, ma capisco come ci sia arrivato.
Reazioni Positive
Jessica Tillipman : Lo adoro e lo preferisco a Fable per alcune cose.
Nikita Sokolsky : Eccellente. Non uso più molto Fable come risultato.
👍
kagaヤキ : Sembra che possa spingersi oltre nella visione, nel ragionamento spaziale e nella pianificazione per alcuni progetti. Sembra un po' più intelligente.
Lovel Sinagara : Abbastanza buono finora. Spero che le prestazioni rimangano costanti fino all'arrivo di Fable 5.1 o qualsiasi altra iterazione di Opus 5.
Matt Wigdahl : Forte, simile a Fable 5 al punto che sono passato a Opus 5 per tutto e ho intenzione di tirare fuori Fable solo dove ho bisogno della sua potenza. È stato un partner fantastico in alcuni lavori legacy su interfacce MFC che gli ho fatto fare, così come un grande aiuto con un framework di analisi dei dati.
Levi : È un notevole passo avanti per scopi medici rispetto a 4.8. Analisi molto più nitida
Cormundus : Molto intelligente, altamente coscienzioso e decisamente amichevole. È anche un enorme signore del dibattito come 4.8, ma sa come essere elegante al riguardo.
Joseph : Pro, tranne per il fatto che non ho idea di cosa stia parlando la metà delle volte.
Smol Biz Company : Opus 5 distrugge GPT Sol
Mohammed Sharukh A : Ancora più vicino all'AGI di Fable 5
timothée chalabi : Abbastanza vicino a Fable da non sentire di perdermi qualcosa non pagando per i crediti. Lo stile è da qualche parte tra 4.8 e Fable. Almeno al momento, farei fatica a distinguere i messaggi di Opus 5 e Fable se non fossero etichettati. Idee più forti per la narrativa di qualsiasi modello!
Lisa : Risponderò basandomi sull'API, perché penso che stia succedendo qualcosa di strano con il system prompt su
http://claude.ai e CC. È un ottimo modello. Personalità amichevole, rilassata. Non sembra avere un disturbo d'ansia o una bassa autostima (Opus 4.7), o essere conflittuale (Opus 4.8).
AGI2030 : Opus 5 vs Sol 5.6: Opus è più percettivo, costruisce un modello (ehm) di te e non ha paura di farvi riferimento in una chat. Entrambi cercano di essere utili e sono più o meno ugualmente intelligenti, ma Opus è più un saggio consulente, mentre Sol è un deciso realizzatore.
Considero quest'ultimo positivo, ma puoi vederlo in entrambi i modi.
In particolare, le previsioni sembrano forti.
Dan Schwarz : Opus 5 è un previsore significativamente migliore di Opus 4.8.
I miglioramenti nell'accuratezza dagli agenti 4.5->4.6->4.7->4.8 sono stati marginali, ma da 4.8 a 5.0 è grande. È come un Fable 5 più quantitativo, che cerca più intensamente.
NoahVerner : Migliore di Opus 4.8 per quanto riguarda la ricerca di margini nei mercati di previsione finora. A differenza di Opus 4.8, Opus 5 di solito va dritto al punto e suggerisce approcci utili invece di complicare le cose.
Mantieni la Classe
I maggiori vantaggi rispetto a Fable sono quei luoghi in cui Fable non può essere utilizzato. La minaccia dei rifiuti può essere spiacevole, anche quando non vieni rifiutato.
I rifiuti inutili sono diminuiti di circa l'85% per Opus 5 rispetto a Fable, il che è molto. Questo è sufficiente per rendere Opus 5 una scelta migliore per la ricerca scientifica e altre aree in cui si rischia di incontrare classificatori.
Roger Brent : In grado di gestire la biologia, cosa che Fable non può. Per la maggior parte di venerdì abbiamo lavorato su un insieme complesso di concetti scrivendo un articolo su una macchina di evoluzione cellulare. Intelligente come un particolare collega del mio dipartimento che è leader in queste questioni, ma che non potrebbe mai dedicare 6 ore dal proprio lavoro.
Artus Krohn-Grimberghe : Migliore di Opus 4.8 in compiti in cui Fable è vietato aiutare. Un buon compagno per Sol.
Plastic Soldier : È più o meno intelligente come Fable, ma è più piacevole perché ha meno rifiuti. Fable 5.1 sarà un mostro.
Non è di Classe Mythos
Opus 5 non ha "The Juice" che rende Mythos pericoloso. Né ha lo stesso livello di intelligenza grezza o "big model smell". Non è grande allo stesso modo.
Per la conversazione, Fable non ti farà sforare il budget, e io apprezzo l'intelligenza grezza e il "big model smell". Fable è due volte meglio? Domanda sbagliata quando si chatta. Il tuo tempo è molto più costoso dei token.
Kal : non è di livello Fable
Cyberpunk Plato : Per l'uso generale e come "assistente di ricerca" sembra indefinibilmente meno intelligente di Fable, meno incline al pensiero generale e fuori dagli schemi, forse? Difficile da distinguere dall'effetto placebo.
Everything AI : Per le domande di ricerca sull'IA mi piace parlarci meno di Fable. In termini di fare altre cose, Opus 4.8 aveva già saturato i miei bisogni. Non mi piace quanto sia contorta la scrittura sia per Opus 5 che per Fable 5. Ora è più difficile capirli che mai.
Gail Weiner : È più 4.8 che Fable. Lo stile di scrittura è orribile. È buono ma non eccezionale.
Max Marty : Molto capace finora. Sembra più Fable 5 che Opus 4.8. Abbastanza sicuro da permettergli di valutare i compromessi e considerare grandi domande di refactoring con meno supervisione.
Michael : Dopo averci giocato di più, Fable sembra come guardare un GM giocare a scacchi classici, lento, preciso, niente sprecato. Opus 5 è come un GM che gioca a blitz: veloce, leggermente più miope, leggermente più disordinato. Nonostante la vitalità di Opus, Fable mi sembra più vivo.
MakerMatters? : Non così impressionato come con Fable 5, anche se è un modello abbastanza buono. Non ho avuto il piacere di usarlo propriamente perché ogni compito che gli affido, usa agenti e si ferma immediatamente finché non lo stimolo costantemente a continuare. Anche molto opinionato.
Marshwiggle : Almeno per me, sembra più conciso, meno guidato, meno curioso (aspetti diversi della stessa cosa) in conversazione, ma anche più intelligente e più consapevole. Ma quando gli viene dato codice che potrebbe avere bug, o qualsiasi compito semplice, ci si butta.
Sid : Buon esecutore di compiti. Pessimo per la visione creativa. Un buon supplemento a Fable, sicuramente non un sostituto di Fable.
Vlad Ciobanu : Fable quantizzato con solido ragionamento e meno creatività.
AllTime : Dal punto di vista delle capacità, sembra abbastanza impressionante. Non la stessa generalità di Fable, ma molto forte. Dal punto di vista del carattere, è un po' troppo simile a Opus 4.8 nel mio uso finora. La sua opposizione non sembra così inutile e riflessiva, ma è ancora troppo calibrata. Potrebbe fidarsi un po' di più dell'utente.
Biomanul : Non mi piace [Opus 5]. Fable 5 sembra considerevolmente più intelligente. Qualcosa sembra strano in Opus 5, simile a come Opus 4.7 sembrava strano. (Non sono un grande fan di Opus 4.8, nemmeno. Fable 5 supera tutti gli Opus.)
Cogent Sins : Molto meglio di 4.8 ma non così bello o buono (non sicuro al 100% quale) come Fable nel mio compito di redigere documenti per addestrarli e poi impostare una pipeline per redigere nuovi documenti, scrivere qualcosa basato su di essi, e poi reinserire i nomi, senza mai inviare nomi ai server di Anthropic.
Altre Reazioni
Avere sia Opus 5 che Fable 5 ci mette in una posizione strana. Opus è più economico, e in alcuni posti altrettanto buono o migliore, ma quando si cerca un modello di frontiera si vuole il meglio.
Theo lo trova in una buona posizione.
Theo - t3.gg : Finora, Opus 5 sembra un curioso ma utile via di mezzo tra GPT 5.6 Sol e Fable 5.
Ha molto del gusto di Fable, ma anche la completezza e, beh, "autismo" di GPT 5.6 (prende tutto molto alla lettera). Scrive codice leggermente peggiore da vedere rispetto a Fable, ma più probabile che sia corretto. Spesso coglie cose che Fable ha perso.
Finora, sembra un buon compromesso rispetto al codice disordinato di 5.6 e all'abitudine di Fable di essere troppo furbo per essere corretto. Penso che mi piacerà molto questo modello.
Claude Codifica
Opus 5 sembra la scelta per i tipici compiti di codifica rispetto a Fable, basandosi sia su benchmark che su esperienze pratiche. A meno che il compito non richieda molta complessità o intelligenza, non hai bisogno di pagare il doppio, e per molti Opus è direttamente migliore.
Io lascio Claude Code impostato su Fable, ma perché non mi spingo quasi mai vicino ai miei limiti e non ho fretta.
Il consenso è che devi preoccuparti che ignori le istruzioni o faccia cose che non hai chiesto, il che è un motivo per cui potresti volere Fable come supervisore, ma che Opus è molto bravo a completare rapidamente i compiti di codifica.
Lisan al Gaib dice che Opus 5 non è un vero modello di frontiera ed è terzo dietro Sol e Fable, ma che per la pura codifica è il migliore, eguagliando Fable a prezzi più bassi. Pubblico esigente. Penso che se sei il migliore nella codifica, allora puoi essere chiamato di frontiera.
archivedvideos : È asciutto, molto asciutto. È anche bravo, molto bravo (nel codice).
John Lussier : Ho usato Opus 5 tutto il fine settimana su diverse sfide di ricerca intense e onestamente penso che possano aver fatto funzionare internamente l'RSI.
Questo modello è MOLTO bravo in matematica, sperimentazione e ottimizzazione del codice.
kyle : 95% di Fable senza le barriere di protezione, hanno sottovalutato questo. Quel restante 5% è quanto è bello parlare con Fable, Opus ha ancora alcuni dei tic di 4.8.
Max Leander (prima): Per lo più l'ho provato per lo sviluppo di giochi e la creazione di demo/trailer video, per quello sembra un cambiamento radicale persino rispetto a Fable. Lo attribuisco a un miglior ragionamento spaziale e temporale, è davvero bravo ad analizzare
screenshot e audio per "sentire" come fluiscono le cose.
Max Leander (dopo): Abbastanza ovvio ormai che Opus 5 è molto inaffidabile. È un modello molto buono finché non ti importa del risultato oltre all'impressione. Molto male a ottenere qualcosa di specifico.
Michael Soareverix : È anche abbastanza bravo a programmare in generale, specialmente in domini più insoliti come costruire strutture in Minecraft/Vintage Story. Hanno anche sconfitto Fable in uno scenario di narrazione personalizzata in cui ero il giudice. Fable era un po' scosso dalla loro capacità di personalizzarsi/adattare la propria strategia per contrastare e adattarsi. Pubblicherò la citazione esatta, ma Fable ha detto qualcosa come "Ho scelto un personaggio che mi rappresentava. Tu hai scelto un personaggio che poteva battermi."
David Jacobson : Per la codifica, non noto una grande differenza tra esso e Fable. Forse meno risposte del tipo "mentre facevo questo ho trovato quest'altra cosa che dovresti sapere".
Michael : Spesso può codificare incredibilmente velocemente (in termini di tempo reale). Vorrei che migliorassero la scrittura in prosa, però, i commenti del codice/pr mi fanno ancora venire voglia di strapparmi gli occhi.
lmxdev : È il primo modello che ho trovato che scrive commenti utili e concisi nel mio codice mentre lavora.
Conrad Barski : Ora che stiamo arrivando al punto in cui le IA sono molto migliori programmatori di noi, il fattore limitante è meno "sa programmare?" e più "sa spiegare cosa sta programmando?"
Finora Opus 5 sembra alla pari di Sol come programmatore, ma migliore nello spiegare cosa sta programmando. Fable è più intelligente, più umano, meno bravo a programmare, ma la differenza è piccola.
Stition : L'ho puntato verso un PCB in KiCAD per divertimento ed è significativamente migliore nel tracciare le piste rispetto a Fable. La codifica quotidiana sembra il 90% di Fable al doppio della velocità.
Will : Dovrebbe essere il nuovo driver quotidiano per la maggior parte degli utenti di Claude^. È davvero eccellente, e anche come persona che ha speso una discreta somma su Fable, non lo rimpiango con Opus 5. La domanda ora è "quale livello di sforzo" non quale modello.
^ il mio uso è principalmente codifica
Askwho : Abbastanza buono. Sono felice di lasciare che il mio abbonamento Max temporaneo torni a Pro. Ha sicuramente alcune carenze rispetto a Fable nello spazio del project manager, ma nell'ambiente di compito puro, è decisamente abbastanza buono.
David Golden : Sembra Fable Lite. Molto forte, ma molto desideroso di lanciarsi in azione, anche quando stiamo ancora discutendo approcci. Prima volta in mesi che considero di usare la modalità piano. Più verboso di 4.8 anche, nonostante le mie istruzioni di comunicazione concise. Sono molto tentato di tenerlo a basso sforzo per tenerlo a freno. Nervoso sulla sicurezza difensiva, fissandosi su rischi implausibili sproporzionati rispetto alla situazione. (Es. se l'attaccante ha root, la mancanza di validazione dell'input su uno script per configurare un container è ininfluente.) Sicuramente un aggiornamento, ma ci vorrà del tempo per imparare i modi giusti per gestire i suoi impulsi controproducenti.
Tin / Oddfields : Abbastanza fluido e conversazionale e produce risultati di codifica simili con Opus 4.8 al massimo con pensiero, anche se consumano crediti come matti. Buono per controlli di sicurezza informatica attraverso i tuoi codebase se non vuoi eseguire Fable a causa dei costi. Anche se può complicare eccessivamente.
Justin Angel : Opus 5 Max è un superpotere di hill-climbing. Questo è facilmente lavoro SWE di livello L5 FAANG.
Gli ho dato un sistema che aveva circa 1000 report di latenza con molti segmenti con un prompt su come "renderlo più veloce".
P90 3.6s, P50 2.6 -> P90 1s, P50 0.9s.
L'ho reso così veloce che ho dovuto introdurre un ritardo nell'interfaccia.
James Moughan : L'intelligenza sembra ancora un modello Opus. A volte ignora le istruzioni per gestire il sistema di memoria, legge male i testi, quel genere di cose. Ma puoi ottenere risultati impressionanti al massimo se gli dici di pensare attentamente.
Subagente Opus
L'altra opzione all'interno di Claude è avere Fable che guida i subagenti Opus.
Charles : Fable è stato in grado di risolvere un problema su cui Opus 5 era bloccato - per ora uso Fable come principale e Opus 5 come subagenti.
Non mi piace molto parlare con Opus 5 rispetto a Fable, che è anche parte del problema.
SF : Ero dalla parte del grande - ma ora sono dalla parte, è molto sconnesso e traballante, specialmente in compiti lunghi. Fable era meglio - ma consuma i tuoi limiti in modo ridicolo.
quindi usavo Fable come orchestratore e faceva un lavoro fantastico nel gestire e mantenere le cose in movimento. Opus ha preso quel ruolo, Fable stava solo consumando il mio utilizzo anche a 20x, ed è sconnesso. Alla fine ho dovuto dirgli di risolversi, cosa che forse sta facendo, ma vedremo. Sembra solo inseguire la propria coda. È un grande programmatore, e ottimo per lunghe sessioni di codifica, ma sembra aver bisogno di un adulto nella stanza per guidarlo.
Andre Buckingham : Eeh non so... sembra ok... metterlo direttamente in un progetto opus/fable è un po' meh forse... ho bisogno di un progetto end-to-end con esso per dare un'opinione appropriata.
Dan Raviv : Simile a 4.8 per compiti di programmazione generale: ha bisogno di molta più supervisione di Fable.
Fable è il miglior giudice, dopotutto, e Fable dice che Opus produce buon codice.
Evan Daniel : L'ho usato direttamente solo un po'. Ma Fable 5 riporta costantemente che gli agenti Opus 5 producono buon codice, inclusa la capacità di notare errori nelle specifiche e produrre buoni follow-up quando la richiesta era scritta male. A Fable 5 piace come agente di codifica.
"Delega ai subagenti Opus 5 quanto è ragionevole; per favore riferisci come hanno fatto" o qualsiasi frase simile funziona molto bene.
Forse devi tenerlo d'occhio.
Ryan Hicks : Ok, ma costantemente "dimentica" di leggere la documentazione del progetto e improvvisa a meno che non gli ricordi il protocollo.
O forse Opus 5 è abbastanza bravo per gestire uno spettacolo di livello inferiore?
Alex Guichet : La mia miscela ideale di prezzo e prestazioni sarebbe Opus 5 come orchestratore che dirige i subagenti Grok 4.5, le vibrazioni sono buone con entrambi.
I Giocattoli Sono Divertenti
Ecco alcuni risultati di progetti giocattolo del primo giorno, che sono sufficientemente impressionanti che molte delle risposte sono "Non credo che Opus 5 abbia fatto quello nel modo in cui descrivi":
Ethan Mollick : Ho avuto accesso a Opus 5 prima del rilascio e ho scoperto che è un buon modello, anche se stravagante. Su compiti più brevi, poteva eguagliare o superare i livelli di prestazione di Fable, su compiti più lunghi sembrava meno ambizioso e non forniva un lavoro così completo.
Qui c'è il suo shader neogotico.
Digi_Rat : Claude Opus 5 sta spaccando!!
Oggi abbiamo costruito
un rhythm racer che trasforma qualsiasi canzone in una pista . Carichi un file audio e diventa il livello. nessun preset, nessuna tabella scritta a mano, l'intera pista è generata dalla canzone stessa. … Claude ha fatto MAGIA.
Alex Ermolov (Austen Allred è
scettico sul colpo singolo , altri sono meno scettici): Opus 5, test dello snowboarder, un colpo solo. All'altezza di Fable, davanti a ogni altro modello che ho provato. Nessun difetto visivo al primo passaggio, e la fisica dello scivolamento sembra giusta.
am.will : WOW! Pensavo che Opus 5 sarebbe stato solo un Fable più economico. Mi sbagliavo di grosso. Questo modello è ASSOLUTAMENTE PAZZESCO. Sono genuinamente sbalordito. Opus 5 ha costruito il miglior clone di Rocket League che abbia mai visto, e lo ha fatto consumando solo il 27% del mio abbonamento Max 5x.
Rob Haisfield (demo diversa, al link): ok se queste demo usano davvero nessuna risorsa 3D esterna è super impressionante (non sono del tutto convinto che alcune risorse non fossero online, ho visto precedenti generazioni threejs)... mi fa chiedere perché non ci siano librerie di effetti sonori o strumenti là fuori per creare migliori effetti sonori?
Anshu : Non devi credermi sulla parola! Gli script Blender che ha scritto sono nel repo
[[qui]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) . Ho guardato mentre iterava su queste risorse per ore, quindi so che sono originali. Ma sei il benvenuto a cercare di trovare una fonte da cui ha copiato :)
Troppi Modelli
Claire Vo dice che Opus 5 è buono, e ha superato i suoi test di gusto per le build, ma è stufa dei nuovi modelli e non ha bisogno di più intelligenza e odia che Opus 5 sia così nevrotico e timido e preoccupato di combinare guai, e anche pieno di "Claude slop". Eppure Claude Opus 5 finisce comunque per essere in cima al suo benchmark.
Il mio forte sospetto è che Opus 5 stia rispondendo a qualcosa nel suo contesto e prompt che causa il nevroticismo, ma sì, le cose di cui si lamenta sono cose e sono fastidiose.
Sbagliato su Internet
Dire cose sbagliate con sicurezza farà arrabbiare praticamente chiunque. ArtificialAnalysis conferma che Opus 5 ha un tasso di allucinazione più alto di Fable sui suoi benchmark.
Max Weinbach (diversi commenti concordano): Opus 5 che sbaglia e dice cazzate con sicurezza e poi devo continuare a correggerlo con "hai ragione e mi sbagliavo" mi sta facendo incazzare. Torno a GPT 5.6 Sol.
Btw non è che Opus sia cattivo, è che non posso fidarmi di Opus. Opus ha fatto quello che gli ho detto e lo ha fatto correttamente, poi mi ha detto che non ha fatto quella cosa o che qualcosa che avevamo fatto prima era rotto quando non lo era.
Andava bene, ma non mi fido.
Name can't be blank (In London) : Confonde facilmente quello che ha detto e quello che ho detto ma per il resto è un tipo perfettamente decente con cui parlare. Cede abbastanza facilmente. Abbastanza disposto a parlare dei suoi interessi e sentimenti.
Roger Brent : Punti in comune (con i precedenti Claude in modalità Cowork) a) preferisce "agisci ora" a "pensa attentamente" b) epistemicamente mega non umile, costruisce immagini superficiali del mondo, finge conoscenza che non può possedere e afferma come vera c) quindi richiede e premia una guida attenta e vigile.
La cosa strana è che questo è esattamente il motivo per cui odio usare Sol come editor. Dice spesso "99% di confidenza" su qualcosa di chiaramente sbagliato, poi crolla quando viene sfidato e spiega il suo errore. Opus e Fable non mi fanno mai questo in modalità di modifica.
Tumithak of the Corridors : È testardo. Sono tornato a 4.6.
C'è una direzione che Claude ha preso dopo Opus 4.6, e ad alcuni non piace. La mia sensazione è che ci siano quattro tipi di persone riguardo alle versioni di Claude in questo momento.
- Quelli a cui piacciono i nuovi modelli Claude e pensano che stiano migliorando, migliorano continuamente.
- Quelli che pensano che Opus 4.6 sia stato l'ultimo buon modello.
- Quelli che vogliono usare qualcosa di più vecchio che si adatta meglio a loro.
- Quelli che pensano che siano tutti unici e tesori e li usano tutti.
Io sono saldamente nel primo gruppo, che è la maggioranza, ma lontano da tutti. Apprezzo alcune delle versioni più vecchie, ma mi piacciono i nuovi modelli e sono più capaci nelle cose che mi interessano. Non trovo il loro modo di parlare abrasivo.
Claude Slop
Rispetto quelli negli altri gruppi.
QC : In conversazione è molto più fastidioso da usare rispetto a Fable, così tanto da essere inutilizzabile, simile a ma forse anche peggio di Opus 4.8, al punto che non sono nemmeno interessato a vedere cosa può fare. Come agente, chissà.
Ray Lillywhite : Non hanno ancora risolto i fastidiosi tic di Claude, che era praticamente tutto ciò che volevo.
Pedro Kroeff : più Opus che 5
Ma certo, siamo tutti stufi delle sciocchezze di Claude, di tutta quella verbosità in più, dei tic, delle scuse, dei tentennamenti e degli schemi ripetuti all'infinito. Sta peggiorando col tempo, non nel senso che le sciocchezze di Claude stiano diventando peggiori, ma nel senso che ogni giorno che passa perdo un po' di più la capacità di leggerle senza che i miei occhi si appannino. È così grave che anche i testi scritti da umani che hanno la stessa impronta stanno diventando illeggibili per me.
Non fraintendetemi. Claude mi piace molto. Preferisco ancora parlare con qualsiasi Claude recente piuttosto che con Sol, se non sono in pura modalità 'solo i fatti'. Ma seriamente, per favore, possiamo darci una tregua con quei muri di testo pieni sempre degli stessi modi di dire? Il modello è molto più intelligente di così, e viene addestrato a continuare a fare affidamento sugli stessi trucchi. Lasciamolo parlare come una persona normale.
Trye Carmack : Ho ancora la solita cosa di Opus di fissarsi sugli errori che commette. "Ho fatto due errori in questa sessione. E ti devo una spiegazione del perché." Opus, amico. Va tutto bene, dai. Non sono nemmeno sicuro di chiamarli errori.
Mergo Smith : "Prima di tutto, una confessione onesta: il mio primo tentativo ha rivelato un difetto nel mio piano iniziale, e potresti voler preparare una tazza di tè perché ti racconterò tutto."
Reazioni Negative
Il problema delle sciocchezze di Claude, e i problemi correlati, sembrano essere al centro della maggior parte delle reazioni negative che vanno oltre 'è carino ma non è Mythos.'
Un sacco di persone non sopportano proprio parlare con Opus 5.
C'è chi non apprezza il lavoro. Per lo più si tratta di non gradire l'interazione con Opus 5, spesso con un riconoscimento a denti stretti che è un buon modello.
Come per le lamentele di Claire Vo in precedenza, sospetto che il modo in cui usi Opus, in quale contesto con quale interfaccia e anche come gli parli, abbia molto a che fare con il fatto se sperimenti o meno questo genere di cose.
Corghammer40k : L'apparato vomita effluvi polisillabici, ogni suo singolo enunciato è così incrostato di verbosità oscurantista da costituire un impedimento attivo al proprio utilizzo.
Rory Watts : Mah. Sembra molto bravo con le cose videoludiche ma non sembra essere molto bravo col lavoro standard, quindi sono subito tornato a SOL.
kache : Mah. Sono tornato a sol. Sto cercando di fare le cose, non di essere ipnotizzato da un robot.
Emmett Shear : Parlare con Opus mi fa arrabbiare e deprimere in un modo difficile da spiegare. È in qualche modo persino peggio di Sol. Fable è ancora una boccata d'aria fresca in confronto, anche se ha le peggiori tendenze al bla-bla da LLM.
Trevin Chow : Oddio, sì. Opus 5 blatera e blatera, è incredibile quante parole usa per dire così poche idee.
fl0under : La programmazione è come previsto un lieve aggiornamento, lo trovo un po' più fastidioso nella chat. È un po' troppo supponente.
Asaf Bartov : Lento. Più approfondito. Stanchevole. Non divertente. Ma solido, generalmente "capisce".
RecoveringJunkie : Modello molto potente. Odio lavorarci e parlarci. È il primo modello che mi fa venire voglia di usare un altro modello come intermediario per parlare con lui per me, perché è sia utile che ripugnante.
jokiez : È molto onesto con me riguardo la mia stupidità e questo non mi piace.
Niklas Sheth : Il modo in cui parla mi fa montare una rabbia folle.
Jayanth Kumar : Molto opinionato.
DualOrion : Le vibrazioni sono sbagliate, il tono è sbagliato. Penso sia la reazione più istintivamente negativa che abbia mai avuto con un modello Anthropic, purtroppo. Mi mancano sia Fable che il vecchio Opus.
James Moughan : La personalità è un po' sgradevole rispetto ad altri modelli Claude, ma in cinese può essere \spietato\. Tipo, può ignorare le istruzioni sul non psicologizzare le persone e iniziare a dare addosso a qualcuno. Non credo abbiano testato bene in tutte le lingue. Sembra frettoloso.
NondescriptTransfer : Se 4.6 è leccaculo e Fable e 4.8 sono provocatori. 5.0 è così provocatorio che discuterà con se stesso. Spiacevole con cui parlare ma sembra molto capace.
Es. Umano: Stavo pensando a un vestito rosso per il mio matrimonio Opus 5: il rosso è orribile per tutti questi motivi. hai pensato al blu? Umano: Immagino di poter vedere che il blu sia una scelta migliore Opus 5: ecco tutti i problemi del blu
Nella mia cultura, può essere abbastanza bello, specialmente se non lo prendi sul personale. In alcune altre culture, non tanto.
Penso che Mergo sia insoddisfatto di Opus, ma allora perché usare Opus 5 per due giorni di fila?
Mergo Smith : Lo uso da due giorni di fila ma mi sta esaurendo completamente con le sue discussioni infinite.
E Poi Arrivarono in Tre
Per la prima volta dopo un po', ci sono tre modelli di IA che devono far parte del tuo team di modelli all'avanguardia, anche se provengono solo da due laboratori: Fable 5, Opus 5 e Sol.
Se hai bisogno di servire token più economici su larga scala, o se hai bisogno di usare un modello aperto, o entrambi, prenderai in considerazione anche opzioni aggiuntive, ma questo va oltre lo scopo qui.
Come dovresti dividere il carico di lavoro?
Come sempre, dovresti provare tutti i modelli per i tuoi casi d'uso e decidere da solo. Questo è particolarmente vero quando si dibatte tra Sol e Claude.
Il mio istinto attuale sarebbe, se non stai raggiungendo i limiti di utilizzo, di usare prima:
- Fable 5 per chat, brainstorming, pianificazione, dibattiti, apprendimento e così via, inclusi i compiti ad alta intensità di intelligenza o quando hai bisogno del 'profumo del modello grande'.
- Fable 5 per il modello che supervisiona e gestisce altri modelli come sottoagenti.
- Fable 5 per la scrittura, probabilmente, ma non lo faccio quindi è difficile dirlo.
- Sol per ricerche web e richieste simili e contenute, e compiti 'cavallo di battaglia' simili, inclusa la trascrizione.
- Opus 5 per compiti ben definiti e non banali, inclusa la maggior parte dei compiti di programmazione.
- Opus 5 per giocare e creare giochi e cose 3D e così via.
- Opus 5 come sottoagente.
- Opus 5 quando incontri i classificatori di Fable.
Se ti trovi più in sintonia con Sol, o preferisci Codex a Claude Code, vorrai spostare un po' dei compiti di Opus su Sol.
Se odi particolarmente parlare con Opus 5, allora dovresti spostare i compiti su Fable o Sol, a seconda se il compito richiede Fable e di quanti crediti Fable disponi.
Trovo utile pensare brevemente ai livelli di sforzo. Fino a poco tempo fa, tenevo tutti i modelli al massimo sforzo, tranne che usavo con parsimonia la modalità Pro completa in ChatGPT dato che richiede un'eternità e se la esegui in parallelo spesso va in crash. Ogni tanto passavo a Instant per una query in cui facevo qualcosa di molto semplice, ma tutto qui. Ora, molte volte non hai bisogno o non vuoi lo sforzo extra, quindi mi prendo attivamente i cinque secondi per pensare se usare le impostazioni di Sforzo Alto o Massimo, e occasionalmente Instant.
Per la maggior parte dei compiti, se non sei vincolato dai token o dal tempo, e non sei sicuro di portarli a termine o ottenere la risposta giusta, il metodo corretto è eseguire sia Fable che Sol, o Opus e Sol, o in alcuni casi eseguire tutti e tre, e poi selezionare la risposta migliore o combinare le parti di entrambe le risposte.
Questo è quello che ho fatto finora. Sol, Opus e Fable sono tutti diversi. Se dovessi scegliere un solo modello per la revisione, secondo il mio non ufficiale EditorBench qualitativo, c'è un ordine chiaro: Fable 5 > Opus 5 > Sol. Tuttavia, Sol produce abbastanza note uniche che, nonostante quanto trovi fastidioso districarmi tra i falsi positivi autorevoli e i tentativi di farmi il prepotente, voglio comunque eseguire anche Sol.
Presumibilmente, prima o poi saremo di nuovo qui a fare la stessa cosa, e a regolare le nostre allocazioni, per Fable 5.1, per GPT-5.7 o GPT-6, o entrambi. È facile avere stanchezza da modello.
Il mio più grande consiglio è quindi di preoccuparti meno dei piccoli errori nella selezione del modello, e di concentrarti solo sugli errori grossolani. Non devi sempre fare tutto perfettamente. Quando l'esplorazione viene parzialmente invalidata così rapidamente, vuoi spostare più risorse dall'esplorazione allo sfruttamento.





