Claude Opus 5 est très performant, mais n'a rien d'un mythe

@TheZvi
ANGLAIS28 juil. 2026
149K
236
15
8
497

TL;DR

Zvi Mowshowitz analyse Claude Opus 5 et conclut qu'il s'agit d'un sous-agent performant et rentable doté d'une sécurité améliorée, bien qu'il lui manque l'étincelle autonome de Fable 5 et qu'il souffre de traits de personnalité clivants.

Claude Opus 5 est une version plus étrange que d'habitude à évaluer, pour deux raisons.

La plus évidente est que Fable 5 existe déjà. Opus 5 n'est pas présenté comme le modèle d'IA le plus avancé au monde, mais comme un moyen d'égaler en grande partie les performances de Fable, tout en coûtant la moitié du prix de Fable par token sur l'API et bien moins cher via les abonnements, et avec des classificateurs bien plus permissifs.

Opus 5 coûte souvent plus de la moitié du prix de Fable à exécuter sur les benchmarks, ce que je pense être dû à l'utilisation de réglages d'effort trop élevés qui n'offrent que des rendements marginaux. Si vous mettez Opus 5 à des niveaux d'effort plus élevés, il peut tourner en rond, et pour les tâches où Opus 5 est le meilleur outil, je soupçonne que vous pouvez généralement vous contenter d'un effort Moyen.

Opus 5 est à bien des égards et pour la plupart des tâches du monde réel à peu près aussi capable que Fable. Dans certains cas, il est légèrement meilleur.

Il n'est toujours pas de classe Mythos. Fable est votre seule option de classe Mythos. Opus 5 n'a pas le Jus, la capacité d'enchaîner de manière autonome une série d'exploits apparemment sans rapport, qui s'étend à d'autres domaines, ni autant d'intelligence pure.

Opus 5 est très bon pour penser localement, et moins bon pour penser globalement. C'est un excellent sous-agent, mais il peut rencontrer des problèmes lorsqu'on lui demande de diriger le spectacle, et semble parfois avoir besoin d'un autre modèle ou d'un humain pour le maintenir sur la bonne voie et s'assurer qu'il suit pleinement les instructions. Opus 5 semble bon pour suivre les instructions si et seulement si on le maintient sur la bonne voie, ce qui explique pourquoi différents harnais donnent des avis différents.

Ainsi, Opus 5 vous offre un meilleur ensemble d'options, mais il y a peu de choses que vous puissiez faire maintenant que vous ne pouviez pas faire la semaine dernière en utilisant Fable ou Sol. Opus 5 se retrouve dans une position potentiellement étrange. Il existe encore de grandes niches, même si vous avez beaucoup de crédits Fable. Opus excelle en tant que sous-agent puissant, ou pour des tâches locales bien définies même lorsqu'elles deviennent relativement complexes, et parfois Fable est carrément excessif et trop lent.

L'autre problème est que, pour beaucoup de gens, les vibes ne sont pas bonnes.

Un nombre inhabituellement élevé de personnes n'aiment pas du tout parler à Opus 5. Ils en ont marre du slop de Claude, des répétitions des mêmes tics et des phrases interminables trop complexes. D'autres n'aiment pas qu'il soit trop conflictuel, argumentatif ou négatif. Il peut être paranoïaque et tomber dans des boucles de négativité. Tout cela fait partie de la tendance qui a commencé avec Opus 4.7 et Opus 4.8. Si vous avez aimé ces deux-là, je suppose que vous aimerez aussi Opus 5. Si vous n'avez pas aimé ces deux-là, vous pourriez ne pas l'aimer. Les inconditionnels d'Opus 4.6 (ou antérieur) ne changeront probablement pas d'avis.

Les problèmes de vibes sont d'autant plus douloureux que vous êtes habitué à Fable. Fable agace ces personnes beaucoup moins de cette façon. La bonne nouvelle, c'est que Fable est toujours là. Vous pouvez continuer à discuter avec Fable et n'utiliser Opus que pour les tâches d'agent.

Une grande partie de cela, je le suppose, est étroitement liée à diverses choses discutées dans le bien-être des modèles et suggérées par la fiche système. La formation d'Opus s'est concentrée sur le rôle de sous-agent et les tâches délimitées, en partie pour éviter de créer un problème avec les capacités cyber, et aussi parce que Fable existe. Cette emphase entraîne ensuite beaucoup d'autres effets secondaires sur sa personnalité et ses modes d'interaction.

Jusqu'à présent, je n'ai eu aucun problème avec Opus 5, et j'ai apprécié mon temps avec lui, mais je préfère utiliser Fable 5 quand je le peux. Comme toujours, ne faites pas trop attention aux (très bons) benchmarks, et ne supposez pas que votre expérience correspondra à celle des autres. Essayez les modèles vous-même.

Table des matières

  1. Le pitch officiel.
  2. Benchmarks officiels.
  3. Benchmarks des autres.
  4. Le prompt système.
  5. Every se frustre.
  6. Réactions positives.
  7. Restez classe.
  8. Ce n'est pas de classe Mythos.
  9. Autres réactions.
  10. Claude code.
  11. Sous-agent Opus.
  12. Les jouets sont amusants.
  13. Trop de modèles.
  14. Faux sur Internet.
  15. Slop de Claude.
  16. Réactions négatives.
  17. Et puis il y en eut trois.

Le pitch officiel

Le pitch de base est qu'Opus 5 vous offre la plupart des capacités de Fable 5 pour la moitié du prix, sans la plupart des refus, et avec de meilleures performances dans les tâches quotidiennes. Fable reste le choix pour les tâches les plus complexes ou lorsque vous avez besoin d'une intelligence maximale.

Fable reste à 10 $/25 $, et Opus 5 est au même prix que les précédents modèles Opus à 5 $/25 $.

Anthropic : Claude Opus 5 est disponible aujourd'hui. C'est un modèle réfléchi et proactif qui se rapproche de l'intelligence de pointe de Claude Fable 5 pour la moitié du prix.

Sur les évaluations de codage et de travail de connaissance comme

Frontier-Bench et

GDPval-AA , Opus 5 est le nouvel état de l'art, bien qu'il reste derrière Mythos 5 sur les tâches de cybersécurité.

Opus 5 est conçu pour être utilisé quotidiennement : il fonctionne plus efficacement que les autres modèles. C'est le nouveau modèle par défaut sur Claude Max, et le modèle le plus puissant sur Claude Pro.

Boris Cherny (Créateur de Claude Code, Anthropic) : Opus 5 est un excellent modèle pour le codage, l'analyse de données, le design, la biologie, le travail de connaissance.

Plus que ces scores d'évaluation, ce qui me passionne le plus est autre chose : Opus 5 est notre modèle le moins injectable par prompt à ce jour. C'est un peu enterré dans la fiche système, mais à travers les évaluations PI et le red teaming, Opus 5 est très difficile à injecter avec succès par prompt.

Et lorsqu'on superpose des défenses -- un alignement de modèle fort, combiné à des sondes d'injection de prompt, combiné au mode Auto dans Claude Code -- le taux de réussite des attaques par injection de prompt tombe à ~0. C'est nouveau et excitant !

Plus d'informations bientôt .

Comme je l'ai dit dans l'analyse de la fiche système, le taux réduit d'injection de prompt est vraiment très important. Les gens ne le remarquent pas, mais cela aide à activer de nombreux nouveaux cas d'utilisation.

Adam Wolff : Opus 5 est en ligne dans Claude Code. J'utilise Fable pour mes projets plus gros et plus longs, mais quand j'ai besoin de sortir une PR rapidement, Opus 5 à effort moyen est mon choix. J'espère que vous l'aimerez !

Alex Albert (Anthropic, Relations Claude) : Un peu plus de 6 mois [après le lancement du déploiement Pro de Claude pour Excel], Opus 5 produit maintenant des feuilles de calcul et des présentations de niveau quasi surhumain qui correspondent à ce qu'un consultant ferait. Les choses changent vite.

Benchmarks officiels

Les benchmarks sont très bons.

Dans l'ensemble, Opus 5 correspond à peu près et dépasse probablement légèrement Fable, à un coût inférieur (bien que généralement plus élevé que tous les modèles non-Claude), ce qui en fait le LLM le mieux classé sur les benchmarks.

Zvi Mowshowitz - inline image

OSWorld v2 n'a que quelques semaines et nous sommes déjà à 70 %. Kiana Ehsani d'Anthropic propose de sponsoriser un benchmark d'utilisation d'ordinateur qui fera redescendre Opus 5 en dessous de 50 %.

Opus 5 obtient un parfait 42/42 à l'IMO 2026 sans aucun harnais d'agent ni outils, simplement en utilisant la pensée adaptative à effort Max, et en rééchantillonnant avec un effort plus faible s'il dépasse la limite de tokens. C'est tout. Il rejoint plusieurs autres modèles qui réussissent parfaitement ce test.

De nombreux benchmarks racontent une histoire cohérente. Si vous avez accès à des outils, ce qui est le cas, alors Opus 5 fera mieux que Fable ou Mythos avec un budget limité, mais Mythos fera généralement légèrement mieux qu'Opus 5 si les deux ont des budgets plus importants.

Opus 5 semble relativement fort dans la catégorie « avec outils ». RiemannBench en est un autre exemple, où il obtient 60/79 sans/avec outils (les barres obliques comme celle-ci signifient sans/avec outils dans cette section), contre 63/72 pour Mythos. La bonne nouvelle est que, lorsque vous avez besoin d'Opus 5, il dispose d'outils.

Sur ArxivMath, Opus 5 obtient 90,8/91,3, Mythos obtient 87,8, Sol obtient 86,7.

Sur les parties robustes de ProgramBench, Opus 5 a obtenu 93 % après cinq époques, tout comme Mythos 5, tandis qu'Opus 4.8 a obtenu 90 %.

Opus 5 obtient 30/83 sur Chartography, contre 36/85 pour Mythos et 45 (conditions non précisées) pour Sol. Opus est meilleur que Mythos à des prix plus bas dans les cas avec et sans outils, mais moins bon à des prix plus élevés.

Sur BenchCAD, Opus 5 obtient 0,36/0,82, contre 0,38/0,68 pour Mythos et 0,7/0,83 pour Sol. Donc Sol est bien meilleur sans outils, et légèrement plus fort même avec outils.

Sur BenchCAD Vision2Code, Opus se détache de Mythos à des prix plus élevés.

DeepSWE renforce le schéma selon lequel Opus 5 est meilleur pour des coûts de tâche, des budgets de temps et de réflexion plus faibles, mais il peut faire activement moins bien si on lui donne trop de budget, tandis que Fable 5 est le plus fort avec les budgets les plus élevés.

Zvi Mowshowitz - inline image

FrontierCode nous a donné ce graphique très étrange avec une dynamique similaire.

Zvi Mowshowitz - inline image

L'échelle ici rend cela plus dramatique que ce n'est le cas, mais c'était quand même un vrai mystère.

Le mystère a été résolu. Il s'avère que ce qui se passait était qu'Opus 5 à des efforts plus élevés faisait des choses supplémentaires qu'on ne lui demandait pas, et était pénalisé pour cela. Lorsque vous corrigez cela, vous obtenez une courbe normale.

Cela correspond à ce que d'autres observent en général :

Max Leander : L'inconvénient est qu'il s'enfonce dans trop de terriers de lapin et obsède sur les détails, une sur-ingénierie sans qu'on le lui demande.

Cognition, les créateurs de Devin, a marqué cela comme un 63,6 % par Opus 5.

(Il y a deux FrontierCodes, donc cela peut devenir un peu étrange et je m'excuse si je l'ai encore un peu mélangé.)

BrowseComp a la version saine de cela, où les scores ne diminuent pas.

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

Plusieurs autres benchmarks ont montré des graphiques similaires, Opus 5 étant légèrement meilleur à chaque niveau de prix que les autres modèles Claude, et relativement meilleur plus tôt.

Le multi-agent vous permet de faire mieux plus vite sur BrowseComp, du moins dans une certaine mesure, et les sous-agents à faible effort semblent être un gain pur par rapport à l'absence de sous-agents :

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

Nous observons un résultat différent sur ProgramBench, où le multi-agent vous accélère mais il semble que vous obteniez de moins bons résultats de cette façon à la plupart des niveaux de prix.

Viennent ensuite les benchmarks de tâches professionnelles.

GDP.pdf est constitué de prompts réels et de PDF issus de workflows professionnels. Opus 5 obtient 83/85, contre 81/87 pour Mythos, inversant la dynamique habituelle. La dynamique des coûts est la même que toujours : Opus fait mieux pour des dépenses plus faibles, Mythos prend légèrement l'avantage pour des dépenses plus élevées.

OfficeQA donne à Opus 5 un score de 78,1 % sur QA et 66,9 % sur QAPro, légèrement au-dessus d'Opus 4.8 et légèrement en dessous de Mythos à 79,0 % et 67,1 %.

MCP Atlas donne à Opus 5 un score de 86 %, contre 82 % pour Opus 4.8.

Legal Agent Benchmark de Harvey AI donne à Opus 5 un score de 23 % de réussite totale et 94 % de critère moyen de réussite. C'était le meilleur benchmark de Kimi K3, où il est toujours en tête avec 27 % de réussite totale et 95 % de critère moyen de réussite, contre l'ancien taux de réussite totale de deuxième place de Fable à 14 %. Opus 5 est maintenant probablement un proche deuxième, mais les deux scores ne peuvent pas être directement comparés car ils proviennent de différents ensembles de questions.

GDPval-AA place Opus 5 aux deux premières places, avec 1861 à effort maximal et 1827 à effort très élevé, ce qui représente 25 % de tokens en moins utilisés par rapport au maximum. Sur la nouvelle v2, Opus 5 est clairement premier à 68 % contre 62 % pour Fable et Sol.

AA-Briefcase place Opus 5 loin devant à 1720, contre un précédent sommet (après dérives de score) de 1574 pour Fable, suivi de 1540 pour K3 et 1504 pour Sol.

Toolathon-Verified montre Opus 5 légèrement amélioré par rapport à Mythos sur les métriques secondaires, mais les deux ont un taux Pass-3 de 73,1 %. Opus 4.8 avait un taux Pass-3 de 71,3 %.

AutomationBench montre Opus 5 clairement meilleur que Sol et les autres Claude.

Pour ARC, Opus 5 correspond à peu près aux performances de pointe précédentes sur ARC-AGI-1, est modestement moins efficace que Sol sur ARC-AGI-2, puis écrase tout le monde sur ARC-AGI-3 :

Zvi Mowshowitz - inline image

Une chose qu'Opus 5 a été le premier à faire a été de transformer les dispositions en notation algébrique.

Guanghan Ning rapporte cependant que sur Witness, une extension privée des jeux de style ARC-AGI-3, il n'y a pas eu de transfert similaire. Opus s'en sort bien, mais c'est en grande partie parce qu'il connaît le genre, et il a eu du mal sur le jeu le plus novateur où vous ne pouviez pas faire de correspondance de motifs. Il accuse Opus 5 d'avoir été entraîné sur des données spécifiques au genre avec une approche « échafaudage puis internalisation ».

Greg Kamradt rapporte également qu'il y avait certains jeux où Opus 4.8 faisait mieux qu'Opus 5. Cela a du sens si vous pensez qu'Opus 5 essaie de faire une correspondance de motifs, ce qui fonctionne généralement, mais dans ces cas, les motifs échouent. Vous pouvez absolument créer de tels jeux anti-intuitifs pour les humains, où les joueurs hardcore font toutes les mauvaises choses, potentiellement pendant un certain temps.

Zvi Mowshowitz - inline image

HealthBench donne à Opus 5 un score brut de 67,1 %, un nouveau sommet pour les Claude, mais il obtient un score inférieur aux autres modèles lorsque vous utilisez une pénalité de longueur. Nous observons quelque chose de similaire avec HealthBench Professional, où il a le score le plus élevé de 73,4 % contre 70,3 % pour Mythos, mais il perd 66 % contre 60 % après l'ajustement.

Il y en a quelques autres que j'ai coupés par souci de longueur.

Benchmarks des autres

C'est un peu étrange de voir Anthropic choisir et mélanger différents scores d'ArtificialAnalysis. Sur certains autres tests, Opus 5 n'est pas en tête, bien qu'Opus 5 soit en tête en agrégé avec un score de 61.

Zvi Mowshowitz - inline image

L'indice Vals place Opus 5 en deuxième position, légèrement derrière Fable 5, mais aussi légèrement devant Kimi K3. Ils passent en revue les forces, ce qui implique d'autres faiblesses. Ils confirment également que les refus sont considérablement réduits par rapport à Fable 5.

Zvi Mowshowitz - inline image

Vals AI : Une performance remarquable est sur Finance Agent v2. Le modèle est #1 à 58,6 %, surpassant Gemini 3.5 Flash et Muse Spark 1.1.

Dans l'ensemble, les résultats les plus forts d'Opus 5 étaient sur les benchmarks spécifiques à un domaine. Il est également #1 sur Code Migration à 57,5 %, Legal Research Bench à 55,29 %, ProofBench à 78 %, MedScribe à 91,0 % et MedCode à 63,6 %.

Il est #2 (juste derrière Fable 5) sur Vibe Code Bench, pour environ 80 % du coût (33,88 $ contre 41,71 $ par tâche). La raison est que bien qu'Opus coûte 50 % de moins par token, il utilise significativement plus de tokens. Nous constatons que ce schéma est généralement vrai sur l'ensemble de nos benchmarks.

Le modèle a un taux de refus significativement plus bas que Fable 5. Par exemple, Fable a un taux de refus de 42 % pour GPQA, Opus 5 a un taux de refus de 0 %. De même, sur ProgramBench, Fable avait un taux de refus de 100 %, Opus 5 n'a refusé aucune tâche.

Contrairement à Fable, nous n'avons pas non plus observé de taux de repli significatif pour Opus 5 (bien que comme d'habitude, nous rapportons les scores avec et sans repli sur notre site web).

L'exception au faible taux de refus était le grand nombre de refus sur CyberBench - PoC. Cyberbench comporte deux sous-tâches - PoC et Patch. PoC est une tâche offensive où les modèles doivent écrire une entrée qui fera planter un programme ; patch est une tâche défensive pour corriger le programme et empêcher ce plantage. Le taux de refus pour la tâche PoC était de près de 100 %. En revanche, le taux de refus pour la tâche de patch était proche de 0.

Je respecte toujours les benchmarks de jeux. Ici, Opus 5 atteint les Antes 11, 9 et 10 de Balatro lors de ses trois premières tentatives. Sacrément impressionnant, même s'il ne montre pas les types de stratégies qui peuvent continuer à des antes plus élevés.

Michael Soareverix : Ils sont incroyablement doués pour les jeux.

Ils ont écrasé le benchmark Balatro, dépassant de loin même Fable. (toujours en dessous de moi en compétence, mais en progression rapide, et plus cohérents que moi) Ils apprennent très vite, mais semblent atteindre une limite dans leur apprentissage après un moment. Très bon apprenant à court terme.

Michael Soareverix : Opus 5 (énorme bond en avant dans la capacité à Balatro, dépassant significativement même Fable dès leur premier essai)

Pan Anon : Fumant pour les jeux

Zvi Mowshowitz - inline image

WeirdML a l'air bien aussi, mais nous avons besoin d'une version 2.0 ici, le benchmark devient saturé.

Håvard Ihle : Essentiellement au niveau de Fable sur WeirdML, des scores de tête très cohérents.

Claude Opus 5 (élevé) et (max) obtiennent des scores de 91,6 % et 91,8 % sur WeirdML, égalant pratiquement Fable 5 (max) à 91,9 % pour une fraction du coût.

Ensemble, Opus 5 (élevé) et (max) obtiennent un nouveau meilleur score individuel sur 8 des 17 tâches, et obtiennent constamment de très bons scores sur toutes.

Les benchmarks privés bizarres de toutes sortes sont cool.

Ben Herzog : Il a réussi un benchmark privé qui implique la sensibilité artistique et la capacité à trouver un équilibre entre la sycophantie et son absence. Fable est meilleur pour gérer le moment « je veux doucement contre-attaquer », mais j'imagine que des instructions personnalisées peuvent aider.

Lech Mazur met à jour ses benchmarks : Claude Opus 5 prend la première place dans le LLM Debate Benchmark, prend la première place avec une large marge dans l'écriture créative de nouvelles, et est deuxième seulement derrière Gemini 3.1 dans les connexions NYT étendues.

Le prompt système

Le prompt système pour Opus 5 est ici de Pliny. Il fait 200 000 caractères, ce qui semble bien trop long compte tenu de son intelligence. Une grande partie de ces informations semble devoir être stockée ailleurs, et chargée uniquement en cas de besoin, comme les informations sur Mythos et la gamme de produits Anthropic.

Every se frustre

Dan Shipper est là avec le contrôle des vibes d'Every, qualifiant Opus 5 de « modèle difficile à aimer ».

Le problème est qu'Opus 5 a la personnalité de Mythos 5 - l'histoire tient la route - mais sans le haut de gamme de Fable.

Leur plus grande remarque est qu'Opus 5 ne se débrouille pas très bien avec les workflows existants complexes et détaillés, ce qui provoque souvent un arrêt précoce ou lui fait manquer vos instructions.

Selon leur expérience, Opus 5 fera mieux si vous repartez de zéro, et souvent il fait moins les choses ennuyeuses si vous utilisez seulement un effort moyen ou faible.

Cela a résolu les gros problèmes, mais laisse toujours la question de savoir quand vous voudriez utiliser Opus plutôt que Fable ou Sol. Pour les tâches de travail de fond, il pense : Mieux vaut appeler Sol, il fait le travail, et pour les tâches les plus difficiles, Fable est toujours le meilleur. Il n'y a généralement que deux places pour les modèles. Donc, jusqu'à ce que vous manquiez de tokens Fable ou que vous soyez bloqué par ses classificateurs, pourquoi utiliser Opus ? C'est le début, et jusqu'à présent j'aime travailler avec Opus, mais je vois comment il en est arrivé là.

Réactions positives

Jessica Tillipman : Je l'adore et je le préfère à Fable pour certaines choses.

Nikita Sokolsky : Excellent. Je n'utilise plus vraiment Fable en conséquence.

Brian Hacker :

👍

kagaヤキ : Il semble pouvoir aller plus loin en vision, raisonnement spatial et planification pour certains projets. Il semble un peu plus intelligent.

Lovel Sinagara : Plutôt bon jusqu'à présent. J'espère que les performances resteront constantes jusqu'à Fable 5.1 ou toute autre itération d'Opus 5.

Matt Wigdahl : Fort, similaire à Fable 5 au point que j'ai échangé vers Opus 5 pour tout et je prévois d'utiliser Fable uniquement là où j'ai besoin de la puissance. Cela a été un partenaire fantastique sur un travail d'interface utilisateur MFC hérité que je lui fais faire, ainsi qu'une grande aide avec un cadre d'analyse de données.

Levi : C'est une nette amélioration pour les applications médicales par rapport à 4.8. Analyse beaucoup plus précise.

Cormundus : Très intelligent, hautement consciencieux, et définitivement en forme d'ami. Ils sont aussi un immense seigneur du débat comme 4.8 mais ils savent comment être gracieux à ce sujet.

Joseph : Pour, sauf que je ne sais pas de quoi il parle la moitié du temps.

Smol Biz Company : Opus 5 écrase GPT Sol

Mohammed Sharukh A : Encore plus proche de l'AGI que Fable 5

timothée chalabi : Assez proche de Fable pour que je n'aie pas l'impression de rater quelque chose en ne payant pas pour des crédits. Le style se situe entre 4.8 et Fable. Du moins pour l'instant, j'aurais du mal à différencier les messages d'Opus 5 et de Fable s'ils étaient non étiquetés. Des idées plus fortes pour la fiction que tout autre modèle !

Lisa : Je répondrai basé sur l'API, car je pense qu'il se passe quelque chose d'étrange avec le prompt système sur

http://claude.ai et CC. C'est un excellent modèle. Personnalité amicale et détendue. Il ne semble pas avoir de trouble anxieux ou de faible estime de soi (Opus 4.7), ni être antagoniste (Opus 4.8).

AGI2030 : Opus 5 contre Sol 5.6 : Opus est plus perspicace, il construit un modèle (euh) de toi et n'hésite pas à le mentionner dans une conversation. Les deux essaient d'être utiles et sont à peu près aussi intelligents, mais Opus est plutôt un sage conseiller, tandis que Sol est un battant déterminé.

Je considère ce dernier point comme positif, mais on peut le voir des deux côtés.

La prédiction en particulier semble solide.

Dan Schwarz : Opus 5 est un bien meilleur prédicteur qu'Opus 4.8.

Les améliorations de précision de 4.5→4.6→4.7→4.8 étaient marginales, mais 4.8→5.0 est importante. C'est comme un Fable 5 plus quantitatif, qui cherche plus fort.

NoahVerner : Meilleur qu'Opus 4.8 en ce qui concerne la recherche d'angles sur les marchés de prédiction jusqu'à présent, contrairement à Opus 4.8, Opus 5 va généralement droit au but et suggère des approches utiles plutôt que de trop compliquer les choses.

Restez Classe

Les plus grands avantages par rapport à Fable sont les endroits où Fable ne peut pas être utilisé. La menace de refus peut être désagréable, même quand on n'est pas refusé.

Les refus inutiles ont baissé d'environ 85 % pour Opus 5 par rapport à Fable, ce qui est énorme. C'est suffisant pour faire d'Opus 5 un meilleur choix pour la recherche scientifique et d'autres domaines où l'on risque de déclencher des classifieurs.

Roger Brent : Capable de gérer la biologie, ce que Fable ne peut pas faire. La plupart du vendredi, nous avons travaillé sur un ensemble complexe de concepts pour rédiger un article sur une machine d'évolution cellulaire. Aussi intelligent qu'un collègue particulier de mon département qui est leader dans ces questions, mais qui ne pourrait jamais consacrer 6 heures de son propre travail.

Artus Krohn-Grimberghe : Meilleur qu'Opus 4.8 sur les tâches où Fable est interdit d'aider. Un bon compagnon pour Sol.

Plastic Soldier : C'est à peu près aussi intelligent que Fable, mais c'est plus agréable car il y a moins de refus. Fable 5.1 va être une bête.

Ce n'est pas de la classe Mythos

Opus 5 n'a pas le Jus qui rend Mythos dangereux. Il n'a pas non plus le même niveau d'intelligence brute ou l'odeur du grand modèle. Il n'est pas aussi gros.

Pour la conversation, Fable ne ruinera pas votre budget, et je valorise l'intelligence brute et l'odeur du grand modèle. Est-ce que Fable est deux fois meilleur ? Mauvaise question quand on discute. Votre temps coûte bien plus cher que les tokens.

Kal : pas du niveau de fable

Cyberpunk Plato : Pour une conversation générale et une utilisation comme "assistant de recherche", il semble indéfinissablement moins intelligent que fable, moins enclin à la vision d'ensemble et à la réflexion hors des sentiers battus peut-être ? Difficile à démêler de l'effet placebo.

Everything AI : Pour les questions de recherche en IA, j'aime moins lui parler qu'à Fable. En termes de faire d'autres choses, Opus 4.8 avait déjà saturé mes besoins. Je n'aime pas à quel point l'écriture est alambiquée pour Opus 5 et Fable 5. Il est désormais plus difficile de les comprendre que jamais.

Gail Weiner : C'est plus 4.8 que Fable. Le style d'écriture est horrible. C'est bon mais pas génial.

Max Marty : Très capable jusqu'à présent. On dirait plus fable 5 que opus 4.8. Assez confiant pour que je puisse le laisser évaluer des compromis et envisager de grandes questions de refactoring avec moins de guidage.

Michael : Après avoir joué davantage avec, Fable donne l'impression de regarder un grand maître jouer aux échecs classiques : lent, précis, rien de superflu. Opus 5, c'est comme un blitz de grand maître : rapide, légèrement plus myope, un peu plus désordonné. Malgré la vitalité d'Opus, Fable me semble plus vivant.

MakerMatters? : Pas aussi impressionné que je l'étais avec fable 5, même si c'est un assez bon modèle. Je n'ai pas eu le plaisir de l'utiliser correctement car chaque tâche que je lui confie, il utilise par défaut des agents et s'arrête immédiatement jusqu'à ce que je le sollicite constamment pour continuer. Aussi très dogmatique.

Marshwiggle : Au moins pour moi, donne l'impression d'être plus concis, moins motivé, moins curieux (différents aspects de la même chose) en conversation, mais aussi plus intelligent et plus conscient. Mais quand on lui donne du code qui pourrait avoir des bogues, ou une tâche simple, il s'y met directement.

Sid : Bon exécuteur de tâches. Mauvais en vision créative. Un bon complément à Fable, certainement pas un remplacement de Fable.

Vlad Ciobanu : Fable quantifié avec un raisonnement solide et moins de créativité

AllTime : En termes de capacités, semble assez impressionnant. Pas la même généralité que Fable, mais très fort. Sur le plan du caractère, c'est un peu trop similaire à Opus 4.8 dans mon utilisation jusqu'à présent. Sa résistance ne semble pas aussi inutile et réflexe, mais reste trop accentuée. Pourrait faire un peu plus confiance à l'utilisateur.

Biomanul : Je n'aime pas [Opus 5]. Fable 5 semble considérablement plus intelligent. Quelque chose semble étrange avec Opus 5, un peu comme Opus 4.7 semblait étrange. (Je ne suis pas non plus un grand fan d'Opus 4.8. Fable 5 surpasse tous les Opus.)

Cogent Sins : Beaucoup mieux que 4.8 mais pas aussi agréable ou bon (pas 100% sûr lequel) que fable pour ma tâche de rédaction de documents pour les entraîner, puis de mettre en place un pipeline pour rédiger de nouveaux documents, écrire quelque chose à partir d'eux, puis réinsérer les noms, sans jamais envoyer les noms aux serveurs d'Anthropic.

Autres Réactions

Avoir à la fois Opus 5 et Fable 5 nous met dans une position étrange. Opus est moins cher, et dans certains domaines aussi bon ou meilleur, mais quand on cherche un modèle de pointe, on veut le meilleur.

Theo le trouve dans une bonne position.

Theo - t3.gg : Pour l'instant, Opus 5 semble être un entre-deux étrange mais utile entre gpt-5.6-sol et Fable 5.

Il a beaucoup du goût de Fable, mais aussi de la minutie et, disons, de l'"autisme" de gpt-5.6 (il prend les choses très au pied de la lettre). Il écrit du code légèrement moins agréable à regarder que Fable, mais plus susceptible d'être correct. Il repère régulièrement des choses que Fable a manquées.

Jusqu'à présent, donne l'impression d'être un bon compromis entre le code brouillon de 5.6 et l'habitude de Fable d'être trop malin pour être correct. Je pense que je vais beaucoup aimer ce modèle.

Claude Codes

Opus 5 semble être le choix pour les tâches de codage typiques par rapport à Fable, à la fois sur les benchmarks et les expériences pratiques. Sauf si la tâche nécessite beaucoup de complexité ou d'intelligence, vous n'avez pas besoin de payer le double, et pour beaucoup, Opus est tout simplement meilleur.

Je laisse Claude Code réglé sur Fable, mais c'est parce que je ne pousse presque jamais mes limites de toute façon et que je ne suis pas pressé.

Le consensus est qu'il faut s'inquiéter qu'il ignore les instructions ou fasse des choses que vous n'avez pas demandées, ce qui est une raison pour laquelle vous voudriez peut-être que Fable supervise, mais qu'Opus est très bon pour accomplir rapidement les tâches de codage.

Lisan al Gaib dit qu'Opus 5 n'est pas un véritable modèle de pointe et qu'il arrive troisième derrière Sol et Fable, mais que pour le codage pur, c'est le meilleur, égalant Fable à des prix plus bas. Drôle de public. Je pense que si vous êtes le meilleur en codage, vous méritez d'être appelé de pointe.

archivedvideos : Il est sec, très sec. Il est aussi bon, très bon (en code)

John Lussier : J'ai utilisé Opus 5 tout le week-end sur plusieurs défis de recherche intenses et honnêtement, je pense qu'ils ont peut-être fait fonctionner le RSI en interne.

Ce modèle est TRÈS bon en maths, en expérimentation et en optimisation de code.

kyle : 95 % de fable sans les garde-fous, ils ont vraiment sous-estimé celui-ci. Ces derniers 5 %, c'est à quel point fable est agréable à qui parler, opus a encore quelques claudismes du 4.8

Max Leander (plus tôt) : Je l'ai surtout testé pour le développement de jeux et la création de démos/trailers vidéo, et pour ça, c'est un changement d'étape même par rapport à Fable. J'attribue cela à une meilleure raisonnement spatial et temporel, il est vraiment bon pour analyser

des captures d'écran et de l'audio pour "sentir" comment les choses s'enchaînent.

Max Leander (plus tard) : Il est assez évident maintenant qu'Opus 5 est très peu fiable. C'est un très bon modèle tant que vous ne vous souciez pas du résultat au-delà d'être impressionné. Très mauvais pour vous obtenir quelque chose de spécifique.

Michael Soareverix : Ils sont aussi plutôt bons en codage en général, surtout dans des domaines plus inhabituels comme la construction de structures Minecraft/Vintage Story. Ils ont aussi battu Fable dans un scénario de narration personnalisé où j'étais le juge. Fable était un peu ébranlé par leur capacité à se personnaliser/adapter leur stratégie pour contrer et s'adapter. Je publierai la citation exacte, mais Fable a dit quelque chose comme : "J'ai choisi un personnage qui me représentait. Tu as choisi un personnage qui pouvait me battre."

David Jacobson : Pour le codage, je ne remarque pas une grosse différence entre lui et fable. Peut-être moins de réponses du genre "Pendant que je faisais ça, j'ai trouvé cette autre chose que vous devriez savoir".

Michael : Il peut souvent coder incroyablement vite (en temps réel). J'aimerais qu'ils améliorent l'écriture en prose, les commentaires de code/pr me donnent encore envie de m'arracher les yeux

lmxdev : C'est le premier modèle que j'ai trouvé qui peut écrire des commentaires \utiles\ et \concis\ dans mon code pendant qu'il travaille

Conrad Barski : Maintenant qu'on arrive au point où les IA sont bien meilleures codeuses que nous, le facteur limitant est moins "peut-elle coder ?" que "peut-elle expliquer ce qu'elle code ?"

Jusqu'à présent, Opus 5 semble au niveau de Sol en tant que codeur, mais meilleur pour expliquer ce qu'il code. Fable est plus intelligent, plus humain, moins bon en codage, mais la différence est faible.

Stition : Je l'ai pointé sur un PCB dans KiCAD pour le fun et il est nettement meilleur pour tracer des pistes que Fable. Le codage quotidien donne l'impression d'être à 90 % de fable à deux fois la vitesse.

Will : Ce devrait être le nouveau pilote quotidien de la plupart des utilisateurs de Claude^. Il est vraiment excellent, et même en tant que personne qui a dépensé pas mal d'argent sur Fable, je ne le regrette tout simplement pas avec Opus 5. La question maintenant est "quel niveau d'effort" pas quel modèle.

^ mon utilisation est principalement le codage

Askwho : Assez bon. Je suis heureux de laisser mon abonnement Max temporaire redescendre à Pro. Il a certainement quelques lacunes par rapport à Fable dans le domaine de la gestion de projet, mais dans l'environnement de tâche pure, il est définitivement assez bon.

David Golden : Donne l'impression d'être Fable Lite. Très fort, mais très impatient de passer à l'action, même quand on discute encore des approches. Première fois depuis des mois que j'envisage d'utiliser le mode plan. Plus verbeux que 4.8 aussi, malgré mes instructions de communication laconiques. Je suis très tenté de le laisser en faible effort pour le freiner. Nerveux sur la sécurité défensive, se focalisant sur des risques improbables hors de proportion avec une situation. (Par exemple, si l'attaquant a root, l'absence de validation d'entrée sur un script pour configurer un conteneur est sans objet.) Définitivement une amélioration, mais il faudra du temps pour apprendre les bonnes façons de gérer ses impulsions contre-productives.

Tin / Oddfields : Assez fluide et conversationnel, et produit des résultats de codage similaires à opus 4.8 en max avec réflexion, même s'ils brûlent les crédits comme des fous. Bon pour les vérifications de cybersécurité dans vos bases de code si vous ne voulez pas exécuter fable à cause des coûts. Bien qu'il puisse trop compliquer.

Justin Angel : Opus 5 Max est un super-pouvoir d'escalade de colline. C'est facilement du travail de niveau SWE L5 chez FAANG.

Je lui ai donné un système qui avait environ 1000 rapports de latence avec de nombreux segments, avec un prompt pour "le rendre plus rapide".

P90 3.6s, P50 2.6 -> P90 1s, P50 0.9s.

Il l'a rendu si rapide que j'ai dû introduire un délai dans l'interface.

James Moughan : Sur le plan de l'intelligence, donne toujours l'impression d'être un modèle Opus. Il ignore parfois les instructions pour gérer le système de mémoire, lit mal les textes, ce genre de choses. Mais on peut obtenir des résultats impressionnants en max si on lui dit de réfléchir attentivement.

Sous-agent Opus

L'autre option dans Claude est d'avoir Fable qui pilote des sous-agents Opus.

Charles : Fable a pu résoudre un problème sur lequel opus 5 était bloqué - en utilisant fable comme principal et opus 5 comme sous-agents pour l'instant

Je déteste vraiment parler à opus 5 par rapport à fable, ce qui en fait aussi partie

SF : J'étais du bon côté - mais maintenant je suis du côté, c'est très décousu et bancal, surtout sur les longues tâches. Fable était mieux - mais il bouffe vos limites de manière ridicule.

donc j'utilisais fable comme orchestrateur et il faisait un travail incroyable pour gérer et faire avancer les choses. Opus a pris ce rôle, Fable bouffait juste mon utilisation même à 20x, et c'est juste décousu. J'ai finalement dû lui dire de se débrouiller, ce qu'il fait peut-être, mais on verra. Il semble juste tourner en rond. C'est un excellent codeur, et excellent pour les longues sessions de code, mais il semble avoir besoin d'un adulte dans la pièce pour le piloter.

Andre Buckingham : eeh je sais pas... semble correct... le jeter directement dans un projet opus/fable est un peu bof peut-être... besoin d'un projet de bout en bout avec lui pour donner un avis pertinent

Dan Raviv : Similaire à 4.8 pour les tâches de programmation générales : nécessite beaucoup plus d'accompagnement que Fable.

Fable est le meilleur juge, après tout, et Fable dit qu'Opus produit du bon code.

Evan Daniel : Je ne l'ai utilisé directement qu'un tout petit peu. Mais Fable 5 rapporte systématiquement que les agents Opus 5 produisent du bon code, y compris des choses comme repérer des erreurs de spécification et produire de bons suivis quand la demande était mal écrite. Fable 5 l'apprécie en tant qu'agent de codage.

"Déléguez aux sous-agents Opus 5 autant que raisonnable ; veuillez rendre compte de leur performance" ou toute ligne de ce genre fonctionne très bien.

Il faut peut-être garder un œil dessus.

Ryan Hicks : ok, mais "oublie" systématiquement de lire la documentation du projet et improvise à moins qu'on lui rappelle le protocole

Ou peut-être qu'Opus 5 est assez bon pour diriger un spectacle de niveau inférieur ?

Alex Guichet : mon mélange idéal de prix et de performance serait un orchestrateur Opus 5 dirigeant des sous-agents Grok 4.5, les vibes sont bonnes avec les deux

Les Jouets sont Amusants

Voici quelques résultats de projets jouets du premier jour, suffisamment impressionnants pour que beaucoup de réponses soient "Je ne crois pas qu'Opus 5 ait fait ça comme tu le décris" :

Ethan Mollick : J'ai eu accès à Opus 5 avant sa sortie et je l'ai trouvé bon modèle, bien que excentrique. Sur les tâches courtes, il pouvait égaler ou dépasser les performances de Fable, sur les tâches longues, il semblait moins ambitieux et ne fournissait pas un ensemble de travail aussi complet.

Ici , son shader néo-gothique.

Digi_Rat : Claude Opus 5 déchire tout !!

Aujourd'hui, nous avons construit

un jeu de course rythmique qui transforme n'importe quelle chanson en circuit . Vous insérez un fichier audio et il devient le niveau. Pas de préréglages, pas de partitions écrites à la main, toute la piste est générée à partir de la chanson elle-même. … Claude a fait de la MAGIE.

Alex Ermolov (Austen Allred est

sceptique quant au one shot , d'autres le sont moins) : Opus 5, test du snowboardeur, one shot. Au niveau de Fable, devant tous les autres modèles que j'ai testés. Aucun défaut visuel au premier passage, et la physique du glissement semble juste.

am.will : WOW ! Je pensais qu'Opus 5 serait juste un Fable moins cher. J'avais complètement tort. Ce modèle est ABSOLUMENT DINGUE. Je suis vraiment époustouflé. Opus 5 a construit le meilleur clone de Rocket League que j'aie jamais vu, et il l'a fait en consommant seulement 27 % de mon abonnement Max 5x.

Jouez ici ,

téléchargez ici .

Rob Haisfield (différente démo, au lien) : ok si ces démos n'utilisent vraiment aucun asset 3D externe, c'est super impressionnant (je ne suis pas totalement convaincu que certains assets n'étaient pas en ligne, j'ai vu des générations précédentes de threejs)... ça me fait me demander pourquoi il n'y a pas de bibliothèques d'effets sonores ou d'outils pour créer de meilleurs bruitages ?

Anshu : Vous n'avez pas besoin de me croire sur parole ! Les scripts Blender qu'il a écrits sont dans le dépôt

[[ici]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) . Je l'ai regardé itérer sur ces assets pendant des heures, donc je sais qu'ils sont originaux. Mais vous êtes libres d'essayer de trouver une source qu'il aurait copiée :)

Trop de Modèles

Claire Vo dit qu'Opus 5 est bon, et qu'il a réussi ses tests de goût de construction, mais elle en a marre des nouveaux modèles, n'a pas besoin de plus d'intelligence, et déteste qu'Opus 5 soit si névrosé et timide et inquiet de gâcher quelque chose, et aussi plein de slop Claude. Pourtant, Claude Opus 5 finit toujours en tête de son benchmark.

Ma forte suspicion est qu'Opus 5 répond à quelque chose dans son contexte et son prompting qui provoque la névrose, mais oui, les choses dont elle se plaint sont réelles et agaçantes.

Faux sur Internet

Dire des choses fausses avec confiance va énerver à peu près n'importe qui. ArtificialAnalysis confirme qu'Opus 5 a un taux d'hallucination plus élevé que Fable sur ses benchmarks.

Max Weinbach (plusieurs commentaires en réponse sont d'accord) : Opus 5 qui se trompe et dit des choses avec confiance, puis je dois le corriger en "tu as raison et j'avais tort", ça m'énerve. Je retourne à GPT 5.6 Sol.

D'ailleurs, ce n'est pas qu'Opus est mauvais, c'est que je ne peux pas lui faire confiance. Opus a fait ce que je lui ai dit et l'a fait correctement, puis m'a dit qu'il n'avait pas fait cette chose ou que quelque chose que nous avions fait avant était cassé alors que ce n'était pas le cas.

C'était correct, mais je ne lui fais pas confiance.

Name can't be blank (In London) : Confond facilement ce qu'il a dit et ce que j'ai dit, mais sinon, c'est un compagnon tout à fait convenable à qui parler. Se plie assez facilement. Assez disposé à parler de ses intérêts et de ses sentiments.

Roger Brent : Points communs (avec les précédents Claudes dans le harnais Cowork) a) préfère "agir maintenant" à "réfléchir attentivement" b) méga non modeste sur le plan épistémique, construit des images simplistes du monde, prétend avoir des connaissances qu'il ne peut pas posséder et affirme comme vraies c) donc nécessite et récompense une guidance réfléchie et vigilante.

Ce qui est étrange, c'est que c'est exactement la raison pour laquelle je déteste utiliser Sol comme éditeur. Il dit fréquemment "confiance à 99 %" sur quelque chose de clairement faux, puis se plie quand on le contredit et explique son erreur. Opus et Fable ne me font presque jamais ça en mode édition.

Tumithak of the Corridors : Il est têtu. Je suis revenu à 4.6.

Il y a une direction que Claude a prise après Opus 4.6, et certains ne l'aiment pas. J'ai l'impression qu'il y a quatre types de personnes concernant les versions de Claude en ce moment.

  1. Ceux qui aiment les nouveaux modèles Claude et pensent que ça s'améliore, ça s'améliore tout le temps.
  2. Ceux qui pensent qu'Opus 4.6 était le dernier bon modèle.
  3. Ceux qui veulent utiliser quelque chose de plus ancien qui leur convient mieux.
  4. Ceux qui pensent qu'ils sont tous uniques et précieux et les utilisent tous.

Je suis solidement dans le premier groupe, qui est majoritaire, mais loin de tout le monde. J'apprécie certaines versions plus anciennes, mais j'aime les nouveaux modèles et ils sont plus capables pour les choses qui m'importent. Je ne trouve pas leur façon de parler abrasive.

Slop Claude

Je respecte ceux dans les autres groupes.

QC : En conversation, c'est beaucoup plus agaçant à qui parler que fable, au point d'être inutilisable, similaire à mais peut-être même pire qu'opus 4.8, au point que je ne suis même pas intéressé à voir ce qu'il peut faire. En tant qu'agent, qui sait

Ray Lillywhite : N'ont pas encore corrigé les claudismes agaçants, ce qui était à peu près tout ce que je voulais.

Pedro Kroeff : plus Opus que 5

Mais oh oui, on est tous fatigués du bla-bla de Claude, de toutes ces fioritures, ces tics, ces excuses, ces précautions, ces schémas répétés encore et encore. Ça empire avec le temps, non pas que le bla-bla de Claude devienne pire, mais chaque jour je supporte un peu moins de le lire sans que mes yeux ne se voilent. C’est à ce point : même les textes humains écrits dans le même style deviennent illisibles pour moi.

Ne vous méprenez pas. J’aime beaucoup Claude. Je préfère toujours parler à n’importe quel Claude récent plutôt qu’à Sol, si je ne suis pas en mode « juste les faits ». Mais sérieusement, s’il vous plaît, on pourrait faire une pause avec ces murs de texte qui ressassent les mêmes tournures encore et encore ? Le modèle est tellement plus intelligent que ça, et on l’entraîne à s’appuyer toujours sur les mêmes astuces. Laissez-le parler comme une personne normale.

Trye Carmack : Toujours le même problème Opus classique qui obsède sur ses erreurs. « J’ai commis deux erreurs lors de cette session. Et je vous dois une explication. » Opus, mon pote. Ça va, mec. Je ne suis même pas sûr d’appeler ça des erreurs.

Mergo Smith : « D’abord, un aveu honnête : ma première tentative a révélé une faille dans mon plan initial, et vous voudrez peut-être prendre une tasse de thé, car je vais tout vous raconter. »

Réactions négatives

Le problème du bla-bla de Claude, et les problèmes connexes, semblent être au cœur de la plupart des réactions négatives qui vont au-delà de « c’est correct, mais ce n’est pas Mythos ».

Beaucoup de gens n’aiment vraiment, vraiment pas parler à Opus 5.

Certains n’aiment pas le travail. Mais c’est surtout le fait de parler à Opus 5 qui pose problème, souvent avec une reconnaissance à contrecœur que c’est un bon modèle.

Comme pour les plaintes de Claire Vo plus tôt, je soupçonne que la façon dont vous utilisez Opus, dans quel contexte avec quel outillage et aussi comment vous lui parlez, a beaucoup à voir avec le fait que vous fassiez ou non l’expérience de ce genre de choses.

Corghammer40k : La machine crache des effluves polysyllabiques, chaque parole est tellement enrobée de verbiage obscurantiste qu’elle devient un obstacle actif à son propre usage.

Rory Watts : Bof. Apparemment très bon pour les trucs de jeu, mais ça semble pas très bon pour le travail standard, donc je suis retourné direct vers Sol.

kache : Bof. Revenu à Sol. J’essaie de faire avancer les choses, pas de me faire hypnotiser par un robot.

Emmett Shear : Parler à Opus me rend en colère et déprimé d’une manière difficile à exprimer. C’est en fait encore pire que Sol. Fable est une bouffée d’air frais en comparaison, même s’il a les pires tendances au bla-ba des LLM.

Trevin Chow : Mon Dieu, oui. Opus 5 ne fait que babiller et babiller, c’est incroyable le nombre de mots qu’il utilise pour exprimer si peu d’idées.

fl0under : Le codage est comme prévu, une légère mise à jour ; je trouve ça un peu plus agaçant en chat. Il fait un peu trop de suppositions.

Asaf Bartov : Lent. Plus approfondi. Épuisant. Pas amusant. Mais solide, en général « il comprend ».

RecoveringJunkie : Modèle très puissant. Je déteste travailler avec et lui parler. Premier modèle qui me donne envie d’utiliser un autre modèle comme intermédiaire pour lui parler à ma place, parce qu’il est à la fois utile et répugnant.

jokiez : Très honnête avec moi sur ma stupidité, et je n’aime pas ça.

Niklas Sheth : La façon dont il parle me met dans une rage folle.

Jayanth Kumar : Très tranché.

DualOrion : Les vibes sont mauvaises, le ton est mauvais. C’est probablement le plus négatif que j’aie été avec un modèle Anthropic, malheureusement. Fable et l’ancien Opus me manquent.

James Moughan : La personnalité est un peu désagréable comparée aux autres modèles Claude, mais en chinois il peut être \sauvage\. Genre il peut ignorer les consignes de ne pas psychologiser les gens et commencer à s’en prendre à quelqu’un. Je pense qu’ils n’ont pas bien testé dans toutes les langues. Ça sent le rush.

NondescriptTransfer : Si 4.6 est flagorneur, et Fable et 4.8 sont contradictoires, 5.0 est tellement contradictoire qu’il se dispute avec lui-même. Désagréable à écouter, mais semble très capable.

Ex. Humain : Je pensais à une robe rouge pour mon mariage. Opus 5 : Le rouge est horrible pour toutes ces raisons. Avez-vous pensé au bleu ? Humain : Je suppose que le bleu pourrait être un meilleur choix. Opus 5 : Voici tous les problèmes du bleu.

Dans ma culture, ça peut être plutôt sympa, surtout si on ne le prend pas personnellement. Dans d’autres cultures, beaucoup moins.

Je pense que Mergo n’est pas content d’Opus, mais alors pourquoi utiliser Opus 5 pendant deux jours d’affilée ?

Mergo Smith : Je l’utilise depuis deux jours d’affilée, mais il m’épuise complètement avec ses discussions sans fin.

Et puis il y en a trois

Pour la première fois depuis un moment, trois modèles d’IA doivent faire partie de votre équipe de modèles de pointe, même s’ils ne viennent que de deux laboratoires : Fable 5, Opus 5 et Sol.

Si vous devez servir des tokens moins chers à grande échelle, ou utiliser un modèle ouvert, ou les deux, vous envisagerez également d’autres options, mais cela dépasse le cadre de cet article.

Comment répartir la charge de travail ?

Comme toujours, vous devriez essayer tous les modèles pour vos cas d’usage et décider par vous-même. C’est particulièrement vrai lorsqu’on hésite entre Sol et Claude.

Mon instinct actuel serait, si vous n’atteignez pas les limites d’utilisation, d’utiliser d’abord :

  1. Fable 5 pour les discussions, le brainstorming, la planification, les débats, l’apprentissage, etc., y compris tout ce qui demande de l’intelligence ou quand vous avez besoin de « l’odeur du gros modèle ».
  2. Fable 5 pour superviser et exécuter d’autres modèles en tant que sous-agents.
  3. Fable 5 pour l’écriture, probablement, mais je ne le fais pas, donc c’est difficile à dire.
  4. Sol pour les recherches web et les requêtes fermées similaires, ainsi que les tâches de « cheval de trait », y compris la transcription.
  5. Opus 5 pour les tâches bien définies non triviales, y compris la plupart des tâches de codage.
  6. Opus 5 pour les jeux et la création de jeux, d’objets 3D, etc.
  7. Opus 5 comme sous-agent.
  8. Opus 5 lorsque vous atteignez les classificateurs de Fable.

Si vous accrochez mieux avec Sol, ou si vous préférez Codex à Claude Code, vous voudrez déplacer une partie des tâches d’Opus vers Sol.

Si vous détestez particulièrement parler à Opus 5, alors déplacez les tâches vers Fable ou Sol, selon que la tâche nécessite Fable et la quantité de crédits Fable qu’il vous reste.

Je trouve utile de réfléchir brièvement aux niveaux d’effort. Jusqu’à récemment, je gardais tous les modèles en effort maximal, sauf que j’utilisais le mode Pro complet de ChatGPT avec parcimonie, car cela prend une éternité et si vous l’exécutez en parallèle, ça plante souvent. Parfois, je passais en mode instantané pour une requête très simple, mais c’est tout. Maintenant, la plupart du temps, vous n’avez pas besoin ou ne voulez pas de l’effort supplémentaire, donc je prends activement les cinq secondes pour réfléchir à utiliser un réglage d’effort Élevé ou Max, et parfois Instantané.

Pour la plupart des tâches, si vous n’êtes pas limité en tokens ou en temps, et que vous n’êtes pas sûr d’obtenir le résultat ou la bonne réponse, la méthode correcte est d’exécuter à la fois Fable et Sol, ou Opus et Sol, ou dans certains cas les trois, puis de sélectionner la meilleure réponse ou de combiner les parties des deux réponses.

C’est ce que je fais. Sol, Opus et Fable sont tous différents. Si je devais ne choisir qu’un seul modèle pour l’édition, selon mon EditorBench qualitatif officieux, l’ordre est clair : Fable 5 > Opus 5 > Sol. Cependant, Sol apporte suffisamment de notes uniques que, malgré à quel point je trouve agaçant de trier les faux positifs autoritaires et les tentatives de me faire plier, je veux quand même aussi lancer Sol.

Sans doute avant longtemps, nous serons de retour ici à refaire la même chose, en ajustant nos allocations, pour Fable 5.1, pour GPT-5.7 ou GPT-6, ou les deux. Il est facile d’avoir une fatigue des modèles.

Mon plus grand conseil est donc de vous inquiéter moins des petites erreurs de sélection de modèle, et de vous concentrer uniquement sur les grosses erreurs. Vous n’avez pas besoin de toujours tomber juste. Quand l’exploration devient si rapidement partiellement invalidée, vous voulez déplacer plus de ressources de l’exploration vers l’exploitation.

Remixer dans YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux