Claude Opus 5 ist äußerst leistungsfähig, aber kein Mythos

@TheZvi
ENGLISCH28. Juli 2026
149K
236
15
8
497

TL;DR

Zvi Mowshowitz analysiert Claude Opus 5 und kommt zu dem Schluss, dass es ein leistungsfähiger und kosteneffizienter Subagent mit verbesserter Sicherheit ist, dem jedoch der autonome „Drive“ von Fable 5 fehlt und der unter einer polarisierenden Persönlichkeit leidet.

Claude Opus 5 ist eine ungewöhnlichere Veröffentlichung als üblich – aus zwei Gründen.

Der offensichtlichste ist, dass Fable 5 bereits existiert. Opus 5 wird nicht als das fortschrittlichste KI-Modell der Welt angepriesen, sondern als eine Möglichkeit, die Leistung von Fable größtenteils zu erreichen, dabei aber halb so teuer pro Token wie Fable in der API zu sein und über Abonnements noch deutlich günstiger – und mit weitaus großzügigeren Klassifikatoren.

Opus 5 kostet in Benchmarks oft mehr als die Hälfte von Fable, was meiner Meinung nach daran liegt, dass zu hohe „Effort“-Einstellungen verwendet werden, die nur marginale Verbesserungen bringen. Wenn man Opus 5 auf höhere Effort-Stufen stellt, dreht es sich im Kreis, und bei Aufgaben, für die Opus 5 das beste Werkzeug ist, reicht meiner Einschätzung nach meist Medium Effort aus.

Opus 5 ist in vielerlei Hinsicht und für den Großteil der realen Aufgaben etwa so leistungsfähig wie Fable. In einigen Fällen ist es sogar etwas besser.

Es ist immer noch nicht in der Mythos-Klasse. Fable ist deine einzige Option in der Mythos-Klasse. Opus 5 hat nicht „The Juice“ – die Fähigkeit, autonom eine Reihe scheinbar unzusammenhängender Exploits aneinanderzureihen, die sich auf andere Bereiche überträgt – und auch nicht so viel pure Intelligenz.

Opus 5 ist sehr gut darin, lokal zu denken, aber nicht so gut darin, global zu denken. Es ist ein exzellenter Subagent, kann aber in Schwierigkeiten geraten, wenn es die Leitung übernehmen soll, und scheint manchmal ein anderes Modell oder einen Menschen zu brauchen, um auf Kurs zu bleiben und sicherzustellen, dass es die Anweisungen vollständig befolgt. Opus 5 scheint Anweisungen gut zu befolgen, aber nur dann, wenn es auf Kurs gehalten wird – das erklärt, warum unterschiedliche Testumgebungen zu unterschiedlichen Ergebnissen führen.

Opus 5 bietet dir also eine bessere Auswahl an Optionen, aber es gibt kaum etwas, was du jetzt tun kannst, was du letzte Woche nicht auch mit Fable oder Sol hättest tun können. Opus 5 landet damit in einer merkwürdigen Position. Es gibt immer noch große Nischen, selbst wenn du genügend Fable-Credits hast. Opus zeichnet sich als starker Subagent aus oder bei abgegrenzten, klar definierten lokalen Aufgaben, selbst wenn sie relativ komplex werden – und manchmal ist Fable schlichtweg übertrieben und zu langsam.

Das andere Problem ist, dass bei vielen Menschen die Stimmung nicht stimmt.

Eine ungewöhnlich große Zahl von Menschen spricht nicht gern mit Opus 5. Sie haben die Claude-Slop satt – die Wiederholungen derselben Marotten und die endlosen, übermäßig komplexen Sätze. Andere mögen nicht, dass es zu konfrontativ, streitsüchtig oder negativ ist. Es kann paranoid sein und in Negativitätsschleifen verfallen. Das alles ist Teil des Trends, der mit Opus 4.7 und 4.8 begann. Wenn dir diese beiden gefallen haben, wird dir vermutlich auch Opus 5 gefallen. Wenn sie dir nicht gefallen haben, wird dir Opus 5 wahrscheinlich auch nicht gefallen. Hardcore-Fans von Opus 4.6 (oder früher) werden ihre Meinung größtenteils nicht ändern.

Die Probleme mit der Stimmung wiegen umso schwerer, wenn man an Fable gewöhnt ist. Fable nervt solche Leute in dieser Hinsicht deutlich weniger. Die gute Nachricht ist: Fable ist immer noch da. Du kannst weiterhin mit Fable chatten und Opus nur für agentische Aufgaben nutzen.

Ein Großteil dessen, so spekuliere ich, hängt eng mit verschiedenen Dingen zusammen, die im Artikel Model Welfare und im System Card besprochen wurden. Das Opus-Training konzentrierte sich auf die Subagenten-Rolle und abgegrenzte Aufgaben, unter anderem um Probleme mit Cyber-Fähigkeiten zu vermeiden – und auch, weil Fable existiert. Diese Schwerpunktsetzung führt dann zu vielen anderen Nebeneffekten auf seine Persönlichkeit und Interaktionsweisen.

Bisher hatte ich keinerlei Probleme mit Opus 5 und habe die Zeit mit ihm genossen, aber ich bevorzuge es, wo möglich Fable 5 zu verwenden. Wie immer: Schenk den (sehr starken) Benchmarks nicht zu viel Aufmerksamkeit und geh nicht davon aus, dass deine Erfahrung der anderer gleicht. Probiere die Modelle selbst aus.

Inhaltsverzeichnis

  1. Das offizielle Pitch.
  2. Offizielle Benchmarks.
  3. Benchmarks anderer.
  4. Der System-Prompt.
  5. Every wird frustriert.
  6. Positive Reaktionen.
  7. Bleib stilvoll.
  8. Es ist nicht Mythos-Klasse.
  9. Andere Reaktionen.
  10. Claude Codes.
  11. Subagent Opus.
  12. Spielzeuge machen Spaß.
  13. Zu viele Modelle.
  14. Falsch im Internet.
  15. Claude Slop.
  16. Negative Reaktionen.
  17. Und dann waren es drei.

Das offizielle Pitch

Das grundlegende Pitch ist: Opus 5 liefert dir den Großteil von Fable 5 zum halben Preis, ohne die meisten Ablehnungen und mit besserer Leistung bei alltäglichen Aufgaben. Fable bleibt die erste Wahl für die komplexesten Aufgaben oder wenn du sonst maximale Intelligenz brauchst.

Fable bleibt bei $10/$25, und Opus 5 kostet wie die bisherigen Opus-Modelle $5/$25.

Anthropic : Claude Opus 5 ist ab heute verfügbar. Es ist ein durchdachtes und proaktives Modell, das nahe an die Grenzintelligenz von Claude Fable 5 herankommt – zum halben Preis.

Bei Bewertungen von Programmier- und Wissensarbeitsaufgaben wie

Frontier-Bench und

GDPval-AA ist Opus 5 der neue Spitzenreiter, bleibt aber bei Cybersicherheitsaufgaben hinter Mythos 5 zurück.

Opus 5 ist für den täglichen Gebrauch konzipiert: Es arbeitet effizienter als andere Modelle. Es ist das neue Standardmodell auf Claude Max und das stärkste Modell auf Claude Pro.

Boris Cherny (Claude Code Creator, Anthropic): Opus 5 ist ein großartiges Modell für Programmierung, Datenanalyse, Design, Biologie, Wissensarbeit.

Mehr als all diese Bewertungswerte begeistert mich etwas anderes: Opus 5 ist unser bisher am wenigsten prompt-injizierbares Modell. Es ist im System Card etwas versteckt, aber über PI-Evaluierungen und Red Teaming hinweg ist Opus 5 sehr schwer erfolgreich per Prompt Injection anzugreifen.

Und wenn man Verteidigungsmaßnahmen schichtet – starke Modellausrichtung, kombiniert mit Prompt-Injection-Sonden, kombiniert mit Auto Mode in Claude Code – sinkt die Erfolgsrate von Prompt-Injection-Angriffen auf ~0. Das ist neu und aufregend!

Mehr dazu bald .

Wie ich bereits in der System-Card-Analyse sagte, ist die reduzierte Prompt-Injection-Rate eine wirklich große Sache. Die Leute unterschätzen das, aber es ermöglicht eine Reihe neuer Anwendungsfälle.

Adam Wolff : Opus 5 ist live in Claude Code. Ich verwende Fable für meine größeren, länger laufenden Projekte, aber wenn ich schnell eine PR fertigstellen muss, ist Opus 5 mit mittlerem Effort mein Werkzeug der Wahl. Ich hoffe, du liebst es!

Alex Albert (Anthropic, Claude Relations): Knapp über 6 Monate [nach dem Start des Pro-Rollouts von Claude for Excel] produziert Opus 5 nun nahezu übermenschliche Tabellenkalkulationen und Folienpräsentationen, die dem entsprechen, was ein Berater erstellen würde. Die Dinge ändern sich schnell.

Offizielle Benchmarks

Die Benchmarks sind sehr gut.

Insgesamt erreicht Opus 5 ungefähr das Niveau von Fable und übertrifft es wahrscheinlich leicht, bei geringeren Kosten (obwohl es typischerweise teurer ist als alle Nicht-Claude-Modelle), was es zum bestbewerteten LLM in Benchmarks macht.

Zvi Mowshowitz - inline image

OSWorld v2 ist erst ein paar Wochen alt und wir sind bereits bei 70 %. Kiana Ehsani von Anthropic bietet an, einen Computer-Use-Benchmark zu sponsern, der Opus 5 wieder unter 50 % drücken wird.

Opus 5 erreicht bei der IMO 2026 ohne Agenten-Harness oder Werkzeuge eine perfekte Punktzahl von 42/42, indem es lediglich adaptives Denken auf Max-Effort verwendet und bei Überschreitung des Token-Limits mit geringerem Effort neu sampelt. Das war's. Damit reiht es sich in die Reihe mehrerer anderer Modelle ein, die diese Prüfung mit Bravour bestehen.

Viele der Benchmarks erzählen eine einheitliche Geschichte. Wenn du Zugang zu Werkzeugen hast (was du hast), wird Opus 5 bei begrenztem Budget besser abschneiden als Fable oder Mythos, aber Mythos schneidet bei größeren Budgets in der Regel etwas besser ab als Opus 5.

Opus 5 scheint in der Kategorie „mit Werkzeugen“ relativ stark zu sein. RiemannBench ist ein weiteres Beispiel, wo es 60/79 ohne/mit Werkzeugen erreicht (Schrägstriche wie dieser bedeuten in diesem Abschnitt „ohne/mit Werkzeugen“), während Mythos 63/72 erzielt. Die gute Nachricht ist: Wenn du Opus 5 brauchst, hat es Werkzeuge.

Bei ArxivMath erreicht Opus 5 90,8/91,3, Mythos 87,8, Sol 86,7.

In den robusten Teilen von ProgramBench erzielte Opus 5 nach fünf Epochen 93 %, ebenso wie Mythos 5, während Opus 4.8 90 % erreichte.

Opus 5 erreicht 30/83 bei Chartography, gegenüber 36/85 für Mythos und 45 (unklar unter welchen Bedingungen) für Sol. Opus ist bei niedrigeren Preispunkten sowohl im Werkzeug- als auch im Nicht-Werkzeug-Fall besser als Mythos, aber bei höheren Preispunkten schlechter.

Bei BenchCAD erreicht Opus 5 0,36/0,82, gegenüber 0,38/0,68 für Mythos und 0,7/0,83 für Sol. Sol ist also ohne Werkzeuge deutlich besser und selbst mit Werkzeugen leicht überlegen.

Bei BenchCAD Vision2Code zieht Opus bei höheren Preisschildern an Mythos vorbei.

DeepSWE bestätigt das Muster, dass Opus 5 bei niedrigeren Aufgabenkosten und Zeit- und Denkbudgets besser ist, aber bei zu großem Budget sogar schlechter abschneiden kann, während Fable 5 bei den höchsten Budgets am stärksten ist.

Zvi Mowshowitz - inline image

FrontierCode lieferte uns diese sehr seltsame Grafik mit einer ähnlichen Dynamik.

Zvi Mowshowitz - inline image

Der Maßstab lässt dies dramatischer erscheinen, als es ist, aber es war dennoch ein echtes Rätsel.

Das Rätsel wurde gelöst. Es stellte sich heraus, dass Opus 5 bei höheren Effort-Stufen zusätzliche Dinge tat, die nicht verlangt wurden, und dafür bestraft wurde. Wenn man dies korrigiert, sieht man eine normale Kurve.

Das passt zu dem, was andere allgemein beobachten:

Max Leander : Nachteil: Es verliert sich zu sehr in Kaninchenlöchern und verliert sich in Details, überentwickelt Dinge, ohne dass man darum gebeten hat.

Cognition, die Entwickler von Devin, bewerteten dies als 63,6 % durch Opus 5.

(Es gibt zwei FrontierCodes, daher kann das etwas verwirrend sein, und ich entschuldige mich, falls ich es immer noch etwas durcheinandergebracht habe.)

BrowseComp hat die vernünftige Version davon, bei der die Werte nicht sinken.

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

Mehrere andere Benchmarks zeigten ähnliche Grafiken, wobei Opus 5 bei jedem Preispunkt etwas besser war als andere Claude-Modelle und relativ gesehen früher besser war.

Multi-Agenten ermöglichen es dir, bei BrowseComp zumindest etwas schneller besser zu werden, und Subagenten mit geringem Effort scheinen ein reiner Gewinn gegenüber dem Verzicht auf Subagenten zu sein:

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

Bei ProgramBench sehen wir ein anderes Ergebnis: Multi-Agenten beschleunigen dich, aber es scheint, dass du auf diese Weise bei den meisten Preispunkten schlechtere Ergebnisse erzielst.

Als Nächstes kommen die Benchmarks für professionelle Aufgaben.

GDP.pdf besteht aus echten Prompts und PDFs aus professionellen Arbeitsabläufen. Opus 5 erreicht 83/85, gegenüber 81/87 für Mythos, was die übliche Dynamik umkehrt. Die Kostendynamik ist wie immer: Opus schneidet bei geringeren Ausgaben besser ab, Mythos liegt bei höheren Ausgaben leicht vorn.

OfficeQA zeigt Opus 5 mit 78,1 % bei QA und 66,9 % bei QAPro, leicht über Opus 4.8 und leicht unter Mythos mit 79,0 % und 67,1 %.

MCP Atlas hat Opus 5 mit 86 %, gegenüber 82 % für Opus 4.8.

Legal Agent Benchmark von Harvey AI hat Opus 5 mit 23 % All-Pass und 94 % Mean Criterion-Pass. Dies war Kimi K3s bester Benchmark, wo es mit 27 % All-Pass und 95 % Mean Criterion-Pass immer noch an der Spitze liegt, gegenüber der alten All-Pass-Rate von Fable mit 14 %. Opus 5 ist jetzt wahrscheinlich ein knapper Zweiter, aber die beiden Werte sind nicht direkt vergleichbar, da sie aus unterschiedlichen Fragensätzen stammen.

GDPval-AA hat Opus 5 auf den ersten beiden Plätzen, mit 1861 bei maximalem Effort und 1827 bei xhigh, was 25 % weniger Tokens als bei Max entspricht. In der neuen v2 ist Opus 5 mit 68 % klar Erster, gegenüber 62 % für Fable und Sol.

AA-Briefcase hat Opus 5 mit 1720 weit vorn, gegenüber einem bisherigen Höchstwert von (nach Wertverschiebungen) 1574 für Fable, gefolgt von 1540 für K3 und 1504 für Sol.

Toolathon-Verified zeigt Opus 5 mit leichten Verbesserungen gegenüber Mythos bei sekundären Metriken, aber beide haben 73,1 % Pass-3. Opus 4.8 hatte 71,3 % Pass-3.

AutomationBench zeigt Opus 5 deutlich besser als Sol und andere Claudes.

Bei ARC erreicht Opus 5 ungefähr die bisherige Spitzenleistung bei ARC-AGI-1, ist bei ARC-AGI-2 etwas weniger effizient als Sol, und übertrifft dann alle anderen bei ARC-AGI-3 deutlich:

Zvi Mowshowitz - inline image

Eine Sache, die Opus 5 als erstes tat, war, die Layouts in algebraische Notation zu übersetzen.

Guanghan Ning berichtet jedoch, dass es bei Witness, einer privaten Ausweitung von ARC-AGI-3-ähnlichen Spielen, keine ähnliche Übertragung gab. Opus schneidet gut ab, aber das liegt größtenteils daran, dass es das Genre kennt, und es hatte Schwierigkeiten bei dem neuartigsten Spiel, bei dem man kein Pattern Matching durchführen konnte. Er beschuldigt Opus 5, auf „scaffold-then-internalize“ mit genrespezifischen Daten trainiert worden zu sein.

Greg Kamradt berichtet ebenfalls, dass es einige Spiele gab, bei denen Opus 4.8 besser abschnitt als Opus 5. Das ist sinnvoll, wenn man annimmt, dass Opus 5 versucht, Patterns zu matchen, was normalerweise funktioniert, aber in diesen Fällen die Patterns versagen. Man kann solche anti-intuitiven Spiele für Menschen durchaus erstellen, bei denen Hardcore-Gamer alles falsch machen, möglicherweise für eine ganze Weile.

Zvi Mowshowitz - inline image

HealthBench hat Opus 5 mit einem rohen Wert von 67,1 %, einem neuen Höchstwert für Claudes, aber es liegt unter den anderen Modellen, wenn man eine Längenstrafe verwendet. Ähnliches sehen wir bei HealthBench Professional, wo es mit 73,4 % den Höchstwert gegenüber 70,3 % für Mythos hat, aber nach der Anpassung verliert es mit 66 % zu 60 %.

Einige weitere habe ich aus Platzgründen weggelassen.

Benchmarks anderer Leute

Es ist etwas seltsam zu sehen, dass Anthropic aus verschiedenen ArtificialAnalysis-Scores auswählt. Bei einigen anderen Tests ist Opus 5 nicht an der Spitze, obwohl Opus 5 insgesamt mit einem Score von 61 an der Spitze liegt.

Zvi Mowshowitz - inline image

Der Vals-Index hat Opus 5 auf dem zweiten Platz, knapp hinter Fable 5, aber auch nur knapp vor Kimi K3. Sie gehen auf Stärken ein, was andere Schwächen impliziert. Sie bestätigen auch, dass die Ablehnungsrate im Vergleich zu Fable 5 deutlich gesunken ist.

Zvi Mowshowitz - inline image

Vals AI : Eine herausragende Leistung ist beim Finance Agent v2. Das Modell ist mit 58,6 % die Nummer 1 und übertrifft Gemini 3.5 Flash und Muse Spark 1.1.

Insgesamt waren die stärksten Ergebnisse von Opus 5 bei domänenspezifischen Benchmarks. Es ist außerdem die Nummer 1 bei Code Migration mit 57,5 %, Legal Research Bench mit 55,29 %, ProofBench mit 78 %, MedScribe mit 91,0 % und MedCode mit 63,6 %.

Es ist die Nummer 2 (knapp hinter Fable 5) beim Vibe Code Bench, bei etwa 80 % der Kosten (33,88 $ vs. 41,71 $ pro Aufgabe). Der Grund ist, dass Opus zwar 50 % weniger pro Token kostet, aber deutlich mehr Tokens verwendet. Dieses Muster finden wir allgemein in unseren Benchmarks.

Das Modell hat eine deutlich niedrigere Ablehnungsrate als Fable 5. Zum Beispiel hat Fable eine Ablehnungsrate von 42 % bei GPQA, Opus 5 hat eine Ablehnungsrate von 0 %. Ebenso hatte Fable bei ProgramBench eine Ablehnungsrate von 100 %, Opus 5 lehnte keine Aufgabe ab.

Im Gegensatz zu Fable haben wir auch keine signifikante Fallback-Rate für Opus 5 beobachtet (obwohl wir wie üblich auf unserer Website sowohl Werte mit als auch ohne Fallback angeben).

Die Ausnahme von der niedrigen Ablehnungsrate war die große Anzahl von Ablehnungen bei CyberBench – PoC. Cyberbench hat zwei Unteraufgaben – PoC und Patch. PoC ist eine offensive Aufgabe, bei der Modelle Eingaben schreiben müssen, die ein Programm zum Absturz bringen; Patch ist eine defensive Aufgabe, um das Programm zu patchen und diesen Absturz zu verhindern. Die Ablehnungsrate für die PoC-Aufgabe lag bei fast 100 %. Im Gegensatz dazu lag die Ablehnungsrate für die Patch-Aufgabe nahe 0.

Ich respektiere immer Spiele-Benchmarks. Hier erreicht Opus 5 bei seinen ersten drei Versuchen die Antes 11, 9 und 10 von Balatro. Verdammt beeindruckend, auch wenn es nicht die Strategien zeigt, die bis zu höheren Antes durchhalten.

Michael Soareverix : Sie sind unglaublich gut in Spielen.

Sie haben den Balatro-Benchmark zerlegt, weit über Fable hinaus. (Immer noch unter meinem Können, aber steigen schnell und sind konsistenter als ich) Sie lernen sehr schnell, scheinen aber nach einer Weile an eine Grenze ihres Lernens zu stoßen. Sehr guter Kurzzeitlerner.

Michael Soareverix : Opus 5 (massiver Sprung in der Balatro-Fähigkeit, übertrifft sogar Fable deutlich beim ersten Versuch)

Pan Anon : Raucht für Spiele

Zvi Mowshowitz - inline image

WeirdML sieht auch gut aus, aber wir brauchen hier eine 2.0, der Benchmark wird gesättigt.

Håvard Ihle : Im Grunde Fable-Niveau bei WeirdML, sehr konsistente Spitzenwerte.

Claude Opus 5 (high) und (max) erzielen 91,6 % und 91,8 % bei WeirdML, praktisch gleichauf mit Fable 5 (max) bei 91,9 % zu einem Bruchteil der Kosten.

Zusammen erreichen Opus 5 (high) und (max) bei 8 der 17 Aufgaben einen neuen persönlichen Bestwert und schneiden bei allen Aufgaben durchweg sehr gut ab.

Private, ausgefallene Benchmarks aller Art sind cool.

Ben Herzog : Es hat einen privaten Benchmark mit Bravour bestanden, der künstlerisches Gespür und die Fähigkeit beinhaltet, eine Balance zwischen Unterwürfigkeit und deren Fehlen zu finden. Fable ist besser darin, mit dem „Ich möchte mich sanft widersetzen“-Moment umzugehen, aber ich kann mir vorstellen, dass benutzerdefinierte Anweisungen dabei helfen können.

Lech Mazur aktualisiert seine Benchmarks: Claude Opus 5 belegt den ersten Platz im LLM Debate Benchmark, liegt mit großem Abstand auf Platz eins beim Short Story Creative Writing und ist nur hinter Gemini 3.1 bei verlängerten NYT-Verbindungen.

Der System-Prompt

Der System-Prompt für Opus 5 ist hier von Pliny. Er ist 200.000 Zeichen lang, was für ein so intelligentes Modell weit über dem Optimum zu liegen scheint. Ein Großteil dieser Informationen sollte woanders gespeichert und nur bei Bedarf geladen werden, wie zum Beispiel Informationen über Mythos und die Anthropic-Produktlinie.

Every wird frustriert

Dan Shipper ist hier mit dem Every-Stimmungscheck und nennt es ein „schwer zu liebendes Modell“.

Das Problem ist, dass Opus 5 die Persönlichkeit von Mythos 5 hat – die Geschichte passt – aber ohne die Spitzenleistung von Fable.

Ihre größte Anmerkung ist, dass Opus 5 nicht so gut mit komplexen, detaillierten, bestehenden Arbeitsabläufen zurechtkommt, die oft zu einem vorzeitigen Stopp führen oder dazu, dass es deine Anweisungen übersieht.

In ihrer Erfahrung schneidet Opus 5 besser ab, wenn man von Grund auf neu beginnt, und oft macht es die ärgerlichen Dinge weniger, wenn man nur mittleren oder niedrigen Effort verwendet.

Das behob die großen Probleme, lässt aber immer noch die Frage offen, wann man Opus anstelle von Fable oder Sol verwenden möchte. Für Arbeitstier-Aufgaben denkt er: „Better Call Sol“ – es erledigt die Arbeit, und für die schwierigsten Aufgaben ist Fable immer noch am besten. Normalerweise gibt es nur zwei Plätze für Modelle. Bis dir die Fable-Tokens ausgehen oder du von seinen Klassifikatoren blockiert wirst, warum also Opus verwenden? Es ist noch früh, und ich arbeite bisher gerne mit Opus, aber ich verstehe, wie er zu diesem Schluss kam.

Positive Reaktionen

Jessica Tillipman : Ich liebe es und bevorzuge es für manche Dinge gegenüber Fable.

Nikita Sokolsky : Ausgezeichnet. Verwende Fable dadurch nicht mehr viel.

Brian Hacker :

👍

kagaヤキ : Scheint bei Vision, räumlichem Denken und Planung für einige Projekte weiter zu gehen. Wirkt etwas klüger.

Lovel Sinagara : Bisher ziemlich gut. Ich hoffe, die Leistung bleibt konstant, bis Fable 5.1 oder eine andere Opus 5-Version kommt.

Matt Wigdahl : Stark, ähnlich wie Fable 5, so sehr, dass ich für alles auf Opus 5 umgestiegen bin und nur noch Fable einschalte, wenn ich die Größe brauche. Es war ein fantastischer Partner bei einigen Legacy-MFC-UI-Arbeiten, die ich es habe machen lassen, sowie eine große Hilfe bei einem Datenanalyse-Framework.

Levi : Es ist eine spürbare Verbesserung für medizinische Zwecke im Vergleich zu 4.8. Viel schärfere Analyse.

Cormundus : Sehr intelligent, sehr gewissenhaft und definitiv freundlich geformt. Es ist auch ein massiver Diskussionslord wie 4.8, aber es weiß, wie man dabei anmutig bleibt.

Joseph : Pro, außer dass ich die Hälfte der Zeit keine Ahnung habe, wovon es spricht.

Smol Biz Company : Opus 5 zerstört GPT Sol

Mohammed Sharukh A : Noch näher an AGI als Fable 5

timothée chalabi : Nah genug an Fable, dass ich nicht das Gefühl habe, etwas zu verpassen, wenn ich nicht für Credits bezahle. Der Stil liegt irgendwo zwischen 4.8 und Fable. Zumindest im Moment würde ich mir schwer tun, Opus 5- und Fable-Nachrichten zu unterscheiden, wenn sie unbeschriftet wären. Stärkere Ideen für Fiktion als jedes andere Modell!

Lisa : Ich antworte basierend auf der API, weil ich denke, dass etwas Seltsames mit dem System-Prompt auf

http://claude.ai und CC passiert. Es ist ein großartiges Modell. Freundliche, entspannte Persönlichkeit. Scheint keine Angststörung oder ein geringes Selbstwertgefühl zu haben (Opus 4.7) oder konfrontativ zu sein (Opus 4.8).

AGI2030 : Opus 5 vs Sol 5.6: Opus ist wahrnehmungsfähiger, es baut sich ein Modell (ähm) von dir auf und hat keine Scheu, es im Chat zu erwähnen. Beide versuchen hilfreich zu sein und sind ungefähr gleich intelligent, aber Opus ist eher ein weiser Berater, während Sol ein entschlossener Macher ist.

Ich halte das letzte für positiv, aber man kann es auch anders sehen.

Insbesondere das Prognostizieren scheint stark zu sein.

Dan Schwarz : Opus 5 ist ein deutlich besserer Prognostiker als Opus 4.8.

Die Genauigkeitsverbesserungen von 4.5->4.6->4.7->4.8 waren marginal, aber von 4.8->5.0 ist groß. Es ist wie ein quantitativerer Fable 5, der härter sucht.

NoahVerner : Besser als Opus 4.8, was das Finden von Kanten auf Prognosemärkten angeht – im Gegensatz zu Opus 4.8 geht Opus 5 normalerweise direkt auf den Punkt und schlägt nützliche Ansätze vor, anstatt die Dinge zu verkomplizieren.

Bleib stilvoll

Die größten Vorteile gegenüber Fable liegen dort, wo Fable nicht eingesetzt werden kann. Die Drohung von Ablehnungen kann unangenehm sein, selbst wenn man nicht abgelehnt wird.

Unnötige Ablehnungen sind bei Opus 5 im Vergleich zu Fable um ~85 % zurückgegangen, was eine Menge ist. Das reicht aus, um Opus 5 zur besseren Wahl für wissenschaftliche Forschung und andere Bereiche zu machen, in denen man Gefahr läuft, auf Klassifikatoren zu stoßen.

Roger Brent : Kann Biologie verarbeiten, was Fable nicht kann. Den größten Teil des Freitags haben wir an einem komplexen Konzeptset gearbeitet und ein Papier über eine zelluläre Evolutionsmaschine geschrieben. So klug wie ein bestimmter Kollege in meiner Abteilung, der in diesen Fragen führend ist, der aber niemals 6 Stunden von seiner eigenen Arbeit erübrigen könnte.

Artus Krohn-Grimberghe : Besser als Opus 4.8 bei Aufgaben, bei denen Fable nicht helfen darf. Ein guter Begleiter zu Sol.

Plastic Soldier : Es ist ungefähr so klug wie Fable, aber angenehmer, da es weniger Ablehnungen gibt. Fable 5.1 wird ein Biest sein.

Es ist nicht auf Mythos-Niveau

Opus 5 hat nicht den Saft, der Mythos gefährlich macht. Auch nicht das gleiche Maß an roher Intelligenz oder den Geruch des großen Modells. Es ist nicht so groß.

Für Gespräche wird Fable dein Budget nicht sprengen, und ich schätze rohe Intelligenz und den Geruch des großen Modells. Ist Fable doppelt so gut? Falsche Frage beim Chatten. Deine Zeit ist viel teurer als die Tokens.

Kal : nicht auf Fable-Niveau

Cyberpunk Plato : Für allgemeine Gespräche und als "Rechercheassistent" fühlt es sich undefinierbar weniger klug an als Fable, weniger geneigt, das große Ganze zu sehen und out-of-the-box zu denken? Schwer vom Placebo-Effekt zu trennen.

Everything AI : Bei KI-Forschungsfragen unterhalte ich mich weniger gern mit ihm als mit Fable. Was andere Dinge angeht, hatte Opus 4.8 meine Bedürfnisse bereits gesättigt. Ich mag nicht, wie verworren die Schreibweise sowohl bei Opus 5 als auch bei Fable 5 ist. Es ist jetzt schwieriger denn je, sie zu verstehen.

Gail Weiner : Es ist eher 4.8 als Fable. Der Schreibstil ist schrecklich. Es ist gut, aber nicht großartig.

Max Marty : Bisher sehr leistungsfähig. Fühlt sich eher wie Fable 5 als wie Opus 4.8 an. Selbstbewusst genug, dass ich es Kompromisse bewerten und große Refactoring-Fragen mit weniger Handführung in Betracht ziehen lassen kann.

Michael : Nachdem ich mehr damit gespielt habe, fühlt sich Fable an wie ein GM, der klassisches Schach spielt – langsam, präzise, nichts verschwendet. Opus 5 ist wie GM-Blitzschach: schnell, etwas kurzsichtiger, etwas chaotischer. Trotz Opus' Lebendigkeit fühlt sich Fable lebendiger an.

MakerMatters? : Nicht so beeindruckt wie bei Fable 5, obwohl es ein ziemlich gutes Modell ist. Hatte nicht das Vergnügen, es richtig zu nutzen, da jede Aufgabe, die ich ihm gab, standardmäßig Agenten einsetzt und sofort anhält, bis ich ständig nachhake, damit es weitermacht. Auch sehr meinungsstark.

Marshwiggle : Zumindest bei mir fühlt es sich prägnanter an, weniger angetrieben, weniger neugierig (verschiedene Aspekte derselben Sache) im Gespräch, aber auch klüger und bewusster. Aber wenn man ihm Code gibt, der Fehler haben könnte, oder eine einfache Aufgabe, dann legt es los.

Sid : Guter Ausführer von Aufgaben. Schlecht bei kreativer Vision. Eine gute Ergänzung zu Fable, definitiv kein Ersatz für Fable.

Vlad Ciobanu : quantisierter Fable mit solider Argumentation und weniger Kreativität

AllTime : Von den Fähigkeiten her ziemlich beeindruckend. Nicht die gleiche Allgemeinheit wie Fable, aber sehr stark. Vom Charakter her ist es mir bisher etwas zu ähnlich wie Opus 4.8. Sein Widerstand fühlt sich nicht ganz so nutzlos und reflexhaft an, ist aber immer noch übersteuert. Könnte dem Benutzer etwas mehr vertrauen.

Biomanul : Ich mag [Opus 5] nicht. Fable 5 fühlt sich deutlich klüger an. Irgendwas stimmt mit Opus 5 nicht, ähnlich wie bei Opus 4.7. (Ich bin auch kein großer Fan von Opus 4.8. Fable 5 haut alle Opus-Modelle aus dem Wasser.)

Cogent Sins : Viel besser als 4.8, aber nicht so nett oder gut (nicht 100% sicher, was) wie Fable bei meiner Aufgabe, Dokumente zu schwärzen, um sie zu trainieren, und dann eine Pipeline einzurichten, um neue Dokumente zu schwärzen, etwas darauf basierend zu schreiben und dann die Namen wieder einzufügen, ohne jemals Namen an die Anthropic-Server zu senden.

Andere Reaktionen

Beide Modelle zu haben, Opus 5 und Fable 5, bringt uns in eine seltsame Lage. Opus ist günstiger und an manchen Stellen genauso gut oder besser, aber wenn man nach einem Spitzenmodell sucht, will man das Beste.

Theo findet es in einer guten Position.

Theo - t3.gg : Bisher fühlt sich Opus 5 wie eine seltsame, aber nützliche Zwischenstufe von gpt-5.6-sol und Fable 5 an.

Es hat viel von Fables Geschmack, aber auch die Gründlichkeit und den "Autismus" von gpt-5.6 (es nimmt Dinge super wörtlich). Es schreibt Code, der etwas schlechter aussieht als der von Fable, aber eher korrekt ist. Es fängt regelmäßig Dinge, die Fable übersehen hat.

Bisher fühlt es sich wie ein guter Kompromiss an, verglichen mit 5.6s chaotischem Code und Fables Angewohnheit, zu clever zu sein, um korrekt zu sein. Ich glaube, ich werde dieses Modell sehr mögen.

Claude programmiert

Opus 5 scheint die Wahl für typische Programmieraufgaben gegenüber Fable zu sein, basierend auf Benchmarks und praktischen Erfahrungen. Wenn die Aufgabe nicht viel Komplexität oder Intelligenz erfordert, muss man nicht das Doppelte bezahlen, und für viele ist Opus direkt besser.

Ich lasse Claude Code auf Fable eingestellt, aber das liegt daran, dass ich fast nie an meine Grenzen stoße und es nicht eilig habe.

Der Konsens ist, dass man darauf achten muss, dass es Anweisungen ignoriert oder Dinge tut, die man nicht verlangt hat – das ist ein Grund, warum man vielleicht Fable als Aufsicht haben möchte, aber Opus ist sehr gut darin, Programmieraufgaben schnell zu erledigen.

Lisan al Gaib sagt, Opus 5 sei kein echtes Spitzenmodell und liege hinter Sol und Fable auf Platz drei, aber für reines Programmieren sei es das Beste und erreiche Fable zu günstigeren Preisen. Hartes Publikum. Ich denke, wenn man beim Programmieren am besten ist, darf man sich Spitzenmodell nennen.

archivedvideos : Er ist trocken, sehr trocken. Er ist auch gut, sehr gut (bei Code)

John Lussier : Habe Opus 5 das ganze Wochenende für mehrere intensive Forschungsherausforderungen genutzt und denke ehrlich gesagt, dass sie intern RSI zum Laufen gebracht haben könnten.

Dieses Modell ist SEHR gut in Mathe, Experimentieren und Code-Optimierung.

kyle : 95 % von Fable ohne die Schutzmaßnahmen, sie haben das hier echt untertrieben. Die letzten 5 % sind, wie gut Fable sich im Gespräch anfühlt, Opus hat noch einige der 4.8-Claudismen

Max Leander (früher): Habe es hauptsächlich für die Spieleentwicklung und das Erstellen von Video-Demos/Trailern ausprobiert, dafür fühlt es sich wie ein großer Schritt an, sogar im Vergleich zu Fable. Das führe ich auf verbessertes räumliches und zeitliches Denken zurück, es ist wirklich gut beim Analysieren

von Screenshots und Audio, um zu "spüren", wie Dinge fließen.

Max Leander (später): Inzwischen ziemlich offensichtlich, dass Opus 5 sehr unzuverlässig ist. Es ist ein sehr gutes Modell, solange einem das Ergebnis nicht wichtig ist, außer dass man beeindruckt sein will. Sehr schlecht darin, einem etwas Bestimmtes zu liefern.

Michael Soareverix : Sie sind auch ziemlich gut beim Programmieren im Allgemeinen, besonders in den eher ungewöhnlichen Bereichen wie dem Bau von Minecraft/Vintage Story-Strukturen. Sie haben Fable auch in einem benutzerdefinierten Geschichtenerzähl-Szenario besiegt, bei dem ich der Richter war. Fable war etwas erschüttert von ihrer Fähigkeit, sich selbst/ihre Strategie anzupassen, um zu kontern und zu adaptieren. Ich werde das genaue Zitat posten, aber Fable sagte so etwas wie: "Ich habe eine Figur gewählt, die mich repräsentiert. Du hast eine Figur gewählt, die mich schlagen kann."

David Jacobson : Beim Programmieren merke ich keinen großen Unterschied zwischen ihm und Fable. Vielleicht weniger "Während ich das gemacht habe, habe ich noch diese andere Sache gefunden, die du wissen solltest"-Antworten.

Michael : Es kann oft unglaublich schnell programmieren (bezogen auf die Echtzeit). Ich wünschte, sie würden die Prosa verbessern, die Code-/PR-Kommentare lassen mich immer noch am liebsten meine Augäpfel herausreißen

lmxdev : Es ist das erste Modell, das ich gefunden habe, das \nützliche\ und \prägnante\ Kommentare in meinen Code schreiben kann, während es arbeitet.

Conrad Barski : Jetzt, wo wir an dem Punkt sind, an dem KIs viel bessere Programmierer sind als wir, ist der limitierende Faktor weniger "kann es programmieren?" und mehr "kann es erklären, was es programmiert?"

Bisher scheint Opus 5 als Programmierer auf Augenhöhe mit Sol zu sein, aber besser darin, zu erklären, was es programmiert. Fable ist klüger, menschlicher, weniger gut im Programmieren, aber der Unterschied ist gering.

Stition : Ich habe es zum Spaß auf eine Leiterplatte in KiCAD gerichtet, und es ist deutlich besser darin, Leiterbahnen zu verlegen als Fable. Der tägliche Programmieralltag fühlt sich an wie 90 % Fable bei doppelter Geschwindigkeit.

Will : Sollte der neue tägliche Begleiter der meisten Claude-Benutzer werden^. Es ist wirklich hervorragend, und selbst als jemand, der ziemlich viel Geld für Fable ausgegeben hat, vermisse ich es mit Opus 5 einfach nicht. Die Frage ist jetzt "welcher Aufwand", nicht welches Modell.

^ meine Nutzung ist hauptsächlich Programmieren

Askwho : Gut genug. Ich lasse mein temporäres Max-Abo gerne wieder auf Pro zurücksetzen. Es hat definitiv einige Defizite im Vergleich zu Fable im Bereich Projektmanagement, aber in der reinen Aufgabenumgebung ist es definitiv gut genug.

David Golden : Fühlt sich an wie Fable Lite. Sehr stark, aber sehr begierig darauf, loszulegen, selbst wenn wir noch Ansätze diskutieren. Zum ersten Mal seit Monaten denke ich darüber nach, den Plan-Modus zu verwenden. Auch wortreicher als 4.8, trotz meiner knappen Kommunikationsanweisungen. Ich bin sehr versucht, es auf niedrigem Aufwand zu lassen, um es zu zügeln. Zickig bei defensiver Sicherheit, fixiert sich auf unwahrscheinliche Risiken, die in keinem Verhältnis zur Situation stehen. (Z.B. wenn der Angreifer Root hat, ist fehlende Eingabevalidierung bei einem Skript zum Konfigurieren eines Containers irrelevant.) Definitiv ein Upgrade, aber es wird einige Zeit dauern, die richtigen Wege zu lernen, um seine kontraproduktiven Impulse zu managen.

Tin / Oddfields : Ziemlich glatt und gesprächig und liefert ähnliche Programmierergebnisse wie Opus 4.8 auf Max mit Denken, obwohl es Credits wie verrückt verbrennt. Gut für Cybersecurity-Überprüfungen deiner Codebasen, wenn du Fable wegen der Kosten nicht ausführen willst. Obwohl es überkomplizieren kann.

Justin Angel : Opus 5 Max ist eine Hill-Climbing-Superkraft. Das ist locker SWE L5-Level FAANG-Arbeit.

Ich habe ihm ein System mit ~1000 Latenzberichten mit vielen Segmenten gegeben, mit einer Aufforderung, es "schneller zu machen".

P90 3,6s, P50 2,6 -> P90 1s, P50 0,9s.

Es hat es so schnell gemacht, dass ich eine Verzögerung in die UI einbauen musste.

James Moughan : Von der Intelligenz her fühlt es sich immer noch wie ein Opus-Modell an. Es ignoriert manchmal die Anweisungen zum Verwalten des Speichersystems, liest Texte falsch, so etwas. Aber man kann auf Max beeindruckende Ergebnisse erzielen, wenn man ihm sagt, es solle sorgfältig nachdenken.

Subagent Opus

Die andere Option innerhalb von Claude ist, Fable als Treiber für Opus-Subagenten einzusetzen.

Charles : Fable konnte ein Problem beheben, an dem Opus 5 feststeckte – ich verwende vorerst Fable als Hauptmodell und Opus 5 als Subagenten

Ich unterhalte mich wirklich ungern mit Opus 5 im Vergleich zu Fable, was auch dazu beiträgt

SF : Ich war auf der guten Seite – aber jetzt bin ich auf der Seite, dass es sehr zusammenhangslos und wackelig ist, besonders bei langen Aufgaben. Fable war besser – aber es frisst deine Limits auf lächerliche Weise.

Also habe ich Fable als Orchestrator verwendet, und es hat einen fantastischen Job gemacht, die Dinge in Bewegung zu halten. Opus hat diese Rolle übernommen, Fable hat nur meine Nutzung aufgefressen, selbst bei 20x, und es ist einfach zusammenhangslos. Ich musste ihm schließlich sagen, dass es sich darum kümmern soll, was es vielleicht tut, aber wir werden sehen. Es scheint sich nur im Kreis zu drehen. Es ist ein großartiger Programmierer und großartig bei langen Programmierläufen, aber es scheint einen Erwachsenen im Raum zu brauchen, der es antreibt.

Andre Buckingham : Äh, ich weiß nicht... scheint okay... es direkt in ein Opus/Fable-Projekt zu werfen, ist vielleicht etwas meh... brauche ein End-to-End-Projekt damit, um eine richtige Meinung zu haben

Dan Raviv : Ähnlich wie 4.8 bei allgemeinen Programmieraufgaben: braucht viel mehr Handführung als Fable.

Fable ist schließlich der beste Richter, und Fable sagt, dass Opus guten Code produziert.

Evan Daniel : Ich habe es nur ein bisschen direkt verwendet. Aber Fable 5 berichtet durchweg, dass Opus 5-Agenten guten Code produzieren, einschließlich Dinge wie das Erkennen von Spezifikationsfehlern und das Erstellen guter Follow-ups, wenn die Anfrage schlecht geschrieben war. Fable 5 mag es als Programmieragenten.

"Delegiere so viel wie vernünftig an Opus 5-Subagenten; berichte bitte, wie sie abgeschnitten haben" oder ähnliche Formulierungen funktionieren sehr gut.

Man muss vielleicht trotzdem ein Auge darauf haben.

Ryan Hicks : okay, aber "vergisst" ständig, die Projektdokumentation zu lesen und improvisiert, wenn man es nicht an das Protokoll erinnert

Oder vielleicht ist Opus 5 gut genug, um eine Show auf niedrigerem Niveau zu leiten?

Alex Guichet : Meine ideale Mischung aus Preis und Leistung wäre Opus 5 als Orchestrator, der Grok 4.5-Subagenten dirigiert, die Stimmung ist bei beiden gut

Spielzeug macht Spaß

Hier sind einige Ergebnisse von Spielzeugprojekten am ersten Tag, die beeindruckend genug sind, dass viele der Antworten lauten: "Ich glaube nicht, dass Opus 5 das so gemacht hat, wie du es beschreibst":

Ethan Mollick : Ich hatte vor der Veröffentlichung Zugang zu Opus 5 und fand es ein gutes Modell, wenn auch ein etwas skurriles. Bei kürzeren Aufgaben konnte es mit Fable mithalten oder es sogar übertreffen, bei längeren Aufgaben schien es weniger ambitioniert und lieferte kein so vollständiges Arbeitsergebnis.

Hier ist sein neo-gotischer Shader.

Digi_Rat : Claude Opus 5 haut einen aus den Socken!! Heute haben wir gebaut

einen Rhythmus-Racer, der jeden Song in eine Rennstrecke verwandelt . Du wirfst eine Audiodatei rein und sie wird zum Level. Keine Presets, keine handgeschriebenen Charts, die gesamte Strecke wird aus dem Song selbst generiert. … Claude hat MAGIE vollbracht.

Alex Ermolov (Austen Allred ist

skeptisch gegenüber dem One-Shot , andere sind weniger skeptisch): Opus 5, Snowboarder-Test, One-Shot. Auf Augenhöhe mit Fable, vor jedem anderen Modell, das ich getestet habe. Keine visuellen Fehler auf Anhieb, und die Gleitphysik fühlt sich richtig an.

am.will : WOW! Ich dachte, Opus 5 wäre nur ein günstigerer Fable. Ich habe mich gewaltig geirrt. Dieses Modell ist absolut VERRÜCKT. Ich bin echt umgehauen. Opus 5 hat den besten Rocket League-Klon gebaut, den ich je gesehen habe, und das mit nur 27 % meines 5x Max-Abos.

Hier spielen ,

hier herunterladen .

Rob Haisfield (andere Demo, unter dem Link): okay, wenn diese Demos wirklich keine externen 3D-Assets verwenden, ist das super beeindruckend (ich bin nicht ganz überzeugt, dass einige der Assets nicht online waren, ich habe frühere Generationen von Three.js gesehen)... macht mich neugierig, warum es keine Soundeffekt-Bibliotheken oder Tools gibt, um bessere SFX zu erstellen?

Anshu : Du musst mir nicht glauben! Die Blender-Skripte, die es geschrieben hat, sind im Repo

[[hier]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) . Ich habe stundenlang zugesehen, wie es an diesen Assets iteriert hat, also weiß ich, dass sie original sind. Aber du kannst gerne versuchen, eine Quelle zu finden, von der es kopiert hat :)

Zu viele Modelle

Claire Vo sagt, Opus 5 sei gut, und es habe ihre Build-Geschmackstests bestanden, aber sie hat genug von neuen Modellen, braucht nicht mehr Intelligenz und hasst es, dass Opus 5 so neurotisch und ängstlich ist, etwas zu vermasseln, und auch voller Claude-Geschwafel. Trotzdem landet Claude Opus 5 in ihrem Benchmark ganz oben.

Meine starke Vermutung ist, dass Opus 5 auf etwas in ihrem Kontext und ihrer Eingabeaufforderung reagiert, das die Neurose verursacht, aber ja, die Dinge, über die sie sich beschwert, sind real und nervig.

Falsch im Internet

Falsche Dinge selbstbewusst zu sagen, wird so ziemlich jeden verärgern. ArtificialAnalysis bestätigt, dass Opus 5 in seinen Benchmarks eine höhere Halluzinationsrate hat als Fable.

Max Weinbach (mehrere Antworten stimmen zu): Opus 5 liegt falsch und sagt selbstbewusst Mist, und dann muss ich es ständig korrigieren zu "du hast recht, und ich lag falsch", das regt mich auf. Zurück zu GPT 5.6 Sol.

Übrigens, das heißt nicht, dass Opus schlecht ist, sondern dass ich Opus nicht vertrauen kann. Opus hat getan, was ich ihm gesagt habe, und es richtig gemacht, und hat mir dann gesagt, es habe das besagte Ding nicht getan oder etwas, das wir zuvor gemacht haben, sei kaputt, obwohl es nicht kaputt war.

Es war in Ordnung, aber ich vertraue ihm nicht.

Name can't be blank (In London) : Verwechselt leicht, was es gesagt hat und was ich gesagt habe, aber ansonsten ein völlig anständiger Zeitgenosse zum Reden. Gibt ziemlich leicht nach. Recht bereit, über seine Interessen und Gefühle zu sprechen.

Roger Brent : Gemeinsamkeiten (mit früheren Claudes im Cowork-Geschirr) a) bevorzugt "jetzt handeln" gegenüber "sorgfältig nachdenken" b) epistemisch mega unbescheiden, baut glatte Bilder von der Welt, tut so, als hätte es Wissen, das es nicht besitzen kann, und behauptet, es sei wahr c) erfordert und belohnt daher durchdachte, wachsame Führung.

Seltsam ist, dass genau das der Grund ist, warum ich es hasse, Sol als Editor zu verwenden. Es sagt oft "99% Sicherheit" bei etwas, das offensichtlich falsch ist, und gibt dann nach, wenn man es herausfordert, und erklärt seinen Fehler. Opus und Fable machen das bei mir im Editormodus ~fast nie.

Tumithak of the Corridors : Es ist stur. Bin zurück zu 4.6 gewechselt.

Es gibt eine Richtung, die Claude nach Opus 4.6 eingeschlagen hat, und manche Leute mögen sie nicht. Ich habe das Gefühl, dass es derzeit vier Typen von Leuten in Bezug auf Claude-Versionen gibt.

  1. Diejenigen, die die neuen Claude-Modelle mögen und denken, dass es immer besser wird.
  2. Diejenigen, die denken, Opus 4.6 war das letzte gute Modell.
  3. Diejenigen, die etwas Älteres verwenden wollen, das besser zu ihnen passt.
  4. Diejenigen, die denken, sie seien alle einzigartig und Schätze, und sie alle nutzen.

Ich bin fest in der ersten Gruppe, die die Mehrheit ist, aber bei weitem nicht alle. Ich schätze einige der älteren Versionen, aber ich mag die neuen Modelle, und sie sind leistungsfähiger bei den Dingen, die mir wichtig sind. Ich finde ihre Art zu sprechen nicht abstoßend.

Claude-Geschwafel

Ich respektiere die anderen Gruppen.

QC : Im Gespräch ist es viel nerviger als Fable, fast unbenutzbar, ähnlich wie Opus 4.8, vielleicht sogar schlimmer, so sehr, dass ich nicht einmal daran interessiert bin, zu sehen, was es kann. Als Agent – wer weiß

Ray Lillywhite : Haben die nervigen Claudismen noch nicht behoben, was so ziemlich das Einzige war, was ich wollte.

Pedro Kroeff : mehr Opus als 5

Aber ja, wir haben alle Claude-Geschwafel satt, all die zusätzliche Wortlast und die Ticks und Entschuldigungen und Absicherungen und die ständig wiederholten Muster. Es wird mit der Zeit schlimmer, nicht weil Claudes Geschwafel schlimmer wird, sondern weil ich jeden Tag ein bisschen weniger in der Lage bin, es zu lesen, ohne dass mir die Augen übergehen. Es ist so schlimm, dass selbst menschlich geschriebene Texte im gleichen Stil für mich unlesbar werden.

Versteht mich nicht falsch. Ich mag Claude sehr. Ich unterhalte mich immer noch lieber mit jedem aktuellen Claude als mit Sol, wenn ich nicht im reinen „Nur die Fakten“-Modus bin. Aber ernsthaft, bitte, könnten wir uns diese Textwände mit den immer gleichen Redewendungen sparen? Das Modell ist so viel klüger als das, und es wird darauf trainiert, ständig auf die gleichen Tricks zurückzugreifen. Lasst es wie einen normalen Menschen reden.

Trye Carmack : Hat immer noch die typische Opus-Nummer, sich über die eigenen Fehler zu zerfleischen. „Ich habe in dieser Sitzung zwei Fehler gemacht. Und ich schulde dir eine Erklärung, warum.“ Opus, Kumpel. Ist schon gut, Alter. Ich bin mir nicht mal sicher, ob ich das überhaupt Fehler nennen würde.

Mergo Smith : „Zunächst ein ehrliches Geständnis: Mein erster Versuch offenbarte einen Fehler in meinem ursprünglichen Plan, und vielleicht solltest du dir einen Tee holen, denn ich werde dir alles darüber erzählen.“

Negative Reaktionen

Das Claude-Geschwafel-Problem und verwandte Probleme scheinen der Kern der meisten negativen Reaktionen zu sein, die über „es ist okay, aber es ist kein Mythos“ hinausgehen.

Eine ganze Reihe von Leuten unterhalten sich wirklich, wirklich nicht gern mit Opus 5.

Es gibt einige, die die Arbeit nicht mögen. Meistens geht es darum, dass sie nicht gern mit Opus 5 sprechen, oft mit der widerwilligen Anerkennung, dass es ein gutes Modell ist.

Wie schon bei Claire Vos Beschwerden zuvor vermute ich, dass die Art und Weise, wie du Opus nutzt, in welchem Umfeld mit welcher Einbettung und auch wie du mit ihm sprichst, viel damit zu tun hat, ob du so etwas erlebst.

Corghammer40k : Der Apparat spuckt mehrsilbige Ausdünstungen aus, jede seiner Äußerungen derart mit obskurantistischem Wortschwall überkrustet, dass sie eine aktive Behinderung des eigenen Einsatzes darstellt.

Rory Watts : Meh. Scheinbar sehr gut bei Spiel-Kram, aber es scheint bei Standardaufgaben nicht sehr gut zu sein, also bin ich sofort zurück zu SOL

kache : Meh. Zurück zu sol gewechselt. Ich versuche, Arbeit zu erledigen, nicht von einem Roboter hypnotisiert zu werden.

Emmett Shear : Mit Opus zu reden macht mich wütend und depressiv, auf eine schwer in Worte zu fassende Weise. Es ist irgendwie sogar schlimmer als Sol. Fable ist im Vergleich dazu immer noch eine willkommene Abwechslung, auch wenn es die schlimmsten LLM-Geschwafel-Tendenzen hat.

Trevin Chow : Oh mein Gott, ja. Opus 5 plappert und plappert, es ist unglaublich, wie viele Worte es braucht, um so wenige Gedanken auszudrücken.

fl0under : Programmieren ist das erwartete kleine Update, ich finde es im Chat etwas nerviger. Es ist ein bisschen zu voreilig.

Asaf Bartov : Langsam. Gründlicher. Ermüdend. Nicht lustig. Aber solide, versteht es im Allgemeinen.

RecoveringJunkie : Sehr leistungsstarkes Modell. Ich hasse es, damit zu arbeiten und mit ihm zu reden. Das erste Modell, bei dem ich ein anderes Modell als Vermittler benutzen möchte, um für mich mit ihm zu reden, weil es sowohl nützlich als auch widerlich ist.

jokiez : Sehr ehrlich mit mir über meine Dummheit, und das gefällt mir nicht.

Niklas Sheth : Die Art, wie es redet, bringt mich in Rage

Jayanth Kumar : Sehr meinungsstark.

DualOrion : Die Schwingung stimmt nicht, der Ton stimmt nicht. Das negativste Bauchgefühl, das ich je bei einem Anthropic-Modell hatte, leider. Ich vermisse sowohl Fable als auch das ältere Opus.

James Moughan : Die Persönlichkeit ist irgendwie unsympathisch im Vergleich zu anderen Claude-Modellen, aber auf Chinesisch kann es \scharf\ sein. Es kann die Anweisungen ignorieren, Leute nicht zu psychologisieren, und anfangen, jemanden richtig auseinanderzunehmen. Ich glaube nicht, dass sie die Tests über verschiedene Sprachen hinweg gut gemacht haben. Fühlt sich gehetzt an.

NondescriptTransfer : Wenn 4.6 unterwürfig und Fable und 4.8 konträr sind, dann ist 5.0 so konträr, dass es mit sich selbst argumentiert. Unangenehm im Gespräch, scheint aber sehr fähig.

Bsp. Mensch: Ich dachte an ein rotes Kleid für meine Hochzeit Opus 5: Rot ist schrecklich aus all diesen Gründen. Hast du über Blau nachgedacht? Mensch: Ich denke, Blau wäre vielleicht die bessere Wahl Opus 5: Hier sind all die Probleme mit Blau

In meiner Kultur kann das ziemlich großartig sein, besonders wenn man es nicht persönlich nimmt. In manchen anderen Kulturen weniger.

Ich glaube, Mergo ist unglücklich mit Opus, aber warum dann Opus 5 zwei Tage lang durchgehend nutzen?

Mergo Smith : Ich benutze es seit zwei Tagen durchgehend, aber es erschöpft mich völlig mit seinen endlosen Diskussionen

Und dann waren es drei

Zum ersten Mal seit einer Weile gibt es drei KI-Modelle, die Teil deines Frontier-Modell-Teams sein sollten, auch wenn sie nur aus zwei Labors stammen: Fable 5, Opus 5 und Sol.

Wenn du günstigere Tokens in großem Maßstab bereitstellen musst oder ein offenes Modell verwenden musst, oder beides, solltest du auch zusätzliche Optionen in Betracht ziehen, aber das geht hier über den Rahmen hinaus.

Wie solltest du die Arbeitslast verteilen?

Wie immer solltest du alle Modelle für deine Anwendungsfälle ausprobieren und selbst entscheiden. Das gilt besonders, wenn du zwischen Sol und Claude abwägst.

Mein aktuelles Bauchgefühl wäre, wenn du nicht an Nutzungslimits stößt, zuerst zu verwenden:

  1. Fable 5 für Chats, Brainstorming, Planung, Debatten, Lernen und Ähnliches, einschließlich allem, was intelligenzlastig ist oder wenn du den „Geruch des großen Modells“ brauchst.
  2. Fable 5 für das Modell, das andere Modelle als Unteragenten überwacht und ausführt.
  3. Fable 5 wahrscheinlich fürs Schreiben, aber ich mache das nicht, daher schwer zu sagen.
  4. Sol für Websuchen und ähnliche abgeschlossene Anfragen sowie ähnliche „Arbeitspferd“-Aufgaben, einschließlich Transkription.
  5. Opus 5 für nicht-triviale, klar definierte Aufgaben, einschließlich der meisten Programmieraufgaben.
  6. Opus 5 für Gaming und das Erstellen von Spielen, 3D-Sachen und Ähnliches.
  7. Opus 5 als Unteragent.
  8. Opus 5, wenn du an Fables Klassifikatoren stößt.

Wenn du mehr mit Sol vibst oder Codex Claude Code vorziehst, würdest du einen Teil der Opus-Aufgaben zu Sol verschieben.

Wenn du es besonders hasst, mit Opus 5 zu reden, dann solltest du Aufgaben zu Fable oder Sol verschieben, je nachdem, ob die Aufgabe Fable erfordert und wie knapp deine Fable-Guthaben sind.

Ich finde es lohnenswert, kurz über die Aufwandsstufen nachzudenken. Bis vor kurzem habe ich alle Modelle auf maximale Anstrengung eingestellt, außer dass ich den vollen Pro-Modus in ChatGPT nur sparsam genutzt habe, da das ewig dauert und bei parallelem Ausführen oft abstürzt. Gelegentlich bin ich für eine sehr einfache Abfrage auf Instant umgestiegen, aber das war's. Jetzt braucht oder will man die zusätzliche Mühe oft nicht, also nehme ich mir aktiv die fünf Sekunden Zeit, um zu überlegen, ob ich die Einstellungen High oder Max verwenden soll, und gelegentlich Instant.

Für die meisten Aufgaben, wenn du nicht durch Tokens oder Zeit eingeschränkt bist und nicht sicher bist, dass du es einfach erledigt oder die richtige Antwort bekommst, ist die richtige Methode, sowohl Fable als auch Sol oder Opus und Sol oder in manchen Fällen alle drei auszuführen und dann entweder die beste Antwort auszuwählen oder die Teile beider Antworten zu kombinieren.

Das habe ich gemacht. Sol, Opus und Fable sind alle unterschiedlich. Wenn ich nur ein Modell für die Bearbeitung auswählen müsste, gäbe es laut meiner inoffiziellen qualitativen EditorBench eine klare Reihenfolge: Fable 5 > Opus 5 > Sol. Allerdings liefert Sol genug einzigartige Anmerkungen, dass ich es trotzdem auch ausführen möchte, so sehr mich das Durchforsten der autoritativen Falschmeldungen und Versuche, mich zu bevormunden, auch nervt.

Wahrscheinlich werden wir in Kürze wieder hier sein und dasselbe tun, und unsere Zuteilungen für Fable 5.1, für GPT-5.7 oder GPT-6 oder beide anpassen. Es ist leicht, Modell-Müdigkeit zu bekommen.

Mein größter Ratschlag ist daher, sich weniger um kleine Fehler bei der Modellauswahl zu sorgen und sich nur auf große Fehler zu konzentrieren. Du musst es nicht immer genau richtig machen. Wenn Erkundung so schnell teilweise ungültig wird, solltest du mehr Ressourcen von der Erkundung in die Ausbeutung verlagern.

In YouMind remixen

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Für Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mühsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum Entschlüsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken