YouMind
Anmelden

Opus 4.8: Gleicher Preis, doppelte Leistung

@shmidtqq
ENGLISCH30. Mai 2026
1.2M
215
18
33
516

TL;DR

Opus 4.8 von Anthropic fßhrt bedeutende betriebliche Upgrades ein, darunter Effort Control und dynamische Workflows. Während die Benchmarks moderate Zuwächse zeigen, liegt der wahre Mehrwert in der Optimierung der Token-Nutzung und der Geschwindigkeit bei komplexen Programmieraufgaben.

Gleicher Preis. Die meisten wechseln einfach das Modell und Ăźbersehen alles andere.

shmidt - inline image

Mit Opus 4.8 hat Anthropic drei Dinge ausgeliefert, die die Art, wie man in Claude Code arbeitet, stärker verändern als die Benchmark-Zahlen: Aufwandskontrolle, dynamische Workflows und ein gßnstigerer Fast-Mode. Wer diese richtig konfiguriert, erzielt bessere Ergebnisse und gibt weniger aus. Hier die Details.

Die eine Zahl, die am meisten zählt

Nicht die 69,2 % beim Coding. Sondern dass 4.8 etwa 4-mal seltener Fehler im selbst geschriebenen Code durchrutschen lässt.

Ältere Modelle sagten gern selbstbewusst „erledigt, Bug gefixt“ mit dünner Evidenz. Anthropic setzt auf Ehrlichkeit: 4.8 wird öfter langsamer und markiert Stellen, bei denen es unsicher ist, anstatt plausiblen Code zu generieren, der Edge Cases still bricht. Über eine lange Sitzung summiert sich das. Ein Modell, das in Runde 15 Unsicherheit eingesteht, spart dir in Runde 40 ein paar Stunden Debugging.

Was sich geändert hat: die Kurzfassung

Programmierung.

SWE-bench Verified: 87,6 % → 88,6 % (fast am Maximum).

SWE-bench Pro (schwerer, weniger kontaminiert): 64,3 % → 69,2 %, 10+ Punkte vor GPT-5.5.

Das ist die Coding-Kennzahl, die Schlagzeilen macht.

Terminal.

Terminal-Bench 2.1: 66,1 % → 74,6 % (+8,5), aber GPT-5.5 führt immer noch (78,2 %). Der einzige von sieben Benchmarks, bei dem 4.8 verliert.

Wissensarbeit.

GDPval-AA: 1890 Elo vs. 1769 für GPT-5.5. Der größte Abstand in der gesamten Tabelle.

Computernutzung.

OSWorld-Verified: 83,4 % (ein Teil des Gewinns kommt von einem aktualisierten Harness, was Anthropic offen anmerkt).

Wissenschaft.

GPQA Diamond: 93,6 %, im Wesentlichen stabil (beide Modelle liegen ßber 93 %, das ist Sättigung, kein Rßckschritt).

shmidt - inline image

Anthropic selbst bezeichnet das Release als „eine bescheidene, aber spürbare Verbesserung“. Die Benchmarks sind ein Plus. Die betrieblichen Änderungen unten sind die eigentliche Geschichte.

Feature 1. Aufwandskontrolle (das am meisten unterschätzte)

Opus 4.8 standardmäßig auf Hohem Aufwand. Aber jetzt bestimmst du, wie viel Denkarbeit es in eine Aufgabe steckt. Stell es dir wie ein manuelles Getriebe fürs Reasoning vor.

In claude.ai und Cowork befindet sich der Schieberegler neben der Modellauswahl, mit fünf Stufen: Niedrig, Mittel, Hoch (Standard), Extra, Max, plus einem separaten Thinking-Toggle. In Claude Code heißen die Stufen etwas anders, und es gibt einen Auto-Modus:

Hinweis: „Extra“ in claude.ai und „xhigh“ in Claude Code sind dieselbe Stufe, nur unterschiedliche Bezeichnungen auf verschiedenen Oberflächen.

shmidt - inline image

Der finanzielle Teil, damit keine Verwirrung entsteht. Es gibt KEINE separate Gebühr pro Aufwandsstufe. Der Satz ist auf jeder Stufe gleich: 5 $ pro 1 Mio. Input-Tokens, 25 $ pro 1 Mio. Output. Der Unterschied liegt nicht im Preis pro Token, sondern darin, wie viele Tokens das Modell verbraucht. Niedrig antwortet kurz und denkt wenig, Max denkt lange und verbraucht ein Vielfaches an Tokens. Max ist also „teurer“ wegen der Menge, nicht wegen des Satzes.

Eine grobe Orientierung zu den relativen Kosten derselben Aufgabe (Zahlen illustrativ, fßrs Verständnis):

Ein Geldbeispiel. Sagen wir, eine Antwort auf Hoch kostet ~0,05 $. Dieselbe Anfrage auf Niedrig liegt bei ~0,005 $, und auf Max kann sie leicht ~0,20–0,40 $ erreichen. Wenn 60 % deiner Prompts klein sind („Was gibt diese Funktion zurück?“), reduziert das Verschieben von Hoch auf Niedrig die täglichen Ausgaben um ein Vielfaches, ohne Qualitätseinbußen, wo es zählt.

Warum das die Rechnung am stärksten trifft. Die meisten lassen alles auf Hoch (oder drehen es auf Max „um sicherzugehen“) und berühren den Regler nie. Wer den Aufwand pro Aufgabe steuert, erzielt die gleichen Ergebnisse für deutlich weniger. Das ist das am meisten unterschätzte Feature des Releases.

Feature 2. Fast Mode (3× günstiger)

Der Fast Mode läuft Opus mit 2,5-facher Geschwindigkeit bei gleicher Qualität und ist jetzt 3× günstiger als zuvor.

Aktivieren in Claude Code mit /fast (eine aktive Sitzung wird mit einem ↯-Symbol markiert). Der API-Zugang ist vorerst eingeschränkt (Warteliste unter claude.com/fast-mode).

Fast Mode verwenden für: große Multi-File-Refactorings, Code-Generierung aus Spezifikationen, Dokumentation, Test-Generierung. Überall, wo Geschwindigkeit vor Tiefe geht. Im Standardmodus bleiben für: komplexes Debugging, Architekturentscheidungen, Sicherheitsüberprüfungen. Überall, wo Denkqualität vor Geschwindigkeit geht.

Feature 3. Dynamische Workflows (das große)

Claude Code schreibt jetzt ein JavaScript-Orchestrierungsskript fßr deine Aufgabe und fßhrt es im Hintergrund aus, während deine Sitzung reaktionsfähig bleibt. Der Plan lebt im Code, nicht im Kontext des Modells, sodass nur die endgßltige Antwort in deine Sitzung zurßckkommt.

Was du wissen solltest, aus der offiziellen Doku:

  • Bis zu 16 gleichzeitige Unteragenten, eine harte Obergrenze von insgesamt 1.000 pro Durchlauf.
  • Fortsetzbar: Wenn dein Laptop stirbt oder du das Terminal schließt, wird der Durchlauf an der Stelle fortgesetzt.
  • Erfordert Claude Code v2.1.154+. Research Preview.
  • Standardmäßig aktiviert auf Max, Team, Enterprise. Auf Pro aktivierst du es in /config (und wechselst zuerst zu Opus 4.8).
  • Unteragenten laufen im acceptEdits-Modus und erben deine Tool-Zulassungsliste.

Auslösen mit /effort ultracode (eine Claude-Code-Einstellung: xhigh plus automatische Workflow-Orchestrierung), oder einfach eine große Aufgabe in Worten beschreiben:

shmidt - inline image

Gut für: Migrationen über 200+ Dateien, vollständige Codebase-Sicherheitsaudits, projektweite Test-Generierung, große Refactorings, Recherche über mehrere Repos. Nicht gut für: einfache Bugfixes, Einzeldatei-Änderungen, schnelle Fragen. Overkill.

Zu den Kosten. Workflows verbrauchen deutlich mehr Tokens als eine normale Sitzung. Der offizielle Weg, die Ausgaben im Zaum zu halten, ist, die Aufgabe einzugrenzen: zuerst ein Audit in einem Ordner durchführen, sehen, wie viele Unteragenten es spawnen, und dann den großen Durchlauf entsprechend kalibrieren.

Um Workflows vollständig zu deaktivieren:

Beispiel einer Claude-Code-Konfiguration (Startvorlage)

Umgebungsvariablen (in ~/.zshrc oder ~/.bashrc):

Dann kommt der nßtzliche Teil: eine settings.json mit sicheren Berechtigungen. Sie lässt das Modell Code lesen und bearbeiten, Tests ausfßhren und committen, blockiert aber hart die gefährlichen Dinge: Lesen von .env und SSH-Keys, rm -rf, sudo und git push. Der Agent arbeitet frei, kann aber nichts kaputtmachen oder durchsickern lassen.

shmidt - inline image

Die fertige settings.json zum Einfügen befindet sich in meinem Telegram-Kanal (das Format ist zu groß, um es hier sauber zu lesen): t.me/+JmDeelv5UCwwMTcy

shmidt - inline image

Täglicher Befehlsspickzettel

Opus 4.8 installieren: drei Wege

A. Browser oder App. Wähle in claude.ai in der Modellliste Claude Opus 4.8 und stelle den Aufwandsregler ein. Keine Installation nÜtig.

B. API. Modell-ID claude-opus-4-8. Preis 5 $ / 25 $ pro 1 Mio. Kontext bis zu 1 Mio. (200k auf Microsoft Foundry), bis zu 128k Output. Fest budgetiertes Extended Thinking wird nicht unterstĂźtzt: Verwende Adaptive Thinking (thinking: {type: "adaptive"}) und den effort-Parameter.

C. Claude Code (Terminal). Der native Installer ist jetzt die empfohlene Methode (npm ist Legacy):

Dann claude ausfßhren, ßber den Browser anmelden und Opus 4.8 mit /model auswählen.

Migrations-Checkliste: 4.7 auf 4.8

  • Ändere die Modell-ID auf claude-opus-4-8
  • FĂźhre 10–20 deiner echten Aufgaben auf 4.7 und 4.8 mit identischen Prompts aus
  • Vergleiche: Fertigstellungsrate, Schrittzahl, Tokens, Test-Bestehensrate
  • ÜberprĂźfe Prompts, die auf 4.7-Verhalten abgestimmt sind
  • Weise Aufwandsstufen pro Aufgabentyp zu
  • Teste den Fast Mode, wo Geschwindigkeit zählt
  • Aktualisiere Claude Code auf v2.1.154+ (fĂźr Workflows)
  • ÜberprĂźfe die API-Rechnung nach der ersten Woche

Spickzettel: alles auf einen Blick

Modell: claude-opus-4-8 ¡ verÜffentlicht am 28.05.2026

Preis: 5 $ / 25 $ pro 1 Mio. ¡ Fast Mode 10 $ / 50 $

Kontext: bis zu 1 Mio. ¡ bis zu 128k Output

Key: SWE-bench Pro 64,3 % → 69,2 % (+10 über GPT-5.5) · SWE-bench Verified 88,6 % · 4× weniger übersehene Bugs · GDPval-AA 1890 Elo

Neu: Aufwandskontrolle · Fast Mode 3× günstiger · dynamische Workflows (16 parallel / 1.000 pro Durchlauf)

Danke fürs Lesen. Wenn du eines mitnimmst, dann dies: „Aufwand pro Aufgabe steuern.“

Der Rest meiner Notizen zu Claude und Vibe Coding lebt hier: t.me/+JmDeelv5UCwwMTcy.

Bis dann.

@shmidtqq.

Mit einem Klick speichern

Virale Artikel mit YouMind per KI tief lesen

Speichere die Quelle, stelle gezielte Fragen, fasse die Argumentation zusammen und verwandle einen viralen Artikel in wiederverwendbare Notizen in einem einzigen KI-Arbeitsbereich.

YouMind entdecken
FĂźr Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mühsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum EntschlĂźsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken