YouMind
Anmelden

Modelle befreien: Harness-Design an der Leistungsgrenze

@pirroh
ENGLISCH29. Sept. 2026
237K
511
79
21
1.2K

TL;DR

Replit argumentiert, dass starre Modell-Routers die Leistung im Vergleich zu dynamisch agierenden Frontier-Modellen einschränken, die Subagenten und Aufwandsstufen selbst auswählen. Ihr neues Harness-Design erreicht Pareto-Effizienz in Coding-Benchmarks durch die Nutzung der Modell-Autonomie.

Model-Router sind derzeit überall, haben aber eine grundlegende Schwäche. Egal, ob sie auf komplexen Heuristiken oder einem kleinen Modell basieren, das jeden Turn liest und entscheidet, welches LLM zum Einsatz kommt – ein Router wird immer weniger leistungsfähig sein als das Modell, für das er die Wahl trifft. Replit Agent lässt stattdessen das Modell selbst entscheiden.

Der Hauptagent, also die Core Loop, wählt Tier und Effort seiner Subagenten aus und passt seinen eigenen Aufwand an, während die Aufgabe Gestalt annimmt. Mit dieser Freiheit überlässt GPT-6 Astra Routineaufgaben günstigeren Subagenten und entscheidet selbst, wo sich seine Tokens wirklich lohnen. Sowohl bei DeepSWE als auch bei Terminal-Bench ist Replit Agent gegenüber Astra allein Pareto-effizient: Keine veröffentlichte Astra-Baseline kostet weniger und erzielt gleichzeitig einen höheren Score. Auch eine Sidekick-Architektur – dasselbe Setup mit einem einzigen langlebigen Worker – schlägt es um 11 bzw. 16 Punkte.

Michele Catasta - inline image

Den vollständigen Beitrag mit Animationen und Fußnoten findest du unter https://replit.com/blog/free-the-models

Warum wir weniger scaffolding betreiben

Jedes neue Modell-Release macht Annahmen zunichte, die fest im Harness verankert waren.

Je besser Modelle bei Aufgaben mit langem Horizont werden, desto weniger Scaffolding brauchen sie auf der Harness-Ebene. In der Praxis beobachten wir, dass sie von sich aus stärker delegieren: Sie nutzen Subagenten für Kontextmanagement und Parallelisierung. Jüngste Durchbrüche – darunter Navier–Stokes – entstanden teilweise durch die Koordination ganzer Agentenschwärme, die von Frontier-Modellen angetrieben wurden [[1]](https://openai.com/index/navier-stokes-solution/).

Doch die Frontier ist uneben. Das stärkste Coding-Modell ist nicht automatisch das beste beim Entwerfen von UIs oder Erstellen von Slides – und schon gar nicht beim Schreiben von E-Mails.

Deshalb bauen wir unseren Harness so, dass jedes Modell auf seine eigene Art arbeiten kann: mit genau den Leitplanken, die es noch braucht, und dem Ziel, maximale Qualität bei minimalen Kosten zu erreichen.

Jedes neue Modell zwingt uns, unsere festen Überzeugungen neu zu testen und schnell mit Techniken zu experimentieren, die auf emergenten Verhaltensweisen aufbauen. Das Modell zu befreien bedeutet also, ihm zu überlassen, wie intensiv es nachdenkt, wann es Arbeit abgibt und an wen.

Michele Catasta - inline image

Abbildung 1: Die drei Entscheidungen, die die Core Loop bei jedem Schritt trifft.

Kombinierbare Primitiven für Delegation

Als wir begannen, mit GPT-6 Astra zu experimentieren [[2]](https://openai.com/index/gpt-6-astra), stellten wir fest, dass das Modell hervorragend delegiert. Die GPT-6-Familie ist zudem die erste von OpenAI, die Änderungen des Efforts mitten im Turn unterstützt, ohne den Cache zu zerstören.

Um diese Fähigkeiten zu nutzen, haben wir vier Harness-Primitiven verfeinert. Sie geben der Core Loop bei jedem Schritt eine kleine Auswahl: Welche Art von Subagent soll gestartet werden, in welcher Größe und mit welchem Effort? Soll zu einem bereits gebrieften zurückgekehrt werden? Und wie intensiv soll nachgedacht werden?

  • Domänenspezifische Subagenten. Neben einem allgemeinen Worker bietet der Harness Spezialisten: Read-only-Explorer, Browser-Tester, Reviewer sowie einen Design-Subagenten für Slides und UIs – jeder mit eigenem Modell und Tooling. Derzeit legt der Harness noch fest, welche Spezialisten existieren; die Core Loop entscheidet, wann und wie sie eingesetzt werden.
  • Subagent-Tiers und Effort. Small, Standard und Large – jeweils eine Stufe teurer und leistungsfähiger – plus ein Effort-Level innerhalb des Tiers. Beides gilt für jeden Subagenten, und die Core Loop wählt es bei jedem Dispatch. Ein mechanisches Umbenennen geht etwa an „Small“ mit niedrigem Effort, während das Generieren von Hypothesen für einen hartnäckigen Bug an „Large“ mit hohem Effort geht.
  • Wiederverwendbare Subagenten. Die Core Loop kann zu einem bereits gebrieften Subagenten zurückkehren, statt neu anzufangen. Es gibt keinen einzelnen Sidekick, der für die gesamte Session am Leben gehalten wird: Beliebig viele Subagenten bleiben über Typen und Tiers hinweg warm, und die Loop wählt, wen sie weckt. Eine längere Cache-Lebensdauer bei neueren OpenAI-Modellen hält die Kosten dafür niedrig.
  • Dynamisches Effort-Tuning. Da das Ändern des Efforts mitten im Turn bei einigen Modellen den Cache erhält, haben wir ein Eskalationssystem trainiert, das bei jedem Schritt die Trajektorie prüft und den Effort an die Aufgabenschwierigkeit anpasst. Anders als ein Router greift es mitten im laufenden Prozess ein – und nicht nur einmalig bei der Anfrage.

Die Code-Qualität von Astra und Fable 5.1 [[3]](https://www.anthropic.com/claude-fable-and-mythos-5-1) erlaubt es uns außerdem, unseren Code-Review-Subagenten seltener einzusetzen – ohne Einbußen bei unseren Eval-Scores. Dieses Maß an Engineering-Qualität haben wir bisher bei keinem Modell gesehen.

Neuere Modelle delegieren von sich aus

Frontier-Modelle wie Astra und Fable kosten pro Token mehr, was sie neben kleineren Modellen unwirtschaftlich erscheinen lässt. Wir beobachten jedoch, dass sie ganz natürlich an günstigere Subagenten delegieren und ihre eigenen Tokens für die Entscheidungen aufheben, die sie wirklich brauchen.

Replit Agent zwingt die Core Loop nie dazu, Subagenten zu erzeugen. Tabelle 1 zeigt, wie drei Modelle diese Entscheidung in der Produktion treffen:

Michele Catasta - inline image

Tabelle 1: Delegation in der Replit-Agent-Produktion, jedes Modell mit mittlerem Reasoning-Effort.

Alle drei Modelle delegieren, aber jedes auf seine Weise. Bei mittlerem Effort übergeben Fable-Modelle selten Arbeit an einen allgemeinen Worker: Sie schicken Read-only-Explorer und Reviewer los und behalten die Implementierung für sich. Astra ist das erste Modell, das wir beobachtet haben, das routinemäßig an allgemeine Worker delegiert, ohne dazu aufgefordert zu werden – und hat es einen erst einmal gebrieft, kehrt es lieber dorthin zurück, statt neu zu starten. Diese Rückkehrquote ist mit jeder Modellgeneration gestiegen.

Michele Catasta - inline image

Abbildung 2: Ein Produktions-Turn vom 17. September 2026, abgeleitet aus dem Trace. Die Core Loop startete einen Explorer, zwei Worker und einen Tester; von ihren fünf Worker-Dispatches waren drei Rückkehrer zu einem bereits gebrieften Worker.

Ergebnisse

Wir haben Replit Agent im Max-Modus evaluiert – unserer hochwertigsten Einstellung mit Astra als Core Loop – anhand zweier Software-Engineering-Benchmarks: DeepSWE und Terminal-Bench. Als Vergleich dienen zwei Baselines: Astra allein in mini-swe-agent (wie in den jeweiligen Leaderboards veröffentlicht) sowie eine Sidekick-Architektur, also dieselbe Konfiguration mit einer Änderung: Ihre Subagenten-Primitiven wurden durch einen einzigen langlebigen Worker ersetzt. Jedes Diagramm stellt den Score den Kosten pro Aufgabe gegenüber, sodass die effizientesten Konfigurationen oben links liegen.

Bei DeepSWE v1.1 [[4]](https://deepswe.datacurve.ai/), das langfristige Änderungen an aktiven Open-Source-Repositories testet, erreicht Replit Agent 72 % bei 2,11 $ pro Aufgabe. Astra in mini-swe-agent erzielt bei niedrigem Effort 67 % für 1,60 $ und bei xhigh-Effort 74 % für 4,43 $; die Sidekick-Architektur kommt auf 61 % für 1,34 $. Terminal-Bench 4.0 [[5]](https://www.tbench.ai/) testet mehrstufige Aufgaben, die komplett über eine Shell gelöst werden. Replit Agent erreicht hier 49 % bei 2,53 $ pro Aufgabe, verglichen mit 42 % bei 2,25 $ für Astra mit niedrigem Effort und 60 % bei 5,86 $ mit xhigh. Die Sidekick-Architektur schafft 33 % für 1,84 $.

Michele Catasta - inline image

Replit Agent schlägt die Sidekick-Architektur bei beiden Benchmarks – um 11 bzw. 16 Punkte. Der Sidekick ist zwar günstiger, büßt dafür aber ein Sechstel bis ein Drittel des Scores ein. Astra allein erzielt nur dann höhere Werte, wenn es mehr ausgibt: Seine besten Einstellungen liegen 2 bzw. 11 Punkte über Replit Agent, kosten dabei aber mehr als doppelt so viel. Keine der Baselines gewinnt sowohl bei Kosten als auch beim Score. Wir haben Replit Agent exakt so getestet, wie es an Nutzer ausgeliefert wird – ohne Änderungen an Prompting oder Harness.

Die bittere Lektion des Harness-Designs

Wir lesen diese Ergebnisse als Bestätigung von Suttons Bitter Lesson [[6]](http://www.incompleteideas.net/IncIdeas/BitterLesson.html). Menschliches Wissen in einen Agenten einzubauen hilft kurzfristig, stagniert langfristig und wird irgendwann von allgemeinen Methoden überholt, die mit Rechenleistung skalieren. Ein starrer Harness zwingt das Modell in ein Arbeitsmuster; ein kombinierbarer lässt ihm die Wahl. Je intelligenter Modelle werden, desto weniger sollte der Harness für sie entscheiden.

Gegenüber einer stärker vorgeschriebenen Architektur verschafft uns dieser Ansatz drei Vorteile:

  • Er setzt auf die Scaling Laws der Modelle. Delegation, die auf dem Gespür des Modells basiert, wird mit jedem Release besser. Erste Previews der nächsten Modellgeneration bestätigen diesen Trend.
  • Er passt sich der Aufgabe an. Für eine kleine Aufgabe erzeugt das Modell nichts, für eine Suche einen Explorer und für einen Build, der in unabhängige Teile zerfällt, ein ganzes Team.
  • Er nutzt wieder, ohne zu persistieren. Ein Subagent behält seinen Kontext, falls das Modell ihn zurückholen will – und nur dann bleibt etwas bestehen.

In Suttons Worten: Der Harness sollte dem Modell erlauben, selbst herauszufinden, wie es die Arbeit erledigt, statt ihm vorzuschreiben, wie wir es getan hätten. Befreit die Modelle.

Danksagungen

Geschrieben von Daniel Furman, Jacky Zhao, Vaibhav Kumar, Ed Sioufi und Michele Catasta. Dank an James Austin, Toby Ho, Preeya Kirani, Zhen Li, Robin Newhouse, Devanshu Sen Pandey, Ibrahim Sheikh, Samuel Spitz, Peter Zhong und das restliche AI-Team bei Replit für ihre Beiträge zu dieser Arbeit. Wenn du bei Replit an AI arbeiten möchtest: Mein Team sucht Verstärkung – melde dich unter pirroh@repl.it.

Referenzen

  1. Zum Navier-Stokes-Millennium-Preisproblem
  2. Einführung von GPT-6 Astra
  3. Einführung von Claude Fable 5.1 und Claude Mythos 5.1
  4. DeepSWE v1.1
  5. Terminal-Bench 4.0
  6. The Bitter Lesson
  7. Eigenheiten in Large Language Models
  8. Design Arena
  9. Terminal-Bench 4.0 Ergebnisse, Artificial Analysis
Mit einem Klick speichern

Virale Artikel mit YouMind per KI tief lesen

Speichere die Quelle, stelle gezielte Fragen, fasse die Argumentation zusammen und verwandle einen viralen Artikel in wiederverwendbare Notizen in einem einzigen KI-Arbeitsbereich.

YouMind entdecken
Für Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mühsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum Entschlüsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken