Am 3. September 2026 veröffentlichte OpenAI GPT-6 Astra.
Viele stellen einfach die Modelleinstellungen ihres Codex auf Astra um und belassen es dabei.
Allerdings hat OpenAI an diesem Tag nicht nur das Modell aktualisiert. Die offizielle Ankündigung stellt klar, dass sie zusammen mit Astra auch das Codex-„Harness“ aktualisiert haben (Quelle: OpenAI „GPT-6 Astra: A new generation of intelligence“ https://openai.com/index/gpt-6-astra/ ).
Das Gehirn und die Umgebung, in der das Gehirn arbeitet. OpenAI hat beides gleichzeitig neu aufgebaut.
Wenn jedoch unklare Anweisungen oder widersprüchliche Regeln bestehen bleiben, kann Astra mitten in der Aufgabe anhalten oder ständig um Klärung bitten.
In diesem Artikel werde ich diese drei Dinge bereitstellen:
- Eine vollständige Erklärung der 8 Elemente, aus denen das Codex Harness besteht (mit Prioritäten)
- 4 Diagnose- und Bestandsaufforderungen, die Sie sofort kopieren und einfügen können
- Eine Ausführungssequenz, wo Sie heute in nur 30 Minuten beginnen können
Es hat keinen Sinn, zurückzuhalten, also teile ich zuerst die wichtigste Aufforderung. Diese Aufforderung veranlasst Codex, seinen aktuellen Projektstatus selbstständig zu melden.
▼ Kopieren Sie ab hier
Sie sind ein Codex Harness Designer.
Das Ziel ist es, einen Zustand zu schaffen, in dem GPT-6 Astra in diesem Projekt „Aufgaben sicher, reproduzierbar und zu Ende bringen kann, ohne jedes Mal detaillierte Anweisungen zu benötigen“.
Nehmen Sie zunächst keine Änderungen vor. Überprüfen Sie die aktuelle Projektkonfiguration, die Einstellungsdateien und die verfügbaren Funktionen und diagnostizieren Sie dann Folgendes:
- AGENTS.md: Sind der Zweck, die zu befolgenden Regeln, Verbote, Abschlussbedingungen und Referenzen klar?
- docs / context: Ist die Struktur so organisiert, dass Sie selbstständig die notwendigen Informationen finden können? Gibt es alte, redundante oder widersprüchliche Beschreibungen?
- Skills: Welche sich wiederholenden Aufgaben sollten in Skills umgewandelt werden? Welche Skills sind umgekehrt unnötig?
- MCP / Plugins: Welche externen Tools oder Datenverbindungen fehlen?
- Environment: Können Sie Abhängigkeiten, Einrichtung und Testausführung selbstständig reproduzieren?
- Permissions / Sandbox: Haben Sie übermäßige Berechtigungen? Gibt es umgekehrt zu viele ausstehende Genehmigungen, die die Arbeit blockieren?
- Hooks / Tests: Können Vorabprüfungen, Erkennung von Geheimnissen, Tests und Abschlussprüfungen automatisiert werden?
- Browser / Computer Use: Gibt es Aufgaben, die durch die tatsächliche Bedienung des fertigen Produkts verifiziert werden sollten?
- Subagents: Gibt es Aufgaben wie Recherche, Überprüfung oder Tests, die durch Parallelisierung schneller wären?
- Feedback Loop: Gibt es einen Mechanismus, um frühere Fehler oder Korrekturanweisungen zurück in AGENTS.md / docs / Skill / Hook / Test zu speisen?
Ausgabeformat: A. Bewerten Sie jedes Element auf einer 5-Punkte-Skala B. Die 5 kritischsten Mängel C. Dinge, die heute in 30 Minuten behoben werden können D. Dinge, die innerhalb einer Woche systematisiert werden sollten E. Zu erstellende/ändernde Dateien und konkrete Änderungsvorschläge F. Sicherheits-/Berechtigungsrisiken G. Priorität der Implementierung
Erfinden Sie keine Einstellungen auf Basis von Spekulationen. Überprüfen Sie die derzeit verfügbaren Codex-Funktionen und -Versionen, bevor Sie urteilen. Geben Sie klar an, ob Funktionen Experimental / Beta / Deprecated sind.
Nehmen Sie keine Änderungen an Dateien vor, erweitern Sie keine Berechtigungen und stellen Sie keine Verbindung zu externen Diensten her, bis ich diese Diagnoseergebnisse überprüft habe.
▲ Kopieren bis hierher
Wenn Sie dies ausführen, bevor Sie zu Ende lesen, sparen Sie später Zeit.
Zielgruppe und Verwendung dieses Artikels
Dieses Ziel ist Codex vom 7. September 2026. Codex wird schnell aktualisiert, überprüfen Sie daher vor dem Lesen das Datum.
Enthalten sind die 8 Harness-Komponenten, 7 Reifegrade und 4 kopierbare Prompt-Vorlagen.
Die Zielgruppe sind „Personen, die Codex verwenden, aber nach dem Schreiben von AGENTS.md aufgehört haben“. Ich werde bei der ersten Nennung Erläuterungen zu Fachbegriffen geben, damit auch Nicht-Entwickler dies lesen können.
Um sicherzustellen, dass der Artikel auch dann einen Mehrwert bietet, wenn Sie nicht alles lesen, habe ich für jedes Element eine „Priorität“ angegeben. Wenn Sie nur die mit hoher Priorität auswählen, wird zumindest ein minimales Funktionieren gewährleistet.
Was genau ist ein „Harness“?
Ein Harness ist ein System, das Modelle, Tools und Menschen verbindet, um Arbeit zu erledigen.
In OpenAIs technischem Blog „Unrolling the Codex agent loop“ (Januar 2026, Michael Bolin) wird das Codex-Harness als „die zentrale Agentenschleife und Ausführungslogik, die als Grundlage für alle Codex-Erfahrungen dient“ beschrieben (https://openai.com/index/unrolling-the-codex-agent-loop/ ).
Die Agentenschleife bezieht sich auf diese Wiederholung:
- Benutzereingabe empfangen
- Das Modell zum Nachdenken abfragen
- Das vom Modell gewählte Tool ausführen
- Das Ergebnis anzeigen und es erneut nachdenken lassen
Es ist die Codex-Seite, nicht das Modell, die diese Schleife ausführt.
Um einen Unternehmensvergleich zu verwenden:
Astra = Das Gehirn eines äußerst talentierten Mitarbeiters. Harness = Das Unternehmen selbst, in dem dieser Mitarbeiter arbeitet. Arbeitsregeln, internes Wiki, Betriebsanweisungen, Zugriffsrechte auf interne Systeme, Genehmigungsregeln, Inspektionsprozesse und Kollegen.
Ein häufiger Fehler ist es, „AGENTS.md = Harness“ zu vereinfachen. AGENTS.md ist nur ein Teil des Harness. So wie ein Unternehmen nicht allein mit einem verteilten Regelwerk läuft.
In der Praxis wird die gesamte Anstrengung, eine „komfortable Arbeitsumgebung“ zu schaffen, indem Elemente wie AGENTS.md, Skills, MCP, Hooks, Berechtigungseinstellungen, Ausführungsumgebungen, Browser und Subagents kombiniert werden, als Harness Engineering bezeichnet. Dieser Artikel verwendet den Begriff in diesem Sinne.
Was hat sich mit der Astra-Veröffentlichung tatsächlich geändert?
Es gibt drei Dinge, die alle offiziell von OpenAI bekannt gegeben wurden.
- OpenAI hat Gehirn und Umgebung gleichzeitig verbessert
Als Astra angekündigt wurde, gab OpenAI explizit an, das Codex-Harness aktualisiert zu haben, und berichtete, dass die Aufgabenerledigung im Mind2Web-Browser-Betriebsbenchmark im Vergleich zur GPT-5.6 Sol-Umgebung 1,9-mal schneller war.
In OSWorld 2.0 erreichte Astra 72,6 % im Vergleich zu GPT-5.6 Sols 65,7 %. Darüber hinaus wurde in Simulationsevaluierungen für die benötigte Zeit eine Reduzierung von etwa 75 Minuten auf etwa 40 Minuten pro Aufgabe gemeldet.
Hier ist Vorsicht geboten: Dies sind von OpenAI selbst veröffentlichte Zahlen und Benchmark-Ergebnisse unter bestimmten Bedingungen. Es gibt keine Garantie, dass es in Ihrer Umgebung 1,9-mal schneller sein wird.
Die Botschaft ist jedoch klar: Die Geschwindigkeitssteigerungen resultierten aus der Kombination von Modell und Ausführungsumgebung, nicht aus dem Modell allein.
- Astra liest „umgebende Anweisungen“ viel besser
Dies ist die effektivste Änderung für die praktische Arbeit.
OpenAIs Modellrichtlinie besagt, dass Astra zwar stärkere Fähigkeiten zur Befolgung von Anweisungen hat, aber auch empfindlicher auf Anweisungen in Dateien wie Skills und AGENTS.md reagieren kann. Es wird dringend empfohlen, Skills und andere Dateien, auf die das Modell zugreifen kann, zu überprüfen (https://developers.openai.com/api/docs/guides/latest-model ).
Dasselbe Dokument enthält eine spezifischere Warnung: Unklare oder widersprüchliche Anweisungen innerhalb einer Skill-Datei können dazu führen, dass das Modell frühzeitig anhält und die Arbeit blockiert.
Die Situation ist folgende:
Das Gehirn ist schlauer geworden. Daher befolgt es sowohl gute als auch schlechte Regeln treuer als zuvor.
Angenommen, in einer AGENTS.md, die Sie seit letztem Jahr erweitern, ist ein nutzloser Satz geblieben. Sol hätte ihn vielleicht angemessen ignoriert. Astra wird ihn strikt befolgen.
- Änderungen bei der Delegation und Handhabung des Gedächtnisses
Laut offizieller Ankündigung kann Astra jetzt Notizen über Kontextfenster hinweg innerhalb von Codex führen, sodass vermieden wird, angesammelte Details jedes Mal in eine einzige Zusammenfassung komprimieren zu müssen. Dies reduziert Informationsverluste bei langen Aufgaben.
Ab dem 7. September 2026 ist dies jedoch eine experimentelle Funktion. Sie muss explizit in config.toml aktiviert werden und ist standardmäßig deaktiviert. OpenAI hat angekündigt, dass dies in den kommenden Wochen zu einer Standardfunktion von Astra wird, aber vorerst funktioniert es nicht, wenn Sie die Einstellung nicht selbst vornehmen.
Andererseits weist die Modellrichtlinie auch darauf hin, dass bei Astra „die Delegation an Subagents möglicherweise nicht so häufig erfolgt, wie Ihr Workflow es erwartet“. Das bedeutet, wenn Sie Parallelisierung wünschen, müssen Sie auf der Harness-Seite angeben, wann delegiert werden soll.
Die Richtlinie erwähnt auch, dass Astra zu detaillierten, formatierten Antworten neigt, daher sollten Sie den gewünschten Stil und die Struktur angeben.
All dies deutet darauf hin: „Lassen Sie es nicht einfach in Ruhe, weil das Modell intelligent ist“, sondern „Weil es intelligent ist, wird es sich genau so bewegen, wie angegeben, also korrigieren Sie Ihre Spezifikationen.“
Die 8-Elemente-Karte des Harness
Die 8 hier aufgeführten Elemente und die später beschriebenen 7 Reifegrade sind keine offiziellen OpenAI-Definitionen. Sie wurden für diesen Artikel basierend auf den bisher gesehenen offiziellen Informationen einzigartig organisiert. Verwenden Sie sie als praktischen Rahmen.
Hier ist die Karte mit Unternehmensanalogien und Prioritäten:
- AGENTS.md | Arbeitsregeln & Grundsatzrichtlinie | Priorität: Höchste
- docs / Context | Internes Wiki & Handbücher | Priorität: Hoch
- Skills | Standardarbeitsanweisungen | Priorität: Hoch
- MCP / Plugins | Verbindung zu internen Systemen | Priorität: Mittel
- Environment | PC, Schreibtisch, Arbeitsumgebung | Priorität: Hoch
- Permissions / Sandbox | Befugnisse & Genehmigungsregeln | Priorität: Höchste
- Hooks / Tests | Automatische Prüfungen & Inspektionen | Priorität: Mittel
- Browser / Subagents | Augen, Hände, Untergebene | Priorität: Mittel
Anfänger sollten mit 1 und 6 beginnen. Der Grund ist einfach: Allein durch die Organisation dieser beiden wird die Grundlage für die anderen Elemente gefestigt. Dies bedeutet jedoch nicht, dass Sie die anderen nicht überprüfen sollten. Berechtigungen für extern verbundene Dienste über MCP, Verfahren in Skills und Skripte, die von Hooks ausgeführt werden, sind alle Gegenstand der Sicherheitsüberprüfung. Insbesondere da MCP eine Verbindung nach außen darstellt, prüfen Sie separat, ob das Ziel vertrauenswürdig ist und ob die erteilten Berechtigungen minimal sind.
Im Folgenden finden Sie eine Erläuterung der einzelnen Elemente.
Anweisungs- und Wissensebene | AGENTS.md, docs, Skills
Was es ist: Eine Markdown-Datei, die im Stammverzeichnis des Repositorys abgelegt wird. Codex liest sie, bevor es mit der Arbeit beginnt, und behandelt sie als projektspezifische Regeln.
Was es bewirkt: Sie können vermeiden, Prämissen wie „Führen Sie Tests immer mit diesem Befehl aus“ oder „Berühren Sie dieses Verzeichnis nicht“ in jede Eingabeaufforderung zu schreiben.
Der Fehler, den fast jeder hier macht, ist die Überfrachtung.
OpenAIs technischer Blog „Harness engineering: leveraging Codex in an agent-first world“ (11. Februar 2026, Ryan Lopopolo) beschreibt interne Fehlschläge. Der Versuch einer massiven AGENTS.md führte zu Kontextdruck, übrig gebliebenen alten Regeln und Verwirrung darüber, was wichtig war (https://openai.com/index/harness-engineering/ ).
Das Team wechselte dazu, AGENTS.md als eine „Karte“ von etwa 100 Zeilen zu betreiben. Details werden unter docs abgelegt, und AGENTS.md verweist lediglich darauf.
Anstatt einem talentierten Neuzugang ein 1.000-seitiges Regelwerk einzuprügeln, geben Sie ihm eine Orientierungskarte mit dem Hinweis: „Schau in dieses Regal, wenn du nicht weiterkommst.“ Das ist der Unterschied.
Kontext ist eine begrenzte Ressource. Riesige Anweisungsdateien verdrängen die Aufgabe selbst oder den Ort des zu lesenden Codes.
Eine kartenartige AGENTS.md sieht normalerweise so aus:
▼ Kopieren Sie ab hier
AGENTS.md
Was ist dieses Projekt?
(1-3 Zeilen. Was bauen Sie, wer nutzt es?)
Lesen Sie zuerst diese
- Designrichtlinie: docs/architecture.md
- Verzeichnisstruktur: docs/structure.md
- Glossar: docs/glossary.md
- Frühere Fehler & Korrekturen: docs/postmortems.md
Zu befolgende Regeln
- Tests: Führen Sie alle mit (tatsächlichem Befehl) aus und melden Sie den Abschluss nicht, wenn noch Fehler vorhanden sind.
- Verbotene Bereiche: (Pfade auflisten)
- Vor dem Commit: (Linter-/Formatter-Befehle)
Definition von „Erledigt“
Melden Sie „Erledigt“ nur, wenn alle folgenden Bedingungen erfüllt sind:
- Tests bestanden
- Die Absicht der Änderung kann in einem Absatz erklärt werden
- Selbst auf unbeabsichtigte Nebenwirkungen überprüft
Bei Unsicherheit
Gehen Sie nicht von Annahmen aus; präsentieren Sie mindestens zwei Optionen und fragen Sie mich.
Anweisungspriorität
- Meine (Benutzer-)Sofortanweisungen
- Diese AGENTS.md
- Verfahren in Skills Sie können niedrigere Anweisungen ignorieren, die höheren widersprechen. Wenn Sie eine Anweisung überspringen, melden Sie ihren Namen.
▲ Kopieren bis hierher
Die letzte „Anweisungspriorität“ ist besonders effektiv für Astra und spätere Modelle. Die Modellrichtlinie besagt ausdrücklich, dass klargestellt werden soll, ob Benutzeranweisungen oder Skill-Anweisungen Vorrang haben.
Was es ist: Das eigentliche Wissensrepository, auf das von AGENTS.md verwiesen wird. Designdokumente, Architekturdiagramme, Glossare, Aufzeichnungen früherer Entscheidungen usw.
Was es bewirkt: Codex liest sie nur bei Bedarf, sodass sie nicht ständig Kontext verbrauchen.
Was im Artikel „Harness Engineering“ auffällt, ist die Erklärung für die langsamen anfänglichen Fortschritte. Es lag nicht an mangelnden Fähigkeiten von Codex, sondern daran, dass „die Umgebung zu wenig spezifiziert war“.
Was fehlte, waren Werkzeuge, Abstraktionen, interne Strukturen und Informationen in einer für Codex lesbaren Form.
Wenn also etwas fehlschlug, war die Reaktion des Teams nicht „lass es noch einmal versuchen“. Es war zu überlegen: „Welche Fähigkeit fehlt, und wie können wir sie für den Agenten lesbar und durchsetzbar machen?“
Dies ist die Essenz des Harness Engineering. Beheben Sie die Umgebung, nicht die Eingabeaufforderung.
Zur Klarstellung: Dies ist eine interne OpenAI-Fallstudie. Ein Team von 3 Personen erstellte in 5 Monaten etwa 1 Million Zeilen und 1.500 PRs mit 0 Zeilen von Menschen geschriebenem Code; das bedeutet nicht, dass normale Benutzer dieselben Ergebnisse reproduzieren können.
Was es ist: Eine Datei im SKILL.md-Format. Sie bündelt Anweisungen, Referenzmaterialien und ggf. Skripte, um bestimmte Aufgaben jedes Mal mit demselben Verfahren auszuführen.
Was es bewirkt: Sie können vom Kopieren und Einfügen guter Prompts dazu übergehen, die Arbeit selbst zu speichern.
Wenn Sie beispielsweise „Artikel erstellen“ zu einem Skill machen, könnte der Inhalt sein:
- Recherche
- Faktenprüfung
- Titelvorschläge
- Strukturdesign
- Schreiben
- Prüfung auf verbotene Ausdrücke
- Abschlussprüfung
Die Vorsicht für Astra und spätere Modelle ist, nicht zu viele hinzuzufügen. Skill-Namen und -Beschreibungen werden in den Kontext geladen. Wenn die Anzahl zunimmt, werden Beschreibungen abgeschnitten, was die Auswahl erschwert. Wenn Beschreibungen sich widersprechen oder alle behaupten „Benutze mich“, könnte das Modell einen Skill laden, der nicht zur Aufgabe passt.
Skills sind für „Verfahren, die nur für bestimmte Aufgaben benötigt werden“, nicht für „Anweisungen, die jedes Mal benötigt werden“. Dies zu verwechseln ist dasselbe, als würde man alles in AGENTS.md schreiben.
Hände- und Füße-Ebene | MCP, Plugins, Environment
Was es ist: MCP ist ein Standard zum Verbinden von Codex mit externen Tools und Daten, verwendbar sowohl in CLI- als auch IDE-Erweiterungen. Plugins sind ein Mechanismus, um Skills, Connectors und MCP-Tools gemeinsam zu verteilen. In Codex sind sie in der ChatGPT-Desktop-App und CLI verfügbar, jedoch nicht in IDE-Erweiterungen.
Was es bewirkt: Ermöglicht Codex den Zugriff auf externe Dokumente, Browser, Designtools usw.
Egal wie intelligent Astra ist, es ist bedeutungslos, wenn es nicht an notwendige Informationen gelangt. Es ist wie ein brillanter Mitarbeiter ohne Zugang zum internen System.
Ich habe die Priorität jedoch auf Mittel gesetzt. Je mehr MCPs Sie hinzufügen, desto mehr Tool-Optionen nehmen zu und desto mehr Kontext wird verbraucht. Der richtige Ansatz ist, nur das hinzuzufügen, was Sie derzeit nur schwer erreichen können.
Was es ist: Das Gerüst für die tatsächliche Bewegung der Hände, wie Abhängigkeiten, Einrichtungsprozeduren, Testausführungsmethoden und Arbeitsverzeichnisstrukturen.
Was es bewirkt: Codex kann sich selbstständig bis zum Punkt „Ausführen und Verifizieren“ steuern. Wenn dies fehlt, wird Codex wieder nur zum Code-Schreiber.
Eine einfache Möglichkeit, dies zu überprüfen, besteht darin, es von einem sauberen Zustand aus zu bitten: „Richten Sie ein, führen Sie Tests durch und melden Sie die Ergebnisse.“ Wo immer es anhält, fehlt genau das.
Die Verwendung von Git Worktree, um Verzeichnisse für jede Aufgabe zu trennen, macht es schwieriger, dass mehrere parallele Aufgaben kollidieren.
Sicherheits- und Inspektionsebene | Permissions, Sandbox, Hooks
Was es ist: Zwei unabhängige Einstellungen, die bestimmen, wie viel Codex automatisch ausführen kann. Die Sandbox bestimmt die Reichweite von Dateien und Netzwerken, während die Genehmigungsrichtlinie festlegt, wo eine menschliche Bestätigung erforderlich ist.
Laut offizieller Codex-Dokumentation sind die Anfangseinstellungen für CLI- und IDE-Erweiterungen auf keinen Netzwerkzugriff und Schreiben nur innerhalb des aktiven Workspace beschränkt (https://developers.openai.com/codex/sandbox ).
Die Sandbox hat 3 Stufen:
- read-only: Kann lesen, aber nicht schreiben. Für Konsultation und Planung.
- workspace-write: Kann innerhalb des Arbeitsordners und temporärer Verzeichnisse schreiben. Dies ist der Standard.
- danger-full-access: Kann überall schreiben. Entfernt die Sandbox effektiv.
Die häufig verwendete Auto-Voreinstellung ist eine Kombination aus workspace-write und „nur bei Bedarf um Genehmigung fragen“. Codex wird anhalten und nachfragen, wenn versucht wird, außerhalb des Workspace zu bearbeiten oder das Netzwerk zu berühren.
Wenn Sie mitten in der Sitzung wechseln möchten, können Sie den Befehl /permissions verwenden. Ein realistischer Betrieb ist read-only für die Planungsphase und Auto für die Ausführungsphase.
Was ich Ihnen vermitteln möchte, ist, dass Autonomie nicht gleichbedeutend ist mit allem erlauben.
Zu danger-full-access zu flüchten, nur weil Genehmigungen lästig sind, ist die am wenigsten effektive Lösung. Wenn es nur in ein bestimmtes Verzeichnis schreiben muss, erlauben Sie einfach diesen Ort.
▼ Kopieren Sie ab hier
【Codex CLI: Konfigurationsbeispiele für Planung und Arbeit】
Ziel ist Codex CLI 0.134.0 oder höher.
Einstellungen werden in drei Dateien gespeichert: „Common“, „Planning“ und „Working“.
Fügen Sie nicht diese gesamte Erklärung in eine einzige Konfigurationsdatei ein. Schreiben Sie nur die entsprechenden Einstellungen an das jeweilige Ziel.
Ziele sind für Standard-Codex-Einstellungen.
■ 1. Gemeinsame Einstellungen
Pfad: ~/.codex/config.toml
Löschen Sie keine vorhandenen Einstellungen; fügen Sie die folgenden Elemente hinzu oder ändern Sie sie. Wenn dasselbe [sandbox_workspace_write] vorhanden ist, bearbeiten Sie es darin, um doppelte Überschriften zu vermeiden.
[sandbox_workspace_write]
network_access = false
Geben Sie zusätzliche genehmigte Verzeichnisse nur bei Bedarf an.
writable_roots = ["/absoluter/pfad/zum/genehmigten-verzeichnis"]
Nur wenn zusätzliche Schreibziele benötigt werden, entfernen Sie das # am Anfang der writable_roots-Zeile und ersetzen Sie den Beispielpfad durch den tatsächlichen absoluten Pfad.
■ 2. Planungseinstellungen
Pfad: ~/.codex/plan.config.toml
Speichern Sie diese beiden Zeilen in einer separaten Datei von den gemeinsamen Einstellungen.
approval_policy = "on-request"
sandbox_mode = "read-only"
■ 3. Arbeitseinstellungen
Pfad: ~/.codex/work.config.toml
Speichern Sie diese beiden Zeilen in einer weiteren separaten Datei.
approval_policy = "on-request"
sandbox_mode = "workspace-write"
■ Verwendung
Schreiben Sie den Startbefehl nicht in die Konfigurationsdatei; führen Sie ihn vom Terminal im Projektordner aus.
Zum Starten für die Planung:
codex --profile plan
Zum Starten für die Arbeit:
codex --profile work
Die Einstellungen des ausgewählten Profils werden über die gemeinsamen Einstellungen gelegt.
Da auch projektspezifische Einstellungen und organisatorische Einschränkungen gelten, überprüfen Sie die tatsächlichen Berechtigungen nach dem Start mit /permissions.
Hinweis: network_access = false ist die Kommunikationseinstellung für Befehle, die innerhalb der Sandbox ausgeführt werden. Überprüfen Sie die Berechtigungen für externe Verbindungen wie MCP separat.
▲ Kopieren bis hierher
Eine Grenze um eins zu erweitern ist etwas völlig anderes, als die Grenze selbst aufzuheben. Gleiches gilt für den Netzwerkzugriff; es ist nur für Projekte eine sinnvolle Entscheidung, die wirklich Pakete von Abhängigkeiten abrufen müssen.
Was es ist: Ein Mechanismus, um eigene Skripte oder MCP-Tools in die Mitte der Codex-Verarbeitung einzufügen. Es ist standardmäßig als Stable-Funktion aktiviert.
Was es bewirkt: Zum Beispiel diese Automatisierungen:
- Stoppen gefährlicher Befehle unmittelbar vor der Ausführung eines Tools
- Überprüfung auf Geheimnisse wie API-Schlüssel
- Ausführen eines Linters unmittelbar nach dem Bearbeiten einer Datei
- Überprüfen, ob Tests am Ende der Arbeit bestanden werden
Es geht darum, von „Seien Sie vorsichtig, keine Fehler zu machen“ zu „Das System stoppt, wenn ein Fehler auftritt“ zu wechseln.
OpenAI warnt jedoch selbst davor, Hooks als Leitplanken und nicht als absolute Durchsetzungsgrenzen zu behandeln, da Codex gleichwertige Arbeiten möglicherweise über verschiedene Tool-Pfade ausführen könnte.
Dinge, die Sie wirklich stoppen möchten, sollten auf Sandbox- und Berechtigungsebene gestoppt werden, nicht mit Hooks. Hooks sind das zweite Netz, das darüber gelegt wird.
Augen- und Team-Ebene | Browser, Subagents
Eine Website zu bauen und mit „Ich habe den Code geschrieben, ich bin fertig“ zu enden, ist Verschwendung.
Hinweis: Die hier beschriebene Computer Use (tatsächliche Bildschirmbedienung) ist derzeit eine Funktion für die Desktop-App-Version von Codex. Der integrierte Browser / Computer Use, der in diesem Kapitel behandelt wird, wird in der ChatGPT-Desktop-App verwendet. Der integrierte Browser ist in Codex CLI oder IDE-Erweiterungen nicht verfügbar. Für Browser-Operationen in CLI/IDE bereiten Sie andere Mechanismen wie MCP oder Playwright vor.
Sie sollten es Folgendes tun lassen:
- Den Browser öffnen
- Den tatsächlichen Bildschirm anzeigen
- Versuchen, ihn zu bedienen
- Kaputte Teile finden
- Sie reparieren
- Erneut überprüfen
Astra ist eine Generation, die sich bei Computer-Betriebs-Benchmarks deutlich verbessert hat, daher lohnt es sich, diesen Prozess zu delegieren. Der Bericht über die Zeitreduzierung von 75 auf 40 Minuten in OSWorld 2.0 handelt genau davon.
In der Harness-Engineering-Fallstudie wurde eine Umgebung geschaffen, in der Codex Chrome DevTools Protocol, DOM, Screenshots, Logs und Metriken verarbeiten konnte, um alles von der Fehlerreproduktion bis zur Behebung und Verifizierung zu handhaben.
Was es ist: Ein Mechanismus, bei dem Codex die Arbeit auf mehrere Unteragenten verteilt. Jeder hat einen unabhängigen Kontext.
Was es bewirkt: Parallelisiert leseintensive, unabhängige Aufgaben wie Recherche, Tests, Loganalyse und Zusammenfassung.
Zwei Vorsichtsmaßnahmen:
Eine ist, dass mehrere Agenten, die gleichzeitig denselben Code schreiben, kollidieren werden. Seien Sie vorsichtig bei der Parallelisierung von Schreibaufgaben.
Die andere ist einfach, dass der Token-Verbrauch steigt. Es wird schneller, aber nicht billiger.
Und spezifisch für Astra besagt die Modellrichtlinie, dass die Delegationshäufigkeit möglicherweise geringer ist als erwartet. Wenn Sie Parallelisierung wünschen, geben Sie explizit in AGENTS.md oder Prompts an: „Sie können Rechercheaufgaben aufteilen und parallel ausführen.“
Die Umkehrung der Astra-Ära | Inventur, nicht Hinzufügen
Ich habe 8 Elemente aufgelistet, aber das Wichtigste, das ich vermitteln möchte, ist das Gegenteil.
Das Erste, was für Astra zu tun ist, ist eine Inventur der vorhandenen Anweisungen. OpenAI empfiehlt ebenfalls, die Anweisungen zu überprüfen, auf die das Modell zugreift, wie Skills und AGENTS.md. Behalten Sie notwendige Anweisungen, füllen Sie Lücken und korrigieren oder entfernen Sie alte/widersprüchliche nach Überprüfung.
Das in OpenAIs Richtlinie verwendete Verb ist „auditing“ (überprüfen), nicht „adding“ (hinzufügen).
Berichte von Teams, die Astra vorab getestet haben, weisen in die gleiche Richtung. Kilo, ein Anbieter von KI-Codierungstools, schrieb in einer Überprüfung, dass Astra deutlich weniger AGENTS.md-Gerüst benötigt und die meisten der im letzten Jahr aufgebauten „Anweisungen, um das Modell von der Spur abzubringen“, jetzt unnötig sind. Sie schlugen sogar vor, wenn Sie eine aufgeblähte Agentendatei haben, versuchen Sie, die Hälfte zu löschen und es erneut zu versuchen (https://blog.kilo.ai/p/gpt-6-astra-what-we-learned-previewing ).
Dies ist der Eindruck eines Unternehmens, keine offizielle Ansicht. Es deckt sich jedoch perfekt mit der offiziellen Richtlinie, dass „widersprüchliche Anweisungen zu frühen Stopps führen können“.
Je intelligenter das Modell, desto mehr wird es durch alte Anweisungen ausgebremst. Paradox, aber wahr.
Die Inventur ist am schnellsten, wenn sie von Codex selbst durchgeführt wird.
▼ Kopieren Sie ab hier
Bitte lesen Sie AGENTS.md, alles unter docs und alle geladenen Skill-Dateien in diesem Repository. Nehmen Sie noch keine Änderungen vor.
Gehen Sie von der Arbeit mit GPT-6 Astra aus und klassifizieren und berichten Sie Folgendes:
【Behalten】 Anweisungen, die noch gültig sind und Ihre Urteilsfähigkeit tatsächlich verbessern. Erklären Sie den Grund in einem Satz.
【Löschkandidaten】 Elemente, die auf eines der folgenden zutreffen. Zitieren Sie den Originaltext und geben Sie einen Grund an. Dies ist keine Entscheidung zum Löschen, sondern eine Liste zur menschlichen Überlegung.
- Anweisungen, die geschrieben wurden, um Modelle der vorherigen Generation zu korrigieren, die jetzt unnötig sind.
- Anweisungen, die auf Spezifikationen, Pfade oder Befehle verweisen, die sich bereits geändert haben.
- Anweisungen, die Ihnen befehlen, Dinge zu tun, die Sie ohnehin tun, ohne dass man es Ihnen sagt.
- Anweisungen, die anderen Anweisungen widersprechen.
Falls jedoch auch nur die geringste Möglichkeit besteht, dass die Anweisung aus Sicherheits-, Schutzgründen oder aufgrund früherer Unfälle/Vorfälle hinzugefügt wurde, klassifiziere sie nicht als 【Löschkandidat】. Ordne sie stattdessen einer separaten Kategorie 【Erfordert menschliche Beurteilung】 zu und erkläre, warum du diese Möglichkeit siehst. Ziehe nicht allein aufgrund deiner eigenen Einschätzung den Schluss, dass sie "unnötig" ist.
【Umschreiben】 Anweisungen, bei denen die Absicht korrekt ist, die Formulierung jedoch mehrdeutig, redundant oder die Priorität unklar ist. Gib einen Umschreibungsvorschlag an.
【Fragen】 Beschreibungen, bei denen es dir schwerfiel, die Bedeutung beim Lesen zu beurteilen.
Melde abschließend unbedingt die folgenden beiden Punkte:
- Falls es Anweisungen gab, die dich tatsächlich blockiert oder zum Zögern gebracht haben, nenne die genaue Zeile und den Grund für dein Zögern.
- Wenn AGENTS.md auf einen Index von etwa 100 Zeilen verdichtet werden sollte, welche Struktur würdest du verwenden?
▲ Bis hierher kopieren
Die resultierende Liste der "Löschkandidaten" sollte nicht einfach vollständig gelöscht werden. Überprüfe zunächst, warum diese Anweisung hinzugefügt wurde, ihre Historie und was passiert, wenn sie entfernt wird. Überprüfungsverfahren, die nach früheren Unfällen hinzugefügt wurden, sollten nicht einfach entfernt werden, nur weil Codex sie für "für sein aktuelles Selbst unnötig" hält. Insbesondere bei Sicherheits- oder Schutzanweisungen sollte die Person, die die Historie kennt, die endgültige Entscheidung treffen. Lösche nur bei Punkten, bei denen der Grund für die Hinzufügung bestätigt ist und die Auswirkungen als begrenzt eingeschätzt werden. Im Zweifelsfall behalte die Anweisung. Wenn du sie nach docs verschiebst, hinterlasse einen klaren Pfad, damit bei Bedarf zuverlässig von AGENTS.md darauf verwiesen werden kann.
Reifegrad | Wo stehst du gerade?
Überprüfe deine Stufe.
Stufe 0: Jedes Mal Prompts schreiben. Wie wenn man einem talentierten Mitarbeiter jeden Morgen alles von Grund auf erklären muss.
Stufe 1: AGENTS.md und docs existieren. Wie ein Unternehmen, das Regeln und Handbücher hat.
Stufe 2: Skills existieren. Verfahren für Routineaufgaben sind festgelegt.
Stufe 3: MCP und Plugins sind angebunden. Kann eigenständig auf notwendige Systeme zugreifen.
Stufe 4: Berechtigungen, Hooks und Tests funktionieren. Automatische Ausführung und automatische Überprüfung sind vorhanden.
Stufe 5: Nutzung von Browser und Subagents. Kann eigenständig verifizieren und Arbeit delegieren.
Stufe 6: Feedback-Schleife existiert. Das System selbst wird bei jedem Fehler aktualisiert.
Viele Leute sind auf Stufe 1. Und sie versuchen voranzukommen, indem sie AGENTS.md dicker machen. Das ist nicht Stufe 2; es ist nur eine aufgeblähte Stufe 1.
Stufe 6 ist anders geartet. Es geht nicht darum, neue Funktionen hinzuzufügen. Es geht nur um eine Betriebsregel: "Wenn derselbe Fehler zweimal gemacht wird, fließt die Korrektur zurück in AGENTS.md, Skill, Hook oder Test."
Hierhin bewegte sich OpenAI im Artikel "Harness Engineering" – hin zu "kontinuierlicher Korrektur statt einmaliger Überprüfung".
Ausführungsreihenfolge | 30 Minuten, 1 Tag, 1 Woche
Priorisiere. Führe diese in der Reihenfolge aus.
Erste 30 Minuten
- Führe den Diagnose-Prompt vom Anfang dieses Artikels aus.
- Überprüfe die aktuellen Berechtigungseinstellungen mit
/permissions. Wenn du regelmäßigdanger-full-accessverwendet hast, stelle zuerst aufworkspace-writezurück. - Öffne AGENTS.md und lies es durch. Überprüfe auf redundante, widersprüchliche oder veraltete Beschreibungen. 100 Zeilen ist nur ein internes OpenAI-Beispiel, kein absoluter Standard. Achte darauf, ob der Inhalt organisiert ist, nicht auf die Zeilenanzahl.
1 Tag
- Führe den Inventur-Prompt aus. Lösche 【Löschkandidaten】 erst, nachdem du den Grund für die Hinzufügung und die Auswirkungen bestätigt hast. Entscheide bei 【Erfordert menschliche Beurteilung】 nach Rücksprache mit jemandem, der die Historie kennt.
- Verschiebe wertvolle Teile des gelöschten Inhalts nach
docs. - Füge "Anweisungspriorität" am Ende von AGENTS.md hinzu.
- Starte aus einem sauberen Zustand mit der Anweisung "Richte Tests ein und lasse sie bestehen" und protokolliere, wo es stoppt.
1 Woche
- Wähle eine Aufgabe, die du mehr als zweimal pro Woche erledigst, und mache daraus einen Skill.
- Wenn es eine externe Datenquelle gibt, die du immer nur schwer erreichen kannst, verbinde sie über MCP.
- Mache entweder eine Überprüfung geheimer Informationen oder die Ausführung eines Post-Edit-Linters zu einem Hook.
- Lege einen Ort fest, an dem Fehler für das Feedback aufgezeichnet werden.
An diesem Punkt erreichst du den Eingang von Stufe 4 ausgehend von Stufe 1.
Umgekehrter Index | Nach Ziel
Möchtest du aufhören, dieselbe Erklärung zu wiederholen → AGENTS.md
Codex bezieht sich auf alte Informationen → Inventar von docs / Kontext
Die Qualität derselben Aufgabe schwankt → Skills
Kannst nicht auf notwendige Daten zugreifen → MCP / Plugins
Kannst Code schreiben, aber nicht zur Überprüfung übergehen → Umgebung
Hast Angst vor eigenständigem Handeln oder es gibt zu viele Genehmigungen → Berechtigungen / Sandbox
Derselbe Fehler wiederholt sich → Hooks / Tests
Bemerkst keine Layout-Brüche → Browser / Computer Use
Recherche dauert zu lange → Subagents
Nach dem Wechsel zu Astra mitten in der Aufgabe gestoppt → Überprüfe zuerst Stopp-Benachrichtigungen, Genehmigungsanfragen und Fehler. Überprüfe ggf. Einstellungen und Nutzung mit /status in der CLI. Bei Verdacht auf widersprüchliche Anweisungen, inventarisiere AGENTS.md und Skills.
Der nächste Wettbewerb ist die Umgebung, nicht das Gehirn
Das Spiel der Modellauswahl ist größtenteils vorbei.
Astra ist intelligent genug und führt Anweisungen exakt aus. Deshalb bestimmt das, was du als Anweisungen hinterlässt, das Ergebnis.
Vom Spiel, gute Prompts zu schreiben, hin zum Spiel, gute Arbeitsumgebungen zu gestalten. Astra ist das Modell, das diesen Übergang endgültig gemacht hat.
Du musst heute nur eines tun. Öffne AGENTS.md und lies es durch. Das ist der Ausgangspunkt.
Vielen Dank, dass du bis hierher gelesen hast.
Ich teile konkrete Beispiele für Zeitersparnis und KI-Nebentätigkeiten mit ChatGPT, Claude und Copilot in einem offenen Chat. Wenn du auf der Seite sein willst, die "KI nutzen kann", tritt jetzt bei.





