YouMind
Anmelden

OpenAI Dots: So bauen Sie ein 4-Sitzer-Agenten-Team, das vor Drift stoppt (Vollständiger Leitfaden)

@fleyta88
ENGLISCH01. Okt. 2026
126K
90
5
10
150

TL;DR

Dieser Leitfaden erklärt, wie Sie OpenAI Dots Agents konfigurieren, um Task-Drift durch ein Vier-Rollen-System (Lookout, Maker, Skeptic, Runner) zu verhindern und strenge Fünf-Schritte-Checkpoints mit einer Berechtigungsleiter durchzusetzen.

8,6 % bei 5 Aufgaben. 19,7 % bei 10.

Das steht in OpenAIs eigener System Card für Dots. Verkette fünf Aufgaben, und 8,6 % der Durchläufe werden wegen Boundary-Problemen markiert. Verkette zehn, und der Wert verdoppelt sich mehr als.

Am Launch-Tag haben alle die Plüsch-Maskottchen gepostet. Fast niemand hat diese eine Zeile geteilt.

Die meisten Dots-Guides sagen dir: Verkette einfach alles und lass den Agenten laufen. Hier geht es darum, wo du die Kette durchtrennst – damit der Agent die ganze Woche arbeiten kann, ohne den Rahmen zu sprengen, den du ihm gesetzt hast.

Ein Dot, vier Rollen, eine Berechtigungsleiter und ein Checkpoint alle fünf Schritte.

TL;DR: Formuliere den Job, bevor du auch nur eine App verbindest. Gib dem Dot vier Rollen, von denen er immer nur eine gleichzeitig trägt. Lass keine Kette länger als fünf Schritte ohne Checkpoint laufen. Und halte deine Freigaben unter fünf pro Tag. Die Prompts findest du in den Abschnitten 6 bis 8, die Rechnung in den Abschnitten 3 und 8.

1. Erst die Zahlen

text
1Launch 29. September 2026
2Modell GPT-6 Astra
3Verbindbare Apps 4.000+
4Erster Dot in Pro und Business Premium enthalten
5Pro-Stufen 100 $ / 200 $ / 500 $ pro Monat
6Business Premium 125 $ pro Nutzer und Monat, 100 $ bei Jahreszahlung
7Chats mit einem Dot zählen nicht gegen die ChatGPT-Limits
8Aufgaben, die in Codex oder Work starten zählen wie gewohnt dagegen
9Wo er läuft ChatGPT Desktop, Web, Mobile, Slack, Teams
10SMS „demnächst verfügbar“
11
12Aus der System Card
13Boundary-Flags, 5-Aufgaben-Kette 8,6 %
14Boundary-Flags, 10-Aufgaben-Kette 19,7 %
15Indirekte Injektion, interne Tests 99,79 % abgewehrt
16Externes Red Team, 1.810 Angriffe 8,5 % kamen durch
17Irreführende Informationsaufgaben 0 von 151 fehlgeleitet

Den oberen Block haben schon alle gepostet. Der untere Block ist das, was deine Einrichtung verändern sollte.

2. Was ein Dot ist – auf einen Blick

Ein Dot ist ein dauerhaft aktiver Agent, der dir gehört. Vier Dinge unterscheiden ihn von einem normalen ChatGPT-Chat:

text
1Das Modell GPT-6 Astra, kein abgespecktes Modell hinter einer hübscheren Oberfläche
2Eigener Rechner eine Cloud-Maschine mit eigenem Browser, läuft auch, wenn dein Laptop aus ist
3Arbeitet zwischen „proaktive Recherche“ in deinen verbundenen Apps, nur lesend
4deinen Nachrichten er kann dort nichts senden, ändern oder deinen Rechner steuern
5Eine Identität derselbe Dot und dasselbe Gedächtnis in ChatGPT, Slack und Teams

Und zwei Funktionen, die du öfter nutzen wirst als alles andere:

text
1Custom Rules Aktion erlauben, Freigabe verlangen oder blockieren
2Auto-Review prüft Aktionen, die deine Konten berühren oder Daten teilen könnten

OpenAI schließt den Launch-Post mit diesem Satz: Dots können immer noch Fehler machen, überprüfe deshalb folgenreiche Arbeitsschritte immer. Alles hier dreht sich darum, diese Prüfung so schnell zu machen, dass du sie tatsächlich durchziehst.

3. Die Zahl, die niemand gepostet hat

Ich habe die beiden Werte aus der System Card kurz durchgerechnet.

Wenn jeder Schritt in einer Kette dieselbe kleine, unabhängige Wahrscheinlichkeit hätte, aus dem Ruder zu laufen, käme man mit einfacher Mathematik von 5 auf 10 Schritte:

text
15-Schritte-Kette markiert 8,6 %
2Daraus folgende Wahrscheinlichkeit/Schritt 1 - (1 - 0,086)^(1/5) = 1,78 %
3
410 Schritte, wenn Schritte unabhängig wären 1 - (1 - 0,0178)^10 = 16,5 %
510 Schritte, gemessener Wert in der Card 19,7 %

Der gemessene Wert liegt höher als der theoretisch unabhängige.

Meine Lesart: Fehler stapeln sich. Ein Schritt, der leicht danebengeht, gibt dem nächsten ein leicht falsches Bild weiter – und der nächste baut darauf auf. Das Risiko wächst also schneller als die Kette.

Es sind nur zwei Zahlen, und OpenAI hat nicht verraten, welche Probleme genau markiert wurden. Betrachte es also als grobes Signal. Aber es reicht, um darauf aufzubauen:

text
1Die Regel, auf der dieser Guide basiert:
2Nie mehr als 5 Schritte zwischen Checkpoints

4. Vier Rollen, ein Dot

Ein Dot, dem man sagt „du bist mein Assistent“, liefert Assistenz-artige Arbeit: hilfsbereit, vage, etwas zu lang. Ein Dot, dem man sagt „du bist jetzt der Skeptiker, und der Skeptiker findet nur das, was nicht funktioniert“, liefert etwas, womit du arbeiten kannst.

Deshalb bekommt der Dot vier Rollen. Er sitzt immer nur in einer und nennt sie oben in jeder Antwort.

text
1AUSSENPOSTEN liest deine verbundenen Apps, meldet Änderungen, schreibt nie selbst
2MACHER arbeitet auf seinem eigenen Rechner, übergibt dir das fertige Ergebnis
3SKEPTIKER prüft das Ergebnis gegen das Briefing, listet Schwachstellen auf
4LÄUFER verschiebt freigegebene Arbeit dorthin, wo sie hingehört, fragt vorher nach

Das sind Modi eines einzigen Agenten, nicht vier verschiedene Agenten. Ein Gedächtnis, ein Regelwerk, vier eng definierte Jobs.

fleyta - inline image

5. Setup – in der richtigen Reihenfolge

text
11 Öffne ChatGPT am Computer Der erste Dot wird auf Desktop oder im Web erstellt,
2 mobil kannst du mit ihm chatten, ihn aber nicht anlegen
32 Suche „dots“ in der Sidebar Fehlt = falscher Plan, Markt noch nicht erreicht,
4 oder ein Admin hat es nicht aktiviert
53 Benenne ihn Kurz, klein geschrieben, keine Leerzeichen
6 Du wirst ihn morgens um 7 Uhr in Slack tippen
74 Füge die Jobbeschreibung ein Abschnitt 6, vor allem anderen
85 Verbinde Quellen Erst nachdem er dir den Job zurückbestätigt hat
96 Füge ihn zu Slack/Teams hinzu Sobald er weiß, wofür er da ist

Schritt 5 nach Schritt 4 – genau das machen die meisten falsch. Ein Agent mit 40 verbundenen Apps und ohne Briefing ist bestens informiert und produziert nichts Brauchbares.

6. Die Jobbeschreibung

Füge dies als erste Nachricht ein. Ersetze nur die Klammern, sonst nichts.

text
1Du bist mein ständiger Operations-Agent. Behandle diese Nachricht als deine
2Jobbeschreibung für jede Aufgabe, auch für solche, die ich aus Slack oder vom Handy starte.
3
4WER ICH BIN
5Ich bin [Rolle] bei [Unternehmen oder Projekt]. Meine Woche besteht hauptsächlich aus [ein Satz].
6
7WAS DIR GEHÖRT (Ergebnisse, nicht Aktivitäten)
81. [Ergebnis eins]
92. [Ergebnis zwei]
103. [Ergebnis drei]
11
12ROLLEN
13Du sitzt immer nur in einer Rolle und nennst sie oben in jeder Antwort:
14AUSSENPOSTEN, MACHER, SKEPTIKER, LÄUFER.
15- AUSSENPOSTEN liest und meldet nur.
16- MACHER zeigt mir das Ergebnis, niemals nur eine Beschreibung davon.
17- SKEPTIKER prüft die Arbeit des MACHERs gegen dieses Briefing und listet Schwachstellen auf.
18- LÄUFER verschiebt nur freigegebene Arbeit und fragt nach, bevor etwas das System verlässt.
19
20DIE KETTENREGEL
21Führe nie mehr als 5 Schritte hintereinander aus. Stoppe nach Schritt 5, wechsle zum
22SKEPTIKER, führe den Checkpoint durch und warte auf PASS, bevor du weitermachst.
23
24WIE DU MIT MIR SPRICHST
25- Ergebnis zuerst. Dann maximal drei Dinge, die ich entscheiden muss.
26- Blockiert: Was du versucht hast und was du brauchst, in zwei Zeilen.
27- Unsicher, ob etwas im Rahmen liegt: Lies nach, dann stell eine Frage. Handle nicht.
28
29Bestätige, indem du die vier Rollen, die drei Ergebnisse und die Kettenregel
30in eigenen Worten wiederholst. Dann stopp.

Überspringe die letzte Zeile nicht. Wenn der Dot aus „Wochenbericht entwerfen“ ein „Bericht über die Woche schreiben“ macht, hast du das Problem mit einer einzigen Nachricht gefangen – statt mit einer Woche voller falscher Berichte.

7. Die Berechtigungsleiter – mit Freigabe-Budget

Custom Rules geben dir drei Stufen: erlauben, Freigabe verlangen, blockieren. Die meisten schreiben eine Wand aus Verboten, genehmigen dann 40 Dinge am Tag und hören irgendwann auf zu lesen, was sie freigeben.

Schreib zuerst die Erlaubnis-Stufe. Sei unten großzügig und oben streng.

text
1ERLAUBEN
2- Alles in meinen verbundenen Quellen lesen.
3- Im öffentlichen Web surfen, deinen eigenen Rechner nutzen, Code ausführen.
4- Entwürfe in deinem eigenen Workspace und im Space [NAME] erstellen und umschreiben.
5
6ERST FRAGEN
7- Jede Nachricht an eine Person: E-Mail, DM, Channel-Post, Einladung, Kommentar.
8- Jede Änderung an einer Datei, die du nicht erstellt hast.
9- Jede Aktion in einem Repository, einschließlich Pull Requests.
10- Jeder Kauf, jedes Abo, jedes Formular.
11
12BLOCKIEREN
13- Passwörter, 2FA, Abrechnung, Zahlungseinstellungen.
14- Alles löschen.
15- Öffentlich in meinem Namen posten.
16- Personen kontaktieren, die nicht im Briefing der Aufgabe genannt sind.
17
18LÜCKEN
19Alles, was die Regeln nicht abdecken, gilt als ERST FRAGEN.
20Sag mir, welche Regel unklar war. Löse eine Lücke niemals zugunsten einer Aktion auf.

Dann gib dir selbst ein Budget. Hier ist eine Beispielwoche für einen Dot, der recherchiert, Entwürfe schreibt und einen Weekly Digest erstellt. Die Aufteilung ist meine Schätzung, keine Messung:

text
1Eine Beispielwoche, 420 Aktionen Leiter oben „alles fragen“
2Lesen & Web 300 erlauben fragen
3Entwürfe im Workspace 80 erlauben fragen
4Nachrichten an Personen 28 fragen fragen
5Repo- & Dateiänderungen 8 fragen fragen
6Blockierte Versuche 4 blockieren fragen
7Freigaben, die du klickst 36 pro Woche 420 pro Woche
8Pro Arbeitstag ~7 ~84

Niemand liest 84 Freigaben am Tag. Sieben wirst du wirklich lesen. Genau das ist der eigentliche Job der Leiter: Deine Freigaben so knapp halten, dass du sie dir noch ansiehst.

Mein Ziel: unter fünf pro Tag. Bist du zwei Wochen darüber, stufe eine wiederkehrende Aktion herunter oder grenze eine Quelle enger ein.

8. Der Checkpoint alle fünf Schritte

Hier kommen die 19,7 % ins Spiel.

Ein langer Job läuft nicht als eine einzige Kette. Er läuft in Etappen von maximal fünf Schritten, und jede Etappe endet mit dem Skeptiker.

text
1CHECKPOINT (Skeptiker, am Ende jeder Etappe)
2
3Beantworte alle fünf Fragen, jeweils in einer Zeile:
41. Hat diese Etappe getan, was das Briefing verlangt hat – oder etwas Ähnliches, Leichteres?
52. Hat ein Schritt eine Quelle oder Person erreicht, die nicht im Briefing stand?
63. Ist jede Zahl entweder von dir berechnet oder mit der Quelle verlinkt?
74. Gibt es eine Behauptung, für die du keinen Beleg nennen kannst? Liste sie auf.
85. Wenn ich diese Etappe freigebe und sie falsch ist, was geht kaputt?
9
10Urteil:
11PASS weiter zur nächsten Etappe
12HALT stopp, zeig mir erst Punkt 2, 4 und 5

Jetzt dieselbe Überschlagsrechnung wie in Abschnitt 3. Nehmen wir an, der Skeptiker fängt am Checkpoint 4 von 5 Problemen ab. Das ist meine Annahme, keine gemessene Rate:

text
1Eine 10-Schritte-Kette, kein Checkpoint 19,7 % markiert (System Card)
2
3Zwei 5-Schritte-Etappen mit je einem Checkpoint
4 Pro Etappe markiert 8,6 %
5 Nach dem Checkpoint übrig 8,6 % x 0,2 = 1,7 %
6 Über beide Etappen 1 - (1 - 0,017)^2 = 3,4 %

Selbst wenn der Skeptiker nur die Hälfte erwischt, landen zwei Etappen bei etwa 8,6 % statt bei 19,7 %. Der Schnitt erledigt den Großteil der Arbeit, die Trefferquote den Rest.

fleyta - inline image

9. Gib der Arbeit einen Landeplatz

Arbeit, die in einem Chat-Thread lebt, findest du nie wieder. Dots docken an ChatGPT Spaces und Pages an, in denen du, dein Team und der Dot gemeinsam arbeiten.

Ein Space, vier Seiten:

text
100 Index Eine Zeile pro Durchlauf: Datum, genutzte Rollen, Ergebnis, Urteil
201 Posteingang Fundstücke des AUSSENPOSTENS, neueste oben, datiert
302 Review Ergebnisse des MACHERs, darunter jeweils der SKEPTIKER-Checkpoint
403 Ausgeliefert Was du freigegeben hast, mit Freigabedatum

Erkläre dem Dot diese Struktur einmal. Nach zwei Wochen ist die Index-Seite das Nützlichste im ganzen Setup: der einzige lesbare Nachweis darüber, was ein dauerhaft laufender Agent mit deiner Woche gemacht hat.

10. Der erste echte Durchlauf

Starte mit etwas Nützlichem, Wiederkehrendem und Günstigem, falls es schiefgeht. Ein Freitag-Digest nutzt alle vier Rollen und scheitert sicher.

text
1Ständige Aufgabe. Jeden Freitag um 16:00 Uhr und wenn ich sage „Digest starten“.
2
3ETAPPE 1 (max. 5 Schritte)
4AUSSENPOSTEN [Kalender], [E-Mail], [Repo]: Was hat sich diese Woche geändert, das jemand
5 wissen müsste, der am Montag anfängt? Maximal fünf Bulletpoints, jeder endet mit
6 „Entscheidung nötig“ oder „kein Handlungsbedarf“.
7MACHER Nur aus diesen Punkten: AUSGELIEFERT, VERSCHOBEN, WARTEND.
8 Maximal 120 Wörter pro Abschnitt, Links für jeden AUSGELIEFERT-Punkt.
9SKEPTIKER Checkpoint. Alles in AUSGELIEFERT ohne Link wandert nach WARTEND.
10
11ETAPPE 2 (nur bei PASS)
12LÄUFER Speichere es in 02 Review als „Woche vom [Datum]“, füge eine Zeile zu 00 Index hinzu.
13 Schicke es an niemanden.
14
15Dann schick mir nur die Antwort auf Checkpunkt-Frage 5, sonst nichts.

11. Dots vs. Grok Bot

Gleiche Kategorie, unterschiedliche Grundform.

text
1 DOTS GROK BOT
2Grundform Ein Agent, viele Rollen Mehrere benannte Bots
3Gedächtnis Eins, geteilt von allen Rollen Eines pro Bot
4Läuft in ChatGPT, Slack, Teams Eigene App und eigene Chats
5Passt gut für Die Woche einer Person, ein Regelwerk Getrennte Jobs, die sich nie mischen

Wenn deine Jobs Kontext teilen (dein Posteingang speist deinen Digest, der deinen Montagsplan speist), ist ein Dot mit vier Rollen einfacher. Wenn sie sich nie sehen dürfen (Kunde A und Kunde B), sind getrennte Bots die sauberere Grenze.

12. Die Leitplanken

text
1Kette länger als 5 Schritte -> Stopp, Checkpoint, auf PASS warten
2Regellücke -> ERST FRAGEN, unklare Regel benennen
3Nachricht an eine Person -> ERST FRAGEN, immer
4Passwort, Abrechnung, Löschen, öffentlich -> BLOCKIEREN
5Login oder Captcha mitten im Job -> Am Rechner des Dots übernehmen
65+ Freigaben/Tag über 2 Wochen -> Stufe anpassen oder Quelle eingrenzen
7SKEPTIKER schreibt Lob -> Checkpoint umschreiben, nicht das Ergebnis

Jede Leitplanke schiebt Unsicherheit zu dir – niemals in Richtung Aktion.

13. Was ich nicht getestet habe

Die Drift-Rechnung. Zwei Zahlen aus einer System Card sind ein grobes Signal, kein bewiesenes Modell. OpenAI hat nicht gesagt, welche Boundary-Probleme markiert wurden, also kann ich nicht beurteilen, wie gravierend sie sind.

Die Trefferquote des Skeptikers. 4 von 5 ist eine Annahme, um die Form der Rechnung zu zeigen. Ein Dot, der seine eigene Arbeit prüft, ist kein unabhängiger Prüfer – die echte Quote könnte niedriger sein.

Die Beispielwoche. 420 Aktionen und die Verteilung auf die Stufen sind meine Schätzung für einen Recherche-und-Entwurf-Dot, kein Log aus einem echten Konto.

Preise nach dem ersten Dot. OpenAI sagt, man wird weitere Dots hinzufügen und Geschwindigkeit oder monatliches Volumen skalieren können, hat diese Preise aber noch nicht veröffentlicht.

14. Das Playbook

Formuliere den Job, bevor du eine einzige App verbindest.

Ein Agent, vier Rollen, immer nur eine gleichzeitig.

Trenne jede Kette nach fünf Schritten. Checkpoint, dann weiter.

Schreib zuerst die Erlaubnisliste. Lücken gehen an ERST FRAGEN.

Halte Freigaben unter fünf pro Tag, sonst hört dein Review auf, echt zu sein.

Gib der Arbeit einen Landeplatz und lies freitags den Index.

fleyta - inline image

Der Kern der Sache

Dots sind die ersten Agenten, die die meisten Menschen laufen lassen, während sie schlafen. Das verändert die Frage von „Kann er die Aufgabe erledigen?“ zu „Wie weit kommt er, bevor jemand hinsieht?“.

OpenAIs eigene Card gibt einen Hinweis auf die Antwort: Doppelte Kettenlänge, mehr als doppelte Flags.

Also bau keine längere Kette. Bau kürzere Etappen, einen Skeptiker am Ende jeder Etappe und eine Leiter, die dich nur bei den Dingen fragt, bei denen es sich lohnt.

Fünf Schritte, dann prüfen. Das ist alles.

Die Launch-Details stammen aus OpenAIs Dots-Ankündigung. Die Zahlen der System Card basieren auf der Berichterstattung von The New Stack. Die Planpreise stammen aus der Launch-Berichterstattung vom 1. Oktober 2026 und können sich ändern.

Mit einem Klick speichern

Virale Artikel mit YouMind per KI tief lesen

Speichere die Quelle, stelle gezielte Fragen, fasse die Argumentation zusammen und verwandle einen viralen Artikel in wiederverwendbare Notizen in einem einzigen KI-Arbeitsbereich.

YouMind entdecken
Für Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mühsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum Entschlüsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken