In den letzten 3 Jahren habe ich weit über 2.000 Stunden mit KI programmiert und persönlich einige der produktivsten Menschen im Bereich des Agentic Engineering interviewt.
Unten findest du mein vollständiges Agentic Engineering Setup, wie es aktuell im dritten Quartal 2026 aussieht.
Interface
Damit ist die UI / CLI gemeint, wie du mit Agenten interagierst. Mein Hauptinterface ist bb.
Es ist Open Source, völlig kostenlos und ermöglicht es dir, jedes Abonnement, jeden Agenten, jedes Modell in einer einzigen GUI zu nutzen. Codex, Claude Code, Pi, Cursor CLI, OpenCode, Grok Build, Hermes – alles in derselben Benutzeroberfläche.
Das Problem mit Apps wie Codex oder Cursor ist, dass sie nur ihre eigenen Modelle und ihr eigenes Abonnement zulassen. Das Ziel ist es, die meisten Tokens für das wenigste Geld zu bekommen.
Alle Funktionen, die du an den Codex- oder Cursor-Apps magst, sind in bb enthalten, und es wird jede Woche besser (außerdem ist es vollständig Open Source und 100 % kostenlos nutzbar).
Eine weitere Sache, die ich oft nutze, ist cmux.
Wenn du einen neuen cmux-Arbeitsbereich startest, kannst du den Bildschirm genau wie in tmux aufteilen (daher der ähnliche Name), verschiedene Terminals in jedem Bereich starten, und es gibt einen integrierten Browser.
Wo cmux an seine Grenzen stößt, ist, wenn du viele Agenten und Arbeitsbereiche hast. Die linke Seitenleiste ist wirklich nicht das richtige Grundkonzept. In Ordnung für ein paar gleichzeitige Aufgaben, aber für ernsthafte agentische Ingenieursarbeit in großem Maßstab nicht optimal.
Ich verwende Ghostty als mein Terminal, weil es sehr schnell und nativ ist.
Innerhalb von Ghostty kannst du Herdr ausführen, was im Grunde tmux, aber für Agenten ist – eine Backend-Laufzeitumgebung für Agenten. Sehr minimalistisch, sehr leichtgewichtig, lebt im Terminal, und wenn ein Agent fertig ist, wird sein Status links angezeigt: erledigt, im Leerlauf, blockiert, läuft.
Die Verfolgung der Zustände von KI-Agenten ist UNERLÄSSLICH. Meine Vorhersage ist, dass diese "Agentenzustandsverfolgung" in 3 bis 6 Monaten immer wichtiger wird, weil du nicht mit einem einzigen Agenten sprechen wirst. Du wirst mit einem Manager-Agenten sprechen, der viele Arbeiter-Agenten verwaltet.
Das letzte Interface, das ich erwähnen muss, ist Corral, etwas, das ich selbst entwickelt habe.
Anstatt zufällig zwischen Agenten zu wechseln, wenn sie fertig sind (in Herdr gibt es keine wirkliche Reihenfolge), hat jeder Agent eine Priorität. So wie Aufgaben unterschiedliche Prioritäts-/Wichtigkeitsstufen haben. Wenn ein P1-Agent fertig ist, kommt er nach oben. Du solltest niemals auf einen P4-Agenten antworten, wenn ein P1-Agent seine Ausführung beendet hat. (Ja... ich muss Corral wirklich noch als Open Source veröffentlichen. Bin noch nicht dazu gekommen.)
Modelle und Abonnements
Du willst die meisten Tokens für das wenigste Geld, das möglich ist. Das sollte eines der Hauptziele jedes Agentic Engineers sein (neben dem Erledigen der Arbeit).
Es gibt derzeit 4 Hauptabonnements, und ja... das könnte in 2 Monaten schon ganz anders aussehen.
Das beste "Preis-Leistungs"-Angebot ist derzeit OpenCode Go. Es kostet nur 10 $ und gibt dir Kimi K3, Grok 4.6, GLM 5.3, DeepSeek V4 Pro und viele andere Modelle... Aber es hat nicht die besten Modelle wie Fable 5 und GPT-5.6 Sol (außerdem sind die Nutzungslimits recht gering).
Wenn du also etwas mehr Geld hast, solltest du Folgendes tun:
- 30 $ – Hol dir OpenCode Go + ChatGPT Plus (20 $)
- 50 $ – Füge das 20 $-Claude-Code-Abonnement hinzu.
- 70 $ – Füge Cursor für 20 $ im Monat hinzu, und du hast die günstigste Stufe aller Abonnements.
- 110 $ – OpenCode plus einen der großen Tarife. Der 100 $-ChatGPT-Tarif bietet dir ein besseres Angebot als Claude. So ist es nun mal. OpenAI hat mehr Rechenleistung und ist bereit, diese stärker zu subventionieren.
- 210 $ – Hol dir einfach beide 100 $-Tarife.
- Und wenn du es wirklich ernst meinst (wie ich), hol dir einfach alle 200 $-Tarife (Codex, Claude, Cursor), denn das ist die 20-fache Nutzung, und diese Tarife bieten dir das beste Angebot.
Übrigens... der Cursor-Tarif wird stark unterschätzt. Cursor, auch bekannt als Grok, wird aufgrund der SpaceX-Übernahme zu einem großartigen Abonnement. SpaceXAI hat jede Menge Rechenleistung, also können sie das Spiel der Subventionierung mitspielen. Und – ich denke – der Cursor/Grok-Tarif gibt dir separate Limits für Cursor + Grok Bot, was einfach unglaublich ist.
Grok Bot wird schnell zur neuen Art und Weise, wie Menschen mit Agenten interagieren, daher war ein Cursor-Abonnement noch nie so wichtig (nicht gesponsert lol, es ist einfach wahr). Außerdem steht das neue Modell – Grok 4.7 – kurz bevor.
Egal was passiert, bezahle nicht die API-Preise. Das ist das schlechteste Angebot da draußen. Hol dir einfach die Abonnements.
Cloud-Agenten
Es ist ziemlich offensichtlich, dass Cloud-Agenten die Zukunft sind. Cursor, Amp, Devin, Codex... all diese Unternehmen setzen alles auf Cloud-Agenten.
Der Beweis, dass Cloud-Agenten die Zukunft sind, ist die folgende Grafik.
[Bild hier]
Dies ist Cursors interner Anteil der gemergten PRs von Cloud-Agenten: etwa 10-15 % zu Beginn dieses Jahres, jetzt annähernd 60 %. Und das sind gemergte PRs, die Dinge, die tatsächlich verwendet werden. Bald genug wird das 70 %, dann 80 % und dann 90 % sein.
Das Problem, alle Agenten lokal auf deinem Rechner auszuführen, ist, dass es nicht skalierbar ist. Du kannst nicht Hunderte von Agenten gleichzeitig ausführen. Es reicht, wenn ein paar Agenten beschließen, gleichzeitig deine gesamte Testsuite auszuführen, und dein Computer fängt an, seltsame Geräusche zu machen (selbst mein 7.000 $-MacBook-Pro hat damit zu kämpfen).
Cloud-Agenten bieten dir isolierte Umgebungen, persistente Sitzungen, dauerhaften Zugang zu Internet und Strom. Wenn du deinen Laptop zuklappst, verlierst du deine Sitzungen. Verlierst du für ein paar Minuten das Internet, können sich die Umgebungen nicht selbst erholen.
Das Problem mit den bestehenden Cloud-Agenten-Lösungen ist das WAHNSINNIGE Maß an Ökosystem-Bindung. Das Einrichten der Umgebungen und all deiner Geheimnisse dauert viele Stunden, und dann bist du gebunden: deine Sitzungen sind dort, du bist an ihre Preise gebunden, und du gibst ihnen all deine Daten. Selbst wenn sie keine Modelle damit trainieren, gibt es so viele andere Möglichkeiten, deine Daten zu nutzen.
Die Lösung ist, einen eigenen Server zu haben. Und dank KI dauert das etwa 10 Minuten (im Ernst). Hol dir einfach einen VPS, installiere Herdr darauf und verbinde dich per SSH damit.
Herdr gibt dir persistente Agentensitzungen, und SSH ermöglicht es dir, dich von deinem Telefon, deinem Laptop, von allem aus zu verbinden. Du kannst buchstäblich das 80/20 der Cloud-Agenten für ein paar Dollar erreichen, ohne die Bindung.
Baue deine eigene Cloud-Umgebung
Ich verwende Hostinger für meine VPSs, und ein KVM2-Plan reicht aus. Hier ist die Hauptsache, die ich rüberbringen möchte... du musst kein Experte in VPS, DevOps, Linux oder all dem sein.
Sprich einfach in einfachem Englisch mit deinem Agenten!!!
Im kommenden Video richte ich das Ganze live ein. Einen cmux-Arbeitsbereich, einen Codierungsagenten im linken Bereich (Cursor CLI mit Grok 4.6), einen leeren Terminalbereich rechts.
Meine cmux-Fähigkeit erlaubt es dem Agenten, diesen anderen Bereich zu finden und darin Befehle auszuführen. Ich habe mich selbst per SSH mit dem frischen VPS verbunden und dann dem Agenten gesagt: "Lerne alles über diesen Server und richte die Entwicklungsumgebung ein. Herdr, Node.js, Python 3, Git".
Es analysierte den VPS in Sekunden, installierte alles, startete Herdr, installierte dann Pi Agent, fand einen OpenRouter-Key auf meinem MacBook und durchlief die gesamte Einrichtung selbst. Ein paar kurze Eingabeaufforderungen später hatte ich Pi mit GPT-5.6 Sol und eine zweite Sitzung mit Fable laufen, beide in der Cloud, auf meinem eigenen VPS, mit vollem Root-Zugriff.
Wenn etwas mit meinem Computer oder WLAN passiert... Wenn mein MacBook explodiert, laufen diese Agenten weiter. Die vollständige Schritt-für-Schritt-Anleitung gibt es im Video. Link zu meinem YouTube hier.
Noch eine Sache zur Geschwindigkeit... Ich diktiere mit SuperWhisper. Die meisten von euch, die das lesen, tippen wahrscheinlich mit 40 oder 50 Wörtern pro Minute. Das ist sehr langsam.
ABER! Du kannst mit 250+ Wörtern pro Minute sprechen. Ein Sprach-KI-Tool (wie Superwhisper, Glaido, Whispr FLow) macht dich sofort 3-4x schneller beim Senden von Eingabeaufforderungen. Nutze eines. Sei nicht dumm.
Geschirr (Harness)
Das erste Geschirr, das ich erwähnen muss, ist Pi Agent, der GOAT.
Das minimalistischste Geschirr da draußen: nur 4 Werkzeuge, läuft immer im YOLO-Modus, unterstützt jedes Modell, jeden Anbieter. Sehr elegant, super konfigurierbar, und deshalb bauen so viele Leute auf Pi auf. Es ist Open Source, völlig kostenlos, geh einfach zu pi.dev und hol es dir. Nicht verhandelbar. Es ist das erste Geschirr, das ich auf den VPS setze.
Cursor CLI. Wird stark unterschätzt, weil du alle Modelle nutzen kannst: Grok, GPT-Modelle, Anthropic-Modelle, Kimi. Du kannst Fähigkeiten markieren und Nachrichten vorab senden. Insgesamt ein großartiges Geschirr.
Die nächste Kategorie von Geschirren nenne ich gerne "selbstverbessernde" Geschirre.
Die beiden bekanntesten sind Hermes Agent und Prime Agent. Diese sind für den Fall, dass du nicht weißt, was du tust. Wenn eine Aufgabe viele Unsicherheiten und viel zu klären hat, verwende ein selbstverbesserndes Geschirr, weil es Fähigkeiten entwickelt und sich im Laufe der Zeit mit dir verbessert.
Und schließlich die Klassiker, Claude Code und Codex. Ich habe sie als Aliase. Viele Leute tippen jeden Tag claude --dangerously-skip-permissions. Extrem langsam, extrem ineffizient. Ich tippe cc und es startet Claude Code mit umgangenen Berechtigungen; cx startet Codex im YOLO-Modus.
DU MUSST globale Aliase für die langen Befehle erstellen, die du oft ausführst. Das ist eines der Gesetze des Agentic Engineering: Wie kannst du in der gleichen Zeit mehr erledigen?
Fähigkeiten (Skills)
Mein Fähigkeiten-Repository wurde letzten Monat viral. (siehe github.com/davidondrej/skills ) Es ist ebenfalls völlig kostenlos, Open Source, all das.
Die für das Agentic Engineering relevantesten FÄHIGKEITEN sind:
\*(1) /total-review
- Es führt zwei andere Fähigkeiten aus, /gpt-review und /fable-review, die alle Codeänderungen überprüfen, die du gerade mit GPT-5.6 Sol und Fable 5 vorgenommen hast, und dann beide Listen zu einer einzigen Liste der Probleme deduplizieren, die tatsächlich wichtig sind. Es ist, als würdest du all deine klügsten Freunde bitten, deine Bewerbung zu überprüfen, und sie geben dir nur die größten Probleme. Führe es bei mittleren bis großen Änderungen aus, besonders wenn ein anderes Modell sie erstellt hat. Wenn Grok 4.6 die Arbeit erledigt hat, möchtest du ein völlig anderes Modell, das sie überprüft.
WICHTIG: Alles, was du oft genug wiederholst, sollte zu einer Voreinstellung werden.
Wenn es ein einzelner Schritt ist, verwende Textersetzungen. Ich habe sie als Raycast-Schnipsel. "Antworte kurz in einfachem Englisch." "Mache deine vorherige Antwort einfacher und kürzer." "Stage alle Dateien, schreibe einen klaren Commit, pushe zu GitHub."
Wenn es ein mehrstufiger Workflow ist, mache daraus eine Fähigkeit.
(2) /ask-then-build
- Ich verwende diese Fähigkeit jeden Tag, vor jedem Bauen. Anstatt zu sagen "mach das Windows-kompatibel" und das Modell stillschweigend wichtige architektonische Entscheidungen treffen zu lassen, die du später bereuen könntest, führt es dich Schritt für Schritt durch die wichtigsten Entscheidungen, mit Optionen. KI-Modelle sind großartig im Programmieren, großartig in der Implementierung. Sie haben keinen Geschmack. Sie haben kein gutes Urteilsvermögen. Du, als Mensch, musst dafür verantwortlich bleiben.
(3) /deepapi
- Diese Fähigkeit verwende ich für jede tiefgehende Recherche, jedes Scraping, alles Webbezogene. Codex und Claude Code haben eine grundlegende Websuche, aber kein Scraping, keine tiefgehende Recherche, und sie werden leicht blockiert. Führe 8 schnelle Websuchen durch und gib mir die Top-3-Optionen, scrap Twitter, scrap GitHub, finde 3 Möglichkeiten, eine Person zu kontaktieren. Jeder in meinem Team verwendet es. Ein Muss.
(4) Leitplanken und Push-Sperre
- Langweiliger, aber absolut unerlässlich, und du richtest sie nur einmal ein. Globale Agenten-Leitplanken sind ein Pre-Tool-Call-Hook, der sicherstellt, dass deine Agenten niemals deine Festplatte löschen, niemals den Git-Verlauf überschreiben, niemals deinen Passwort-Manager anfassen. Und Push-Sperre, für den Fall, dass du 15+ Agenten parallel laufen hast: eine OS-Level-Kernel-Sperre für das gesamte Schiff. Merge, verifizieren, pushen, CI, deployen, Health Check.
Installiere nicht alle meine Fähigkeiten. Schnapp dir einfach die, die du brauchst.
Arbeitsbäume (Worktrees)
Ein Worktree ist im Grunde eine Kopie deines primären Checkouts in einen separaten Ordner und erstellt dort einen neuen Git-Branch, sodass Agenten parallel und völlig isoliert arbeiten können.
Bei einem kleinen Projekt ist das völlig übertrieben. Bleibe auf einem einzigen Branch und arbeite schneller.
Bei mittleren bis großen Projekten, in denen du ständig 20-30+ Agenten laufen hast, gibt es keinen Weg daran vorbei. Ohne Worktrees werden die Agenten in Konflikt geraten, die Änderungen der anderen rückgängig machen und sich gegenseitig bekämpfen. Eine weitere gute Sache an BB: Es hat integrierte Worktrees. Es merkt sich, dass ich bei meinen großen Repos immer einen neuen Worktree basierend auf origin/main haben möchte.
Weitere Tipps zum Agentic Engineering
Wisse, wann du welches Modell einsetzen solltest.
- Einen Plan entwerfen oder ein neues Projekt starten? Fable. Es hat die meisten Geistesblitze. Einen tiefgreifenden, ernsthaften Bug beheben? GPT-5.6 Sol, maximale Denkanstrengung. Standardmäßiges Chatten? Grok 4.6 auf hoch. Fast die gleiche Intelligenz, aber 2x günstiger und 2x schneller. Frontend? Kimi K3.
- Und wenn ein großes neues Modell veröffentlicht wird, nimm dir einen Tag, an dem du nur dieses Modell verwendest. Höre nicht auf Twitter. Probiere es selbst aus.
Wisse, wann du überprüfen solltest.
- Ich führe nicht bei jeder Änderung ein total review durch. Eine kleine Frontend-Anpassung geht sofort in die Produktion.
- Und mache NIEMALS rekursive Überprüfungen. Wenn du einem Modell sagst "finde die 5 größten Probleme", wird es 5 Probleme finden, selbst wenn die Codebasis völlig in Ordnung ist. Diese Modelle erfinden imaginäre Bugs.
Vorab-Senden.
- Normalerweise weiß ich, was der Agent als Nächstes tun wird, also stelle ich die Nachrichten im Voraus in die Warteschlange: "den Plan umsetzen", "Fable-Review dazu ausführen", "jetzt diese Dinge beheben".
- Manchmal sind es 2 Nachrichten, manchmal 6.
- Verwende niemals ein Geschirr, das dir kein Vorab-Senden erlaubt.
Subagenten werden übermäßig genutzt.
- Viele Leute verbrennen einfach ihre Limits damit. Ich verwende sie, wenn ich die Kontrolle habe. Ich möchte auswählen, welches Modell im Subagenten läuft, weil ich weiß, welche Abonnements und Limits ich habe.
- Die Zukunft ist ein Manager-Agent, der Arbeiter startet, aber du musst dieses System immer noch entwerfen: die Regeln, die Berechtigungen, die Bedingungen, unter denen ein Subagent gestartet wird. Ich möchte nicht, dass irgendein Typ bei Anthropic oder OpenAI das für mich entscheidet.
ADRs.
- So bringst du Entscheidungen in eine Codebasis. /docs/adr ist einer der ersten Ordner, die ich in jedem Projekt erstelle.
- Jede zentrale architektonische Entscheidung bekommt eine kurze Datei: was entschieden wurde, warum, und wie der Stand des Projekts zu diesem Zeitpunkt war. Manche Dinge können aus dem Code gelesen werden, aber nicht alles.
- Die Dinge, die das nicht können, sollten dokumentiert werden, damit zukünftige Agenten und Menschen sofort verstehen, warum es so gebaut wurde.
Tests.
- Aktuelle Modelle BLÄHEN dein Repository mit Tests auf: Unit-Tests, Integrationstests, Datenbanktests, selbst bei den kleinsten Repos, wo es keinen Sinn ergibt.
- Wenn du dem Modell sagst, es soll Tests hinzufügen, fügt es eine wahnsinnige Menge hinzu. Wenn du sagst "füge keine Tests hinzu", fügt es trotzdem einige hinzu, und du landest bei der richtigen Menge.
Produktions-DB-Zugriff.
- Jedes Produkt mit echter Nutzung muss das tun... erstelle eine schreibgeschützte Postgres-Rolle und gib deinen Agenten diese.
- Gib ihnen keinen Schreibzugriff. Es reicht eine irreversible Änderung, und du wirst es bereuen.
- Aber auch kein Zugriff ist ein Fehler. Mit schreibgeschütztem Zugriff kannst du jede Funktion auf Realitätscheck prüfen. Passiert das überhaupt in der Produktion? Nutzen die Leute das überhaupt? Ich wünschte, ich hätte das früher getan.
Verfolge deine agentische Produktivität.
- Wir haben gerade ein neues Open-Source-Repository unter Vectal Labs namens agentic-productivity veröffentlicht. Es verfolgt deine Commits, deine Agentensitzungen und deine Benutzereingabeaufforderungen.
- Jede einzelne Metrik für sich ist schlecht, aber kombiniere die 3 und betrachte den langfristigen Trend, und du kannst sehen, ob du tatsächlich ein besserer Agentic Engineer wirst.
Das ist das Setup, wie es derzeit aussieht. In einem Monat wird es wahrscheinlich anders sein. Das ändert sich ständig.
von David Ondrej (für YouTube gesprochen, dann für das Artikelformat neu geschrieben)





