Ich habe einen einzigen Satz gefunden, der die Qualität meiner KI-Ergebnisse massiv verbessert hat. Bevor ich dir verrate, welcher das ist, wirf einen Blick auf diese beiden Websites, die mit nahezu identischen Prompts erstellt wurden.


Ich vermute, dir gefällt das Design von Marginalia besser als das von Folio. Hier sind die Prompts, die ich jeweils verwendet habe:
Erstelle eine responsive Lesezeichen-App. Nutzer können Bücher hinzufügen, sie als gelesen markieren und zwischen gelesenen und ungelesenen Büchern filtern. Speichere die Liste über Seitenaktualisierungen hinweg. Sie muss auf Desktop und Mobilgeräten funktionieren.
Du bist der beste UX/UI-Designer der Welt.
Erstelle eine responsive Lesezeichen-App. Nutzer können Bücher hinzufügen, sie als gelesen markieren und zwischen gelesenen und ungelesenen Büchern filtern. Speichere die Liste über Seitenaktualisierungen hinweg. Sie muss auf Desktop und Mobilgeräten funktionieren.
Allein dieser eine Satz, der dem Modell sagt, dass es in etwas das Beste der Welt sei, hat einen riesigen Unterschied gemacht. Man sieht ihn bei der Schriftwahl, beim Layout der Seite, beim Einsatz von Farben, bei den Abständen zwischen den Abschnitten und in der UX-Hierarchie.
Beide nutzten GPT-6 Astra Ultra, liefen in leeren Ordnern und wurden gleichzeitig erstellt – ohne voneinander zu wissen. Ich habe die Traces geprüft, um sicherzugehen, dass es keine Vermischung gab. Kleine Designdetails änderten sich bei wiederholten Durchläufen, aber der zusätzliche Satz gewann jedes Mal.
Ich mache das mittlerweile bei den meisten meiner Prompts. Ich sage Claude oder Chat, dass sie die besten Designer der Welt sind, ein erfahrener Software-Architekt, der renommierteste Autor weltweit, der intelligenteste Investor usw. Das Ergebnis: deutlich besserer Code, mehr gefundene Bugs und klarere Texte.
Also habe ich versucht, das zu automatisieren
Das manuelle Einfügen fand ich schon immer lästig, also habe ich einen Skill gebaut, um mir Tipparbeit zu sparen und weniger babysitten zu müssen. Ein Skill ist einfach eine Reihe von Anweisungen, die dein Agent wiederverwenden kann. Du findest ihn auf GitHub; Installationsanweisungen stehen am Ende. Wie sich herausstellte, war das Erstellen des Skills deutlich aufwendiger als gedacht.
Beim ersten Versuch bat ich Astra, einen Skill zu generieren, der zuverlässig genau den Unterschied erzeugt, den ich zwischen Folio und Marginalia gesehen hatte. Ich wies es an, das Modell so zu framen, als wäre es das Beste der Welt in genau der Expertise, die für die jeweilige Aufgabe nötig ist. Ich gab ihm beide Prompts und ließ es machen. Es scheiterte.
Astra baute ein episch kompliziertes Regelwerk, und mein eigentlicher Prompt ging darin unter. Ein Blick auf den Reasoning Trace zeigte: Wegen dieser ganzen Komplexität wurden die Anweisungen komplett ignoriert.
Aber ich war zu faul, den Skill selbst zu schreiben. Also ließ ich Astra einen zweiten Versuch starten – diesmal mit der Vorgabe, so lange zu iterieren, bis eine nachweisbare Verbesserung durch den Skill sichtbar wird. Die Schleife, die dabei entstand, hat mich wirklich beeindruckt: Mehrere Subagenten bearbeiteten den Skill, testeten ihn und prüften die Ergebnisse jedes Prompts. Für jeden Test wurde ein eigener Container erstellt. Ich war skeptisch, ob Hill Climbing für eine simple Prompting-Aufgabe sinnvoll ist, ließ es aber laufen. Nach 20 Minuten kam die Meldung, dass der Gipfel erreicht sei – und das Testergebnis war perfekt.
Es gab nur ein Problem: Tief im Skill versteckt war ein Prompt, der exakt auf dieses Beispiel zugeschnitten war. Als ich Chat damit konfrontierte, kam folgende Antwort: „Du hast recht – ich habe einen universellen Skill zu stark auf unseren UI-Testfall overfitted.“ Also entfernten wir die aufgabenspezifischen Formulierungen, und der Skill war wieder nutzlos.
Worauf hat das Modell eigentlich geachtet?
Ich hatte zwei Vermutungen, warum mein „Beste der Welt“-Framing funktionierte:
- Der höhere Anspruch zwang das Modell zu mehr Iterationen
- Die Rolle als UI/UX-Designer betonte, wie wichtig gutes Design ist
Ich sah mir die Reasoning Traces meiner erfolgreicheren Durchläufe noch einmal an und fand Belege für beides. Es gab sowohl eine zusätzliche Designphase als auch insgesamt mehr Reasoning-Aufwand. Der Skill, den ich gebaut hatte, nannte die Rolle „Frontend Engineer“, weshalb mehr Zeit in die Robustheit der Anwendung und in Edge Cases floss, die Bugs verursachen könnten. Beide Rollen waren wichtig, aber die KI entschied sich dafür, sich auf technische Korrektheit und das exakte Erfüllen der ursprünglichen Prompts zu konzentrieren. Wie konnte ich sie weiter pushen?
Also stellte ich mir zwei Fragen:
Wenn jede einzelne Anforderung erfüllt ist – woran könnte das Ergebnis in der Praxis trotzdem scheitern?
Warum würde das Publikum einem von zwei gleichermaßen korrekten Ergebnissen den Vorzug geben?
Was am Ende funktioniert hat
Heraus kam dieser vierstufige Prozess, der der KI konkrete Rollen zuweist und sie dann zu einem höheren Qualitätsstandard treibt:
- Vor der Umsetzung die entscheidenden Stärken definieren. Was soll das Ergebnis herausstechen lassen? LLMs brauchen einen klaren Fokus, um Top-Ergebnisse zu liefern. Einfach nur „bau die beste Website“ funktioniert nicht so gut wie: „Entwirf die beste UX für diese Website, achte auf Abstände, Schriften und Farben im UI und teste es aus Nutzersicht, um jede Reibung zu vermeiden.“ Den letzten Prompt manuell zu formulieren ist mühsam, aber ein Prompt, der das LLM zwingt, vorab die nötigen Rollen meta-analytisch zu bewerten, liefert ähnliche Ergebnisse. Bei menschlichen Mitarbeitern ist es genauso: Wer weiß, worauf er achten muss und wie er seine Gedanken strukturieren soll, arbeitet produktiver. Wir müssen definieren, durch welche Brille die KI die Aufgabe betrachtet – aber damit der Skill universell bleibt, muss die KI selbst entscheiden, wie diese Brille aussieht. Dass wir dabei etwas Performance verlieren, weil wir diese Verantwortung an die KI abgeben (die vielleicht nicht exakt die Absichten des Nutzers im Kopf hat), lässt sich kaum vermeiden. Meine bisherigen Tests deuten aber darauf hin, dass wir ziemlich nah ans Optimum kommen.
- Den Standard anhand einer Referenz kalibrieren. Nimm eine starke, passende Referenz oder erstelle eine kleine, konkrete Alternative. So bekommt „exzellent“ etwas Greifbares zum Vergleichen. Nach einem perfekten Testergebnis sucht die KI eine passende Referenz oder baut eine Alternative. Bei einer Website könnte das ein neues Layout sein. Mit einer Vergleichsmöglichkeit bedeutet „mach es exzellent“ plötzlich viel mehr.
- Handwerk getrennt von Korrektheit prüfen. Frag dich: „Wo ist das hier nur Mittelmaß, und welche konkrete Verfeinerung würde das Erlebnis der Zielgruppe am meisten verbessern?“ Betrachte das Gesamtbild und wie die Teile zusammenspielen. Das macht Ergebnisse stimmiger – egal ob es um die Struktur eines Essays oder das Gesamtthema einer Website geht.
- Verfeinern und das stärkere Ergebnis behalten. Mehr Änderungen bedeuten nicht automatisch bessere Arbeit. Der Skill bewahrt die vorherige Version, vergleicht inhaltliche Änderungen und behält das stärkere Ergebnis. Macht eine Änderung alles schlimmer, wird sie zurückgerollt. Sonst hinterlässt der ganze Extra-Aufwand am Ende nur Chaos.

Das Endergebnis nutzt Farben und Schriften gekonnt, mit optisch ansprechenden Abständen. Es hat einiges von der Unruhe reduziert, die mich bei Marginalia gestört hat (laut Reasoning Trace eine bewusste Entscheidung), setzt aber Farben und Elementdesign in Sidebar und Selektoren deutlich besser ein als Folio.
Warum ist das nicht längst in den Tools eingebaut?
Jedes Framework wie Codex oder Claude Code muss Qualität, Geschwindigkeit und Kosten abwägen. Irgendwann muss der Agent entscheiden, dass die Arbeit gut genug ist.
Aber „gut genug“ lässt noch enorm viel Luft nach oben. Egal welches Tool ich nutze – alle hören früher auf, als mir lieb ist. Ich investiere die zusätzlichen Tokens lieber in ein besseres Ergebnis. Und ganz wichtig: „Besser“ braucht eine konkrete Grundlage. Wie sieht ein starkes Ergebnis aus? Welcher Teil ist noch bloß Mittelmaß? Und hat die letzte Änderung wirklich etwas verbessert?
Probier es selbst aus
Ich habe diesen gesamten Prozess in Prompt Lab gepackt.
Prompt Lab auf GitHub herunterladen
Zur Installation füge dies in Codex ein:
1$skill-installer Installiere den Skill von https://github.com/coltonconley/prompt-lab/tree/main/skills/prompt-lab
Falls der Skill nach der Installation nicht auftaucht, starte Codex neu. Füge ihn dann vor deiner eigentlichen Aufgabe ein:
1$prompt-lab2[Deine Aufgabe, Einschränkungen, Zielgruppe und das gewünschte Ergebnis]
Du musst weder die Expertenrollen auswählen noch den Prüfprozess ausformulieren. Gib einfach den Kontext und die Einschränkungen an, die du normalerweise nutzen würdest – besonders alles Wichtige darüber, für wen das Ergebnis gedacht ist. Und dann lass es laufen.
Mein Tipp: Probier es mit etwas aus, das du die KI schon einmal tun lassen hast, womit du aber nicht zufrieden warst. Führe dieselbe Aufgabe in neuen Chats durch – einmal mit und einmal ohne den Skill, mit demselben Modell und denselben Einstellungen. Vergleiche die tatsächlichen Ergebnisse und entscheide, ob die Verbesserung den Mehraufwand wert war.
Mich interessieren besonders Beispiele jenseits von Webdesign. Schreiben, Programmieren, Analysen – was auch immer du konkret mit KI machst. Wenn es bei dir funktioniert (oder auch nicht), antworte mit deinem Prompt sowie dem Vorher-Nachher-Vergleich. Je mehr Beispiele ich habe, desto besser wird der Skill.





