YouMind
Anmelden

Warum LLMs nicht gut schreiben können und wie Sherpa das Problem löst

@RohanNayak2
ENGLISCH30. Sept. 2026
324K
612
156
31
639

TL;DR

Pocket-FM-CEO Rohan Nayak erklärt, warum Standard-LLMs aufgrund fehlender Engagement-Signale Schwierigkeiten mit kreativem Schreiben haben. Er beschreibt detailliert, wie Sherpa, ein maßgeschneidertes AI-Harness mit spezialisierten Planern und Gedächtnismodellen, Autoren dabei unterstützt, erfolgreiche serielle Hörspiele zu produzieren.

Als wir auf KI-geschriebene Shows umstiegen, sagten uns unzählige Leute, das würde Pocket FM das Genick brechen. Nach sechs langen Monaten glaubte ich ihnen fast. Doch dann explodierte unser Ökosystem – und zwar nicht trotz der KI-Autoren, sondern genau wegen ihnen. In weniger als zwei Jahren hat unsere KI Autoren dabei geholfen, 161 Blockbuster auf Pocket zu erschaffen, darunter eine IP im Wert von 100 Millionen US-Dollar.

Dass LLMs beim Schreiben anfangs furchtbar waren, zwang uns dazu, eigene Modelle und ein passendes Harness zu entwickeln. Bei null anzufangen, war manchmal ziemlich demotivierend. Es brauchte enorm viel Trial and Error – und einen goldenen Datensatz, den 550.000 Autoren und über 100 Millionen Nutzer auf unserer Plattform erzeugt haben.

Ich erkläre dir, wie wir aus dem Nichts ein perfekt kalibriertes Schreibmodell entwickelt haben, warum Pocket FM das ideale Testfeld dafür ist und was die Geheimzutat hinter Sherpas Fähigkeit ist, echte Blockbuster zu schreiben.


Seit der Veröffentlichung von ChatGPT bemängeln alle, dass es zu sehr nach KI klingt. Sobald du ein LLM bittest, irgendetwas zu schreiben – egal wie lang –, tauchen Gedankenstriche auf, kurze, knackige Sätze schleichen sich ein und das Ergebnis liest sich wie ein einziges großes, langweiliges Stück Arbeit.

LLMs wurden grundlegend für logisches Denken, mathematische Fragen, Programmierhilfe und das Abrufen von enzyklopädischem Wissen entwickelt. Nichts in ihrem Training bringt ihnen bei, etwas zu schreiben, das Menschen freiwillig lesen oder anhören würden. Das ist nicht die Schuld der Modelle.

Reinforcement Learning funktioniert am besten, wenn das Ergebnis an ein klares Erfolgssignal gekoppelt ist, das dem Modell zeigt, ob etwas funktioniert hat. Beim Programmieren läuft der Code entweder und tut, was du wolltest, oder eben nicht. Die Antwort ist eindeutig.

Wenn du etwas schreibst, kannst du nicht sofort erkennen, ob es gut ist. Du weißt nicht, ob der Leser nach dem ersten Satz abgesprungen ist oder bis zum Ende gelesen hat. Noch schlimmer: Frag zehn Personen nach einem bestimmten Buch oder Artikel, den sie gelesen haben, und du bekommst zehn verschiedene Antworten.

Dass wir sowohl Erstellung als auch Distribution kontrollieren, gibt Pocket FM eine absolut einzigartige Position. Wir überwachen die Nutzung Minute für Minute. Wir wissen, wann Nutzer aufhören zuzuhören, ob sie für die nächste Folge zurückkommen und ob sie langfristig dabeibleiben. Bessere Signale gibt es nicht. Was dazu führt, dass ein Nutzer abspringt, lernt Sherpa zu vermeiden; und was Nutzer bei einer bestimmten Show fesselt, nutzt Sherpa für neue Shows.

Rohan Nayak - inline image

Der durchschnittliche Nutzer hört auf Pocket FM über 150 Minuten pro Tag – fast dreimal so viel wie auf YouTube und rund 50 % mehr als auf Netflix. Ich glaube, wir stehen erst am Anfang einer neuen Welle extrem unterhaltsamer, immersiver und hyperpersonalisierter Inhalte, die mit jedem zusätzlichen Datenpunkt noch besser werden.

Warum KI-Texte immer nach KI klingen

Dostojewski war ein unglaublicher Autor, weil er Widersprüche und Emotionen im Verhalten und in den Tiraden seiner Figuren zeigte. Oscar Wilde und Fitzgerald, weil sie ihre geistreichen Texte so wunderschön ausschmückten, dass man einfach weiterlesen musste. Conan Doyle, weil er Informationen bis zur allerletzten Seite vor dem Leser verbergen konnte.

Allgemeine LLMs wurden gebaut, um genau das Gegenteil zu tun – ohne jede Möglichkeit, darin besser zu werden. Sie geben direkte Antworten, schreiben in neutraler Sprache und übernutzen Stilmittel, um ihre Wirkung zu verstärken. Genauso sind gute KI-Assistenten darauf trainiert, dich schnell zur richtigen Schlussfolgerung zu führen. All diese grundlegenden Verhaltensmuster durchziehen ihre Texte – und genau deshalb sind sie schlecht darin.

Kreatives Schreiben braucht Spannung, Emotionen, Aufbau und die langsame Auflösung von Konflikten, Charakterzüge, die über Einzeiler hinausgehen, und Tempowechsel. Leser müssen auf falsche Fährten gelockt werden, während sie gleichzeitig Hinweise bekommen, die sie am Ball halten.

Selbst ein Reasoning-Modell, das länger nachdenkt, arbeitet in der Regel nur darauf hin, das Problem zu lösen – statt dafür belohnt zu werden, wie das Publikum diesen Weg erlebt. Ein Rätsel zu lösen und ein Rätsel zu schreiben, sind zwei völlig verschiedene Dinge.

Wir sind gescheitert, weil wir Bestehendes anpassen wollten

Anfangs dachten wir, wir könnten mit dem arbeiten, was bereits verfügbar war. Wir testeten Standardmodelle und versuchten, sie zu verfeinern, in der Hoffnung, ihr seelenloses Storytelling zu reparieren.

Wir experimentierten damit, immer stärkere Modelle direkt per Prompt anzusprechen, laufende Zusammenfassungen mitzuführen, während sich die Geschichte entwickelte, sowie Retrieval und Knowledge Graphs einzusetzen, um Fragen zu beantworten.

Beim direkten Prompting landest du bei Folge 100 mit 10 bis 20 Ungereimtheiten. Laufende Zusammenfassungen schicken wichtige Details quasi ins Nirwana, was die Geschichte danach beschädigt. Ein größeres Kontextfenster hilft, aber Modelle tun sich bei langen Kontexten trotzdem schwer, Informationen präzise zu nutzen.

Neben dem eigentlichen Output sind Abfragen der beste Maßstab dafür, wie gut ein Modell versteht, was es geschrieben hat. Uns wurde schnell klar: Egal wie viel Aufwand wir in ein Modell steckten, es scheiterte an narratologischen Multi-Hop-Fragen, die Details aus mehreren Episoden erfordern. Das zeigte uns die Grenzen der damaligen Technologie.

Wir kamen zu dem Schluss, dass dieser Weg nicht tragfähig war, und beschlossen, unsere eigene Technologie zu bauen … Sherpa – passenderweise benannt nach dem Führer, der Autoren durch die schwierigsten Teile des Geschichtenerzählens lotst.

Die technischen Gründe, warum Sherpa Geschichten schreibt, die du hören willst

Sherpa ist ein Harness für serielle, kreative Langtexte. Es besteht aus drei Komponenten, die ich nach dieser Einführung genauer beschreibe:

  1. Ein Planer legt fest, was jeder Handlungsbogen und jede Szene erreichen muss, und kümmert sich um Charakterentwicklung und Beziehungsdynamiken.
  2. Ein Narrative World Model führt strukturiert Protokoll darüber, was passiert ist, was jede Figur weiß und welche Versprechen die Geschichte dem Publikum noch schuldet.
  3. Eine Prose Engine formuliert basierend auf diesem Plan und Zustand den Text, während Kritiker das Verhalten der Figuren, die Kontinuität und die Szenenqualität prüfen. Die Überarbeitungen der Autoren und die Reaktionen des Publikums verbessern dann die nächste Iteration.

Die Ergebnisse sind sehr ermutigend. Als Sherpa und verschiedene Konkurrenzmodelle jeweils eine Geschichte von einer leeren Seite aus schrieben, bevorzugten verblindete Paarvergleiche Sherpa in 65,6 % bis 97,1 % der Fälle – je nach Konkurrent. Angesichts von Sherpas Reinforcement Learning und Pockets wachsendem Datensatz gibt es keinen Grund, warum sich dieser Vorsprung nicht weiter vergrößern sollte.

Rohan Nayak - inline image

Gedächtnis – Narrative World Model (NWM)

Sprachmodelle haben zwischen Aufrufen kein Gedächtnis, also muss alles, was sie über eine Geschichte wissen, in den Prompt passen. Längere Kontextfenster lösen das Problem nicht, da Modelle Informationen, die mitten in einem langen Prompt vergraben sind, ungleichmäßig verarbeiten. Auch Retrieval über Rohtext hilft nicht weiter. Eine Suche findet vielleicht die Textstelle, die sagt, wo ein Gegenstand war – aber nicht, wo es jetzt ist.

Wenn eine Episode mit Sherpa finalisiert wird, extrahiert ein Modell daraus strukturierte Datensätze, die jeweils mit der passenden Textstelle verknüpft sind. Die Felder sind speziell für Fiktion gemacht: was Figuren wissen und was noch nicht, wann ein Ereignis stattfand im Vergleich dazu, wann das Publikum davon erfährt, welche Set-ups noch auf ihre Auflösung warten. Jede Tatsache gilt ab dem Kapitel, in dem sie eingeführt wurde, bis zu dem Kapitel, das sie ändert. Wenn ein Autor ein früheres Kapitel überarbeitet, wird alles, was darauf aufbaute, neu generiert.

Um Fragen zu beantworten, durchsucht das NWM den Graphen gleichzeitig nach exaktem Wortlaut und Bedeutung, zieht die direkten Verbindungen jedes Treffers heran und übergibt dem Modell ein kleines, fokussiertes Datenpaket.

Dieses episodenbewusste Retrieval liefert nur relevanten Kanon und ermöglicht Multi-Hop-Reasoning, ohne zukünftige Handlungsstränge zu verraten. In einem internen Benchmark mit 60 Fragen erreichte das Sherpa-NWM eine Genauigkeit von 86,7 % (52/60) bei Kosten von 0,7793 $ pro Durchlauf. Das entspricht der Genauigkeit des Memory-Harness von Claude Code mit Modellen der opus-5.x-Klasse – allerdings bei etwa 21-fach niedrigeren Kosten (16,2172 $ pro Durchlauf). Zudem übertraf es reines Text-Retrieval um 20 Prozentpunkte (von 66,7 % auf 86,7 %) und kostete deutlich weniger.

Rohan Nayak - inline image

Prose Engine: So schwer zu knacken, dass wir ein eigenes Modell bauen mussten

Reinforcement Learning braucht ein Belohnungssignal, und Prosa hat kein offensichtliches. Es gibt keinen Test, der dir sagt, ob ein Absatz nobelpreisverdächtig oder nur Füllmaterial ist.

Sherpa verteilt die verschiedenen Aufgaben des Schreibens auf unterschiedliche Modelle. Jede Figur ist ein Agent, der auf unseren eigenen, nachtrainierten Modellen läuft. Er schlägt vor, was er als Nächstes tun will – basierend auf seiner Persönlichkeit, dem aktuellen Ziel der Geschichte, kürzlichen Ereignissen und den für ihn relevanten Teilen der Welt. Ein separates Kritiker-Modell prüft jeden Vorschlag und weist alles zurück, was vage, unglaubwürdig, untypisch für die Figur, repetitiv ist oder die Geschichte nicht voranbringt. Ein drittes Modell, der Erzähler, wählt dann aus, welche Vorschläge in die Szene passen, und schreibt sie in den nächsten Absatz. Nur die Handlungen, die tatsächlich im Text landen, fließen in das Gedächtnis der Geschichte ein.

Darüber hinaus trainieren wir ein proprietäres Prosamodell mit Reward-Funktionen, die speziell für serielle Fiktion entwickelt wurden. Wir bestrafen überladene Sprache, Wiederholungen und zu viele Erklärungen und belohnen natürliche Dialoge, authentische Stimmen und Spannung.

Signale, anhand derer wir Prosa bewerten:

  • Widerspricht dies etablierten Ereignissen oder dem Wissen der Figuren?
  • Ist die Handlung plausibel, typisch für die Figur und treibt sie die Szene voran?
  • Bevorzugen Autoren diesen Dialog, diese Stimme und dieses Tempo gegenüber einer Alternative?
  • Hören die Zuhörer die Episode zu Ende und kommen sie für spätere Folgen zurück?

Diese Signale wirken auf unterschiedlichen Zeitskalen. Ein Satz kann großartig klingen, aber den Kanon brechen, und ein Cliffhanger kann die Abrufe der nächsten Folge steigern, aber einen ganzen Handlungsbogen schwächen. Sherpa muss über all diese Signale hinweg optimieren, statt Retention als einzigen Score für „gutes Schreiben“ zu behandeln – denn Letzteres ist viel zu subjektiv.

Sherpas Prose Engine übertrifft bereits die meisten Open-Source- und kommerziellen Modelle, die wir in unseren internen Fiktions-Benchmarks getestet haben: mit Präferenzwerten von 69 % gegenüber Sonnet 5 und 94 % gegenüber Gemini 3.1 Pro. Jeder Balken zeigt die Präferenz für Sherpas Text gegenüber dem jeweiligen Modell, bewertet in beiden Darstellungsreihenfolgen, wobei 50 % Gleichstand bedeutet. Das sind frühe Ergebnisse aus dem laufenden Post-Training, und wir erwarten weitere Verbesserungen, während das Training fortgesetzt wird.

Rohan Nayak - inline image

Hierarchischer Story Planner

Die Struktur einer Geschichte ist eine Eigenschaft der gesamten Show, aber Sprachmodelle generieren immer nur das nächste Fragment. Nichts in der Next-Word-Prediction weiß, dass ein Hinweis in Folge 5 seine Auflösung in Folge 60 braucht, oder dass dieses Kapitel ein Ziel, einen Konflikt und ein Ergebnis benötigt. In einer 100-seitigen Geschichte eines Frontier-Modells fand ein KI-Editor, der nur fünf Kapitel stichprobenartig prüfte, 52 strukturelle Probleme: Handlungsfäden, die nicht funktionierten, und Kapitel, die die Geschichte gar nicht brauchte.

Sherpas Planer arbeitet von der Gesamterzählung über Handlungsbögen und Episoden nach unten und gibt jeder Szene eine Aufgabe – inklusive dem, was sie unaufgelöst lassen muss, damit Folge 20 die Enthüllung in Folge 80 vorbereiten kann, ohne sie vorwegzunehmen. Jedes Set-up wird als offenes Versprechen im Story-Gedächtnis gespeichert, bis es eingelöst wird. Ein Zielgenerator hält die Geschichte in Bewegung: Wenn ein Ziel erreicht wird oder ins Stocken gerät, setzt er ein neues, das keines der früheren Ziele wiederholt. Im selben 100-Seiten-Test sanken die strukturellen Probleme von 52 auf 31, und allein das Entfernen der Ziel-Updates verbesserte die Kritik auf Kapitelebene um fast die Hälfte.

Rohan Nayak - inline image

Alles ist bereit, damit Sherpa Autoren in den nächsten Jahren dabei helfen kann, Milliarden-Dollar-IPs zu erschaffen. Sherpa wird mit jedem weiteren Creator und Nutzer auf unserer Plattform kontinuierlich besser.

Es liegt noch viel Arbeit vor uns, und viele Fragen sind offen. Sherpa zu perfektionieren gehört dazu – genauso wie die logistischen Voraussetzungen zu schaffen, damit Autoren es optimal nutzen können.

Ich bin unglaublich begeistert von dem, was wir bei Pocket FM machen. Wir helfen Creators, ihren Lebensunterhalt mit Geschichten zu verdienen, für die man vor ein paar Jahren noch ein Millionenbudget gebraucht hätte.

Wir stehen noch ganz am Anfang einer Chance im Billionen-Dollar-Bereich.

In YouMind remixen

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Für Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mühsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum Entschlüsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken