Lorsque nous avons pivoté vers des séries écrites par l'IA, d'innombrables personnes nous ont prédit que cela signerait la fin de Pocket FM. Après six longs mois, j'ai failli les croire. Mais notre écosystème a ensuite explosé : non pas malgré l'écriture par IA, mais grâce à elle. En moins de 2 ans, notre IA a aidé nos auteurs à créer 161 succès retentissants sur Pocket, dont une propriété intellectuelle (IP) valorisée à 100 millions de dollars.
Le fait que les LLM soient catastrophiques en écriture nous a obligés à construire nos propres modèles et notre propre infrastructure sur mesure. Repartir de zéro s'est parfois révélé décourageant. Il a fallu une quantité phénoménale d'essais et d'erreurs, ainsi qu'un jeu de données en or produit par 550 000 auteurs et plus de 100 millions d'utilisateurs sur la plateforme.
Je vais vous expliquer comment nous sommes passés de rien à un modèle d'écriture magnifiquement calibré, pourquoi Pocket FM est le terrain d'expérimentation idéal, et quel est l'ingrédient secret qui permet à Sherpa d'écrire des blockbusters.
Depuis la sortie de ChatGPT, tout le monde souligne que son style fait trop « IA ». Quand vous demandez à un LLM d'écrire quoi que ce soit, quelle que soit la longueur, les tirets cadratins apparaissent comme par magie, les phrases courtes et percutantes s'invitent dans le texte, et le résultat ressemble à un gros bloc ennuyeux.
Les LLM ont été fondamentalement conçus pour le raisonnement logique, répondre à des questions mathématiques, aider au codage et restituer des connaissances encyclopédiques. Rien dans leur apprentissage ne leur enseigne à rédiger un texte qu'un lecteur aurait envie de lire ou d'écouter. Et ce n'est pas la faute des modèles.
L'apprentissage par renforcement fonctionne mieux lorsque le résultat est lié à un signal de réussite clair, ce qui indique au modèle si une approche a fonctionné. En programmation, le code fonctionne et fait ce que vous avez demandé, ou il échoue. La réponse est binaire.
Quand vous écrivez, impossible de savoir immédiatement si c'est bon. Vous ignorez si le lecteur a décroché après la première phrase ou s'il est allé jusqu'au bout. Pire encore : demandez à 10 personnes ce qu'elles pensent d'un livre ou d'un article précis qu'elles ont lu, et vous obtiendrez 10 réponses différentes.
Maîtriser à la fois la création et la distribution place Pocket FM dans une position unique. Nous surveillons l'utilisation minute par minute. Nous savons quand les gens arrêtent d'écouter, s'ils reviennent pour l'épisode suivant et s'ils restent sur la durée. Il n'existe pas de meilleurs signaux. Tout ce qui fait fuir un utilisateur, Sherpa apprend à l'éviter ; et tout ce qui maintient l'utilisateur accroché à une série spécifique, Sherpa l'exploite pour les nouvelles.

Un utilisateur moyen sur Pocket FM écoute plus de 150 minutes par jour, soit presque 3 fois plus que sur YouTube et environ 50 % de plus que sur Netflix. Je pense que nous assistons aux tout premiers instants d'une nouvelle vague de contenus extrêmement divertissants, immersifs et hyper-personnalisés, qui ne feront que s'améliorer à mesure que nous accumulerons des données.
Pourquoi l'écriture par IA sonne comme de l'écriture par IA
Dostoïevski était un écrivain incroyable parce qu'il mettait en lumière les contradictions et les émotions à travers le comportement et les tirades de ses personnages. Oscar Wilde et Fitzgerald parce qu'ils ornaient leurs textes spirituels avec une telle élégance qu'on ne peut s'empêcher de tourner les pages. Conan Doyle pour sa capacité à dissimuler des informations au lecteur jusqu'à la toute fin.
Les LLM généralistes ont été conçus pour faire exactement l'inverse, sans aucun moyen de s'améliorer sur ce plan. Ils donnent des réponses directes, écrivent dans un langage neutre et abusent des figures de style pour renforcer l'efficacité du message. De même, les bons assistants IA sont entraînés à vous mener rapidement à la bonne conclusion. Tous ces mécanismes fondamentaux imprègnent leur écriture, et c'est précisément pour cela qu'ils y sont mauvais.
L'écriture créative exige de la tension, de l'émotion, de la création et une résolution lente des conflits, des traits de caractère qui dépassent les simples formules chocs, ainsi que des variations de rythme. Le lecteur doit être mené vers de fausses conclusions tout en recevant des indices qui maintiennent son attention.
Même un modèle de raisonnement qui prend plus de temps pour réfléchir cherche généralement à résoudre le problème, plutôt qu'à optimiser l'expérience vécue par le public pour y parvenir. Résoudre une énigme et écrire une énigme sont deux choses radicalement différentes.
Nous avons échoué en essayant de modifier l'existant
Au début, nous pensions pouvoir nous contenter des outils disponibles. Nous avons testé des modèles prêts à l'emploi et tenté de les affiner dans l'espoir de donner une âme à leur narration stérile.
Nous avons expérimenté le prompting direct de modèles de plus en plus puissants, la tenue de résumés glissants au fil de l'histoire, ainsi que l'utilisation de la récupération d'informations (RAG) et des graphes de connaissances pour répondre aux requêtes.
Avec le prompting direct, on atteint l'épisode 100 avec 10 à 20 incohérences. Les résumés glissants envoient quant à eux les détails importants aux oubliettes, ce qui dégrade la suite de l'histoire. Une fenêtre de contexte plus large aide, mais les modèles peinent toujours à utiliser correctement les informations dans des contextes longs.
Au-delà du texte généré, les requêtes constituent la meilleure mesure de la compréhension qu'a un modèle de ce qu'il a écrit. Très vite, nous avons réalisé que peu importe l'effort investi dans un modèle, il échouait à répondre aux requêtes narratologiques multi-sauts, qui nécessitent de croiser des détails issus de plusieurs épisodes. Cela a mis en lumière les limites de l'état actuel de la technologie.
Nous avons conclu que cette voie était une impasse et décidé de développer notre propre technologie... Sherpa, un nom tout trouvé pour désigner celui qui guide un auteur à travers les passages les plus ardus de la narration.
Les raisons techniques pour lesquelles Sherpa écrit une histoire que vous avez envie d'écouter
Sherpa est une infrastructure de modèle d'écriture créative sérialisée et de longue haleine. Elle se compose de trois éléments, que je détaillerai après cette introduction :
- Un planificateur détermine ce que chaque arc narratif et chaque scène doivent accomplir, ainsi que l'évolution des personnages et de leurs relations.
- Un Narrative World Model (modèle du monde narratif) conserve une trace structurée de ce qui s'est passé, de ce que sait chaque personnage et des promesses que l'histoire doit encore tenir envers le public.
- Un moteur de prose rédige le texte en s'appuyant sur ce plan et cet état, tandis que des critiques vérifient le comportement des personnages, la continuité et la qualité des scènes. Les modifications de l'auteur et les réactions du public permettent ensuite d'améliorer l'itération suivante.
Les résultats sont très encourageants. Lorsque Sherpa et chacun de ses concurrents ont dû écrire une histoire à partir d'une page blanche, des évaluations en aveugle par paires ont préféré Sherpa dans 65,6 % à 97,1 % des cas, selon le concurrent. Compte tenu de l'apprentissage par renforcement de Sherpa et du jeu de données grandissant de Pocket, rien ne laisse penser que cet écart ne continuera pas de se creuser.

Mémoire - Narrative World Model (NWM)
Les modèles de langage n'ont aucune mémoire entre deux appels : tout ce qu'ils savent d'une histoire doit donc tenir dans le prompt. Des fenêtres de contexte plus longues ne résolvent pas le problème, car les modèles exploitent de manière inégale les informations enfouies au milieu d'un long prompt. La recherche sur du texte brut ne résout rien non plus. Une requête peut retourner le passage indiquant où se trouvait un objet, mais pas où il se trouve actuellement.
Lorsqu'un épisode est finalisé avec Sherpa, un modèle en extrait des enregistrements structurés, chacun étant lié au passage qui le justifie. Les champs sont pensés pour la fiction : ce que les personnages savent ou ignorent encore, le moment où un événement s'est produit par rapport au moment où le public l'apprend, quelles intrigues attendent leur dénouement. Chaque fait reste valide depuis le chapitre qui l'a établi jusqu'à celui qui le modifie. Si un auteur modifie un chapitre antérieur, tout ce qui en dépendait est reconstruit.
Pour répondre aux questions, le NWM interroge le graphe simultanément par correspondance exacte et par sens, récupère les connexions directes de chaque résultat et transmet au modèle un petit paquet d'informations ciblé.
Sa récupération consciente des épisodes ne fait remonter que le canon pertinent, permettant un raisonnement multi-sauts sans fuite d'informations sur la suite de l'histoire. Lors d'un benchmark interne de 60 items, le NWM de Sherpa a atteint 86,7 % de précision (52/60) pour 0,7793 $ par exécution. C'est la même précision que l'infrastructure de mémoire de Claude Code avec des modèles de classe opus 5.x, pour un coût environ 21 fois inférieur (16,2172 $ par exécution). Il a également surpassé la récupération basée uniquement sur la prose de 20 points de pourcentage (de 66,7 % à 86,7 %) tout en coûtant nettement moins cher.

Moteur de prose : un casse-tête tel que nous avons dû créer notre propre modèle
L'apprentissage par renforcement nécessite un signal de récompense, et la prose n'en offre aucun d'évident. Aucun test ne permet de dire si un paragraphe mérite un prix Nobel ou s'il sert juste de remplissage.
Sherpa confie chaque partie du travail d'écriture à un modèle différent. Chaque personnage est un agent, fonctionnant sur nos modèles personnalisés post-entraînés, qui propose ce qu'il compte faire ensuite en se basant sur sa personnalité, l'objectif actuel de l'histoire, les événements récents et les éléments de l'univers qui le concernent. Un modèle critique distinct examine chaque proposition et rejette tout ce qui est vague, invraisemblable, hors personnage, répétitif ou qui ne fait pas avancer l'histoire. Un troisième modèle, le narrateur, choisit ensuite les propositions adaptées à la scène et les intègre au paragraphe suivant. Seules les actions qui atterrissent sur la page sont ajoutées à la mémoire de l'histoire.
Parallèlement, nous entraînons un modèle de prose propriétaire doté de fonctions de récompense pensées pour la fiction sérialisée. Nous pénalisons le style ampoulé, les répétitions et les surexplications, et récompensons les dialogues naturels, les voix distinctes et la tension.
Les signaux sur lesquels nous évaluons la prose :
- Cela contredit-il les événements établis ou les connaissances des personnages ?
- L'action est-elle plausible, fidèle au personnage, et fait-elle avancer la scène ?
- Les auteurs préfèrent-ils ce dialogue, cette voix et ce rythme à une alternative ?
- Les auditeurs terminent-ils l'épisode et reviennent-ils pour les suivants ?
Ces signaux s'opèrent sur des échelles de temps différentes. Une phrase peut sonner parfaitement bien tout en brisant le canon, et un cliffhanger peut améliorer le lancement de l'épisode suivant tout en affaiblissant un arc entier. Sherpa doit optimiser l'ensemble de ces signaux plutôt que de traiter la rétention comme un score unique de « bonne écriture », tant cette notion est subjective.
Le moteur de prose de Sherpa surpasse déjà la plupart des modèles open source et commerciaux que nous avons évalués lors de nos benchmarks internes de fiction, avec des scores de préférence de prose de 69 % face à Sonnet 5 et de 94 % face à Gemini 3.1 Pro. Chaque barre représente la préférence pour l'écriture de Sherpa par rapport au modèle nommé, évaluée dans les deux ordres de présentation, 50 % représentant une égalité parfaite. Ce sont des résultats préliminaires issus d'un post-entraînement en cours, et nous anticipons de nouvelles améliorations à mesure que l'entraînement se poursuit.

Planificateur d'histoire hiérarchique
La structure narrative est une propriété de la série entière, alors que les modèles de langage ne génèrent que le fragment suivant. Rien dans la prédiction du mot suivant ne sait qu'un indice semé à l'épisode 5 doit trouver son dénouement à l'épisode 60, ou que ce chapitre a besoin d'un objectif, d'un conflit et d'une issue. Dans une histoire de 100 pages générée par un modèle de pointe, un éditeur IA n'ayant échantillonné que cinq chapitres a relevé 52 problèmes structurels : des progressions bancales et des chapitres superflus.
Le planificateur de Sherpa procède de haut en bas, de la narration globale vers les arcs et les épisodes, et attribue une mission à chaque scène, y compris ce qu'elle doit laisser en suspens, afin que l'épisode 20 puisse préparer la révélation de l'épisode 80 sans l'éventer. Chaque intrigue est stockée dans la mémoire de l'histoire comme une promesse ouverte jusqu'à son dénouement. Un générateur d'objectifs maintient le récit en mouvement : lorsqu'un objectif est atteint ou s'enlise, il en définit un nouveau qui ne répète aucun des précédents. Sur ce même test de 100 pages, les problèmes structurels sont passés de 52 à 31, et la simple suppression des mises à jour d'objectifs a réduit de près de moitié les critiques au niveau des chapitres.

Tout est en place pour que Sherpa aide les auteurs à créer des IP valant des milliards de dollars dans les années à venir. Sherpa s'améliore continuellement à mesure que nous intégrons davantage de créateurs et d'utilisateurs sur la plateforme.
Il reste énormément de travail et de nombreux défis à relever : perfectionner Sherpa en fait partie, tout comme créer les conditions logistiques permettant aux auteurs de l'exploiter au mieux.
Ce que nous accomplissons chez Pocket FM m'enthousiasme au plus haut point. Nous aidons les créateurs à vivre de leur art en racontant des histoires qui auraient nécessité un budget de plusieurs millions de dollars il y a quelques années.
Nous n'en sommes qu'aux prémices d'une opportunité qui pèsera 1 000 milliards de dollars.





