Quando abbiamo virato verso gli show scritti dall'IA, in tantissimi ci hanno detto che sarebbe stata la fine di Pocket FM. Dopo sei lunghi mesi, ho quasi iniziato a crederci anch'io. Ma poi il nostro ecosistema è esploso: non nonostante l'IA, ma proprio grazie ad essa. In meno di 2 anni, la nostra IA ha aiutato gli autori a creare 161 successi su Pocket, inclusa una IP da 100 milioni di dollari.
Il fatto che gli LLM fossero pessimi nella scrittura ci ha costretti a costruire modelli e harness personalizzati. Partire da zero, a volte, era demoralizzante. Ci sono voluti un'enorme quantità di tentativi ed errori e un dataset d'oro prodotto da 550 mila autori e oltre 100 milioni di utenti sulla piattaforma.
Vi spiegherò come siamo passati dal nulla a un modello di scrittura perfettamente calibrato, perché Pocket FM è il terreno di prova ideale e qual è l'ingrediente segreto dietro la capacità di Sherpa di scrivere veri e propri blockbuster.
Da quando è uscito ChatGPT, tutti fanno notare che "suona" troppo artificiale. Quando chiedi a un LLM di scrivere qualcosa, indipendentemente dalla lunghezza, spuntano i trattini lunghi (em-dash), frasi brevi e incisive si insinuano nel testo e il risultato finale sembra un unico, grande e noioso blocco di parole.
Gli LLM sono stati progettati alla radice per il ragionamento logico, rispondere a quesiti matematici, aiutare con il codice e recuperare conoscenze enciclopediche. Nulla nel loro training insegna loro a scrivere qualcosa che un lettore sceglierebbe volontariamente di leggere o ascoltare. E non è colpa dei modelli.
L'apprendimento per rinforzo funziona meglio quando l'output è legato a un segnale di successo chiaro, che indica al modello se qualcosa ha funzionato. Nella programmazione, il codice funziona e fa quello che hai chiesto, oppure no. La risposta è certa.
Quando scrivi qualcosa, invece, non puoi sapere subito se è valido. Non sai se il lettore ha abbandonato dopo la prima frase o se è arrivato fino in fondo. Peggio ancora: chiedi a 10 persone cosa pensano di un libro o di un articolo specifico che hanno letto e otterrai 10 risposte diverse.
Controllare sia la creazione che la distribuzione mette Pocket FM in una posizione davvero unica. Monitoriamo l'utilizzo minuto per minuto. Sappiamo quando le persone smettono di ascoltare, se tornano per l'episodio successivo e se restano fedeli nel lungo periodo. Non esistono segnali migliori di questi. Qualsiasi cosa porti un utente ad abbandonare, Sherpa impara a evitarla; e tutto ciò che mantiene l'utente incollato a uno show specifico, Sherpa lo sfrutta per i nuovi show.

L'utente medio su Pocket FM ascolta per oltre 150 minuti al giorno, quasi 3 volte tanto rispetto a YouTube e circa il 50% in più rispetto a Netflix. Credo che siamo solo all'inizio di una nuova ondata di contenuti estremamente divertenti, immersivi e iper-personalizzati, che miglioreranno sempre di più man mano che raccoglieremo più dati.
Perché la scrittura dell'IA suona come scrittura dell'IA
Dostoevskij era uno scrittore incredibile perché mostrava le contraddizioni e le emozioni nei comportamenti e nelle sfuriate dei suoi personaggi. Oscar Wilde e Fitzgerald perché abbellivano i loro testi arguti in modo così magistrale che non puoi fare a meno di continuare a voltare pagina. Conan Doyle per la sua capacità di nascondere le informazioni al lettore fino all'ultimissimo momento.
Gli LLM generalisti sono stati costruiti per fare l'esatto opposto di tutto questo, senza alcun modo per migliorare in tal senso. Danno risposte dirette, scrivono con un linguaggio neutro e abusano di espedienti retorici per rendere la comunicazione più efficace. Allo stesso modo, i buoni assistenti IA sono addestrati per portarti rapidamente alla conclusione giusta. Tutti questi meccanismi fondamentali permeano la loro scrittura, ed è per questo che sono pessimi in questo campo.
La scrittura creativa richiede tensione, emozione, costruzione e risoluzione lenta del conflitto, tratti caratteriali che vanno oltre le battute a effetto e variazioni di ritmo. I lettori devono essere guidati verso conclusioni sbagliate, ricevendo però indizi che li tengano incollati alla storia.
Anche un modello di ragionamento che impiega più tempo a "pensare" lavora generalmente per risolvere il problema, anziché essere premiato per l'esperienza che il pubblico vive nell'arrivarci. Risolvere un mistero e scrivere un mistero sono due cose completamente diverse.
Abbiamo fallito cercando di modificare ciò che già esisteva
All'inizio pensavamo di potercela cavare usando ciò che era già disponibile. Abbiamo provato modelli pronti all'uso e cercato di affinarli, sperando di dare un'anima alla loro narrazione sterile.
Abbiamo sperimentato il prompting diretto di modelli sempre più potenti, mantenendo riassunti progressivi man mano che la storia evolveva e utilizzando retrieval e knowledge graph per rispondere alle query.
Con il prompting diretto, arrivi all'episodio 100 con 10-20 incongruenze. I riassunti progressivi, di fatto, disperdono i dettagli importanti nel vuoto, compromettendo la storia da quel punto in poi. Una finestra di contesto più ampia aiuta, ma i modelli faticano comunque a usare le informazioni in modo accurato in contesti molto lunghi.
Oltre all'output effettivo, le query sono la misura migliore della comprensione che un modello ha di ciò che ha scritto. Fin da subito, ci siamo resi conto che, per quanto impegno mettessimo in qualsiasi modello, questo non riusciva a rispondere a query narratologiche multi-hop, che richiedono dettagli provenienti da più episodi. Questo ha messo in luce i limiti dello stato attuale della tecnologia.
Abbiamo concluso che questa strada non era sostenibile e abbiamo deciso di costruire la nostra tecnologia... Sherpa, chiamato giustamente così per guidare l'autore attraverso le parti più difficili della narrazione.
I motivi tecnici per cui Sherpa scrive storie che vorrai ascoltare
Sherpa è un harness di modelli per la scrittura creativa serializzata e di lunga durata. È composto da tre elementi, che descriverò più nel dettaglio dopo questa introduzione:
- Un planner decide cosa deve ottenere ogni arco narrativo e ogni scena, occupandosi anche dello sviluppo dei personaggi e dell'evoluzione delle relazioni.
- Un Narrative World Model tiene un registro strutturato di ciò che è accaduto, di ciò che ogni personaggio sa e di quali promesse la storia deve ancora mantenere nei confronti del pubblico.
- Un prose engine stende la bozza basandosi su quel piano e su quello stato, mentre dei critici verificano il comportamento dei personaggi, la continuità e la qualità della scena. Le modifiche dell'autore e la reazione del pubblico aiutano poi a migliorare l'iterazione successiva.
I risultati sono molto incoraggianti. Quando Sherpa e ciascun concorrente hanno scritto una storia partendo da una pagina bianca, i giudizi ciechi a coppie hanno preferito Sherpa in una percentuale compresa tra il 65,6% e il 97,1% dei casi, a seconda del concorrente. Considerando l'apprendimento per rinforzo di Sherpa e il dataset in continua crescita di Pocket, non c'è motivo per cui questo divario non debba continuare ad ampliarsi.

Memoria - Narrative World Model (NWM)
I modelli linguistici non hanno memoria tra una chiamata e l'altra, quindi tutto ciò che sanno di una storia deve rientrare nel prompt. Finestre di contesto più lunghe non risolvono il problema, perché i modelli utilizzano in modo disomogeneo le informazioni sepolte nel mezzo di un prompt molto lungo. Nemmeno il retrieval su testo grezzo lo risolve. Una ricerca può restituire il passaggio che dice dove si trovava un oggetto, non dove si trova ora.
Quando un episodio viene finalizzato con Sherpa, un modello ne estrae record strutturati, ciascuno legato al passaggio che lo supporta. I campi sono pensati per la narrativa: cosa i personaggi sanno e non sanno ancora, quando è avvenuto un evento rispetto a quando il pubblico lo scopre, quali preparazioni sono in attesa di una risoluzione. Ogni fatto è valido dal capitolo in cui è stato stabilito fino al capitolo in cui viene modificato. Se un autore modifica un capitolo precedente, tutto ciò che dipendeva da esso viene ricostruito.
Per rispondere alle domande, NWM cerca nel grafo contemporaneamente per corrispondenza esatta e per significato, recupera le connessioni dirette di ogni risultato e fornisce al modello un pacchetto ridotto e mirato.
Il suo retrieval consapevole degli episodi fa emergere solo il canon rilevante, consentendo il ragionamento multi-hop senza fughe di notizie sulla trama futura. In un benchmark interno di 60 elementi, Sherpa NWM ha raggiunto un'accuratezza dell'86,7% (52/60) a 0,7793 $ per esecuzione. È la stessa accuratezza dell'harness di memoria di Claude Code con modelli di classe opus 5.x, ma a un costo circa 21 volte inferiore (16,2172 $ per esecuzione). Ha inoltre superato il retrieval basato solo sul testo di 20 punti percentuali (dal 66,7% all'86,7%), costando sostanzialmente meno.

Prose Engine: così difficile da decifrare che abbiamo dovuto costruire il nostro modello
L'apprendimento per rinforzo ha bisogno di un segnale di ricompensa, e la prosa non ne ha uno ovvio. Non esiste un test che dica se un paragrafo è da Premio Nobel o semplice riempitivo.
Sherpa assegna ogni parte del lavoro di scrittura a un modello diverso. Ogni personaggio è un agente, eseguito sui nostri modelli personalizzati e post-addestrati, che propone cosa intende fare successivamente in base alla sua personalità, all'obiettivo attuale della storia, agli eventi recenti e alle parti del mondo che lo riguardano. Un modello critico separato esamina ogni proposta e rimanda indietro tutto ciò che risulta vago, implausibile, fuori personaggio, ripetitivo o che non fa avanzare la trama. Un terzo modello, il narratore, sceglie quindi quali proposte si adattano alla scena e le trasforma nel paragrafo successivo. Solo le azioni che finiscono sulla pagina vengono aggiunte alla memoria della storia.
Inoltre, stiamo addestrando un modello di prosa proprietario con funzioni di ricompensa create appositamente per la narrativa serializzata. Penalizziamo la prosa ampollosa, le ripetizioni e le spiegazioni eccessive, e premiamo i dialoghi naturali, le voci autentiche e la tensione.
I segnali con cui valutiamo la prosa:
- Contraddice eventi stabiliti o conoscenze dei personaggi?
- L'azione è plausibile, coerente con il personaggio e fa progredire la scena?
- Gli autori preferiscono questo dialogo, questa voce e questo ritmo rispetto a un'alternativa?
- Gli ascoltatori finiscono l'episodio e tornano per quelli successivi?
Questi segnali operano su scale temporali diverse. Una frase può suonare bene ma infrangere il canon, e un cliffhanger può migliorare l'avvio dell'episodio successivo ma indebolire un intero arco narrativo. Sherpa deve ottimizzare trasversalmente questi segnali, anziché trattare la retention come un singolo punteggio di "buona scrittura", data l'estrema soggettività di quest'ultima.
Il Prose Engine di Sherpa sta già superando la maggior parte dei modelli open source e commerciali che abbiamo valutato nei nostri benchmark interni di narrativa, con punteggi di preferenza della prosa del 69% contro Sonnet 5 e del 94% contro Gemini 3.1 Pro. Ogni barra mostra la preferenza per la scrittura di Sherpa rispetto al modello indicato, valutata in entrambi gli ordini di presentazione, con il 50% che rappresenta la parità. Questi sono i primi risultati del post-training in corso e prevediamo ulteriori miglioramenti man mano che l'addestramento proseguirà.

Hierarchical Story Planner
La struttura della storia è una proprietà dell'intero show, mentre i modelli linguistici generano solo il frammento successivo. Nulla nella previsione della parola successiva sa che un indizio seminato nell'episodio 5 deve trovare risoluzione nell'episodio 60, o che questo capitolo ha bisogno di un obiettivo, un conflitto e un esito. In una storia di 100 pagine generata da un modello frontier, un editor IA che ha analizzato solo cinque capitoli ha individuato 52 problemi strutturali: sviluppi che non funzionavano e capitoli di cui la storia non aveva bisogno.
Il planner di Sherpa lavora a cascata, dalla narrazione complessiva agli archi e agli episodi, assegnando a ogni scena un compito preciso, incluso ciò che deve lasciare irrisolto, in modo che l'episodio 20 possa preparare la rivelazione dell'episodio 80 senza svelarla. Ogni preparazione viene memorizzata nella memoria della storia come una promessa aperta finché non trova compimento. Un generatore di obiettivi mantiene viva la storia: quando un obiettivo viene raggiunto o si arena, ne imposta uno nuovo che non ripeta nessuno dei precedenti. Sullo stesso test di 100 pagine, i problemi strutturali sono scesi da 52 a 31, e la sola rimozione degli aggiornamenti degli obiettivi ha migliorato le critiche a livello di capitolo di quasi la metà.

Tutto è pronto affinché Sherpa aiuti gli autori a creare IP miliardarie nei prossimi anni. Sherpa continua a migliorare man mano che accogliamo nuovi creator e utenti sulla piattaforma.
C'è ancora molto lavoro da fare e molte questioni rimangono aperte: perfezionare Sherpa è una di queste, così come creare le condizioni logistiche ideali affinché gli autori possano sfruttarlo al meglio.
Sono entusiasta di ciò che stiamo facendo in Pocket FM. Stiamo aiutando i creator a guadagnarsi da vivere raccontando storie che, solo pochi anni fa, avrebbero richiesto un budget multimilionario.
Siamo ancora agli albori di quella che sarà un'opportunità da mille miliardi di dollari.





