YouMind
Iniciar sesión

Por qué los LLM no escriben bien y cómo Sherpa lo soluciona

@RohanNayak2
INGLÉS30 sept 2026
324K
612
156
31
639

TL;DR

Rohan Nayak, CEO de Pocket FM, explica por qué los LLM estándar tienen dificultades con la escritura creativa debido a la falta de señales de engagement. Detalla cómo Sherpa, un entorno de IA personalizado con planificadores especializados y modelos de memoria, permite a los escritores producir dramas de audio serializados de éxito.

Cuando cambiamos el rumbo hacia los programas escritos con IA, muchísima gente nos dijo que eso mataría a Pocket FM. Después de seis largos meses, casi les creí. Pero entonces nuestro ecosistema explotó, y no a pesar de la escritura con IA, sino gracias a ella. En menos de 2 años, nuestra IA ha ayudado a los escritores a crear 161 éxitos rotundos en Pocket, incluyendo una IP de 100 millones de dólares.

El hecho de que los LLM fueran pésimos escribiendo nos obligó a construir nuestros propios modelos personalizados y su infraestructura de orquestación. Empezar desde cero fue desmoralizante por momentos. Hizo falta una cantidad enorme de ensayo y error, además de un dataset de oro generado por 550 mil escritores y más de 100 millones de usuarios en la plataforma.

Te voy a contar cómo pasamos de la nada a un modelo de escritura perfectamente calibrado, por qué Pocket FM es el campo de pruebas ideal y cuál es la fórmula secreta detrás de la capacidad de Sherpa para escribir grandes éxitos.


Desde que se lanzó ChatGPT, todo el mundo ha señalado que suena demasiado a IA. Cuando le pides a un LLM que escriba algo, sin importar la extensión, empiezan a aparecer guiones largos, las frases cortas e impactantes se cuelan en el texto y el resultado se lee como un bloque enorme y aburrido.

Los LLM fueron diseñados fundamentalmente para el razonamiento lógico, resolver problemas matemáticos, ayudar con código y recuperar conocimiento enciclopédico. Nada en su entrenamiento les enseña a escribir algo que un lector quiera leer o escuchar por voluntad propia. Y no es culpa de los modelos.

El aprendizaje por refuerzo funciona mejor cuando el resultado está ligado a una señal de éxito clara, lo que le indica al modelo si algo funcionó o no. En programación, el código funciona y hace lo que pediste, o no lo hace. La respuesta es inequívoca.

Cuando escribes algo, no puedes saber de inmediato si es bueno. No sabes si el lector abandonó después de la primera frase o si llegó hasta el final. Peor aún: pregúntale a 10 personas sobre un libro o artículo concreto que hayan leído y obtendrás 10 respuestas distintas.

Controlar tanto la creación como la distribución pone a Pocket FM en una posición única. Monitorizamos el uso minuto a minuto. Sabemos cuándo la gente deja de escuchar, si vuelven para el siguiente episodio y si se quedan a largo plazo. No hay señales mejores que esas. Todo lo que provoca que un usuario abandone, Sherpa aprende a evitarlo; y todo lo que mantiene al usuario enganchado a un programa concreto, Sherpa lo aprovecha para los nuevos.

Rohan Nayak - inline image

El usuario promedio de Pocket FM escucha más de 150 minutos al día, casi 3 veces más que en YouTube y un ~50 % más que en Netflix. Creo que estamos justo al principio de una nueva ola de contenido extremadamente entretenido, inmersivo e hiperpersonalizado, que solo irá a mejor a medida que consigamos más datos.

Por qué la escritura con IA suena a escritura con IA

Dostoievski era un escritor increíble porque mostraba las contradicciones y emociones en el comportamiento y los arrebatos de sus personajes. Oscar Wilde y Fitzgerald, porque embellecían sus ingeniosos textos de una forma tan hermosa que no puedes evitar seguir pasando páginas. Conan Doyle, por su habilidad para ocultarle información al lector hasta el mismísimo final.

Los LLM de propósito general se construyeron para hacer exactamente lo contrario, y no tienen manera de mejorar en ello. Dan respuestas directas, escriben en un lenguaje neutro y abusan de ciertos recursos para potenciar la eficacia del mensaje. Del mismo modo, los buenos asistentes de IA están entrenados para llevarte rápidamente a la conclusión correcta. Todos estos elementos fundamentales impregnan su forma de escribir, y por eso son malos haciéndolo.

La escritura creativa requiere tensión, emoción, construcción y resolución pausada del conflicto, rasgos de personaje que vayan más allá de las frases hechas y variaciones en el ritmo. Hay que llevar a los lectores a conclusiones equivocadas mientras se les dan pistas que los mantengan enganchados.

Incluso un modelo de razonamiento que dedica más tiempo a pensar suele estar enfocado en resolver el problema, no en ser recompensado por la experiencia que vive el público durante ese proceso. Resolver un misterio y escribir un misterio son dos cosas muy distintas.

Fracasamos por intentar retocar lo que ya existía

Al principio, pensamos que podíamos salir del paso usando lo que había disponible. Probamos modelos comerciales y tratamos de ajustarlos con la esperanza de arreglar su narrativa sin alma.

Experimentamos haciendo prompts directamente a modelos cada vez más potentes, manteniendo resúmenes continuos a medida que avanzaba la historia y utilizando recuperación de información (retrieval) y grafos de conocimiento para responder consultas.

Si haces prompts directamente, llegas al episodio 100 con entre 10 y 20 inconsistencias. Los resúmenes continuos básicamente mandan detalles importantes al limbo, lo que perjudica la historia a partir de ahí. Una ventana de contexto más grande ayuda, pero los modelos siguen teniendo dificultades para usar la información con precisión en contextos largos.

Más allá del texto generado, las consultas son la mejor forma de medir cuánto entiende un modelo lo que ha escrito. Al principio nos dimos cuenta de que, por mucho esfuerzo que dedicáramos a cualquier modelo, este fallaba al responder consultas narratológicas multi-salto, aquellas que requieren detalles de varios episodios. Esto puso de manifiesto las limitaciones del estado actual de la tecnología.

Llegamos a la conclusión de que este camino era insostenible y decidimos desarrollar nuestra propia tecnología... Sherpa, bautizada así, con toda razón, para guiar al escritor por las partes más difíciles de la narrativa.

Razones técnicas por las que Sherpa escribe historias que querrás escuchar

Sherpa es una infraestructura de orquestación de modelos de escritura creativa serializada de formato largo. Está compuesta por tres elementos, que describiré con más detalle después de esta introducción:

  1. Un planificador decide qué debe lograr cada arco y escena, además de gestionar el desarrollo de los personajes y la evolución de sus relaciones.
  2. Un Modelo de Mundo Narrativo (Narrative World Model) mantiene un registro estructurado de lo que ha ocurrido, lo que sabe cada personaje y qué promesas le debe aún la historia al público.
  3. Un motor de prosa redacta basándose en ese plan y estado, mientras unos críticos revisan el comportamiento de los personajes, la continuidad y la calidad de la escena. Después, las correcciones del escritor y la respuesta del público ayudan a mejorar la siguiente iteración.

Los resultados son muy alentadores. Cuando Sherpa y cada uno de sus competidores escribieron una historia partiendo de una página en blanco, las evaluaciones ciegas por pares prefirieron a Sherpa entre el 65,6 % y el 97,1 % de las veces, dependiendo del rival. Dado el aprendizaje por refuerzo de Sherpa y el creciente dataset de Pocket, no hay motivo para pensar que esta brecha no seguirá ampliándose.

Rohan Nayak - inline image

Memoria - Modelo de Mundo Narrativo (NWM)

Los modelos de lenguaje no tienen memoria entre llamadas, así que todo lo que saben sobre una historia tiene que caber en el prompt. Las ventanas de contexto más largas no solucionan esto, porque los modelos hacen un uso desigual de la información enterrada en medio de un prompt extenso. Recuperar información sobre texto plano tampoco lo resuelve. Una búsqueda puede devolverte el fragmento que dice dónde estaba un objeto, pero no dónde está ahora.

Cuando un episodio se finaliza con Sherpa, un modelo extrae registros estructurados del mismo, cada uno vinculado al fragmento que lo respalda. Los campos están diseñados específicamente para la ficción: qué saben y qué no saben aún los personajes, cuándo ocurrió un evento frente a cuándo se entera el público, qué preparativos están esperando su desenlace. Cada dato es válido desde el capítulo que lo establece hasta el capítulo que lo cambia. Si un escritor modifica un capítulo anterior, todo lo que dependía de él se reconstruye.

Para responder preguntas, el NWM busca en el grafo por coincidencia exacta y por significado al mismo tiempo, extrae las conexiones directas de cada resultado y le entrega al modelo un paquete pequeño y enfocado.

Su sistema de recuperación consciente del contexto por episodio muestra únicamente el canon relevante, permitiendo el razonamiento multi-salto sin filtrar información de la trama futura. En una prueba interna de 60 ítems, el NWM de Sherpa alcanzó un 86,7 % de precisión (52/60) con un coste de $0,7793 por ejecución. Es la misma precisión que logra la infraestructura de memoria de Claude Code con modelos de la clase opus 5.x, pero con un coste aproximadamente 21 veces menor ($16,2172 por ejecución). Además, superó a la recuperación basada solo en prosa por 20 puntos porcentuales (del 66,7 % al 86,7 %) costando sustancialmente menos.

Rohan Nayak - inline image

Motor de prosa: tan difícil de descifrar que tuvimos que crear nuestro propio modelo

El aprendizaje por refuerzo necesita una señal de recompensa, y la prosa no tiene una evidente. No existe ninguna prueba que determine si un párrafo tiene calidad de Premio Nobel o si es simple relleno.

Sherpa asigna cada parte del trabajo de escritura a un modelo distinto. Cada personaje es un agente que se ejecuta sobre nuestros modelos personalizados y post-entrenados, y propone lo que pretende hacer a continuación basándose en su personalidad, el objetivo actual de la historia, los eventos recientes y las partes del mundo que le afectan. Un modelo crítico independiente revisa cada propuesta y rechaza cualquier cosa vaga, inverosímil, fuera de personaje, repetitiva o que no haga avanzar la trama. Un tercer modelo, el narrador, elige entonces qué propuestas encajan en la escena y las convierte en el siguiente párrafo. Solo las acciones que llegan a la página se añaden a la memoria de la historia.

Además de esto, estamos entrenando un modelo de prosa propietario con funciones de recompensa diseñadas para la ficción serializada. Penalizamos la prosa recargada, la repetición y la sobreexplicación, y premiamos los diálogos naturales, las voces propias y la tensión.

Señales con las que medimos la prosa:

  • ¿Contradice esto eventos establecidos o el conocimiento de los personajes?
  • ¿Es la acción verosímil, fiel al personaje y hace avanzar la escena?
  • ¿Prefieren los escritores este diálogo, voz y ritmo frente a otra alternativa?
  • ¿Terminan los oyentes el episodio y vuelven para los siguientes?

Estas señales operan en escalas de tiempo distintas. Una frase puede sonar genial pero romper el canon, y un cliffhanger puede mejorar el inicio del siguiente episodio pero debilitar un arco entero. Sherpa necesita optimizar equilibrando todas estas señales en lugar de tratar la retención como una puntuación única de "buena escritura", debido a lo subjetiva que es esta última.

El Motor de Prosa de Sherpa ya supera a la mayoría de los modelos abiertos y comerciales que evaluamos en nuestras pruebas internas de ficción, con puntuaciones de preferencia de prosa del 69 % frente a Sonnet 5 y del 94 % frente a Gemini 3.1 Pro. Cada barra muestra la preferencia por la escritura de Sherpa frente al modelo indicado, evaluada en ambos órdenes de presentación, donde el 50 % representa un empate. Estos son resultados preliminares de un post-entrenamiento en curso, y esperamos seguir mejorando a medida que avance.

Rohan Nayak - inline image

Planificador jerárquico de historias

La estructura narrativa es una propiedad de la serie completa, y los modelos de lenguaje solo generan el siguiente fragmento. Nada en la predicción del siguiente token sabe que una pista plantada en el episodio 5 debe resolverse en el episodio 60, o que este capítulo necesita un objetivo, un conflicto y un desenlace. En una historia de 100 páginas generada por un modelo de vanguardia, un editor de IA que analizó solo cinco capítulos detectó 52 problemas estructurales: tramas que no fluían y capítulos que la historia no necesitaba.

El planificador de Sherpa trabaja de arriba abajo, desde la narrativa global pasando por los arcos y episodios, y le asigna una tarea a cada escena, incluyendo lo que debe dejar sin resolver, para que el episodio 20 pueda preparar la revelación del episodio 80 sin destriparla. Cada elemento introductorio se almacena en la memoria de la historia como una promesa pendiente hasta que se cumple. Un generador de objetivos mantiene la historia en movimiento: cuando un objetivo se alcanza o se estanca, establece uno nuevo que no repita ninguno anterior. En esa misma prueba de 100 páginas, los problemas estructurales bajaron de 52 a 31, y el simple hecho de eliminar las actualizaciones de objetivos redujo las críticas a nivel de capítulo casi a la mitad.

Rohan Nayak - inline image

Todo está listo para que Sherpa ayude a los escritores a crear IPs multimillonarias en los próximos años. Sherpa sigue mejorando a medida que incorporamos más creadores y usuarios a la plataforma.

Queda mucho trabajo por delante y muchos problemas por resolver; perfeccionar Sherpa es uno de ellos, igual que crear las condiciones logísticas para que los escritores puedan sacarle el máximo partido.

Me entusiasma enormemente lo que estamos haciendo en Pocket FM. Estamos ayudando a los creadores a ganarse la vida contando historias que hace unos años habrían requerido un presupuesto de varios millones de dólares.

Aún estamos en los inicios de lo que será una oportunidad de 1 billón de dólares.

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales