YouMind
Iniciar sesión

Por qué los LLM no escriben bien y cómo Sherpa lo soluciona

@RohanNayak2
INGLÉS30 sept 2026
324K
612
156
31
639

TL;DR

Rohan Nayak, CEO de Pocket FM, explica por qué los LLM estándar tienen dificultades con la escritura creativa debido a la falta de señales de interacción. Detalla cómo Sherpa, un entorno de IA personalizado con planificadores especializados y modelos de memoria, permite a los escritores producir audiodramas serializados de gran éxito.

Cuando cambiamos el rumbo hacia los shows escritos con IA, muchísima gente nos dijo que eso iba a matar a Pocket FM. Después de seis largos meses, casi les creí. Pero entonces nuestro ecosistema explotó, y no a pesar de la escritura con IA, sino gracias a ella. En menos de 2 años, nuestra IA ayudó a los escritores a crear 161 éxitos rotundos en Pocket, incluyendo una IP de 100 millones de dólares.

Que los LLM fueran pésimos escribiendo nos obligó a construir nuestros propios modelos personalizados y su infraestructura de soporte (harness). Empezar desde cero fue desmoralizante por momentos. Hizo falta una cantidad enorme de prueba y error, y un dataset de oro generado por 550 mil escritores y más de 100 millones de usuarios en la plataforma.

Te voy a contar cómo pasamos de cero a un modelo de escritura perfectamente calibrado, por qué Pocket FM es el campo de pruebas ideal y cuál es la fórmula secreta detrás de la capacidad de Sherpa para escribir grandes éxitos.


Desde que se lanzó ChatGPT, todo el mundo señala que suena demasiado a IA. Cuando le pides a un LLM que escriba algo, sin importar la extensión, aparecen las rayas largas (em-dashes), las frases cortas y contundentes se cuelan en el texto, y el resultado se lee como un bloque gigante y aburrido.

Los LLM fueron diseñados fundamentalmente para el razonamiento lógico, resolver problemas matemáticos, ayudar con código y recuperar conocimiento enciclopédico. Nada en su entrenamiento les enseña a escribir algo que un lector quiera leer o escuchar por voluntad propia. Y no es culpa de los modelos.

El aprendizaje por refuerzo funciona mejor cuando el resultado está ligado a una señal de éxito clara, que le indica al modelo si algo funcionó. En programación, el código funciona y hace lo que pediste, o no lo hace. La respuesta es definitiva.

Cuando escribes algo, no puedes saber si es bueno. No sabes si el lector abandonó después de la primera frase o si llegó hasta el final. Peor aún: pregúntale a 10 personas sobre un libro o artículo específico que leyeron y obtendrás 10 respuestas distintas.

Controlar tanto la creación como la distribución pone a Pocket FM en una posición única. Monitoreamos el uso minuto a minuto. Sabemos cuándo la gente deja de escuchar, si vuelven para el siguiente episodio y si se quedan a largo plazo. No hay señales mejores que esas. Sherpa aprende a evitar todo lo que hace que un usuario abandone; y aprovecha todo lo que mantiene al usuario enganchado con un show específico para aplicarlo en nuevos shows.

Rohan Nayak - inline image

El usuario promedio en Pocket FM escucha más de 150 minutos al día, casi 3 veces más que en YouTube y ~50% más que en Netflix. Creo que estamos apenas al inicio de una nueva ola de contenido sumamente entretenido, inmersivo e hiperpersonalizado, que solo va a mejorar a medida que consigamos más datos.

Por qué la escritura con IA suena a escritura con IA

Dostoievski era un escritor increíble porque mostraba las contradicciones y emociones en el comportamiento y los arrebatos de sus personajes. Oscar Wilde y Fitzgerald, porque embellecían sus ingeniosos textos de una forma tan hermosa que no podías dejar de pasar las páginas. Conan Doyle, por su habilidad para ocultarle información al lector hasta el mismísimo final.

Los LLM de propósito general fueron construidos para hacer exactamente lo contrario, y no tienen forma de mejorar en esto. Dan respuestas directas, escriben en un lenguaje neutro y abusan de ciertos recursos para intentar ser más efectivos. De igual manera, los buenos asistentes de IA están entrenados para llevarte rápido a la conclusión correcta. Todos estos elementos fundamentales impregnan su forma de escribir, y por eso son malos haciéndolo.

La escritura creativa requiere tensión, emoción, construcción y resolución lenta del conflicto, rasgos de personalidad que van más allá de las frases hechas y variaciones en el ritmo. Hay que llevar a los usuarios a conclusiones equivocadas mientras reciben pistas que los mantienen enganchados.

Incluso un modelo de razonamiento que dedica más tiempo a "pensar" generalmente trabaja para resolver el problema, en lugar de ser recompensado por la experiencia que vive la audiencia al llegar a esa solución. Resolver un misterio y escribir un misterio son dos cosas muy distintas.

Fracasamos por intentar ajustar lo que ya existía

Al principio, pensamos que podíamos salir del paso usando lo que había disponible. Probamos modelos comerciales listos para usar y tratamos de ajustarlos con la esperanza de arreglar su narrativa sin alma.

Experimentamos haciendo prompts directamente a modelos cada vez más potentes, manteniendo resúmenes continuos a medida que avanzaba la historia, y usando recuperación de información (retrieval) y grafos de conocimiento para responder consultas.

Al hacer prompts directamente, llegas al episodio 100 con entre 10 y 20 inconsistencias. Los resúmenes continuos básicamente mandan los detalles importantes al vacío, arruinando la historia de ahí en adelante. Una ventana de contexto más grande ayuda, pero los modelos siguen teniendo problemas para usar la información con precisión en contextos largos.

Más allá del resultado final, las consultas son la mejor forma de medir qué tanto entiende un modelo lo que acaba de escribir. Al principio nos dimos cuenta de que, sin importar cuánto esfuerzo le metiéramos a cualquier modelo, fallaba al responder consultas narratológicas multi-salto, que requieren detalles de varios episodios. Esto dejó al descubierto las limitaciones del estado actual de la tecnología.

Concluimos que ese camino era insostenible y decidimos construir nuestra propia tecnología... Sherpa, bautizada así con toda razón para guiar al escritor por las partes más difíciles de contar una historia.

Razones técnicas por las que Sherpa escribe historias que sí quieres escuchar

Sherpa es una infraestructura de soporte (harness) de un modelo de escritura creativa serializada y de formato largo. Está compuesta por tres componentes, que te describiré con más detalle después de esta introducción:

  1. Un planificador decide qué debe lograr cada arco y escena, además de definir el desarrollo de los personajes y la evolución de sus relaciones.
  2. Un Narrative World Model (Modelo de Mundo Narrativo) lleva un registro estructurado de lo que pasó, lo que sabe cada personaje y qué promesas le debe todavía la historia a la audiencia.
  3. Un motor de prosa redacta basándose en ese plan y estado, mientras que unos críticos revisan el comportamiento de los personajes, la continuidad y la calidad de la escena. Luego, las ediciones del escritor y la respuesta de la audiencia ayudan a mejorar la siguiente iteración.

Los resultados son muy alentadores. Cuando Sherpa y cada uno de sus competidores escribieron una historia partiendo de una página en blanco, las evaluaciones ciegas por pares prefirieron a Sherpa entre el 65.6% y el 97.1% de los casos, dependiendo del competidor. Dado el aprendizaje por refuerzo de Sherpa y el dataset en crecimiento de Pocket, no hay razón para pensar que esta brecha no seguirá ampliándose.

Rohan Nayak - inline image

Memoria - Narrative World Model (NWM)

Los modelos de lenguaje no tienen memoria entre llamadas, así que todo lo que saben sobre una historia tiene que caber en el prompt. Las ventanas de contexto más largas no solucionan esto, porque los modelos hacen un uso desigual de la información enterrada en medio de un prompt extenso. Recuperar información sobre texto plano tampoco lo resuelve. Una búsqueda puede devolverte el fragmento que dice dónde estaba un objeto, pero no dónde está ahora.

Cuando un episodio queda listo con Sherpa, un modelo extrae registros estructurados de él, cada uno vinculado al fragmento que lo respalda. Los campos están diseñados para la ficción: qué saben y qué aún no saben los personajes, cuándo ocurrió un evento frente a cuándo se entera la audiencia, qué preparativos están esperando su desenlace. Cada dato es válido desde el capítulo que lo estableció hasta el capítulo que lo cambia. Si un escritor edita un capítulo anterior, todo lo que dependía de él se reconstruye.

Para responder preguntas, el NWM busca en el grafo por palabras exactas y por significado al mismo tiempo, extrae las conexiones directas de cada resultado y le entrega al modelo un paquete pequeño y enfocado.

Su sistema de recuperación consciente del contexto de cada episodio muestra únicamente el canon relevante, lo que permite el razonamiento multi-salto sin filtrar información de la trama futura. En un benchmark interno de 60 ítems, el NWM de Sherpa alcanzó un 86.7% de precisión (52/60) a $0.7793 por ejecución. Es la misma precisión que logra la infraestructura de memoria de Claude Code con modelos de clase opus 5.x, pero a un costo aproximadamente 21× menor ($16.2172 por ejecución). También superó a la recuperación basada solo en prosa por 20 puntos porcentuales (de 66.7% a 86.7%) costando sustancialmente menos.

Rohan Nayak - inline image

Motor de Prosa: tan difícil de descifrar que tuvimos que construir nuestro propio modelo

El aprendizaje por refuerzo necesita una señal de recompensa, y la prosa no tiene una obvia. No existe ninguna prueba que te diga si un párrafo tiene calidad de Premio Nobel o si es puro relleno.

Sherpa le asigna cada parte del trabajo de escritura a un modelo distinto. Cada personaje es un agente que corre sobre nuestros modelos personalizados y post-entrenados, y propone qué quiere hacer a continuación basándose en su personalidad, el objetivo actual de la historia, los eventos recientes y las partes del mundo que le resultan relevantes. Un modelo crítico independiente revisa cada propuesta y devuelve cualquier cosa vaga, inverosímil, fuera de personaje, repetitiva o que no haga avanzar la historia. Luego, un tercer modelo, el narrador, elige qué propuestas encajan en la escena y las convierte en el siguiente párrafo. Solo las acciones que llegan a la página se agregan a la memoria de la historia.

Además de esto, estamos entrenando un modelo de prosa propietario con funciones de recompensa diseñadas específicamente para la ficción serializada. Penalizamos la prosa recargada, la repetición y la sobreexplicación, y premiamos los diálogos naturales, las voces auténticas y la tensión.

Señales con las que medimos la prosa:

  • ¿Esto contradice eventos establecidos o lo que sabe el personaje?
  • ¿La acción es verosímil, fiel al personaje y hace avanzar la escena?
  • ¿Los escritores prefieren este diálogo, voz y ritmo frente a otra alternativa?
  • ¿Los oyentes terminan el episodio y vuelven para los siguientes?

Estas señales operan en escalas de tiempo distintas. Una frase puede sonar genial pero romper el canon, y un cliffhanger puede mejorar el inicio del siguiente episodio pero debilitar un arco completo. Sherpa necesita optimizar equilibrando todas estas señales en lugar de tratar la retención como un puntaje único de "buena escritura", dado lo subjetivo que es esto último.

El Motor de Prosa de Sherpa ya supera a la mayoría de los modelos abiertos y comerciales que evaluamos en nuestros benchmarks internos de ficción, con puntajes de preferencia de prosa del 69% contra Sonnet 5 y del 94% contra Gemini 3.1 Pro. Cada barra muestra la preferencia por la escritura de Sherpa sobre el modelo indicado, evaluada en ambos órdenes de presentación, donde el 50% representa un empate. Estos son resultados preliminares de un post-entrenamiento en curso, y esperamos seguir mejorando a medida que avance.

Rohan Nayak - inline image

Planificador Jerárquico de Historias

La estructura narrativa es una propiedad de todo el show, y los modelos de lenguaje solo generan el siguiente fragmento. Nada en la predicción de la siguiente palabra sabe que una pista sembrada en el episodio 5 debe resolverse en el episodio 60, o que este capítulo necesita un objetivo, un conflicto y un desenlace. En una historia de 100 páginas generada por un modelo de vanguardia, un editor de IA que analizó solo cinco capítulos detectó 52 problemas estructurales: tramas que no fluían y capítulos que la historia no necesitaba.

El planificador de Sherpa trabaja de arriba hacia abajo, desde la narrativa general pasando por los arcos y episodios, y le asigna una tarea a cada escena, incluyendo qué debe dejar sin resolver, para que el episodio 20 pueda preparar la revelación del episodio 80 sin arruinarla. Cada preparación se guarda en la memoria de la historia como una promesa pendiente hasta que se cumple. Un generador de objetivos mantiene la historia en movimiento: cuando un objetivo se alcanza o se estanca, establece uno nuevo que no repita ninguno anterior. En esa misma prueba de 100 páginas, los problemas estructurales bajaron de 52 a 31, y solo con eliminar las actualizaciones de objetivos, las críticas a nivel de capítulo mejoraron casi a la mitad.

Rohan Nayak - inline image

Todo está listo para que Sherpa ayude a los escritores a crear IPs multimillonarias en los próximos años. Sherpa sigue mejorando a medida que sumamos más creadores y usuarios a la plataforma.

Queda mucho trabajo por delante y muchos temas por resolver; perfeccionar a Sherpa es uno de ellos, y también lo es crear las condiciones logísticas para que los escritores puedan aprovecharlo al máximo.

Me emociona muchísimo lo que estamos haciendo en Pocket FM. Estamos ayudando a los creadores a ganarse la vida contando historias que hace unos años habrían requerido un presupuesto de millones de dólares.

Apenas estamos empezando en lo que será una oportunidad de 1 billón de dólares (1T).

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales