Quando mudamos nosso foco para séries escritas por IA, inúmeras pessoas nos disseram que isso mataria o Pocket FM. Depois de seis longos meses, eu quase acreditei nelas. Mas então nosso ecossistema explodiu — e não apesar da escrita por IA, mas justamente por causa dela. Em menos de 2 anos, nossa IA ajudou roteiristas a criar 161 blockbusters no Pocket, incluindo uma propriedade intelectual avaliada em US$ 100 milhões.
O fato de os LLMs serem péssimos em escrever nos forçou a construir nossos próprios modelos e infraestrutura personalizados. Começar do zero foi desanimador em alguns momentos. Exigiu uma quantidade enorme de tentativa e erro, além de um dataset valiosíssimo produzido por 550 mil roteiristas e mais de 100 milhões de usuários na plataforma.
Vou explicar como saímos do zero para chegar a um modelo de escrita perfeitamente calibrado, por que o Pocket FM é o campo de testes ideal e qual é o segredo por trás da capacidade do Sherpa de escrever blockbusters.
Desde o lançamento do ChatGPT, todo mundo aponta que ele soa artificial demais. Quando você pede para um LLM escrever qualquer coisa, independentemente do tamanho, travessões aparecem do nada, frases curtas e de impacto se infiltram no texto, e o resultado final parece um bloco único, grande e entediante.
Os LLMs foram projetados, em sua essência, para raciocínio lógico, resolver problemas matemáticos, ajudar com programação e recuperar conhecimento enciclopédico. Nada no treinamento deles ensina a escrever algo que um leitor leria ou ouviria por vontade própria. E a culpa não é dos modelos.
O aprendizado por reforço funciona melhor quando o resultado está atrelado a um sinal claro de sucesso, treinando o modelo caso algo tenha dado certo. Na programação, o código funciona e faz o que você pediu, ou não funciona. A resposta é certa.
Quando você escreve algo, não dá para saber se ficou bom. Você não sabe se o leitor desistiu depois da primeira frase ou se chegou até o fim. Pior ainda: pergunte a 10 pessoas sobre um livro ou artigo específico que leram e você receberá 10 respostas diferentes.
Controlar a criação e a distribuição coloca o Pocket FM em uma posição única. Monitoramos o uso minuto a minuto. Sabemos quando as pessoas param de ouvir, se voltam para o próximo episódio e se ficam pelo longo prazo. Não existem sinais melhores do que esses. O que faz um usuário desistir, o Sherpa aprende a evitar; e o que mantém o usuário engajado em uma série específica, o Sherpa aproveita nas novas produções.

O usuário médio do Pocket FM ouve mais de 150 minutos por dia, quase 3 vezes mais do que no YouTube e cerca de 50% a mais do que na Netflix. Acredito que estamos apenas no início de uma nova onda de conteúdos extremamente envolventes, imersivos e hiperpersonalizados, que só vão melhorar à medida que tivermos mais dados.
Por que textos de IA têm "cara" de textos de IA
Dostoiévski era um escritor incrível porque expunha as contradições e emoções no comportamento e nos desabafos de seus personagens. Oscar Wilde e Fitzgerald porque adornavam seus textos espirituosos de forma tão bela que você não consegue parar de virar as páginas. Conan Doyle pela habilidade de esconder informações do leitor até o último momento.
Os LLMs de uso geral foram criados para fazer exatamente o oposto disso, sem nenhuma margem para evoluir nessa área. Eles dão respostas diretas, escrevem em linguagem neutra e abusam de recursos para tentar tornar a entrega mais eficaz. Da mesma forma, bons assistentes de IA são treinados para levar você rapidamente à conclusão correta. Todas essas características fundamentais permeiam a escrita deles, e é por isso que são ruins nisso.
A escrita criativa exige tensão, emoção, construção e resolução lenta de conflitos, traços de personalidade que vão muito além de frases de efeito e variações de ritmo. Os leitores precisam ser conduzidos a conclusões erradas enquanto recebem pistas que os mantenham fisgados.
Mesmo um modelo de raciocínio que passa mais tempo "pensando" geralmente trabalha para resolver o problema, e não para ser recompensado pela experiência que o público tem ao chegar lá. Resolver um mistério e escrever um mistério são duas coisas completamente diferentes.
Fracassamos ao tentar ajustar o que já existia
No começo, achamos que daria para improvisar usando o que já estava disponível. Testamos modelos prontos e tentamos refiná-los, na esperança de consertar aquela narrativa sem alma.
Experimentamos fazer prompts diretamente para modelos cada vez mais potentes, manter resumos contínuos conforme a história avançava e usar recuperação de dados (retrieval) e grafos de conhecimento para responder a consultas.
Com prompts diretos, você chega ao episódio 100 com 10 a 20 inconsistências. Resumos contínuos basicamente mandam detalhes importantes para o limbo, prejudicando a história dali em diante. Uma janela de contexto maior ajuda, mas os modelos ainda têm dificuldade para usar as informações com precisão em contextos longos.
Além do texto gerado, as consultas são a melhor forma de medir o quanto o modelo compreendeu o que escreveu. Logo no início, percebemos que, por mais esforço que dedicássemos a qualquer modelo, ele não conseguia responder a consultas narratológicas multi-hop, que exigem detalhes de vários episódios. Isso escancarou as limitações do estado atual da tecnologia.
Concluímos que esse caminho era insustentável e decidimos criar nossa própria tecnologia... o Sherpa, batizado assim justamente para guiar o roteirista pelas partes mais difíceis da construção de uma história.
Razões técnicas pelas quais o Sherpa escreve histórias que você quer ouvir
O Sherpa é uma infraestrutura de modelo de escrita criativa serializada e de formato longo. Ele é composto por três elementos, que detalharei melhor após esta introdução:
- Um planejador decide o que cada arco e cena precisam alcançar, além de definir o desenvolvimento dos personagens e a evolução dos relacionamentos.
- Um Narrative World Model (Modelo de Mundo Narrativo) mantém um registro estruturado do que aconteceu, do que cada personagem sabe e de quais promessas a história ainda deve ao público.
- Um motor de prosa redige o texto com base nesse plano e nesse estado, enquanto críticos avaliam o comportamento dos personagens, a continuidade e a qualidade das cenas. As edições do roteirista e a reação do público ajudam a aprimorar a próxima iteração.
Os resultados são muito animadores. Quando o Sherpa e cada concorrente escreveram uma história partindo de uma página em branco, avaliações cegas em pares preferiram o Sherpa em 65,6% a 97,1% dos casos, dependendo do concorrente. Considerando o aprendizado por reforço do Sherpa e o dataset crescente do Pocket, não há motivo para que essa diferença não continue aumentando.

Memória - Narrative World Model (NWM)
Modelos de linguagem não têm memória entre uma chamada e outra, então tudo o que sabem sobre uma história precisa caber no prompt. Janelas de contexto maiores não resolvem isso, porque os modelos usam de forma desigual as informações enterradas no meio de um prompt longo. A recuperação de dados em texto bruto também não resolve. Uma busca pode retornar o trecho que diz onde um objeto estava, e não onde ele está agora.
Quando um episódio é finalizado com o Sherpa, um modelo extrai registros estruturados dele, cada um vinculado ao trecho que o embasa. Os campos são feitos sob medida para ficção: o que os personagens sabem e ainda não sabem, quando um evento aconteceu versus quando o público descobre, quais ganchos estão esperando uma resolução. Cada fato é válido desde o capítulo que o estabeleceu até o capítulo que o altera. Se um roteirista edita um capítulo anterior, tudo o que dependia dele é reconstruído.
Para responder perguntas, o NWM busca no grafo pela formulação exata e pelo significado ao mesmo tempo, puxa as conexões diretas de cada resultado e entrega ao modelo um pacote pequeno e focado.
Sua recuperação consciente do contexto dos episódios traz apenas o cânone relevante, permitindo o raciocínio multi-hop sem vazar informações do futuro da história. Em um benchmark interno de 60 itens, o NWM do Sherpa alcançou 86,7% de precisão (52/60) a US$ 0,7793 por execução. É a mesma precisão da infraestrutura de memória do Claude Code com modelos da classe opus 5.x, mas com um custo aproximadamente 21 vezes menor (US$ 16,2172 por execução). Também superou a recuperação baseada apenas em prosa em 20 pontos percentuais (de 66,7% para 86,7%), custando substancialmente menos.

Motor de Prosa: tão difícil de decifrar que tivemos que criar nosso próprio modelo
O aprendizado por reforço precisa de um sinal de recompensa, e a prosa não tem um óbvio. Não existe um teste para dizer se um parágrafo tem qualidade de Prêmio Nobel ou se é apenas enchimento.
O Sherpa distribui cada parte do trabalho de escrita para um modelo diferente. Cada personagem é um agente rodando em nossos modelos personalizados e pós-treinados, que propõe o que pretende fazer em seguida com base em sua persona, no objetivo atual da história, nos eventos recentes e nas partes do mundo relevantes para ele. Um modelo crítico separado analisa cada proposta e devolve qualquer coisa vaga, implausível, fora do personagem, repetitiva ou que não faça a história avançar. Um terceiro modelo, o narrador, escolhe quais propostas se encaixam na cena e as transforma no próximo parágrafo. Apenas as ações que chegam à página são adicionadas à memória da história.
Além disso, estamos treinando um modelo de prosa proprietário com funções de recompensa criadas especificamente para ficção serializada. Penalizamos prosa rebuscada demais, repetições e explicações excessivas, e recompensamos diálogos naturais, vozes autênticas e tensão.
Sinais que usamos para avaliar a prosa:
- Isso contradiz eventos estabelecidos ou o conhecimento do personagem?
- A ação é plausível, fiel ao personagem e faz a cena avançar?
- Os roteiristas preferem este diálogo, voz e ritmo em relação a uma alternativa?
- Os ouvintes terminam o episódio e voltam para os próximos?
Esses sinais operam em escalas de tempo diferentes. Uma frase pode soar ótima, mas quebrar o cânone, e um cliffhanger pode aumentar o número de pessoas que iniciam o próximo episódio, mas enfraquecer um arco inteiro. O Sherpa precisa otimizar todos esses sinais em vez de tratar a retenção como uma pontuação única de "boa escrita", justamente por ser algo tão subjetivo.
O Motor de Prosa do Sherpa já supera a maioria dos modelos abertos e comerciais que avaliamos em nossos benchmarks internos de ficção, com índices de preferência de prosa de 69% contra o Sonnet 5 e 94% contra o Gemini 3.1 Pro. Cada barra mostra a preferência pela escrita do Sherpa em relação ao modelo indicado, avaliada em ambas as ordens de apresentação, sendo 50% o empate técnico. Estes são resultados preliminares de um pós-treinamento contínuo, e esperamos ganhos ainda maiores conforme o treinamento avança.

Planejador Hierárquico de Histórias
A estrutura narrativa é uma característica da série como um todo, e os modelos de linguagem só geram o próximo pedaço. Nada na previsão da próxima palavra sabe que uma pista plantada no episódio 5 precisa render frutos no episódio 60, ou que este capítulo exige um objetivo, um conflito e um desfecho. Em uma história de 100 páginas gerada por um modelo de ponta, um editor de IA que analisou apenas cinco capítulos apontou 52 problemas estruturais: progressões que não funcionavam e capítulos desnecessários para a trama.
O planejador do Sherpa trabalha de cima para baixo, partindo da narrativa geral para os arcos e episódios, e dá uma função a cada cena, incluindo o que ela deve deixar em aberto, para que o episódio 20 possa preparar a revelação do episódio 80 sem estragar a surpresa. Cada preparação é armazenada na memória da história como uma promessa em aberto até ser cumprida. Um gerador de objetivos mantém a trama em movimento: quando uma meta é atingida ou trava, ele define uma nova que não repita nenhuma das anteriores. No mesmo teste de 100 páginas, os problemas estruturais caíram de 52 para 31, e apenas remover as atualizações de objetivos reduziu as críticas em nível de capítulo quase pela metade.

Tudo está pronto para que o Sherpa ajude roteiristas a criar propriedades intelectuais bilionárias nos próximos anos. O Sherpa continua evoluindo à medida que atraímos mais criadores e usuários para a plataforma.
Há muito trabalho pela frente e várias questões continuam em aberto; aperfeiçoar o Sherpa é uma delas, assim como criar as condições logísticas para que os roteiristas tirem o máximo proveito dele.
Estou extremamente empolgado com o que estamos construindo no Pocket FM. Estamos ajudando criadores a ganhar a vida contando histórias que, há poucos anos, exigiriam orçamentos multimilionários.
Ainda estamos no começo do que será uma oportunidade de US$ 1 trilhão.





