Quando mudamos nosso foco para séries escritas por IA, inúmeras pessoas nos disseram que isso acabaria com o Pocket FM. Depois de seis longos meses, eu quase acreditei nelas. Mas então o nosso ecossistema explodiu — e não apesar da escrita por IA, mas justamente por causa dela. Em menos de 2 anos, nossa IA ajudou os autores a criar 161 sucessos no Pocket, incluindo uma propriedade intelectual avaliada em US$ 100 milhões.
O fato de os LLMs serem péssimos em escrever nos forçou a construir nossos próprios modelos e infraestrutura personalizados. Começar do zero foi desanimador em alguns momentos. Exigiu uma quantidade enorme de tentativa e erro, além de um dataset valioso gerado por 550 mil autores e mais de 100 milhões de usuários na plataforma.
Vou explicar como saímos do zero para chegar a um modelo de escrita perfeitamente calibrado, por que o Pocket FM é o campo de testes ideal e qual é o segredo por trás da capacidade do Sherpa de criar grandes sucessos.
Desde o lançamento do ChatGPT, todo mundo aponta que ele soa artificial demais. Quando você pede para um LLM escrever qualquer coisa, independentemente do tamanho, travessões começam a aparecer, frases curtas e de impacto se infiltram no texto, e o resultado final parece um trabalho único, longo e entediante.
Os LLMs foram projetados, em sua essência, para raciocínio lógico, resolver problemas matemáticos, ajudar com programação e recuperar conhecimento enciclopédico. Nada no treinamento deles os ensina a escrever algo que um leitor leria ou ouviria por vontade própria. E a culpa não é dos modelos.
O aprendizado por reforço funciona melhor quando o resultado está ligado a um sinal claro de sucesso, treinando o modelo caso algo tenha dado certo. Na programação, o código funciona e faz o que você pediu, ou não funciona. A resposta é certa.
Quando você escreve algo, não dá para saber se ficou bom. Você não sabe se o leitor abandonou o texto depois da primeira frase ou se chegou até o fim. Pior ainda: pergunte a 10 pessoas sobre um livro ou artigo específico que leram e você receberá 10 respostas diferentes.
Controlar a criação e a distribuição coloca o Pocket FM em uma posição bastante única. Monitoramos o uso minuto a minuto. Sabemos quando as pessoas param de ouvir, se voltam para o próximo episódio e se ficam por muito tempo. Não existem sinais melhores do que esses. O que faz o usuário abandonar a história, o Sherpa aprende a evitar; e o que mantém o usuário engajado em uma série específica, o Sherpa aproveita nas novas produções.

O usuário médio do Pocket FM ouve mais de 150 minutos por dia, quase 3 vezes mais do que no YouTube e cerca de 50% a mais do que na Netflix. Acredito que estamos apenas no começo de uma nova onda de conteúdos extremamente divertidos, imersivos e hiperpersonalizados, que só vão melhorar à medida que tivermos mais dados.
Por que textos de IA parecem textos de IA
Dostoiévski era um escritor incrível porque mostrava contradições e emoções no comportamento e nos desabafos de seus personagens. Oscar Wilde e Fitzgerald porque enfeitavam seus textos espirituosos de forma tão bela que você não consegue parar de virar as páginas. Conan Doyle pela habilidade de esconder informações do leitor até o último momento.
Os LLMs de uso geral foram criados para fazer exatamente o oposto disso, sem nenhuma chance de melhorar nesse aspecto. Eles dão respostas diretas, escrevem em linguagem neutra e abusam de recursos para tentar tornar a entrega mais eficaz. Da mesma forma, bons assistentes de IA são treinados para levar você rapidamente à conclusão correta. Todas essas características fundamentais permeiam a escrita deles, e é por isso que são ruins nisso.
A escrita criativa exige tensão, emoção, construção e resolução lenta de conflitos, traços de personalidade que vão além de frases de efeito e variações de ritmo. Os leitores precisam ser levados a conclusões erradas enquanto recebem pistas que os mantêm fisgados.
Mesmo um modelo de raciocínio que passa mais tempo "pensando" geralmente trabalha para resolver o problema, e não para ser recompensado pela experiência que o público tem ao chegar lá. Resolver um mistério e escrever um mistério são duas coisas completamente diferentes.
Fracassamos ao tentar ajustar o que já existia
No início, achamos que daria para seguir usando o que já estava disponível. Testamos modelos prontos e tentamos refiná-los na esperança de consertar aquela narrativa sem alma.
Experimentamos fazer prompts diretamente para modelos cada vez mais potentes, manter resumos contínuos conforme a história avançava e usar recuperação de dados (retrieval) e grafos de conhecimento para responder perguntas.
Ao fazer prompts diretamente, você chega ao episódio 100 com 10 a 20 inconsistências. Resumos contínuos basicamente jogam detalhes importantes no vazio, prejudicando a história dali em diante. Uma janela de contexto maior ajuda, mas os modelos ainda têm dificuldade para usar as informações com precisão em contextos longos.
Além do resultado final, as consultas são a melhor forma de medir o quanto o modelo entende do que escreveu. Logo no início, percebemos que, não importava o esforço aplicado em qualquer modelo, ele não conseguia responder a perguntas narratológicas de múltiplos saltos (multi-hop), que exigem detalhes de vários episódios. Isso escancarou as limitações do estado atual da tecnologia.
Concluímos que esse caminho era insustentável e decidimos criar nossa própria tecnologia... o Sherpa, batizado assim justamente para guiar o autor pelas partes mais difíceis da construção de uma história.
Razões técnicas pelas quais o Sherpa escreve uma história que você quer ouvir
O Sherpa é uma infraestrutura de modelo de escrita criativa serializada para formatos longos. Ele é composto por três elementos, que detalharei melhor após esta introdução:
- Um planejador decide o que cada arco e cena precisam alcançar, além de cuidar do desenvolvimento dos personagens e da evolução dos relacionamentos.
- Um Narrative World Model (Modelo de Mundo Narrativo) mantém um registro estruturado do que aconteceu, do que cada personagem sabe e de quais promessas a história ainda deve ao público.
- Um motor de prosa redige o texto com base nesse plano e estado, enquanto críticos avaliam o comportamento dos personagens, a continuidade e a qualidade das cenas. As edições do autor e a resposta do público ajudam a aprimorar a próxima iteração.
Os resultados são muito animadores. Quando o Sherpa e cada concorrente escreveram uma história partindo de uma página em branco, avaliações cegas em pares preferiram o Sherpa em 65,6% a 97,1% dos casos, dependendo do concorrente. Considerando o aprendizado por reforço do Sherpa e o dataset crescente do Pocket, não há motivo para essa diferença não continuar aumentando.

Memória - Narrative World Model (NWM)
Modelos de linguagem não têm memória entre chamadas, então tudo o que sabem sobre uma história precisa caber no prompt. Janelas de contexto maiores não resolvem isso, porque os modelos usam de forma desigual as informações escondidas no meio de um prompt longo. Fazer buscas em texto bruto também não resolve. Uma pesquisa pode retornar o trecho que diz onde um objeto estava, e não onde ele está agora.
Quando um episódio é finalizado com o Sherpa, um modelo extrai registros estruturados dele, cada um vinculado ao trecho que o sustenta. Os campos são feitos sob medida para ficção: o que os personagens sabem e o que ainda não sabem, quando um evento aconteceu em comparação com quando o público descobre, quais preparações estão esperando um desfecho. Cada fato é válido desde o capítulo que o estabeleceu até o capítulo que o altera. Se um autor edita um capítulo anterior, tudo o que dependia dele é reconstruído.
Para responder perguntas, o NWM busca no grafo por correspondência exata e por significado ao mesmo tempo, puxa as conexões diretas de cada resultado e entrega ao modelo um pacote pequeno e focado.
Sua recuperação consciente do contexto dos episódios traz apenas o cânone relevante, permitindo o raciocínio multi-hop sem vazar informações da história futura. Em um benchmark interno de 60 itens, o NWM do Sherpa alcançou 86,7% de precisão (52/60) a um custo de US$ 0,7793 por execução. É a mesma precisão da infraestrutura de memória do Claude Code com modelos da classe opus 5.x, mas com um custo aproximadamente 21 vezes menor (US$ 16,2172 por execução). Ele também superou a recuperação baseada apenas em prosa em 20 pontos percentuais (de 66,7% para 86,7%) custando bem menos.

Motor de Prosa: tão difícil de decifrar que tivemos que criar nosso próprio modelo
O aprendizado por reforço precisa de um sinal de recompensa, e a prosa não tem um óbvio. Não existe um teste para dizer se um parágrafo tem qualidade de Prêmio Nobel ou se é apenas enchimento.
O Sherpa distribui cada parte do trabalho de escrita para um modelo diferente. Cada personagem é um agente rodando em nossos modelos personalizados e pós-treinados, que propõe o que pretende fazer em seguida com base em sua persona, no objetivo atual da história, nos eventos recentes e nas partes do mundo relevantes para ele. Um modelo crítico separado analisa cada proposta e devolve qualquer coisa vaga, implausível, fora do personagem, repetitiva ou que não faça a história avançar. Um terceiro modelo, o narrador, escolhe quais propostas se encaixam na cena e as transforma no próximo parágrafo. Apenas as ações que chegam à página são adicionadas à memória da história.
Além disso, estamos treinando um modelo de prosa proprietário com funções de recompensa criadas para ficção serializada. Penalizamos prosa rebuscada demais, repetições e explicações excessivas, e recompensamos diálogos naturais, vozes autênticas e tensão.
Sinais que usamos para avaliar a prosa:
- Isso contradiz eventos estabelecidos ou o conhecimento do personagem?
- A ação é plausível, fiel ao personagem e faz a cena avançar?
- Os autores preferem este diálogo, voz e ritmo em relação a uma alternativa?
- Os ouvintes terminam o episódio e voltam para os próximos?
Esses sinais operam em escalas de tempo diferentes. Uma frase pode soar ótima, mas quebrar o cânone, e um gancho de suspense pode aumentar o número de pessoas que iniciam o próximo episódio, mas enfraquecer um arco inteiro. O Sherpa precisa otimizar todos esses sinais em vez de tratar a retenção como uma pontuação única de "boa escrita", já que isso é algo muito subjetivo.
O Motor de Prosa do Sherpa já supera a maioria dos modelos abertos e comerciais que avaliamos em nossos benchmarks internos de ficção, com índices de preferência de prosa de 69% contra o Sonnet 5 e 94% contra o Gemini 3.1 Pro. Cada barra mostra a preferência pela escrita do Sherpa em relação ao modelo indicado, avaliada em ambas as ordens de apresentação, sendo 50% o empate técnico. Esses são resultados iniciais do pós-treinamento em andamento, e esperamos avanços ainda maiores conforme o treinamento continua.

Planejador Hierárquico de Histórias
A estrutura de uma história é uma característica da série inteira, mas os modelos de linguagem só geram o próximo pedaço. Nada na previsão da próxima palavra sabe que uma pista deixada no episódio 5 precisa ter um desfecho no episódio 60, ou que este capítulo precisa de um objetivo, um conflito e uma consequência. Em uma história de 100 páginas gerada por um modelo de ponta, um editor de IA que analisou apenas cinco capítulos apontou 52 problemas estruturais: progressões que não funcionavam e capítulos desnecessários para a trama.
O planejador do Sherpa trabalha de cima para baixo, partindo da narrativa geral para os arcos e episódios, dando uma função a cada cena, inclusive definindo o que ela deve deixar em aberto, para que o episódio 20 possa preparar a revelação do episódio 80 sem estragar a surpresa. Toda preparação é armazenada na memória da história como uma promessa em aberto até ser cumprida. Um gerador de objetivos mantém a trama em movimento: quando uma meta é alcançada ou trava, ele cria uma nova que não repete nenhuma das anteriores. No mesmo teste de 100 páginas, os problemas estruturais caíram de 52 para 31, e apenas remover as atualizações de objetivos reduziu as críticas em nível de capítulo quase pela metade.

Tudo está pronto para que o Sherpa ajude os autores a criar propriedades intelectuais bilionárias nos próximos anos. O Sherpa continua evoluindo à medida que trazemos mais criadores e usuários para a plataforma.
Há muito trabalho pela frente e várias questões continuam em aberto; aperfeiçoar o Sherpa é uma delas, assim como criar as condições logísticas para que os autores possam aproveitá-lo da melhor forma possível.
Estou extremamente empolgado com o que estamos fazendo no Pocket FM. Estamos ajudando criadores a ganhar a vida contando histórias que, há poucos anos, exigiriam um orçamento multimilionário.
Ainda estamos no começo do que será uma oportunidade de US$ 1 trilhão.





