Когда мы переключились на сериалы, написанные ИИ, нам твердили на каждом шагу: это убьет Pocket FM. После шести долгих месяцев я и сам почти в это поверил. Но потом наша экосистема взорвалась — и не вопреки ИИ-сценариям, а именно благодаря им. Менее чем за 2 года наш ИИ помог авторам создать 161 блокбастер на Pocket, включая IP стоимостью $100 млн.
То, что LLM ужасно справлялись с текстами, вынудило нас создавать собственные кастомные модели и инфраструктуру. Начинать с нуля порой было просто невыносимо. Потребовалось огромное количество проб и ошибок, а также золотой датасет, собранный 550 тыс. авторов и более чем 100 млн пользователей платформы.
Я расскажу, как мы прошли путь от полного нуля до идеально откалиброванной модели для написания текстов, почему Pocket FM стал идеальным полигоном для тестов и в чем секрет способности Sherpa создавать блокбастеры.
С момента выхода ChatGPT все только и говорят, что он звучит слишком «по-роботизированному». Попросите LLM написать хоть что-нибудь, любого объема — и текст тут же заполнится тире, короткими рублеными фразами, а результат будет читаться как один большой и скучный кусок текста.
LLM изначально создавались для логических рассуждений, решения математических задач, помощи в программировании и поиска энциклопедической информации. Ничто в их обучении не учит их писать так, чтобы человек захотел это читать или слушать. И это не вина моделей.
Обучение с подкреплением работает лучше всего, когда результат привязан к четкому сигналу успеха, который подсказывает модели, сработало что-то или нет. В коде всё просто: программа либо работает и делает то, что вы просили, либо нет. Ответ однозначен.
А когда вы пишете текст, невозможно сразу понять, хорош ли он. Вы не знаете, бросил ли читатель его после первого предложения или дочитал до конца. Что еще хуже: спросите 10 человек о конкретной книге или статье, которую они прочли, и получите 10 разных ответов.
Контроль над созданием и дистрибуцией контента ставит Pocket FM в совершенно уникальное положение. Мы отслеживаем поведение пользователей буквально поминутно. Мы знаем, когда люди перестают слушать, возвращаются ли они за следующей серией и остаются ли с нами надолго. Лучше сигналов просто не бывает. Чего бы ни стоило пользователю уйти, Sherpa учится этого избегать; а всё, что удерживает внимание на конкретном шоу, Sherpa использует в новых проектах.

Средний пользователь Pocket FM слушает контент более 150 минут в день — это почти в 3 раза больше, чем на YouTube, и примерно на 50% больше, чем на Netflix. Мне кажется, мы находимся в самом начале новой волны невероятно увлекательного, погружающего и гиперперсонализированного контента, который будет становиться только лучше по мере накопления данных.
Почему ИИ-тексты звучат как ИИ-тексты
Достоевский был гениальным писателем, потому что показывал противоречия и эмоции через поступки и монологи своих героев. Оскар Уайльд и Фицджеральд — потому что украшали свои остроумные тексты так изящно, что от них невозможно было оторваться. Конан Дойл — за умение прятать информацию от читателя до самой последней страницы.
Универсальные LLM созданы делать ровно наоборот, и у них нет шансов стать в этом лучше. Они отвечают напрямую, пишут нейтральным языком и злоупотребляют штампами, пытаясь сделать подачу эффективнее. Точно так же хорошие ИИ-ассистенты обучены максимально быстро приводить вас к правильному выводу. Все эти базовые настройки пропитывают их тексты, и именно поэтому они так плохо пишут.
Художественная литература требует напряжения, эмоций, создания и медленного разрешения конфликта, черт характера, которые не опишешь одной фразой, и смены темпа. Читателя нужно вести к ложным выводам, подкидывая ему подсказки, которые держат на крючке.
Даже модель с развитым мышлением, которая дольше обдумывает ответ, обычно стремится решить задачу, а не получить награду за то, какие эмоции испытает аудитория в процессе. Разгадать детектив и написать детектив — две совершенно разные вещи.
Мы потерпели неудачу, пытаясь доработать готовое
Поначалу мы думали, что обойдемся тем, что уже есть на рынке. Мы брали готовые модели и пытались их доработать в надежде вдохнуть жизнь в их бездушные истории.
Мы экспериментировали с прямыми промптами для всё более мощных моделей, вели скользящие сводки по мере развития сюжета, использовали RAG и графы знаний для ответов на запросы.
При прямом промптинге к 100-й серии вы получаете 10–20 несостыковок. Скользящие сводки по сути отправляют важные детали в никуда, и дальше история начинает хромать. Большее контекстное окно помогает, но моделям всё равно сложно точно использовать информацию в длинных контекстах.
Помимо самого результата, лучший способ проверить, понимает ли модель то, что написала, — задавать ей вопросы. Очень быстро мы осознали: сколько усилий ни прикладывай к любой модели, она не справляется с многошаговыми нарратологическими запросами, требующими деталей из нескольких серий. Это обнажило ограничения текущего уровня технологий.
Мы поняли, что этот путь ведет в тупик, и решили создать собственную технологию... Sherpa — название говорит само за себя: этот проводник помогает автору пройти через самые сложные этапы сторителлинга.
Технические причины, по которым Sherpa пишет истории, которые хочется слушать
Sherpa — это инфраструктура (harness) для модели художественного письма, работающей с длинными serialized-форматами. Она состоит из трех компонентов, о которых я подробнее расскажу после этого введения:
- Планировщик решает, чего должна достичь каждая арка и сцена, и отвечает за развитие персонажей и эволюцию их отношений.
- Narrative World Model (Модель мира повествования) ведет структурированный учет того, что произошло, что знает каждый персонаж и какие обещания сюжет всё еще должен выполнить перед аудиторией.
- Прозаический движок пишет текст на основе этого плана и состояния, а критики проверяют поведение персонажей, непрерывность сюжета и качество сцен. Затем правки автора и реакция аудитории помогают улучшить следующую итерацию.
Результаты очень обнадёживают. Когда Sherpa и каждый из конкурентов писали историю с чистого листа, при слепом парном сравнении Sherpa побеждал в 65,6%–97,1% случаев в зависимости от соперника. Учитывая обучение с подкреплением Sherpa и растущий датасет Pocket, нет никаких причин, по которым этот разрыв не продолжит увеличиваться.

Память — Narrative World Model (NWM)
У языковых моделей нет памяти между вызовами, поэтому всё, что они знают об истории, должно помещаться в промпт. Более длинные контекстные окна проблему не решают: модели неравномерно используют информацию, спрятанную в середине длинного промпта. Поиск по сырому тексту тоже не выход. Поиск может вернуть фрагмент, где сказано, где предмет находился раньше, но не где он сейчас.
Когда серия завершается в Sherpa, модель извлекает из неё структурированные записи, каждая из которых привязана к подтверждающему её фрагменту текста. Поля созданы специально для художественной литературы: что персонажи знают, а чего ещё нет; когда событие произошло по сравнению с тем, когда о нём узнала аудитория; какие завязки ждут развязки. Каждый факт действителен с главы, в которой он появился, до главы, в которой он изменился. Если автор редактирует раннюю главу, всё, что от неё зависело, перестраивается заново.
Чтобы отвечать на вопросы, NWM одновременно ищет в графе по точному совпадению слов и по смыслу, подтягивает прямые связи каждого результата и передаёт модели небольшой сфокусированный пакет данных.
Её поиск с учётом серий выводит только релевантный канон, позволяя выполнять многошаговые рассуждения без утечек из будущего сюжета. На внутреннем бенчмарке из 60 пунктов Sherpa NWM показал точность 86,7% (52/60) при стоимости $0,7793 за запуск. Это та же точность, что и у системы памяти Claude Code с моделями класса opus 5.x, но примерно в 21 раз дешевле ($16,2172 за запуск). Он также превзошел поиск только по тексту на 20 процентных пунктов (66,7% → 86,7%), стоив при этом существенно меньше.

Прозаический движок: задача оказалась настолько сложной, что пришлось строить свою модель
Обучению с подкреплением нужен сигнал вознаграждения, а у прозы его нет. Не существует теста, который скажет, тянет ли абзац на Нобелевскую премию или это просто вода.
Sherpa распределяет задачи по написанию текста между разными моделями. Каждый персонаж — это агент, работающий на наших кастомных дообученных моделях, который предлагает, что он собирается делать дальше, исходя из своего характера, текущей цели истории, недавних событий и тех частей мира, которые к нему относятся. Отдельная модель-критик проверяет каждое предложение и отклоняет всё расплывчатое, неправдоподобное, нехарактерное для героя, повторяющееся или не двигающее сюжет вперед. Затем третья модель — рассказчик — выбирает, какие предложения подходят для сцены, и превращает их в следующий абзац. Только те действия, которые попали на страницу, добавляются в память истории.
Вдобавок к этому мы обучаем проприетарную модель прозы с функциями вознаграждения, созданными специально для сериальной литературы. Мы штрафуем за излишнюю витиеватость, повторы и пережевывание одного и того же, а поощряем естественные диалоги, голоса персонажей и напряжение.
Сигналы, по которым мы оцениваем прозу:
- Противоречит ли это установленным событиям или знаниям персонажей?
- Правдоподобно ли действие, в характере ли оно и двигает ли сцену вперед?
- Предпочитают ли авторы этот диалог, голос и темп альтернативному варианту?
- Дослушивают ли слушатели серию до конца и возвращаются ли за следующими?
Эти сигналы работают в разных временных масштабах. Предложение может звучать отлично, но ломать канон, а клиффхэнгер — улучшать старт следующей серии, но ослаблять целую арку. Sherpa должен оптимизировать работу по всем этим сигналам, а не сводить удержание к единой оценке «хорошего текста», потому что последнее слишком субъективно.
Прозаический движок Sherpa уже превосходит большинство открытых и коммерческих моделей, которые мы тестировали на внутренних бенчмарках художественной литературы: предпочтение его текстов составило 69% против Sonnet 5 и 94% против Gemini 3.1 Pro. Каждый столбец показывает предпочтение текстов Sherpa перед указанной моделью, оцененное в обоих порядках подачи, где 50% означает паритет. Это ранние результаты продолжающегося дообучения, и мы ожидаем дальнейшего роста по мере продолжения обучения.

Иерархический планировщик сюжета
Структура истории — свойство всего шоу целиком, а языковые модели генерируют только следующий фрагмент. Ничто в предсказании следующего слова не знает, что подсказка, оставленная в 5-й серии, должна выстрелить в 60-й, или что этой главе нужны цель, конфликт и исход. В 100-страничной истории от frontier-модели ИИ-редактор, проверивший всего пять глав, обнаружил 52 структурные проблемы: неработающую динамику и главы, без которых история легко обошлась бы.
Планировщик Sherpa спускается от общего нарратива через арки и серии и назначает каждой сцене задачу, включая то, что она должна оставить неразрешенным, чтобы 20-я серия могла подготовить раскрытие карты в 80-й, не выдавая его раньше времени. Каждая завязка хранится в памяти истории как открытое обещание, пока не получит развязку. Генератор целей не дает сюжету буксовать: когда цель достигнута или застопорилась, он ставит новую, не повторяющую ни одну из предыдущих. На том же 100-страничном тесте количество структурных проблем упало с 52 до 31, а одно только удаление обновлений целей повысило оценку качества на уровне глав почти наполовину.

У Sherpa есть всё необходимое, чтобы помочь авторам создавать IP стоимостью в миллиарды долларов в ближайшие несколько лет. Sherpa становится лучше с каждым новым креатором и пользователем на платформе.
Впереди много работы, и множество вопросов пока остаются открытыми: доведение Sherpa до совершенства — один из них, как и создание условий, в которых авторы смогут использовать его максимально эффективно.
Я невероятно воодушевлен тем, что мы делаем в Pocket FM. Мы помогаем креаторам зарабатывать на жизнь, рассказывая истории, на которые пару лет назад потребовался бы многомиллионный бюджет.
Мы всё ещё в самом начале пути к рынку объемом в $1 трлн.





