YouMind
Увійти

Чому LLM погано пишуть і як Sherpa це виправляє

@RohanNayak2
АНГЛІЙСЬКА30 вер. 2026 р.
324K
612
156
31
639

Коротко

Генеральний директор Pocket FM Рохан Наяк пояснює, чому стандартні LLM мають труднощі з творчим письмом через відсутність сигналів залученості. Він детально описує, як Sherpa — кастомний AI-фреймворк зі спеціалізованими планувальниками та моделями пам’яті — допомагає авторам створювати успішні серіалізовані аудіодрами.

Коли ми переорієнтувалися на шоу, написані за допомогою ШІ, безліч людей казали нам, що це вб'є Pocket FM. Після шести довгих місяців я майже повірив їм. Але потім наша екосистема вибухнула — і не всупереч ШІ-письменництву, а завдяки йому. Менш ніж за 2 роки наш ШІ допоміг авторам створити 161 блокбастер на Pocket, включно з IP вартістю $100 млн.

Те, що LLM жахливо писали тексти, змусило нас створювати власні кастомні моделі та інфраструктуру для них. Починати з нуля часом було справді демотивуюче. Це забрало величезну кількість спроб і помилок, а також золотий датасет, сформований 550 тис. авторів та понад 100 млн користувачів нашої платформи.

Я розповім, як ми пройшли шлях від нуля до ідеально налаштованої моделі для написання текстів, чому Pocket FM — це ідеальний полігон для випробувань, і в чому секрет здатності Sherpa створювати блокбастери.


Відколи вийшов ChatGPT, усі зауважують, що він звучить надто «по-штучному». Коли ви просите LLM написати будь-що, незалежно від обсягу, у тексті з'являються довгі тире, короткі рублені речення пробиваються назовні, а результат читається як одна велика нудна робота.

LLM фундаментально створювалися для логічних міркувань, розв'язання математичних задач, допомоги з кодом та пошуку енциклопедичних знань. Нічого в їхньому навчанні не вчить їх писати те, що читач захоче прочитати або послухати добровільно. І це не провина моделей.

Навчання з підкріпленням працює найкраще, коли результат прив'язаний до чіткого сигналу успіху, який дає моделі зрозуміти, чи спрацювало щось. У програмуванні код або працює й робить те, що ви просили, або ні. Відповідь однозначна.

Коли ви пишете текст, ви не можете одразу сказати, чи він хороший. Ви не знаєте, чи читач закрив сторінку після першого речення, чи дочитав до кінця. Що ще гірше: запитайте 10 людей про конкретну книгу чи статтю, яку вони прочитали, і ви отримаєте 10 різних відповідей.

Контроль над створенням та дистрибуцією ставить Pocket FM в абсолютно унікальне становище. Ми відстежуємо використання щохвилини. Ми знаємо, коли люди перестають слухати, чи повертаються вони до наступного епізоду і чи залишаються з нами надовго. Кращих сигналів просто не існує. Sherpa вчиться уникати всього, що змушує користувача піти, і використовує для нових шоу все, що тримає його увагу в конкретному серіалі.

Rohan Nayak - inline image

Середній користувач Pocket FM слухає контент понад 150 хвилин на день — це майже втричі більше, ніж на YouTube, і приблизно на 50% більше, ніж на Netflix. Я вважаю, що ми лише на самому початку нової хвилі надзвичайно захопливого, імерсивного та гіперперсоналізованого контенту, який ставатиме тільки кращим зі збільшенням обсягу даних.

Чому тексти, написані ШІ, звучать як тексти, написані ШІ

Достоєвський був неймовірним письменником, бо показував суперечності та емоції через поведінку й монологи своїх персонажів. Оскар Вайльд та Фіцджеральд — тому, що так майстерно прикрашали свої дотепні тексти, що неможливо відірватися від сторінок. Конан Дойл — завдяки вмінню приховувати інформацію від читача до самого фіналу.

Універсальні LLM створені робити рівно протилежне, і в них немає жодного способу стати в цьому кращими. Вони дають прямі відповіді, пишуть нейтральною мовою та зловживають шаблонами заради ефективності подачі. Так само й хороші ШІ-асистенти натреновані швидко приводити вас до правильної висновку. Усі ці фундаментальні налаштування пронизують їхнє письмо, і саме тому вони в ньому такі слабкі.

Художнє письмо потребує напруги, емоцій, створення та повільного вирішення конфлікту, рис характеру, які виходять за межі коротких фраз, і зміни темпу. Користувачів треба вести до хибних висновків, одночасно підкидаючи підказки, які тримають їх на гачку.

Навіть модель із розширеними міркуваннями, яка довше «думає», зазвичай працює над розв'язанням проблеми, а не над тим, щоб винагородити аудиторію за сам процес її досягнення. Розгадати загадку і написати загадку — це дві абсолютно різні речі.

Ми зазнали невдачі, намагаючись підлатати те, що вже існувало

Спочатку ми думали, що зможемо обійтися наявними інструментами. Ми брали готові моделі й намагалися їх доопрацювати, сподіваючись вдихнути душу в їхню беземоційну оповідь.

Ми експериментували з прямими промптами для дедалі потужніших моделей, вели рухомі резюме сюжету в міру його розвитку, використовували RAG та графи знань для відповідей на запити.

При роботі з прямими промптами до 100-го епізоду ви накопичуєте 10–20 неузгодженостей. Рухомі резюме фактично відправляють важливі деталі в небуття, що псує подальший сюжет. Більше контекстне вікно допомагає, але моделям усе одно складно точно використовувати інформацію в довгих контекстах.

Окрім самого результату, запити — найкращий спосіб перевірити, наскільки модель розуміє те, що написала. На ранніх етапах ми усвідомили: скільки б зусиль ми не вкладали в будь-яку модель, вона не могла відповісти на багатоходові наратологічні запити, які потребують деталей із кількох епізодів. Це оголило обмеження тогочасних технологій.

Ми дійшли висновку, що цей шлях безперспективний, і вирішили створити власну технологію... Sherpa — назва говорить сама за себе, адже цей інструмент покликаний провести автора через найскладніші етапи створення історії.

Технічні причини, чому Sherpa пише історії, які хочеться слухати

Sherpa — це інфраструктура (harness) моделі для написання довгих серіалізованих художніх текстів. Вона складається з трьох компонентів, які я детальніше опишу після цього вступу:

  1. Планувальник визначає, що має досягти кожна арка та сцена, а також відповідає за розвиток персонажів та еволюцію їхніх стосунків.
  2. Narrative World Model (Модель наративного світу) веде структурований запис того, що сталося, що знає кожен персонаж і які обіцянки історія ще має виконати перед аудиторією.
  3. Прозовий рушій (prose engine) генерує чернетку на основі цього плану та стану, тоді як критики перевіряють поведінку персонажів, безперервність сюжету та якість сцен. Потім правки автора та реакція аудиторії допомагають покращити наступну ітерацію.

Результати дуже обнадійливі. Коли Sherpa та кожен із конкурентів писали історію з чистого аркуша, сліпі попарні оцінки надавали перевагу Sherpa у 65,6%–97,1% випадків залежно від конкурента. Зважаючи на навчання з підкріпленням Sherpa та постійне зростання датасету Pocket, немає жодних причин, чому б цей розрив не мав продовжувати збільшуватися.

Rohan Nayak - inline image

Пам'ять — Narrative World Model (NWM)

Мовні моделі не мають пам'яті між викликами, тому все, що вони знають про історію, має поміститися в промпт. Довші контекстні вікна цього не вирішують, бо моделі нерівномірно використовують інформацію, заховану посередині довгого промпту. Пошук по сирих текстах теж не рятує. Запит може видати уривок, де сказано, де предмет був, а не де він зараз.

Коли епізод завершується за допомогою Sherpa, модель витягує з нього структуровані записи, кожен із яких прив'язаний до уривка тексту, що його підтверджує. Поля створені спеціально для художньої літератури: що персонажі знають, а чого ще ні; коли сталася подія порівняно з тим, коли про неї дізнається аудиторія; які зав'язки чекають на розв'язку. Кожен факт є дійсним від розділу, де його встановлено, до розділу, де його змінено. Якщо автор редагує попередній розділ, усе, що від нього залежало, перебудовується.

Щоб відповідати на запитання, NWM одночасно шукає в графі за точним формулюванням і за змістом, підтягує прямі зв'язки кожного результату та передає моделі невеликий сфокусований пакет даних.

Цей пошук, який враховує структуру епізодів, видає лише релевантний канон, уможливлюючи багатоходові міркування без витоку інформації з майбутнього сюжету. У внутрішньому бенчмарку на 60 пунктів Sherpa NWM досяг точності 86,7% (52/60) за ціною $0,7793 за один запуск. Це та сама точність, що й у системи пам'яті Claude Code з моделями класу opus 5.x, але приблизно у 21 раз дешевше ($16,2172 за запуск). Він також перевершив пошук лише по прозі на 20 відсоткових пунктів (66,7% → 86,7%), коштуючи при цьому значно менше.

Rohan Nayak - inline image

Прозовий рушій: настільки складна задача, що нам довелося створити власну модель

Навчання з підкріпленням потребує сигналу винагороди, а в прозі немає очевидного такого сигналу. Немає тесту, який би сказав, чи абзац тягне на Нобелівську премію, чи це просто вода.

Sherpa розподіляє кожну частину роботи над текстом між різними моделями. Кожен персонаж — це агент, який працює на наших кастомних донавчених моделях і пропонує, що він збирається зробити далі, спираючись на свій характер, поточну мету історії, останні події та ті елементи світу, які його стосуються. Окрема модель-критик переглядає кожну пропозицію й відхиляє все розмите, неправдоподібне, нетипове для персонажа, повторюване або таке, що не рухає сюжет вперед. Третя модель, оповідач, потім обирає, які пропозиції пасують до сцени, і вплітає їх у наступний абзац. Лише ті дії, що потрапляють на сторінку, додаються до пам'яті історії.

Поверх цього ми тренуємо пропрієтарну прозову модель із функціями винагороди, створеними спеціально для серіалізованої літератури. Ми штрафуємо за надмірно пафосний стиль, повтори та зайві пояснення, а винагороджуємо за природні діалоги, голоси персонажів і напругу.

Сигнали, за якими ми оцінюємо прозу:

  • Чи суперечить це встановленим подіям або знанням персонажів?
  • Чи є дія правдоподібною, чи відповідає вона характеру і чи рухає сцену вперед?
  • Чи віддають автори перевагу цьому діалогу, голосу та темпу перед альтернативою?
  • Чи дослуховують слухачі епізод до кінця і чи повертаються до наступних?

Ці сигнали працюють у різних часових масштабах. Речення може звучати чудово, але порушувати канон, а кліфгенгер може покращити старти наступного епізоду, але послабити цілу арку. Sherpa має оптимізувати роботу за всіма цими сигналами, а не сприймати утримання як єдину оцінку «хорошого тексту», адже останнє занадто суб'єктивне.

Прозовий рушій Sherpa вже перевершує більшість відкритих і комерційних моделей, які ми тестували в наших внутрішніх бенчмарках художньої літератури: перевага прози становить 69% проти Sonnet 5 та 94% проти Gemini 3.1 Pro. Кожна шкала показує перевагу тексту Sherpa над зазначеною моделлю, оцінену в обох порядках подачі, де 50% означає паритет. Це ранні результати поточного донавчання, і ми очікуємо подальшого прогресу в міру продовження тренувань.

Rohan Nayak - inline image

Ієрархічний планувальник історії

Структура історії — це властивість усього шоу, а мовні моделі генерують лише наступний фрагмент. Ніщо в передбаченні наступного слова не знає, що підказка, залишена в 5-му епізоді, має спрацювати в 60-му, або що цьому розділу потрібні мета, конфлікт і результат. У 100-сторінковій історії від флагманської моделі ШІ-редактор, який перевірив лише п'ять розділів, виявив 52 структурні проблеми: збитий розвиток подій та розділи, які історії взагалі не були потрібні.

Планувальник Sherpa рухається від загального наративу вниз, через арки та епізоди, і дає кожній сцені конкретне завдання, включно з тим, що вона має залишити нерозкритим, щоб 20-й епізод міг підготувати розкриття карт у 80-му, не видаючи його завчасно. Кожна зав'язка зберігається в пам'яті історії як відкрита обіцянка, поки не отримає розв'язки. Генератор цілей не дає сюжету зупинитися: коли ціль досягнута або буксує, він ставить нову, яка не повторює жодної з попередніх. У тому самому 100-сторінковому тесті кількість структурних проблем впала з 52 до 31, а лише видалення оновлень цілей покращило оцінки на рівні розділів майже вдвічі.

Rohan Nayak - inline image

Усе готово для того, щоб Sherpa допоміг авторам створювати IP на мільярди доларів у найближчі кілька років. Sherpa стає дедалі кращим, оскільки ми залучаємо на платформу більше креаторів та користувачів.

Попереду ще багато роботи, і чимало питань залишаються відкритими: доведення Sherpa до досконалості — одне з них, як і створення організаційних умов, щоб автори могли використовувати його максимально ефективно.

Я неймовірно захоплений тим, що ми робимо в Pocket FM. Ми допомагаємо креаторам заробляти на життя, розповідаючи історії, які ще кілька років тому вимагали б багатомільйонного бюджету.

Ми все ще на самому початку шляху до можливості вартістю $1 трлн.

Переробити в YouMind

Перетворіть одну віральну статтю на повноцінний робочий процес

Збирайте джерела, розшифровуйте патерни, створюйте матеріали, пишіть чернетки та поширюйте контент в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей