私たちが AI による脚本制作へと舵を切ったとき、数え切れないほど多くの人から「Pocket FM は終わる」と言われました。半年もの間、私も彼らの言葉を信じかけていました。しかしその後、私たちのエコシステムは爆発的に成長しました。AI が書いたからではなく、AI が書いたからこそ起きたことです。2 年足らずの間に、私たちの AI はライターたちと共に Pocket 上で 161 の大ヒット作を生み出し、その中には 1 億ドル規模の IP も含まれています。
LLM が文章を書くのがあまりにも下手だったおかげで、私たちは独自のカスタムモデルとハーネス(制御基盤)を構築せざるを得なくなりました。ゼロからのスタートは、時に心が折れそうになるものでした。途方もない試行錯誤と、プラットフォーム上の 55 万人のライターと 1 億人以上のユーザーが生み出した黄金のデータセットが必要でした。
本記事では、何もない状態から見事に調整されたライティングモデルをどうやって作り上げたのか、なぜ Pocket FM が完璧なテスト環境なのか、そして Sherpa が大ヒット作を書き上げる秘訣について解説します。
ChatGPT がリリースされて以来、誰もが「いかにも AI らしい文体だ」と指摘してきました。LLM に何かを書かせると、長さに関係なくダッシュ記号が現れ、短く歯切れの良い文が散りばめられ、出力全体が退屈で単調な文章に仕上がってしまいます。
LLM は本来、論理的推論、数学の問題解決、コーディング支援、百科事典的な知識の検索のために設計されています。読者が進んで読みたくなる、あるいは聴きたくなるような文章を書くための訓練は一切受けていません。これはモデルのせいではありません。
強化学習は、出力が明確な成功シグナルに紐づいているときに最も効果を発揮し、「何がうまくいったか」をモデルに学習させます。コーディングであれば、コードが要求通りに動くか動かないかのどちらかであり、答えは明白です。
しかし文章の場合、それが良いものかどうか判断できません。読者が最初の一文で離脱したのか、最後まで読んでくれたのかも分かりません。さらに厄介なのは、特定の本や記事について 10 人に感想を聞けば、10 通りの答えが返ってくることです。
制作と配信の両方を自社で担っていることが、Pocket FM を非常にユニークな立場に置いています。私たちは利用状況を分単位で監視しています。ユーザーがいつ視聴をやめたのか、次のエピソードに戻ってきたのか、長期的に定着しているのかが分かります。これ以上のシグナルはありません。ユーザーの離脱につながる要素を Sherpa は回避するように学習し、特定の番組へのエンゲージメントを維持する要素を新しい番組に活用します。

Pocket FM の平均的なユーザーは 1 日あたり 150 分以上をリスニングに費やしており、これは YouTube の約 3 倍、Netflix よりも約 50% 多い数字です。私たちは今、極めてエンターテインメント性が高く、没入感があり、超パーソナライズされたコンテンツという新たな波の始まりにいると考えています。データが集まるにつれて、その質はさらに向上していくでしょう。
なぜ AI の文章は AI っぽく聞こえるのか
ドストエフスキーが偉大な作家であったのは、登場人物の行動や長台詞の中に矛盾や感情を描き出したからです。オスカー・ワイルドやフィッツジェラルドは、機知に富んだ文章を美しく装飾し、ページをめくる手を止めさせませんでした。コナン・ドイルは、最後の瞬間まで読者から情報を隠す手腕に長けていました。
汎用 LLM は、これらとは真逆のことを行うように作られており、それを改善する術も持っていません。直接的に答えを出し、中立的な言葉で書き、伝達効果を高めるための定型表現を使いすぎます。同様に、優れた AI アシスタントは、ユーザーを素早く正しい結論へ導くよう訓練されています。こうした根本的な設計思想が文章の端々に滲み出てしまうため、彼らは文章を書くのが苦手なのです。
クリエイティブ・ライティングには、緊張感、感情、葛藤の創出とゆっくりとした解決、一言では表せないキャラクター性、そしてテンポの変化が必要です。読者を惹きつけるヒントを与えつつ、あえて誤った結論へと誘導しなければなりません。
思考に時間をかける推論モデルであっても、基本的には問題解決に向かって進んでおり、そこに至る過程での読者の体験が評価されることはありません。謎を解くことと、謎解き小説を書くことは全くの別物なのです。
既存モデルの微調整という失敗
当初、私たちは既存のもので十分対応できると考えていました。既製のモデルを試したり、魂のないストーリーテリングを修正しようとファインチューニングを行ったりしました。
より強力なモデルに対して直接プロンプトを与える実験、物語の進行に合わせてローリングサマリー(逐次要約)を保持する手法、クエリ回答のための検索やナレッジグラフの利用などを試みました。
しかし、直接プロンプトを与える方法では、第 100 エピソードに到達するまでに 10〜20 の矛盾が生じます。ローリングサマリーは重要な詳細を闇に葬り去り、その後の物語の質を損ないます。コンテキストウィンドウを大きくすれば多少は改善しますが、それでもモデルは長い文脈の中で情報を正確に扱うのに苦労します。
出力結果以外で、モデルが自分が書いた内容をどれだけ理解しているかを測る最良の指標はクエリです。初期段階で私たちは、どのモデルにどれほど手を加えても、複数エピソードの詳細を必要とするマルチホップの物語学的クエリには答えられないことに気づきました。これが当時の技術的限界を浮き彫りにしました。
このアプローチは持続不可能だと結論づけ、独自の技術を構築することに決めました……それが Sherpa です。物語創作における最も困難な部分をライターと共に歩むガイドとして、まさにふさわしい名前です。
Sherpa が「聴きたくなる物語」を書ける技術的理由
Sherpa は、長編の連載型クリエイティブ・ライティングモデルハーネスです。3 つのコンポーネントで構成されており、この導入部の後で詳しく説明します。
- プランナー:各アークやシーンが何を達成すべきか、キャラクターの成長や関係性の推移を決定します。
- ナラティブ・ワールド・モデル:何が起きたのか、各キャラクターが何を知っているのか、物語がまだ視聴者に果たしていない約束は何かを構造化して記録します。
- プロースエンジン:その計画と状態に基づいて草稿を作成し、クリティック(批評家モデル)がキャラクターの行動、整合性、シーンの品質をチェックします。その後、ライターの編集と視聴者の反応が次のイテレーションの改善に役立ちます。
結果は非常に有望です。Sherpa と各競合モデルが白紙の状態から物語を作成した際、ブラインドでのペアワイズ比較において、競合モデルに応じて 65.6% から 97.1% の割合で Sherpa が選好されました。Sherpa の強化学習と Pocket の拡大し続けるデータセットを考えれば、この差が今後も広がり続けない理由はありません。

メモリ - ナラティブ・ワールド・モデル(NWM)
言語モデルは呼び出し間でメモリを共有しないため、物語に関するすべての情報をプロンプト内に収める必要があります。コンテキストウィンドウを長くしても解決しません。長いプロンプトの中間に埋もれた情報の扱いが不均一になるためです。生テキストに対する検索でも解決しません。オブジェクトが「どこにあったか」を示す箇所は見つかっても、「今どこにあるか」は分からないからです。
Sherpa でエピソードが完成すると、モデルがそこから構造化レコードを抽出し、それぞれを根拠となる箇所に紐づけます。フィールドはフィクション向けに設計されています。キャラクターが知っていること/まだ知らないこと、イベントが発生した時点と視聴者がそれを知る時点の違い、回収を待っている伏線などです。すべての事実は、それが設定された章から変更される章まで有効です。ライターが過去の章を編集すると、それに依存していたすべてが再構築されます。
質問に答える際、NWM はグラフを完全一致と意味の両方で同時に検索し、各結果の直接的なつながりを引き出し、小さく焦点の絞られた情報パケットをモデルに渡します。
エピソードを認識した検索により、関連する公式設定のみが提示され、未来の物語の漏洩なしにマルチホップ推論が可能になります。社内の 60 項目ベンチマークにおいて、Sherpa NWM は 1 回の実行あたり 0.7793 ドルのコストで 86.7%(52/60)の精度を達成しました。これは opus 5.x クラスのモデルを使用した Claude Code のメモリハーネスと同等の精度でありながら、コストは約 21 分の 1(1 回あたり 16.2172 ドル)です。また、散文のみを対象とした検索と比較して 20 ポイント高い性能(66.7% → 86.7%)を発揮しつつ、コストは大幅に抑えられています。

プロースエンジン:難易度が高すぎて独自モデルの構築が必要だった
強化学習には報酬シグナルが必要ですが、散文には明確なものがありません。ある段落がノーベル賞級なのか、ただの埋め草なのかを判定するテストは存在しないのです。
Sherpa は執筆タスクの各部分を異なるモデルに割り当てます。各キャラクターはエージェントであり、独自にポストトレーニングされたカスタムモデル上で動作します。ペルソナ、物語の現在の目標、直近の出来事、自身に関連する世界の設定に基づいて、次に何をするつもりかを提案します。別のクリティックモデルがすべての提案をレビューし、曖昧なもの、不自然なもの、キャラクター性に合わないもの、繰り返しのもの、物語を前進させないものを差し戻します。そして 3 つ目のモデルであるナレーターが、どの提案がシーンにふさわしいかを選び、次の段落へと書き上げます。実際に本文に採用された行動のみが物語のメモリに追加されます。
さらに、連載フィクション向けに設計された報酬関数を用いて、独自のプロースモデルを訓練しています。過剰な修飾、繰り返し、過剰な説明にはペナルティを与え、自然な会話、声の個性、緊張感には報酬を与えます。
散文の評価に用いるシグナル:
- 確定済みの出来事やキャラクターの知識と矛盾していないか?
- 行動は妥当で、キャラクターに合致し、シーンを前進させているか?
- ライターは代替案よりもこの会話、語り口、テンポを好むか?
- リスナーはそのエピソードを最後まで聴き、次回以降も戻ってくるか?
これらのシグナルは異なる時間軸で作用します。文としては優れていても設定と矛盾する場合もありますし、クリフハンガーは次回の再生開始率を高めても、アーク全体を弱体化させることもあります。「良い文章」という概念は極めて主観的であるため、Sherpa はリテンションを単一のスコアとして扱うのではなく、これらのシグナル全体を横断して最適化する必要があります。
社内フィクションベンチマークにおいて、Sherpa のプロースエンジンはすでに評価対象としたオープンソースおよび商用モデルの大半を上回っており、Sonnet 5 に対して 69%、Gemini 3.1 Pro に対して 94% のプロース選好率を記録しました。各バーは、提示順序を入れ替えた上での、指定モデルに対する Sherpa の文章の選好率を示しており、50% が同等であることを意味します。これらは現在進行中のポストトレーニングの初期結果であり、訓練が進むにつれてさらなる向上が見込まれます。

階層的ストーリープランナー
物語構造は番組全体の特性ですが、言語モデルは次の一部分しか生成できません。次の単語予測の中には、第 5 エピソードで仕込んだ伏線を第 60 エピソードで回収しなければならないことや、この章には目標、葛藤、結末が必要だという認識はありません。最先端モデルが生成した 100 ページの物語において、わずか 5 章をサンプリングした AI エディターが 52 の構造的問題を検出しました。機能していない展開や、不要な章が含まれていたのです。
Sherpa のプランナーは、物語全体からアーク、エピソードへと階層的に降りていき、すべてのシーンに役割を与えます。何を未解決のまま残すべきかも含めて定義するため、第 20 エピソードで第 80 エピソードの種明かしに向けた準備を、ネタバレせずに仕込むことができます。すべての伏線は、回収されるまで「未解決の約束」としてストーリーメモリに保存されます。ゴールジェネレーターが物語を前進させ続けます。目標が達成されたり停滞したりすると、過去の目標と重複しない新しい目標を設定します。同じ 100 ページのテストにおいて、構造的問題は 52 から 31 に減少し、目標更新の仕組みを導入しただけで、章レベルの批判的評価はほぼ半減しました。

今後数年間で、Sherpa がライターたちと共に 10 億ドル規模の IP を生み出すための準備はすべて整っています。プラットフォームに参加するクリエイターとユーザーが増えるにつれ、Sherpa は進化し続けます。
やるべきことは山積みで、未解決の課題も多く残っています。Sherpa の完成もその一つですし、ライターが最大限に活用できる運用環境を整備することも同様です。
私は Pocket FM で取り組んでいることに大きな興奮を覚えています。数年前なら数百万ドルの予算が必要だった物語を語ることで、クリエイターが生計を立てられるよう支援しているのです。
1 兆ドル規模のチャンスは、まだ始まったばかりです。





