当我们转向 AI 创作剧集时,无数人告诉我们这会毁了 Pocket FM。熬过漫长的六个月后,我差点就信了。但随后我们的生态迎来了爆发——不是因为绕开了 AI 写作,而恰恰是因为它。在不到 2 年的时间里,我们的 AI 已经帮助创作者在 Pocket 上打造了 161 部爆款作品,其中包括一个价值 1 亿美元的 IP。
LLM 糟糕的写作能力,逼得我们不得不从头构建自己的定制模型和配套框架。从零开始的过程有时真的很让人泄气。这背后是海量的试错,以及平台上 55 万创作者和超过 1 亿用户共同沉淀出的黄金数据集。
接下来我会聊聊,我们是如何从一无所有打磨出一个调校精良的写作模型的,为什么 Pocket FM 是最完美的试验田,以及 Sherpa 能写出爆款背后的独门秘籍。
自从 ChatGPT 发布以来,所有人都在吐槽它听起来“太 AI 了”。只要你让 LLM 写点东西,不管篇幅长短,破折号就会冒出来,短促有力的句子会强行挤进文章里,最后输出的内容读起来就像一篇冗长乏味的流水账。
LLM 在设计之初就是为了逻辑推理、解答数学题、辅助编程和检索百科知识。它们的训练过程中,没有任何环节教它们去写读者真正愿意读或愿意听的东西。但这并不是模型的错。
当输出能与明确的成功信号挂钩时,强化学习的效果最好——它能告诉模型“这样做行得通”。在编程中,代码要么跑得通、实现了你的需求,要么跑不通,答案是确定的。
但写作不一样,你很难判断自己写得好不好。你不知道读者是不是读完第一句就划走了,还是坚持看完了全文。更糟的是,你去问 10 个人对同一本书或同一篇文章的看法,可能会得到 10 种不同的答案。
同时掌控内容创作与分发,让 Pocket FM 处在一个非常独特的位置。我们能按分钟级监控用户的使用情况:知道听众什么时候停止收听、会不会回来听下一集、能不能长期留下来。没有比这更好的反馈信号了。凡是导致用户流失的写法,Sherpa 都会学着避开;凡是能让用户对某部剧保持投入的元素,Sherpa 都会复用到新剧中。

Pocket FM 上的用户平均每天收听超过 150 分钟,几乎是 YouTube 的 3 倍,比 Netflix 高出约 50%。我认为,我们正站在一波全新内容浪潮的起点——这些内容极具娱乐性、沉浸感强且高度个性化,而且随着数据不断积累,体验只会越来越好。
为什么 AI 写的东西总有一股 AI 味
陀思妥耶夫斯基之所以伟大,是因为他能在角色的行为和长篇大论中展现矛盾与情感。王尔德和菲茨杰拉德之所以迷人,是因为他们把机智的文字修饰得太漂亮,让你忍不住一页页翻下去。柯南·道尔的厉害之处,则在于他能把关键信息藏到最后一刻才揭晓。
通用 LLM 的设计逻辑恰恰与此相反,而且根本没有机制让它们在这方面变得更好。它们习惯直接给答案、用中立客观的语气表达,还会滥用各种修辞套路来显得自己“很有说服力”。同样地,优秀的 AI 助手被训练成要尽快引导你得出正确结论。这些底层基因渗透到了它们生成的每一段文字里,这就是它们不擅长写作的原因。
创意写作需要张力、情绪、铺垫,以及冲突的缓慢化解;需要超越一句话标签的立体人物性格;还需要节奏的起伏变化。你要把读者引向错误的结论,同时又抛出线索让他们欲罢不能。
即便是思考时间更长的推理模型,通常也只是为了“解决问题”,而不是因为“让受众享受解题过程”而获得奖励。解开一个谜团和写出一部悬疑小说,完全是两码事。
试图在现有基础上修修补补,让我们栽了跟头
一开始,我们以为靠现成的工具就能蒙混过关。我们试过市面上的通用模型,也尝试对它们做微调,希望能治好那种毫无灵魂的叙事方式。
我们尝试过直接用提示词驱动越来越强的模型,在故事推进时维护滚动摘要,还用过检索和知识图谱来回答问题。
但直接靠提示词生成,写到第 100 集时就会出现 10 到 20 处前后矛盾。滚动摘要本质上会把重要细节丢进黑洞,后面的故事也就跟着垮了。更大的上下文窗口有点帮助,但在超长文本里,模型依然很难准确调用信息。
除了最终输出的文本,提问测试是衡量模型是否真正理解自己所写内容的最佳方式。我们很早就发现,无论在某款模型上投入多少精力,它都无法回答需要跨越多集信息的“多跳叙事问题”。这暴露了当时技术本身的局限。
我们意识到这条路走不通,于是决定自研技术……也就是 Sherpa,这个名字起得恰如其分——它的使命就是带领创作者穿越故事创作中最艰难的那段路。
Sherpa 能写出你想听的故事,背后的技术原因
Sherpa 是一套面向长篇连载创意写作的模型框架(harness)。它由三个核心组件构成,我会在引言之后详细介绍:
- 规划器(Planner)负责决定每个故事弧线和场景需要完成什么任务,以及角色如何成长、关系如何演变。
- 叙事世界模型(Narrative World Model)以结构化的方式记录已经发生的事、每个角色掌握的信息,以及故事还欠观众哪些“交代”。
- 行文引擎(Prose Engine)根据规划和状态起草正文,同时由评审模型检查角色行为、连贯性和场景质量。创作者的修改和观众的反馈,则会用来优化下一次迭代。
结果非常令人振奋。当 Sherpa 和各竞品都从一张白纸开始创作故事时,在盲测的两两对比中,Sherpa 的胜率达到 65.6% 至 97.1%,具体取决于对手是谁。考虑到 Sherpa 具备强化学习能力,加上 Pocket 的数据集还在不断增长,这个差距只会越拉越大。

记忆系统 —— 叙事世界模型(NWM)
语言模型在两次调用之间是没有记忆的,所以它对故事的所有了解都必须塞进提示词里。更长的上下文窗口解决不了这个问题,因为模型对埋在长提示词中间的信息利用率极不稳定。直接在原始文本上做检索也不行:搜索能找到“某个物品曾经在哪”的段落,却找不到“它现在在哪”。
当一集内容在 Sherpa 中定稿后,模型会从中提取结构化记录,每条记录都会关联到支撑它的原文段落。这些字段是专为虚构故事设计的:角色知道什么、还不知道什么;事件实际发生的时间与观众得知的时间差;哪些伏笔还在等待回收。每一条事实,从确立它的那一章开始生效,直到改变它的那一章为止。如果创作者修改了前面的章节,所有依赖该设定的内容都会被重新构建。
在回答问题时,NWM 会同时按字面表述和语义在图谱中检索,拉取每个结果的直接关联节点,然后交给模型一个精简、聚焦的信息包。
这种“感知剧集进度”的检索机制只会调出相关的既定设定,从而实现多跳推理,又不会提前泄露后续剧情。在一项包含 60 个问题的内部基准测试中,Sherpa NWM 的准确率达到 86.7%(52/60),单次运行成本仅为 0.7793 美元。这与 Claude Code 搭配 opus 5.x 级别模型的记忆框架准确率相当,但成本降低了约 21 倍(后者单次运行需 16.2172 美元)。相比纯文本检索,它的准确率还高出了 20 个百分点(从 66.7% 提升至 86.7%),同时成本低得多。

行文引擎:难啃到我们只能自研模型
强化学习需要奖励信号,而行文并没有明显的信号。一段文字没法通过任何测试来证明它是诺贝尔奖水准还是凑字数的废话。
Sherpa 把写作任务拆分给了不同的模型。每个角色都是一个 Agent,运行在我们定制的后训练模型上,根据自己的人设、故事当前的目标、近期事件以及与自身相关的世界设定,提出下一步的行动意图。另一个独立的评审模型会审查每一个提案,把含糊不清、不合逻辑、偏离人设、重复啰嗦或无法推动剧情的方案打回。接着,第三个模型(旁白)会挑选适合当前场景的提案,把它们写成下一段正文。只有真正落到纸面上的行动,才会被写入故事的记忆中。
在此基础上,我们正在训练一个专有的行文模型,其奖励函数完全为连载小说量身定制。我们会惩罚辞藻堆砌、重复啰嗦和过度解释,奖励自然的对话、鲜明的声音和十足的张力。
我们评估行文质量的信号包括:
- 是否与既定情节或角色认知相矛盾?
- 行动是否合理、符合人设,并推动了场景发展?
- 与备选方案相比,创作者是否更喜欢这段对话、语气和节奏?
- 听众有没有听完这一集,并回来听后续内容?
这些信号作用在不同的时间尺度上。一句话可能读起来很美,却破坏了既有设定;一个悬念钩子可能提高了下一集的打开率,却拖垮了整个故事弧线。由于“好文笔”本身极其主观,Sherpa 需要在这些信号之间综合寻优,而不是简单地把留存率当成衡量“写得好不好”的唯一分数。
在我们的内部虚构写作基准测试中,Sherpa 的行文引擎已经超越了绝大多数开源和商业模型:对阵 Sonnet 5 时的行文偏好得分为 69%,对阵 Gemini 3.1 Pro 时为 94%。柱状图显示的是评测者更偏爱 Sherpa 而非对应模型的比例,两种展示顺序均已纳入考量,50% 代表持平。这些只是持续后训练过程中的早期成果,随着训练推进,我们预计还会有进一步提升。

分层故事规划器
故事结构是整部剧的全局属性,而语言模型只能生成下一个片段。“下一个词预测”机制根本不知道第 5 集埋下的线索要在第 60 集回收,也不知道这一章需要目标、冲突和结果。在用前沿模型生成的一个 100 页故事中,AI 编辑仅抽检了五章就发现了 52 个结构性问题:推不动的剧情,以及故事根本不需要的章节。
Sherpa 的规划器会从整体叙事向下拆解到故事弧线和单集,给每个场景分配明确的任务,包括必须留下哪些未解之谜,这样第 20 集才能为第 80 集的真相揭晓做铺垫,又不至于提前剧透。每一个伏笔都会作为“未兑现的承诺”存入故事记忆,直到被回收为止。目标生成器负责推动故事前进:当一个目标达成或陷入停滞时,它会设定一个不与之前重复的新目标。在同样的 100 页测试中,结构性问题从 52 个降到了 31 个;而仅仅去掉目标更新机制,章节层面的负面评价就增加了近一半。

一切准备就绪,未来几年,Sherpa 将助力创作者打造出十亿美元级别的 IP。随着越来越多创作者和用户加入平台,Sherpa 也在不断进化。
前面还有很多工作要做,不少问题悬而未决:打磨好 Sherpa 是其中之一,为创作者创造用好它的配套条件同样重要。
我对 Pocket FM 正在做的事情感到无比兴奋。我们正在帮助创作者靠讲故事谋生,而这些故事放在几年前,可能需要数百万美元的预算才能做出来。
面对这个万亿美元级的机会,一切都才刚刚开始。





