當我們決定轉向 AI 創作節目時,無數人告訴我們這會毀了 Pocket FM。熬過漫長的六個月後,我差點就信了。但隨後我們的生態系迎來爆發——不是「儘管用了 AI 寫作」,而是「正因為用了 AI 寫作」。在不到 2 年的時間裡,我們的 AI 已協助創作者在 Pocket 上打造出 161 部爆款作品,其中甚至包含一個價值 1 億美元的 IP。
LLM 在寫作上的糟糕表現,逼得我們不得不自己打造專屬模型與整套系統。從零開始的過程有時真的很讓人氣餒。這需要大量的試錯,以及平台上 55 萬名創作者與超過 1 億用戶共同淬鍊出的黃金資料集。
接下來我會分享:我們如何從一無所有走到一套調校精良的寫作模型、為什麼 Pocket FM 是完美的試驗場,以及 Sherpa 能寫出爆款作品的秘密配方。
自從 ChatGPT 發布以來,大家都在說它聽起來太有「AI 味」。只要你請 LLM 寫點東西,不管篇幅長短,破折號就會冒出來,簡短有力的句子會硬塞進文章裡,最後產出的內容讀起來就像一大篇無聊的流水帳。
LLM 從根本上就是為了邏輯推理、解答數學題、輔助寫程式和檢索百科知識而設計的。它們的訓練過程中,沒有任何環節教它們寫出讀者願意讀下去或聽下去的內容。這不是模型的錯。
強化學習在輸出能對應到明確成功訊號時效果最好,也就是讓模型知道什麼做法有效。在寫程式時,程式碼要嘛跑得動、完成你要求的事,要嘛跑不動,答案是確定的。
但寫作不一樣,你很難判斷寫出來的東西到底好不好。你不知道讀者是不是看完第一句就離開了,還是真的讀完了。更糟的是,你去問 10 個人對同一本書或同一篇文章的看法,你會得到 10 種不同的答案。
同時掌握內容創作與發行,讓 Pocket FM 處在一個非常獨特的位置。我們能逐分鐘追蹤使用狀況,知道聽眾在哪裡停止收聽、會不會回來聽下一集,以及是否願意長期留下來。沒有比這更好的訊號了。凡是導致用戶流失的元素,Sherpa 都會學會避開;凡是能讓用戶持續追劇的元素,Sherpa 都會應用到新節目中。

Pocket FM 的用戶平均每天收聽超過 150 分鐘,幾乎是 YouTube 的 3 倍,也比 Netflix 多出約 50%。我認為,我們正站在一波全新浪潮的起點——極度有趣、沉浸感十足且高度個人化的內容即將席捲而來,而且隨著資料不斷累積,只會越來越好。
為什麼 AI 寫的東西總是一股 AI 味
杜斯妥也夫斯基之所以是偉大的作家,是因為他能在角色的行為與獨白中展現矛盾與情感。王爾德與費茲傑羅之所以迷人,是因為他們把機智的文字修飾得太美,讓你忍不住一頁接一頁翻下去。柯南·道爾則厲害在能把關鍵資訊藏到最後一刻才揭曉。
通用型 LLM 的設計邏輯恰恰相反,而且根本沒有機制讓它們在這方面變強。它們直接給答案、用中立語氣寫作,還過度依賴各種修辭技巧來提升表達效果。同樣地,優秀的 AI 助手被訓練成要盡快引導你得出正確結論。這些底層設定深深滲透進它們的文字裡,這就是為什麼它們不擅長寫作。
創意寫作需要張力、情感、衝突的鋪陳與緩慢化解、超越一句話標籤的角色性格,以及節奏的變化。你必須引導讀者走向錯誤的結論,同時丟出線索讓他們欲罷不能。
即使是花更長時間思考的推理模型,通常也是以「解決問題」為目標,而不是因為「讓受眾享受解謎過程」而獲得獎勵。解開謎團和寫出謎團,完全是兩回事。
試圖微調現有模型,讓我們徹底失敗
一開始,我們以為靠現成的工具就能過關。我們試過市面上的通用模型,也試著微調它們,希望能治好那種毫無靈魂的說故事方式。
我們嘗試直接用提示詞驅動越來越強的模型、在劇情推進時維護滾動式摘要,並透過檢索與知識圖譜來回答問題。
但直接用提示詞生成的結果是:寫到第 100 集時,會出現 10 到 20 個前後矛盾。滾動式摘要基本上就是把重要細節丟進黑洞,後續劇情跟著崩壞。更大的上下文窗口有點幫助,但模型在長文本中依然難以準確運用資訊。
除了實際產出的內容,「提問」是檢驗模型是否真正理解自己所寫內容的最佳方式。我們很早就發現,無論在某個模型上投入多少心力,它都無法回答需要跨越多集細節的「多跳式敘事學問題」。這讓我們看清了當時技術的極限。
我們最終認定這條路走不通,決定自己開發技術……也就是 Sherpa,這個名字取得恰到好處,因為它就是要帶領創作者走過說故事最艱難的那段路。
Sherpa 能寫出你想聽的故事,背後的技術原因
Sherpa 是一套專為長篇連載創意寫作打造的模型系統(harness)。它由三個部分組成,我在這段簡介之後會詳細說明:
- 規劃器(Planner)負責決定每個故事弧線與場景要達成什麼目標,以及角色成長與關係演變的方向。
- 敘事世界模型(Narrative World Model)會結構化記錄已經發生的事、每個角色知道什麼,以及故事還欠觀眾哪些伏筆回收。
- 散文引擎(Prose Engine)根據上述規劃與狀態進行草稿撰寫,同時由評論者檢查角色行為、連貫性與場景品質。接著,創作者的修改與聽眾回饋會用來優化下一次迭代。
成果非常令人振奮。當 Sherpa 與各家競品都從空白頁面開始寫故事時,在盲測的成對評比中,Sherpa 的勝率落在 65.6% 到 97.1% 之間(依對手而定)。考慮到 Sherpa 的強化學習機制與 Pocket 持續成長的資料集,這個差距沒有理由不繼續擴大。

記憶 —— 敘事世界模型(NWM)
語言模型在每次呼叫之間沒有記憶,所以它對故事的所有認知都必須塞進提示詞裡。更長的上下文窗口解決不了這個問題,因為模型對埋在長提示詞中間的資訊利用率很不穩定。直接在原始文字上做檢索也行不通。搜尋可以找出「某個物品曾經在哪裡」的段落,卻找不到「它現在在哪裡」。
當一集內容在 Sherpa 中定稿後,模型會從中提取結構化紀錄,每筆紀錄都綁定支持它的原文段落。這些欄位是專為小說設計的:角色知道與還不知道什麼、事件發生的時間與觀眾得知該事件的時間差、哪些伏筆還在等回收。每一項事實從確立它的那一章開始生效,直到改變它的那一章為止。如果創作者修改了前面的章節,所有依賴該設定的內容都會重新生成。
為了回答問題,NWM 會同時以精確字詞與語意在圖譜中搜尋,拉出每個結果的直接關聯,再交給模型一個小而精準的資訊包。
這種具備「集數意識」的檢索機制只會提取相關的正史設定,讓多跳式推理成為可能,又不會洩漏後續劇情。在一項內部 60 題的基準測試中,Sherpa NWM 達到 86.7% 的準確率(52/60),每次執行成本為 0.7793 美元。這與 Claude Code 搭配 opus 5.x 等級模型的記憶系統準確率相同,但成本大約低了 21 倍(後者每次執行需 16.2172 美元)。它也比純文字檢索高出 20 個百分點(66.7% → 86.7%),同時成本低得多。

散文引擎:難到我們只好自己建模型
強化學習需要獎勵訊號,但文字寫作並沒有明顯的訊號。一段文字沒有測驗能判定它是諾貝爾獎等級還是純粹灌水。
Sherpa 把寫作任務的不同部分交給不同模型處理。每個角色都是一個 Agent,運行在我們自行訓練的微調模型上,根據自身人設、故事當前目標、近期事件,以及與自己相關的世界觀,提出下一步打算做什麼。另一個獨立的評論模型會審查每個提案,把模糊、不合理、不符合人設、重複或無法推動劇情的內容退回去。第三個模型(旁白)則負責挑選適合該場景的提案,把它們寫成下一段文字。只有真正落到頁面上的行動,才會被加入故事的記憶中。
在此基礎上,我們正在訓練一個專有的散文模型,其獎勵函數是專為連載小說設計的。我們會懲罰華麗空洞的詞藻、重複與過度解釋,並獎勵自然的對話、鮮明的語氣與張力。
我們用來評估文字的訊號包括:
- 這是否與既定事件或角色已知資訊矛盾?
- 行動是否合理、符合人設,並推動場景發展?
- 比起其他版本,創作者是否更偏好這樣的對話、語氣與節奏?
- 聽眾是否聽完這一集,並回來聽後續集數?
這些訊號作用在不同的時間尺度上。一句話可能很好聽卻破壞了正史設定;一個懸念結尾可能提高下一集的開播率,卻拖垮整條故事線。由於「好文章」太過主觀,Sherpa 必須在這些訊號之間尋求最佳平衡,而不是把留存率當成單一評分標準。
在我們內部的小說基準測試中,Sherpa 的散文引擎已經超越多數我們評估過的開源與商業模型:對上 Sonnet 5 的文字偏好得分為 69%,對上 Gemini 3.1 Pro 則高達 94%。每個長條圖顯示的是在兩種呈現順序下,評測者偏好 Sherpa 文字勝過指定模型的比例,50% 代表兩者持平。這些是持續後訓練過程中的早期成果,我們預期隨著訓練推進,表現還會進一步提升。

階層式故事規劃器
故事結構是整部節目的屬性,但語言模型只能生成下一個片段。「預測下一個字」的機制根本不知道:第 5 集埋下的線索要在第 60 集回收,或者這一章需要目標、衝突與結果。在用前沿模型生成的 100 頁故事中,一位 AI 編輯只抽樣五章就標記出 52 個結構問題:推不動的劇情,以及根本不需要的章節。
Sherpa 的規劃器會從整體敘事往下拆解到故事弧線與單集,並為每個場景指派任務,包括它必須留下哪些未解之謎,這樣第 20 集才能為第 80 集的真相揭露鋪路,又不會提前爆雷。每個伏筆都會作為「未兌現的承諾」存在故事記憶中,直到被回收為止。目標產生器則負責推動劇情:當一個目標達成或卡住時,它會設定一個不與先前重複的新目標。在同樣的 100 頁測試中,結構問題從 52 個降到 31 個;光是移除目標更新機制,就讓章節層級的負面評價增加近一半。

一切都已就緒,Sherpa 將在未來幾年內協助創作者打造價值十億美元的 IP。隨著更多創作者與用戶加入平台,Sherpa 也會持續進化。
前方還有很多工作要做,許多問題尚未解決:完善 Sherpa 是其中之一,為創作者打造能充分發揮它價值的後勤條件也是一個。
我對我們在 Pocket FM 做的事感到無比興奮。我們正在幫助創作者靠說故事維生,而這些故事放在幾年前,可能需要數百萬美元的預算才做得出來。
在這個價值 1 兆美元的機會面前,一切都才剛開始。





