ตอนที่เราหันมาทำซีรีส์ที่เขียนด้วย AI มีคนนับไม่ถ้วนบอกเราว่านี่คือจุดจบของ Pocket FM หลังจากผ่านไปหกเดือนอันยาวนาน ผมเองก็เกือบจะเชื่อพวกเขาไปแล้ว แต่แล้วระบบนิเวศของเราก็เติบโตแบบก้าวกระโดด และไม่ใช่ "แม้จะมี" AI ช่วยเขียน แต่เป็น "เพราะมี" มันต่างหาก ภายในเวลาไม่ถึง 2 ปี AI ของเราได้ช่วยนักเขียนสร้างผลงานระดับบล็อกบัสเตอร์บน Pocket ไปแล้วถึง 161 เรื่อง รวมถึง IP มูลค่า 100 ล้านดอลลาร์สหรัฐ
การที่ LLMs เขียนเรื่องได้ห่วยแตก บังคับให้เราต้องสร้างโมเดลและระบบควบคุม (harness) ของเราเองขึ้นมา การเริ่มต้นจากศูนย์นั้นบางครั้งก็ทำให้ท้อแท้ไม่น้อย เราต้องใช้การลองผิดลองถูกมหาศาล ประกอบกับชุดข้อมูลทองคำที่สร้างขึ้นโดยนักเขียนกว่า 550,000 คน และผู้ใช้งานมากกว่า 100 ล้านคนบนแพลตฟอร์ม
ผมจะเล่าให้ฟังว่าเราเปลี่ยนจากที่ไม่มีอะไรเลย มาเป็นโมเดลการเขียนที่ปรับจูนมาอย่างสมบูรณ์แบบได้อย่างไร ทำไม Pocket FM ถึงเป็นสนามทดสอบที่ลงตัวที่สุด และเคล็ดลับเบื้องหลังความสามารถในการเขียนผลงานระดับบล็อกบัสเตอร์ของ Sherpa คืออะไร
ตั้งแต่ ChatGPT เปิดตัว ทุกคนต่างพูดเป็นเสียงเดียวกันว่ามันฟังดูเป็น AI มากเกินไป เวลาที่คุณสั่งให้ LLM เขียนอะไรก็ตาม ไม่ว่าจะยาวแค่ไหน เครื่องหมายขีดกลาง (em-dash) ก็จะโผล่มา ประโยคสั้นๆ ห้วนๆ จะแทรกอยู่ในงานเขียน และผลลัพธ์ที่ได้ก็จะอ่านดูเหมือนงานชิ้นใหญ่ที่น่าเบื่อชิ้นเดียว
LLMs ถูกออกแบบมาเพื่อการให้เหตุผลเชิงตรรกะ ตอบคำถามคณิตศาสตร์ ช่วยเขียนโค้ด และดึงข้อมูลความรู้ระดับสารานุกรม ไม่มีอะไรในกระบวนการเทรนที่สอนให้พวกมันเขียนสิ่งที่ผู้อ่านอยากจะอ่านหรืออยากฟังจริงๆ นี่ไม่ใช่ความผิดของโมเดล
การเรียนรู้แบบเสริมกำลัง (Reinforcement learning) จะได้ผลดีที่สุดเมื่อผลลัพธ์ผูกติดกับสัญญาณความสำเร็จที่ชัดเจน ซึ่งเป็นการสอนโมเดลว่าสิ่งไหนใช้ได้ผล ในวงการเขียนโค้ด โค้ดจะทำงานได้ตามที่คุณสั่งหรือไม่ก็ได้ คำตอบนั้นชัดเจนแน่นอน
แต่เวลาคุณเขียนอะไรสักอย่าง คุณไม่สามารถบอกได้เลยว่ามันดีจริงไหม คุณไม่รู้ด้วยซ้ำว่าผู้อ่านเลิกอ่านไปตั้งแต่ประโยคแรก หรืออ่านจนจบ ที่แย่ไปกว่านั้นคือ ลองถามคน 10 คนเกี่ยวกับหนังสือหรือบทความเล่มเดียวกันที่คุณเพิ่งอ่าน แล้วคุณจะได้คำตอบที่แตกต่างกันถึง 10 แบบ
การเป็นเจ้าของทั้งการสร้างและการกระจายคอนเทนต์ ทำให้ Pocket FM อยู่ในตำแหน่งที่ไม่เหมือนใคร เราติดตามพฤติกรรมการใช้งานแบบนาทีต่อนาที เรารู้ว่าคนหยุดฟังตอนไหน พวกเขาจะกลับมาฟังตอนต่อไปหรือไม่ และจะอยู่กับเราไปนานแค่ไหน ไม่มีสัญญาณใดที่ดีไปกว่านี้อีกแล้ว อะไรก็ตามที่ทำให้ผู้ใช้เลิกฟัง Sherpa จะเรียนรู้เพื่อหลีกเลี่ยง และอะไรก็ตามที่ทำให้ผู้ใช้ติดตามซีรีส์ใดซีรีส์หนึ่งต่อ Sherpa ก็จะนำไปต่อยอดใช้กับซีรีส์ใหม่ๆ

ผู้ใช้งานทั่วไปบน Pocket FM ฟังเนื้อหาเฉลี่ยมากกว่า 150 นาทีต่อวัน ซึ่งเกือบเป็น 3 เท่าของ YouTube และมากกว่า Netflix ประมาณ 50% ผมคิดว่าเราเพิ่งอยู่ในจุดเริ่มต้นของคลื่นลูกใหม่แห่งคอนเทนต์ที่สนุกสุดเหวี่ยง ดื่มด่ำลึกซึ้ง และเป็นส่วนตัวขั้นสุด ซึ่งจะยิ่งดีขึ้นเรื่อยๆ เมื่อเรามีข้อมูลมากขึ้น
ทำไมงานเขียนจาก AI ถึงฟังดูเหมือน AI
Dostoevsky เป็นนักเขียนที่ยอดเยี่ยม เพราะเขาถ่ายทอดความขัดแย้งและอารมณ์ผ่านพฤติกรรมและคำพร่ำบ่นของตัวละคร ส่วน Oscar Wilde และ Fitzgerald นั้นโดดเด่นเพราะพวกเขาแต่งเติมงานเขียนที่เฉียบคมได้อย่างงดงาม จนคุณอดไม่ได้ที่จะพลิกหน้ากระดาษต่อไปเรื่อยๆ ขณะที่ Conan Doyle โดดเด่นด้วยความสามารถในการซ่อนข้อมูลจากผู้อ่านจนถึงวินาทีสุดท้าย
LLMs สำหรับงานทั่วไปถูกสร้างมาเพื่อทำสิ่งที่ตรงกันข้ามกับเรื่องนี้โดยสิ้นเชิง และไม่มีทางที่จะพัฒนาให้เก่งขึ้นในเรื่องนี้ได้ พวกมันให้คำตอบตรงๆ ใช้ภาษาที่เป็นกลาง และพึ่งพาเทคนิคต่างๆ มากเกินความจำเป็นเพื่อเพิ่มประสิทธิภาพในการสื่อสาร เช่นเดียวกับ AI assistant ที่ดีที่ถูกฝึกมาให้พาคุณไปสู่ข้อสรุปที่ถูกต้องอย่างรวดเร็ว องค์ประกอบพื้นฐานเหล่านี้ฝังลึกอยู่ในงานเขียนของพวกมัน นั่นจึงเป็นเหตุผลว่าทำไมพวกมันถึงเขียนเรื่องได้ไม่ดี
การเขียนเชิงสร้างสรรค์ต้องการความตึงเครียด อารมณ์ การสร้างและคลี่คลายปมขัดแย้งอย่างค่อยเป็นค่อยไป ลักษณะนิสัยของตัวละครที่ต้องลึกซึ้งกว่าแค่บทพูดสั้นๆ และการปรับเปลี่ยนจังหวะการเล่าเรื่อง ผู้อ่านต้องถูกชักนำให้เข้าใจผิดไปในทิศทางหนึ่ง ในขณะที่ได้รับเบาะแสที่ทำให้พวกเขายังคงติดตามเรื่องราวต่อไป
แม้แต่ reasoning model ที่ใช้เวลาคิดนานขึ้น โดยทั่วไปก็ยังมุ่งเน้นไปที่การแก้ปัญหา มากกว่าจะได้รับรางวัลจากการมอบประสบการณ์ระหว่างทางให้กับผู้อ่าน การไขปริศนา กับการเขียนนิยายสืบสวนสอบสวน เป็นสองสิ่งที่แตกต่างกันอย่างสิ้นเชิง
เราล้มเหลวเพราะพยายามปรับแต่งสิ่งที่มีอยู่
ในตอนแรก เราคิดว่าเราน่าจะใช้เครื่องมือที่มีอยู่ทั่วไปได้ เราลองใช้โมเดลสำเร็จรูปและพยายามปรับแต่งมัน ด้วยความหวังว่าจะซ่อมแซมการเล่าเรื่องที่ไร้จิตวิญญาณของมันได้
เราทดลองป้อน prompt ให้โมเดลที่เก่งขึ้นเรื่อยๆ โดยตรง เก็บ rolling summaries ไปเรื่อยๆ ตามเนื้อเรื่องที่ดำเนินไป และใช้ retrieval กับ knowledge graphs เพื่อตอบคำถาม
การป้อน prompt โดยตรงจะทำให้คุณไปถึงตอนที่ 100 พร้อมกับความไม่สอดคล้องกัน 10-20 จุด ส่วน rolling summaries นั้นแทบจะโยนรายละเอียดสำคัญทิ้งไปในอากาศ ซึ่งทำลายเนื้อเรื่องหลังจากนั้น Context window ที่ใหญ่ขึ้นช่วยได้บ้าง แต่โมเดลก็ยัง struggle กับการนำข้อมูลมาใช้ได้อย่างแม่นยำในบริบทที่ยาวๆ
นอกเหนือจากผลลัพธ์ที่ได้แล้ว คำถาม (queries) คือตัวชี้วัดที่ดีที่สุดว่าโมเดลเข้าใจสิ่งที่มันเขียนไปมากน้อยแค่ไหน ในช่วงแรก เราตระหนักว่าไม่ว่าเราจะทุ่มเทความพยายามไปกับโมเดลใดมากแค่ไหน มันก็ล้มเหลวในการตอบคำถามเชิงการเล่าเรื่องแบบ multi-hop ซึ่งต้องใช้รายละเอียดจากหลายตอนรวมกัน สิ่งนี้เผยให้เห็นข้อจำกัดของเทคโนโลยีในปัจจุบัน
เราจึงสรุปได้ว่าเส้นทางนี้ไปต่อไม่ไหว และตัดสินใจสร้างเทคโนโลยีของเราเอง... Sherpa ซึ่งตั้งชื่อนี้อย่างเหมาะสม เพื่อทำหน้าที่เป็นผู้นำทางให้นักเขียนก้าวผ่านส่วนที่ยากที่สุดของการเล่าเรื่อง
เหตุผลทางเทคนิคที่ทำให้ Sherpa เขียนเรื่องที่คุณอยากฟัง
Sherpa คือ harness ของโมเดลการเขียนเชิงสร้างสรรค์แบบต่อเนื่องสำหรับเนื้อหายาว มันประกอบด้วย 3 ส่วนหลัก ซึ่งผมจะอธิบายรายละเอียดเพิ่มเติมหลังจากบทนำนี้:
- Planner ทำหน้าที่ตัดสินใจว่าแต่ละ arc และฉากต้องบรรลุเป้าหมายอะไร รวมถึงการพัฒนาตัวละครและความสัมพันธ์ที่เปลี่ยนแปลงไป
- Narrative World Model ทำหน้าที่เก็บบันทึกอย่างเป็นระบบว่าเกิดอะไรขึ้นแล้ว ตัวละครแต่ละตัวรู้อะไรบ้าง และเนื้อเรื่องยังค้างสัญญาอะไรไว้กับผู้อ่าน
- Prose engine ทำหน้าที่ร่างเนื้อหาตามแผนและ state นั้น โดยมี critics คอยตรวจสอบพฤติกรรมตัวละคร ความต่อเนื่อง และคุณภาพของฉาก จากนั้นการแก้ไขของนักเขียนและผลตอบรับจากผู้ฟังจะถูกนำมาใช้ปรับปรุงในรอบถัดไป
ผลลัพธ์ที่ได้นั้นน่าประทับใจมาก เมื่อ Sherpa และคู่แข่งแต่ละรายเขียนเรื่องขึ้นมาจากหน้ากระดาษเปล่า การตัดสินแบบจับคู่โดยไม่เปิดเผยชื่อ (blinded pairwise judgments) เลือก Sherpa ในสัดส่วน 65.6% ถึง 97.1% ขึ้นอยู่กับว่าเป็นคู่แข่งรายไหน และด้วยการเรียนรู้แบบเสริมกำลังของ Sherpa รวมกับชุดข้อมูลที่เติบโตขึ้นเรื่อยๆ ของ Pocket ก็ไม่มีเหตุผลใดที่ช่องว่างนี้จะไม่กว้างขึ้นอีก

Memory - Narrative World Model (NWM)
Language models ไม่มีความทรงจำระหว่างการเรียกใช้งานแต่ละครั้ง ดังนั้นทุกสิ่งที่มันรู้เกี่ยวกับเรื่องราวจึงต้องบรรจุอยู่ใน prompt ทั้งหมด context window ที่ยาวขึ้นไม่ได้แก้ปัญหานี้ เพราะโมเดลใช้งานข้อมูลที่อยู่ตรงกลาง prompt ยาวๆ ได้ไม่สม่ำเสมอ การใช้ retrieval กับ raw text ก็แก้ไม่ได้เช่นกัน การค้นหาอาจคืนค่าข้อความที่บอกว่าวัตถุนั้นเคยอยู่ที่ไหน แต่ไม่ใช่ตำแหน่งที่มันอยู่ตอนนี้
เมื่อตอนหนึ่งๆ ถูกจัดทำเสร็จสมบูรณ์ด้วย Sherpa โมเดลจะดึงข้อมูลที่มีโครงสร้างออกมา โดยแต่ละรายการจะเชื่อมโยงกับข้อความต้นฉบับที่สนับสนุนข้อมูลนั้น ฟิลด์ต่างๆ ถูกออกแบบมาเพื่อนิยายโดยเฉพาะ: ตัวละครรู้อะไรและยังไม่รู้อะไร เหตุการณ์เกิดขึ้นเมื่อไหร่เทียบกับตอนที่ผู้อ่านได้รับรู้ เบาะแสไหนที่กำลังรอการเฉลย ทุกข้อเท็จจริงจะมีผลบังคับใช้ตั้งแต่ตอนที่มันถูกกำหนดขึ้น ไปจนถึงตอนที่มันถูกเปลี่ยนแปลง หากนักเขียนแก้ไขตอนก่อนหน้า ทุกอย่างที่ขึ้นอยู่กับตอนนั้นจะถูกสร้างขึ้นใหม่ทั้งหมด
ในการตอบคำถาม NWM จะค้นหากราฟทั้งจากคำที่ตรงกันและความหมายในเวลาเดียวกัน ดึงการเชื่อมต่อโดยตรงของแต่ละผลลัพธ์เข้ามา และส่งแพ็กเก็ตข้อมูลขนาดเล็กที่โฟกัสไปยังโมเดล
ระบบ retrieval ที่รับรู้บริบทของแต่ละตอนนี้ จะดึงเฉพาะ canon ที่เกี่ยวข้องเท่านั้น ทำให้เกิดการให้เหตุผลแบบ multi-hop ได้โดยไม่มีการรั่วไหลของเนื้อเรื่องในอนาคต ในการทดสอบ benchmark ภายใน 60 ข้อ Sherpa NWM ทำความแม่นยำได้ถึง 86.7% (52/60) ที่ต้นทุน $0.7793 ต่อรอบ ซึ่งเป็นความแม่นยำเท่ากับ memory harness ของ Claude Code ที่ใช้โมเดลระดับ opus 5.x แต่ต้นทุนต่ำกว่าประมาณ 21 เท่า ($16.2172 ต่อรอบ) และยังทำได้ดีกว่า prose-only retrieval ถึง 20 เปอร์เซ็นต์พอยต์ (66.7% → 86.7%) ในขณะที่ใช้ต้นทุนน้อยกว่าอย่างมาก

Prose Engine: ยากเกินกว่าจะเจาะจนเราต้องสร้างโมเดลของตัวเอง
การเรียนรู้แบบเสริมกำลังต้องการสัญญาณรางวัล (reward signal) และงานเขียนร้อยแก้วก็ไม่มีสัญญาณนั้นชัดเจน ไม่มีบททดสอบใดที่บอกได้ว่าย่อหน้านี้คุณภาพระดับรางวัลโนเบลหรือเป็นแค่ตัวถมที่
Sherpa แบ่งงานเขียนแต่ละส่วนให้กับโมเดลที่แตกต่างกัน ตัวละครแต่ละตัวคือ agent ที่ทำงานบนโมเดล custom ที่ผ่านการ post-trained ของเรา ซึ่งจะเสนอสิ่งที่มันตั้งใจจะทำต่อไป โดยอิงจากบุคลิก เป้าหมายปัจจุบันของเรื่อง เหตุการณ์ล่าสุด และส่วนของโลกที่เกี่ยวข้องกับมัน โมเดล critic แยกต่างหากจะตรวจสอบทุกข้อเสนอ และตีกลับสิ่งที่คลุมเครือ ไม่น่าเป็นไปได้ ขัดกับคาแรคเตอร์ ซ้ำซาก หรือไม่ช่วยให้เรื่องเดินหน้าไป โมเดลที่สามคือผู้บรรยาย จะเลือกข้อเสนอที่เหมาะกับฉากและเขียนลงไปในย่อหน้าถัดไป เฉพาะการกระทำที่ถูกเขียนลงบนหน้ากระดาษเท่านั้นที่จะถูกเพิ่มเข้าไปในความทรงจำของเรื่อง
นอกจากนี้ เรายังกำลังเทรน prose model ที่เป็นกรรมสิทธิ์ของเราด้วย reward functions ที่สร้างมาเพื่อนิยายแบบต่อเนื่องโดยเฉพาะ เราลงโทษการใช้ภาษาที่วิจิตรพิสดารเกินงาม การทำซ้ำ และการอธิบายยืดยาว และให้รางวัลกับบทสนทนาที่เป็นธรรมชาติ น้ำเสียงของตัวละคร และความตึงเครียด
สัญญาณที่เราใช้ประเมินงานเขียน:
- สิ่งนี้ขัดแย้งกับเหตุการณ์ที่กำหนดไว้แล้วหรือความรู้ของตัวละครหรือไม่?
- การกระทำนี้สมเหตุสมผล ตรงกับคาแรคเตอร์ และช่วยให้ฉากเดินหน้าต่อไปหรือไม่?
- นักเขียนชอบบทสนทนา น้ำเสียง และจังหวะนี้ มากกว่าทางเลือกอื่นหรือไม่?
- ผู้ฟังฟังจนจบตอน และกลับมาฟังตอนต่อๆ ไปหรือไม่?
สัญญาณเหล่านี้ทำงานในกรอบเวลาที่แตกต่างกัน ประโยคหนึ่งอาจฟังดูดีแต่ทำลาย canon และ cliffhanger อาจช่วยให้คนเริ่มฟังตอนต่อไปมากขึ้น แต่ก็อาจทำให้ arc ทั้งเส้นเรื่องอ่อนแอลง Sherpa จึงต้อง optimize สัญญาณเหล่านี้ร่วมกัน แทนที่จะมอง retention เป็นคะแนนเดียวที่หมายถึง "งานเขียนที่ดี" เพราะเรื่องหลังนี้เป็นอัตวิสัยมากเกินไป
Prose Engine ของ Sherpa ทำผลงานได้ดีกว่าโมเดล open-source และเชิงพาณิชย์ส่วนใหญ่ที่เราทดสอบใน fiction benchmark ภายในของเราแล้ว โดยมีคะแนนความชื่นชอบในงานเขียน (prose preference scores) อยู่ที่ 69% เมื่อเทียบกับ Sonnet 5 และ 94% เมื่อเทียบกับ Gemini 3.1 Pro แต่ละแท่งกราฟแสดงความชื่นชอบในงานเขียนของ Sherpa เทียบกับโมเดลที่ระบุ โดยตัดสินจากการสลับลำดับการนำเสนอทั้งสองแบบ ซึ่ง 50% หมายถึงความเท่าเทียมกัน นี่คือผลลัพธ์เบื้องต้นจากการ post-training ที่กำลังดำเนินอยู่ และเราคาดว่าจะเห็นการพัฒนาที่ดีขึ้นอีกเมื่อการเทรนดำเนินต่อไป

Hierarchical Story Planner
โครงสร้างเรื่องเป็นคุณสมบัติของซีรีส์ทั้งเรื่อง แต่ language models สร้างได้ทีละส่วนเท่านั้น ไม่มีอะไรในการทำนายคำถัดไปที่รู้ว่าเบาะแสที่วางไว้ในตอนที่ 5 ต้องได้รับการเฉลยในตอนที่ 60 หรือรู้ว่าตอนนี้ต้องมีเป้าหมาย มีความขัดแย้ง และมีบทสรุป ในเนื้อเรื่องยาว 100 หน้าจาก frontier model บรรณาธิการ AI ที่สุ่มตรวจเพียงห้าตอน พบปัญหาเชิงโครงสร้างถึง 52 จุด ทั้งการดำเนินเรื่องที่ไม่เวิร์ก และตอนที่เนื้อเรื่องไม่จำเป็นต้องมี
Planner ของ Sherpa ทำงานจากระดับภาพรวมของเนื้อเรื่อง ลงมาสู่ arcs และตอนต่างๆ และมอบหมายหน้าที่ให้ทุกฉาก รวมถึงสิ่งที่ต้องปล่อยค้างไว้ เพื่อให้ตอนที่ 20 สามารถปูทางไปสู่การเฉลยในตอนที่ 80 ได้โดยไม่สปอยล์ ทุกการปูเรื่องจะถูกเก็บไว้ใน story memory ในฐานะสัญญาที่เปิดอยู่ จนกว่าจะถึงเวลาเฉลย goal generator จะคอยขับเคลื่อนเรื่องไปข้างหน้า: เมื่อเป้าหมายบรรลุผลหรือชะงัก มันจะตั้งเป้าหมายใหม่ที่ไม่ซ้ำกับเป้าหมายเดิม ในการทดสอบ 100 หน้าเดียวกัน ปัญหาเชิงโครงสร้างลดลงจาก 52 เหลือ 31 จุด และการลบการอัปเดตเป้าหมายออกไปอย่างเดียว ก็ทำให้คำวิจารณ์ระดับตอนดีขึ้นเกือบครึ่งหนึ่ง

ทุกอย่างพร้อมแล้วสำหรับ Sherpa ที่จะช่วยนักเขียนสร้าง IP ระดับพันล้านดอลลาร์ในอีกไม่กี่ปีข้างหน้า Sherpa จะยิ่งเก่งขึ้นเรื่อยๆ เมื่อเรามีครีเอเตอร์และผู้ใช้งานเข้ามาบนแพลตฟอร์มมากขึ้น
ยังมีงานอีกมากรออยู่ข้างหน้า และหลายปัญหายังไม่ได้รับการแก้ไข การทำให้ Sherpa สมบูรณ์แบบเป็นหนึ่งในนั้น เช่นเดียวกับการสร้างสภาพแวดล้อมด้านโลจิสติกส์เพื่อให้นักเขียนใช้งานมันได้อย่างเต็มประสิทธิภาพที่สุด
ผมตื่นเต้นอย่างยิ่งกับสิ่งที่เรากำลังทำอยู่ที่ Pocket FM เรากำลังช่วยให้ครีเอเตอร์หาเลี้ยงชีพได้ด้วยการเล่าเรื่อง ซึ่งถ้าเป็นเมื่อไม่กี่ปีก่อน เรื่องแบบนี้จะต้องใช้งบประมาณหลายล้านดอลลาร์
เรายังอยู่ในช่วงเริ่มต้นของโอกาสทางธุรกิจมูลค่า 1 ล้านล้านดอลลาร์





