YouMind
Đăng nhập

Tại sao LLM không thể viết hay và cách Sherpa khắc phục điều đó

@RohanNayak2
TIẾNG ANH30 thg 9, 2026
324K
612
156
31
639

TL;DR

CEO Rohan Nayak của Pocket FM giải thích lý do tại sao các mô hình ngôn ngữ lớn (LLM) tiêu chuẩn gặp khó khăn trong việc sáng tác văn học do thiếu tín hiệu tương tác. Ông trình bày chi tiết về cách Sherpa, một hệ thống AI tùy chỉnh với các lập kế hoạch chuyên biệt và mô hình bộ nhớ, giúp các nhà văn tạo ra những vở kịch âm thanh nhiều tập thành công.

Khi chúng tôi chuyển hướng sang các chương trình do AI viết, vô số người đã nói rằng điều này sẽ giết chết Pocket FM. Sau sáu tháng dài đằng đẵng, tôi gần như đã tin họ. Nhưng rồi hệ sinh thái của chúng tôi bùng nổ, và không phải bất chấp việc AI viết lách mà chính là nhờ nó. Trong vòng chưa đầy 2 năm, AI của chúng tôi đã giúp các tác giả tạo ra 161 siêu phẩm trên Pocket, bao gồm một IP trị giá 100 triệu USD.

Việc các LLM viết cực kỳ tệ đã buộc chúng tôi phải tự xây dựng các mô hình tùy chỉnh và hệ thống vận hành (harness) của riêng mình. Bắt đầu lại từ con số không nhiều lúc khiến chúng tôi nản lòng. Quá trình đó đòi hỏi vô số lần thử nghiệm và sai sót, cùng với một tập dữ liệu vàng được tạo ra bởi 550 nghìn tác giả và hơn 100 triệu người dùng trên nền tảng.

Tôi sẽ chia sẻ cách chúng tôi đi từ con số không đến một mô hình viết lách được tinh chỉnh hoàn hảo, lý do vì sao Pocket FM là môi trường thử nghiệm lý tưởng, và "bí kíp" đằng sau khả năng viết nên những siêu phẩm của Sherpa.


Kể từ khi ChatGPT ra mắt, ai cũng nhận xét rằng giọng văn của nó nghe quá giống AI. Khi bạn yêu cầu một LLM viết bất cứ thứ gì, dù dài hay ngắn, các dấu gạch ngang (em-dash) sẽ xuất hiện, những câu ngắn gọn, cộc lốc chen vào bài viết, và kết quả đọc lên chẳng khác nào một mớ chữ dài ngoằng, nhàm chán.

Về bản chất, các LLM được thiết kế để suy luận logic, giải toán, hỗ trợ lập trình và truy xuất kiến thức bách khoa toàn thư. Không có gì trong quá trình huấn luyện dạy chúng cách viết ra thứ mà người đọc thực sự muốn đọc hoặc muốn nghe. Đây không phải lỗi của các mô hình.

Học tăng cường (reinforcement learning) hoạt động hiệu quả nhất khi đầu ra gắn liền với một tín hiệu thành công rõ ràng, giúp huấn luyện mô hình biết được điều gì thực sự hiệu quả. Trong lập trình, đoạn code hoặc chạy đúng như bạn yêu cầu, hoặc không. Kết quả luôn rành mạch.

Nhưng khi bạn viết một thứ gì đó, bạn không thể biết ngay nó có hay hay không. Bạn không biết liệu người đọc đã bỏ đi ngay sau câu đầu tiên hay họ đã đọc đến cuối. Tệ hơn nữa, hãy hỏi 10 người về một cuốn sách hay bài báo cụ thể mà họ đã đọc, bạn sẽ nhận về 10 câu trả lời khác nhau.

Việc nắm giữ cả khâu sáng tạo lẫn phân phối đặt Pocket FM vào một vị thế vô cùng độc đáo. Chúng tôi theo dõi hành vi sử dụng từng phút một. Chúng tôi biết khi nào mọi người ngừng nghe, liệu họ có quay lại xem tập tiếp theo hay không, và họ có gắn bó lâu dài hay không. Chẳng có tín hiệu nào tốt hơn thế. Bất cứ điều gì khiến người dùng rời đi, Sherpa sẽ học cách tránh; và bất cứ điều gì giữ chân người dùng ở lại với một chương trình cụ thể, Sherpa sẽ tận dụng cho các chương trình mới.

Rohan Nayak - inline image

Người dùng trung bình trên Pocket FM nghe hơn 150 phút mỗi ngày, gấp gần 3 lần so với YouTube và nhiều hơn khoảng 50% so với Netflix. Tôi tin rằng chúng ta mới chỉ đang ở giai đoạn khởi đầu của một làn sóng nội dung mới: cực kỳ giải trí, nhập tâm và cá nhân hóa sâu sắc — và nó sẽ còn tuyệt vời hơn nữa khi chúng tôi có thêm dữ liệu.

Vì sao văn phong AI nghe rất "AI"

Dostoevsky là một nhà văn vĩ đại bởi ông phơi bày những mâu thuẫn và cảm xúc qua hành vi cũng như lời độc thoại của nhân vật. Oscar Wilde và Fitzgerald chinh phục độc giả bởi lối viết dí dỏm được trau chuốt đẹp đến mức bạn không thể ngừng lật trang. Conan Doyle thì tài tình ở khả năng giấu kín thông tin với người đọc cho đến tận phút chót.

Các LLM đa dụng lại được xây dựng để làm điều ngược lại hoàn toàn, và chẳng có cách nào để chúng giỏi hơn trong chuyện này. Chúng đưa ra câu trả lời trực tiếp, viết bằng ngôn ngữ trung tính, và lạm dụng các thủ pháp tu từ để tăng tính thuyết phục. Tương tự, các trợ lý AI giỏi được huấn luyện để dẫn dắt bạn đến kết luận đúng càng nhanh càng tốt. Tất cả những "đường dây thần kinh" cơ bản này thấm sâu vào văn phong của chúng, và đó là lý do vì sao chúng viết dở.

Sáng tác văn học cần sự căng thẳng, cảm xúc, việc xây dựng và tháo gỡ xung đột một cách chậm rãi, những nét tính cách nhân vật vượt xa vài câu miêu tả hời hợt, và nhịp độ biến hóa linh hoạt. Người đọc phải bị dẫn dắt đến những kết luận sai lầm trong khi vẫn liên tục nhận được manh mối khiến họ không thể dứt ra.

Ngay cả một mô hình suy luận dành nhiều thời gian "suy nghĩ" hơn thì về cơ bản vẫn đang cố giải quyết vấn đề, chứ không được thưởng vì mang lại trải nghiệm thú vị cho khán giả trên hành trình tìm ra đáp án. Giải mã một bí ẩn và viết nên một bí ẩn là hai chuyện hoàn toàn khác nhau.

Chúng tôi đã thất bại khi cố gắng "chắp vá" những thứ có sẵn

Ban đầu, chúng tôi nghĩ mình có thể dùng tạm những công cụ đang có trên thị trường. Chúng tôi thử các mô hình đóng gói sẵn và tinh chỉnh chúng với hy vọng thổi hồn vào lối kể chuyện vô cảm của chúng.

Chúng tôi thử nghiệm việc prompt trực tiếp các mô hình ngày càng mạnh hơn, duy trì các bản tóm tắt liên tục (rolling summaries) khi cốt truyện phát triển, đồng thời dùng kỹ thuật truy xuất và đồ thị tri thức để trả lời các truy vấn.

Nhưng khi prompt trực tiếp, đến tập 100 bạn sẽ gặp 10-20 điểm mâu thuẫn. Các bản tóm tắt liên tục về cơ bản ném những chi tiết quan trọng vào hư không, làm hỏng phần câu chuyện phía sau. Cửa sổ ngữ cảnh lớn hơn có giúp ích đôi chút, nhưng các mô hình vẫn chật vật khi phải sử dụng thông tin chính xác trong những ngữ cảnh dài.

Ngoài chất lượng đầu ra, các truy vấn là thước đo tốt nhất cho thấy mô hình hiểu những gì nó vừa viết đến đâu. Ngay từ sớm, chúng tôi nhận ra rằng dù có đổ bao nhiêu công sức vào bất kỳ mô hình nào, nó vẫn không thể trả lời các truy vấn tự sự học đa bước (multi-hop narratological queries) — loại truy vấn đòi hỏi tổng hợp chi tiết từ nhiều tập. Điều này phơi bày giới hạn của công nghệ hiện tại.

Chúng tôi kết luận rằng con đường này không bền vững và quyết định tự xây dựng công nghệ của riêng mình... Sherpa — cái tên hoàn toàn xứng đáng cho vai trò dẫn dắt tác giả vượt qua những phần khó nhằn nhất của việc kể chuyện.

Lý do kỹ thuật khiến Sherpa viết ra câu chuyện bạn thực sự muốn nghe

Sherpa là một hệ thống vận hành (harness) mô hình sáng tác văn học dạng dài, đăng tải nhiều kỳ. Nó bao gồm ba thành phần, và tôi sẽ mô tả chi tiết hơn sau phần giới thiệu này:

  1. Một bộ lập kế hoạch (planner) quyết định mỗi tuyến truyện và phân cảnh cần đạt được điều gì, cũng như định hướng phát triển nhân vật và tiến hóa các mối quan hệ.
  2. Một Mô hình Thế giới Tự sự (Narrative World Model) lưu trữ có cấu trúc những gì đã xảy ra, từng nhân vật biết điều gì, và câu chuyện còn "nợ" khán giả những lời hứa nào.
  3. Một cỗ máy viết văn xuôi (prose engine) phác thảo dựa trên kế hoạch và trạng thái đó, trong khi các mô hình phê bình (critic) kiểm tra hành vi nhân vật, tính liên tục và chất lượng phân cảnh. Sau đó, phần chỉnh sửa của tác giả và phản hồi của khán giả sẽ giúp cải thiện vòng lặp tiếp theo.

Kết quả thu được rất đáng khích lệ. Khi Sherpa và từng đối thủ cạnh tranh cùng viết một câu chuyện từ trang giấy trắng, các đánh giá cặp đôi mù (blinded pairwise judgments) ưu tiên Sherpa trong 65,6% đến 97,1% trường hợp, tùy thuộc vào đối thủ. Với học tăng cường của Sherpa và tập dữ liệu ngày càng lớn của Pocket, không có lý do gì khoảng cách này không tiếp tục nới rộng.

Rohan Nayak - inline image

Bộ nhớ - Mô hình Thế giới Tự sự (NWM)

Các mô hình ngôn ngữ không có bộ nhớ giữa các lần gọi, nên mọi thứ chúng biết về một câu chuyện đều phải nhét vừa vào prompt. Cửa sổ ngữ cảnh dài hơn không giải quyết được vấn đề này vì các mô hình xử lý thông tin nằm giữa một prompt dài rất thiếu ổn định. Truy xuất trên văn bản thô cũng vô ích. Một lệnh tìm kiếm có thể trả về đoạn văn nói nơi một món đồ từng ở, chứ không phải nơi nó đang ở hiện tại.

Khi một tập truyện được hoàn thiện với Sherpa, một mô hình sẽ trích xuất các bản ghi có cấu trúc từ tập đó, mỗi bản ghi được liên kết với đoạn văn bản gốc chứng minh cho nó. Các trường dữ liệu được thiết kế riêng cho tiểu thuyết: nhân vật biết gì và chưa biết gì, sự kiện xảy ra khi nào so với lúc khán giả biết được nó, những nút thắt nào đang chờ được tháo gỡ. Mọi dữ kiện đều có giá trị từ chương thiết lập nó cho đến chương thay đổi nó. Nếu tác giả chỉnh sửa một chương trước đó, mọi thứ phụ thuộc vào chương ấy sẽ được xây dựng lại.

Để trả lời câu hỏi, NWM tìm kiếm trên đồ thị bằng cả từ khóa chính xác lẫn ý nghĩa cùng một lúc, kéo theo các kết nối trực tiếp của từng kết quả, và cung cấp cho mô hình một gói dữ liệu nhỏ gọn, tập trung.

Khả năng truy xuất theo từng tập của nó chỉ hiển thị những dữ kiện chính truyện có liên quan, cho phép suy luận đa bước mà không làm rò rỉ nội dung tương lai. Trong một bài kiểm chuẩn nội bộ gồm 60 câu hỏi, NWM của Sherpa đạt độ chính xác 86,7% (52/60) với chi phí 0,7793 USD mỗi lần chạy. Mức độ chính xác này tương đương với hệ thống quản lý bộ nhớ của Claude Code khi dùng các mô hình hạng opus 5.x, nhưng chi phí thấp hơn khoảng 21 lần (16,2172 USD mỗi lần chạy). Nó cũng vượt trội hơn phương pháp truy xuất văn bản thuần túy tới 20 điểm phần trăm (từ 66,7% lên 86,7%) trong khi tốn ít chi phí hơn hẳn.

Rohan Nayak - inline image

Cỗ máy viết văn xuôi: Khó đến mức chúng tôi phải tự xây dựng mô hình riêng

Học tăng cường cần một tín hiệu thưởng, và văn xuôi thì không có tín hiệu nào rõ ràng. Chẳng có bài kiểm tra nào cho một đoạn văn để kết luận nó đạt tầm giải Nobel hay chỉ là thứ sáo rỗng lấp chỗ trống.

Sherpa giao mỗi phần của công việc viết lách cho một mô hình khác nhau. Mỗi nhân vật là một agent, chạy trên các mô hình tùy chỉnh đã qua hậu huấn luyện (post-trained) của chúng tôi, tự đề xuất hành động tiếp theo dựa trên tính cách, mục tiêu hiện tại của câu chuyện, các sự kiện gần đây và những phần của thế giới có liên quan đến mình. Một mô hình phê bình riêng biệt sẽ xem xét mọi đề xuất và trả lại bất cứ thứ gì mơ hồ, phi logic, sai lệch tính cách nhân vật, lặp lại hoặc không thúc đẩy câu chuyện tiến lên. Sau đó, mô hình thứ ba — người kể chuyện — sẽ chọn những đề xuất phù hợp với phân cảnh và viết chúng thành đoạn văn tiếp theo. Chỉ những hành động thực sự xuất hiện trên trang giấy mới được thêm vào bộ nhớ của câu chuyện.

Bên cạnh đó, chúng tôi đang huấn luyện một mô hình văn xuôi độc quyền với các hàm thưởng được thiết kế riêng cho tiểu thuyết nhiều kỳ. Chúng tôi phạt lỗi viết hoa mỹ sáo rỗng, lặp từ và giải thích dông dài, đồng thời thưởng cho hội thoại tự nhiên, giọng văn đặc trưng và sự kịch tính.

Các tín hiệu chúng tôi dùng để đánh giá văn xuôi:

  • Đoạn này có mâu thuẫn với các sự kiện đã thiết lập hoặc hiểu biết của nhân vật không?
  • Hành động có hợp lý, đúng tính cách nhân vật và giúp phân cảnh tiến triển không?
  • Tác giả có thích đoạn hội thoại, giọng văn và nhịp độ này hơn phương án khác không?
  • Người nghe có nghe hết tập này và quay lại ở các tập sau không?

Những tín hiệu này hoạt động trên các khung thời gian khác nhau. Một câu văn có thể nghe rất hay nhưng lại phá vỡ logic truyện, và một cú cliffhanger có thể giúp tập sau mở đầu hấp dẫn hơn nhưng lại làm yếu cả một tuyến truyện. Sherpa cần tối ưu hóa trên tất cả các tín hiệu này thay vì coi tỷ lệ giữ chân người dùng là một điểm số duy nhất cho "văn hay", bởi khái niệm đó quá chủ quan.

Cỗ máy viết văn xuôi của Sherpa hiện đã vượt qua hầu hết các mô hình mã nguồn mở và thương mại mà chúng tôi đánh giá trong các bài kiểm chuẩn tiểu thuyết nội bộ, với điểm số ưa thích văn phong đạt 69% khi so với Sonnet 5 và 94% khi so với Gemini 3.1 Pro. Mỗi cột thể hiện tỷ lệ người đánh giá thích văn phong của Sherpa hơn mô hình được nêu tên, được chấm ở cả hai thứ tự trình bày, với mốc 50% đại diện cho sự ngang bằng. Đây là những kết quả ban đầu từ quá trình hậu huấn luyện đang diễn ra, và chúng tôi kỳ vọng sẽ còn cải thiện hơn nữa khi quá trình huấn luyện tiếp tục.

Rohan Nayak - inline image

Bộ lập kế hoạch cốt truyện phân cấp

Cấu trúc truyện là thuộc tính của toàn bộ chương trình, trong khi các mô hình ngôn ngữ chỉ tạo ra mảnh ghép tiếp theo. Thuật toán dự đoán từ tiếp theo không hề biết rằng một manh mối gieo ở tập 5 cần được tháo gỡ ở tập 60, hay chương này cần một mục tiêu, một xung đột và một kết quả. Trong một câu chuyện dài 100 trang do một mô hình hàng đầu tạo ra, một biên tập viên AI chỉ lấy mẫu năm chương đã phát hiện 52 vấn đề về cấu trúc: mạch truyện bị vấp và những chương thừa thãi.

Bộ lập kế hoạch của Sherpa đi từ tổng thể câu chuyện xuống các tuyến truyện và từng tập, giao cho mỗi phân cảnh một nhiệm vụ cụ thể, bao gồm cả những gì nó phải để ngỏ, nhờ đó tập 20 có thể dọn đường cho cú lật mặt ở tập 80 mà không làm lộ kết quả. Mọi nút thắt được gieo đều được lưu trong bộ nhớ câu chuyện dưới dạng một "lời hứa" cho đến khi được tháo gỡ. Một bộ tạo mục tiêu giúp câu chuyện luôn tiến về phía trước: khi một mục tiêu hoàn thành hoặc bế tắc, nó sẽ thiết lập mục tiêu mới không trùng lặp với bất kỳ mục tiêu cũ nào. Cũng trên bài kiểm tra 100 trang đó, số lỗi cấu trúc giảm từ 52 xuống 31, và chỉ riêng việc loại bỏ các bản cập nhật mục tiêu đã giúp giảm gần một nửa số lời chê ở cấp độ chương.

Rohan Nayak - inline image

Mọi mảnh ghép đã sẵn sàng để Sherpa giúp các tác giả tạo ra những IP tỷ đô trong vài năm tới. Sherpa sẽ ngày càng hoàn thiện hơn khi chúng tôi đón thêm nhiều nhà sáng tạo và người dùng lên nền tảng.

Phía trước vẫn còn rất nhiều việc phải làm và vô số vấn đề chưa có lời giải; việc hoàn thiện Sherpa là một trong số đó, cũng như việc tạo ra các điều kiện vận hành để tác giả có thể sử dụng nó một cách tốt nhất.

Tôi vô cùng hào hứng với những gì chúng tôi đang làm tại Pocket FM. Chúng tôi đang giúp các nhà sáng tạo kiếm sống bằng cách kể những câu chuyện mà vài năm trước sẽ ngốn ngân sách hàng triệu USD để sản xuất.

Và chúng ta vẫn chỉ đang ở giai đoạn khởi đầu của một cơ hội trị giá 1 nghìn tỷ USD.

Viết lại trong YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral