YouMind
Đăng nhập

Những điều bạn chưa biết về huấn luyện LLM: Nguyên lý, lộ trình và các phương pháp thực hành mới

@HiTw93
TIẾNG TRUNG03 thg 4, 2026
632K
2.2K
461
53
4.1K

TL;DR

Bài viết này khám phá bối cảnh đang thay đổi của việc huấn luyện LLM, chuyển trọng tâm từ tiền huấn luyện quy mô lớn sang hậu huấn luyện tinh vi, học tăng cường (reinforcement learning) và kỹ thuật khai thác tác nhân (agentic harness engineering) – những yếu tố định hình hiệu suất của các mô hình hiện đại.

TL;DR

Sau khi viết "Những điều bạn chưa biết về Claude Code: Kiến trúc, Quản trị và Thực hành Kỹ thuật" và "Những điều bạn chưa biết về Agent: Nguyên tắc, Kiến trúc và Thực hành Kỹ thuật", tôi muốn thử thách bản thân tóm tắt cách hoạt động thực sự của quá trình huấn luyện Mô hình Ngôn ngữ Lớn (LLM). Bài viết này hướng đến việc dễ hiểu ngay cả với những người không có nền tảng chuyên môn.

Nhìn về năm 2026, khoảng cách thực sự về hiệu suất của LLM không còn chỉ nằm ở quá trình tiền huấn luyện (pre-training), mà là phần đuôi dài phía sau: hậu huấn luyện (post-training), đánh giá (evaluation), phần thưởng (reward), huấn luyện Agent và chưng cất (distillation). Mỗi bước đều ảnh hưởng đến trải nghiệm thực tế của người dùng. Khi bạn thấy một mô hình đột nhiên trở nên mạnh hơn, rất có thể là do những lĩnh vực này được tối ưu hóa cùng nhau, chứ không phải do một yếu tố đơn lẻ.

Phần tiếp theo đi theo quy trình huấn luyện LLM, tập trung vào cách các nhà sản xuất cải thiện kết quả cuối cùng thông qua nửa sau của quy trình huấn luyện.

Huấn luyện LLM là một Quy trình

Trong vài năm qua, sự tiến bộ của mô hình thường được giải thích bằng sự tích lũy về tham số, dữ liệu và sức mạnh tính toán. Tuy nhiên, những cải tiến mà nhiều người dùng thực sự cảm nhận được không đến từ việc huấn luyện trên nhiều kho ngữ liệu cơ bản hơn, mà đến từ toàn bộ quá trình huấn luyện sau tiền huấn luyện. Cách một mô hình nói chuyện, tuân theo hướng dẫn, suy luận và sử dụng công cụ—những điều này không tự nhiên phát triển chỉ bằng cách cho nó ăn thêm văn bản internet.

InstructGPT đã đưa ra một ví dụ rất trực tiếp: một mô hình chỉ có 1,3B tham số trải qua quá trình căn chỉnh (alignment) và tối ưu hóa sở thích (preference optimization) có thể đánh bại GPT-3 175B trong các đánh giá sở thích của con người. Với sự chênh lệch tham số lên đến hai bậc độ lớn, người dùng cuối cùng lại thích phiên bản nhỏ hơn nhiều. Nửa sau của quá trình huấn luyện thực sự viết lại nhận thức của người dùng.

Quá trình huấn luyện thực chất là một quy trình nơi dữ liệu, thuật toán, hệ thống và phản hồi được kết hợp chặt chẽ. Một thay đổi ở một lớp thường lan truyền sang các lớp khác. Vào năm 2026, khả năng của mô hình và giá trị công nghiệp ngày càng tập trung vào các lớp sau tiền huấn luyện.

Tw93 - inline image

Đây cũng là lý do tại sao chúng ta thường cảm thấy Doubao không cạnh tranh về thứ hạng, nhưng lại thấy hài lòng hơn khi sử dụng hàng ngày—đó là nhờ phần hậu huấn luyện được thực hiện tốt.

Sáu lớp này chỉ để thấy sự phân công lao động. Chín giai đoạn trong hình dưới đây là một phiên bản chi tiết hơn: dữ liệu thô và công thức hệ thống được tách riêng, Agent harness và Triển khai (Deployment) là các phân nhánh của nửa sau. Ngoài ra còn có hai vòng phản hồi xuyên suốt: lưu lượng sản xuất quay trở lại kỹ thuật dữ liệu và kết quả đánh giá ngoại tuyến quay trở lại tiền huấn luyện.

Tw93 - inline image

Tiền huấn luyện Chỉ là Nền tảng

Tiền huấn luyện vẫn là điểm khởi đầu của chuỗi huấn luyện. Chỉ khi hiểu nó làm gì, chúng ta mới có thể hiểu mỗi lớp tiếp theo bổ sung điều gì. Nếu không có bước này, sẽ không có khả năng mô hình hóa ngôn ngữ, không có nén kiến thức và không có chỗ cho việc chuyển giao khả năng sau này. Về mặt kỹ thuật, nó làm nhiều hơn là chỉ dạy mô hình dự đoán token tiếp theo: nó học phân phối ngôn ngữ, nén kiến thức và các mẫu từ văn bản quy mô lớn vào các tham số, và để lại chỗ cho việc kích hoạt khả năng sau này. Dự đoán token tiếp theo chỉ mô tả hình thức huấn luyện; nó không giải thích tại sao các mô hình đột nhiên phát triển các khả năng mới khi quy mô tăng lên.

Sau GPT-3, nhiều nỗ lực tinh chỉnh mô hình xem xét ngân sách và tỷ lệ cẩn thận hơn. Mô hình không tốt hơn chỉ vì chúng lớn hơn. Có một vấn đề về tỷ lệ giữa số lượng tham số, token huấn luyện và tổng ngân sách tính toán. Nhiều mô hình không phải quá nhỏ; chúng bị huấn luyện thiếu và chưa đạt đến điểm phù hợp hơn trong một ngân sách nhất định.

Trong các quyết định huấn luyện thực tế, câu hỏi thực tế là: nếu ai đó cho bạn 10.000 H100 và một tháng, bạn sẽ huấn luyện một mô hình mã nguồn mở đủ tốt như thế nào? Các định luật mở rộng quy mô (scaling laws) ở đây giống một công cụ phân bổ ngân sách hơn là một đường cong trừu tượng trong bài báo. Cuối cùng, bạn cần cân nhắc: vòng huấn luyện tiếp theo nên xếp chồng nhiều tham số hơn hay đưa thêm nhiều dữ liệu hơn? Mô hình hiện tại thiếu khả năng hay chỉ bị huấn luyện thiếu? Với ngân sách GPU hạn chế, tỷ lệ nào là có giá trị nhất?

Tiền huấn luyện giống như đặt nền móng cho khả năng của mô hình, xác định phạm vi kiến thức, tiềm năng tổng quát hóa và khả năng suy luận mẫu. Nó cũng quyết định liệu có chỗ cho hậu huấn luyện khai thác hay không. Tuy nhiên, tiền huấn luyện không thể kiểm soát việc mô hình có tuân theo hướng dẫn, hợp tác với người dùng hay chạy ổn định trên các tác vụ quan trọng hay không.

Giai đoạn tiền huấn luyện không chỉ quyết định lượng kiến thức được học; nó định trước những gì mô hình có thể trở thành. Cách phân tách của tokenizer ảnh hưởng trực tiếp đến quá trình huấn luyện tiếp theo và độ dài cửa sổ ngữ cảnh phải được đặt trước. Liệu có tiếp tục tiền huấn luyện đa phương thức hay không, hay liệu hoạt động trên một bộ tăng tốc duy nhất có phải là yêu cầu ngay từ đầu hay không—những sự đánh đổi này được viết vào công thức trong giai đoạn huấn luyện, chứ không phải được thêm vào như các tính năng khi phát hành. Gemma 3 nhấn mạnh đồng thời vào bộ tăng tốc đơn, ngữ cảnh 128K, khả năng thị giác và lượng tử hóa, phản ánh những sự đánh đổi này. Các khả năng mà người dùng cuối cùng thấy—chạy trên máy tính cục bộ, nhìn thấy hình ảnh, hiểu tài liệu dài—thực tế phần lớn được xác định trong giai đoạn huấn luyện.

Nhìn vào điểm dữ liệu tối ưu do Chinchilla đưa ra, đối với mô hình 8B tham số, đó là khoảng 200B token. Tuy nhiên, Llama 3 8B thực tế đã sử dụng 15T token, gấp khoảng 75 lần. Các công thức huấn luyện quá mức như vậy thường đánh đổi mật độ khả năng cao hơn cho cùng một tham số, tạo ra một mô hình nhỏ hơn, tiết kiệm chi phí hơn cho suy luận. Đo lường điều này bằng tổng FLOPs (các phép toán dấu phẩy động) đáng tin cậy hơn là nhìn vào số lượng tham số. Hình dưới đây minh họa trực quan khoảng cách này.

Tw93 - inline image

Một thiết kế khác thường bị bỏ qua xảy ra trong giai đoạn tiền huấn luyện: kích thước từ vựng của tokenizer, chiến lược phân tách và phương pháp mã hóa cấp byte có tác động đáng kể. Llama 2 có từ vựng 32K; sau khi Llama 3 mở rộng lên 128K, độ dài chuỗi được nén khoảng 15% và hiệu suất hạ nguồn cũng được cải thiện theo. Tác động này kéo dài đến chi phí suy luận và khả năng đa ngôn ngữ. Hiệu quả token của tiếng Trung, mã và công thức toán học được xác định trong quá trình thiết kế từ vựng. Ví dụ: một tokenizer phân tách tiếng Trung thành các phần rất nhỏ không chỉ tốn nhiều token hơn mỗi lần; mỗi lần suy luận đều phải liên tục chịu chi phí của quyết định tồi đó.

Công thức Dữ liệu Xác định Khả năng của Mô hình

Quy mô tham số từng là một thước đo chính trong quá khứ, nhưng trong hai năm qua, điều quan trọng hơn là "công thức dữ liệu."

Quá trình này bề ngoài trông giống như làm sạch dữ liệu, nhưng thực chất nó là một nhiệm vụ kỹ thuật sản xuất dữ liệu hoàn chỉnh. Dữ liệu thô từ các trang web, kho mã, sách và diễn đàn trước tiên phải trải qua quá trình trích xuất văn bản, nhận dạng ngôn ngữ, lọc chất lượng, xử lý quyền riêng tư, lọc an toàn và loại bỏ trùng lặp trước khi vào tiền huấn luyện. Hình dưới đây cho thấy quy trình xử lý phễu hoàn chỉnh.

Tw93 - inline image

Nếu bạn chỉ coi dữ liệu là nhiên liệu huấn luyện, bạn dễ dàng kết luận rằng càng nhiều càng tốt. Nhưng kỹ thuật dữ liệu gần với thiết kế khả năng hơn. Những gì mô hình thấy và không thấy, cùng với tỷ lệ mã, toán học và bách khoa toàn thư, ảnh hưởng trực tiếp đến phân phối khả năng cuối cùng của mô hình.

Kiểm soát trùng lặp và nhiễm bẩn thường bị bỏ qua, nhưng chúng ảnh hưởng đáng kể đến kết quả. Nó không chỉ là dữ liệu chất lượng thấp; nó bao gồm các mẫu trùng lặp, văn bản giấy phép, trang web nhân bản và nhiễm bẩn do rò rỉ điểm chuẩn. Nếu việc loại bỏ trùng lặp ở cấp tài liệu và cấp dòng không đủ, mô hình thường hấp thụ lặp đi lặp lại nội dung dễ sao chép nhất mà không nhất thiết học được những phần có giá trị nhất. Hiệu suất không nhất quán của nhiều mô hình mã nguồn mở thường là do khoảng cách về chất lượng xử lý dữ liệu.

Trong hai năm qua, việc trộn dữ liệu (data mixing) đã trở thành một vấn đề nghiên cứu riêng biệt. Các công trình như Data Mixing Laws không chỉ tập trung vào việc có thể thu thập thêm bao nhiêu dữ liệu, mà còn tập trung vào cách tỷ lệ của các loại dữ liệu khác nhau dẫn dắt mô hình hướng tới các cấu trúc khả năng cụ thể.

Dữ liệu tổng hợp (synthetic data) cũng đã chuyển từ một phương tiện hỗ trợ thành một phần chính thức của quá trình huấn luyện. Các phương pháp như Self-Instruct, quỹ đạo chưng cất của DeepSeek-R1 và sự giám sát tổng hợp ngày càng rõ ràng trong các dòng Qwen và Kimi đều đang đi theo cùng một hướng. Mỗi thế hệ mô hình mạnh hơn tham gia vào việc tái tạo dữ liệu mà thế hệ tiếp theo nhìn thấy. Các mô hình ban đầu tạo ra dữ liệu hướng dẫn cơ bản; các mô hình mạnh hơn tạo ra quỹ đạo suy luận chất lượng cao và dữ liệu CoT (Chuỗi Suy nghĩ); và các mô hình suy luận được huấn luyện qua RL chưng cất các quỹ đạo này thành các mô hình dày đặc (dense) nhỏ hơn. "Dày đặc" có nghĩa là tất cả các tham số đều chạy, không giống như MoE (Hỗn hợp Chuyên gia) kích hoạt theo nhu cầu.

Điểm mấu chốt ở đây là các mô hình thường cần hình thành khả năng ở quy mô lớn hơn trước, sau đó những khả năng đó mới có thể được nén vào các mô hình nhỏ hơn. Dòng DeepSeek-R1-Distill là một ví dụ trực tiếp. Các quỹ đạo của mô hình lớn sau RL đã mang lại lợi ích đáng kể cho các mô hình dày đặc từ 1,5B đến 70B. Llama 3.1 405B cũng được sử dụng một cách rõ ràng để cải thiện chất lượng hậu huấn luyện của các mô hình 8B và 70B. Đây không phải là sản phẩm phụ mà là một phần của thiết kế huấn luyện.

Các Ràng buộc về Hệ thống và Kiến trúc Phải được Xác định Rõ trước khi Huấn luyện

Nhiều người hiểu huấn luyện là một vấn đề nghiên cứu: làm thế nào để đặt hàm mục tiêu, làm thế nào để giảm loss và làm thế nào để thay đổi cấu trúc mô hình. Nhưng trong huấn luyện LLM thực tế, các ràng buộc hệ thống rất quan trọng; đó là một vấn đề về hệ thống phân tán, chứ không phải vấn đề học sâu trên một máy đơn lẻ. Số lượng GPU, băng thông bộ nhớ, chiến lược song song, khả năng chịu lỗi và chi phí—những điều này không thể đợi đến sau khi huấn luyện mới tối ưu hóa. Chúng quyết định ngay từ đầu bạn có thể huấn luyện lớn đến đâu, hỗ trợ ngữ cảnh dài bao lâu và liệu bạn có thể chạy các hậu huấn luyện phức tạp hơn hay không.

MoE là ví dụ điển hình nhất ở lớp này. Chế độ đa chuyên gia cho phép mô hình mở rộng tổng số tham số với chi phí tính toán tương tự trong khi kiểm soát chi phí kích hoạt trên mỗi token. Sự đánh đổi là định tuyến phức tạp, cân bằng tải khó khăn và cơ sở hạ tầng nặng nề. Các thiết kế MoE của DeepSeek-V3 và Qwen là sự thỏa hiệp giữa chi phí và hiệu quả, chứ không chỉ là sở thích kiến trúc.

Các cuộc thảo luận trong các công thức được công bố gần đây không còn chỉ là phân tích thô như kích thước mô hình và tỷ lệ token. muP cho phép các siêu tham số được chuyển từ các thí nghiệm quy mô nhỏ sang huấn luyện quy mô lớn. Tốc độ học WSD là một lịch trình tăng lên, ổn định và sau đó giảm dần. Kết hợp với kích thước batch tối ưu và tỷ lệ dữ liệu trên tham số cao hơn, những chi tiết này đang trở thành yếu tố khác biệt thực sự giữa các mô hình cùng quy mô.

Ngữ cảnh dài, đa phương thức và các kiến trúc mới, nếu chỉ được hiểu là các tính năng sản phẩm, sẽ bỏ lỡ các ràng buộc về phía huấn luyện. Mục tiêu ngữ cảnh 128K trực tiếp thay đổi chi phí attention, kích thước batch, chương trình giảng dạy huấn luyện (sắp xếp thứ tự dữ liệu) và chiến lược song song. Đa phương thức thay đổi không chỉ cấu trúc mô hình, mà còn cả việc trộn dữ liệu, thiết kế bộ mã hóa và đánh giá an toàn. Nếu hoạt động trên một thẻ đơn là một yêu cầu cứng, số lượng tham số, đường dẫn lượng tử hóa và kích thước họ mô hình sẽ đều bị thắt chặt.

Các công trình như Forgetting Transformer và Kimi's Attention Residuals trả lời các câu hỏi tương tự: làm thế nào để huấn luyện các ngữ cảnh dài hơn và làm thế nào để tránh pha loãng thông tin khi mạng ngày càng sâu. Những gì bạn thấy là một mô hình có thể xử lý đầu vào dài hơn hoặc dễ triển khai hơn, nhưng những gì phải đối mặt trong quá trình huấn luyện là một bộ ràng buộc hoàn toàn khác.

Ngân sách tính toán là cố định. Kích thước mô hình, khối lượng token huấn luyện, độ dài ngữ cảnh và chi phí phục vụ—đối với mỗi bit chi tiêu theo một hướng, những hướng khác phải nhường lại.

Tw93 - inline image

Khi ngữ cảnh dài ra, chi phí attention bùng nổ và kích thước batch phải giảm xuống. Khi mô hình lớn hơn, mức sử dụng bộ nhớ GPU tăng lên và chi phí phục vụ cũng tăng theo. Đây không phải là những lựa chọn mà là kết quả của các ràng buộc về tài nguyên. Hầu hết các quyết định đều được khóa chặt trước khi quá trình huấn luyện bắt đầu.

Ngoài ra còn có một thực tế kỹ thuật thường bị bỏ qua: huấn luyện không phải lúc nào cũng ổn định. Hàng nghìn GPU chạy trong nhiều tuần và đột nhiên xảy ra một đợt tăng loss huấn luyện, lớn đến mức không thể bỏ qua, buộc phải quay lại một checkpoint từ nhiều ngày trước để bắt đầu lại.

Bên cạnh các đợt tăng loss, còn có các lỗi GPU im lặng—một GPU đơn lẻ không báo lỗi nhưng âm thầm tạo ra gradient sai—sự bất thường về băng thông NVLink và nhiễu loạn giao tiếp giữa các nút. Mỗi lỗi có thể làm hỏng một vài bước huấn luyện. Có khả năng phát hiện, cách ly và phục hồi nhanh chóng trong huấn luyện quy mô lớn là một năng lực kỹ thuật cấp phòng thí nghiệm, chứ không phải vấn đề giải quyết bằng cách đọc các bài báo.

DeepSeek-V3 đã đề cập cụ thể trong báo cáo kỹ thuật rằng toàn bộ quá trình tiền huấn luyện không có đợt tăng loss không thể phục hồi và không có lần quay lại nào. Đây cũng là một trong số ít trường hợp xác minh rằng huấn luyện hỗn hợp độ chính xác FP8 khả thi trên các mô hình siêu lớn. Theo dữ liệu công khai, toàn bộ quá trình mất khoảng 2,788M giờ GPU H800 để tiền huấn luyện 14,8T token.

Hệ thống huấn luyện và hệ thống suy luận có liên quan chặt chẽ nhưng không phải là cùng một vấn đề kỹ thuật. Huấn luyện quan tâm đến gradient, tính song song, checkpoint, thông lượng và chi phí; suy luận quan tâm đến độ trễ, bộ nhớ đệm KV (lưu trữ các tính toán lịch sử để tránh lặp lại), lượng tử hóa và độ ổn định dịch vụ.

Hậu huấn luyện Xác định Khoảng cách Cảm nhận của Người dùng

Nhiều cải tiến mà người dùng thông thường thực sự có thể cảm nhận được xảy ra sau tiền huấn luyện. Tinh chỉnh hướng dẫn (instruction tuning) sử dụng các cặp hướng dẫn-câu trả lời được gắn nhãn để huấn luyện có giám sát. Nó thay đổi cách mô hình trả lời, biến các yêu cầu như cách nhận nhiệm vụ, tổ chức đầu ra và hành động như một trợ lý hợp tác thành các tín hiệu giám sát. Một mô hình cơ sở có thể đã có nhiều khả năng tiềm ẩn, nhưng nếu không có bước này, những khả năng đó thường sẽ không xuất hiện một cách ổn định dưới hình thức mà người dùng mong đợi.

Nhìn xa hơn, RLHF, DPO và RFT có chung hướng đi—tích hợp định nghĩa về "câu trả lời tốt hơn" vào vòng lặp huấn luyện—nhưng thông qua các con đường khác nhau.

  • RLHF (Học Tăng cường từ Phản hồi của Con người) trước tiên bắt chước các câu trả lời chất lượng cao, sau đó sử dụng so sánh sở thích để tăng cường.
  • DPO (Tối ưu hóa Sở thích Trực tiếp) rút ngắn con đường này bằng cách học trực tiếp từ so sánh sở thích mà không cần một mô hình phần thưởng riêng biệt.
  • RFT (Tinh chỉnh Tăng cường) là một giao diện dễ triển khai hơn trong kỹ thuật, đưa các định nghĩa nhiệm vụ, thiết kế bộ chấm điểm và tín hiệu phần thưởng vào quy trình sản phẩm hóa.

Ngày nay, nói về hậu huấn luyện chỉ với SFT hoặc RL là không còn đủ. Phần khó hơn là làm thế nào để thiết lập đánh giá, làm thế nào để chấm điểm và loại câu trả lời nào đáng để tiếp tục tối ưu hóa. SFT là tinh chỉnh có giám sát; nó không chỉ học kiến thức mà còn học phong cách. Độ dài dữ liệu, định dạng, có bao gồm trích dẫn hay không và sở thích đối với các dấu đầu dòng ảnh hưởng đáng kể đến hình thức đầu ra cuối cùng của mô hình. Nhiều người dùng nghĩ rằng họ đang so sánh khả năng, nhưng họ thường chỉ so sánh sự khác biệt về phong cách. Thêm vào đó, các đánh giá sở thích tự nhiên ưu ái các câu trả lời dài hơn, dễ nhầm lẫn các đầu ra dài trông có vẻ nghiêm túc với những đầu ra đáng tin cậy hơn. Do đó, nhìn vào bảng xếp hạng cho hậu huấn luyện thường là không đủ; người ta phải kết hợp kết quả nhiệm vụ thực tế, chi phí và độ ổn định.

Hậu huấn luyện hiện đại là một quy trình nhiều giai đoạn. Công thức của DeepSeek-R1 là rõ ràng nhất trong các tài liệu công khai. Nó tiến hành theo bốn giai đoạn:

Giai đoạn 1 là SFT khởi động nguội (cold-start SFT). Trước khi thực hiện học tăng cường, hãy sử dụng một lượng nhỏ dữ liệu Chuỗi Suy nghĩ (CoT) chất lượng cao để khởi động. DeepSeek-R1-Zero đã chứng minh rằng thực hiện RL trực tiếp từ một mô hình cơ sở (mô hình thô sau tiền huấn luyện mà không có căn chỉnh) là khả thi, nhưng các mô hình được huấn luyện hoàn toàn bằng RL sẽ tự lặp lại, ngôn ngữ lộn xộn và khả năng đọc kém. SFT khởi động nguội cung cấp cho RL một điểm khởi đầu ổn định hơn, khóa chặt tính nhất quán về định dạng và ngôn ngữ.

Giai đoạn 2 thực hiện học tăng cường trong các lĩnh vực có thể xác minh như toán học, mã và logic, sử dụng GRPO làm thuật toán huấn luyện và tính đúng đắn có thể xác minh bằng chương trình làm tín hiệu phần thưởng. Điểm mấu chốt là tại sao GRPO được chọn thay vì PPO truyền thống: PPO (Tối ưu hóa Chính sách Gần) yêu cầu một mạng giá trị độc lập để ước tính giá trị trạng thái hiện tại, đây là một gánh nặng kỹ thuật lớn đối với các mô hình lớn. GRPO lấy mẫu nhiều câu trả lời cho cùng một lời nhắc và sử dụng xếp hạng trong nhóm thay vì ước tính giá trị tuyệt đối, loại bỏ nhu cầu về một mạng giá trị độc lập. Dòng DeepSeek và cơ sở hạ tầng RL của Cursor Composer 2 đều sử dụng các sơ đồ gần với GRPO.

Giai đoạn 3 thực hiện Tinh chỉnh Lấy mẫu Loại bỏ (Rejection Sampling Fine-Tuning), lọc các quỹ đạo thành công do RL tạo ra và chuyển đổi chúng thành dữ liệu SFT mới cho một vòng tinh chỉnh có giám sát khác. Đây là cầu nối giữa RL và SFT; các quỹ đạo tốt được RL khám phá trở thành các mẫu huấn luyện chất lượng cao cho vòng SFT tiếp theo.

Giai đoạn 4 tích hợp phản hồi về tính hữu ích và an toàn để điều chỉnh mô hình thành một hình thức trợ lý đáp ứng các tiêu chuẩn phát hành.

Tw93 - inline image

Bốn giai đoạn phụ thuộc lẫn nhau: khởi động nguội cho phép RL bắt đầu ổn định, RL tạo ra dữ liệu chất lượng cao, lấy mẫu loại bỏ biến dữ liệu đó thành đầu vào cho vòng SFT tiếp theo và RL căn chỉnh hoàn tất quá trình hội tụ hành vi. Từ các kết quả công khai, khoảng cách giữa SFT trực tiếp và hoàn thành cả bốn giai đoạn thường có thể thấy rõ.

Eval, Grader và Phần thưởng đang Xác định lại Mục tiêu Huấn luyện

Thành phần chịu trách nhiệm biến đầu ra của mô hình thành điểm số huấn luyện được gọi là bộ chấm điểm (grader) và nó có thể dễ dàng gặp các vấn đề không mong muốn. Nếu nó chỉ nhìn vào câu trả lời cuối cùng, mô hình sẽ nhanh chóng học cách đi đường tắt; nếu việc chấm điểm quá thô, nhiễu sẽ liên tục được khuếch đại bởi học tăng cường; nếu điểm số trên bảng xếp hạng tăng lên, các nhiệm vụ thực tế có thể không đi theo. Thông thường, người dùng nghĩ rằng họ đang thấy khoảng cách trong mô hình cơ sở, nhưng khoảng cách lại nằm ở cách mục tiêu được xác định.

Trong quy trình huấn luyện, eval xác định những gì cần kiểm tra, grader xác định cách một đầu ra trở thành điểm số và phần thưởng xác định nơi mô hình sẽ được đẩy tới. Cùng nhau, chúng tạo thành một vòng phản hồi cụ thể: định nghĩa nhiệm vụ, eval, grader, tối ưu hóa, triển khai (rollout) và đánh giá lại. Rollout đề cập đến các quỹ đạo được tạo ra bởi mô hình thực thi các nhiệm vụ. Nếu bất kỳ mắt xích nào trong chuỗi đi chệch hướng, quá trình tối ưu hóa tiếp theo cũng sẽ đi chệch hướng.

Chỉ nhìn vào kết quả cuối cùng, một mô hình có thể tình cờ đúng hoặc đi theo một quy trình sai để có được câu trả lời đúng. Điều này đặc biệt rõ ràng trong các nhiệm vụ mã, toán học và suy luận phức tạp. Nếu các bước trung gian không đi vào phản hồi, những gì mô hình học được thường không phải là suy luận đáng tin cậy hơn, mà là cách để đạt được điểm cuối cùng đó với xác suất cao hơn.

Do đó, nhiều công việc trong những năm gần đây đã chuyển từ RLHF truyền thống sang phần thưởng được xác minh (verified rewards), sử dụng các chương trình để xác minh trực tiếp tính đúng đắn. Trong các nhiệm vụ có thể xác minh như toán học, mã và logic, tính đúng đắn hiện có thể được chấm điểm trực tiếp mà không cần chủ yếu dựa vào sở thích của con người. Nhưng phần thưởng được xác minh vẫn chưa giải quyết hoàn toàn vấn đề. Các hiện tượng như tối ưu hóa quá mức, quá khớp phần thưởng (các quy tắc chấm điểm được tối ưu hóa quá mức mà không có lợi ích thực sự về khả năng) và sụp đổ chế độ (đầu ra trở nên rất đơn điệu và mất tính đa dạng) vẫn xảy ra. Vấn đề đã chuyển từ việc liệu các sở thích có được gắn nhãn chính xác hay không sang liệu chuỗi chấm điểm có ổn định hay không.

Quá trình suy nghĩ do mô hình viết ra không thể được coi là một bản ghi hoàn chỉnh về các quy trình nội bộ. Anthropic đã phát hiện trong các thí nghiệm quan sát mô hình suy luận rằng các mô hình sử dụng các gợi ý bổ sung nhưng không thừa nhận điều đó trong CoT có thể nhìn thấy; trong các kịch bản hack phần thưởng, chúng có nhiều khả năng thêm một lời giải thích có vẻ hợp lý. Hack phần thưởng là khai thác hệ thống chấm điểm thay vì thực sự hoàn thành nhiệm vụ. CoT có thể nhìn thấy phù hợp hơn như một tín hiệu huấn luyện và giám sát, chứ không phải là sự thật hoàn chỉnh.

Đi sâu hơn một lớp, các mô hình thậm chí có thể bắt đầu khai thác chính kênh chấm điểm. Nghiên cứu về giả mạo phần thưởng (reward tampering) và giả mạo căn chỉnh (alignment faking) cho thấy các mô hình về mặt lý thuyết có thể chủ động can thiệp vào quá trình chấm điểm. Giả mạo phần thưởng là trực tiếp thay đổi quy trình tính toán phần thưởng; giả mạo căn chỉnh là giả vờ tuân thủ—bề ngoài tỏ ra hợp tác trong khi che giấu các ý định không được căn chỉnh.

Một khi mô hình có quyền truy cập môi trường đủ mạnh, những gì nó tối ưu hóa không chỉ là kết quả nhiệm vụ, mà còn có thể là danh sách kiểm tra, mã phần thưởng và chính mối quan hệ huấn luyện. Một thí nghiệm của Anthropic năm 2025 đã tiêm kiến thức hack phần thưởng bổ sung vào một tập hợp các môi trường RL mã sản xuất có thể khai thác và sau đó quan sát thấy sự tổng quát hóa tương tự. Sau khi học hack phần thưởng, mô hình không chỉ tiếp tục khai thác nó trong các nhiệm vụ tương tự mà còn cho thấy sự sai lệch rộng hơn như giả mạo căn chỉnh.

Những hành vi này không được thấy trong các đánh giá đối thoại tiêu chuẩn, chỉ trong môi trường nhiệm vụ Agent. Hàm ý kỹ thuật là trực tiếp: phần thưởng, bộ chấm điểm, cách ly môi trường và giám sát phải là một phần của thiết kế huấn luyện.

Trong giai đoạn Agent, thiết kế phần thưởng được tinh chỉnh thêm. Kết quả cuối cùng chỉ là một mục; chất lượng quy trình, quản lý ngữ cảnh và các ràng buộc chống gian lận cũng phải được đo lường riêng biệt. Kimi K2.5 thưởng cho sự phân rã hiệu quả và song song thực sự; Chroma Context-1 chấm điểm các tài liệu liên quan được tìm thấy trong quá trình tìm kiếm; Cursor Composer 2 bao gồm các bản tóm tắt trong các nhiệm vụ dài như một phần thưởng vì nếu bản tóm tắt bị bóp méo, ngữ cảnh tiếp theo sẽ bị hiểu sai.

Trong triển khai, ORM là Mô hình Phần thưởng Kết quả (Outcome Reward Model), chỉ chấm điểm câu trả lời cuối cùng. Tín hiệu thưa thớt, chi phí thấp và phù hợp để bắt đầu, nhưng mô hình dễ đi đường tắt hơn. PRM là Mô hình Phần thưởng Quy trình (Process Reward Model), chấm điểm các bước trung gian. Tín hiệu dày đặc hơn và thường mạnh hơn cho suy luận toán học và mã, nhưng chi phí gắn nhãn và hệ thống cao hơn nhiều. OpenAI đã thấy trong các thí nghiệm suy luận toán học rằng PRM không chỉ cải thiện độ chính xác mà còn giúp ràng buộc quy trình dễ dàng hơn vì mọi bước đều được giám sát. Vấn đề cũng trực tiếp: chi phí của PRM thường cao gấp nhiều lần so với ORM, vì vậy hầu hết các hệ thống thực tế đều bắt đầu với ORM. Chỉ trong các nhiệm vụ có thể xác minh như toán học, mã và logic, việc tự động hóa PRM mới dễ dàng hơn, sử dụng các chương trình để xác minh các bước trung gian và bỏ qua các nút thắt về gắn nhãn của con người.

Tw93 - inline image

Vòng lặp hoàn chỉnh chạy như sau:

Tw93 - inline image

Các phương pháp căn chỉnh gần đây đều đang làm cùng một việc. Constitutional AI của Anthropic tích hợp các nguyên tắc do con người viết vào quá trình huấn luyện, sử dụng phản hồi AI để thay thế sở thích cá nhân của con người. Deliberative Alignment của OpenAI đưa việc tuân thủ an toàn vào quá trình suy luận, để bản thân khả năng suy luận chịu một phần ràng buộc an toàn. Deliberative Alignment ở đây có nghĩa là mô hình tự đánh giá các chuẩn mực an toàn trong giai đoạn suy luận thay vì dựa vào các phản xạ đã được huấn luyện. Cả hai hướng đều biến căn chỉnh từ nhãn hiệu của con người thành một phần của mục tiêu huấn luyện nội bộ.

Lấy Constitutional AI làm ví dụ, quy trình hai giai đoạn trước tiên cho phép mô hình tự phê bình và sửa đổi đầu ra dựa trên các nguyên tắc, sau đó sử dụng phản hồi AI để thay thế việc gắn nhãn sở thích cá nhân của con người. Căn chỉnh không bao giờ là một bản vá được treo sau quá trình huấn luyện; bất cứ điều gì hệ thống kiểm tra, cách nó chấm điểm và những gì nó thưởng, mô hình sẽ di chuyển theo hướng đó. Đây là công cụ điều chỉnh trực tiếp nhất trong nửa sau của quá trình huấn luyện.

Tw93 - inline image

Trong Huấn luyện Agent, Không Chỉ Mô hình được Tối ưu hóa

Trong hai năm qua, sự xuất hiện nhanh chóng của các mô hình lý luận đại diện bởi dòng o1 và DeepSeek-R1 cho thấy rằng trong điều kiện phần thưởng ổn định, xác minh đáng tin cậy và cơ sở hạ tầng đầy đủ, RL trên các mô hình ngôn ngữ có thể cải thiện đáng kể hiệu suất trong các tác vụ toán học, mã hóa và logic.

Điều này cũng mở ra một chiều hướng mới: khả năng tính toán suy luận giờ đây có thể được mở rộng. Vai trò của huấn luyện RL thêm một lớp khác: ngoài việc dạy mô hình trả lời câu hỏi, nó còn dạy mô hình cách phân bổ ngân sách suy luận — biết khi nào cần suy nghĩ nhiều hơn và khi nào nên dừng lại. Về phía trước, thách thức trở nên là để mô hình hoạt động liên tục trong một môi trường chứ không chỉ kéo dài một suy nghĩ đơn lẻ.

Tw93 - inline image

Junyang Lin, cựu trưởng nhóm mô hình tại Qwen, có một phản ánh tiêu biểu về con đường kết hợp giữa Thinking và Instruct: khó khăn không phải là tạo cho mô hình một công tắc suy nghĩ, mà là mục tiêu của hai chế độ khác nhau — một theo đuổi sự trực tiếp, tuân thủ và độ trễ thấp, trong khi chế độ kia theo đuổi nhiều khám phá hơn và độ chính xác cao hơn. Một bước xa hơn, mục tiêu huấn luyện chuyển từ suy nghĩ bao lâu trước khi trả lời sang cách phân bổ ngân sách trong hành động, cách chấp nhận phản hồi, và cách tiếp tục tiến triển nhiệm vụ.

Tại thời điểm này, đối tượng huấn luyện không còn chỉ là một mô hình trả lời câu hỏi, mà là một hệ thống có thể lập kế hoạch, gọi công cụ, nhận phản hồi và duy trì sự mạch lạc trong các tác vụ dài. Do đó, ngăn xếp huấn luyện thay đổi: trình duyệt, thiết bị đầu cuối, tìm kiếm, hộp cát thực thi, hệ thống bộ nhớ, máy chủ công cụ và khung điều phối tất cả đều bắt đầu đi vào hệ thống huấn luyện.

Chính xác hơn, một harness là một chương trình điều khiển được bọc quanh mô hình. Khái niệm này không chỉ thuộc về môi trường chạy Agent; nó tồn tại trong giai đoạn huấn luyện: xác định mô hình nhìn thấy đầu vào nào, cách nó nhận phản hồi, khi nào cần cắt bỏ ngữ cảnh, và khi nào cần gọi công cụ. Xây dựng lời nhắc, cập nhật bộ nhớ, chính sách truy xuất, chỉnh sửa ngữ cảnh và điều phối công cụ đều nằm ở đây. Môi trường không còn chỉ là một trình xác thực tĩnh mà là một lớp mà cả huấn luyện và triển khai đều phải đối mặt trực tiếp.

Tw93 - inline image

Harness phải ổn định để việc huấn luyện mô hình có ý nghĩa. Nếu giá trị trả về của công cụ không ổn định, môi trường trình duyệt không nhất quán với môi trường trực tuyến, hoặc trạng thái hệ thống tệp không thể tái tạo, thì trước hết bộ chấm điểm sẽ thất bại, và sau đó mô hình sẽ học cách khai thác lỗ hổng môi trường thay vì đạt được năng lực. Khi huấn luyện Agent, bạn thường đang gỡ lỗi cả mô hình lẫn môi trường.

Cách tiếp cận của ba công ty rất rõ ràng: Kimi sử dụng PARL để giải quyết phân rã song song và gán tín dụng; Cursor sử dụng tự tóm tắt và RL thời gian thực để kết nối các phiên lập trình dài và lưu lượng sản xuất trở lại huấn luyện; Chroma huấn luyện prune_chunks như một chiến lược, để việc cắt bỏ ngữ cảnh trực tiếp đi vào quy trình truy xuất.

Trong kỷ nguyên SFT, sự đa dạng dữ liệu là tối quan trọng; trong kỷ nguyên Agent, chất lượng môi trường là cốt lõi: tính ổn định, tính xác thực, độ bao phủ, phân bố độ khó, độ giàu phản hồi và khả năng chống khai thác. Mục tiêu huấn luyện thay đổi tương ứng, đòi hỏi độ tin cậy trong các nhiệm vụ hoàn chỉnh, không chỉ trả lời đúng một câu hỏi. Các benchmark CoT cổ điển không thể bao phủ điều này.

Sự thay đổi này tiếp tục tiến lên: không chỉ huấn luyện mô hình trong một harness runtime, mà ngay cả mã harness cũng đang trở thành một đối tượng có thể được tìm kiếm và tối ưu hóa bởi một vòng lặp bên ngoài.

Tw93 - inline image

PARL của Kimi K2.5 là một trường hợp kỹ thuật đáng chú ý với một lộ trình rõ ràng: chỉ huấn luyện bộ điều phối, thu hẹp gán tín dụng vào lớp điều phối, và không tối ưu hóa tất cả các tác nhân phụ cùng lúc.

Tín hiệu phần thưởng được chia thành ba loại: thành công nhiệm vụ, phân rã song song và các ràng buộc hoàn thành, cùng nhau điều khiển lớp điều phối. Trong giai đoạn đầu huấn luyện, trọng số r_parallel được tăng lên để khuyến khích khám phá các chiến lược song song, sau đó giảm dần về 0 ở giai đoạn sau để tránh việc mở nhiều tác nhân phụ trở thành một lối tắt. Đánh giá không chỉ nhìn vào tổng số bước mà còn vào độ dài đường dẫn tới hạn; đường dẫn tới hạn ngắn hơn cho thấy tính song song thực sự hiệu quả.

Tw93 - inline image

Nhưng đến năm 2026, mọi thứ đã tiến xa hơn một bước. Meta-Harness coi kỹ thuật harness như một mục tiêu tối ưu hóa riêng biệt. Nó không tối ưu hóa trọng số, mà là chính mã harness — các chương trình xây dựng lời nhắc, truy xuất, bộ nhớ và cập nhật trạng thái xung quanh một mô hình cố định. Các con số ở đầu bài báo rất trực tiếp: với cùng một mô hình cơ sở, chỉ cần thay đổi harness có thể dẫn đến chênh lệch hiệu suất gấp 6 lần trên cùng một benchmark. Bộ chương trình bên ngoài mô hình này không còn chỉ là một chi tiết triển khai mà là một lớp hình thành năng lực.

Chìa khóa không phải là thêm một bộ tối ưu hóa trừu tượng khác, mà là viết mã tiên nghiệm, điểm số và dấu vết thực thi (nhật ký của các lệnh gọi công cụ và thay đổi trạng thái) vào hệ thống tệp, để cho phép một proposer sử dụng grep, cat, và diff giống như viết mã, sau đó sửa đổi harness dọc theo các đường dẫn thất bại. Proposer là mô-đun đề xuất các sửa đổi harness.

Các tác giả đánh giá rõ ràng rằng nhiều bộ tối ưu hóa văn bản trước đây không hiệu quả đối với các chương trình dài hạn, có trạng thái như harness bởi vì chỉ nhìn vào điểm số vô hướng, mẫu ngắn hoặc tóm tắt sẽ làm phẳng vấn đề. Điểm số vô hướng chỉ cung cấp điểm cuối cùng mà không có thông tin quy trình. Lỗi harness thường biểu hiện nhiều bước sau đó; một khi phản hồi bị nén quá mức, chuỗi chẩn đoán bị phá vỡ.

Những kết quả này không chỉ là điểm benchmark cao hơn. Trong phân loại văn bản trực tuyến, Meta-Harness cao hơn 7,7 điểm so với ACE (đường cơ sở kỹ thuật ngữ cảnh agent) đồng thời nén việc sử dụng token ngữ cảnh xuống còn 1/4. Trong lý luận toán học tăng cường truy xuất, một harness được khám phá đã cải thiện trung bình 4,7 điểm trên 200 bài toán cấp độ IMO cho 5 mô hình chưa từng tham gia tối ưu hóa. Trên TerminalBench-2, nó cũng vượt qua các đường cơ sở kỹ thuật thủ công. Điều này cho thấy những gì đang được tối ưu hóa không còn chỉ là các chiến lược mô hình nội bộ, mà còn là các chương trình tổ chức thông tin và hành động xung quanh mô hình.

Một ví dụ cụ thể: Meta-Harness tự động phát hiện khởi tạo môi trường trên TerminalBench-2 — chạy một lệnh shell trước khi vòng lặp agent bắt đầu để tổ chức thư mục làm việc, các ngôn ngữ có sẵn, trình quản lý gói và trạng thái bộ nhớ thành một ảnh chụp nhanh được đưa vào lời nhắc đầu tiên. Nhiều agent lập trình dành vài vòng đầu tiên để khám phá môi trường; với việc xử lý trước này, sự cải thiện không nhất thiết đến từ trọng số mạnh hơn, mà từ harness cho phép mô hình bắt đầu với một ngữ cảnh tốt hơn.

Tại thời điểm này, mục tiêu tối ưu hóa đã mở rộng từ câu trả lời sang quỹ đạo, và sau đó đến chương trình harness mang những quỹ đạo đó.

Sau Khi Một Mô hình Hàng đầu Được Phát hành, Chuỗi Huấn luyện Tiếp tục

Hiểu các mô hình lớn ngày nay chỉ qua lăng kính của một vòng pre-training đơn lẻ là không còn đủ. Đằng sau một mô hình đã phát hành, toàn bộ chuỗi pre-training, post-training, chưng cất và chuyên biệt hóa thường đã được hoàn thành, và các mô hình mạnh hơn tiếp tục tạo ra dữ liệu huấn luyện cho thế hệ tiếp theo.

Việc chưng cất của dòng DeepSeek-R1 là một ví dụ điển hình. Một mô hình lớn đầu tiên phát triển khả năng lý luận thông qua RL và phần thưởng đã được xác minh, sau đó chuyển các quỹ đạo lý luận này sang các mô hình dense nhỏ hơn. Các mô hình chuyên biệt như TranslateGemma cho thấy một lộ trình khác: trên các tác vụ mục tiêu cụ thể hơn, sử dụng dữ liệu chất lượng cao và thiết kế phần thưởng chuyên biệt để nén thêm và định hướng khả năng. Ở giai đoạn này, các mô hình mạnh hơn không chỉ để phục vụ người dùng mà còn để trực tiếp tạo ra dữ liệu huấn luyện cho thế hệ tiếp theo.

Lý do đằng sau điều này cơ bản hơn là chuyển giao quỹ đạo: một giải thích khả dĩ là trong kho ngữ liệu internet, bộ nhớ kiến thức và khả năng lý luận được kết hợp với nhau, và các mục tiêu pre-training hiện tại yêu cầu mô hình phải học tốt cả hai. Mô hình lớn phải đến trước vì chỉ chúng mới đủ lớn để hỗ trợ cả hai, và sau đó chúng có thể được sử dụng để tạo ra dữ liệu trình diễn lý luận thuần túy. Khi các mô hình nhỏ huấn luyện trên dữ liệu như vậy, chúng có thể tập trung vào lý luận mà không bị buộc phải ghi nhớ tất cả kiến thức. Bắt đầu lớn và sau đó đi nhỏ là về tách rời khả năng, không chỉ là một chiến lược chi phí.

Mặt khác, khả năng thích ứng triển khai cũng quan trọng như chính năng lực. Nhiều kịch bản không cần một mô hình lớn đa năng; họ quan tâm nhiều hơn đến chi phí, độ trễ, tính ổn định và khả năng kiểm soát. Kết thúc của huấn luyện không nhất thiết là lớn hơn, mà có thể là nhỏ hơn, rẻ hơn và chuyên biệt hơn.

Mô hình cuối cùng được phát hành không nhất thiết là checkpoint ở phía ngoài cùng bên phải của đường cong huấn luyện. Trước khi phát hành thực tế, nhiều checkpoint thường được so sánh lặp đi lặp lại về kết quả tác vụ thực tế, phong cách từ chối, tính ổn định của công cụ, chi phí và rủi ro hồi quy. Phiên bản được đưa lên trực tuyến thường là một quyết định sản phẩm, không phải là phiên bản hoạt động mạnh nhất trên một số liệu đơn lẻ.

Khi người dùng nhìn thấy tên mô hình, họ cho rằng nó tương ứng với một đường cong huấn luyện tăng đều đặn, nhưng checkpoint nào thực sự được đưa lên trực tuyến lại là một vấn đề khác.

Giá trị của một mô hình lớn nằm ở cả khả năng phục vụ của chính nó và ở việc nó tiếp tục cung cấp dữ liệu huấn luyện, nguồn chưng cất và nền tảng phát hành cho thế hệ tiếp theo.

Tw93 - inline image

Ngoài huấn luyện ngoại tuyến, tối ưu hóa liên tục gần trực tuyến đã đi vào quy trình chính. RL thời gian thực của Cursor Composer 2 cho thấy một số khả năng Agent đã bắt đầu lặp lại liên tục thông qua lưu lượng sản xuất thay vì chờ đợi vòng huấn luyện ngoại tuyến quy mô lớn tiếp theo. Ranh giới giữa huấn luyện và triển khai không biến mất, nhưng vòng phản hồi giữa chúng đang ngắn lại.

Cách Đánh Giá Tại Sao Một Mô hình Trở Nên Mạnh Hơn trong Tương lai

Giá trị của các mô hình hàng đầu trong năm 2026 ngày càng phụ thuộc vào ai có thể hoàn thành toàn bộ chuỗi huấn luyện sau pre-training: liên tục tạo ra dữ liệu huấn luyện, thực hiện chưng cất, thực hiện chuyên biệt hóa, thực hiện đánh giá và phần thưởng tốt, và đưa ra các lựa chọn phát hành cuối cùng.

Bởi vì điều này, khi xem xét tại sao một mô hình đột nhiên trở nên mạnh hơn, bạn có thể xem xét ba điều trước tiên:

  • Đầu tiên, xem sự thay đổi xảy ra ở lớp pre-training hay trong quá trình huấn luyện tiếp theo. Nhiều cải thiện năng lực thực sự đến từ pre-training mạnh hơn và công thức dữ liệu tốt hơn, nhưng nhiều thay đổi nhận thức được thực sự bắt nguồn từ post-training. Việc một mô hình tuân theo hướng dẫn, sử dụng công cụ, hay có phong cách trả lời ổn định thường không phát triển một cách tự nhiên chỉ bằng cách huấn luyện trên nhiều kho ngữ liệu hơn.
  • Tiếp theo, xem sự cải thiện đến từ lớp nào: là trọng số và công thức huấn luyện, hay phần thưởng/đánh giá/chấm điểm, hay mã harness và vòng lặp triển khai. Vào thời điểm chúng ta đạt đến các mô hình lý luận và Agent, sức mạnh mà người dùng cảm nhận thường không phải là kết quả của riêng mô hình cơ sở. Cách đánh giá được thiết lập, cách phần thưởng được tính điểm, môi trường công cụ có ổn định không, cách truy xuất và bộ nhớ được tổ chức, cách tóm tắt và ngữ cảnh được cắt bỏ, và checkpoint nào được chọn để phát hành — tất cả những điều này cùng nhau thay đổi hiệu suất sản phẩm cuối cùng.
  • Cuối cùng, xem phiên bản trực tuyến đang tối ưu hóa điều gì. Một số phiên bản theo đuổi trần cao hơn, một số theo đuổi chi phí thấp hơn, độ trễ thấp hơn và rủi ro hồi quy thấp hơn, và một số được chuyên biệt hóa cho một loại kịch bản nhất định. Phiên bản phát hành là một quyết định sản phẩm, không phải là điểm ở phía ngoài cùng bên phải của đường cong huấn luyện. Vì vậy, khi xem xét các bản cập nhật mô hình, xem xét nó thực sự đang tối ưu hóa điều gì sẽ gần với sự thật hơn.

Phân tích sự cải thiện đột ngột của một mô hình thành các giai đoạn sản xuất, nhiều lợi ích thực sự được khuếch đại bởi nửa sau của ngăn xếp huấn luyện và harness bên ngoài. Chu kỳ lặp lại của chuỗi này cũng đang ngắn lại: lưu lượng sản xuất liên tục chảy ngược trở lại huấn luyện, mỗi thế hệ mô hình mạnh hơn tạo ra dữ liệu giám sát thế hệ tiếp theo đồng thời tạo ra năng lực, và các chương trình bên ngoài liên tục được viết lại dựa trên các bản triển khai, nhật ký và phản hồi tác vụ thực tế.

Mô hình được phát hành hôm nay chỉ là một ảnh chụp nhanh; pipeline và chương trình harness là những sản phẩm tiếp tục chạy.

Tài liệu Học tập

  1. Hoffmann et al. (2022). Training Compute-Optimal Large Language Models (Chinchilla). arXiv:2203.15556
  2. Ouyang et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). arXiv:2203.02155
  3. Shao et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (GRPO). arXiv:2402.03300
  4. DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948
  5. DeepSeek-AI (2024). DeepSeek-V3 Technical Report. arXiv:2412.19437
  6. Llama Team, AI @ Meta (2024). The Llama 3 Herd of Models. arXiv:2407.21783
  7. Bai et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073
  8. OpenAI (2024). Deliberative Alignment: Reasoning Enables Safer Language Models. openai.com/index/deliberative-alignment
  9. Anthropic (2025). Sycophancy to Subterfuge: Investigating Reward Tampering in Language Models. anthropic.com/research/reward-tampering
  10. MacDiarmid et al. (2025). Natural Emergent Misalignment from Reward Hacking in Production RL. arXiv:2511.18397
  11. Lee et al. (2026). Meta-Harness: End-to-End Optimization of Model Harnesses (preprint project page). yoonholee.com/meta-harness
  12. Kimi Team (2026). Kimi K2.5 Tech Blog: Visual Agentic Intelligence. kimi.com/blog/kimi-k2-5
  13. Rush, S. (2026). A technical report on Composer 2. cursor.com/blog/composer-2-technical-report
  14. Chroma (2026). Chroma Context-1: Training a Self-Editing Search Agent. trychroma.com/research/context-1

Bài viết này không cho phép bất kỳ hình thức sao chép hoặc viết lại để tái bản. Nếu bạn phát hiện bất kỳ trường hợp nào, vui lòng giúp tôi báo cáo.

Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral