Sau khi thấy nhiều người nhận được lời mời làm nghiên cứu sinh tiến sĩ và ngay lập tức có được các vị trí trong ngành với mức lương cao trong đợt tuyển dụng mùa xuân, tôi bắt đầu tự hỏi liệu đi thẳng vào ngành có phải là lựa chọn tốt hơn hay không.
Vì vậy, tôi đã xem qua về cơ bản tất cả các bài chia sẻ kinh nghiệm phỏng vấn liên quan đến RL mà tôi có thể tìm thấy trên Zhihu, kết hợp chúng với các cuộc thảo luận gần đây và quan sát của riêng tôi, và chắt lọc mọi thứ thành 35 câu hỏi thú vị nhất.
Hãy coi nó như một bộ tiêu chuẩn đánh giá phỏng vấn RL.
Phiên bản tiếng Trung trên Zhihu: https://zhuanlan.zhihu.com/p/2046740446353811230
Một vài lưu ý:
• Danh sách này không phân tách rõ ràng LLM RL và Agentic RL. Một số câu hỏi có câu trả lời rất khác nhau tùy thuộc vào bối cảnh.
• Hầu hết mọi câu hỏi đều có thể được mở rộng hơn nữa. Không có câu trả lời tham khảo nào được cung cấp. Nếu bạn sử dụng LLM, hãy tiếp tục đặt các câu hỏi tiếp theo và tìm kiếm rộng rãi.
• Tuyển dụng RL hiện đại ngày càng đòi hỏi sự hiểu biết toàn diện. Nếu bạn là nhà nghiên cứu thuật toán, mọi người vẫn sẽ hỏi các câu hỏi về cơ sở hạ tầng. Điều ngược lại cũng đúng.
• Các câu hỏi liên quan đến dữ liệu không được bao gồm. Những câu hỏi đó gần như không thể học thuộc lòng và phụ thuộc nhiều vào kinh nghiệm thực tế của bạn.
• Học thuộc lòng các câu hỏi phỏng vấn là chưa đủ. Sự hiểu biết sâu sắc quan trọng hơn nhiều.
Thuật toán
- Tại sao lại sử dụng Actor-Critic thay vì phương pháp Critic thuần túy?
- Mối quan hệ giữa phân kỳ KL, entropy chéo và MLE là gì?
- Làm thế nào để thiết kế phần thưởng trong các tình huống RL khác nhau?
- Lấy mẫu quan trọng, lấy mẫu loại bỏ và các phương pháp Monte Carlo khác phù hợp như thế nào trong RL?
- Lợi thế được tính toán như thế nào trong PPO và GRPO? Tại sao lại trừ đi một baseline? Việc chuẩn hóa độ lệch chuẩn có thực sự cần thiết không?
- Quá trình khám phá trong RL training và test-time scaling khác nhau như thế nào?
- Cơ chế clipping của PPO hoạt động như thế nào? Tại sao lại lấy objective tối thiểu? Điều gì xảy ra nếu không có clipping? CISPO khác biệt như thế nào?
- Tại sao GRPO lại bao gồm một hình phạt KL? KL được tính như thế nào? Tại sao các phương pháp như DAPO và GSPO lại loại bỏ nó?
- Trong quá trình huấn luyện LLM, điều gì xảy ra nếu loss vô tình bị All Reduced nhiều lần?
- Hàm phần thưởng trong DPO là gì? Có thể xảy ra reward hacking không? Làm thế nào để giảm thiểu nó?
- Những phương pháp nào giải quyết sự không khớp giữa huấn luyện và suy luận trong các mô hình MoE, và chúng hoạt động như thế nào?
- Làm thế nào để chọn kích thước nhóm, tốc độ học, số epoch PPO và độ dài sinh trong quá trình huấn luyện RL?
- So với GRPO, Dr.GRPO, DAPO, GSPO, CISPO, SAPO, DPPO, MaxRL và SimKO cải thiện quá trình huấn luyện như thế nào? Những hạn chế của chúng là gì?
- TRPO, DPPO và AReaL thực thi các ràng buộc trust-region trên các mục tiêu RL như thế nào?
- Về cơ bản, RL có thể mở rộng ranh giới năng lực của LLM không?
- Dựa trên các công trình như ProRL, chúng ta nên suy nghĩ như thế nào về việc mở rộng ranh giới của huấn luyện RL?
- OPD mang lại những cải tiến gì so với RL truyền thống và SFT? Các ứng dụng của nó là gì?
- Khả năng suy luận xuất hiện trong LLM ở giai đoạn huấn luyện nào?
- Từ DeepSeek R1 đến V3.2 và các hệ thống V4 trong tương lai, những cải tiến liên quan đến RL nào đã được giới thiệu? RL khác biệt như thế nào trong các mô hình MoE?
Cơ sở hạ tầng
- Bỏ qua CPU offload, có bao nhiêu bản sao mô hình tồn tại trong bộ nhớ trong quá trình huấn luyện GRPO? Các tối ưu hóa khác nhau có thể tiết kiệm bao nhiêu bộ nhớ?
- Suy luận phân tán: tối ưu hóa truyền tải bộ đệm KV và các chiến lược giao tiếp đa GPU.
- INT8 so với FP8. Sự đánh đổi là gì? Độ chính xác nào được ưa chuộng cho huấn luyện và suy luận?
- Vấn đề đuôi dài trong các rollout RL là gì và làm thế nào để giải quyết nó?
- Continuous batching gây ra những vấn đề gì trong huấn luyện RL? vLLM và SGLang khác nhau như thế nào?
- Làm thế nào để đo lường mức độ sử dụng trong vLLM và SGLang? Làm thế nào để đánh giá mức độ sử dụng bộ đệm KV trong quá trình huấn luyện?
- Lan truyền ngược được triển khai như thế nào trong huấn luyện RL đa nút quy mô lớn?
- Những framework RL không đồng bộ nào tồn tại và chúng giải quyết những nút thắt cổ chai đồng bộ hóa nào?
- Trong AReaL hoặc các framework rollout một phần khác, bộ đệm KV từ các chính sách trước đó có được lưu giữ không?
- Expert Parallelism ảnh hưởng đến thông lượng MoE như thế nào?
- Trong huấn luyện ngữ cảnh dài, thiết kế sự chồng chéo giữa tính toán và giao tiếp như thế nào? Megatron và FSDP khác nhau như thế nào về chiến lược song song?
- Làm thế nào để kích hoạt thực thi xác định? Tính bất biến lô là gì? Nguyên nhân gây ra nó? Atomic add có liên quan không? Atomic add có thể giải quyết vấn đề không?
- AReaL và slime khác nhau như thế nào trong hiểu biết của chúng về nút thắt cổ chai rollout RL?
- Chúng ta nên suy nghĩ như thế nào về độ trễ trong huấn luyện RL hoàn toàn không đồng bộ? Các giá trị điển hình trong thực tế là gì?
- Dữ liệu chảy qua slime như thế nào? Nó được tích hợp với Megatron như thế nào? Loss được tính như thế nào?
- Nếu bạn phải chọn giữa VeRL, TRL, Unsloth, AReaL và slime, bạn sẽ chọn cái nào và tại sao?
Chúc bạn may mắn.
Và hãy nhớ: chuẩn bị phỏng vấn có ích, nhưng sự hiểu biết thực sự có giá trị hơn nhiều so với những câu trả lời học thuộc lòng.





