看到好幾個人收到博士錄取後,馬上就在春季招聘中拿到高薪業界職位,我開始思考直接進入業界是否可能是更好的選擇。
於是我翻遍了知乎上幾乎所有我能找到的 RL 相關面試經驗,結合最近的討論和我自己的觀察,提煉出 35 個最有趣的問題。
把它當作一份 RL 面試基準測試吧。
知乎中文版:https://zhuanlan.zhihu.com/p/2046740446353811230
幾點說明:
• 這個列表並沒有嚴格區分 LLM RL 和 Agentic RL。有些問題在不同的設定下,答案會很不一樣。
• 幾乎每個問題都可以延伸討論得很深。這裡沒有提供參考答案。如果你用 LLM 來輔助,記得追問下去並廣泛搜尋。
• 現代的 RL 招聘越來越要求全棧理解。如果你是演算法研究員,別人還是會問你基礎設施的問題。反過來也一樣。
• 不包含與數據相關的問題。這類問題幾乎無法死記硬背,而且高度依賴你實際的經驗。
• 光背面試題是不夠的。深入理解遠比死記答案重要。
演算法
- 為什麼使用 Actor-Critic 而不是純粹的 Critic 方法?
- KL 散度、交叉熵和最大似然估計之間的關係是什麼?
- 在不同的 RL 場景中,應該如何設計獎勵函數?
- 重要性採樣、拒絕採樣和其他蒙地卡羅方法如何應用於 RL?
- 在 PPO 和 GRPO 中,優勢函數是如何計算的?為什麼要減去基線?標準差歸一化真的必要嗎?
- RL 訓練和測試時的運算擴展(test-time scaling)在探索方式上有何不同?
- PPO 的裁剪(clipping)是如何運作的?為什麼要取最小值目標?如果沒有裁剪會發生什麼?CISPO 又有何不同?
- 為什麼 GRPO 要加入 KL 懲罰項?KL 是怎麼計算的?為什麼像 DAPO 和 GSPO 這樣的方法會移除它?
- 在 LLM 訓練過程中,如果不小心對損失函數進行了多次 All Reduce,會發生什麼事?
- DPO 中的獎勵函數是什麼?會發生獎勵駭客攻擊(reward hacking)嗎?如何減輕這種情況?
- 有哪些方法可以解決 MoE 模型中的訓練-推理不匹配問題?它們是如何運作的?
- 在 RL 訓練中,應該如何選擇組大小(group size)、學習率、PPO 迭代次數和生成長度?
- 與 GRPO 相比,Dr.GRPO、DAPO、GSPO、CISPO、SAPO、DPPO、MaxRL 和 SimKO 分別如何改進訓練過程?它們各自的限制是什麼?
- TRPO、DPPO 和 AReaL 是如何對 RL 目標施加信賴域(trust-region)約束的?
- RL 從根本上能擴展 LLM 的能力邊界嗎?
- 基於 ProRL 等研究,我們該如何看待擴展 RL 訓練邊界的問題?
- OPD 相比傳統 RL 和 SFT 帶來了哪些改進?它的應用場景有哪些?
- LLM 的推理能力是在訓練的哪個階段湧現的?
- 從 DeepSeek R1 到 V3.2 再到未來的 V4 系統,引入了哪些與 RL 相關的改進?RL 在 MoE 模型中有何不同?
基礎設施
- 忽略 CPU 卸載,GRPO 訓練期間記憶體中會存在多少個模型副本?各種最佳化方法能節省多少記憶體?
- 分散式推理:KV 快取傳輸最佳化和多 GPU 通訊策略。
- INT8 與 FP8。它們各自的權衡是什麼?訓練和推理分別偏好哪種精度?
- RL 推論中的長尾問題是什麼?該如何解決?
- 連續批處理(continuous batching)在 RL 訓練中會引入哪些問題?vLLM 和 SGLang 有何不同?
- 如何衡量 vLLM 和 SGLang 中的利用率?如何在訓練期間評估 KV 快取利用率?
- 在大規模多節點 RL 訓練中,反向傳播是如何實現的?
- 有哪些非同步 RL 框架?它們解決了哪些同步瓶頸?
- 在 AReaL 或其他部分推論(partial rollout)框架中,是否會保留來自先前策略的 KV 快取?
- 專家並行(Expert Parallelism)對 MoE 吞吐量有何影響?
- 在長序列訓練中,應該如何設計計算與通訊的重疊?Megatron 和 FSDP 在並行策略上有何不同?
- 如何啟用確定性執行?什麼是批次不變性(batch invariance)?是什麼原因導致的?是否涉及原子加法(atomic add)?原子加法能解決這個問題嗎?
- AReaL 和 slime 對 RL 推論瓶頸的理解有何不同?
- 在全非同步 RL 訓練中,應該如何看待延遲(staleness)問題?實務上典型的數值是多少?
- 數據在 slime 中是如何流動的?它如何與 Megatron 整合?損失函數是如何計算的?
- 如果你必須在 VeRL、TRL、Unsloth、AReaL 和 slime 中選擇一個,你會選哪個?為什麼?
祝你好運。
記住:面試準備有幫助,但真正的理解比死記硬背的答案能走得更遠。





