看到好几个人拿到博士录取后,紧接着就在春招里拿下高薪工业界职位,我开始琢磨:直接进工业界会不会是更好的选择。
于是我几乎翻遍了知乎上所有我能找到的 RL 相关面试经验,结合最近的讨论和自己的观察,提炼出 35 个最有意思的问题。
你可以把它当作一份 RL 面试基准。
知乎中文版:https://zhuanlan.zhihu.com/p/2046740446353811230
几点说明:
• 这份清单没有严格区分 LLM RL 和 Agentic RL。有些问题在不同设定下答案差异很大。
• 几乎每个问题都可以深入拓展。没有提供参考答案。如果使用 LLM,请不断追问并广泛搜索。
• 现代 RL 招聘越来越需要全栈理解。如果你是算法研究员,别人仍然会问基础设施问题。反之亦然。
• 不包含数据相关的问题。那些几乎没法死记硬背,完全依赖你的实际经验。
• 光背面试题是不够的。深刻理解比死记答案重要得多。
算法
- 为什么使用 Actor-Critic 而不是纯 Critic 方法?
- KL 散度、交叉熵和 MLE 之间有什么关系?
- 在不同 RL 场景下应该如何设计奖励?
- 重要性采样、拒绝采样以及其他蒙特卡洛方法如何融入 RL?
- PPO 和 GRPO 中的优势是如何计算的?为什么要减去基线?标准差归一化真的必要吗?
- RL 训练时的探索和 test-time scaling 的探索有何不同?
- PPO 的 clipping 是如何工作的?为什么取最小目标?没有 clipping 会怎样?CISPO 有什么不同?
- GRPO 为什么要加入 KL 惩罚?KL 是如何计算的?为什么 DAPO 和 GSPO 等方法去掉了它?
- 在 LLM 训练中,如果不小心多次 All Reduce 损失,会发生什么?
- DPO 中的奖励函数是什么?会出现 reward hacking 吗?如何缓解?
- 有哪些方法可以解决 MoE 模型中的训练-推理不匹配问题?它们是如何工作的?
- RL 训练时,组大小、学习率、PPO epoch 和生成长度应该如何选择?
- 与 GRPO 相比,Dr.GRPO、DAPO、GSPO、CISPO、SAPO、DPPO、MaxRL 和 SimKO 如何改进训练过程?它们的局限性是什么?
- TRPO、DPPO 和 AReaL 如何在 RL 目标上施加信任域约束?
- RL 能从根本上扩展 LLM 的能力边界吗?
- 基于 ProRL 等工作,我们应该如何思考 RL 训练边界的扩展?
- OPD 相比传统 RL 和 SFT 有哪些改进?它的应用有哪些?
- LLM 的推理能力是在训练的哪个阶段涌现的?
- 从 DeepSeek R1 到 V3.2 再到未来的 V4 系列,引入了哪些 RL 相关的改进?MoE 模型中的 RL 有何不同?
基础设施
- 忽略 CPU offload,GRPO 训练时内存中存在多少份模型副本?各种优化可以节省多少内存?
- 分布式推理:KV 缓存传输优化和多 GPU 通信策略。
- INT8 与 FP8。各自的权衡是什么?训练和推理中更偏好哪种精度?
- RL rollout 中的长尾问题是什么?如何解决?
- 连续批处理在 RL 训练中引入什么问题?vLLM 和 SGLang 有何不同?
- 如何衡量 vLLM 和 SGLang 的利用率?如何在训练中评估 KV 缓存利用率?
- 大规模多节点 RL 训练中的反向传播是如何实现的?
- 存在哪些异步 RL 框架?它们解决了哪些同步瓶颈?
- 在 AReaL 或其他部分 rollout 框架中,之前策略的 KV 缓存会被保留吗?
- Expert Parallelism 如何影响 MoE 的吞吐量?
- 长上下文训练中,应该怎样设计计算-通信重叠?Megatron 和 FSDP 在并行策略上有什么不同?
- 如何实现确定性执行?什么是 batch invariance?是什么引起的?涉及到 atomic add 吗?atomic add 能解决这个问题吗?
- AReaL 和 slime 对 RL rollout 瓶颈的理解有何不同?
- 在完全异步的 RL 训练中,应该如何思考陈旧性问题?实际中典型值是多少?
- 数据在 slime 中是如何流动的?它是如何与 Megatron 集成的?损失是如何计算的?
- 如果必须在 VeRL、TRL、Unsloth、AReaL 和 slime 中选择,你会用哪一个?为什么?
祝你好运。
记住:面试准备有帮助,但真正的理解比死记硬背走得更远。





