何人かの人が博士号オファーを受け、すぐに春のリクルーティングで高給の業界ポジションを獲得するのを見てから、直接業界に入る方が良い選択なのか気になり始めました。
そこで、知乎で見つけられる RL 関連の面接体験談を実質的にすべて読み漁り、最近の議論や自分の観察も合わせて、35 の最も興味深い質問に絞り込みました。
これを RL 面接のベンチマークと考えてください。
知乎の中国語版: https://zhuanlan.zhihu.com/p/2046740446353811230
いくつか注意点:
- このリストは LLM RL と Agentic RL を厳密には区別していません。設定によって、答えが大きく異なる質問もあります。
- ほぼすべての質問をさらに深掘りできます。参考回答はありません。LLM を使う場合は、どんどんフォローアップ質問をして、広く検索してください。
- 現代の RL 採用では、フルスタックの理解が求められることが増えています。アルゴリズム研究者でも、インフラに関する質問をされるでしょう。その逆も同様です。
- データ関連の質問は含まれていません。それらは暗記するのがほぼ不可能で、実際の経験に大きく依存します。
- 面接の質問を暗記するだけでは十分ではありません。深い理解が何より重要です。
アルゴリズム
- なぜ純粋な Critic アプローチではなく Actor-Critic を使うのですか?
- KL ダイバージェンス、クロスエントロピー、MLE の関係は何ですか?
- 異なる RL シナリオでは、報酬をどのように設計すべきですか?
- Importance Sampling、Rejection Sampling、その他のモンテカルロ法は RL にどのように適合しますか?
- PPO と GRPO では Advantage はどのように計算されますか?なぜベースラインを引くのですか?標準偏差の正規化は本当に必要ですか?
- RL のトレーニング時とテスト時のスケーリングでは、探索の方法がどのように異なりますか?
- PPO のクリッピングはどのように機能しますか?なぜ最小値を取るのですか?クリッピングがないとどうなりますか?CISPO とはどこが違いますか?
- GRPO が KL ペナルティを含むのはなぜですか?KL はどのように計算されますか?DAPO や GSPO などの手法がそれを削除するのはなぜですか?
- LLM トレーニング中に、誤って損失が複数回 All Reduce されるとどうなりますか?
- DPO の報酬関数は何ですか?Reward Hacking は発生しますか?どのように軽減できますか?
- MoE モデルにおける Train-Inference Mismatch に対処する方法と、その仕組みは何ですか?
- RL トレーニング中に、グループサイズ、学習率、PPO エポック、生成長さはどのように選択すべきですか?
- GRPO と比較して、Dr.GRPO、DAPO、GSPO、CISPO、SAPO、DPPO、MaxRL、SimKO はトレーニングプロセスをどのように改善しますか?それらの限界は何ですか?
- TRPO、DPPO、AReaL は、RL 目的関数に Trust-Region 制約をどのように課しますか?
- RL は LLM の能力の限界を根本的に拡張できますか?
- ProRL などの研究に基づくと、RL トレーニングのスケーリングの限界についてどのように考えるべきですか?
- OPD は従来の RL や SFT に比べてどのような改善をもたらしますか?その応用は何ですか?
- LLM のトレーニングのどの段階で推論能力が出現しますか?
- DeepSeek R1 から V3.2、そして将来の V4 システムに至るまで、どのような RL 関連の改善が導入されましたか?MoE モデルでは RL はどのように異なりますか?
インフラ
- CPU オフロードを無視した場合、GRPO トレーニング中にメモリ上にはいくつのモデルコピーが存在しますか?さまざまな最適化でどれだけのメモリを節約できますか?
- 分散推論: KV キャッシュ転送の最適化とマルチ GPU 通信戦略。
- INT8 対 FP8。トレードオフは何ですか?トレーニングと推論にはどの精度が好まれますか?
- RL ロールアウトにおける Long-Tail 問題とは何ですか?どのように対処できますか?
- Continuous Batching は RL トレーニングにどのような問題を引き起こしますか?vLLM と SGLang はどのように異なりますか?
- vLLM と SGLang で利用率をどのように測定しますか?トレーニング中の KV キャッシュ利用率はどのように評価しますか?
- 大規模マルチノード RL トレーニングでは、バックプロパゲーションはどのように実装されますか?
- どのような非同期 RL フレームワークが存在し、それらはどのような同期ボトルネックを解決しますか?
- AReaL やその他の部分ロールアウトフレームワークでは、以前のポリシーからの KV キャッシュは保持されますか?
- Expert Parallelism は MoE のスループットにどのような影響を与えますか?
- 長コンテキストトレーニングでは、計算と通信のオーバーラップをどのように設計すべきですか?並列化戦略において Megatron と FSDP はどのように異なりますか?
- 決定論的な実行を有効にするにはどうすればよいですか?Batch Invariance とは何ですか?その原因は何ですか?Atomic Add は関係していますか?Atomic Add で問題は解決できますか?
- AReaL と slime は、RL ロールアウトのボトルネックについてどのように理解が異なりますか?
- 完全非同期 RL トレーニングにおける Staleness について、どのように考えるべきですか?実際に一般的な値はどの程度ですか?
- slime ではデータはどのように流れますか?Megatron とどのように統合されますか?損失はどのように計算されますか?
- VeRL、TRL、Unsloth、AReaL、slime の中から選ぶとしたら、どれを使いますか?また、その理由は何ですか?
Good luck.
そして、覚えておいてください: 面接対策は役立ちますが、真の理解は暗記した答えよりもはるかにスケールします。





