몇몇 사람들이 박사 과정 합격 통지를 받고 바로 봄 채용 시즌에 업계 고연봉 자리를 잡는 모습을 보면서, 곧바로 업계로 진출하는 것이 더 나은 선택일지 궁금해지기 시작했습니다.
그래서 저는 Zhihu 에서 찾을 수 있는 모든 RL 관련 면접 후기를 거의 다 살펴보고, 최근 논의와 제 관찰을 결합하여 가장 흥미로운 35 개의 질문으로 정리했습니다.
이것을 RL 면접 벤치마크라고 생각하시면 됩니다.
Zhihu 의 중국어 버전: https://zhuanlan.zhihu.com/p/2046740446353811230
몇 가지 참고 사항:
- 이 목록은 LLM RL 과 Agentic RL 을 엄격히 구분하지 않습니다. 일부 질문은 설정에 따라 답변이 크게 달라집니다.
- 거의 모든 질문은 더 확장될 수 있습니다. 참고 답변은 제공되지 않습니다. LLM 을 사용하는 경우, 계속해서 후속 질문을 하고 광범위하게 검색하세요.
- 현대 RL 채용에서는 점점 풀스택 이해를 요구합니다. 알고리즘 연구자라도 인프라 관련 질문을 받게 될 것입니다. 그 반대도 마찬가지입니다.
- 데이터 관련 질문은 포함되지 않았습니다. 이러한 질문은 거의 암기할 수 없으며 실제 경험에 크게 의존합니다.
- 면접 질문을 암기하는 것만으로는 충분하지 않습니다. 깊은 이해가 훨씬 중요합니다.
Algorithm
- 순수 Critic 접근법 대신 Actor-Critic 을 사용하는 이유는 무엇인가요?
- KL 발산, 크로스 엔트로피, MLE 사이의 관계는 무엇인가요?
- 다양한 RL 시나리오에서 보상은 어떻게 설계되어야 하나요?
- 중요도 샘플링, 리젝션 샘플링 및 기타 몬테카를로 방법은 RL 에 어떻게 적용되나요?
- PPO 와 GRPO 에서 어드밴티지는 어떻게 계산되나요? 왜 기준선을 빼나요? 표준편차 정규화가 정말로 필요한가요?
- RL 훈련과 테스트 시간 스케일링은 탐색을 어떻게 다르게 수행하나요?
- PPO 클리핑은 어떻게 작동하나요? 왜 최소 목적 함수를 취하나요? 클리핑 없이 어떻게 되나요? CISPO 는 어떻게 다른가요?
- GRPO 에 KL 패널티가 포함된 이유는 무엇인가요? KL 은 어떻게 계산되나요? DAPO 및 GSPO 와 같은 방법이 이를 제거하는 이유는 무엇인가요?
- LLM 훈련 중 실수로 loss 가 여러 번 All Reduced 되면 어떻게 되나요?
- DPO 의 보상 함수는 무엇인가요? 보상 해킹이 발생할 수 있나요? 어떻게 완화할 수 있나요?
- MoE 모델에서 훈련-추론 불일치를 해결하는 방법은 무엇이며, 어떻게 작동하나요?
- RL 훈련 중 그룹 크기, 학습률, PPO 에포크, 생성 길이는 어떻게 선택해야 하나요?
- GRPO 와 비교하여 Dr.GRPO, DAPO, GSPO, CISPO, SAPO, DPPO, MaxRL, SimKO 는 훈련 과정을 어떻게 개선하나요? 그들의 한계는 무엇인가요?
- TRPO, DPPO, AReaL 은 RL 목적 함수에 신뢰 영역 제약을 어떻게 적용하나요?
- RL 이 LLM 의 능력 한계를 근본적으로 확장할 수 있나요?
- ProRL 과 같은 연구를 바탕으로 RL 훈련의 경계 확장을 어떻게 생각해야 하나요?
- OPD 는 전통적인 RL 및 SFT 에 비해 어떤 개선을 제공하나요? 그 응용 분야는 무엇인가요?
- LLM 에서 추론 능력은 훈련의 어떤 단계에서 나타나나요?
- DeepSeek R1 에서 V3.2 및 미래 V4 시스템까지 어떤 RL 관련 개선이 도입되었나요? MoE 모델에서 RL 은 어떻게 다른가요?
Infrastructure
- CPU 오프로드를 무시할 때, GRPO 훈련 중 메모리에 몇 개의 모델 복사본이 존재하나요? 다양한 최적화를 통해 얼마나 많은 메모리를 절약할 수 있나요?
- 분산 추론: KV 캐시 전송 최적화 및 다중 GPU 통신 전략.
- INT8 대 FP8. 트레이드오프는 무엇인가요? 훈련 및 추론에 어떤 정밀도가 선호되나요?
- RL 롤아웃의 롱테일 문제는 무엇이며, 어떻게 해결할 수 있나요?
- 연속 배칭이 RL 훈련에 어떤 문제를 야기하나요? vLLM 과 SGLang 은 어떻게 다른가요?
- vLLM 과 SGLang 에서 활용률을 어떻게 측정하나요? 훈련 중 KV 캐시 활용률은 어떻게 평가하나요?
- 대규모 다중 노드 RL 훈련에서 역전파는 어떻게 구현되나요?
- 어떤 비동기 RL 프레임워크가 있으며, 어떤 동기화 병목 현상을 해결하나요?
- AReaL 또는 다른 부분 롤아웃 프레임워크에서 이전 정책의 KV 캐시가 보존되나요?
- Expert Parallelism 은 MoE 처리량에 어떤 영향을 미치나요?
- 긴 컨텍스트 훈련에서 계산-통신 중첩은 어떻게 설계되어야 하나요? Megatron 과 FSDP 는 병렬화 전략에서 어떻게 다른가요?
- 결정적 실행을 어떻게 활성화하나요? 배치 불변성이란 무엇인가요? 무엇이 원인인가요? atomic add 가 관련되어 있나요? atomic add 로 문제를 해결할 수 있나요?
- AReaL 과 slime 은 RL 롤아웃 병목 현상에 대한 이해에서 어떻게 다른가요?
- 완전 비동기 RL 훈련에서 지연(staleness)을 어떻게 생각해야 하나요? 실제로 일반적인 값은 무엇인가요?
- slime 을 통해 데이터는 어떻게 흐르나요? Megatron 과 어떻게 통합되나요? loss 는 어떻게 계산되나요?
- VeRL, TRL, Unsloth, AReaL, slime 중에서 선택해야 한다면 어떤 것을 사용하시겠습니까? 그리고 그 이유는 무엇인가요?
행운을 빕니다.
그리고 기억하세요: 면접 준비는 도움이 되지만, 진정한 이해가 암기된 답변보다 훨씬 더 확장됩니다.





