Después de ver a varias personas recibir ofertas de doctorado y luego conseguir inmediatamente puestos bien remunerados en la industria durante la contratación de primavera, empecé a preguntarme si ir directamente a la industria podría ser la mejor opción.
Así que revisé prácticamente todas las experiencias de entrevistas relacionadas con RL que pude encontrar en Zhihu, las combiné con discusiones recientes y mis propias observaciones, y destilé todo en 35 de las preguntas más interesantes.
Piénsalo como un punto de referencia para entrevistas de RL.
Versión en chino en Zhihu: https://zhuanlan.zhihu.com/p/2046740446353811230
Algunas notas:
• La lista no separa estrictamente el RL de LLM del RL Agentic. Algunas preguntas tienen respuestas muy diferentes según el contexto.
• Casi todas las preguntas se pueden extender mucho más. No se proporcionan respuestas de referencia. Si usas un LLM, sigue haciendo preguntas de seguimiento y busca extensamente.
• La contratación moderna en RL espera cada vez más una comprensión de pila completa. Si eres investigador de algoritmos, igual te harán preguntas de infraestructura. Lo contrario también es cierto.
• No se incluyen preguntas relacionadas con datos. Esas son casi imposibles de memorizar y dependen en gran medida de tu experiencia real.
• Memorizar preguntas de entrevista no es suficiente. La comprensión profunda importa mucho más.
Algoritmo
- ¿Por qué usar Actor-Critic en lugar de un enfoque puramente Critic?
- ¿Cuál es la relación entre la divergencia KL, la entropía cruzada y MLE?
- ¿Cómo deberían diseñarse las recompensas en diferentes escenarios de RL?
- ¿Cómo encajan el muestreo por importancia, el muestreo por rechazo y otros métodos de Monte Carlo en RL?
- ¿Cómo se calcula la ventaja en PPO y GRPO? ¿Por qué restar una línea base? ¿Es realmente necesaria la normalización de la desviación estándar?
- ¿Cómo realizan la exploración de manera diferente el entrenamiento de RL y el escalado en tiempo de prueba?
- ¿Cómo funciona el recorte de PPO? ¿Por qué tomar el objetivo mínimo? ¿Qué sucede sin recorte? ¿En qué se diferencia CISPO?
- ¿Por qué GRPO incluye una penalización KL? ¿Cómo se calcula la KL? ¿Por qué métodos como DAPO y GSPO la eliminan?
- Durante el entrenamiento de LLM, ¿qué sucede si la pérdida se reduce globalmente accidentalmente varias veces?
- ¿Cuál es la función de recompensa en DPO? ¿Puede ocurrir reward hacking? ¿Cómo se puede mitigar?
- ¿Qué métodos abordan el desajuste entre entrenamiento e inferencia en modelos MoE, y cómo funcionan?
- ¿Cómo se deben seleccionar el tamaño del grupo, la tasa de aprendizaje, las épocas de PPO y la longitud de generación durante el entrenamiento de RL?
- En comparación con GRPO, ¿cómo mejoran el proceso de entrenamiento Dr.GRPO, DAPO, GSPO, CISPO, SAPO, DPPO, MaxRL y SimKO? ¿Cuáles son sus limitaciones?
- ¿Cómo imponen TRPO, DPPO y AReaL restricciones de región de confianza en los objetivos de RL?
- ¿Puede RL expandir fundamentalmente la frontera de capacidades de los LLM?
- Basado en trabajos como ProRL, ¿cómo deberíamos pensar en escalar los límites del entrenamiento de RL?
- ¿Qué mejoras introduce OPD sobre el RL tradicional y SFT? ¿Cuáles son sus aplicaciones?
- ¿En qué etapa del entrenamiento emerge la capacidad de razonamiento en los LLM?
- Desde DeepSeek R1 hasta V3.2 y los futuros sistemas V4, ¿qué mejoras relacionadas con RL se han introducido? ¿En qué se diferencia el RL en los modelos MoE?
Infraestructura
- Ignorando la descarga a CPU, ¿cuántas copias del modelo existen en memoria durante el entrenamiento de GRPO? ¿Cuánta memoria pueden ahorrar varias optimizaciones?
- Inferencia distribuida: optimización de la transferencia de caché KV y estrategias de comunicación multi-GPU.
- INT8 versus FP8. ¿Cuáles son las compensaciones? ¿Qué precisiones se prefieren para entrenamiento e inferencia?
- ¿Cuál es el problema de cola larga en los rollouts de RL, y cómo se puede abordar?
- ¿Qué problemas introduce el batching continuo en el entrenamiento de RL? ¿En qué se diferencian vLLM y SGLang?
- ¿Cómo se mide la utilización en vLLM y SGLang? ¿Cómo se evalúa la utilización de la caché KV durante el entrenamiento?
- ¿Cómo se implementa la retropropagación en el entrenamiento de RL a gran escala con múltiples nodos?
- ¿Qué marcos de RL asíncronos existen, y qué cuellos de botella de sincronización resuelven?
- En AReaL u otros marcos de rollout parcial, ¿se conservan las cachés KV de políticas anteriores?
- ¿Cómo afecta el Paralelismo de Expertos al rendimiento de MoE?
- En el entrenamiento de contexto largo, ¿cómo se debe diseñar la superposición de cómputo y comunicación? ¿En qué se diferencian Megatron y FSDP en las estrategias de paralelismo?
- ¿Cómo se habilita la ejecución determinista? ¿Qué es la invariancia de lote? ¿Qué la causa? ¿Está involucrada la suma atómica? ¿Puede la suma atómica resolver el problema?
- ¿En qué se diferencian AReaL y slime en su comprensión del cuello de botella del rollout de RL?
- ¿Cómo deberíamos pensar en la obsolescencia en el entrenamiento de RL totalmente asíncrono? ¿Cuáles son los valores típicos en la práctica?
- ¿Cómo fluyen los datos a través de slime? ¿Cómo se integra con Megatron? ¿Cómo se calcula la pérdida?
- Si tuvieras que elegir entre VeRL, TRL, Unsloth, AReaL y slime, ¿cuál usarías y por qué?
Buena suerte.
Y recuerda: la preparación para la entrevista ayuda, pero la comprensión genuina escala mucho más que las respuestas memorizadas.





