Después de ver a varias personas recibir ofertas de doctorado y luego conseguir puestos muy bien pagados en la industria durante el reclutamiento de primavera, empecé a preguntarme si ir directamente a la industria podría ser en realidad la mejor opción.
Así que revisé prácticamente todas las experiencias de entrevistas relacionadas con RL que pude encontrar en Zhihu, las combiné con discusiones recientes y mis propias observaciones, y destilé todo en 35 de las preguntas más interesantes.
Piénsalo como un referente de entrevistas de RL.
Versión china en Zhihu: https://zhuanlan.zhihu.com/p/2046740446353811230
Algunas notas:
• La lista no separa estrictamente el RL de LLM del RL Agentic. Algunas preguntas tienen respuestas muy diferentes según el contexto.
• Casi todas las preguntas se pueden ampliar mucho más. No se proporcionan respuestas de referencia. Si usas un LLM, sigue haciendo preguntas de seguimiento y busca exhaustivamente.
• La contratación moderna en RL espera cada vez más una comprensión integral. Si eres investigador de algoritmos, igual te harán preguntas de infraestructura. Lo contrario también es cierto.
• Las preguntas relacionadas con datos no están incluidas. Esas son casi imposibles de memorizar y dependen en gran medida de tu experiencia real.
• Memorizar preguntas de entrevista no es suficiente. La comprensión profunda importa mucho más.
Algoritmo
- ¿Por qué usar Actor-Critic en lugar de un enfoque puramente Critic?
- ¿Cuál es la relación entre divergencia KL, entropía cruzada y MLE?
- ¿Cómo se deben diseñar las recompensas en diferentes escenarios de RL?
- ¿Cómo encajan el muestreo por importancia, el muestreo por rechazo y otros métodos de Monte Carlo en RL?
- ¿Cómo se calcula la ventaja en PPO y GRPO? ¿Por qué restar una línea base? ¿Es realmente necesaria la normalización de la desviación estándar?
- ¿Cómo realizan la exploración de manera diferente el entrenamiento con RL y el escalado en tiempo de prueba?
- ¿Cómo funciona el clipping en PPO? ¿Por qué tomar el mínimo de las dos funciones objetivo? ¿Qué sucede sin clipping? ¿En qué se diferencia CISPO?
- ¿Por qué GRPO incluye una penalización KL? ¿Cómo se calcula la KL? ¿Por qué métodos como DAPO y GSPO la eliminan?
- Durante el entrenamiento de LLMs, ¿qué sucede si accidentalmente se aplica All Reduced múltiples veces a la pérdida?
- ¿Cuál es la función de recompensa en DPO? ¿Puede ocurrir reward hacking? ¿Cómo se puede mitigar?
- ¿Qué métodos abordan la discrepancia entre entrenamiento e inferencia en modelos MoE, y cómo funcionan?
- ¿Cómo se deben seleccionar el tamaño del grupo, la tasa de aprendizaje, las épocas de PPO y la longitud de generación durante el entrenamiento con RL?
- En comparación con GRPO, ¿cómo mejoran el proceso de entrenamiento Dr.GRPO, DAPO, GSPO, CISPO, SAPO, DPPO, MaxRL y SimKO? ¿Cuáles son sus limitaciones?
- ¿Cómo imponen TRPO, DPPO y AReaL restricciones de región de confianza en los objetivos de RL?
- ¿Puede el RL expandir fundamentalmente la frontera de capacidades de los LLMs?
- Basándonos en trabajos como ProRL, ¿cómo deberíamos pensar en escalar los límites del entrenamiento con RL?
- ¿Qué mejoras introduce OPD sobre el RL tradicional y SFT? ¿Cuáles son sus aplicaciones?
- ¿En qué etapa del entrenamiento emerge la capacidad de razonamiento en los LLMs?
- Desde DeepSeek R1 hasta V3.2 y futuros sistemas V4, ¿qué mejoras relacionadas con RL se han introducido? ¿En qué se diferencia el RL en modelos MoE?
Infraestructura
- Ignorando la descarga a CPU, ¿cuántas copias del modelo existen en memoria durante el entrenamiento GRPO? ¿Cuánta memoria pueden ahorrar varias optimizaciones?
- Inferencia distribuida: optimización de transferencia de caché KV y estrategias de comunicación multi-GPU.
- INT8 vs FP8. ¿Cuáles son las compensaciones? ¿Qué precisiones se prefieren para entrenamiento e inferencia?
- ¿Cuál es el problema de cola larga (long-tail) en los rollouts de RL y cómo se puede abordar?
- ¿Qué problemas introduce el batching continuo en el entrenamiento con RL? ¿En qué se diferencian vLLM y SGLang?
- ¿Cómo se mide la utilización en vLLM y SGLang? ¿Cómo se evalúa la utilización de la caché KV durante el entrenamiento?
- ¿Cómo se implementa la retropropagación en el entrenamiento RL a gran escala con múltiples nodos?
- ¿Qué frameworks de RL asíncrono existen y qué cuellos de botella de sincronización resuelven?
- En AReaL u otros frameworks con rollouts parciales, ¿se preservan las cachés KV de políticas anteriores?
- ¿Cómo afecta el paralelismo de expertos (Expert Parallelism) al rendimiento de MoE?
- En entrenamiento con contexto largo, ¿cómo se debe diseñar la superposición de cómputo y comunicación? ¿En qué se diferencian Megatron y FSDP en sus estrategias de paralelismo?
- ¿Cómo se habilita la ejecución determinista? ¿Qué es la invariancia de lote (batch invariance)? ¿Qué la causa? ¿Está involucrada la suma atómica? ¿Puede la suma atómica resolver el problema?
- ¿En qué se diferencian AReaL y slime en su comprensión del cuello de botella de rollout en RL?
- ¿Cómo deberíamos pensar sobre la obsolescencia (staleness) en el entrenamiento completamente asíncrono con RL? ¿Cuáles son los valores típicos en la práctica?
- ¿Cómo fluyen los datos a través de slime? ¿Cómo se integra con Megatron? ¿Cómo se calcula la pérdida?
- Si tuvieras que elegir entre VeRL, TRL, Unsloth, AReaL y slime, ¿cuál usarías y por qué?
Buena suerte.
Y recuerda: la preparación para la entrevista ayuda, pero la comprensión genuina escala mucho más que las respuestas memorizadas.





