Preguntas de entrevista sobre RL para 2026

@sheriyuo
INGLÉShace 2 meses · 06 jun 2026
285K
1.8K
168
16
4.5K

TL;DR

Una lista curada de 35 preguntas de entrevista sobre aprendizaje por refuerzo para 2026, centrada en el diseño de algoritmos, la integración de LLM y las optimizaciones de infraestructura a gran escala.

Después de ver a varias personas recibir ofertas de doctorado y luego conseguir puestos muy bien pagados en la industria durante el reclutamiento de primavera, empecé a preguntarme si ir directamente a la industria podría ser en realidad la mejor opción.

Así que revisé prácticamente todas las experiencias de entrevistas relacionadas con RL que pude encontrar en Zhihu, las combiné con discusiones recientes y mis propias observaciones, y destilé todo en 35 de las preguntas más interesantes.

Piénsalo como un referente de entrevistas de RL.

Versión china en Zhihu: https://zhuanlan.zhihu.com/p/2046740446353811230

Algunas notas:

• La lista no separa estrictamente el RL de LLM del RL Agentic. Algunas preguntas tienen respuestas muy diferentes según el contexto.

• Casi todas las preguntas se pueden ampliar mucho más. No se proporcionan respuestas de referencia. Si usas un LLM, sigue haciendo preguntas de seguimiento y busca exhaustivamente.

• La contratación moderna en RL espera cada vez más una comprensión integral. Si eres investigador de algoritmos, igual te harán preguntas de infraestructura. Lo contrario también es cierto.

• Las preguntas relacionadas con datos no están incluidas. Esas son casi imposibles de memorizar y dependen en gran medida de tu experiencia real.

• Memorizar preguntas de entrevista no es suficiente. La comprensión profunda importa mucho más.

Algoritmo

  1. ¿Por qué usar Actor-Critic en lugar de un enfoque puramente Critic?
  2. ¿Cuál es la relación entre divergencia KL, entropía cruzada y MLE?
  3. ¿Cómo se deben diseñar las recompensas en diferentes escenarios de RL?
  4. ¿Cómo encajan el muestreo por importancia, el muestreo por rechazo y otros métodos de Monte Carlo en RL?
  5. ¿Cómo se calcula la ventaja en PPO y GRPO? ¿Por qué restar una línea base? ¿Es realmente necesaria la normalización de la desviación estándar?
  6. ¿Cómo realizan la exploración de manera diferente el entrenamiento con RL y el escalado en tiempo de prueba?
  7. ¿Cómo funciona el clipping en PPO? ¿Por qué tomar el mínimo de las dos funciones objetivo? ¿Qué sucede sin clipping? ¿En qué se diferencia CISPO?
  8. ¿Por qué GRPO incluye una penalización KL? ¿Cómo se calcula la KL? ¿Por qué métodos como DAPO y GSPO la eliminan?
  9. Durante el entrenamiento de LLMs, ¿qué sucede si accidentalmente se aplica All Reduced múltiples veces a la pérdida?
  10. ¿Cuál es la función de recompensa en DPO? ¿Puede ocurrir reward hacking? ¿Cómo se puede mitigar?
  11. ¿Qué métodos abordan la discrepancia entre entrenamiento e inferencia en modelos MoE, y cómo funcionan?
  12. ¿Cómo se deben seleccionar el tamaño del grupo, la tasa de aprendizaje, las épocas de PPO y la longitud de generación durante el entrenamiento con RL?
  13. En comparación con GRPO, ¿cómo mejoran el proceso de entrenamiento Dr.GRPO, DAPO, GSPO, CISPO, SAPO, DPPO, MaxRL y SimKO? ¿Cuáles son sus limitaciones?
  14. ¿Cómo imponen TRPO, DPPO y AReaL restricciones de región de confianza en los objetivos de RL?
  15. ¿Puede el RL expandir fundamentalmente la frontera de capacidades de los LLMs?
  16. Basándonos en trabajos como ProRL, ¿cómo deberíamos pensar en escalar los límites del entrenamiento con RL?
  17. ¿Qué mejoras introduce OPD sobre el RL tradicional y SFT? ¿Cuáles son sus aplicaciones?
  18. ¿En qué etapa del entrenamiento emerge la capacidad de razonamiento en los LLMs?
  19. Desde DeepSeek R1 hasta V3.2 y futuros sistemas V4, ¿qué mejoras relacionadas con RL se han introducido? ¿En qué se diferencia el RL en modelos MoE?

Infraestructura

  1. Ignorando la descarga a CPU, ¿cuántas copias del modelo existen en memoria durante el entrenamiento GRPO? ¿Cuánta memoria pueden ahorrar varias optimizaciones?
  2. Inferencia distribuida: optimización de transferencia de caché KV y estrategias de comunicación multi-GPU.
  3. INT8 vs FP8. ¿Cuáles son las compensaciones? ¿Qué precisiones se prefieren para entrenamiento e inferencia?
  4. ¿Cuál es el problema de cola larga (long-tail) en los rollouts de RL y cómo se puede abordar?
  5. ¿Qué problemas introduce el batching continuo en el entrenamiento con RL? ¿En qué se diferencian vLLM y SGLang?
  6. ¿Cómo se mide la utilización en vLLM y SGLang? ¿Cómo se evalúa la utilización de la caché KV durante el entrenamiento?
  7. ¿Cómo se implementa la retropropagación en el entrenamiento RL a gran escala con múltiples nodos?
  8. ¿Qué frameworks de RL asíncrono existen y qué cuellos de botella de sincronización resuelven?
  9. En AReaL u otros frameworks con rollouts parciales, ¿se preservan las cachés KV de políticas anteriores?
  10. ¿Cómo afecta el paralelismo de expertos (Expert Parallelism) al rendimiento de MoE?
  11. En entrenamiento con contexto largo, ¿cómo se debe diseñar la superposición de cómputo y comunicación? ¿En qué se diferencian Megatron y FSDP en sus estrategias de paralelismo?
  12. ¿Cómo se habilita la ejecución determinista? ¿Qué es la invariancia de lote (batch invariance)? ¿Qué la causa? ¿Está involucrada la suma atómica? ¿Puede la suma atómica resolver el problema?
  13. ¿En qué se diferencian AReaL y slime en su comprensión del cuello de botella de rollout en RL?
  14. ¿Cómo deberíamos pensar sobre la obsolescencia (staleness) en el entrenamiento completamente asíncrono con RL? ¿Cuáles son los valores típicos en la práctica?
  15. ¿Cómo fluyen los datos a través de slime? ¿Cómo se integra con Megatron? ¿Cómo se calcula la pérdida?
  16. Si tuvieras que elegir entre VeRL, TRL, Unsloth, AReaL y slime, ¿cuál usarías y por qué?

Buena suerte.

Y recuerda: la preparación para la entrevista ayuda, pero la comprensión genuina escala mucho más que las respuestas memorizadas.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales