Preguntas de entrevista sobre RL para 2026

@sheriyuo
INGLÉShace 2 meses · 06 jun 2026
285K
1.8K
168
16
4.5K

TL;DR

Una lista curada de 35 preguntas de entrevista sobre aprendizaje por refuerzo para 2026, enfocada en el diseño de algoritmos, la integración de LLM y las optimizaciones de infraestructura a gran escala.

Después de ver a varias personas recibir ofertas de doctorado y luego conseguir inmediatamente puestos bien remunerados en la industria durante la contratación de primavera, empecé a preguntarme si ir directamente a la industria podría ser la mejor opción.

Así que revisé prácticamente todas las experiencias de entrevistas relacionadas con RL que pude encontrar en Zhihu, las combiné con discusiones recientes y mis propias observaciones, y destilé todo en 35 de las preguntas más interesantes.

Piénsalo como un punto de referencia para entrevistas de RL.

Versión en chino en Zhihu: https://zhuanlan.zhihu.com/p/2046740446353811230

Algunas notas:

• La lista no separa estrictamente el RL de LLM del RL Agentic. Algunas preguntas tienen respuestas muy diferentes según el contexto.

• Casi todas las preguntas se pueden extender mucho más. No se proporcionan respuestas de referencia. Si usas un LLM, sigue haciendo preguntas de seguimiento y busca extensamente.

• La contratación moderna en RL espera cada vez más una comprensión de pila completa. Si eres investigador de algoritmos, igual te harán preguntas de infraestructura. Lo contrario también es cierto.

• No se incluyen preguntas relacionadas con datos. Esas son casi imposibles de memorizar y dependen en gran medida de tu experiencia real.

• Memorizar preguntas de entrevista no es suficiente. La comprensión profunda importa mucho más.

Algoritmo

  1. ¿Por qué usar Actor-Critic en lugar de un enfoque puramente Critic?
  2. ¿Cuál es la relación entre la divergencia KL, la entropía cruzada y MLE?
  3. ¿Cómo deberían diseñarse las recompensas en diferentes escenarios de RL?
  4. ¿Cómo encajan el muestreo por importancia, el muestreo por rechazo y otros métodos de Monte Carlo en RL?
  5. ¿Cómo se calcula la ventaja en PPO y GRPO? ¿Por qué restar una línea base? ¿Es realmente necesaria la normalización de la desviación estándar?
  6. ¿Cómo realizan la exploración de manera diferente el entrenamiento de RL y el escalado en tiempo de prueba?
  7. ¿Cómo funciona el recorte de PPO? ¿Por qué tomar el objetivo mínimo? ¿Qué sucede sin recorte? ¿En qué se diferencia CISPO?
  8. ¿Por qué GRPO incluye una penalización KL? ¿Cómo se calcula la KL? ¿Por qué métodos como DAPO y GSPO la eliminan?
  9. Durante el entrenamiento de LLM, ¿qué sucede si la pérdida se reduce globalmente accidentalmente varias veces?
  10. ¿Cuál es la función de recompensa en DPO? ¿Puede ocurrir reward hacking? ¿Cómo se puede mitigar?
  11. ¿Qué métodos abordan el desajuste entre entrenamiento e inferencia en modelos MoE, y cómo funcionan?
  12. ¿Cómo se deben seleccionar el tamaño del grupo, la tasa de aprendizaje, las épocas de PPO y la longitud de generación durante el entrenamiento de RL?
  13. En comparación con GRPO, ¿cómo mejoran el proceso de entrenamiento Dr.GRPO, DAPO, GSPO, CISPO, SAPO, DPPO, MaxRL y SimKO? ¿Cuáles son sus limitaciones?
  14. ¿Cómo imponen TRPO, DPPO y AReaL restricciones de región de confianza en los objetivos de RL?
  15. ¿Puede RL expandir fundamentalmente la frontera de capacidades de los LLM?
  16. Basado en trabajos como ProRL, ¿cómo deberíamos pensar en escalar los límites del entrenamiento de RL?
  17. ¿Qué mejoras introduce OPD sobre el RL tradicional y SFT? ¿Cuáles son sus aplicaciones?
  18. ¿En qué etapa del entrenamiento emerge la capacidad de razonamiento en los LLM?
  19. Desde DeepSeek R1 hasta V3.2 y los futuros sistemas V4, ¿qué mejoras relacionadas con RL se han introducido? ¿En qué se diferencia el RL en los modelos MoE?

Infraestructura

  1. Ignorando la descarga a CPU, ¿cuántas copias del modelo existen en memoria durante el entrenamiento de GRPO? ¿Cuánta memoria pueden ahorrar varias optimizaciones?
  2. Inferencia distribuida: optimización de la transferencia de caché KV y estrategias de comunicación multi-GPU.
  3. INT8 versus FP8. ¿Cuáles son las compensaciones? ¿Qué precisiones se prefieren para entrenamiento e inferencia?
  4. ¿Cuál es el problema de cola larga en los rollouts de RL, y cómo se puede abordar?
  5. ¿Qué problemas introduce el batching continuo en el entrenamiento de RL? ¿En qué se diferencian vLLM y SGLang?
  6. ¿Cómo se mide la utilización en vLLM y SGLang? ¿Cómo se evalúa la utilización de la caché KV durante el entrenamiento?
  7. ¿Cómo se implementa la retropropagación en el entrenamiento de RL a gran escala con múltiples nodos?
  8. ¿Qué marcos de RL asíncronos existen, y qué cuellos de botella de sincronización resuelven?
  9. En AReaL u otros marcos de rollout parcial, ¿se conservan las cachés KV de políticas anteriores?
  10. ¿Cómo afecta el Paralelismo de Expertos al rendimiento de MoE?
  11. En el entrenamiento de contexto largo, ¿cómo se debe diseñar la superposición de cómputo y comunicación? ¿En qué se diferencian Megatron y FSDP en las estrategias de paralelismo?
  12. ¿Cómo se habilita la ejecución determinista? ¿Qué es la invariancia de lote? ¿Qué la causa? ¿Está involucrada la suma atómica? ¿Puede la suma atómica resolver el problema?
  13. ¿En qué se diferencian AReaL y slime en su comprensión del cuello de botella del rollout de RL?
  14. ¿Cómo deberíamos pensar en la obsolescencia en el entrenamiento de RL totalmente asíncrono? ¿Cuáles son los valores típicos en la práctica?
  15. ¿Cómo fluyen los datos a través de slime? ¿Cómo se integra con Megatron? ¿Cómo se calcula la pérdida?
  16. Si tuvieras que elegir entre VeRL, TRL, Unsloth, AReaL y slime, ¿cuál usarías y por qué?

Buena suerte.

Y recuerda: la preparación para la entrevista ayuda, pero la comprensión genuina escala mucho más que las respuestas memorizadas.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales