Depois de ver várias pessoas receberem ofertas de doutorado e, em seguida, conseguirem imediatamente cargos bem remunerados na indústria durante o recrutamento de primavera, comecei a me perguntar se ir direto para a indústria não seria, na verdade, a melhor jogada.
Então, vasculhei praticamente todas as experiências de entrevistas relacionadas a RL que encontrei no Zhihu, combinei com discussões recentes e minhas próprias observações, e destilei tudo em 35 das perguntas mais interessantes.
Pense nisso como um benchmark de entrevistas de RL.
Versão em chinês no Zhihu: https://zhuanlan.zhihu.com/p/2046740446353811230
Algumas observações:
• A lista não separa estritamente RL de LLM de RL Agentic. Algumas perguntas têm respostas muito diferentes dependendo do contexto.
• Quase todas as perguntas podem ser estendidas muito além. Nenhuma resposta de referência é fornecida. Se você usar um LLM, continue fazendo perguntas de acompanhamento e pesquise extensivamente.
• A contratação moderna em RL espera cada vez mais uma compreensão full-stack. Se você é um pesquisador de algoritmos, ainda farão perguntas sobre infraestrutura. O contrário também é verdadeiro.
• Perguntas relacionadas a dados não estão incluídas. Elas são quase impossíveis de memorizar e dependem muito da sua experiência real.
• Memorizar perguntas de entrevista não é suficiente. A compreensão profunda é muito mais importante.
Algoritmo
- Por que usar Actor-Critic em vez de uma abordagem puramente Critic?
- Qual é a relação entre divergência KL, entropia cruzada e MLE?
- Como as recompensas devem ser projetadas em diferentes cenários de RL?
- Como a amostragem por importância, a amostragem por rejeição e outros métodos de Monte Carlo se encaixam no RL?
- Como a vantagem é calculada no PPO e no GRPO? Por que subtrair uma linha de base? A normalização do desvio padrão é realmente necessária?
- Como o treinamento de RL e a exploração em escala de teste realizam a exploração de forma diferente?
- Como funciona o clipping do PPO? Por que usar o objetivo mínimo? O que acontece sem clipping? Como o CISPO difere?
- Por que o GRPO inclui uma penalidade KL? Como o KL é calculado? Por que métodos como DAPO e GSPO o removem?
- Durante o treinamento de LLM, o que acontece se a perda for acidentalmente "All Reduced" várias vezes?
- Qual é a função de recompensa no DPO? Pode ocorrer "reward hacking"? Como pode ser mitigado?
- Quais métodos abordam a incompatibilidade treino-inferência em modelos MoE e como eles funcionam?
- Como selecionar o tamanho do grupo, a taxa de aprendizado, as épocas do PPO e o comprimento de geração durante o treinamento de RL?
- Comparados ao GRPO, como Dr.GRPO, DAPO, GSPO, CISPO, SAPO, DPPO, MaxRL e SimKO melhoram o processo de treinamento? Quais são suas limitações?
- Como TRPO, DPPO e AReaL impõem restrições de região de confiança nos objetivos de RL?
- O RL pode fundamentalmente expandir a fronteira de capacidades dos LLMs?
- Com base em trabalhos como ProRL, como devemos pensar sobre o escalonamento dos limites do treinamento de RL?
- Quais melhorias o OPD introduz em relação ao RL tradicional e ao SFT? Quais são suas aplicações?
- Em qual estágio do treinamento a capacidade de raciocínio emerge nos LLMs?
- Do DeepSeek R1 ao V3.2 e futuros sistemas V4, quais melhorias relacionadas a RL foram introduzidas? Como o RL é diferente em modelos MoE?
Infraestrutura
- Ignorando o CPU offload, quantas cópias do modelo existem na memória durante o treinamento GRPO? Quanta memória várias otimizações podem economizar?
- Inferência distribuída: otimização da transferência do cache KV e estratégias de comunicação multi-GPU.
- INT8 versus FP8. Quais são os trade-offs? Quais precisões são preferidas para treinamento e inferência?
- Qual é o problema de cauda longa (long-tail) nos rollouts de RL e como pode ser resolvido?
- Quais problemas o "continuous batching" introduz no treinamento de RL? Como o vLLM e o SGLang diferem?
- Como você mede a utilização no vLLM e no SGLang? Como você avalia a utilização do cache KV durante o treinamento?
- Como a retropropagação é implementada no treinamento de RL em larga escala com múltiplos nós?
- Quais frameworks de RL assíncrono existem e quais gargalos de sincronização eles resolvem?
- No AReaL ou em outros frameworks de rollout parcial, os caches KV de políticas anteriores são preservados?
- Como o "Expert Parallelism" afeta a taxa de transferência do MoE?
- No treinamento de contexto longo, como a sobreposição computação-comunicação deve ser projetada? Como o Megatron e o FSDP diferem nas estratégias de paralelismo?
- Como você habilita a execução determinística? O que é invariância de lote? O que a causa? O "atomic add" está envolvido? O "atomic add" pode resolver o problema?
- Como o AReaL e o slime diferem em sua compreensão do gargalo de rollout de RL?
- Como devemos pensar sobre a obsolescência (staleness) no treinamento de RL totalmente assíncrono? Quais são os valores típicos na prática?
- Como os dados fluem através do slime? Como ele é integrado ao Megatron? Como a perda é calculada?
- Se você tivesse que escolher entre VeRL, TRL, Unsloth, AReaL e slime, qual você usaria e por quê?
Boa sorte.
E lembre-se: a preparação para a entrevista ajuda, mas a compreensão genuína escala muito além das respostas memorizadas.





