Depois de ver várias pessoas receberem ofertas de doutorado e, em seguida, conseguirem cargos altamente remunerados na indústria durante o recrutamento de primavera, comecei a me perguntar se ir direto para a indústria não seria a melhor jogada.
Então, vasculhei praticamente todas as experiências de entrevista relacionadas a RL que consegui encontrar no Zhihu, combinei com discussões recentes e minhas próprias observações, e destilei tudo em 35 das perguntas mais interessantes.
Pense nisso como um benchmark de entrevistas para RL.
Versão em chinês no Zhihu: https://zhuanlan.zhihu.com/p/2046740446353811230
Algumas observações:
• A lista não separa estritamente RL de LLM de RL Agentic. Algumas perguntas têm respostas muito diferentes dependendo do contexto.
• Quase todas as perguntas podem ser estendidas muito mais. Nenhuma resposta de referência é fornecida. Se você usar um LLM, continue fazendo perguntas de acompanhamento e pesquise extensivamente.
• A contratação moderna em RL espera cada vez mais uma compreensão de pilha completa. Se você é um pesquisador de algoritmos, ainda farão perguntas sobre infraestrutura. O inverso também é verdadeiro.
• Perguntas relacionadas a dados não estão incluídas. Elas são quase impossíveis de memorizar e dependem muito da sua experiência real.
• Memorizar perguntas de entrevista não é suficiente. A compreensão profunda é muito mais importante.
Algoritmo
- Por que usar Actor-Critic em vez de uma abordagem puramente Critic?
- Qual é a relação entre divergência KL, entropia cruzada e MLE?
- Como as recompensas devem ser projetadas em diferentes cenários de RL?
- Como a amostragem por importância, a amostragem por rejeição e outros métodos de Monte Carlo se encaixam no RL?
- Como a vantagem é calculada no PPO e no GRPO? Por que subtrair uma linha de base? A normalização do desvio padrão é realmente necessária?
- Como o treinamento RL e a escala em tempo de teste realizam a exploração de forma diferente?
- Como funciona o clipping do PPO? Por que usar o objetivo mínimo? O que acontece sem o clipping? Como o CISPO difere?
- Por que o GRPO inclui uma penalidade KL? Como o KL é calculado? Por que métodos como DAPO e GSPO o removem?
- Durante o treinamento de LLM, o que acontece se a perda for acidentalmente All Reduced várias vezes?
- Qual é a função de recompensa no DPO? O reward hacking pode ocorrer? Como pode ser mitigado?
- Quais métodos abordam a incompatibilidade treino-inferência em modelos MoE e como eles funcionam?
- Como o tamanho do grupo, a taxa de aprendizado, as épocas do PPO e o comprimento da geração devem ser selecionados durante o treinamento RL?
- Comparado ao GRPO, como Dr.GRPO, DAPO, GSPO, CISPO, SAPO, DPPO, MaxRL e SimKO melhoram o processo de treinamento? Quais são suas limitações?
- Como TRPO, DPPO e AReaL impõem restrições de região de confiança nos objetivos de RL?
- O RL pode expandir fundamentalmente a fronteira de capacidade dos LLMs?
- Com base em trabalhos como ProRL, como devemos pensar sobre a expansão dos limites do treinamento RL?
- Quais melhorias o OPD introduz em relação ao RL tradicional e ao SFT? Quais são suas aplicações?
- Em qual estágio do treinamento a capacidade de raciocínio emerge nos LLMs?
- Do DeepSeek R1 ao V3.2 e futuros sistemas V4, quais melhorias relacionadas a RL foram introduzidas? Como o RL é diferente em modelos MoE?
Infraestrutura
- Ignorando o CPU offload, quantas cópias do modelo existem na memória durante o treinamento GRPO? Quanta memória várias otimizações podem economizar?
- Inferência distribuída: otimização da transferência do cache KV e estratégias de comunicação multi-GPU.
- INT8 versus FP8. Quais são os tradeoffs? Quais precisões são preferidas para treinamento e inferência?
- Qual é o problema da cauda longa em rollouts de RL e como ele pode ser resolvido?
- Quais problemas o batching contínuo introduz no treinamento RL? Como vLLM e SGLang diferem?
- Como você mede a utilização no vLLM e no SGLang? Como você avalia a utilização do cache KV durante o treinamento?
- Como a retropropagação é implementada no treinamento RL multi-node em grande escala?
- Quais frameworks de RL assíncrona existem e quais gargalos de sincronização eles resolvem?
- No AReaL ou em outros frameworks de rollout parcial, os caches KV de políticas anteriores são preservados?
- Como o Expert Parallelism afeta a taxa de transferência do MoE?
- No treinamento de contexto longo, como a sobreposição computação-comunicação deve ser projetada? Como Megatron e FSDP diferem nas estratégias de paralelismo?
- Como você habilita a execução determinística? O que é invariância de lote? O que a causa? O add atômico está envolvido? O add atômico pode resolver o problema?
- Como AReaL e slime diferem em sua compreensão do gargalo de rollout de RL?
- Como devemos pensar sobre a defasagem no treinamento RL totalmente assíncrono? Quais são os valores típicos na prática?
- Como os dados fluem pelo slime? Como ele é integrado ao Megatron? Como a perda é calculada?
- Se você tivesse que escolher entre VeRL, TRL, Unsloth, AReaL e slime, qual você usaria e por quê?
Boa sorte.
E lembre-se: a preparação para a entrevista ajuda, mas a compreensão genuína escala muito mais do que respostas memorizadas.





