Perguntas de Entrevista sobre RL em 2026

@sheriyuo
INGLÊShá 2 meses · 06 de jun. de 2026
285K
1.8K
168
16
4.5K

TL;DR

Uma lista curada de 35 perguntas de entrevista sobre aprendizado por reforço para 2026, com foco em design de algoritmos, integração de LLMs e otimizações de infraestrutura em larga escala.

Depois de ver várias pessoas receberem ofertas de doutorado e, em seguida, conseguirem cargos altamente remunerados na indústria durante o recrutamento de primavera, comecei a me perguntar se ir direto para a indústria não seria a melhor jogada.

Então, vasculhei praticamente todas as experiências de entrevista relacionadas a RL que consegui encontrar no Zhihu, combinei com discussões recentes e minhas próprias observações, e destilei tudo em 35 das perguntas mais interessantes.

Pense nisso como um benchmark de entrevistas para RL.

Versão em chinês no Zhihu: https://zhuanlan.zhihu.com/p/2046740446353811230

Algumas observações:

• A lista não separa estritamente RL de LLM de RL Agentic. Algumas perguntas têm respostas muito diferentes dependendo do contexto.

• Quase todas as perguntas podem ser estendidas muito mais. Nenhuma resposta de referência é fornecida. Se você usar um LLM, continue fazendo perguntas de acompanhamento e pesquise extensivamente.

• A contratação moderna em RL espera cada vez mais uma compreensão de pilha completa. Se você é um pesquisador de algoritmos, ainda farão perguntas sobre infraestrutura. O inverso também é verdadeiro.

• Perguntas relacionadas a dados não estão incluídas. Elas são quase impossíveis de memorizar e dependem muito da sua experiência real.

• Memorizar perguntas de entrevista não é suficiente. A compreensão profunda é muito mais importante.

Algoritmo

  1. Por que usar Actor-Critic em vez de uma abordagem puramente Critic?
  2. Qual é a relação entre divergência KL, entropia cruzada e MLE?
  3. Como as recompensas devem ser projetadas em diferentes cenários de RL?
  4. Como a amostragem por importância, a amostragem por rejeição e outros métodos de Monte Carlo se encaixam no RL?
  5. Como a vantagem é calculada no PPO e no GRPO? Por que subtrair uma linha de base? A normalização do desvio padrão é realmente necessária?
  6. Como o treinamento RL e a escala em tempo de teste realizam a exploração de forma diferente?
  7. Como funciona o clipping do PPO? Por que usar o objetivo mínimo? O que acontece sem o clipping? Como o CISPO difere?
  8. Por que o GRPO inclui uma penalidade KL? Como o KL é calculado? Por que métodos como DAPO e GSPO o removem?
  9. Durante o treinamento de LLM, o que acontece se a perda for acidentalmente All Reduced várias vezes?
  10. Qual é a função de recompensa no DPO? O reward hacking pode ocorrer? Como pode ser mitigado?
  11. Quais métodos abordam a incompatibilidade treino-inferência em modelos MoE e como eles funcionam?
  12. Como o tamanho do grupo, a taxa de aprendizado, as épocas do PPO e o comprimento da geração devem ser selecionados durante o treinamento RL?
  13. Comparado ao GRPO, como Dr.GRPO, DAPO, GSPO, CISPO, SAPO, DPPO, MaxRL e SimKO melhoram o processo de treinamento? Quais são suas limitações?
  14. Como TRPO, DPPO e AReaL impõem restrições de região de confiança nos objetivos de RL?
  15. O RL pode expandir fundamentalmente a fronteira de capacidade dos LLMs?
  16. Com base em trabalhos como ProRL, como devemos pensar sobre a expansão dos limites do treinamento RL?
  17. Quais melhorias o OPD introduz em relação ao RL tradicional e ao SFT? Quais são suas aplicações?
  18. Em qual estágio do treinamento a capacidade de raciocínio emerge nos LLMs?
  19. Do DeepSeek R1 ao V3.2 e futuros sistemas V4, quais melhorias relacionadas a RL foram introduzidas? Como o RL é diferente em modelos MoE?

Infraestrutura

  1. Ignorando o CPU offload, quantas cópias do modelo existem na memória durante o treinamento GRPO? Quanta memória várias otimizações podem economizar?
  2. Inferência distribuída: otimização da transferência do cache KV e estratégias de comunicação multi-GPU.
  3. INT8 versus FP8. Quais são os tradeoffs? Quais precisões são preferidas para treinamento e inferência?
  4. Qual é o problema da cauda longa em rollouts de RL e como ele pode ser resolvido?
  5. Quais problemas o batching contínuo introduz no treinamento RL? Como vLLM e SGLang diferem?
  6. Como você mede a utilização no vLLM e no SGLang? Como você avalia a utilização do cache KV durante o treinamento?
  7. Como a retropropagação é implementada no treinamento RL multi-node em grande escala?
  8. Quais frameworks de RL assíncrona existem e quais gargalos de sincronização eles resolvem?
  9. No AReaL ou em outros frameworks de rollout parcial, os caches KV de políticas anteriores são preservados?
  10. Como o Expert Parallelism afeta a taxa de transferência do MoE?
  11. No treinamento de contexto longo, como a sobreposição computação-comunicação deve ser projetada? Como Megatron e FSDP diferem nas estratégias de paralelismo?
  12. Como você habilita a execução determinística? O que é invariância de lote? O que a causa? O add atômico está envolvido? O add atômico pode resolver o problema?
  13. Como AReaL e slime diferem em sua compreensão do gargalo de rollout de RL?
  14. Como devemos pensar sobre a defasagem no treinamento RL totalmente assíncrono? Quais são os valores típicos na prática?
  15. Como os dados fluem pelo slime? Como ele é integrado ao Megatron? Como a perda é calculada?
  16. Se você tivesse que escolher entre VeRL, TRL, Unsloth, AReaL e slime, qual você usaria e por quê?

Boa sorte.

E lembre-se: a preparação para a entrevista ajuda, mas a compreensão genuína escala muito mais do que respostas memorizadas.

Salvar com um clique

Faça leitura profunda de artigos virais com IA no YouMind

Salve a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis em um único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais