Dopo aver visto diverse persone ricevere offerte di dottorato e subito dopo ottenere posizioni ben pagate nell'industria durante il reclutamento primaverile, ho iniziato a chiedermi se entrare direttamente nel mondo del lavoro non fosse la scelta migliore.
Così ho esaminato praticamente tutte le esperienze di colloquio relative all'RL che ho potuto trovare su Zhihu, le ho combinate con discussioni recenti e le mie osservazioni personali, e ho distillato tutto in 35 domande tra le più interessanti.
Pensatelo come un benchmark per i colloqui di RL.
Versione CN su Zhihu: https://zhuanlan.zhihu.com/p/2046740446353811230
Alcune note:
• L'elenco non separa rigorosamente l'RL per LLM dall'RL agentico. Alcune domande hanno risposte molto diverse a seconda del contesto.
• Quasi ogni domanda può essere approfondita ulteriormente. Non vengono fornite risposte di riferimento. Se usi un LLM, continua a fare domande di approfondimento e cerca ampiamente.
• L'assunzione moderna in ambito RL richiede sempre più spesso una comprensione full-stack. Se sei un ricercatore di algoritmi, ti faranno comunque domande sull'infrastruttura. Vale anche il contrario.
• Le domande relative ai dati non sono incluse. Sono quasi impossibili da memorizzare e dipendono fortemente dalla tua esperienza reale.
• Memorizzare le domande del colloquio non è sufficiente. La comprensione profonda è molto più importante.
Algoritmo
- Perché usare Actor-Critic invece di un approccio puramente Critic?
- Qual è la relazione tra divergenza KL, entropia incrociata e MLE?
- Come dovrebbero essere progettate le ricompense in diversi scenari di RL?
- Come si inseriscono l'importance sampling, il rejection sampling e altri metodi Monte Carlo nell'RL?
- Come viene calcolato il vantaggio in PPO e GRPO? Perché sottrarre una baseline? La normalizzazione della deviazione standard è davvero necessaria?
- In che modo l'esplorazione durante l'addestramento RL e il test-time scaling differiscono?
- Come funziona il clipping in PPO? Perché prendere il minimo obiettivo? Cosa succede senza clipping? In cosa differisce CISPO?
- Perché GRPO include una penalità KL? Come viene calcolata la KL? Perché metodi come DAPO e GSPo la rimuovono?
- Durante l'addestramento di un LLM, cosa succede se la loss viene accidentalmente "All Reduced" più volte?
- Qual è la funzione di ricompensa in DPO? Può verificarsi reward hacking? Come può essere mitigato?
- Quali metodi affrontano il disallineamento tra addestramento e inferenza nei modelli MoE e come funzionano?
- Come dovrebbero essere selezionati la dimensione del gruppo, il tasso di apprendimento, le epoche PPO e la lunghezza di generazione durante l'addestramento RL?
- Rispetto a GRPO, in che modo Dr.GRPO, DAPO, GSPO, CISPO, SAPO, DPPO, MaxRL e SimKO migliorano il processo di addestramento? Quali sono i loro limiti?
- In che modo TRPO, DPPO e AReaL impongono vincoli di trust-region sugli obiettivi RL?
- L'RL può espandere fondamentalmente la frontiera delle capacità degli LLM?
- Basandoci su lavori come ProRL, come dovremmo pensare allo scaling dei confini dell'addestramento RL?
- Quali miglioramenti introduce OPD rispetto all'RL tradizionale e all'SFT? Quali sono le sue applicazioni?
- In quale fase dell'addestramento emerge la capacità di ragionamento negli LLM?
- Da DeepSeek R1 a V3.2 e ai futuri sistemi V4, quali miglioramenti legati all'RL sono stati introdotti? In che modo l'RL è diverso nei modelli MoE?
Infrastruttura
- Ignorando il CPU offload, quante copie del modello esistono in memoria durante l'addestramento GRPO? Quanta memoria possono risparmiare varie ottimizzazioni?
- Inferenza distribuita: ottimizzazione del trasferimento della cache KV e strategie di comunicazione multi-GPU.
- INT8 versus FP8. Quali sono i compromessi? Quali precisioni sono preferite per addestramento e inferenza?
- Qual è il problema della coda lunga (long-tail) nei rollout RL e come può essere affrontato?
- Quali problemi introduce il continuous batching nell'addestramento RL? In cosa differiscono vLLM e SGLang?
- Come si misura l'utilizzo in vLLM e SGLang? Come si valuta l'utilizzo della cache KV durante l'addestramento?
- Come viene implementata la backpropagation nell'addestramento RL multi-nodo su larga scala?
- Quali framework RL asincroni esistono e quali colli di bottiglia di sincronizzazione risolvono?
- In AReaL o altri framework di rollout parziale, le cache KV delle policy precedenti vengono preservate?
- In che modo Expert Parallelism influisce sul throughput di MoE?
- Nell'addestramento a contesto lungo, come dovrebbe essere progettata la sovrapposizione calcolo-comunicazione? In cosa differiscono Megatron e FSDP nelle strategie di parallelismo?
- Come si abilita l'esecuzione deterministica? Cos'è l'invarianza di batch? Cosa la causa? L'addizione atomica è coinvolta? L'addizione atomica può risolvere il problema?
- In che modo AReaL e slime differiscono nella loro comprensione del collo di bottiglia del rollout RL?
- Come dovremmo pensare all'obsolescenza (staleness) nell'addestramento RL completamente asincrono? Quali sono i valori tipici nella pratica?
- Come fluiscono i dati attraverso slime? Come si integra con Megatron? Come viene calcolata la loss?
- Se dovessi scegliere tra VeRL, TRL, Unsloth, AReaL e slime, quale useresti e perché?
Buona fortuna.
E ricordate: la preparazione per i colloqui aiuta, ma la comprensione genuina scala molto più lontano delle risposte memorizzate.





