Nachdem ich mehrere Leute gesehen hatte, die PhD-Angebote erhielten und dann sofort während der Frühjahrsrekrutierung hochbezahlte Positionen in der Industrie bekamen, begann ich mich zu fragen, ob der direkte Einstieg in die Industrie nicht vielleicht der bessere Weg wäre.
Also habe ich im Grunde jede RL-bezogene Interviewerfahrung, die ich auf Zhihu finden konnte, durchgearbeitet, sie mit aktuellen Diskussionen und meinen eigenen Beobachtungen kombiniert und alles zu 35 der interessantesten Fragen destilliert.
Betrachte es als einen RL-Interview-Benchmark.
CN-Version auf Zhihu: https://zhuanlan.zhihu.com/p/2046740446353811230
Ein paar Anmerkungen:
• Die Liste trennt nicht strikt zwischen LLM-RL und Agentic-RL. Manche Fragen haben je nach Kontext sehr unterschiedliche Antworten.
• Fast jede Frage kann noch viel weiter vertieft werden. Es werden keine Musterantworten bereitgestellt. Wenn du ein LLM verwendest, stelle weiterführende Fragen und recherchiere umfassend.
• Die moderne RL-Einstellung erwartet zunehmend ein Full-Stack-Verständnis. Wenn du ein Algorithmus-Forscher bist, werden dir trotzdem Infrastrukturfragen gestellt. Das gilt auch umgekehrt.
• Datenbezogene Fragen sind nicht enthalten. Diese kann man sich kaum merken und sie hängen stark von deiner tatsächlichen Erfahrung ab.
• Das Auswendiglernen von Interviewfragen reicht nicht aus. Tiefes Verständnis ist weitaus wichtiger.
Algorithmus
- Warum Actor-Critic anstelle eines reinen Critic-Ansatzes verwenden?
- Wie ist das Verhältnis zwischen KL-Divergenz, Kreuzentropie und MLE?
- Wie sollten Belohnungen in verschiedenen RL-Szenarien gestaltet werden?
- Wie passen Importance Sampling, Rejection Sampling und andere Monte-Carlo-Methoden in RL?
- Wie wird der Advantage in PPO und GRPO berechnet? Warum eine Baseline subtrahieren? Ist die Normalisierung der Standardabweichung wirklich notwendig?
- Wie unterscheiden sich RL-Training und Test-Time-Scaling bei der Exploration?
- Wie funktioniert das Clipping in PPO? Warum das Minimum der Zielfunktion nehmen? Was passiert ohne Clipping? Wie unterscheidet sich CISPO?
- Warum enthält GRPO eine KL-Strafe? Wie wird die KL berechnet? Warum entfernen Methoden wie DAPO und GSPO sie?
- Was passiert während des LLM-Trainings, wenn der Loss versehentlich mehrfach All-Reduced wird?
- Was ist die Belohnungsfunktion in DPO? Kann Reward Hacking auftreten? Wie kann man es abmildern?
- Welche Methoden adressieren den Trainings-Inferenz-Konflikt in MoE-Modellen und wie funktionieren sie?
- Wie sollten Gruppengröße, Lernrate, PPO-Epochen und Generierungslänge während des RL-Trainings ausgewählt werden?
- Wie verbessern Dr.GRPO, DAPO, GSPO, CISPO, SAPO, DPPO, MaxRL und SimKO im Vergleich zu GRPO den Trainingsprozess? Was sind ihre Einschränkungen?
- Wie setzen TRPO, DPPO und AReaL Trust-Region-Constraints auf RL-Zielfunktionen durch?
- Kann RL die Fähigkeitsgrenzen von LLMs grundlegend erweitern?
- Wie sollten wir basierend auf Arbeiten wie ProRL über die Skalierung der Grenzen des RL-Trainings denken?
- Welche Verbesserungen führt OPD gegenüber traditionellem RL und SFT ein? Was sind seine Anwendungen?
- In welcher Trainingsphase entsteht die Reasoning-Fähigkeit in LLMs?
- Von DeepSeek R1 über V3.2 bis hin zu zukünftigen V4-Systemen: Welche RL-bezogenen Verbesserungen wurden eingeführt? Wie unterscheidet sich RL in MoE-Modellen?
Infrastruktur
- Ohne CPU-Offload zu berücksichtigen, wie viele Modellkopien existieren während des GRPO-Trainings im Speicher? Wie viel Speicher können verschiedene Optimierungen einsparen?
- Verteiltes Inferenz: KV-Cache-Transfer-Optimierung und Multi-GPU-Kommunikationsstrategien.
- INT8 versus FP8. Was sind die Kompromisse? Welche Präzisionen werden für Training und Inferenz bevorzugt?
- Was ist das Long-Tail-Problem bei RL-Rollouts und wie kann es angegangen werden?
- Welche Probleme führt Continuous Batching im RL-Training ein? Wie unterscheiden sich vLLM und SGLang?
- Wie misst man die Auslastung in vLLM und SGLang? Wie bewertet man die KV-Cache-Auslastung während des Trainings?
- Wie wird Backpropagation im großen, mehrknotigen RL-Training implementiert?
- Welche asynchronen RL-Frameworks gibt es und welche Synchronisationsengpässe lösen sie?
- Werden in AReaL oder anderen teilweisen Rollout-Frameworks KV-Caches aus vorherigen Policies beibehalten?
- Wie wirkt sich Expert Parallelism auf den MoE-Durchsatz aus?
- Wie sollte im Long-Context-Training die Compute-Communication-Overlap gestaltet werden? Wie unterscheiden sich Megatron und FSDP in ihren Parallelisierungsstrategien?
- Wie aktiviert man deterministische Ausführung? Was ist Batch-Invarianz? Was verursacht sie? Ist Atomic Add involviert? Kann Atomic Add das Problem lösen?
- Wie unterscheiden sich AReaL und slime in ihrem Verständnis des RL-Rollout-Engpasses?
- Wie sollte man über Staleness im vollständig asynchronen RL-Training denken? Was sind typische Werte in der Praxis?
- Wie fließen Daten durch slime? Wie ist es in Megatron integriert? Wie wird der Loss berechnet?
- Wenn du dich zwischen VeRL, TRL, Unsloth, AReaL und slime entscheiden müsstest, welches würdest du verwenden und warum?
Viel Erfolg.
Und denk daran: Die Vorbereitung auf Vorstellungsgespräche hilft, aber echtes Verständnis skaliert viel weiter als auswendig gelernte Antworten.





