หลังจากเห็นหลายคนได้รับข้อเสนอเรียนต่อปริญญาเอกแล้วก็ได้งานในอุตสาหกรรมที่เงินเดือนสูงทันทีในช่วงรับสมัครฤดูใบไม้ผลิ ผมเริ่มสงสัยว่าการเข้าสู่อุตสาหกรรมโดยตรงอาจเป็นทางเลือกที่ดีกว่าหรือไม่
ผมเลยรวบรวมประสบการณ์สัมภาษณ์ที่เกี่ยวข้องกับ RL เท่าที่หาได้บน Zhihu รวมกับบทสนทนาล่าสุดและข้อสังเกตของตัวเอง แล้วกลั่นกรองออกมาเป็น 35 คำถามที่น่าสนใจที่สุด
ลองคิดว่านี่คือชุด benchmark สำหรับสัมภาษณ์งาน RL
เวอร์ชันภาษา CN บน Zhihu: https://zhuanlan.zhihu.com/p/2046740446353811230
ข้อสังเกตบางประการ:
• รายการนี้ไม่ได้แยก LLM RL กับ Agentic RL อย่างเคร่งครัด บางคำถามมีคำตอบที่แตกต่างกันมาก ขึ้นอยู่กับบริบท
• เกือบทุกคำถามสามารถขยายความต่อยอดไปได้อีกไกล ไม่มีคำตอบอ้างอิงให้ ถ้าคุณใช้ LLM ให้ลองถามคำถามต่อเนื่องและค้นหาเพิ่มเติม
• ปัจจุบันการรับสมัครงานด้าน RL คาดหวังให้คุณเข้าใจทุกส่วนของระบบ ถ้าคุณเป็นนักวิจัยด้านอัลกอริทึม ก็ยังมีคนถามเกี่ยวกับ infrastructure เช่นกัน และในทางกลับกัน
• คำถามเกี่ยวกับข้อมูล (Data) ไม่ได้รวมไว้ เพราะแทบเป็นไปไม่ได้ที่จะท่องจำและขึ้นอยู่กับประสบการณ์จริงของคุณมากเกินไป
• การท่องจำคำถามสัมภาษณ์ไม่พอ ความเข้าใจอย่างลึกซึ้งสำคัญกว่ามาก
Algorithm
- ทำไมต้องใช้ Actor-Critic แทนที่จะใช้แนวทาง Critic ล้วน ๆ?
- ความสัมพันธ์ระหว่าง KL divergence, cross entropy และ MLE คืออะไร?
- ควรออกแบบรางวัล (reward) ในสถานการณ์ RL ต่าง ๆ อย่างไร?
- Importance sampling, rejection sampling และวิธี Monte Carlo อื่น ๆ ทำงานร่วมกับ RL ได้อย่างไร?
- Advantage ถูกคำนวณอย่างไรใน PPO และ GRPO? ทำไมต้องลบค่า baseline? การ Normalize ด้วยค่าเบี่ยงเบนมาตรฐานจำเป็นจริง ๆ หรือ?
- การฝึก RL และการปรับขนาดในเวลาทดสอบ (test-time scaling) สำรวจหา (exploration) ด้วยวิธีที่แตกต่างกันอย่างไร?
- PPO clipping ทำงานอย่างไร? ทำไมต้องใช้ค่า minimum objective? จะเกิดอะไรขึ้นถ้าไม่มี clipping? CISPO แตกต่างอย่างไร?
- ทำไม GRPO จึงรวม KL penalty? KL ถูกคำนวณอย่างไร? ทำไมวิธีการเช่น DAPO และ GSPO ถึงลบมันออก?
- ระหว่างการฝึก LLM จะเกิดอะไรขึ้นถ้า loss ถูก All Reduced หลายครั้งโดยไม่ได้ตั้งใจ?
- ฟังก์ชันรางวัลใน DPO คืออะไร? Reward hacking เกิดขึ้นได้หรือไม่? จะลดความเสี่ยงได้อย่างไร?
- มีวิธีใดบ้างที่จัดการกับ train-inference mismatch ในโมเดล MoE และทำงานอย่างไร?
- ควรเลือก group size, learning rate, PPO epochs และ generation length อย่างไรระหว่างการฝึก RL?
- เมื่อเทียบกับ GRPO แล้ว Dr.GRPO, DAPO, GSPO, CISPO, SAPO, DPPO, MaxRL และ SimKO ปรับปรุงกระบวนการฝึกอย่างไร? ข้อจำกัดของพวกมันคืออะไร?
- TRPO, DPPO และ AReaL ใช้ trust-region constraints กับวัตถุประสงค์ของ RL อย่างไร?
- RL สามารถขยายขีดความสามารถพื้นฐานของ LLMs ได้จริงหรือ?
- จากผลงานเช่น ProRL เราควรคิดเกี่ยวกับการขยายขอบเขตของการฝึก RL อย่างไร?
- OPD ปรับปรุงอะไรเหนือ RL และ SFT แบบดั้งเดิม? การประยุกต์ใช้ของมันคืออะไร?
- ความสามารถในการใช้เหตุผล (reasoning) เกิดขึ้นใน LLMs ในขั้นตอนใดของการฝึก?
- จาก DeepSeek R1 ถึง V3.2 และระบบ V4 ในอนาคต มีการปรับปรุงที่เกี่ยวข้องกับ RL อะไรบ้าง? RL แตกต่างในโมเดล MoE อย่างไร?
Infrastructure
- ถ้าไม่นับ CPU offload มี model copies กี่ชุดในหน่วยความจำระหว่างการฝึก GRPO? การเพิ่มประสิทธิภาพต่าง ๆ สามารถประหยัดหน่วยความจำได้เท่าไหร่?
- การอนุมานแบบกระจาย: การปรับปรุงการถ่ายโอน KV cache และกลยุทธ์การสื่อสาร GPU หลายตัว
- INT8 กับ FP8: ข้อดีข้อเสียคืออะไร? ความแม่นยำแบบใดเหมาะสำหรับการฝึกและการอนุมาน?
- ปัญหาหางยาว (long-tail) ใน RL rollouts คืออะไร และจะแก้ไขได้อย่างไร?
- Continuous batching ทำให้เกิดปัญหาอะไรในการฝึก RL? vLLM กับ SGLang แตกต่างกันอย่างไร?
- คุณวัด utilization ใน vLLM และ SGLang อย่างไร? คุณประเมินการใช้ KV cache ระหว่างการฝึกอย่างไร?
- Backpropagation ถูกนำไปใช้ในการฝึก RL ขนาดใหญ่แบบหลายโหนดอย่างไร?
- เฟรมเวิร์ก RL แบบอะซิงโครนัสมีอะไรบ้าง และแก้ปัญหาคอขวดของการซิงโครไนซ์อะไร?
- ใน AReaL หรือเฟรมเวิร์กที่ rollout บางส่วน KV caches จากนโยบายก่อนหน้ายังคงไว้หรือไม่?
- Expert Parallelism ส่งผลต่อปริมาณงานของ MoE อย่างไร?
- ในการฝึกแบบ long-context ควรออกแบบการซ้อนทับระหว่างการคำนวณและการสื่อสารอย่างไร? Megatron กับ FSDP แตกต่างกันในกลยุทธ์การขนานอย่างไร?
- จะเปิดใช้งาน deterministic execution ได้อย่างไร? Batch invariance คืออะไร? สาเหตุคืออะไร? Atomic add เกี่ยวข้องหรือไม่? Atomic add แก้ปัญหาได้หรือไม่?
- AReaL กับ slime มีความเข้าใจที่แตกต่างกันเกี่ยวกับคอขวดของ RL rollout อย่างไร?
- เราควรมองความล้าสมัย (staleness) ในการฝึก RL แบบอะซิงโครนัสเต็มรูปแบบอย่างไร? ค่าทั่วไปในทางปฏิบัติคืออะไร?
- ข้อมูลไหลผ่าน slime อย่างไร? มันรวมเข้ากับ Megatron อย่างไร? loss ถูกคำนวณอย่างไร?
- ถ้าต้องเลือกจาก VeRL, TRL, Unsloth, AReaL และ slime คุณจะเลือกอันไหนและเพราะอะไร?
ขอให้โชคดี
และจำไว้ว่า: การเตรียมตัวสัมภาษณ์ช่วยได้ แต่ความเข้าใจที่แท้จริงนั้นไปได้ไกลกว่าคำตอบที่ท่องจำมา





