CTC: 44-58 LPA
เราส่ง cold email ถึงวิศวกรที่ @Cloudflare คุยกันพอสมควรเกี่ยวกับตัวตำแหน่งและประสบการณ์ของเรา แล้วสองสามวันต่อมา ก็ได้รับอีเมลเชิญสัมภาษณ์พร้อมลิงก์ให้เลือกเวลา
รอบแรกเป็นการคุยกับ Lead Staff Engineer ที่มีประสบการณ์ 10+ ปี และโฟกัสไปที่ ทีม AI Workers
AI stack ของ Cloudflare น่าสนใจทีเดียว: รันโมเดลบน serverless GPU ในเครือข่ายทั่วโลกของพวกเขา โดยทำ inference ให้ใกล้กับผู้ใช้มากขึ้น พร้อมกับขยับไปสู่โมเดลที่ใหญ่ขึ้นเรื่อยๆ ในระดับ frontier scale
ก่อนหน้านี้เราไม่ค่อยคุ้นเคยกับด้านนี้ของ Cloudflare เท่าไหร่ เลยใช้เวลาคุยกันสักพักเกี่ยวกับสิ่งที่ทีมกำลังสร้าง และแนวทางของพวกเขาในการทำ AI inference ที่เร็วและมีประสิทธิภาพในสเกลใหญ่
จากนั้นก็เข้าสู่เรื่องประสบการณ์ของเราเอง
ตอนฝึกงาน เราทำงานด้าน model deployment, rooflining และการปรับ optimization เรื่อง inference ของโมเดลแบบ encoder-based เป็นหลัก โดยเฉพาะ reranker และ embedding model ที่รันบน GPU ในระบบของบริษัทเอง
โมเดลพวกนี้เป็น encoder-only model ซึ่งส่วนใหญ่เป็น stack ของ MLPs เรียงซ้อนกัน เลยทำให้ inference stack รอบๆ attention, KV cache, vLLM หรือ SGLang ที่ใช้กันทั่วไปกับ LLM ไม่ค่อยเกี่ยวข้องในกรณีนี้เท่าไหร่
เราลงรายละเอียดกันค่อนข้างลึกในเรื่อง:
วิธีที่เราใช้ในการ rooflining และ profiling การเลือก batch size และการวัดผลกระทบของมัน การ scale workload การทำ inference การหา bottleneck ใน pipeline การทำ inference การปรับ p50 และ p99 latency ค่า TTFT และ response latency โดยรวม
เรายังคุยกันถึงแนวทางที่เราจะใช้ในการ optimize ต่อหลังจากที่กำจัด bottleneck ที่เห็นได้ชัดออกไปแล้ว
มีคำถามหนึ่งที่เราชอบเป็นพิเศษ:
Frontier AI มีความหมายกับคุณอย่างไร?
รอบนั้นผ่านไปด้วยดี และเรายังคุยกันถึงรอบถัดไปด้วยซ้ำ ซึ่งน่าจะต้องมีการลงมือใช้ PyTorch จริงๆ จังๆ
สุดท้ายก็ไม่ได้ผ่านเข้ารอบ เราคิดว่าพวกเขาน่าจะมองหาคนที่มีประสบการณ์ลงมือทำ LLM inference จริงๆ มากกว่า เราเคยศึกษาด้าน LLM inference และ systems มาอย่างจริงจัง แต่ตอนนั้นยังไม่มีประสบการณ์ production ที่เกี่ยวข้องในด้านนั้นมากนัก งานที่ลงมือทำจริงๆ ส่วนใหญ่ของเราเป็นเรื่อง distributed training, ML systems และ infra
ถึงอย่างนั้น ก็ถือเป็นประสบการณ์การสัมภาษณ์ที่ดีมาก การได้คุยกันทำให้เราเข้าใจปัญหาที่เกี่ยวข้องกับการ serve AI models ในสเกลของ Cloudflare ดีขึ้นมาก





