CTC: 44-58 LPA
我主动给 @Cloudflare 的一位工程师发了封邮件,我们简单聊了聊这个岗位和我的背景,几天后我收到了面试邀请,附带一个选择时间的链接。
第一轮面试的面试官是一位拥有 10+ 年经验的 Lead Staff Engineer,面试主要围绕 AI Workers 团队展开。
Cloudflare 的 AI 技术栈挺有意思的:在全球网络的 serverless GPU 上运行模型,让推理更靠近用户,同时也在逐步向更大规模、更前沿的模型迈进。
我之前对 Cloudflare 的这一面不太了解,所以我们花了一些时间讨论团队在做什么,以及他们如何在大规模场景下实现快速、高效的 AI 推理。
然后我们聊到了我自己的经历。
实习期间,我主要做模型部署、Roofline 性能分析以及基于编码器的模型的推理优化,主要是重排序模型和嵌入模型,在内部 GPU 上运行。
这些是仅编码器(encoder-only)模型,大多是 MLP 堆叠,所以常见的 LLM 围绕 attention 的推理栈、KV cache、vLLM 或 SGLang 在这些场景下其实并不太适用。
我们聊得相当深入,涉及:
我是如何做 Roofline 分析和性能剖析的 如何选择 batch size 并衡量其影响 如何扩展推理工作负载 如何在整个推理管线中定位瓶颈 如何优化 p50 和 p99 延迟 TTFT 和整体响应延迟
我们还讨论了在明显的瓶颈被消除之后,我会如何进一步优化。
有一个问题我特别喜欢:
前沿 AI 对你来说意味着什么?
这一轮面试进行得很顺利,我们甚至聊到了后续的面试轮次,会涉及动手写 PyTorch 代码。
最终没能通过。我觉得他们想找的是在 LLM 推理方面有更多实操经验的人。我确实一直在认真学习 LLM 推理和系统相关知识,但当时我在这个领域并没有太多相关的生产环境经验。我大部分动手实践都集中在分布式训练、ML 系统和基础设施上。
不过,这依然是一次非常好的面试体验。这次交流让我对在 Cloudflare 这种规模下提供 AI 模型服务所涉及的问题有了更深入的理解。





