我面试 @Cloudflare AI Engineer 岗位的经历分享

@aditya_ghai07
英语2026年8月09日
112K
1.0K
27
15
1.7K

TL;DR

Aditya Ghai 详细介绍了他在 Cloudflare AI Workers 团队的面试流程,强调了冷邮件策略以及在 AI 推理优化方面深厚技术知识的重要性。

CTC: 44-58 LPA

我主动给 @Cloudflare 的一位工程师发了封邮件,我们简单聊了聊这个岗位和我的背景,几天后我收到了面试邀请,附带一个选择时间的链接。

第一轮面试的面试官是一位拥有 10+ 年经验的 Lead Staff Engineer,面试主要围绕 AI Workers 团队展开。

Cloudflare 的 AI 技术栈挺有意思的:在全球网络的 serverless GPU 上运行模型,让推理更靠近用户,同时也在逐步向更大规模、更前沿的模型迈进。

我之前对 Cloudflare 的这一面不太了解,所以我们花了一些时间讨论团队在做什么,以及他们如何在大规模场景下实现快速、高效的 AI 推理。

然后我们聊到了我自己的经历。

实习期间,我主要做模型部署、Roofline 性能分析以及基于编码器的模型的推理优化,主要是重排序模型和嵌入模型,在内部 GPU 上运行。

这些是仅编码器(encoder-only)模型,大多是 MLP 堆叠,所以常见的 LLM 围绕 attention 的推理栈、KV cache、vLLM 或 SGLang 在这些场景下其实并不太适用。

我们聊得相当深入,涉及:

我是如何做 Roofline 分析和性能剖析的 如何选择 batch size 并衡量其影响 如何扩展推理工作负载 如何在整个推理管线中定位瓶颈 如何优化 p50 和 p99 延迟 TTFT 和整体响应延迟

我们还讨论了在明显的瓶颈被消除之后,我会如何进一步优化。

有一个问题我特别喜欢:

前沿 AI 对你来说意味着什么?

这一轮面试进行得很顺利,我们甚至聊到了后续的面试轮次,会涉及动手写 PyTorch 代码。

最终没能通过。我觉得他们想找的是在 LLM 推理方面有更多实操经验的人。我确实一直在认真学习 LLM 推理和系统相关知识,但当时我在这个领域并没有太多相关的生产环境经验。我大部分动手实践都集中在分布式训练、ML 系统和基础设施上。

不过,这依然是一次非常好的面试体验。这次交流让我对在 Cloudflare 这种规模下提供 AI 模型服务所涉及的问题有了更深入的理解。

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章