CTC:44-58 LPA
我主動寫了一封 email 給 @Cloudflare 的工程師,我們針對職位和我的背景簡單聊了一下,幾天後就收到面試邀請,裡頭附了可以挑選時段的連結。
第一輪的面試官是一位 Lead Staff Engineer,擁有 10+ 年資歷,重點圍繞在 AI Workers 團隊。
Cloudflare 的 AI 技術堆疊相當有意思:他們在全球網路上用無伺服器 GPU 執行模型,讓推論更靠近使用者,同時也逐步往更大規模與前沿等級的模型邁進。
我先前對 Cloudflare 這個部分不太熟悉,所以我們花了一些時間討論團隊正在打造的東西,以及他們如何在大規模下實現快速、高效的 AI 推論。
接著我們聊到了我自己的經驗。
實習期間,我負責模型部署、rooflining 分析,以及基於 encoder 模型的推論最佳化,主要是 reranker 和 embedding 模型,跑在公司內部的 GPU 上。
這些都是純 encoder 模型,大多是 MLP 的堆疊,所以常見的 LLM 圍繞 attention 的推論堆疊、KV cache、vLLM 或 SGLang 在這些情況下其實不太適用。
我們深入聊了:
我如何進行 rooflining 與 profiling 選擇 batch size 並衡量其影響 擴展推論工作負載 找出推論管線中的瓶頸 最佳化 p50 與 p99 延遲 TTFT 與整體回應延遲
我們也聊到,當顯而易見的瓶頸都移除之後,我會如何做更進一步的最佳化。
有一個問題我特別喜歡:
對你來說,前沿 AI 代表什麼?
那一輪進行得很順利,我們甚至還聊到了接下來的幾輪面試,那些會需要動手實作 PyTorch。
最後還是沒能通過。我想他們要的是在 LLM 推論方面有更多實戰經驗的人。我當時雖然一直在積極研究 LLM 推論與系統,但在那個領域還沒有太多相關的生產環境經驗。我大部分的實作經驗都集中在分散式訓練、ML 系統與基礎架構。
不過,這真的是一次很棒的面試體驗。那場討論讓我更深入了解在 Cloudflare 的規模下提供 AI 模型服務會遇到的各種問題。





