CTC: 44-58 LPA
Ho mandato un'email a freddo a un ingegnere di @Cloudflare, abbiamo parlato un po' del ruolo e del mio background, e qualche giorno dopo ho ricevuto un invito al colloquio con un link per scegliere uno slot.
Il primo round è stato con un Lead Staff Engineer con oltre 10 anni di esperienza ed era incentrato sul team AI Workers.
Lo stack AI di Cloudflare è piuttosto interessante: fanno girare modelli su GPU serverless attraverso la loro rete globale, con l'inferenza più vicina agli utenti, e si stanno spostando sempre più verso modelli più grandi e di frontiera.
Non conoscevo bene questo lato di Cloudflare prima, quindi abbiamo passato un po' di tempo a parlare di cosa sta costruendo il team e di come affrontano l'inferenza AI veloce ed efficiente su larga scala.
Poi siamo passati alla mia esperienza.
Durante il mio stage, ho lavorato su deployment di modelli, rooflining e ottimizzazione dell'inferenza di modelli basati su encoder, principalmente reranker e modelli di embedding, eseguiti in-house su GPU.
Questi erano modelli encoder-only, per lo più stack di MLP, quindi il solito stack di inferenza LLM basato sull'attention, KV cache, vLLM o SGLang non era davvero rilevante in questi casi.
Siamo andati abbastanza in profondità su:
come affronto il rooflining e il profiling scegliere la dimensione dei batch e misurarne l'impatto scalare i carichi di lavoro di inferenza trovare i colli di bottiglia lungo la pipeline di inferenza ottimizzare la latenza p50 e p99 TTFT e latenza complessiva di risposta
Abbiamo anche discusso di come avrei affrontato ulteriori ottimizzazioni una volta rimossi i colli di bottiglia più evidenti.
Una domanda che mi è piaciuta particolarmente:
Cosa significa per te l'AI di frontiera?
Il round è andato bene e abbiamo anche discusso dei round successivi, che avrebbero incluso lavoro pratico con PyTorch.
Alla fine non ce l'ho fatta. Penso che cercassero qualcuno con più esperienza pratica nell'inferenza LLM. Avevo studiato attivamente l'inferenza e i sistemi LLM, ma all'epoca non avevo molta esperienza di produzione rilevante in quell'area. Gran parte del mio lavoro pratico riguardava il training distribuito, i sistemi ML e l'infrastruttura.
Comunque, un'esperienza di colloquio davvero positiva. La discussione mi ha dato una comprensione molto migliore dei problemi legati al servire modelli AI alla scala di Cloudflare.





