La mia esperienza di colloquio con @Cloudflare per il ruolo di AI Engineer.

112K
1.0K
27
15
1.7K

TL;DR

Aditya Ghai descrive nel dettaglio il suo processo di selezione per il team AI Workers di Cloudflare, sottolineando l'importanza delle cold email e di una profonda conoscenza tecnica nell'ottimizzazione dell'inferenza AI.

CTC: 44-58 LPA

Ho mandato un'email a freddo a un ingegnere di @Cloudflare, abbiamo parlato un po' del ruolo e del mio background, e qualche giorno dopo ho ricevuto un invito al colloquio con un link per scegliere uno slot.

Il primo round è stato con un Lead Staff Engineer con oltre 10 anni di esperienza ed era incentrato sul team AI Workers.

Lo stack AI di Cloudflare è piuttosto interessante: fanno girare modelli su GPU serverless attraverso la loro rete globale, con l'inferenza più vicina agli utenti, e si stanno spostando sempre più verso modelli più grandi e di frontiera.

Non conoscevo bene questo lato di Cloudflare prima, quindi abbiamo passato un po' di tempo a parlare di cosa sta costruendo il team e di come affrontano l'inferenza AI veloce ed efficiente su larga scala.

Poi siamo passati alla mia esperienza.

Durante il mio stage, ho lavorato su deployment di modelli, rooflining e ottimizzazione dell'inferenza di modelli basati su encoder, principalmente reranker e modelli di embedding, eseguiti in-house su GPU.

Questi erano modelli encoder-only, per lo più stack di MLP, quindi il solito stack di inferenza LLM basato sull'attention, KV cache, vLLM o SGLang non era davvero rilevante in questi casi.

Siamo andati abbastanza in profondità su:

come affronto il rooflining e il profiling scegliere la dimensione dei batch e misurarne l'impatto scalare i carichi di lavoro di inferenza trovare i colli di bottiglia lungo la pipeline di inferenza ottimizzare la latenza p50 e p99 TTFT e latenza complessiva di risposta

Abbiamo anche discusso di come avrei affrontato ulteriori ottimizzazioni una volta rimossi i colli di bottiglia più evidenti.

Una domanda che mi è piaciuta particolarmente:

Cosa significa per te l'AI di frontiera?

Il round è andato bene e abbiamo anche discusso dei round successivi, che avrebbero incluso lavoro pratico con PyTorch.

Alla fine non ce l'ho fatta. Penso che cercassero qualcuno con più esperienza pratica nell'inferenza LLM. Avevo studiato attivamente l'inferenza e i sistemi LLM, ma all'epoca non avevo molta esperienza di produzione rilevante in quell'area. Gran parte del mio lavoro pratico riguardava il training distribuito, i sistemi ML e l'infrastruttura.

Comunque, un'esperienza di colloquio davvero positiva. La discussione mi ha dato una comprensione molto migliore dei problemi legati al servire modelli AI alla scala di Cloudflare.

Salva con un clic

Leggi in profondità gli articoli virali con l’AI di YouMind

Salva la fonte, fai domande mirate, riassumi l’argomentazione e trasforma un articolo virale in note riutilizzabili in un unico spazio di lavoro AI.

Scopri YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali