Mon expérience d'entretien chez @Cloudflare pour un poste d'ingénieur en IA.

@aditya_ghai07
ANGLAIS09 août 2026
112K
1.0K
27
15
1.7K

TL;DR

Aditya Ghai détaille son processus d'entretien pour l'équipe AI Workers de Cloudflare, en soulignant l'importance des e-mails à froid et d'une connaissance technique approfondie de l'optimisation de l'inférence en IA.

CTC : 44-58 LPA

J'ai envoyé un e-mail à froid à un ingénieur de @Cloudflare, nous avons échangé un peu autour du poste et de mon parcours, puis, quelques jours plus tard, j'ai reçu une invitation à un entretien avec un lien pour choisir un créneau.

Le premier tour s'est déroulé avec un Lead Staff Engineer ayant 10+ ans d'expérience et portait sur l'équipe AI Workers.

La stack IA de Cloudflare est assez intéressante : ils exécutent des modèles sur des GPU serverless à travers leur réseau mondial, avec une inférence plus proche des utilisateurs, tout en se tournant de plus en plus vers des modèles plus grands, jusqu'aux modèles frontière.

Je ne connaissais pas très bien cet aspect de Cloudflare auparavant, alors nous avons passé du temps à discuter de ce que l'équipe construisait et de la façon dont elle abordait une inférence IA rapide et efficace à grande échelle.

Ensuite, nous sommes passés à mon expérience personnelle.

Pendant mon stage, j'ai travaillé sur le déploiement de modèles, le rooflining et l'optimisation de l'inférence de modèles basés sur des encodeurs, principalement des rerankers et des modèles d'embedding, exécutés en interne sur des GPU.

Il s'agissait de modèles encoder-only, principalement des empilements de MLP, donc le LLM habituel avec sa stack d'inférence autour de l'attention, le cache KV, vLLM ou SGLang n'était pas vraiment pertinent dans ces cas-là.

Nous sommes allés assez en profondeur dans les points suivants :

comment j'aborde le rooflining et le profilage le choix des tailles de batch et la mesure de leur impact la mise à l'échelle des charges de travail d'inférence la recherche des goulots d'étranglement dans le pipeline d'inférence l'optimisation de la latence p50 et p99 le TTFT et la latence de réponse globale

Nous avons aussi discuté de la façon dont j'aborderais d'autres optimisations une fois les goulots d'étranglement évidents supprimés.

Une question que j'ai particulièrement aimée :

Que signifie l'IA frontière pour toi ?

Le tour s'est bien passé et nous avons même discuté des tours suivants, qui auraient impliqué du PyTorch pratique.

Je n'ai finalement pas été retenu. Je pense qu'ils cherchaient quelqu'un avec plus d'expérience pratique en inférence LLM. J'étudiais activement l'inférence LLM et les systèmes, mais à l'époque, je n'avais pas beaucoup d'expérience de production pertinente dans ce domaine. L'essentiel de mon travail pratique tournait autour de l'entraînement distribué, des systèmes de ML et de l'infra.

Malgré tout, une très bonne expérience d'entretien. La discussion m'a donné une bien meilleure compréhension des problèmes liés au serving de modèles d'IA à l'échelle de Cloudflare.

Enregistrer en un clic

Lire les articles viraux en profondeur avec l’IA de YouMind

Enregistrez la source, posez des questions ciblées, résumez l’argument et transformez un article viral en notes réutilisables dans un seul espace de travail IA.

Découvrir YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux