CTC: 44-58 LPA
Я написал холодное письмо инженеру из @Cloudflare, и мы немного обсудили роль и мой бэкграунд, а через несколько дней я получил приглашение на собеседование со ссылкой для выбора слота.
Первый раунд я проходил с Lead Staff Engineer с опытом более 10 лет, и он был посвящён команде AI Workers.
AI-стек Cloudflare довольно интересный: они запускают модели на serverless GPU по всей своей глобальной сети, инференс находится ближе к пользователям, и при этом они всё больше переходят к более крупным моделям уровня frontier.
Раньше я не был хорошо знаком с этой стороной Cloudflare, поэтому мы некоторое время обсуждали, над чем работает команда и как они подходят к быстрому и эффективному AI-инференсу в масштабе.
Затем мы перешли к моему опыту.
Во время стажировки я занимался деплоем моделей, roofline-анализом и оптимизацией инференса энкодерных моделей — в основном реранкеров и эмбеддинг-моделей, — которые работали на собственных GPU.
Это были модели только с энкодером, в основном стеки из MLP, поэтому обычный LLM инференс-стек на основе attention, KV-кэш, vLLM или SGLang был не особо релевантен в этих случаях.
Мы довольно глубоко погрузились в:
мой подход к roofline-анализу и профилированию выбор размеров батчей и измерение их влияния масштабирование инференс-нагрузок поиск узких мест в пайплайне инференса оптимизацию задержек p50 и p99 TTFT и общую задержку ответа
Мы также обсудили, как бы я подошёл к дальнейшей оптимизации после устранения очевидных узких мест.
Один вопрос, который мне особенно понравился:
Что для тебя значит frontier AI?
Раунд прошёл хорошо, и мы даже обсудили следующие этапы, которые включали бы практическую работу с PyTorch.
В итоге я не прошёл. Думаю, они искали кого-то с большим практическим опытом в LLM-инференсе. Я активно изучал LLM-инференс и системы, но на тот момент у меня было мало релевантного продакшен-опыта в этой области. Большая часть моей практической работы была связана с распределённым обучением, ML-системами и инфраструктурой.
Тем не менее, это был действительно хороший опыт собеседования. Обсуждение дало мне гораздо лучшее понимание проблем, связанных с сервингом AI-моделей в масштабе Cloudflare.





