Мій досвід співбесіди в @Cloudflare на посаду AI Engineer.

@aditya_ghai07
АНГЛІЙСЬКА09 серп. 2026 р.
112K
1.0K
27
15
1.7K

Коротко

Адітья Гай детально описує свій процес проходження співбесіди в команду AI Workers компанії Cloudflare, наголошуючи на важливості холодних листів та глибоких технічних знань в оптимізації виведення ШІ (AI inference).

CTC: 44-58 LPA

Я надіслав cold email інженеру з @Cloudflare, ми трохи поговорили про роль і мій бекграунд, а за кілька днів я отримав запрошення на співбесіду з посиланням для вибору слота.

Перший раунд був із Lead Staff Engineer із 10+ роками досвіду й був зосереджений на команді AI Workers.

AI-стек Cloudflare досить цікавий: вони запускають моделі на безсерверних GPU по всій своїй глобальній мережі, наближаючи інференс до користувачів, і дедалі більше переходять до масштабніших моделей, аж до фронтирних.

Раніше я не був добре знайомий із цим напрямом роботи Cloudflare, тож ми трохи поговорили про те, що будує команда і як вони підходять до швидкого та ефективного AI-інференсу в масштабі.

Потім ми перейшли до мого власного досвіду.

Під час стажування я займався розгортанням моделей, рофлайнінгом та оптимізацією інференсу енкодерних моделей, здебільшого реранкерів і ембедінг-моделей, що запускалися in-house на GPU.

Це були моделі лише з енкодером, переважно стеки з MLP, тож звичайний LLM інференс-стек на основі attention, KV-кеш, vLLM або SGLang був не надто доречним у цих випадках.

Ми досить глибоко занурилися в:

як я підходжу до рофлайнінгу та профілювання вибір розмірів батчів і вимірювання їхнього впливу масштабування інференс-навантажень пошук вузьких місць у конвеєрі інференсу оптимізація латентності p50 і p99 TTFT і загальна латентність відповіді

Ми також обговорили, як би я підходив до подальшої оптимізації після усунення очевидних вузьких місць.

Одне питання, яке мені особливо сподобалося:

Що для тебе означає фронтирний AI?

Раунд пройшов добре, і ми навіть обговорили наступні раунди, які мали включати практичну роботу з PyTorch.

У підсумку я не пройшов далі. Гадаю, вони шукали когось із більшим практичним досвідом у LLM-інференсі. Я активно вивчав LLM-інференс і системи, але на той момент у мене не було достатнього релевантного продакшн-досвіду в цій сфері. Більшість моєї практичної роботи була пов'язана з розподіленим навчанням, ML-системами та інфраструктурою.

Утім, це був справді хороший досвід співбесіди. Ця розмова дала мені набагато краще розуміння проблем, пов'язаних із сервінгом AI-моделей у масштабі Cloudflare.

Збереження в один клік

Використовуйте YouMind для AI-глибокого читання віральних статей

Зберігайте джерела, ставте цілеспрямовані запитання, підсумовуйте аргументи та перетворюйте віральні статті на корисні нотатки в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей