CTC: 44-58 LPA
Я надіслав cold email інженеру з @Cloudflare, ми трохи поговорили про роль і мій бекграунд, а за кілька днів я отримав запрошення на співбесіду з посиланням для вибору слота.
Перший раунд був із Lead Staff Engineer із 10+ роками досвіду й був зосереджений на команді AI Workers.
AI-стек Cloudflare досить цікавий: вони запускають моделі на безсерверних GPU по всій своїй глобальній мережі, наближаючи інференс до користувачів, і дедалі більше переходять до масштабніших моделей, аж до фронтирних.
Раніше я не був добре знайомий із цим напрямом роботи Cloudflare, тож ми трохи поговорили про те, що будує команда і як вони підходять до швидкого та ефективного AI-інференсу в масштабі.
Потім ми перейшли до мого власного досвіду.
Під час стажування я займався розгортанням моделей, рофлайнінгом та оптимізацією інференсу енкодерних моделей, здебільшого реранкерів і ембедінг-моделей, що запускалися in-house на GPU.
Це були моделі лише з енкодером, переважно стеки з MLP, тож звичайний LLM інференс-стек на основі attention, KV-кеш, vLLM або SGLang був не надто доречним у цих випадках.
Ми досить глибоко занурилися в:
як я підходжу до рофлайнінгу та профілювання вибір розмірів батчів і вимірювання їхнього впливу масштабування інференс-навантажень пошук вузьких місць у конвеєрі інференсу оптимізація латентності p50 і p99 TTFT і загальна латентність відповіді
Ми також обговорили, як би я підходив до подальшої оптимізації після усунення очевидних вузьких місць.
Одне питання, яке мені особливо сподобалося:
Що для тебе означає фронтирний AI?
Раунд пройшов добре, і ми навіть обговорили наступні раунди, які мали включати практичну роботу з PyTorch.
У підсумку я не пройшов далі. Гадаю, вони шукали когось із більшим практичним досвідом у LLM-інференсі. Я активно вивчав LLM-інференс і системи, але на той момент у мене не було достатнього релевантного продакшн-досвіду в цій сфері. Більшість моєї практичної роботи була пов'язана з розподіленим навчанням, ML-системами та інфраструктурою.
Утім, це був справді хороший досвід співбесіди. Ця розмова дала мені набагато краще розуміння проблем, пов'язаних із сервінгом AI-моделей у масштабі Cloudflare.





