CTC: 44-58 LPA
Mandei um e-mail a frio para um engenheiro da @Cloudflare, conversamos um pouco sobre a vaga e meu histórico e, alguns dias depois, recebi um convite para entrevista com um link para escolher um horário.
A primeira rodada foi com um Lead Staff Engineer com mais de 10 anos de experiência e foi focada no time de AI Workers.
A stack de IA da Cloudflare é bem interessante: rodar modelos em GPUs serverless em toda a rede global deles, com inferência mais próxima dos usuários, enquanto avançam cada vez mais para modelos maiores e de escala frontier.
Eu não estava muito familiarizado com esse lado da Cloudflare antes, então passamos um tempo conversando sobre o que o time vem construindo e como eles estão abordando a inferência de IA rápida e eficiente em escala.
Depois falamos sobre a minha própria experiência.
Durante o estágio, trabalhei com deploy de modelos, rooflining e otimização de inferência de modelos baseados em encoder, principalmente rerankers e modelos de embedding, rodando internamente em GPUs.
Esses eram modelos somente de encoder, em sua maioria, pilhas de MLPs, então o LLM usual stack de inferência em torno de attention, KV cache, vLLM ou SGLang não era muito relevante nesses casos.
Fomos bastante a fundo em:
como eu abordo rooflining e profiling escolher tamanhos de batch e medir o impacto deles escalar workloads de inferência encontrar gargalos ao longo do pipeline de inferência otimizar latência p50 e p99 TTFT e latência geral de resposta
Também discutimos como eu abordaria otimizações adicionais depois que os gargalos óbvios fossem removidos.
Uma pergunta que eu gostei especialmente:
O que a IA de fronteira significa para você?
A rodada correu bem e ainda discutimos as próximas etapas, que teriam envolvido PyTorch na prática.
No fim, não passei. Acho que eles estavam procurando alguém com mais experiência prática em inferência de LLM. Eu vinha estudando ativamente inferência e sistemas de LLM, mas na época não tinha muita experiência de produção relevante nessa área. A maior parte do meu trabalho prático tinha sido com treinamento distribuído, sistemas de ML e infra.
Mesmo assim, foi uma experiência de entrevista muito boa. A conversa me ajudou a entender muito melhor os problemas envolvidos em servir modelos de IA na escala da Cloudflare.





