CTC: 44-58 LPA
Mandei um e-mail a frio para um engenheiro da @Cloudflare, conversamos um pouco sobre a vaga e meu histórico, e alguns dias depois recebi um convite para entrevista com um link para escolher um horário.
A primeira etapa foi com um Lead Staff Engineer com mais de 10 anos de experiência, focada no time AI Workers.
O stack de IA da Cloudflare é bem interessante: rodar modelos em GPUs serverless pela rede global deles, com inferência mais perto dos usuários, enquanto avançam cada vez mais para modelos maiores e de escala frontier.
Eu não conhecia muito esse lado da Cloudflare antes, então passamos um tempo conversando sobre o que o time vem construindo e como eles estão abordando inferência de IA rápida e eficiente em escala.
Depois, entramos na minha própria experiência.
Durante meu estágio, trabalhei com deploy de modelos, rooflining e otimização de inferência de modelos baseados em encoder, principalmente rerankers e modelos de embedding, rodando internamente em GPUs.
Eram modelos só de encoder, em sua maioria pilhas de MLPs, então o stack usual de LLM de inferência em torno de attention, KV cache, vLLM ou SGLang não era muito relevante nesses casos.
Fomos bem a fundo em:
como eu abordo rooflining e profiling escolher tamanhos de batch e medir seu impacto escalar cargas de trabalho de inferência encontrar gargalos no pipeline de inferência otimizar a latência de p50 e p99 TTFT e latência geral de resposta
Também discutimos como eu abordaria otimizações adicionais depois que os gargalos óbvios fossem removidos.
Uma pergunta de que gostei especialmente:
O que a IA frontier significa para você?
A etapa correu bem e ainda discutimos as próximas etapas, que teriam envolvido PyTorch na prática.
Acabei não passando. Acho que eles procuravam alguém com mais experiência prática em inferência de LLM. Eu vinha estudando ativamente inferência e sistemas de LLM, mas na época não tinha muita experiência relevante de produção nessa área. A maior parte do meu trabalho prático tinha sido com treinamento distribuído, sistemas de ML e infraestrutura.
Ainda assim, uma experiência de entrevista muito boa. A conversa me deu uma compreensão muito melhor dos problemas envolvidos em servir modelos de IA na escala da Cloudflare.





