Minha experiência de entrevista na @Cloudflare para a vaga de Engenheiro de IA.

@aditya_ghai07
INGLÊS09 de ago. de 2026
112K
1.0K
27
15
1.7K

TL;DR

Aditya Ghai detalha seu processo de entrevista para a equipe de AI Workers da Cloudflare, destacando a importância do envio de e-mails diretos e do conhecimento técnico profundo em otimização de inferência de IA.

CTC: 44-58 LPA

Mandei um e-mail a frio para um engenheiro da @Cloudflare, conversamos um pouco sobre a vaga e meu histórico e, alguns dias depois, recebi um convite para entrevista com um link para escolher um horário.

A primeira rodada foi com um Lead Staff Engineer com mais de 10 anos de experiência e foi focada no time de AI Workers.

A stack de IA da Cloudflare é bem interessante: rodar modelos em GPUs serverless em toda a rede global deles, com inferência mais próxima dos usuários, enquanto avançam cada vez mais para modelos maiores e de escala frontier.

Eu não estava muito familiarizado com esse lado da Cloudflare antes, então passamos um tempo conversando sobre o que o time vem construindo e como eles estão abordando a inferência de IA rápida e eficiente em escala.

Depois falamos sobre a minha própria experiência.

Durante o estágio, trabalhei com deploy de modelos, rooflining e otimização de inferência de modelos baseados em encoder, principalmente rerankers e modelos de embedding, rodando internamente em GPUs.

Esses eram modelos somente de encoder, em sua maioria, pilhas de MLPs, então o LLM usual stack de inferência em torno de attention, KV cache, vLLM ou SGLang não era muito relevante nesses casos.

Fomos bastante a fundo em:

como eu abordo rooflining e profiling escolher tamanhos de batch e medir o impacto deles escalar workloads de inferência encontrar gargalos ao longo do pipeline de inferência otimizar latência p50 e p99 TTFT e latência geral de resposta

Também discutimos como eu abordaria otimizações adicionais depois que os gargalos óbvios fossem removidos.

Uma pergunta que eu gostei especialmente:

O que a IA de fronteira significa para você?

A rodada correu bem e ainda discutimos as próximas etapas, que teriam envolvido PyTorch na prática.

No fim, não passei. Acho que eles estavam procurando alguém com mais experiência prática em inferência de LLM. Eu vinha estudando ativamente inferência e sistemas de LLM, mas na época não tinha muita experiência de produção relevante nessa área. A maior parte do meu trabalho prático tinha sido com treinamento distribuído, sistemas de ML e infra.

Mesmo assim, foi uma experiência de entrevista muito boa. A conversa me ajudou a entender muito melhor os problemas envolvidos em servir modelos de IA na escala da Cloudflare.

Salvar com um clique

Faça leitura profunda de artigos virais com IA no YouMind

Salve a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis em um único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais