Minha experiência de entrevista na @Cloudflare para a vaga de Engenheiro de IA.

112K
1.0K
27
15
1.7K

TL;DR

Aditya Ghai detalha seu processo de entrevista para a equipe de AI Workers da Cloudflare, destacando a importância do contato direto por e-mail e do conhecimento técnico aprofundado em otimização de inferência de IA.

CTC: 44-58 LPA

Mandei um e-mail a frio para um engenheiro da @Cloudflare, conversamos um pouco sobre a vaga e meu histórico, e alguns dias depois recebi um convite para entrevista com um link para escolher um horário.

A primeira etapa foi com um Lead Staff Engineer com mais de 10 anos de experiência, focada no time AI Workers.

O stack de IA da Cloudflare é bem interessante: rodar modelos em GPUs serverless pela rede global deles, com inferência mais perto dos usuários, enquanto avançam cada vez mais para modelos maiores e de escala frontier.

Eu não conhecia muito esse lado da Cloudflare antes, então passamos um tempo conversando sobre o que o time vem construindo e como eles estão abordando inferência de IA rápida e eficiente em escala.

Depois, entramos na minha própria experiência.

Durante meu estágio, trabalhei com deploy de modelos, rooflining e otimização de inferência de modelos baseados em encoder, principalmente rerankers e modelos de embedding, rodando internamente em GPUs.

Eram modelos só de encoder, em sua maioria pilhas de MLPs, então o stack usual de LLM de inferência em torno de attention, KV cache, vLLM ou SGLang não era muito relevante nesses casos.

Fomos bem a fundo em:

como eu abordo rooflining e profiling escolher tamanhos de batch e medir seu impacto escalar cargas de trabalho de inferência encontrar gargalos no pipeline de inferência otimizar a latência de p50 e p99 TTFT e latência geral de resposta

Também discutimos como eu abordaria otimizações adicionais depois que os gargalos óbvios fossem removidos.

Uma pergunta de que gostei especialmente:

O que a IA frontier significa para você?

A etapa correu bem e ainda discutimos as próximas etapas, que teriam envolvido PyTorch na prática.

Acabei não passando. Acho que eles procuravam alguém com mais experiência prática em inferência de LLM. Eu vinha estudando ativamente inferência e sistemas de LLM, mas na época não tinha muita experiência relevante de produção nessa área. A maior parte do meu trabalho prático tinha sido com treinamento distribuído, sistemas de ML e infraestrutura.

Ainda assim, uma experiência de entrevista muito boa. A conversa me deu uma compreensão muito melhor dos problemas envolvidos em servir modelos de IA na escala da Cloudflare.

Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais