CTC: 44-58 LPA
Le envié un correo en frío a un ingeniero de @Cloudflare, hablamos un poco sobre el puesto y mi trayectoria, y unos días después recibí una invitación a una entrevista con un enlace para elegir un horario.
La primera ronda fue con un Lead Staff Engineer con más de 10 años de experiencia y estuvo enfocada en el equipo de AI Workers.
El stack de IA de Cloudflare es bastante interesante: ejecutan modelos en GPUs serverless a través de su red global, con la inferencia más cerca de los usuarios, mientras avanzan cada vez más hacia modelos más grandes y de frontera.
No estaba muy familiarizado con este lado de Cloudflare de antemano, así que pasamos un tiempo hablando de lo que el equipo ha estado construyendo y de cómo están abordando la inferencia de IA rápida y eficiente a escala.
Luego pasamos a mi propia experiencia.
Durante mi pasantía, trabajé en el despliegue de modelos, el rooflining y la optimización de inferencia de modelos basados en encoders, principalmente rerankers y modelos de embedding, que ejecutábamos internamente en GPUs.
Eran modelos de solo encoder, en su mayoría pilas de MLPs, por lo que el stack de inferencia habitual de LLM alrededor de attention, la caché KV, vLLM o SGLang no era realmente relevante en estos casos.
Profundizamos bastante en:
cómo abordo el rooflining y el profiling la elección de tamaños de batch y la medición de su impacto el escalado de cargas de trabajo de inferencia la detección de cuellos de botella en el pipeline de inferencia la optimización de la latencia p50 y p99 el TTFT y la latencia de respuesta general
También hablamos de cómo abordaría una optimización adicional una vez que los cuellos de botella obvios ya se hubieran eliminado.
Una pregunta que me gustó especialmente:
¿Qué significa para ti la IA de frontera?
La ronda salió bien e incluso hablamos de las siguientes rondas, que habrían implicado PyTorch práctico.
Al final no logré pasar. Creo que buscaban a alguien con más experiencia práctica en inferencia de LLM. Había estado estudiando activamente inferencia de LLM y sistemas, pero en ese momento no tenía mucha experiencia relevante en producción en esa área. La mayor parte de mi trabajo práctico había sido en torno al entrenamiento distribuido, sistemas de ML e infraestructura.
Aun así, fue una muy buena experiencia de entrevista. La conversación me dio una comprensión mucho mejor de los problemas que implica servir modelos de IA a la escala de Cloudflare.





