CTC: 44-58 LPA
Le escribí un correo en frío a un ingeniero de @Cloudflare, tuvimos una pequeña charla sobre el rol y mi trayectoria, y unos días después recibí una invitación para una entrevista con un enlace para elegir un horario.
La primera ronda fue con un Lead Staff Engineer con más de 10 años de experiencia y estuvo enfocada en el equipo de AI Workers.
El stack de IA de Cloudflare es bastante interesante: ejecutan modelos en GPUs serverless a través de su red global, con la inferencia más cerca de los usuarios, mientras se mueven cada vez más hacia modelos más grandes y de escala fronteriza.
No estaba muy familiarizado con esta faceta de Cloudflare, así que pasamos un tiempo hablando de lo que el equipo ha estado construyendo y de cómo abordan la inferencia de IA rápida y eficiente a escala.
Después pasamos a mi propia experiencia.
Durante mis prácticas, trabajé en el despliegue de modelos, rooflining y optimización de inferencia de modelos basados en encoders, principalmente rerankers y modelos de embeddings, que se ejecutaban internamente en GPUs.
Eran modelos de solo encoder, en su mayoría pilas de MLPs, así que el stack de inferencia habitual de LLM alrededor de la atención, la caché KV, vLLM o SGLang no era realmente relevante en estos casos.
Entramos bastante en detalle en:
cómo abordo el rooflining y el profiling cómo elijo los tamaños de batch y mido su impacto cómo escalo las cargas de trabajo de inferencia cómo encuentro los cuellos de botella en el pipeline de inferencia cómo optimizo la latencia p50 y p99 TTFT y la latencia general de respuesta
También hablamos de cómo enfocaría una optimización adicional una vez eliminados los cuellos de botella obvios.
Una pregunta que me gustó especialmente:
¿Qué significa para ti la IA de frontera?
La ronda fue bien e incluso hablamos de las siguientes rondas, que habrían incluido trabajo práctico con PyTorch.
Al final no logré pasar. Creo que buscaban a alguien con más experiencia práctica en inferencia de LLM. Había estado estudiando activamente la inferencia y los sistemas de LLM, pero en ese momento no tenía mucha experiencia de producción relevante en esa área. La mayor parte de mi trabajo práctico había sido en entrenamiento distribuido, sistemas de ML e infraestructura.
Aun así, una experiencia de entrevista realmente buena. La conversación me dio una comprensión mucho mejor de los problemas que implica servir modelos de IA a la escala de Cloudflare.





