Mi experiencia de entrevista con @Cloudflare para el puesto de Ingeniero de IA.

@aditya_ghai07
INGLÉS09 ago 2026
112K
1.0K
27
15
1.7K

TL;DR

Aditya Ghai detalla su proceso de entrevista para el equipo de AI Workers de Cloudflare, destacando la importancia de los correos en frío y el conocimiento técnico profundo en la optimización de inferencia de IA.

CTC: 44-58 LPA

Le envié un correo en frío a un ingeniero de @Cloudflare, hablamos un poco sobre el puesto y mi trayectoria, y unos días después recibí una invitación a una entrevista con un enlace para elegir un horario.

La primera ronda fue con un Lead Staff Engineer con más de 10 años de experiencia y estuvo enfocada en el equipo de AI Workers.

El stack de IA de Cloudflare es bastante interesante: ejecutan modelos en GPUs serverless a través de su red global, con la inferencia más cerca de los usuarios, mientras avanzan cada vez más hacia modelos más grandes y de frontera.

No estaba muy familiarizado con este lado de Cloudflare de antemano, así que pasamos un tiempo hablando de lo que el equipo ha estado construyendo y de cómo están abordando la inferencia de IA rápida y eficiente a escala.

Luego pasamos a mi propia experiencia.

Durante mi pasantía, trabajé en el despliegue de modelos, el rooflining y la optimización de inferencia de modelos basados en encoders, principalmente rerankers y modelos de embedding, que ejecutábamos internamente en GPUs.

Eran modelos de solo encoder, en su mayoría pilas de MLPs, por lo que el stack de inferencia habitual de LLM alrededor de attention, la caché KV, vLLM o SGLang no era realmente relevante en estos casos.

Profundizamos bastante en:

cómo abordo el rooflining y el profiling la elección de tamaños de batch y la medición de su impacto el escalado de cargas de trabajo de inferencia la detección de cuellos de botella en el pipeline de inferencia la optimización de la latencia p50 y p99 el TTFT y la latencia de respuesta general

También hablamos de cómo abordaría una optimización adicional una vez que los cuellos de botella obvios ya se hubieran eliminado.

Una pregunta que me gustó especialmente:

¿Qué significa para ti la IA de frontera?

La ronda salió bien e incluso hablamos de las siguientes rondas, que habrían implicado PyTorch práctico.

Al final no logré pasar. Creo que buscaban a alguien con más experiencia práctica en inferencia de LLM. Había estado estudiando activamente inferencia de LLM y sistemas, pero en ese momento no tenía mucha experiencia relevante en producción en esa área. La mayor parte de mi trabajo práctico había sido en torno al entrenamiento distribuido, sistemas de ML e infraestructura.

Aun así, fue una muy buena experiencia de entrevista. La conversación me dio una comprensión mucho mejor de los problemas que implica servir modelos de IA a la escala de Cloudflare.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales