Mi experiencia de entrevista en @Cloudflare para el puesto de AI Engineer.

@aditya_ghai07
INGLÉS09 ago 2026
112K
1.0K
27
15
1.7K

TL;DR

Aditya Ghai detalla su proceso de entrevista para el equipo de AI Workers de Cloudflare, destacando la importancia del contacto por correo en frío y el conocimiento técnico profundo en la optimización de inferencia de IA.

CTC: 44-58 LPA

Le escribí un correo en frío a un ingeniero de @Cloudflare, tuvimos una pequeña charla sobre el rol y mi trayectoria, y unos días después recibí una invitación para una entrevista con un enlace para elegir un horario.

La primera ronda fue con un Lead Staff Engineer con más de 10 años de experiencia y estuvo enfocada en el equipo de AI Workers.

El stack de IA de Cloudflare es bastante interesante: ejecutan modelos en GPUs serverless a través de su red global, con la inferencia más cerca de los usuarios, mientras se mueven cada vez más hacia modelos más grandes y de escala fronteriza.

No estaba muy familiarizado con esta faceta de Cloudflare, así que pasamos un tiempo hablando de lo que el equipo ha estado construyendo y de cómo abordan la inferencia de IA rápida y eficiente a escala.

Después pasamos a mi propia experiencia.

Durante mis prácticas, trabajé en el despliegue de modelos, rooflining y optimización de inferencia de modelos basados en encoders, principalmente rerankers y modelos de embeddings, que se ejecutaban internamente en GPUs.

Eran modelos de solo encoder, en su mayoría pilas de MLPs, así que el stack de inferencia habitual de LLM alrededor de la atención, la caché KV, vLLM o SGLang no era realmente relevante en estos casos.

Entramos bastante en detalle en:

cómo abordo el rooflining y el profiling cómo elijo los tamaños de batch y mido su impacto cómo escalo las cargas de trabajo de inferencia cómo encuentro los cuellos de botella en el pipeline de inferencia cómo optimizo la latencia p50 y p99 TTFT y la latencia general de respuesta

También hablamos de cómo enfocaría una optimización adicional una vez eliminados los cuellos de botella obvios.

Una pregunta que me gustó especialmente:

¿Qué significa para ti la IA de frontera?

La ronda fue bien e incluso hablamos de las siguientes rondas, que habrían incluido trabajo práctico con PyTorch.

Al final no logré pasar. Creo que buscaban a alguien con más experiencia práctica en inferencia de LLM. Había estado estudiando activamente la inferencia y los sistemas de LLM, pero en ese momento no tenía mucha experiencia de producción relevante en esa área. La mayor parte de mi trabajo práctico había sido en entrenamiento distribuido, sistemas de ML e infraestructura.

Aun así, una experiencia de entrevista realmente buena. La conversación me dio una comprensión mucho mejor de los problemas que implica servir modelos de IA a la escala de Cloudflare.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales