AI Engineer भूमिका के लिए @Cloudflare के साथ मेरा इंटरव्यू अनुभव।

@aditya_ghai07
अंग्रेज़ी09 अग॰ 2026
112K
1.0K
27
15
1.7K

TL;DR

Aditya Ghai ने Cloudflare की AI Workers टीम के लिए अपनी इंटरव्यू प्रक्रिया का विवरण दिया है, जिसमें कोल्ड ईमेलिंग के महत्व और AI इन्फरेंस ऑप्टिमाइज़ेशन में गहरे तकनीकी ज्ञान पर प्रकाश डाला गया है।

CTC: 44-58 LPA

मैंने @Cloudflare के एक इंजीनियर को cold email किया, हमने रोल और मेरे बैकग्राउंड के बारे में थोड़ी चर्चा की, और कुछ दिनों बाद मुझे इंटरव्यू का निमंत्रण मिला, जिसमें स्लॉट चुनने का लिंक था।

पहला राउंड 10+ साल के अनुभव वाले Lead Staff Engineer के साथ था, और यह AI Workers team पर केंद्रित था।

Cloudflare का AI स्टैक काफी दिलचस्प है: अपने ग्लोबल नेटवर्क पर serverless GPUs पर मॉडल चलाना, यूज़र्स के करीब inference लाना, और साथ ही धीरे-धीरे बड़े और frontier-scale मॉडल्स की ओर बढ़ना।

मैं पहले से Cloudflare के इस पहलू से बहुत परिचित नहीं था, इसलिए हमने कुछ समय इस बात पर चर्चा करने में बिताया कि टीम क्या बना रही है और वे बड़े पैमाने पर तेज़ और कुशल AI inference कैसे कर रहे हैं।

फिर बात मेरे अपने अनुभव पर आई।

अपनी इंटर्नशिप के दौरान, मैंने encoder-based मॉडल्स के deployment, rooflining और inference optimization पर काम किया, मुख्य रूप से rerankers और embedding models पर, जो in-house GPUs पर चलते थे।

ये encoder-only मॉडल थे, ज़्यादातर MLPs के स्टैक, इसलिए सामान्य LLM attention पर आधारित inference स्टैक, KV cache, vLLM या SGLang इन मामलों में वाकई प्रासंगिक नहीं थे।

हमने इन पर काफी गहराई से चर्चा की:

rooflining और profiling के लिए मेरा दृष्टिकोण batch sizes का चयन और उनके प्रभाव को मापना inference workloads को scale करना inference pipeline में bottlenecks खोजना p50 और p99 latency को optimize करना TTFT और समग्र response latency

हमने यह भी चर्चा की कि एक बार स्पष्ट bottlenecks हटा देने के बाद मैं आगे optimization कैसे करूँगा।

एक सवाल जो मुझे खास पसंद आया:

आपके लिए frontier AI का क्या मतलब है?

राउंड अच्छा गया और हमने अगले राउंड्स पर भी चर्चा की, जिनमें hands-on PyTorch शामिल होता।

आखिरकार मैं आगे नहीं बढ़ पाया। मुझे लगता है कि वे किसी ऐसे व्यक्ति की तलाश में थे जिसके पास hands-on LLM inference का ज़्यादा अनुभव हो। मैं LLM inference और systems का actively अध्ययन कर रहा था, लेकिन उस वक़्त उस क्षेत्र में मेरे पास ज़्यादा production experience नहीं था। मेरा ज़्यादातर hands-on काम distributed training, ML systems और infra के आसपास रहा था।

फिर भी, इंटरव्यू का अनुभव वाकई बहुत अच्छा रहा। इस चर्चा ने मुझे Cloudflare के पैमाने पर AI मॉडल्स को serve करने में शामिल समस्याओं की कहीं बेहतर समझ दी।

एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें