CTC: 44-58 LPA
मैंने @Cloudflare के एक इंजीनियर को cold email किया, हमने रोल और मेरे बैकग्राउंड के बारे में थोड़ी चर्चा की, और कुछ दिनों बाद मुझे इंटरव्यू का निमंत्रण मिला, जिसमें स्लॉट चुनने का लिंक था।
पहला राउंड 10+ साल के अनुभव वाले Lead Staff Engineer के साथ था, और यह AI Workers team पर केंद्रित था।
Cloudflare का AI स्टैक काफी दिलचस्प है: अपने ग्लोबल नेटवर्क पर serverless GPUs पर मॉडल चलाना, यूज़र्स के करीब inference लाना, और साथ ही धीरे-धीरे बड़े और frontier-scale मॉडल्स की ओर बढ़ना।
मैं पहले से Cloudflare के इस पहलू से बहुत परिचित नहीं था, इसलिए हमने कुछ समय इस बात पर चर्चा करने में बिताया कि टीम क्या बना रही है और वे बड़े पैमाने पर तेज़ और कुशल AI inference कैसे कर रहे हैं।
फिर बात मेरे अपने अनुभव पर आई।
अपनी इंटर्नशिप के दौरान, मैंने encoder-based मॉडल्स के deployment, rooflining और inference optimization पर काम किया, मुख्य रूप से rerankers और embedding models पर, जो in-house GPUs पर चलते थे।
ये encoder-only मॉडल थे, ज़्यादातर MLPs के स्टैक, इसलिए सामान्य LLM attention पर आधारित inference स्टैक, KV cache, vLLM या SGLang इन मामलों में वाकई प्रासंगिक नहीं थे।
हमने इन पर काफी गहराई से चर्चा की:
rooflining और profiling के लिए मेरा दृष्टिकोण batch sizes का चयन और उनके प्रभाव को मापना inference workloads को scale करना inference pipeline में bottlenecks खोजना p50 और p99 latency को optimize करना TTFT और समग्र response latency
हमने यह भी चर्चा की कि एक बार स्पष्ट bottlenecks हटा देने के बाद मैं आगे optimization कैसे करूँगा।
एक सवाल जो मुझे खास पसंद आया:
आपके लिए frontier AI का क्या मतलब है?
राउंड अच्छा गया और हमने अगले राउंड्स पर भी चर्चा की, जिनमें hands-on PyTorch शामिल होता।
आखिरकार मैं आगे नहीं बढ़ पाया। मुझे लगता है कि वे किसी ऐसे व्यक्ति की तलाश में थे जिसके पास hands-on LLM inference का ज़्यादा अनुभव हो। मैं LLM inference और systems का actively अध्ययन कर रहा था, लेकिन उस वक़्त उस क्षेत्र में मेरे पास ज़्यादा production experience नहीं था। मेरा ज़्यादातर hands-on काम distributed training, ML systems और infra के आसपास रहा था।
फिर भी, इंटरव्यू का अनुभव वाकई बहुत अच्छा रहा। इस चर्चा ने मुझे Cloudflare के पैमाने पर AI मॉडल्स को serve करने में शामिल समस्याओं की कहीं बेहतर समझ दी।





