हमने GLM-5.2 के लिए सबसे तेज़ API कैसे बनाया

@philipkiely
अंग्रेज़ी2 दिन पहले · 26 जुल॰ 2026
162K
459
42
26
484

TL;DR

Baseten ने बताया है कि कैसे उन्होंने शेड्यूलर में सुधार, समानता (parallelism) समायोजन और B200 GPU के उपयोग के माध्यम से उद्योग-अग्रणी गति प्राप्त करने के लिए GLM-5.2 API को अनुकूलित किया।

एक महीने पहले, GLM-5.2 जारी किया गया था। हमारे दिन-शून्य समर्थन के हिस्से के रूप में, हमने GLM-5.2 के लिए दुनिया का सबसे तेज़ API बनाया, जिसकी अधिकतम गति 280 टोकन प्रति सेकंड और औसत गति लगभग 100 टोकन प्रति सेकंड थी। आज, हमारा GLM-5.2 API जैसा कि Artificial Analysis द्वारा बेंचमार्क किया गया है, लॉन्च-डे API से दोगुने से अधिक प्रदर्शन दिखाता है। हम पाते हैं कि हमारा बेहतर API प्रदर्शन बेंचमार्क और वास्तविक दुनिया के उपयोग दोनों में दिखाई देता है।

Philip Kiely - inline image

Baseten का GLM-5.2 API TTFT और TPS दोनों में अग्रणी प्रदर्शन प्राप्त करता है।

जैसे-जैसे GLM-5.2 जैसे मॉडल बाजार में निरंतर लोकप्रियता प्रदर्शित करते हैं, हम अपने उपयोगकर्ताओं के लिए बेहतर विलंबता और थ्रूपुट को अनलॉक करने के लिए मॉडल-विशिष्ट अनुकूलन कार्य में अपने निवेश को गहरा करते हैं। अपने GLM-5.2 API को बेहतर बनाने के अलावा, हमने मॉडल के लिए एक और API बनाया: GLM-5.2-Fast

कुछ प्रदर्शन कार्य दोनों APIs को लाभान्वित करते हैं। पिछले महीने में, हमने शेड्यूलर को अनुकूलित किया है, जिससे थ्रूपुट में थोड़ी वृद्धि हुई है, साथ ही बेहतर NVFP4 वेट और एक अपडेटेड स्पेक्युलेटिव डिकोडिंग प्रोफाइल भी रोल आउट किया है। हमने अपने इन्फ्रेंस इंजन और पूरे स्टैक में गुणवत्ता और प्रदर्शन दोनों पर बग भी ठीक किए हैं।

फास्ट API के लिए, हमने कोडिंग और एजेंटों के लिए विलंबता कम करने पर ध्यान केंद्रित किया। इन्फ्रेंस इंजीनियरिंग विलंबता और थ्रूपुट के बीच पेरेटो फ्रंटियर पर ट्रेड ऑफ करने के कई अवसर प्रदान करती है। बाजार से एक मजबूत संकेत के आधार पर कि अधिक प्रदर्शन के लिए भुगतान करने की इच्छा है, Baseten के मॉडल प्रदर्शन टीम ने सिस्टम को जितना संभव हो उतना विलंबता की ओर धकेलने के लिए समानांतरता, बैचिंग और कैशिंग में कॉन्फ़िगरेशन विकल्पों पर पुनर्विचार किया। दो परिवर्तन थे जिनका सबसे बड़ा प्रभाव पड़ा:

  • जबकि सामान्य API थ्रूपुट में सुधार के लिए Attention Data Parallelism (ADP) का उपयोग करता है, फास्ट API केवल Tensor and Expert Parallelism का उपयोग करता है जिसमें कॉन्फ़िगरेशन विलंबता के लिए चुने गए हैं।
  • अधिकतम बैच साइज में एक महत्वपूर्ण कमी का मतलब है कि कम अनुरोध संसाधनों के लिए प्रतिस्पर्धा कर रहे हैं।

यह फास्ट API सामान्य API के समान NVIDIA B200 GPUs पर चलता है। हालांकि, चूंकि प्रदर्शन अनुकूलन विलंबता में सुधार के लिए थ्रूपुट का व्यापार करते हैं, फास्ट API पर इनपुट और आउटपुट टोकन कीमतें 50% अधिक हैं।

यह प्रदर्शन कार्य Artificial Analysis के नवीनतम बेंचमार्क में दिखाई देता है, जो शनिवार, 25 जुलाई, 2026 को लगभग 7:00 PM Pacific Time पर मापा गया।

Philip Kiely - inline image

एंड-टू-एंड प्रतिक्रिया समय उपयोगकर्ता अनुभव के लिए एक महत्वपूर्ण मीट्रिक है।

Philip Kiely - inline image

TPS के संदर्भ में शुद्ध आउटपुट गति, विशेष रूप से उन तर्क मॉडलों के लिए महत्वपूर्ण है जो क्वेरी का उत्तर देने से पहले सोचते हैं।

LLM का प्रदर्शन सिस्टम में ट्रैफ़िक की मात्रा, उस ट्रैफ़िक के पैटर्न और इनपुट और आउटपुट अनुक्रम लंबाई के आधार पर काफी भिन्न होता है। Artificial Analysis बेंचमार्क लगभग 10,000 इनपुट टोकन के प्रॉम्प्ट भेजता है ताकि लगभग 1,000 आउटपुट टोकन के उत्तर उत्पन्न किए जा सकें। हमें बाजार से हमारे API के वास्तविक दुनिया के उपयोग में अग्रणी प्रदर्शन के बारे में सकारात्मक प्रतिक्रिया मिली है, न कि केवल बेंचमार्क में।

हमने GLM-5.2 के प्रदर्शन को अनुकूलित करना समाप्त नहीं किया है। हमारी जल्द ही अपने स्पेक्युलेटिव डिकोडिंग एल्गोरिदम में एक और सुधार रोल आउट करने की योजना है। हम Kimi K3 के लिए API बनाने की प्रक्रिया से भी बहुत कुछ सीख रहे हैं, और हम इन सीखों को GLM-5.2 जैसे अन्य ओपन मॉडलों पर वापस लागू करने के लिए उत्सुक हैं।

GLM-5.2 के लिए नया फास्ट API Baseten पर सार्वजनिक रूप से उपलब्ध है। इसे आज ही आज़माएं: https://www.baseten.co/library/glm-52-fast/

YouMind में रीमिक्स करें

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें