एक महीने पहले, GLM-5.2 जारी किया गया था। हमारे दिन-शून्य समर्थन के हिस्से के रूप में, हमने GLM-5.2 के लिए दुनिया का सबसे तेज़ API बनाया, जिसकी अधिकतम गति 280 टोकन प्रति सेकंड और औसत गति लगभग 100 टोकन प्रति सेकंड थी। आज, हमारा GLM-5.2 API जैसा कि Artificial Analysis द्वारा बेंचमार्क किया गया है, लॉन्च-डे API से दोगुने से अधिक प्रदर्शन दिखाता है। हम पाते हैं कि हमारा बेहतर API प्रदर्शन बेंचमार्क और वास्तविक दुनिया के उपयोग दोनों में दिखाई देता है।

Baseten का GLM-5.2 API TTFT और TPS दोनों में अग्रणी प्रदर्शन प्राप्त करता है।
जैसे-जैसे GLM-5.2 जैसे मॉडल बाजार में निरंतर लोकप्रियता प्रदर्शित करते हैं, हम अपने उपयोगकर्ताओं के लिए बेहतर विलंबता और थ्रूपुट को अनलॉक करने के लिए मॉडल-विशिष्ट अनुकूलन कार्य में अपने निवेश को गहरा करते हैं। अपने GLM-5.2 API को बेहतर बनाने के अलावा, हमने मॉडल के लिए एक और API बनाया: GLM-5.2-Fast।
कुछ प्रदर्शन कार्य दोनों APIs को लाभान्वित करते हैं। पिछले महीने में, हमने शेड्यूलर को अनुकूलित किया है, जिससे थ्रूपुट में थोड़ी वृद्धि हुई है, साथ ही बेहतर NVFP4 वेट और एक अपडेटेड स्पेक्युलेटिव डिकोडिंग प्रोफाइल भी रोल आउट किया है। हमने अपने इन्फ्रेंस इंजन और पूरे स्टैक में गुणवत्ता और प्रदर्शन दोनों पर बग भी ठीक किए हैं।
फास्ट API के लिए, हमने कोडिंग और एजेंटों के लिए विलंबता कम करने पर ध्यान केंद्रित किया। इन्फ्रेंस इंजीनियरिंग विलंबता और थ्रूपुट के बीच पेरेटो फ्रंटियर पर ट्रेड ऑफ करने के कई अवसर प्रदान करती है। बाजार से एक मजबूत संकेत के आधार पर कि अधिक प्रदर्शन के लिए भुगतान करने की इच्छा है, Baseten के मॉडल प्रदर्शन टीम ने सिस्टम को जितना संभव हो उतना विलंबता की ओर धकेलने के लिए समानांतरता, बैचिंग और कैशिंग में कॉन्फ़िगरेशन विकल्पों पर पुनर्विचार किया। दो परिवर्तन थे जिनका सबसे बड़ा प्रभाव पड़ा:
- जबकि सामान्य API थ्रूपुट में सुधार के लिए Attention Data Parallelism (ADP) का उपयोग करता है, फास्ट API केवल Tensor and Expert Parallelism का उपयोग करता है जिसमें कॉन्फ़िगरेशन विलंबता के लिए चुने गए हैं।
- अधिकतम बैच साइज में एक महत्वपूर्ण कमी का मतलब है कि कम अनुरोध संसाधनों के लिए प्रतिस्पर्धा कर रहे हैं।
यह फास्ट API सामान्य API के समान NVIDIA B200 GPUs पर चलता है। हालांकि, चूंकि प्रदर्शन अनुकूलन विलंबता में सुधार के लिए थ्रूपुट का व्यापार करते हैं, फास्ट API पर इनपुट और आउटपुट टोकन कीमतें 50% अधिक हैं।
यह प्रदर्शन कार्य Artificial Analysis के नवीनतम बेंचमार्क में दिखाई देता है, जो शनिवार, 25 जुलाई, 2026 को लगभग 7:00 PM Pacific Time पर मापा गया।

एंड-टू-एंड प्रतिक्रिया समय उपयोगकर्ता अनुभव के लिए एक महत्वपूर्ण मीट्रिक है।

TPS के संदर्भ में शुद्ध आउटपुट गति, विशेष रूप से उन तर्क मॉडलों के लिए महत्वपूर्ण है जो क्वेरी का उत्तर देने से पहले सोचते हैं।
LLM का प्रदर्शन सिस्टम में ट्रैफ़िक की मात्रा, उस ट्रैफ़िक के पैटर्न और इनपुट और आउटपुट अनुक्रम लंबाई के आधार पर काफी भिन्न होता है। Artificial Analysis बेंचमार्क लगभग 10,000 इनपुट टोकन के प्रॉम्प्ट भेजता है ताकि लगभग 1,000 आउटपुट टोकन के उत्तर उत्पन्न किए जा सकें। हमें बाजार से हमारे API के वास्तविक दुनिया के उपयोग में अग्रणी प्रदर्शन के बारे में सकारात्मक प्रतिक्रिया मिली है, न कि केवल बेंचमार्क में।
हमने GLM-5.2 के प्रदर्शन को अनुकूलित करना समाप्त नहीं किया है। हमारी जल्द ही अपने स्पेक्युलेटिव डिकोडिंग एल्गोरिदम में एक और सुधार रोल आउट करने की योजना है। हम Kimi K3 के लिए API बनाने की प्रक्रिया से भी बहुत कुछ सीख रहे हैं, और हम इन सीखों को GLM-5.2 जैसे अन्य ओपन मॉडलों पर वापस लागू करने के लिए उत्सुक हैं।
GLM-5.2 के लिए नया फास्ट API Baseten पर सार्वजनिक रूप से उपलब्ध है। इसे आज ही आज़माएं: https://www.baseten.co/library/glm-52-fast/।





![ChatGPT Work: वन-शॉट रिक्वेस्ट के साथ करेक्शन की झंझट खत्म करें [टेम्पलेट्स शामिल]](/cdn-cgi/image/width=1920,quality=90,format=auto,metadata=none/https%3A%2F%2Fcms-assets.youmind.com%2Fmedia%2F1785174444638_v6q5ut_HOIfqlObMAAEjxQ.jpg)