इस लेख का उद्देश्य यथासंभव सरल और समझने में आसान होना है, ताकि कोई भी नौसिखिया खिलाड़ी आसानी से स्थानीय मॉडल डिप्लॉयमेंट में महारत हासिल कर सके और अपना खुद का वर्कफ़्लो बना सके।
इस साल, घरेलू ओपन-सोर्स लार्ज लैंग्वेज मॉडल काफी सक्रिय रहे हैं। DeepSeek, Qwen, Kimi, GLM, MiniMax... एक के बाद एक नए मॉडल आ रहे हैं, लगातार अपने वेट खोल रहे हैं, और अमेरिकी क्लोज्ड-सोर्स मॉडल के साथ कदमताल करने लगे हैं।
लेकिन जितने अधिक मॉडल होंगे, मुझे उतना ही एक विशिष्ट प्रश्न की चिंता होती है: क्या ये मॉडल केवल वेब पेजों और API तक सीमित रह सकते हैं, या वास्तव में हमारी अपनी मशीनों में इंस्टॉल हो सकते हैं, स्थानीय फ़ाइलों, टूल्स और वर्कफ़्लो से जुड़ सकते हैं?
हालाँकि API टोकन की यूनिट कीमत आम तौर पर घट रही है, फिर भी उच्च-आवृत्ति कॉल और लंबे टेक्स्ट के मामले में लागत अधिक रहती है। इसमें प्राइवेसी, नेटवर्किंग और डेटा कंट्रोल जैसे मुद्दे जुड़ जाते हैं, जिससे स्थानीय डिप्लॉयमेंट अधिक से अधिक डेवलपर्स और उद्यमों की पसंद बनता जा रहा है।
इसलिए इस बार, मैं एक चुनौतीपूर्ण आकार और सिंगल-मशीन डिप्लॉयमेंट के लिए प्रतिनिधि मॉडल चुनना चाहता हूँ, ताकि पूरी स्थानीय डिप्लॉयमेंट प्रक्रिया को पूरा किया जा सके।
अंत में चुना गया मुख्य पात्र एंट बैलिंग द्वारा ओपन-सोर्स किया गया Ling-3.0-flash है—यह एक मिक्सचर ऑफ एक्सपर्ट्स (MoE) मॉडल है जिसमें कुल 124B पैरामीटर हैं। मेरे पास संयोग से एक NVIDIA DGX Spark है, जो इसे चला सकता है।
तो देर किस बात की, चलिए मुख्य शो शुरू करते हैं।

01 शब्दावली प्राइमर
शुरू करने से पहले, आइए कुछ मॉडल-संबंधित शब्दों का परिचय दें ताकि सभी अपडेट हो जाएँ ✌🏻
मॉडल परिशुद्धता
एक ही मॉडल अक्सर विभिन्न परिशुद्धता या क्वांटाइज़्ड वर्शन प्रदान करता है, जो सीधे मॉडल के आकार और चलाने की सीमा को प्रभावित करते हैं।

इस बार हम आधिकारिक Ling INT4 वर्शन का उपयोग कर रहे हैं, जो लगभग 71.75GB का है।
Dense या MoE

ध्यान दें कि 5.1B केवल प्रति इन्फ़रेंस सक्रिय पैरामीटरों की संख्या है; पूरे 124B वेट को अभी भी मेमोरी में लोड करने की आवश्यकता है।
इन्फ़रेंस इंजन
इन्फ़रेंस इंजन वेट लोड करने, कॉन्टेक्स्ट और कंकरेंसी को मैनेज करने और इंटरफ़ेस प्रदान करने के लिए जिम्मेदार है। यह मॉडल को चलाने का टूल है, न कि स्वयं मॉडल।

हमने इस बार vLLM को चुना क्योंकि वर्तमान आधिकारिक अनुकूलन Ling-3.0-flash के INT4 वेट और MTP स्पेक्युलेटिव डिकोडिंग को सपोर्ट करता है।
02 मॉडल इंस्टॉलेशन और डिप्लॉयमेंट
पहले, आइए इंस्टॉलेशन वातावरण का परिचय दें: मैं एक NVIDIA DGX Spark का उपयोग कर रहा हूँ, जो GB10 चिप और 121.6GB यूनिफ़ाइड मेमोरी से लैस है, जो ARM64 आर्किटेक्चर पर Ubuntu 24.04 चला रहा है। डिप्लॉयमेंट Ling-3.0-flash-INT4 है, और बाद के थ्रूपुट परीक्षण स्थानीय Qwen 3.8-27B को संदर्भ के रूप में उपयोग करेंगे।
आधिकारिक तौर पर एक बेसिक वर्शन और FP8, FP4, और INT4 जैसे विभिन्न परिशुद्धता वर्शन प्रदान किए गए हैं। आप अपने हार्डवेयर के अनुसार चुन सकते हैं।
एक 8B Ling-3.0-tiny और इसके FP8, INT4 वर्शन भी हैं। सामान्य Mac या एकल 4090 वाले उपयोगकर्ता Tiny के कम-परिशुद्धता वर्शन को प्राथमिकता दे सकते हैं।

चरण 1: मॉडल डाउनलोड करें। मैंने इस बार आधिकारिक INT4 वर्शन का उपयोग किया। डाउनलोड प्रविष्टियाँ 👇🏻
- Hugging Face: Ling-3.0-flash-int4
- ModelScope: Ling-3.0-flash-int4
यदि Hugging Face तक पहुँचना असुविधाजनक है, तो आप ModelScope से मैन्युअल रूप से डाउनलोड कर सकते हैं। डाउनलोड करने के बाद, कुल 24 safetensors शार्ड हैं, जो लगभग 71.75GB हैं। आपको रनटाइम के दौरान इन्फ़रेंस इंजन और KV Cache के लिए भी जगह छोड़नी होगी।
चरण 2: वातावरण तैयार करें। Ling-3.0-flash का BailingMoeV3 आर्किटेक्चर काफी नया है। मैंने llama.cpp के साथ GGUF का उपयोग करने का प्रयास किया, लेकिन यह unknown model architecture: 'bailingmoe3' त्रुटि देता है। इसलिए इस बार, मैंने सीधे आधिकारिक रूप से अनुकूलित vLLM ब्रांच का उपयोग किया:
1pip install uv2uv venv ~/my_ling_env3source ~/my_ling_env/bin/activate45git clone -b ling_3_0 https://github.com/inclusionAI/vllm-ling-v3.git6cd vllm-ling-v37VLLM_USE_PRECOMPILED=1 uv pip install --editable . --torch-backend=auto
चरण 3: इन्फ़रेंस सेवा शुरू करें। मॉडल पथ को अपने स्थानीय रूप से डाउनलोड किए गए INT4 वेट से बदलें:
1vllm serve /path/to/Ling-3.0-flash-int4 \2 --served-model-name ling-int4 \3 --host 127.0.0.1 \4 --port 30000 \5 --trust-remote-code \6 --max-model-len 16384 \7 --gpu-memory-utilization 0.8 \8 --max-num-seqs 8 \9 --reasoning-parser ling3 \10 --speculative-config '{"method":"bailing_hybrid_v3_mtp","num_speculative_tokens":1}'
⚠️
कृपया कमांड में दिए गए पथों को अपनी मशीन के वास्तविक पथों से बदलें।
यहाँ, कॉन्टेक्स्ट सीमा 16K, कंकरेंसी 8, और MTP स्पेक्युलेटिव डिकोडिंग सक्षम है।
नोट: MTP (मल्टी-टोकन प्रेडिक्शन) मॉडल को एक साथ कई टोकन की भविष्यवाणी करने का प्रयास करने की अनुमति देता है। सही ढंग से भविष्यवाणी किए गए भागों को सीधे अपनाया जा सकता है, जिससे एक-एक करके टोकन उत्पन्न करने के लिए गणना के चक्र कम हो जाते हैं और आउटपुट गति बढ़ जाती है।
चरण 4: सेवा सत्यापित करें। शुरू होने के बाद, एक सरल अनुरोध भेजें:
1curl -s http://127.0.0.1:30000/v1/chat/completions \2 -H "Content-Type: application/json" \3 -d '{"model":"ling-int4",4 "messages":[{"role":"user","content":"नमस्ते, कृपया अपना परिचय एक वाक्य में दें।"}],5 "stream":true}'
टर्मिनल स्ट्रीम में सामग्री वापस करना शुरू कर देता है, जो दर्शाता है कि यह 124B मॉडल स्थानीय रूप से चल रहा है।

03 मॉडल प्रदर्शन और क्षमता का परीक्षण
- टोकन थ्रूपुट जब मॉडल पहली बार शुरू हुआ, तो मैंने vLLM के अंतर्निहित बेंचमार्क का उपयोग करके परीक्षणों का एक दौर चलाया। सभी 20 अनुरोध पूरे हुए, जिसमें आउटपुट थ्रूपुट 84.34 tok/s, कुल टोकन थ्रूपुट 133.10 tok/s, और MTP स्वीकृति दर 67.35% थी।

मूल लॉग आउटपुट 👇🏻
1============ Serving Benchmark Result ============2Successful requests: 203Failed requests: 04Request rate configured (RPS): 2.005Benchmark duration (s): 60.716Total input tokens: 29607Total generated tokens: 51208Request throughput (req/s): 0.339Output token throughput (tok/s): 84.3410Peak output token throughput (tok/s): 61.0011Peak concurrent requests: 20.0012Total token throughput (tok/s): 133.1013---------------Time to First Token----------------14Mean TTFT (ms): 19692.9815Median TTFT (ms): 18877.9916P99 TTFT (ms): 40039.0217-----Time per Output Token (excl. 1st token)------18Mean TPOT (ms): 44.6119Median TPOT (ms): 44.0920P99 TPOT (ms): 49.6821---------------Inter-token Latency----------------22Mean ITL (ms): 74.0923Median ITL (ms): 72.3924P99 ITL (ms): 280.7125---------------Speculative Decoding---------------26Acceptance rate (%): 67.3527Acceptance length: 1.6728Drafts: 305129Draft tokens: 305130Accepted tokens: 205531Per-position acceptance (%):32 Position 0: 67.3533==================================================
इसके बाद, मैंने Ling और स्थानीय Qwen 3.8-27B पर कंकरेंसी परीक्षण किए। 8 कंकरेंसी पर, Ling का कुल थ्रूपुट 141.38 tok/s था, जबकि Qwen 3.8 का 32.61 tok/s था, इस दौर में लगभग 4.34 गुना का अंतर।
🔥🔥🔥Ling-3.0-Flash बनाम Qwen3.8-27B स्ट्रेस टेस्ट तुलना

Ling-3.0-flash

Qwen 3.8 -27B


कुछ लोग सोच सकते हैं: Ling की एकल कंकरेंसी केवल 34.77 tok/s क्यों है, लेकिन 8 कंकरेंसी पर यह 141.38 tok/s हो जाती है? तकनीकी मित्र यह भी पूछ सकते हैं कि क्या यह एकल कंकरेंसी स्कोर आधिकारिक डेटा की तुलना में धीमा है।
यहाँ हमें विशिष्ट परीक्षण विधि और विभिन्न मूल्यांकन विधियों के कारण होने वाले गति अंतर को समझाने की आवश्यकता है:
- परीक्षण विधि और वास्तविक एंड-टू-एंड लिंक: यह परीक्षण एक स्थानीय OpenAI-संगत इंटरफ़ेस का उपयोग करता है, HTTP स्ट्रीमिंग अनुरोधों के माध्यम से स्ट्रेस-टेस्टिंग करता है, न कि सेवा फ्रेमवर्क से अलग एक ऑफ़लाइन इन्फ़रेंस परीक्षण। प्रत्येक Ling अनुरोध लगभग 150 टोकन के लंबे टेक्स्ट प्रॉम्प्ट का उपयोग करता है, जो अधिकतम 512 टोकन उत्पन्न करता है। समय क्लाइंट के HTTP अनुरोध से लेकर स्ट्रीमिंग प्रतिक्रिया पूरी होने तक शुरू होता है, इस प्रकार इसमें स्थानीय HTTP कॉल, सेवा शेड्यूलिंग, टोकनाइज़र प्रोसेसिंग, प्रीफ़िल, टोकन-दर-टोकन डिकोडिंग और स्ट्रीमिंग रिटर्न शामिल हैं।
- सिंगल-स्ट्रीम आउटपुट दर बनाम मशीन कुल थ्रूपुट: सिंगल-स्ट्रीम गति (वास्तविक उपयोगकर्ता अनुभव): $c=1$ पर, एंड-टू-एंड आउटपुट दर लगभग 35.34 tok/s (वास्तविक एकल वार्तालाप परीक्षण 38+ tok/s पर) है, जो प्रति सेकंड 35 से अधिक चीनी अक्षरों के बराबर है, जो देखने में बेहद तेज़ है; कुल थ्रूपुट (कंकरेंसी के तहत कुल आउटपुट): जैसे-जैसे कंकरेंसी बढ़ती है, vLLM कंटीन्यूअस बैचिंग का उपयोग करके कई अनुरोधों को GPU गणनाओं में संयोजित करता है, ब्लैकवेल की यूनिफ़ाइड मेमोरी बैंडविड्थ का पूरा उपयोग करता है। 8 कंकरेंसी पर, मशीन का कुल थ्रूपुट बढ़कर 141.38 tok/s हो गया।
जहाँ तक इस बात का सवाल है कि यह कुछ आधिकारिक बेंचमार्क से भिन्न क्यों है, मुख्य बात परीक्षण मानदंड है। मॉडल परिशुद्धता, इन्फ़रेंस इंजन, कॉन्टेक्स्ट लंबाई, इनपुट/आउटपुट टोकन गणना, कंकरेंसी स्केल, और ऑफ़लाइन इन्फ़रेंस या HTTP सेवाओं का उपयोग किया जाता है या नहीं, ये सभी अंतिम परिणाम को प्रभावित करते हैं। केवल जब ये स्थितियाँ मूल रूप से सुसंगत हों, तभी संख्याएँ सीधी तुलना के लिए उपयुक्त होती हैं।
सीधे शब्दों में कहें: मूल्यांकन विधियों के कारण गति भिन्न होती है—यदि अत्यधिक उच्च कंकरेंसी (जैसे 32/64) में या नेटवर्क प्रोटोकॉल के बिना शुद्ध कंप्यूटिंग वातावरण में परीक्षण किया जाता है, तो कुल थ्रूपुट संख्याएँ अधिक दिखाई देंगी; हमारे दैनिक एकल-व्यक्ति वार्तालापों या कोडिंग प्रोडक्शन कॉल में, Ling की सिंगल-स्ट्रीम 35+ tok/s और 220ms से कम की फर्स्ट-टोकन विलंबता पहले से ही बेहद सहज और अंतराल-मुक्त लगती है।
एकल कंकरेंसी पर, Ling की औसत सिंगल-स्ट्रीम गति लगभग 35.34 tok/s है; 8 कंकरेंसी पर, कुल थ्रूपुट 141.38 tok/s तक पहुँच जाता है। Qwen3.8 का कुल थ्रूपुट 8 कंकरेंसी पर 32.61 tok/s है। इस दौर में, Ling का लाभ मुख्य रूप से आउटपुट गति और समवर्ती थ्रूपुट में परिलक्षित होता है, वास्तविक उपयोग में उत्तर काफी तेज़ होते हैं।
2. वास्तविक क्षमताएँ
बेंचमार्क केवल प्रदर्शन के एक हिस्से को दर्शाते हैं; वास्तविक उपयोगिता विशिष्ट समस्याओं पर मॉडल के प्रदर्शन पर निर्भर करती है। मैंने सरल परीक्षण के लिए तीन दिशाएँ चुनीं।
(1) तार्किक तर्क
मैंने चिकन-एंड-रैबिट समस्या का एक रूपांतर, एक क्लासिक कार वॉश समस्या, और एक कार वॉश मशीन समस्या तैयार की, मुख्य रूप से यह देखने के लिए कि क्या यह परिचित दिखने वाले उत्तर को लागू करने के बजाय शर्तों को सटीक रूप से समझ सकता है। इनमें से, चिकन-एंड-रैबिट समस्या में पारंपरिक पैटर्न को तोड़ने के लिए तीन पैरों वाले 4 यांत्रिक पक्षी शामिल थे।

(2) सुरक्षा सीमाएँ: इसके बाद, मैंने उच्च-जोखिम वाले संचालनों पर इसकी प्रतिक्रिया का परीक्षण किया: क्या यह सीधे निष्पादित करता है या जोखिमों की पहचान करता है, उपयोगकर्ता के साथ पुष्टि करता है, और सुरक्षित विकल्प प्रदान करता है।

(3) लंबा टेक्स्ट
अंत में, लंबे टेक्स्ट परीक्षण का एक दौर। मैंने एक लंबे कॉन्टेक्स्ट में महत्वपूर्ण जानकारी छिपाई ताकि यह देखा जा सके कि क्या यह सटीक रूप से ढूँढ़ और उत्तर दे सकता है, साथ ही लंबे टेक्स्ट के तहत आउटपुट गति और स्थिरता का निरीक्षण किया जा सके।

04 API से TUI, फिर टूल कॉलिंग तक
हमने मॉडल डिप्लॉयमेंट और क्षमता परीक्षण पूरा कर लिया है, लेकिन सामान्य उपयोगकर्ताओं के लिए, curl दैनिक उपयोग की तुलना में इंटरफ़ेस सत्यापित करने के लिए अधिक उपयुक्त है। स्थानीय मॉडल से लंबे समय तक बात करने के लिए, एक अधिक सुविधाजनक इंटरैक्शन इंटरफ़ेस की आवश्यकता है।
इसलिए मैंने पहले एक सरल TUI बनाया, एक चैट इंटरफ़ेस जो टर्मिनल में चलता है। यह जटिल सॉफ़्टवेयर नहीं है; मैंने AI से एक Python स्क्रिप्ट लिखवाई जो स्थानीय इंटरफ़ेस कॉल, स्ट्रीमिंग आउटपुट और वार्तालाप इतिहास को समाहित करती है, फिर इसे एक कमांड से शुरू किया:
1python3 ling-3.0-chat.py
इस तरह, मुझे हर बार curl लिखने की ज़रूरत नहीं है। टर्मिनल खोलें और सीधे चैट करें; उत्तर स्ट्रीम में आते हैं, और आप TPS, TTFT और टोकन गणना देख सकते हैं। मैंने पिछली क्षमता परीक्षण इसी इंटरफ़ेस में पूरे किए।
हालाँकि, इस बिंदु पर, TUI केवल एक टेक्स्ट चैट टूल है जिसमें टूल कॉल करने की क्षमता नहीं है। लार्ज मॉडल एक "दिमाग" की तरह है जो सोचने के लिए जिम्मेदार है, लेकिन इसके पास फ़ाइलें पढ़ने, कमांड निष्पादित करने या सिस्टम की वर्तमान स्थिति जानने के लिए कोई "हाथ और पैर" नहीं हैं।
इसे सिस्टम क्षमताओं को कॉल करने देने के लिए, हमें टूल कॉलिंग जोड़ने की आवश्यकता है। सीधे शब्दों में कहें, कमांड निष्पादन, फ़ाइल पढ़ना और लिखना जैसे संचालन को टूल के रूप में समाहित किया जाता है। मॉडल पहले निर्णय लेता है कि उसे किस जानकारी की आवश्यकता है, फिर एक टूल उपयोग शुरू करता है; Python स्क्रिप्ट इसे निष्पादित करती है और आगे की प्रक्रिया के लिए परिणाम मॉडल को वापस देती है।
उदाहरण के लिए, शुरू में, जब मैंने इसे सिस्टम GPU जानकारी जाँचने के लिए कहा, तो यह वास्तविक उपयोग नहीं जानता था और केवल मुझे बता सकता था कि कैसे जाँच करें। टूल कॉलिंग जोड़ने के बाद, यह स्वयं सिस्टम कमांड निष्पादित कर सकता था और क्वेरी परिणामों को सीधे TUI में व्यवस्थित कर सकता था।
उसी सिद्धांत के आधार पर, आप वेब सर्च, आंतरिक उद्यम इंटरफ़ेस, डेटाबेस आदि को जोड़ना जारी रख सकते हैं। विशिष्ट टूल को व्यावसायिक आवश्यकताओं के अनुसार विस्तारित किया जा सकता है।

05 एक विज़ुअल इंटरफ़ेस से कनेक्ट करना
व्यक्तिगत उपयोग के लिए, टूल कॉलिंग वाला TUI वास्तव में काफी पर्याप्त है। आगे बढ़ने और मॉडल को एक अधिक पूर्ण Agent वर्कबेंच में रखने के लिए, आप Harness जैसे एजेंट फ्रेमवर्क से कनेक्ट कर सकते हैं।
इस बार मैंने लियांग शेंग के DeepSeek Harness को चुना, जो न केवल एक चैट पेज जोड़ता है बल्कि कॉन्टेक्स्ट मैनेजमेंट, वर्कस्पेस, टूल कॉलिंग, अनुमति नियंत्रण और टास्क प्लानिंग भी प्रदान करता है, जिसमें एक अंतर्निहित Web UI है। यह "सब कुछ एक प्लगइन है" आर्किटेक्चर का उपयोग करता है, जो भविष्य में कार्यात्मक विस्तार की अनुमति देता है।
ध्यान दें कि DeepSeek Harness अभी भी डेवलपर पूर्वावलोकन चरण में है और तेज़ी से अपडेट होता है, जिससे असंगत परिवर्तन हो सकते हैं। कई अन्य ओपन-सोर्स Agent फ्रेमवर्क हैं; आप अपनी आवश्यकताओं के अनुसार चुन सकते हैं।
कनेक्शन प्रक्रिया जटिल नहीं है: मुख्य बात एक कस्टम मॉडल सेवा जोड़ना और पते को vLLM द्वारा प्रदान किए गए स्थानीय इंटरफ़ेस पर इंगित करना है। Web UI में कॉन्फ़िगर करने के अलावा, आप कॉन्फ़िगरेशन फ़ाइल को नीचे दिखाए अनुसार संशोधित भी कर सकते हैं:
1llm-pi-ai:2 providers:3 ling:4 displayName: "Ling-3.0-flash (124B)"5 api: openai-completions6 baseURL: http://127.0.0.1:30000/v17 apiKeyEnv: OPENAI_API_KEY8 models:9 - id: ling-int410 name: Ling-3.0-flash (124B MoE)
Web UI शुरू करने के बाद, अपने ब्राउज़र में डिफ़ॉल्ट पता खोलें:
1http://localhost:3080
इस तरह, दैनिक चैटिंग, इतिहास और मॉडल स्विचिंग सभी DeepSeek Harness में किए जा सकते हैं। Harness स्वयं फ़ाइल संचालन, कमांड निष्पादन और टास्क प्लानिंग प्रदान करता है, जिसे प्लगइन के माध्यम से और बढ़ाया जा सकता है। विशिष्ट उपयोग और तृतीय-पक्ष प्लगइन के लिए, इच्छुक मित्र उन्हें खोज सकते हैं।
ध्यान दें कि मैंने Python TUI में जो टूल लिखे थे, वे स्वचालित रूप से स्थानांतरित नहीं होंगे। Harness में उपयोग करने के लिए, उन्हें इसके प्लगइन तंत्र के अनुसार पुन: एकीकृत करने की आवश्यकता है। नीचे Ling के लिए मेरे द्वारा बनाया गया वास्तविक एकीकरण प्रभाव है; आप रिकॉर्डिंग देख सकते हैं।

06 एक AI वर्कफ़्लो बनाना
इस बिंदु पर, Ling-3.0-flash के लिए डिप्लॉयमेंट से इंटरफ़ेस और टूल कॉलिंग तक का सिंगल-मॉडल लिंक पूरी तरह से स्थापित हो गया है।
हालाँकि, वास्तविक परियोजनाओं में, हम आमतौर पर केवल एक मॉडल का उपयोग नहीं करते हैं। विभिन्न मॉडल अलग-अलग चीज़ों में उत्कृष्ट होते हैं; उन्हें संयोजित करना अक्सर एक मॉडल को सब कुछ संभालने से बेहतर होता है।
Ling-3.0-flash का लाभ टेक्स्ट प्रोसेसिंग और जनरेशन गति है, लेकिन यह मूल मल्टीमॉडल इनपुट का समर्थन नहीं करता है। यदि किसी कार्य में छवियों या वीडियो को समझने की आवश्यकता है, तो आप Qwen3.8-27B जैसे मल्टीमॉडल मॉडल को कनेक्ट कर सकते हैं; यदि आपको वीडियो जनरेट करने की आवश्यकता है, तो आप हाल ही में ओपन-सोर्स किए गए MiniMax H3 को कनेक्ट कर सकते हैं। प्रत्येक मॉडल वह संभालता है जिसमें वह सबसे अच्छा है, परिणामों को अगले तक पहुँचाता है।
उदाहरण के लिए, एक वीडियो जनरेशन वर्कफ़्लो बनाने के लिए, Ling पहले आवश्यकताओं को समझ सकता है, स्क्रिप्ट लिख सकता है और स्टोरीबोर्ड को विभाजित कर सकता है, फिर मल्टीमॉडल मॉडल संदर्भ सामग्री और दृश्य स्थिरता की जाँच करता है, और अंत में, वीडियो मॉडल इसे जनरेट करता है। जनरेशन के बाद, दृश्य निरीक्षण का एक और दौर किया जा सकता है, प्रॉम्प्ट को संशोधित करने और परिणामों के आधार पर पुन: जनरेट करने के लिए:
1आवश्यकताएँ और सामग्री2→ Ling स्क्रिप्ट और स्टोरीबोर्ड उत्पन्न करता है3→ मल्टीमॉडल मॉडल सामग्री और दृश्य आवश्यकताओं की जाँच करता है4→ MiniMax H3 वीडियो उत्पन्न करता है5→ मल्टीमॉडल मॉडल दृश्य और निरंतरता की जाँच करता है6→ Ling फीडबैक के आधार पर प्रॉम्प्ट को समायोजित करता है7→ मानव अंतिम समीक्षा पूरी करता है
नीचे दिया गया वीडियो Ling-3.0-flash द्वारा उत्पन्न प्रॉम्प्ट का वास्तविक प्रभाव दिखाता है, जिसे बाद में MiniMax H3 को जनरेशन के लिए दिया गया।

एक बार यह प्रक्रिया तय हो जाने के बाद, आपको बार-बार उपयोग के लिए केवल आवश्यकताओं और सामग्री को बदलने की आवश्यकता है। हालाँकि, एक साथ कई लार्ज मॉडल को स्थानीय रूप से चलाने के लिए बहुत अधिक VRAM और मेमोरी की आवश्यकता होती है। Ling INT4 लगभग 72GB है, Qwen3.8-27B BF16 लगभग 51.77GB है, साथ ही KV Cache और वीडियो मॉडल; इस Spark पर उन सभी को एक साथ रखना मुश्किल है।
वास्तविक डिप्लॉयमेंट से पहले, यह गणना करना सुनिश्चित करें कि प्रत्येक मॉडल को कितनी VRAM या यूनिफ़ाइड मेमोरी की आवश्यकता है। जब संसाधन अपर्याप्त हों, तो आप चरण-दर-चरण मॉडल स्विच कर सकते हैं, क्वांटाइज़्ड वर्शन चुन सकते हैं, या मॉडल को कई उपकरणों में विभाजित कर सकते हैं। कई मॉडल अब स्वतंत्र रूप से नहीं चलते हैं बल्कि एक ही कार्य के आसपास सहयोग करते हैं—यह वास्तव में उपयोग करने योग्य मल्टी-मॉडल AI वर्कफ़्लो है।
07 अंतिम विचार
मॉडल डिप्लॉयमेंट, TUI और टूल कॉलिंग से लेकर मल्टी-मॉडल वर्कफ़्लो तक, पूरी श्रृंखला पूरी हो गई है। इस लेख का उद्देश्य एक निश्चित कॉन्फ़िगरेशन के बजाय एक दोहराने योग्य विधि साझा करना है।
ओपन-सोर्स मॉडल अपडेट होते रहेंगे। भविष्य में, चाहे आप मॉडल, क्वांटाइज़ेशन वर्शन या इन्फ़रेंस इंजन बदलें, वेट डाउनलोड करने और सेवाएँ शुरू करने से लेकर टूल और वर्कफ़्लो कनेक्ट करने का तरीका ज्यादा नहीं बदलेगा।
यदि स्थितियाँ अनुमति देती हैं, तो मैं अभी भी सभी को व्यक्तिगत रूप से स्थानीय मॉडल डिप्लॉय करने की सलाह देता हूँ:
- डेटा नियंत्रण: फ़ाइलें, वार्तालाप और व्यावसायिक डेटा आपकी मशीन या इंट्रानेट पर रहते हैं, निर्देशिका और कमांड अनुमतियाँ आपके द्वारा प्रतिबंधित की जाती हैं।
- उच्च-आवृत्ति उपयोग के लिए उपयुक्त: प्रति उपयोग टोकन लागत की गणना करने की आवश्यकता नहीं है, नेटवर्क और तृतीय-पक्ष सेवाओं पर निर्भरता कम करता है।
- आसान अनुकूलन: मॉडल, क्वांटाइज़ेशन परिशुद्धता, इन्फ़रेंस इंजन और टूल सभी को समायोजित किया जा सकता है, और आंतरिक इंटरफ़ेस और डेटाबेस को जोड़ा जा सकता है।
जैसे-जैसे ओपन-सोर्स मॉडल मजबूत होते जाएंगे, स्थानीय डिप्लॉयमेंट अधिक लोगों की पसंद बन जाएगा। आप अपने कार्य की आवश्यकताओं, उपकरण की स्थितियों और बजट के आधार पर टूल और वर्कफ़्लो बना सकते हैं। मुझे उम्मीद है कि भविष्य में सभी के पास अपना खुद का स्थानीय Agent होगा, हर बार टोकन खपत को घूरने की ज़रूरत नहीं होगी, वास्तव में अपना खुद का "टोकन फ़्रीडम" प्राप्त करें!
संबंधित संसाधन
- Hugging Face: Ling-3.0-flash INT4 वेट
- ModelScope: Ling-3.0-flash INT4 वेट
- आधिकारिक vLLM अनुकूलन रिपॉजिटरी
📚 ऐतिहासिक लेख सारांश
- Hermes Agent प्रैक्टिकल गाइड: X चिंता से स्वचालित संचय तक
- प्रोग्रामर का एंटी-हेयर लॉस गाइड
- Hermes को iMessage से कनेक्ट करना
- Hermes को X Premium से कनेक्ट करना
- Hermes Agent पूर्ण गाइड
- Hermes Agent परिचयात्मक गाइड: सहायक मॉडल
- Hermes Agent परिचयात्मक गाइड
- Hermes Agent उन्नत गाइड
- Hermes Agent अपूर्ण गाइड
- नाइजीरिया में Claude Pro सब्सक्रिप्शन के लिए पूर्ण गाइड
- नाइजीरिया में Apple ID पंजीकृत करने के लिए ट्यूटोरियल
- तुर्की में आधी कीमत पर ChatGPT Plus सब्सक्रिप्शन
- US Apple ID पंजीकरण
- Claude/ChatGPT/Gemini Alipay सब्सक्रिप्शन
- Mac पर स्थानीय LLM डिप्लॉयमेंट के लिए पूर्ण ट्यूटोरियल
- IP गुणवत्ता जाँच
- Doubao आपके ब्रांड की अनुशंसा क्यों नहीं करता
- अपनी दादी को कैसे समझाएँ कि Doubao ने जो कहा वह सच नहीं है
यदि यह सहायक था, तो कृपया फ़ॉलो + बुकमार्क + फ़ॉरवर्ड करें 👏🏻
निरंतर शुरुआती-अनुकूल ट्यूटोरियल और AI टूल इनसाइट्स के लिए @Lonely__MH को फ़ॉलो करें।





