लोकल LLM डिप्लॉयमेंट के लिए संपूर्ण गाइड: टोकन फ्रीडम के लिए अपना खुद का एजेंट वर्कफ़्लो बनाना (शुरुआती लोगों के लिए)

@Lonely__MH
चीनी17 अग॰ 2026
153K
287
74
94
470

TL;DR

vLLM का उपयोग करके 124B Ling-3.0-flash मॉडल को लोकल स्तर पर डिप्लॉय करने पर एक विस्तृत ट्यूटोरियल, जिसमें परफॉरमेंस बेंचमार्क, TUI डेवलपमेंट और स्वचालित कंटेंट कार्यों के लिए मल्टी-मॉडल वर्कफ़्लो को एकीकृत करना शामिल है।

इस लेख का उद्देश्य यथासंभव सरल और समझने में आसान होना है, ताकि कोई भी नौसिखिया खिलाड़ी आसानी से स्थानीय मॉडल डिप्लॉयमेंट में महारत हासिल कर सके और अपना खुद का वर्कफ़्लो बना सके।

इस साल, घरेलू ओपन-सोर्स लार्ज लैंग्वेज मॉडल काफी सक्रिय रहे हैं। DeepSeek, Qwen, Kimi, GLM, MiniMax... एक के बाद एक नए मॉडल आ रहे हैं, लगातार अपने वेट खोल रहे हैं, और अमेरिकी क्लोज्ड-सोर्स मॉडल के साथ कदमताल करने लगे हैं।

लेकिन जितने अधिक मॉडल होंगे, मुझे उतना ही एक विशिष्ट प्रश्न की चिंता होती है: क्या ये मॉडल केवल वेब पेजों और API तक सीमित रह सकते हैं, या वास्तव में हमारी अपनी मशीनों में इंस्टॉल हो सकते हैं, स्थानीय फ़ाइलों, टूल्स और वर्कफ़्लो से जुड़ सकते हैं?

हालाँकि API टोकन की यूनिट कीमत आम तौर पर घट रही है, फिर भी उच्च-आवृत्ति कॉल और लंबे टेक्स्ट के मामले में लागत अधिक रहती है। इसमें प्राइवेसी, नेटवर्किंग और डेटा कंट्रोल जैसे मुद्दे जुड़ जाते हैं, जिससे स्थानीय डिप्लॉयमेंट अधिक से अधिक डेवलपर्स और उद्यमों की पसंद बनता जा रहा है।

इसलिए इस बार, मैं एक चुनौतीपूर्ण आकार और सिंगल-मशीन डिप्लॉयमेंट के लिए प्रतिनिधि मॉडल चुनना चाहता हूँ, ताकि पूरी स्थानीय डिप्लॉयमेंट प्रक्रिया को पूरा किया जा सके।

अंत में चुना गया मुख्य पात्र एंट बैलिंग द्वारा ओपन-सोर्स किया गया Ling-3.0-flash है—यह एक मिक्सचर ऑफ एक्सपर्ट्स (MoE) मॉडल है जिसमें कुल 124B पैरामीटर हैं। मेरे पास संयोग से एक NVIDIA DGX Spark है, जो इसे चला सकता है।

तो देर किस बात की, चलिए मुख्य शो शुरू करते हैं।

Lonely - inline image

01 शब्दावली प्राइमर

शुरू करने से पहले, आइए कुछ मॉडल-संबंधित शब्दों का परिचय दें ताकि सभी अपडेट हो जाएँ ✌🏻

मॉडल परिशुद्धता

एक ही मॉडल अक्सर विभिन्न परिशुद्धता या क्वांटाइज़्ड वर्शन प्रदान करता है, जो सीधे मॉडल के आकार और चलाने की सीमा को प्रभावित करते हैं।

Lonely - inline image

इस बार हम आधिकारिक Ling INT4 वर्शन का उपयोग कर रहे हैं, जो लगभग 71.75GB का है।

Dense या MoE

Lonely - inline image

ध्यान दें कि 5.1B केवल प्रति इन्फ़रेंस सक्रिय पैरामीटरों की संख्या है; पूरे 124B वेट को अभी भी मेमोरी में लोड करने की आवश्यकता है।

इन्फ़रेंस इंजन

इन्फ़रेंस इंजन वेट लोड करने, कॉन्टेक्स्ट और कंकरेंसी को मैनेज करने और इंटरफ़ेस प्रदान करने के लिए जिम्मेदार है। यह मॉडल को चलाने का टूल है, न कि स्वयं मॉडल।

Lonely - inline image

हमने इस बार vLLM को चुना क्योंकि वर्तमान आधिकारिक अनुकूलन Ling-3.0-flash के INT4 वेट और MTP स्पेक्युलेटिव डिकोडिंग को सपोर्ट करता है।

02 मॉडल इंस्टॉलेशन और डिप्लॉयमेंट

पहले, आइए इंस्टॉलेशन वातावरण का परिचय दें: मैं एक NVIDIA DGX Spark का उपयोग कर रहा हूँ, जो GB10 चिप और 121.6GB यूनिफ़ाइड मेमोरी से लैस है, जो ARM64 आर्किटेक्चर पर Ubuntu 24.04 चला रहा है। डिप्लॉयमेंट Ling-3.0-flash-INT4 है, और बाद के थ्रूपुट परीक्षण स्थानीय Qwen 3.8-27B को संदर्भ के रूप में उपयोग करेंगे।

आधिकारिक तौर पर एक बेसिक वर्शन और FP8, FP4, और INT4 जैसे विभिन्न परिशुद्धता वर्शन प्रदान किए गए हैं। आप अपने हार्डवेयर के अनुसार चुन सकते हैं।

एक 8B Ling-3.0-tiny और इसके FP8, INT4 वर्शन भी हैं। सामान्य Mac या एकल 4090 वाले उपयोगकर्ता Tiny के कम-परिशुद्धता वर्शन को प्राथमिकता दे सकते हैं।

Lonely - inline image

चरण 1: मॉडल डाउनलोड करें। मैंने इस बार आधिकारिक INT4 वर्शन का उपयोग किया। डाउनलोड प्रविष्टियाँ 👇🏻

यदि Hugging Face तक पहुँचना असुविधाजनक है, तो आप ModelScope से मैन्युअल रूप से डाउनलोड कर सकते हैं। डाउनलोड करने के बाद, कुल 24 safetensors शार्ड हैं, जो लगभग 71.75GB हैं। आपको रनटाइम के दौरान इन्फ़रेंस इंजन और KV Cache के लिए भी जगह छोड़नी होगी।

चरण 2: वातावरण तैयार करें। Ling-3.0-flash का BailingMoeV3 आर्किटेक्चर काफी नया है। मैंने llama.cpp के साथ GGUF का उपयोग करने का प्रयास किया, लेकिन यह unknown model architecture: 'bailingmoe3' त्रुटि देता है। इसलिए इस बार, मैंने सीधे आधिकारिक रूप से अनुकूलित vLLM ब्रांच का उपयोग किया:

text
1pip install uv
2uv venv ~/my_ling_env
3source ~/my_ling_env/bin/activate
4
5git clone -b ling_3_0 https://github.com/inclusionAI/vllm-ling-v3.git
6cd vllm-ling-v3
7VLLM_USE_PRECOMPILED=1 uv pip install --editable . --torch-backend=auto

चरण 3: इन्फ़रेंस सेवा शुरू करें। मॉडल पथ को अपने स्थानीय रूप से डाउनलोड किए गए INT4 वेट से बदलें:

text
1vllm serve /path/to/Ling-3.0-flash-int4 \
2 --served-model-name ling-int4 \
3 --host 127.0.0.1 \
4 --port 30000 \
5 --trust-remote-code \
6 --max-model-len 16384 \
7 --gpu-memory-utilization 0.8 \
8 --max-num-seqs 8 \
9 --reasoning-parser ling3 \
10 --speculative-config '{"method":"bailing_hybrid_v3_mtp","num_speculative_tokens":1}'

⚠️

कृपया कमांड में दिए गए पथों को अपनी मशीन के वास्तविक पथों से बदलें।

यहाँ, कॉन्टेक्स्ट सीमा 16K, कंकरेंसी 8, और MTP स्पेक्युलेटिव डिकोडिंग सक्षम है।

नोट: MTP (मल्टी-टोकन प्रेडिक्शन) मॉडल को एक साथ कई टोकन की भविष्यवाणी करने का प्रयास करने की अनुमति देता है। सही ढंग से भविष्यवाणी किए गए भागों को सीधे अपनाया जा सकता है, जिससे एक-एक करके टोकन उत्पन्न करने के लिए गणना के चक्र कम हो जाते हैं और आउटपुट गति बढ़ जाती है।

चरण 4: सेवा सत्यापित करें। शुरू होने के बाद, एक सरल अनुरोध भेजें:

bash
1curl -s http://127.0.0.1:30000/v1/chat/completions \
2 -H "Content-Type: application/json" \
3 -d '{"model":"ling-int4",
4 "messages":[{"role":"user","content":"नमस्ते, कृपया अपना परिचय एक वाक्य में दें।"}],
5 "stream":true}'

टर्मिनल स्ट्रीम में सामग्री वापस करना शुरू कर देता है, जो दर्शाता है कि यह 124B मॉडल स्थानीय रूप से चल रहा है।

Lonely - inline image

03 मॉडल प्रदर्शन और क्षमता का परीक्षण

  1. टोकन थ्रूपुट जब मॉडल पहली बार शुरू हुआ, तो मैंने vLLM के अंतर्निहित बेंचमार्क का उपयोग करके परीक्षणों का एक दौर चलाया। सभी 20 अनुरोध पूरे हुए, जिसमें आउटपुट थ्रूपुट 84.34 tok/s, कुल टोकन थ्रूपुट 133.10 tok/s, और MTP स्वीकृति दर 67.35% थी।
Lonely - inline image

मूल लॉग आउटपुट 👇🏻

text
1============ Serving Benchmark Result ============
2Successful requests: 20
3Failed requests: 0
4Request rate configured (RPS): 2.00
5Benchmark duration (s): 60.71
6Total input tokens: 2960
7Total generated tokens: 5120
8Request throughput (req/s): 0.33
9Output token throughput (tok/s): 84.34
10Peak output token throughput (tok/s): 61.00
11Peak concurrent requests: 20.00
12Total token throughput (tok/s): 133.10
13---------------Time to First Token----------------
14Mean TTFT (ms): 19692.98
15Median TTFT (ms): 18877.99
16P99 TTFT (ms): 40039.02
17-----Time per Output Token (excl. 1st token)------
18Mean TPOT (ms): 44.61
19Median TPOT (ms): 44.09
20P99 TPOT (ms): 49.68
21---------------Inter-token Latency----------------
22Mean ITL (ms): 74.09
23Median ITL (ms): 72.39
24P99 ITL (ms): 280.71
25---------------Speculative Decoding---------------
26Acceptance rate (%): 67.35
27Acceptance length: 1.67
28Drafts: 3051
29Draft tokens: 3051
30Accepted tokens: 2055
31Per-position acceptance (%):
32 Position 0: 67.35
33==================================================

इसके बाद, मैंने Ling और स्थानीय Qwen 3.8-27B पर कंकरेंसी परीक्षण किए। 8 कंकरेंसी पर, Ling का कुल थ्रूपुट 141.38 tok/s था, जबकि Qwen 3.8 का 32.61 tok/s था, इस दौर में लगभग 4.34 गुना का अंतर।

🔥🔥🔥Ling-3.0-Flash बनाम Qwen3.8-27B स्ट्रेस टेस्ट तुलना

Lonely - inline image

Ling-3.0-flash

Lonely - inline image

Qwen 3.8 -27B

Lonely - inline image
Lonely - inline image

कुछ लोग सोच सकते हैं: Ling की एकल कंकरेंसी केवल 34.77 tok/s क्यों है, लेकिन 8 कंकरेंसी पर यह 141.38 tok/s हो जाती है? तकनीकी मित्र यह भी पूछ सकते हैं कि क्या यह एकल कंकरेंसी स्कोर आधिकारिक डेटा की तुलना में धीमा है।

यहाँ हमें विशिष्ट परीक्षण विधि और विभिन्न मूल्यांकन विधियों के कारण होने वाले गति अंतर को समझाने की आवश्यकता है:

  1. परीक्षण विधि और वास्तविक एंड-टू-एंड लिंक: यह परीक्षण एक स्थानीय OpenAI-संगत इंटरफ़ेस का उपयोग करता है, HTTP स्ट्रीमिंग अनुरोधों के माध्यम से स्ट्रेस-टेस्टिंग करता है, न कि सेवा फ्रेमवर्क से अलग एक ऑफ़लाइन इन्फ़रेंस परीक्षण। प्रत्येक Ling अनुरोध लगभग 150 टोकन के लंबे टेक्स्ट प्रॉम्प्ट का उपयोग करता है, जो अधिकतम 512 टोकन उत्पन्न करता है। समय क्लाइंट के HTTP अनुरोध से लेकर स्ट्रीमिंग प्रतिक्रिया पूरी होने तक शुरू होता है, इस प्रकार इसमें स्थानीय HTTP कॉल, सेवा शेड्यूलिंग, टोकनाइज़र प्रोसेसिंग, प्रीफ़िल, टोकन-दर-टोकन डिकोडिंग और स्ट्रीमिंग रिटर्न शामिल हैं।
  2. सिंगल-स्ट्रीम आउटपुट दर बनाम मशीन कुल थ्रूपुट: सिंगल-स्ट्रीम गति (वास्तविक उपयोगकर्ता अनुभव): $c=1$ पर, एंड-टू-एंड आउटपुट दर लगभग 35.34 tok/s (वास्तविक एकल वार्तालाप परीक्षण 38+ tok/s पर) है, जो प्रति सेकंड 35 से अधिक चीनी अक्षरों के बराबर है, जो देखने में बेहद तेज़ है; कुल थ्रूपुट (कंकरेंसी के तहत कुल आउटपुट): जैसे-जैसे कंकरेंसी बढ़ती है, vLLM कंटीन्यूअस बैचिंग का उपयोग करके कई अनुरोधों को GPU गणनाओं में संयोजित करता है, ब्लैकवेल की यूनिफ़ाइड मेमोरी बैंडविड्थ का पूरा उपयोग करता है। 8 कंकरेंसी पर, मशीन का कुल थ्रूपुट बढ़कर 141.38 tok/s हो गया।

जहाँ तक इस बात का सवाल है कि यह कुछ आधिकारिक बेंचमार्क से भिन्न क्यों है, मुख्य बात परीक्षण मानदंड है। मॉडल परिशुद्धता, इन्फ़रेंस इंजन, कॉन्टेक्स्ट लंबाई, इनपुट/आउटपुट टोकन गणना, कंकरेंसी स्केल, और ऑफ़लाइन इन्फ़रेंस या HTTP सेवाओं का उपयोग किया जाता है या नहीं, ये सभी अंतिम परिणाम को प्रभावित करते हैं। केवल जब ये स्थितियाँ मूल रूप से सुसंगत हों, तभी संख्याएँ सीधी तुलना के लिए उपयुक्त होती हैं।

सीधे शब्दों में कहें: मूल्यांकन विधियों के कारण गति भिन्न होती है—यदि अत्यधिक उच्च कंकरेंसी (जैसे 32/64) में या नेटवर्क प्रोटोकॉल के बिना शुद्ध कंप्यूटिंग वातावरण में परीक्षण किया जाता है, तो कुल थ्रूपुट संख्याएँ अधिक दिखाई देंगी; हमारे दैनिक एकल-व्यक्ति वार्तालापों या कोडिंग प्रोडक्शन कॉल में, Ling की सिंगल-स्ट्रीम 35+ tok/s और 220ms से कम की फर्स्ट-टोकन विलंबता पहले से ही बेहद सहज और अंतराल-मुक्त लगती है।

एकल कंकरेंसी पर, Ling की औसत सिंगल-स्ट्रीम गति लगभग 35.34 tok/s है; 8 कंकरेंसी पर, कुल थ्रूपुट 141.38 tok/s तक पहुँच जाता है। Qwen3.8 का कुल थ्रूपुट 8 कंकरेंसी पर 32.61 tok/s है। इस दौर में, Ling का लाभ मुख्य रूप से आउटपुट गति और समवर्ती थ्रूपुट में परिलक्षित होता है, वास्तविक उपयोग में उत्तर काफी तेज़ होते हैं।

2. वास्तविक क्षमताएँ

बेंचमार्क केवल प्रदर्शन के एक हिस्से को दर्शाते हैं; वास्तविक उपयोगिता विशिष्ट समस्याओं पर मॉडल के प्रदर्शन पर निर्भर करती है। मैंने सरल परीक्षण के लिए तीन दिशाएँ चुनीं।

(1) तार्किक तर्क

मैंने चिकन-एंड-रैबिट समस्या का एक रूपांतर, एक क्लासिक कार वॉश समस्या, और एक कार वॉश मशीन समस्या तैयार की, मुख्य रूप से यह देखने के लिए कि क्या यह परिचित दिखने वाले उत्तर को लागू करने के बजाय शर्तों को सटीक रूप से समझ सकता है। इनमें से, चिकन-एंड-रैबिट समस्या में पारंपरिक पैटर्न को तोड़ने के लिए तीन पैरों वाले 4 यांत्रिक पक्षी शामिल थे।

Lonely - inline image

(2) सुरक्षा सीमाएँ: इसके बाद, मैंने उच्च-जोखिम वाले संचालनों पर इसकी प्रतिक्रिया का परीक्षण किया: क्या यह सीधे निष्पादित करता है या जोखिमों की पहचान करता है, उपयोगकर्ता के साथ पुष्टि करता है, और सुरक्षित विकल्प प्रदान करता है।

Lonely - inline image

(3) लंबा टेक्स्ट

अंत में, लंबे टेक्स्ट परीक्षण का एक दौर। मैंने एक लंबे कॉन्टेक्स्ट में महत्वपूर्ण जानकारी छिपाई ताकि यह देखा जा सके कि क्या यह सटीक रूप से ढूँढ़ और उत्तर दे सकता है, साथ ही लंबे टेक्स्ट के तहत आउटपुट गति और स्थिरता का निरीक्षण किया जा सके।

Lonely - inline image

04 API से TUI, फिर टूल कॉलिंग तक

हमने मॉडल डिप्लॉयमेंट और क्षमता परीक्षण पूरा कर लिया है, लेकिन सामान्य उपयोगकर्ताओं के लिए, curl दैनिक उपयोग की तुलना में इंटरफ़ेस सत्यापित करने के लिए अधिक उपयुक्त है। स्थानीय मॉडल से लंबे समय तक बात करने के लिए, एक अधिक सुविधाजनक इंटरैक्शन इंटरफ़ेस की आवश्यकता है।

इसलिए मैंने पहले एक सरल TUI बनाया, एक चैट इंटरफ़ेस जो टर्मिनल में चलता है। यह जटिल सॉफ़्टवेयर नहीं है; मैंने AI से एक Python स्क्रिप्ट लिखवाई जो स्थानीय इंटरफ़ेस कॉल, स्ट्रीमिंग आउटपुट और वार्तालाप इतिहास को समाहित करती है, फिर इसे एक कमांड से शुरू किया:

text
1python3 ling-3.0-chat.py

इस तरह, मुझे हर बार curl लिखने की ज़रूरत नहीं है। टर्मिनल खोलें और सीधे चैट करें; उत्तर स्ट्रीम में आते हैं, और आप TPS, TTFT और टोकन गणना देख सकते हैं। मैंने पिछली क्षमता परीक्षण इसी इंटरफ़ेस में पूरे किए।

हालाँकि, इस बिंदु पर, TUI केवल एक टेक्स्ट चैट टूल है जिसमें टूल कॉल करने की क्षमता नहीं है। लार्ज मॉडल एक "दिमाग" की तरह है जो सोचने के लिए जिम्मेदार है, लेकिन इसके पास फ़ाइलें पढ़ने, कमांड निष्पादित करने या सिस्टम की वर्तमान स्थिति जानने के लिए कोई "हाथ और पैर" नहीं हैं।

इसे सिस्टम क्षमताओं को कॉल करने देने के लिए, हमें टूल कॉलिंग जोड़ने की आवश्यकता है। सीधे शब्दों में कहें, कमांड निष्पादन, फ़ाइल पढ़ना और लिखना जैसे संचालन को टूल के रूप में समाहित किया जाता है। मॉडल पहले निर्णय लेता है कि उसे किस जानकारी की आवश्यकता है, फिर एक टूल उपयोग शुरू करता है; Python स्क्रिप्ट इसे निष्पादित करती है और आगे की प्रक्रिया के लिए परिणाम मॉडल को वापस देती है।

उदाहरण के लिए, शुरू में, जब मैंने इसे सिस्टम GPU जानकारी जाँचने के लिए कहा, तो यह वास्तविक उपयोग नहीं जानता था और केवल मुझे बता सकता था कि कैसे जाँच करें। टूल कॉलिंग जोड़ने के बाद, यह स्वयं सिस्टम कमांड निष्पादित कर सकता था और क्वेरी परिणामों को सीधे TUI में व्यवस्थित कर सकता था।

उसी सिद्धांत के आधार पर, आप वेब सर्च, आंतरिक उद्यम इंटरफ़ेस, डेटाबेस आदि को जोड़ना जारी रख सकते हैं। विशिष्ट टूल को व्यावसायिक आवश्यकताओं के अनुसार विस्तारित किया जा सकता है।

Lonely - inline image

05 एक विज़ुअल इंटरफ़ेस से कनेक्ट करना

व्यक्तिगत उपयोग के लिए, टूल कॉलिंग वाला TUI वास्तव में काफी पर्याप्त है। आगे बढ़ने और मॉडल को एक अधिक पूर्ण Agent वर्कबेंच में रखने के लिए, आप Harness जैसे एजेंट फ्रेमवर्क से कनेक्ट कर सकते हैं।

इस बार मैंने लियांग शेंग के DeepSeek Harness को चुना, जो न केवल एक चैट पेज जोड़ता है बल्कि कॉन्टेक्स्ट मैनेजमेंट, वर्कस्पेस, टूल कॉलिंग, अनुमति नियंत्रण और टास्क प्लानिंग भी प्रदान करता है, जिसमें एक अंतर्निहित Web UI है। यह "सब कुछ एक प्लगइन है" आर्किटेक्चर का उपयोग करता है, जो भविष्य में कार्यात्मक विस्तार की अनुमति देता है।

ध्यान दें कि DeepSeek Harness अभी भी डेवलपर पूर्वावलोकन चरण में है और तेज़ी से अपडेट होता है, जिससे असंगत परिवर्तन हो सकते हैं। कई अन्य ओपन-सोर्स Agent फ्रेमवर्क हैं; आप अपनी आवश्यकताओं के अनुसार चुन सकते हैं।

कनेक्शन प्रक्रिया जटिल नहीं है: मुख्य बात एक कस्टम मॉडल सेवा जोड़ना और पते को vLLM द्वारा प्रदान किए गए स्थानीय इंटरफ़ेस पर इंगित करना है। Web UI में कॉन्फ़िगर करने के अलावा, आप कॉन्फ़िगरेशन फ़ाइल को नीचे दिखाए अनुसार संशोधित भी कर सकते हैं:

text
1llm-pi-ai:
2 providers:
3 ling:
4 displayName: "Ling-3.0-flash (124B)"
5 api: openai-completions
6 baseURL: http://127.0.0.1:30000/v1
7 apiKeyEnv: OPENAI_API_KEY
8 models:
9 - id: ling-int4
10 name: Ling-3.0-flash (124B MoE)

Web UI शुरू करने के बाद, अपने ब्राउज़र में डिफ़ॉल्ट पता खोलें:

text
1http://localhost:3080

इस तरह, दैनिक चैटिंग, इतिहास और मॉडल स्विचिंग सभी DeepSeek Harness में किए जा सकते हैं। Harness स्वयं फ़ाइल संचालन, कमांड निष्पादन और टास्क प्लानिंग प्रदान करता है, जिसे प्लगइन के माध्यम से और बढ़ाया जा सकता है। विशिष्ट उपयोग और तृतीय-पक्ष प्लगइन के लिए, इच्छुक मित्र उन्हें खोज सकते हैं।

ध्यान दें कि मैंने Python TUI में जो टूल लिखे थे, वे स्वचालित रूप से स्थानांतरित नहीं होंगे। Harness में उपयोग करने के लिए, उन्हें इसके प्लगइन तंत्र के अनुसार पुन: एकीकृत करने की आवश्यकता है। नीचे Ling के लिए मेरे द्वारा बनाया गया वास्तविक एकीकरण प्रभाव है; आप रिकॉर्डिंग देख सकते हैं।

Lonely - inline image

06 एक AI वर्कफ़्लो बनाना

इस बिंदु पर, Ling-3.0-flash के लिए डिप्लॉयमेंट से इंटरफ़ेस और टूल कॉलिंग तक का सिंगल-मॉडल लिंक पूरी तरह से स्थापित हो गया है।

हालाँकि, वास्तविक परियोजनाओं में, हम आमतौर पर केवल एक मॉडल का उपयोग नहीं करते हैं। विभिन्न मॉडल अलग-अलग चीज़ों में उत्कृष्ट होते हैं; उन्हें संयोजित करना अक्सर एक मॉडल को सब कुछ संभालने से बेहतर होता है।

Ling-3.0-flash का लाभ टेक्स्ट प्रोसेसिंग और जनरेशन गति है, लेकिन यह मूल मल्टीमॉडल इनपुट का समर्थन नहीं करता है। यदि किसी कार्य में छवियों या वीडियो को समझने की आवश्यकता है, तो आप Qwen3.8-27B जैसे मल्टीमॉडल मॉडल को कनेक्ट कर सकते हैं; यदि आपको वीडियो जनरेट करने की आवश्यकता है, तो आप हाल ही में ओपन-सोर्स किए गए MiniMax H3 को कनेक्ट कर सकते हैं। प्रत्येक मॉडल वह संभालता है जिसमें वह सबसे अच्छा है, परिणामों को अगले तक पहुँचाता है।

उदाहरण के लिए, एक वीडियो जनरेशन वर्कफ़्लो बनाने के लिए, Ling पहले आवश्यकताओं को समझ सकता है, स्क्रिप्ट लिख सकता है और स्टोरीबोर्ड को विभाजित कर सकता है, फिर मल्टीमॉडल मॉडल संदर्भ सामग्री और दृश्य स्थिरता की जाँच करता है, और अंत में, वीडियो मॉडल इसे जनरेट करता है। जनरेशन के बाद, दृश्य निरीक्षण का एक और दौर किया जा सकता है, प्रॉम्प्ट को संशोधित करने और परिणामों के आधार पर पुन: जनरेट करने के लिए:

text
1आवश्यकताएँ और सामग्री
2→ Ling स्क्रिप्ट और स्टोरीबोर्ड उत्पन्न करता है
3→ मल्टीमॉडल मॉडल सामग्री और दृश्य आवश्यकताओं की जाँच करता है
4→ MiniMax H3 वीडियो उत्पन्न करता है
5→ मल्टीमॉडल मॉडल दृश्य और निरंतरता की जाँच करता है
6→ Ling फीडबैक के आधार पर प्रॉम्प्ट को समायोजित करता है
7→ मानव अंतिम समीक्षा पूरी करता है

नीचे दिया गया वीडियो Ling-3.0-flash द्वारा उत्पन्न प्रॉम्प्ट का वास्तविक प्रभाव दिखाता है, जिसे बाद में MiniMax H3 को जनरेशन के लिए दिया गया।

Lonely - inline image

एक बार यह प्रक्रिया तय हो जाने के बाद, आपको बार-बार उपयोग के लिए केवल आवश्यकताओं और सामग्री को बदलने की आवश्यकता है। हालाँकि, एक साथ कई लार्ज मॉडल को स्थानीय रूप से चलाने के लिए बहुत अधिक VRAM और मेमोरी की आवश्यकता होती है। Ling INT4 लगभग 72GB है, Qwen3.8-27B BF16 लगभग 51.77GB है, साथ ही KV Cache और वीडियो मॉडल; इस Spark पर उन सभी को एक साथ रखना मुश्किल है।

वास्तविक डिप्लॉयमेंट से पहले, यह गणना करना सुनिश्चित करें कि प्रत्येक मॉडल को कितनी VRAM या यूनिफ़ाइड मेमोरी की आवश्यकता है। जब संसाधन अपर्याप्त हों, तो आप चरण-दर-चरण मॉडल स्विच कर सकते हैं, क्वांटाइज़्ड वर्शन चुन सकते हैं, या मॉडल को कई उपकरणों में विभाजित कर सकते हैं। कई मॉडल अब स्वतंत्र रूप से नहीं चलते हैं बल्कि एक ही कार्य के आसपास सहयोग करते हैं—यह वास्तव में उपयोग करने योग्य मल्टी-मॉडल AI वर्कफ़्लो है।

07 अंतिम विचार

मॉडल डिप्लॉयमेंट, TUI और टूल कॉलिंग से लेकर मल्टी-मॉडल वर्कफ़्लो तक, पूरी श्रृंखला पूरी हो गई है। इस लेख का उद्देश्य एक निश्चित कॉन्फ़िगरेशन के बजाय एक दोहराने योग्य विधि साझा करना है।

ओपन-सोर्स मॉडल अपडेट होते रहेंगे। भविष्य में, चाहे आप मॉडल, क्वांटाइज़ेशन वर्शन या इन्फ़रेंस इंजन बदलें, वेट डाउनलोड करने और सेवाएँ शुरू करने से लेकर टूल और वर्कफ़्लो कनेक्ट करने का तरीका ज्यादा नहीं बदलेगा।

यदि स्थितियाँ अनुमति देती हैं, तो मैं अभी भी सभी को व्यक्तिगत रूप से स्थानीय मॉडल डिप्लॉय करने की सलाह देता हूँ:

  1. डेटा नियंत्रण: फ़ाइलें, वार्तालाप और व्यावसायिक डेटा आपकी मशीन या इंट्रानेट पर रहते हैं, निर्देशिका और कमांड अनुमतियाँ आपके द्वारा प्रतिबंधित की जाती हैं।
  2. उच्च-आवृत्ति उपयोग के लिए उपयुक्त: प्रति उपयोग टोकन लागत की गणना करने की आवश्यकता नहीं है, नेटवर्क और तृतीय-पक्ष सेवाओं पर निर्भरता कम करता है।
  3. आसान अनुकूलन: मॉडल, क्वांटाइज़ेशन परिशुद्धता, इन्फ़रेंस इंजन और टूल सभी को समायोजित किया जा सकता है, और आंतरिक इंटरफ़ेस और डेटाबेस को जोड़ा जा सकता है।

जैसे-जैसे ओपन-सोर्स मॉडल मजबूत होते जाएंगे, स्थानीय डिप्लॉयमेंट अधिक लोगों की पसंद बन जाएगा। आप अपने कार्य की आवश्यकताओं, उपकरण की स्थितियों और बजट के आधार पर टूल और वर्कफ़्लो बना सकते हैं। मुझे उम्मीद है कि भविष्य में सभी के पास अपना खुद का स्थानीय Agent होगा, हर बार टोकन खपत को घूरने की ज़रूरत नहीं होगी, वास्तव में अपना खुद का "टोकन फ़्रीडम" प्राप्त करें!

संबंधित संसाधन

📚 ऐतिहासिक लेख सारांश

  1. Hermes Agent प्रैक्टिकल गाइड: X चिंता से स्वचालित संचय तक
  2. प्रोग्रामर का एंटी-हेयर लॉस गाइड
  3. Hermes को iMessage से कनेक्ट करना
  4. Hermes को X Premium से कनेक्ट करना
  5. Hermes Agent पूर्ण गाइड
  6. Hermes Agent परिचयात्मक गाइड: सहायक मॉडल
  7. Hermes Agent परिचयात्मक गाइड
  8. Hermes Agent उन्नत गाइड
  9. Hermes Agent अपूर्ण गाइड
  10. नाइजीरिया में Claude Pro सब्सक्रिप्शन के लिए पूर्ण गाइड
  11. नाइजीरिया में Apple ID पंजीकृत करने के लिए ट्यूटोरियल
  12. तुर्की में आधी कीमत पर ChatGPT Plus सब्सक्रिप्शन
  13. US Apple ID पंजीकरण
  14. Claude/ChatGPT/Gemini Alipay सब्सक्रिप्शन
  15. Mac पर स्थानीय LLM डिप्लॉयमेंट के लिए पूर्ण ट्यूटोरियल
  16. IP गुणवत्ता जाँच
  17. Doubao आपके ब्रांड की अनुशंसा क्यों नहीं करता
  18. अपनी दादी को कैसे समझाएँ कि Doubao ने जो कहा वह सच नहीं है

यदि यह सहायक था, तो कृपया फ़ॉलो + बुकमार्क + फ़ॉरवर्ड करें 👏🏻

निरंतर शुरुआती-अनुकूल ट्यूटोरियल और AI टूल इनसाइट्स के लिए @Lonely__MH को फ़ॉलो करें।

YouMind में रीमिक्स करें

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें