पहले, मैंने Codex और Hyperframes का उपयोग करके एक किताब-संबंधित Douyin अकाउंट के वायरल वीडियो को डीकंस्ट्रक्ट करने की कोशिश की थी, और साउंड इफेक्ट्स को सभी से लगातार प्रशंसा मिली।
आज, मैं एक विस्तृत लेख लिख रही हूँ जिसमें आपको चरण-दर-चरण सिखाऊँगी कि कैसे वायरल Douyin वीडियो को डीकंस्ट्रक्ट करें और एक वर्कफ़्लो को ठीक करें, ताकि आप भी AI का उपयोग करके वीडियो बनाने की क्षमता प्राप्त कर सकें।
https://x.com/369Serena/status/2073012234184282287
1. तैयारी
पहले, सभी को अपने उपकरण तैयार करने चाहिए:
- आपको Codex जैसे एजेंट की आवश्यकता है।
- फिर प्लगइन स्टोर पर जाएँ और दो टूल्स इंस्टॉल करें:
(a) Hyperframes: यह HTML फॉर्मेट में वीडियो बनाता है, जो कॉर्पोरेट प्रेजेंटेशन, डेटा एनिमेशन या शोकेस वीडियो के लिए बहुत उपयुक्त है।
(b) Remotion: React में लिखा गया, यह वीडियो-एज़-कोड को प्राप्त करता है। एक बार जब आप एक थीम स्टाइल तय कर लेते हैं, तो यह कोडिंग के माध्यम से उच्च मात्रा में रिप्लिकेशन के लिए बहुत उपयुक्त है। मैंने कई ब्लॉगर्स को "Xiao Lin Shuo" शैली में एनिमेशन बनाने के लिए Remotion का उपयोग करते देखा है, जो टॉकिंग-हेड वीडियो के साथ बहुत अच्छा काम करता है।
इसके अतिरिक्त, आप डीकंस्ट्रक्शन में सहायता के लिए कुछ Skills इंस्टॉल कर सकते हैं। यदि आप एक वायरल वीडियो की संरचना को समझना चाहते हैं—जैसे पहले कुछ सेकंड दर्शकों को कैसे आकर्षित करते हैं, साउंड इफेक्ट्स क्या हैं, और नैरेशन और विज़ुअल्स के बीच लय क्या है—तो आप निम्नलिखित Skills के माध्यम से उन्हें डीकंस्ट्रक्ट और रिप्लिकेट कर सकते हैं:
- Claude Video: वीडियो प्रक्रिया को डीकंस्ट्रक्ट करने के लिए उपयोग किया जाता है ताकि अगले चरण में आसानी से रिप्लिकेट किया जा सके।
- Video Use: मैं संपादन शुरुआती लोगों के लिए इसकी अत्यधिक अनुशंसा करती हूँ। यह एक "वीडियो एडिटिंग डायरेक्टर" की तरह काम करता है जो आपकी ज़रूरतों के अनुसार उपयुक्त टूल्स को कॉल कर सकता है। उन नौसिखियों के लिए जो नहीं जानते कि कब किस टूल का उपयोग करना है, यह एक मास्टर डायरेक्टर की भूमिका निभाता है।
तैयारी का काम यहीं समाप्त होता है।
2. वीडियो प्रोडक्शन वर्कफ़्लो
Codex + Hyperframes के साथ वीडियो बनाने के लिए इस क्रम का पालन किया जा सकता है:
1️⃣ पहले वीडियो स्पेसिफिकेशन परिभाषित करें
उदाहरण: 30 सेकंड, 9:16, चीनी, ज्ञान-आधारित, पुस्तक परिचय, X / TikTok / Xiaohongshu के लिए।
2️⃣ नैरेशन स्क्रिप्ट लिखें
पहले Codex को 30 सेकंड की चीनी नैरेशन लिखने दें; विज़ुअल्स में जल्दबाज़ी न करें।
3️⃣ विज़ुअल शैली की पुष्टि करें
उदाहरण: डार्क एडिटोरियल नॉलेज वीडियो, हाई-एंड नॉलेज स्टाइल, डार्क बैकग्राउंड, मुख्य विज़ुअल के रूप में बुक कवर, कैमरे का हल्का ज़ूम-इन।
4️⃣ टाइमस्टैम्प स्टोरीबोर्ड बनाएं
नैरेशन को 4-6 विज़ुअल सेगमेंट में तोड़ें, प्रत्येक एक कोर जानकारी के अनुरूप हो।
5️⃣ सामग्री तैयार करें
बुक कवर, शीर्षक, कीवर्ड, लोगो, बैकग्राउंड म्यूज़िक, वॉइसओवर टेक्स्ट।
6️⃣ वॉइसओवर जनरेट करें
आप Edge TTS, ElevenLabs या Hyperframes मीडिया-संबंधित वर्कफ़्लो का उपयोग कर सकते हैं।
7️⃣ वॉइसओवर का ट्रांसक्रिप्ट बनाएं
अंतिम ऑडियो का उपयोग करके ट्रांसक्रिप्ट जनरेट करें; सबटाइटल टाइमिंग का मैन्युअल अनुमान न लगाएं।
8️⃣ Hyperframes कम्पोज़िशन बनाएं
सही data-start / data-duration / data-track-index का उपयोग करके index.html लिखें।
9️⃣ सबटाइटल बनाएं
ट्रांसक्रिप्ट के आधार पर स्वचालित रूप से सबटाइटल सिंक करें।
🔟 पूर्वावलोकन करें
पहले पूर्वावलोकन देखें; सीधे अंतिम वीडियो रेंडर न करें।
1️⃣1️⃣ मान्य करें / निरीक्षण करें
त्रुटियों, फ़ॉन्ट, लेआउट ओवरफ़्लो और सबटाइटल बाधाओं की जाँच करें।
1️⃣2️⃣ MP4 रेंडर करें
सब कुछ सही होने की पुष्टि करने के बाद ही रेंडर करें।
ये सामान्य कदम हैं। वास्तव में, कई भागों में मैन्युअल हस्तक्षेप की आवश्यकता नहीं होती है, इसलिए इन सामान्य चरणों को समझना ही पर्याप्त है; मैन्युअल भाग वास्तव में बहुत कम है।
3. प्रारंभिक मैन्युअल डीकंस्ट्रक्शन + स्क्रिप्ट जनरेशन
अब हमें वीडियो को डीकंस्ट्रक्ट करने की आवश्यकता है।
पहले, हमें वीडियो संरचना को डीकंस्ट्रक्ट करने के लिए Claude Video का उपयोग करना होगा। मैंने जिसे डीकंस्ट्रक्ट किया वह एक बुक अकाउंट था, इसलिए इसकी संरचना बहुत सरल है: पहले कुछ सेकंड दर्शकों को बनाए रखने के लिए होते हैं, उसके बाद एक पुस्तक परिचय या समीक्षा।
नैरेशन स्क्रिप्ट जनरेशन के अगले चरण इस प्रकार हैं:
- जानकारी एकत्र करें: (a) पुस्तक जानकारी एकत्र करने के लिए Codex का उपयोग करें। (b) बार-बार हाइलाइट किए गए सेक्शन और टिप्पणियाँ देखने के लिए WeChat Reading Skills कनेक्शन को कॉल करें। (c) Codex से प्रसिद्ध पुस्तक समीक्षाएँ खोजवाएं।
- परिचय जनरेट करें: Codex को पुस्तक तथ्यों के आधार पर एक परिचय जनरेट करने दें। यह परिचय सेल्फ-मीडिया प्लेटफॉर्म के लिए "AI फ्लेवर" को हटाना चाहिए। आप इसे अपनी सौंदर्य आवश्यकताओं के अनुसार समायोजित कर सकते हैं, विशिष्ट आवश्यकताओं में शामिल हैं: (a) सामान्य AI अभिव्यक्तियों से बचें जैसे "यह नहीं है... बल्कि...". (b) अत्यधिक समानांतरता वाले वाक्य संरचनाओं से बचें। (c) अभिव्यक्ति सहज और प्राकृतिक होनी चाहिए, पुस्तक की कहानी को सीधे-सीधे बताएं, न कि अहंकारी लहजे में परिचय दें।
इस भाग के लिए हमें दो बिंदुओं के आधार पर काम करने की आवश्यकता है:
- पहले डीकंस्ट्रक्ट की गई वीडियो संरचना के आधार पर।
- हमें एक गेटकीपर के रूप में कार्य करना होगा ताकि समीक्षा कर सकें कि कॉपी व्यवहार्य है या नहीं।
एक बार जनरेट होने के बाद, आप Codex द्वारा एकत्र और व्यवस्थित सामग्री को एक Skill में बदल सकते हैं। इस तरह, नैरेशन स्क्रिप्ट को भविष्य में पुन: उपयोग किया जा सकता है।
सब कुछ Codex द्वारा तथ्यों के आधार पर लिखा जाना चाहिए। इस ऑपरेशन के बाद, यह मुझे एक नैरेशन स्क्रिप्ट देगा, जो पहली समग्र स्क्रिप्ट प्रोडक्शन को पूरा करेगा।
4. ऑडियो TTS फ़ाइल प्रोसेसिंग: एक प्राकृतिक, आकर्षक आवाज़ प्राप्त करना
नैरेशन तैयार होने के बाद, काम का एक और बड़ा हिस्सा—जिसे मैंने अभी तक वॉइस जनरेशन API को जोड़कर स्वचालित नहीं किया है—ऑडियो एडजस्टमेंट है।
हालांकि, मेरा मानना है कि यह किया जा सकता है, इसलिए मैं लिखूंगी कि आवाज़ को अधिक प्राकृतिक, आकर्षक और कहानी-उन्मुख बनाने के लिए कैसे समायोजित किया जाए।
मैंने पहले एक ट्वीट में साझा किया था कि मैंने ElevenLabs का उपयोग किया, जिसे Codex ने अनुशंसित किया था। इसमें अंग्रेजी आवाज़ें वास्तव में परिपूर्ण हैं, विभिन्न देशों की आवाज़ें उपलब्ध हैं।
लेकिन चीनी वॉइस जनरेशन का उपयोग करते समय, मैंने पाया कि यह चीनी को अच्छी तरह से नहीं पहचानता, जिसके परिणामस्वरूप कई टाइपो होते हैं। इस मामले में, यह सिर्फ "AI फ्लेवर" का मुद्दा नहीं है; यह बस उपयोग करने योग्य नहीं है। Codex ने मुझे जो समाधान दिया वह पहले Jianying या BytePlus (Volcengine) API का उपयोग करना था।
चूंकि मेरे पास अभी तक BytePlus API नहीं है, मैंने अपने कंप्यूटर पर Jianying ऐप का उपयोग किया।
मेरी विधि बहुत सरल है:
- एक नया प्रोजेक्ट बनाएं और टेक्स्ट विकल्प खोजें।
- "Text to Speech" फ़ंक्शन का उपयोग करें और मुझे पसंद आने वाली आवाज़ चुनें।
- नैरेशन कॉपी को सीधे पेस्ट करें और जनरेट पर क्लिक करें।
- अंत में, आवाज़ को एक्सपोर्ट करें (Jianying केवल MP4 फ़ाइलें एक्सपोर्ट कर सकता है)।
- मैं इस MP4 फ़ाइल को Codex को फीड करती हूँ।
Codex के पिछले वॉइस विश्लेषण के आधार पर, मैं इसे ध्वनि को प्रोसेस करने में मदद करने के लिए कहती हूँ ताकि वह बेंचमार्क वीडियो की तरह प्राकृतिक, कहानी कहने वाली और आकर्षक हो।
Codex की ध्वनि संभालने की प्रक्रिया इस प्रकार है:
- स्वचालित विश्लेषण: Codex पहले मूल वीडियो के साउंड पैरामीटर का विश्लेषण करता है और तदनुसार मेरी MP4 फ़ाइल को संशोधित करता है।
- पैरामीटर सेटिंग्स: मैं यहाँ प्रासंगिक पैरामीटर का स्क्रीनशॉट रखूंगी। आप स्क्रीनशॉट Codex को भेज सकते हैं, और यह आपके लिए उस प्रभाव को प्रोसेस करेगा।
- सरल विधि: या इससे भी सरल विधि का उपयोग करें—सीधे इसे बेंचमार्क वीडियो का एक सेगमेंट दें और बताएं, "मैं चाहती हूँ कि ध्वनि इस तरह प्रोसेस हो," और Codex इसे आपके लिए संभाल लेगा।

इस तरह से प्रोसेस की गई ध्वनि परिपूर्ण होती है। एक बार जब आप इस ध्वनि प्रोसेसिंग क्षमता में महारत हासिल कर लेते हैं, तो आप इसे अन्य प्रकार के वीडियो प्रोडक्शन में पुन: उपयोग कर सकते हैं, जैसे:
(a) फिल्म व्याख्याएँ या कहानी कथन
(b) जीवन दर्शन या प्रेरणादायक वीडियो
(c) विज्ञान लोकप्रियकरण अकाउंट
इन परिदृश्यों में, यह ध्वनि प्रोसेसिंग विधि पूरी तरह से लागू होती है।
जैसा कि मैंने उल्लेख किया, यह भाग आदर्श रूप से स्वचालित होना चाहिए। सेल्फ-मीडिया क्रिएशन में, जब भी संभव हो मैन्युअल काम से बचें; ऐसी "दर्द रहित" स्थिति में, बने रहना बहुत आसान है। इसलिए बाद में, मैं BytePlus API का उपयोग करके Codex को स्वचालित रूप से नैरेशन और वॉइस TTS फ़ाइलें जनरेट करने का प्रयास करूंगी।
5. विज़ुअल्स, सबटाइटल और ऑडियो अलाइनमेंट के लिए Hyperframes
अगला है विज़ुअल्स बनाना और आवाज़ को सबटाइटल से मिलाना। इस स्तर पर, मैंने बिल्कुल हस्तक्षेप नहीं किया क्योंकि Codex के पास पहले से ही एक सामान्य योजना थी। मैंने पहले ही इसे एक बेंचमार्क वीडियो फीड कर दिया था, और अब नैरेशन और वॉइसओवर के साथ, Codex अपने आप वीडियो बनाता है।
वीडियो निर्माण के बाद जनरेट किया गया संस्करण पहली बार परिपूर्ण नहीं होगा; कई स्थितियाँ उत्पन्न हो सकती हैं:
- आवाज़ और सबटाइटल मेल नहीं खाते: आपको Codex से संवाद करना होगा और इसे उन्हें संरेखित करने देना होगा। Codex स्वचालित रूप से फ्रेम निकालेगा यह जाँचने के लिए कि वे मेल क्यों नहीं खाते; इसमें लगभग दो समायोजन की आवश्यकता हो सकती है।
- विज़ुअल समस्याएँ: जिसमें विज़ुअल सामग्री, सबटाइटल पोजिशनिंग और परिणामी रूप शामिल हैं। इन्हें Codex के साथ बार-बार संवाद किया जा सकता है, इसे लगातार याद दिलाते हुए कि वह उस वीडियो के करीब जाए जिसे हम रिप्लिकेट करना चाहते हैं।
एक बार पूरी प्रक्रिया सुचारू हो जाने पर, हम उच्च स्तर की रिप्लिकेशन वाले वीडियो जनरेट कर सकते हैं। यदि हम पूरे वर्कफ़्लो को स्वचालित कर सकते हैं, तो हम बैचों में अकाउंट चला सकते हैं। चाहे वह बुक अकाउंट हो या अन्य प्रकार, सभी को इस प्रक्रिया का पालन करके डीकंस्ट्रक्ट और रिप्लिकेट किया जा सकता है।
6. सारांश
अंत में, मुझे उम्मीद है कि यह लेख सभी के लिए उपयोगी है।
मैं भी करते-करते सीखने की स्थिति में हूँ, और मुझे उम्मीद है कि हम और अधिक संवाद और विचारों का आदान-प्रदान कर सकते हैं। अक्सर, ऐसा नहीं है कि हम नहीं कर सकते, बल्कि यह है कि हमने अभी तक कार्रवाई नहीं की है।
Codex का उपयोग करने के लिए भी यही बात लागू होती है; जब तक हम कार्रवाई करना शुरू करते हैं और Codex के साथ प्राकृतिक भाषा में बातचीत करते हैं, हम कदम-दर-कदम ये समाधान पा सकते हैं। मेरा मानना है कि जब तक हर कोई इसे करना शुरू करता है, हर कोई सेल्फ-मीडिया में जीविका कमाने के लिए AI का उपयोग कर सकता है।
मुझे उम्मीद है कि हर कोई इस AI युग का उपयोग कर सकता है—एक ऐसा युग जहाँ सामान्य लोग अनंत रूप से उच्च उत्पादकता के करीब पहुँच सकते हैं—सेल्फ-मीडिया करने, बनाने और रिप्लिकेट करने के तरीके खोजने के लिए, ताकि यह सोते समय भी धन उत्पन्न कर सके, और स्वतंत्रता के अनंत करीब पहुँच सके।
मैं Serena हूँ, AI × Web3 × Self-Media की खोज कर रही हूँ, यह रिकॉर्ड कर रही हूँ कि कैसे सामान्य लोग अपने जीवन में पहल वापस लेते हैं। मुझे उम्मीद है कि यह लेख आपकी मदद करेगा!
👏





