Codex और Hypit के साथ वायरल Douyin वीडियो को दोहराने की चरण-दर-चरण गाइड

@Pluvio9yte
चीनी16 सित॰ 2026
204K
468
92
29
937

TL;DR

ओपन-सोर्स Hypit इंजन और Codex का उपयोग करके वायरल शॉर्ट-फॉर्म वीडियो को दोहराने पर एक व्यापक गाइड। इसमें संपत्ति उत्पादन, संपादन और संयोजन के लिए AI एजेंट्स सेटअप करने का विवरण दिया गया है।

Hypit क्या है?

Hypit एक ओपन-सोर्स प्रोजेक्ट है जो AI Agents को वीडियो बनाने में सक्षम बनाता है। आप Codex को रेफरेंस वीडियो, कैरेक्टर इमेजेस और आवश्यकताएं प्रदान करते हैं, और Agent Hypit का उपयोग करके एसेट जनरेशन, एडिटिंग, सबटाइटल्स और पिक्चर-इन-पिक्चर (PiP) इफेक्ट्स को व्यवस्थित कर सकता है, अंत में वीडियो एक्सपोर्ट करता है।

यह एक एडिटेबल प्रोजेक्ट फाइल भी छोड़ जाता है। यदि आप बाद में सबटाइटल्स बदलना चाहते हैं या PiP समायोजित करना चाहते हैं, तो आप उत्पन्न किए गए एसेट्स को दोबारा उपयोग कर सकते हैं और उन्हें संशोधित करना जारी रख सकते हैं।

ओपन सोर्स पता: hypit-ai/hypit

सबसे पहले, तैयार उत्पाद पर नज़र डालें। बाईं ओर "Chao Ge Shuo Che" (Brother Chao Talks Cars) का मूल वीडियो है, और दाईं ओर मेरा "Han Li" कैरेक्टर का उपयोग करके बनाया गया रेप्लिका है।

雪踏乌云 - inline image

यह मेरे अपने Minimax H3 API का उपयोग करके बनाया गया था। यदि आप आधिकारिक API या SeedDance का उपयोग करते हैं, तो परिणाम और भी बेहतर होंगे।

नीचे, हम इंस्टॉलेशन से शुरू करते हैं और पूरी ऑपरेशन को विस्तार से देखते हैं। मॉडल कॉन्फ़िगरेशन के दो रास्ते हैं: यदि आपके पास Hypit क्रेडिट्स हैं, तो बिल्ट-इन सेवाओं का उपयोग करें, या यदि नहीं हैं, तो अपना खुद का API कनेक्ट करें।** यह उदाहरण वास्तव में स्वामी वाले API पाथ का अनुसरण करता है।

  1. भूमिकाओं को स्पष्ट करें: Hypit, Codex, और जनरेशन मॉडल क्या-क्या संभालते हैं?

हमें पहले पाइपलाइन में हर टूल की विशिष्ट जिम्मेदारियों को स्पष्ट करना होगा ताकि भ्रम से बचा जा सके:

  • Codex की भूमिका: एक कोड और इंजीनियरिंग निष्पादन सहायक के रूप में, Codex प्राकृतिक भाषा के अनुरोधों को पार्स करता है, स्थानीय विकास वातावरण की जांच और कॉन्फ़िगर करता है, रेफरेंस वीडियो की स्टोरीबोर्ड संरचना को पढ़ता और तोड़ता है, प्रोजेक्ट सोर्स फाइल्स को जेनरेट और संशोधित करता है, और स्वचालित पाइपलाइनों को पूरा करने के लिए अंडरलाइंग इंजनों को कॉल करने को व्यवस्थित करता है।
  • Image & Video Models की भूमिका: विशेष रूप से स्थिर दृश्य एसेट्स और गतिशील सीन्स जेनरेट करने के लिए जिम्मेदार। इस उदाहरण में, इमेज मॉडल एक आधुनिक लाइवस्ट्रीम रूम में प्राचीन पोशाक वाले व्यक्ति का पहला फ्रेम जेनरेट करता है, जबकि वीडियो मॉडल पहले फ्रेम को बोलते हुए स्ट्रीमर एनिमेशन में चलाता है और प्रॉम्प्ट्स के आधार पर बाहरी ट्रैफिक शॉट्स जेनरेट करता है।
  • Hypit Engine की भूमिका: मुख्य ऑर्केस्ट्रेशन केंद्र के रूप में, Hypit सभी जेनरेट किए गए एसेट निर्भरताओं को दर्ज करता है, शॉट अनुक्रम और ट्रांजिशन क्लॉक्स को परिभाषित करता है, सबटाइटल डिस्प्ले टाइमिंग और उपस्थिति को नियंत्रित करता है, PiP की स्थिति, लेयरिंग, और राउंडेड कॉर्नर मास्क को प्रबंधित करता है, और एसेट्स तैयार होने पर अंतिम वीडियो को कंपोजिट करने के लिए अंडरलाइंग रेंडरर को कॉल करता है।

विभिन्न पाठकों की वास्तविक स्थितियों के अनुसार, यह ट्यूटोरियल जनरेशन मॉडल कॉन्फ़िगरेशन को दो स्वतंत्र पाथ्स में स्पष्ट रूप से विभाजित करता है:

  • Path A: आपके Hypit खाते में उपलब्ध क्रेडिट्स हैं और आप आधिकारिक HypiHub सेवा के माध्यम से बिल्ट-इन होस्टेड मॉडल्स को सीधे कॉल करते हैं।
  • Path B: आपके पास Hypit प्लेटफॉर्म क्रेडिट्स नहीं हैं और आप स्पष्ट रूप से अपने स्वयं के थर्ड-पार्टी API इंटरफेस को कॉन्फ़िगर और कनेक्ट करते हैं।

आपको केवल अपनी स्थिति के अनुसार एक पाथ (A या B) चुनना है ताकि कॉन्फ़िगरेशन पूरा हो सके, फिर सामान्य उत्पादन और ऑर्केस्ट्रेशन वर्कफ्लो में शामिल हो जाएं।

  1. तैयारी और एसेट स्पेसिफिकेशन्स

शुरू करने से पहले, Codex, एक स्पष्ट रेफरेंस वीडियो, और एक लक्ष्य कैरेक्टर रेफरेंस इमेज जिसकी आप प्रतिस्थापन करना चाहते हैं, तैयार करें।

कैरेक्टर रेफरेंस इमेजेस आदर्श रूप से एकल व्यक्ति की तस्वीरें होनी चाहिए जिनमें स्पष्ट चेहरे की विशेषताएं, समान रोशनी, और साफ कपड़े/बालों के विवरण हों। चूंकि रेफरेंस इमेजेस में कोई गति जानकारी नहीं होती है, इसलिए यह मानकर न चलें कि मॉडल केवल एक स्थिर छवि से मूल होस्ट के कंधे उचकाना, हाथ के इशारे आदि को स्वचालित रूप से दोहरा देगा।

यदि आप परिणाम को सार्वजनिक रूप से प्रकाशित करने की योजना बना रहे हैं और मूल होस्ट की आवाज़ का उपयोग नहीं करना चाहते हैं, तो औपचारिक उत्पादन से पहले रिप्लेसमेंट डायलॉग ऑडियो रिकॉर्ड करें। वॉइसओवर ऑडियो बदलने से उच्चारण ठहराव और खंड अवधि बदल जाती है, जिससे कट्स और सबटाइटल टाइमिंग को पुनः संरेखित करना आवश्यक हो जाता है।

  1. इंस्टॉलेशन

आधिकारिक Skill ग्लोबल इंस्टॉलेशन कमांड निष्पादित करें:

npx skills add hypit-ai/hypit -g

इंस्टॉलेशन एंट्री पॉइंट्स के लिए Hypit Repository और विस्तृत प्रक्रिया चरणों के लिए Official Quickstart Manual का संदर्भ लें।

Path A: Hypit क्रेडिट्स के साथ, बिल्ट-इन सेवाओं का उपयोग

यदि आपके पास क्रेडिट्स हैं, तो आप Codex को बिना अपने खुद के API को कॉन्फ़िगर किए Hypit की बिल्ट-इन सेवाओं का सीधे उपयोग करने दे सकते हैं।

कृपया मुझे लॉग इन करने, उपलब्ध मॉडल्स और क्रेडिट्स की जांच करने में मदद करने के लिए Hypit की बिल्ट-इन सेवाओं का उपयोग करें। पहले अनुमानित खपत बताएं, फिर जनरेशन शुरू करें।

Path B: Hypit क्रेडिट्स के बिना, अपने खुद के API का उपयोग

इस बार मैंने स्वामी वाले API पाथ का अनुसरण किया: इमेज जनरेशन के लिए Google और वीडियो जनरेशन के लिए ZenMux के MiniMax H3 Max का उपयोग कर रहा हूँ।

मैंने पहले Codex से इंटरफेस कॉन्फ़िगर करवाए, पुष्टि की कि मॉडल्स को कॉल किया जा सकता है, और फिर उत्पादन जारी रखा।

इमेज जनरेशन के लिए Google API और वीडियो के लिए ZenMux के MiniMax H3 Max का उपयोग करें। कृपया मुझे कॉन्फ़िगरेशन पूरा करने और उपलब्धता की जांच करने में मदद करें। यदि पेड टेस्टिंग आवश्यक है तो पहले लागत समझाएं।

雪踏乌云 - inline image

Codex को मूल वीडियो और Han Li इमेज दें

अगला, मैंने "Chao Ge Shuo Che" के वीडियो का लिंक और Han Li इमेज दोनों को एक साथ Codex को भेजा, यह निर्दिष्ट करते हुए कि केवल पहले 20 सेकंड की नकल की जाए।

कृपया इस वीडियो के पहले 20 सेकंड की नकल करें, कैरेक्टर को मेरे द्वारा प्रदान की गई Han Li इमेज से बदलें। मूल संरचना, कट रिदम, सबटाइटल्स, और PiP को सुरक्षित रखें। मूल ऑडियो रखें। सभी ऑपरेशन उसी Hypit प्रोजेक्ट के भीतर पूरे करें।

रेप्लिकेशन स्कोप के बारे में स्पष्ट रहें; अन्यथा, 10+ मिनट के मूल वीडियो के लिए, Codex पूरी लंबाई के लिए योजना बना सकता है।

雪踏乌云 - inline image

वीडियो जेनरेट करने से पहले पहले फ्रेम्स की जांच करें

मैंने Codex से शॉट्स को तोड़ने और चार पहले फ्रेम्स जेनरेट करने को कहा: लाइवस्ट्रीम रूम में Han Li, सूर्यास्त शहरी ट्रैफिक, सुरंग में सफेद Mercedes, और दिन के समय सड़क ट्रैफिक।

यह चरण मुख्य रूप से यह जांचता है कि कैरेक्टर सही दिखता है, कपड़े सही हैं, और सीन्स विचलित नहीं हुए हैं। यदि पहले फ्रेम्स संतोषजनक नहीं हैं, तो गतिशील वीडियो जेनरेट करना जारी रखने से पहले उन्हें संशोधित करें।

कृपया पहले चार सीन्स के पहले फ्रेम्स दिखाएं। Han Li का चेहरा, लंबे बाल, और नीले-सुनहरे रोब्स सुरक्षित रखें। कार शॉट्स में मूल होस्ट, सबटाइटल्स, या PiP नहीं होना चाहिए; ये बाद में Hypit द्वारा समान रूप से जोड़े जाएंगे।

[Insert Han Li Livestream Room First Frame Here]

Codex से सेगमेंट्स जेनरेट करवाएं, फिर Hypit के साथ कंपोजिट करें

पहले फ्रेम्स की पुष्टि करने के बाद, मैंने Codex से चार होस्ट सेगमेंट्स और तीन कार सेगमेंट्स जेनरेट करने को कहा, प्रत्येक 5 सेकंड का अनुरोध किया, फिर अंतिम 20 सेकंड को कंपोजिट करने के लिए Hypit का उपयोग किया।

मॉडल्स दृश्य जेनरेट करते हैं; Hypit कट्स, सबटाइटल्स, और PiP को संभालता है।

कृपया पुष्टि किए गए पहले फ्रेम्स और बजट के अनुसार गतिशील एसेट्स जेनरेट करें, फिर मूल रिदम का पालन करते हुए 20-सेकंड का वीडियो कंपोजिट करें। जब कार शॉट्स दिखाई दें, तो Han Li को केंद्रित नीचे PiP में रखें, मूल ऑडियो और सबटाइटल्स के साथ। पहले से जेनरेट किए गए एसेट्स को सीधे दोबारा उपयोग करें; पुनः जेनरेट न करें।

雪踏乌云 - inline image

इस बार, रेफरेंस वीडियो से Han Li संस्करण के अंतिम कट तक, मेरे मुख्य कार्य Codex को आवश्यकताएं देना, परिणामों की समीक्षा करना, और उसे बताना था कि किस चीज़ को समायोजित करने की आवश्यकता थी।

Hypit केवल एक वीडियो नहीं छोड़ता, बल्कि एक एडिटेबल प्रोजेक्ट भी छोड़ता है। अगली बार जब आप कैरेक्टर्स बदलना चाहें, सबटाइटल्स एडिट करना चाहें, या PiP समायोजित करना चाहें, तो आप इस प्रोजेक्ट से जारी रख सकते हैं।

निश्चित रूप से, वर्तमान एक्शन्स और लिप-सिंकिंग अभी तक 1:1 रेप्लिकेशन तक नहीं पहुंचे हैं; Seedance सीरीज़ जैसे बेहतर मॉडल्स का उपयोग करने से इसे महत्वपूर्ण रूप से सुधार सकते हैं। यदि रुचि हो, तो पहले एक छोटा 10-20 सेकंड का वीडियो ढूंढने का प्रयास करें और देखें कि यह आपको कौन से चरण बचाता है।

प्रोजेक्ट पता: hypit-ai/hypit. यदि आपको यह उपयोगी लगे, तो प्रोजेक्ट को स्टार करने पर विचार करें।

YouMind में रीमिक्स करें

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें