Hypit क्या है?
Hypit एक ओपन-सोर्स प्रोजेक्ट है जो AI Agents को वीडियो बनाने में सक्षम बनाता है। आप Codex को रेफरेंस वीडियो, कैरेक्टर इमेजेस और आवश्यकताएं प्रदान करते हैं, और Agent Hypit का उपयोग करके एसेट जनरेशन, एडिटिंग, सबटाइटल्स और पिक्चर-इन-पिक्चर (PiP) इफेक्ट्स को व्यवस्थित कर सकता है, अंत में वीडियो एक्सपोर्ट करता है।
यह एक एडिटेबल प्रोजेक्ट फाइल भी छोड़ जाता है। यदि आप बाद में सबटाइटल्स बदलना चाहते हैं या PiP समायोजित करना चाहते हैं, तो आप उत्पन्न किए गए एसेट्स को दोबारा उपयोग कर सकते हैं और उन्हें संशोधित करना जारी रख सकते हैं।
ओपन सोर्स पता: hypit-ai/hypit
सबसे पहले, तैयार उत्पाद पर नज़र डालें। बाईं ओर "Chao Ge Shuo Che" (Brother Chao Talks Cars) का मूल वीडियो है, और दाईं ओर मेरा "Han Li" कैरेक्टर का उपयोग करके बनाया गया रेप्लिका है।

यह मेरे अपने Minimax H3 API का उपयोग करके बनाया गया था। यदि आप आधिकारिक API या SeedDance का उपयोग करते हैं, तो परिणाम और भी बेहतर होंगे।
नीचे, हम इंस्टॉलेशन से शुरू करते हैं और पूरी ऑपरेशन को विस्तार से देखते हैं। मॉडल कॉन्फ़िगरेशन के दो रास्ते हैं: यदि आपके पास Hypit क्रेडिट्स हैं, तो बिल्ट-इन सेवाओं का उपयोग करें, या यदि नहीं हैं, तो अपना खुद का API कनेक्ट करें।** यह उदाहरण वास्तव में स्वामी वाले API पाथ का अनुसरण करता है।
- भूमिकाओं को स्पष्ट करें: Hypit, Codex, और जनरेशन मॉडल क्या-क्या संभालते हैं?
हमें पहले पाइपलाइन में हर टूल की विशिष्ट जिम्मेदारियों को स्पष्ट करना होगा ताकि भ्रम से बचा जा सके:
- Codex की भूमिका: एक कोड और इंजीनियरिंग निष्पादन सहायक के रूप में, Codex प्राकृतिक भाषा के अनुरोधों को पार्स करता है, स्थानीय विकास वातावरण की जांच और कॉन्फ़िगर करता है, रेफरेंस वीडियो की स्टोरीबोर्ड संरचना को पढ़ता और तोड़ता है, प्रोजेक्ट सोर्स फाइल्स को जेनरेट और संशोधित करता है, और स्वचालित पाइपलाइनों को पूरा करने के लिए अंडरलाइंग इंजनों को कॉल करने को व्यवस्थित करता है।
- Image & Video Models की भूमिका: विशेष रूप से स्थिर दृश्य एसेट्स और गतिशील सीन्स जेनरेट करने के लिए जिम्मेदार। इस उदाहरण में, इमेज मॉडल एक आधुनिक लाइवस्ट्रीम रूम में प्राचीन पोशाक वाले व्यक्ति का पहला फ्रेम जेनरेट करता है, जबकि वीडियो मॉडल पहले फ्रेम को बोलते हुए स्ट्रीमर एनिमेशन में चलाता है और प्रॉम्प्ट्स के आधार पर बाहरी ट्रैफिक शॉट्स जेनरेट करता है।
- Hypit Engine की भूमिका: मुख्य ऑर्केस्ट्रेशन केंद्र के रूप में, Hypit सभी जेनरेट किए गए एसेट निर्भरताओं को दर्ज करता है, शॉट अनुक्रम और ट्रांजिशन क्लॉक्स को परिभाषित करता है, सबटाइटल डिस्प्ले टाइमिंग और उपस्थिति को नियंत्रित करता है, PiP की स्थिति, लेयरिंग, और राउंडेड कॉर्नर मास्क को प्रबंधित करता है, और एसेट्स तैयार होने पर अंतिम वीडियो को कंपोजिट करने के लिए अंडरलाइंग रेंडरर को कॉल करता है।
विभिन्न पाठकों की वास्तविक स्थितियों के अनुसार, यह ट्यूटोरियल जनरेशन मॉडल कॉन्फ़िगरेशन को दो स्वतंत्र पाथ्स में स्पष्ट रूप से विभाजित करता है:
- Path A: आपके Hypit खाते में उपलब्ध क्रेडिट्स हैं और आप आधिकारिक HypiHub सेवा के माध्यम से बिल्ट-इन होस्टेड मॉडल्स को सीधे कॉल करते हैं।
- Path B: आपके पास Hypit प्लेटफॉर्म क्रेडिट्स नहीं हैं और आप स्पष्ट रूप से अपने स्वयं के थर्ड-पार्टी API इंटरफेस को कॉन्फ़िगर और कनेक्ट करते हैं।
आपको केवल अपनी स्थिति के अनुसार एक पाथ (A या B) चुनना है ताकि कॉन्फ़िगरेशन पूरा हो सके, फिर सामान्य उत्पादन और ऑर्केस्ट्रेशन वर्कफ्लो में शामिल हो जाएं।
- तैयारी और एसेट स्पेसिफिकेशन्स
शुरू करने से पहले, Codex, एक स्पष्ट रेफरेंस वीडियो, और एक लक्ष्य कैरेक्टर रेफरेंस इमेज जिसकी आप प्रतिस्थापन करना चाहते हैं, तैयार करें।
कैरेक्टर रेफरेंस इमेजेस आदर्श रूप से एकल व्यक्ति की तस्वीरें होनी चाहिए जिनमें स्पष्ट चेहरे की विशेषताएं, समान रोशनी, और साफ कपड़े/बालों के विवरण हों। चूंकि रेफरेंस इमेजेस में कोई गति जानकारी नहीं होती है, इसलिए यह मानकर न चलें कि मॉडल केवल एक स्थिर छवि से मूल होस्ट के कंधे उचकाना, हाथ के इशारे आदि को स्वचालित रूप से दोहरा देगा।
यदि आप परिणाम को सार्वजनिक रूप से प्रकाशित करने की योजना बना रहे हैं और मूल होस्ट की आवाज़ का उपयोग नहीं करना चाहते हैं, तो औपचारिक उत्पादन से पहले रिप्लेसमेंट डायलॉग ऑडियो रिकॉर्ड करें। वॉइसओवर ऑडियो बदलने से उच्चारण ठहराव और खंड अवधि बदल जाती है, जिससे कट्स और सबटाइटल टाइमिंग को पुनः संरेखित करना आवश्यक हो जाता है।
- इंस्टॉलेशन
आधिकारिक Skill ग्लोबल इंस्टॉलेशन कमांड निष्पादित करें:
npx skills add hypit-ai/hypit -g
इंस्टॉलेशन एंट्री पॉइंट्स के लिए Hypit Repository और विस्तृत प्रक्रिया चरणों के लिए Official Quickstart Manual का संदर्भ लें।
Path A: Hypit क्रेडिट्स के साथ, बिल्ट-इन सेवाओं का उपयोग
यदि आपके पास क्रेडिट्स हैं, तो आप Codex को बिना अपने खुद के API को कॉन्फ़िगर किए Hypit की बिल्ट-इन सेवाओं का सीधे उपयोग करने दे सकते हैं।
कृपया मुझे लॉग इन करने, उपलब्ध मॉडल्स और क्रेडिट्स की जांच करने में मदद करने के लिए Hypit की बिल्ट-इन सेवाओं का उपयोग करें। पहले अनुमानित खपत बताएं, फिर जनरेशन शुरू करें।
Path B: Hypit क्रेडिट्स के बिना, अपने खुद के API का उपयोग
इस बार मैंने स्वामी वाले API पाथ का अनुसरण किया: इमेज जनरेशन के लिए Google और वीडियो जनरेशन के लिए ZenMux के MiniMax H3 Max का उपयोग कर रहा हूँ।
मैंने पहले Codex से इंटरफेस कॉन्फ़िगर करवाए, पुष्टि की कि मॉडल्स को कॉल किया जा सकता है, और फिर उत्पादन जारी रखा।
इमेज जनरेशन के लिए Google API और वीडियो के लिए ZenMux के MiniMax H3 Max का उपयोग करें। कृपया मुझे कॉन्फ़िगरेशन पूरा करने और उपलब्धता की जांच करने में मदद करें। यदि पेड टेस्टिंग आवश्यक है तो पहले लागत समझाएं।

Codex को मूल वीडियो और Han Li इमेज दें
अगला, मैंने "Chao Ge Shuo Che" के वीडियो का लिंक और Han Li इमेज दोनों को एक साथ Codex को भेजा, यह निर्दिष्ट करते हुए कि केवल पहले 20 सेकंड की नकल की जाए।
कृपया इस वीडियो के पहले 20 सेकंड की नकल करें, कैरेक्टर को मेरे द्वारा प्रदान की गई Han Li इमेज से बदलें। मूल संरचना, कट रिदम, सबटाइटल्स, और PiP को सुरक्षित रखें। मूल ऑडियो रखें। सभी ऑपरेशन उसी Hypit प्रोजेक्ट के भीतर पूरे करें।
रेप्लिकेशन स्कोप के बारे में स्पष्ट रहें; अन्यथा, 10+ मिनट के मूल वीडियो के लिए, Codex पूरी लंबाई के लिए योजना बना सकता है।

वीडियो जेनरेट करने से पहले पहले फ्रेम्स की जांच करें
मैंने Codex से शॉट्स को तोड़ने और चार पहले फ्रेम्स जेनरेट करने को कहा: लाइवस्ट्रीम रूम में Han Li, सूर्यास्त शहरी ट्रैफिक, सुरंग में सफेद Mercedes, और दिन के समय सड़क ट्रैफिक।
यह चरण मुख्य रूप से यह जांचता है कि कैरेक्टर सही दिखता है, कपड़े सही हैं, और सीन्स विचलित नहीं हुए हैं। यदि पहले फ्रेम्स संतोषजनक नहीं हैं, तो गतिशील वीडियो जेनरेट करना जारी रखने से पहले उन्हें संशोधित करें।
कृपया पहले चार सीन्स के पहले फ्रेम्स दिखाएं। Han Li का चेहरा, लंबे बाल, और नीले-सुनहरे रोब्स सुरक्षित रखें। कार शॉट्स में मूल होस्ट, सबटाइटल्स, या PiP नहीं होना चाहिए; ये बाद में Hypit द्वारा समान रूप से जोड़े जाएंगे।
[Insert Han Li Livestream Room First Frame Here]
Codex से सेगमेंट्स जेनरेट करवाएं, फिर Hypit के साथ कंपोजिट करें
पहले फ्रेम्स की पुष्टि करने के बाद, मैंने Codex से चार होस्ट सेगमेंट्स और तीन कार सेगमेंट्स जेनरेट करने को कहा, प्रत्येक 5 सेकंड का अनुरोध किया, फिर अंतिम 20 सेकंड को कंपोजिट करने के लिए Hypit का उपयोग किया।
मॉडल्स दृश्य जेनरेट करते हैं; Hypit कट्स, सबटाइटल्स, और PiP को संभालता है।
कृपया पुष्टि किए गए पहले फ्रेम्स और बजट के अनुसार गतिशील एसेट्स जेनरेट करें, फिर मूल रिदम का पालन करते हुए 20-सेकंड का वीडियो कंपोजिट करें। जब कार शॉट्स दिखाई दें, तो Han Li को केंद्रित नीचे PiP में रखें, मूल ऑडियो और सबटाइटल्स के साथ। पहले से जेनरेट किए गए एसेट्स को सीधे दोबारा उपयोग करें; पुनः जेनरेट न करें।

इस बार, रेफरेंस वीडियो से Han Li संस्करण के अंतिम कट तक, मेरे मुख्य कार्य Codex को आवश्यकताएं देना, परिणामों की समीक्षा करना, और उसे बताना था कि किस चीज़ को समायोजित करने की आवश्यकता थी।
Hypit केवल एक वीडियो नहीं छोड़ता, बल्कि एक एडिटेबल प्रोजेक्ट भी छोड़ता है। अगली बार जब आप कैरेक्टर्स बदलना चाहें, सबटाइटल्स एडिट करना चाहें, या PiP समायोजित करना चाहें, तो आप इस प्रोजेक्ट से जारी रख सकते हैं।
निश्चित रूप से, वर्तमान एक्शन्स और लिप-सिंकिंग अभी तक 1:1 रेप्लिकेशन तक नहीं पहुंचे हैं; Seedance सीरीज़ जैसे बेहतर मॉडल्स का उपयोग करने से इसे महत्वपूर्ण रूप से सुधार सकते हैं। यदि रुचि हो, तो पहले एक छोटा 10-20 सेकंड का वीडियो ढूंढने का प्रयास करें और देखें कि यह आपको कौन से चरण बचाता है।
प्रोजेक्ट पता: hypit-ai/hypit. यदि आपको यह उपयोगी लगे, तो प्रोजेक्ट को स्टार करने पर विचार करें।





