Codex ऑटोमेटेड वीडियो एडिटिंग: मेरे $7,000+ Douyin वर्कफ़्लो के लिए एक स्टेप-बाय-स्टेप गाइड

@xilo2991
चीनी2 सप्ताह पहले · 05 जुल॰ 2026
1.6M
3.2K
622
83
5.7K

TL;DR

यह विस्तृत गाइड सोशल मीडिया के लिए वीडियो एडिटिंग को ऑटोमेट करने हेतु Codex का उपयोग करके एक AI-पावर्ड वर्कफ़्लो की व्याख्या करती है, जिसमें वायरल रेफरेंस वीडियो का विश्लेषण करना और उन्हें लोकल एसेट्स के साथ मैच करना शामिल है।

मैं पिछले दो महीनों से इस एडिटिंग वर्कफ़्लो का उपयोग कर रहा हूँ और कम से कम 10 वर्ज़न को पुनरावृत्त किया है। इस लेख में, मैं अपने दोस्तों के लिए पूरी प्रक्रिया और विवरणों को यथासंभव स्पष्ट रूप से समझाऊंगा।

आप लेख के तर्क का अनुसरण कर सकते हैं या इस लेख को सीधे Codex को भेज सकते हैं ताकि AI आपके लिए एक Skill बना सके।

नमस्ते दोस्तों, मैं ड्राफ़्ट लेकर आया हूँ!

पिछले हफ़्ते, मैंने Codex पर एक परिचयात्मक लेख लिखा था, और मैं समर्थन के लिए बहुत आभारी हूँ—यह दस लाख से अधिक व्यूज़ तक पहुँच गया।

https://x.com/xilo2991/status/2070051136187621452

उस समय, कई दोस्तों ने पूछा था कि क्या मैं लेख में बताई गई ऑटोमेटेड एडिटिंग साझा कर सकता हूँ।

बिल्कुल। आज, मैं आपसे बात करने आया हूँ कि Codex के साथ ऑटोमेटेड एडिटिंग कैसे प्राप्त करें ताकि वीडियो निर्माण की दक्षता को अधिकतम किया जा सके।

वर्कफ़्लो का अंतर्निहित तर्क

चाहे आप कंटेंट कर रहे हों या ई-कॉमर्स, ट्रैफ़िक तेज़ी से पाने का सबसे आसान तरीका है वायरल हिट्स की नकल करना

क्योंकि वायरल हिट्स ऐसा कंटेंट होता है जो पहले से बाज़ार द्वारा मान्य किया जा चुका है, जब तक आप उनका पर्याप्त तेज़ी से अनुसरण करते हैं, ट्रैफ़िक आमतौर पर खराब नहीं होगा। (बेशक, नकल और साहित्यिक चोरी के बीच अंतर पर ध्यान दें।)

इस वर्कफ़्लो का मूल वायरल हिट्स की नकल करना है।

मान लीजिए आप एक वायरल वीडियो देखते हैं और उसी लय और संरचना का अनुसरण करते हुए अपना खुद का वीडियो बनाना चाहते हैं। पारंपरिक तरीका यह है कि मैन्युअल रूप से CapCut (Jianying) में जाएँ और संदर्भ वीडियो के साथ फ्रेम-दर-फ्रेम मिलान करें, सामग्री ढूँढें, उन्हें समय दें, और सबटाइटल को संरेखित करें। एक वीडियो में दो या तीन घंटे लग सकते हैं।

लेकिन इस वर्कफ़्लो के साथ, आपको केवल संदर्भ वीडियो और अपनी खुद की सामग्री लाइब्रेरी तैयार करने की आवश्यकता है; Codex बाकी काम अपने आप पूरा कर सकता है।

Codex स्वचालित रूप से संदर्भ वीडियो में हर शॉट ट्रांज़िशन की पहचान करेगा, आपकी लाइब्रेरी से सबसे अच्छी मैचिंग सामग्री ढूँढेगा, स्वचालित रूप से वॉयसओवर और सबटाइटल जेनरेट करेगा, और अंत में आपको एक CapCut ड्राफ़्ट देगा जिसे आप खोलकर एडिट कर सकते हैं।

पूरी प्रक्रिया में कुछ ही मिनट लग सकते हैं।

मैं मुख्य रूप से इस वर्कफ़्लो का उपयोग Douyin उत्पाद वीडियो बनाते समय करता हूँ।

Codex से पहले, मैं अधिकतम 6 वीडियो प्रतिदिन ही एडिट कर पाता था। लेकिन Codex के साथ, मुझे बस उपयुक्त वायरल वीडियो को संदर्भ के रूप में ढूँढना होता है और उत्पाद सामग्री तैयार करनी होती है। बाकी ऑटोमैटिक जनरेशन, समीक्षा और फ़ाइन-ट्यूनिंग है।

मैं आसानी से प्रतिदिन 30 वीडियो पूरे कर सकता हूँ, जो कम से कम पाँच गुना दक्षता में वृद्धि है।

xilo - inline image

लेकिन स्पष्ट रहें: इस वर्कफ़्लो का स्थान ऑटोमैटिक प्रोडक्शन है, बुटीक क्रिएशन नहीं।

यह उन वीडियो के लिए उपयुक्त है जिनमें कई सेगमेंट को जोड़ने की आवश्यकता होती है, जैसे ई-कॉमर्स, मार्केटिंग, या मिक्स Vlogs।

संदर्भ वीडियो संरचना और लय प्रदान करता है, आपकी सामग्री लाइब्रेरी दृश्य प्रदान करती है, वॉयसओवर और सबटाइटल स्वचालित रूप से जेनरेट होते हैं, और अंतिम वीडियो स्वचालित रूप से तैयार होता है।

यदि आप उच्च-गुणवत्ता वाला मूल कंटेंट बनाना चाहते हैं जिसमें बहुत सटीक सिनेमाई भाषा, जटिल ट्रांज़िशन और नाजुक भावनात्मक अभिव्यक्ति की आवश्यकता होती है, तो यह प्रक्रिया उपयुक्त नहीं हो सकती है।

क्योंकि वर्तमान स्वचालित मिलान तर्क अभी तक इतनी सटीक अर्थ संबंधी समझ और भावनात्मक नियंत्रण प्राप्त नहीं कर सकता है।

मैं यह भी शोध कर रहा हूँ कि मूल वीडियो के लिए इस प्रक्रिया को कैसे अनुकूलित किया जाए और स्थिर होने पर इसे दोस्तों के साथ साझा करूँगा।

वर्कफ़्लो तैयारी

ठीक है, ऑटोमेटेड एडिटिंग वर्कफ़्लो पर वापस आते हैं। नीचे, मैं चरण-दर-चरण समझाऊंगा कि इस वर्कफ़्लो को कैसे बनाया जाए। शुरू करने से पहले, आपको दो चीज़ें तैयार करने की आवश्यकता है।

1. संबंधित टूल्स इंस्टॉल करें

यह वर्कफ़्लो Codex पर आधारित है, इसलिए आपके पास पहले Codex होना चाहिए। यदि आपने इसका उपयोग नहीं किया है, तो पिछले हफ़्ते का मेरा परिचयात्मक लेख देखें।

विशेष रूप से, इस वर्कफ़्लो के लिए इन मुख्य टूल्स की आवश्यकता है:

  • FFmpeg: वीडियो स्प्लिटिंग, मर्जिंग, और फ़ॉर्मेट रूपांतरण जैसे अंतर्निहित कार्यों के लिए उपयोग किया जाता है। यह आधार है और इसे इंस्टॉल किया जाना चाहिए।
  • Python Environment: चूँकि पूरी प्रक्रिया Python में लिखी गई है, आपको कम से कम Python 3.8 की आवश्यकता है।
  • Voiceover Tools: यदि आप स्वचालित वॉयसओवर चाहते हैं, तो सबसे स्थिर ByteDance का Doubao वॉयस मॉडल है; यदि आप आवाज़ क्लोन करना चाहते हैं, तो VoxCPM का उपयोग करें, जो एक मुफ़्त ओपन-सोर्स टूल है।
  • CapCut (Jianying): अंतिम जेनरेट किया गया ड्राफ़्ट CapCut फ़ॉर्मेट में है, इसलिए आपको डेस्कटॉप वर्ज़न इंस्टॉल करना होगा।

इनमें से, FFmpeg और Python मुख्य निर्भरताएँ हैं।

आप पर्यावरण की जाँच करने और लापता टूल्स को इंस्टॉल करने में सहायता के लिए निम्नलिखित टेक्स्ट को Codex में कॉपी कर सकते हैं:

text
1कृपया ऑटोमेटेड वीडियो एडिटिंग के लिए आवश्यक पर्यावरण की जाँच करने में मेरी मदद करें:
2
31. जाँचें कि FFmpeg इंस्टॉल है या नहीं; यदि नहीं है, तो इसे इंस्टॉल करने में मेरी मदद करें।
42. जाँचें कि Python वर्ज़न >= 3.8 है या नहीं; यदि नहीं है, तो इसे इंस्टॉल या अपग्रेड करने में मेरी मदद करें।
53. जाँचें कि CapCut (Jianying) Professional इंस्टॉल है या नहीं; यदि नहीं है, तो मुझे डाउनलोड लिंक बताएँ।
64. Python निर्भरताएँ इंस्टॉल करें: opencv-python, numpy, pillow
7
8जाँच के बाद, मुझे बताएँ कि क्या तैयार है और मुझे क्या मैन्युअल रूप से संभालना है।

वॉयसओवर के लिए, यह आपकी आवश्यकताओं पर निर्भर करता है। यदि आप ई-कॉमर्स वीडियो बना रहे हैं, तो Doubao वॉयस मॉडल सबसे स्थिर है। यह CapCut के समान AI आवाज़ों का उपयोग करता है। कीमत कम है—1 मिनट का वीडियो बनाने में लगभग 0.4-0.8 RMB खर्च होता है।

यदि आप अपनी खुद की आवाज़ का उपयोग करना चाहते हैं या किसी और की आवाज़ क्लोन करना चाहते हैं, तो VoxCPM का उपयोग करें। GitHub पर लिंक ढूँढें और इसे इंस्टॉल करने के लिए Codex को भेजें।

2. फ़ोल्डर बनाएँ

इन्हें इंस्टॉल करने के बाद, आपको एक प्रोजेक्ट फ़ोल्डर बनाना होगा। मैं आमतौर पर इसे इस तरह व्यवस्थित करता हूँ:

text
1प्रोजेक्ट फ़ोल्डर/
2 assets/ # आपकी सामग्री लाइब्रेरी
3 work/ # कार्य क्षेत्र, प्रत्येक एडिट के लिए एक दिनांक फ़ोल्डर बनाएँ
4 final/ # अंतिम उत्पाद
5 AGENTS.md # प्रोजेक्ट कॉन्फ़िगरेशन फ़ाइल

assets फ़ोल्डर आपकी लाइब्रेरी है। सभी संभावित उपयोगी सामग्री वहाँ रखें। ये AI-जनरेटेड या आपके द्वारा फिल्माई गई हो सकती हैं, लेकिन इन्हें पुन: प्रयोज्य संपत्ति के रूप में पहले से तैयार किया जाना चाहिए।

सामग्री को उपस्थिति, कार्य या दृश्य के अनुसार वर्गीकृत किया जा सकता है।

work फ़ोल्डर सक्रिय प्रोजेक्ट्स के लिए है। हर बार जब आप एक नया वीडियो बनाते हैं, तो 2026-07-05 जैसा एक दिनांक फ़ोल्डर बनाएँ और उसमें संदर्भ वीडियो, मध्यवर्ती फ़ाइलें और अंतिम ड्राफ़्ट रखें।

AGENTS.md कॉन्फ़िगरेशन फ़ाइल है जिसमें प्रोजेक्ट लक्ष्य, आउटपुट विशिष्टताएँ और स्वीकृति मानदंड शामिल हैं। यह महत्वपूर्ण है क्योंकि Codex इसका उपयोग आपकी आवश्यकताओं को समझने के लिए करता है।

xilo - inline image

PS: मेरी खुद की AGENTS फ़ाइल थोड़ी लंबी है, इसलिए मैंने इसे संदर्भ के लिए अंत में रखा है।

एडिटिंग वर्कफ़्लो का निर्माण

1. संदर्भ वीडियो को डीकंस्ट्रक्ट करें

यहाँ मुख्य लक्ष्य संदर्भ वीडियो को स्वतंत्र शॉट्स में विभाजित करना और सामग्री मिलान के आधार के रूप में प्रत्येक शॉट के लिए कीफ्रेम निकालना है।

एक ऐसा वीडियो ढूँढें जिसे आप संदर्भित करना चाहते हैं। इसे डाउनलोड करें, work फ़ोल्डर में रखें, और इसे एक स्पष्ट नाम दें।

फिर इसे Codex को भेजें:

text
1मुझे एक संदर्भ वीडियो को डीकंस्ट्रक्ट करने की आवश्यकता है।
2
3संदर्भ वीडियो स्थान: @(अपनी फ़ाइल का नाम दर्ज करें)
4
5कृपया मेरी मदद करें:
61. शॉट ट्रांज़िशन की पहचान करने के लिए FFmpeg का उपयोग करें (इंटर-फ्रेम अंतर विश्लेषण के माध्यम से)।
72. प्रत्येक शॉट के लिए कीफ्रेम निकालें और उन्हें इमेज के रूप में सहेजें।
83. ऑडियो ट्रैक को अलग से निकालें।
94. प्रत्येक शॉट के लिए प्रारंभ समय, समाप्ति समय, अवधि और कीफ्रेम पथ रिकॉर्ड करने वाली एक recipe.json फ़ाइल जेनरेट करें।
105. यदि टेक्स्ट है, तो शॉट के अनुसार विभाजित ऑडियो के आधार पर एक वॉयसओवर स्क्रिप्ट जेनरेट करें।
11
12पूरा होने के बाद, AGENTS.md आवश्यकताओं का पालन करें, संबंधित फ़ोल्डर में सहेजें, और मुझे बताएँ कि कितने शॉट्स की पहचान की गई।

यह recipe.json फ़ाइल पूरी प्रक्रिया का मूल है।

xilo - inline image

डीकंस्ट्रक्शन के बाद, आप कई छोटे वीडियो क्लिप और स्क्रीनशॉट देखेंगे। जाँचें कि विभाजन उचित है या नहीं। यदि नहीं, तो आप Codex को समायोजित करने के लिए कह सकते हैं।

2. सामग्री को फ़िल्टर और मैच करें

यह चरण सबसे महत्वपूर्ण है और ऑटोमेशन के मूल्य को प्रदर्शित करता है।

पारंपरिक रूप से, आप अपनी लाइब्रेरी को शॉट दर शॉट खोजते। इस वर्कफ़्लो के साथ, आप बस Codex को बताते हैं कि आपकी लाइब्रेरी कहाँ है, और यह विजुअल मिलान करता है।

Codex के लिए प्रॉम्प्ट:

text
1मुझे लाइब्रेरी से सामग्री मैच और रिप्लेस करने की आवश्यकता है।
2
3प्रोजेक्ट जानकारी:
4- recipe.json पथ: (पिछले चरण का पथ)
5- सामग्री लाइब्रेरी पथ: assets/
6- आउटपुट पथ: work/(आपका पथ)
7
8मिलान आवश्यकताएँ:
91. recipe.json से कीफ्रेम पढ़ें।
102. लाइब्रेरी को ट्रैवर्स करें और प्रत्येक संपत्ति के लिए कीफ्रेम निकालें।
113. रंग, चमक और संरचना के माध्यम से सबसे अच्छी मैचिंग सामग्री की सिफारिश करें (कॉन्फिडेंस स्कोर प्रदान करें)।
124. नियम लागू करें: लगातार 3 शॉट्स के लिए एक ही सामग्री का उपयोग करने से बचें; स्पष्ट दोहराव वाली रचनाओं से बचें।
135. fragment_plan.json और matches.json जेनरेट करें।
146. चयनित सामग्री को material/fragment01/ आदि में कॉपी करें (स्थानांतरित न करें)।
15
16सिद्धांत: यदि कॉन्फिडेंस 0.6 से कम है, तो "लापता सामग्री" के रूप में चिह्नित करें।

Codex विजुअल फीचर्स के आधार पर समानता की गणना करता है। उच्च स्कोर वाली सामग्री को प्राथमिकता दी जाती है।

xilo - inline image

matches.json अंतिम परिणाम रिकॉर्ड करता है। एक मुख्य सिद्धांत: किसी सामग्री को खाली छोड़ना बेहतर है, अप्रासंगिक को मजबूर करने से।

3. वॉयसओवर जेनरेट करें

मिलान के बाद, वॉयसओवर जेनरेट करें। चूँकि Codex OCR/ASR का उपयोग करता है, पहले स्क्रिप्ट में त्रुटियों की जाँच करें।

प्रॉम्प्ट:

text
1मुझे वॉयसओवर जेनरेट करने की आवश्यकता है। स्क्रिप्ट है @(आपकी script.txt)
2
3आवश्यकताएँ:
41. प्रत्येक शॉट के लिए स्वतंत्र ऑडियो जेनरेट करने के लिए Doubao TTS API को कॉल करें।
52. प्रत्येक ऑडियो फ़ाइल की वास्तविक अवधि पढ़ें।
63. यदि अवधि संदर्भ शॉट से भिन्न है, तो अंतर रिकॉर्ड करें।
74. final_voice.mp3 में मर्ज करें।
85. वास्तविक अवधि के साथ recipe.json अपडेट करें।

Codex ऑडियो के आधार पर वीडियो लय को समायोजित करेगा। यदि 3 सेकंड के संदर्भ शॉट के लिए वॉयसओवर 5 सेकंड लेता है, तो अंतिम वीडियो शॉट को 5 सेकंड तक बढ़ा दिया जाएगा।

xilo - inline image

4. ड्राफ़्ट और CapCut प्रोजेक्ट जेनरेट करें

CapCut ड्राफ़्ट जेनरेट करना जटिल है क्योंकि फ़ॉर्मेट ID और पथों के संबंध में सख्त है। मैंने त्रुटियों से बचने के लिए प्रॉम्प्ट में नियम शामिल किए हैं।

प्रॉम्प्ट:

text
1मुझे अंतिम वीडियो और CapCut ड्राफ़्ट जेनरेट करने की आवश्यकता है।
2
3इनपुट:
4- recipe.json, matches.json, सामग्री पथ, वॉयसओवर फ़ाइल, स्क्रिप्ट।
5
6आउटपुट:
71. पूर्वावलोकन वीडियो रेंडर करें: work/remix.mp4
82. सबटाइटल फ़ाइल: work/captions.srt
93. CapCut ड्राफ़्ट: work/jianying_draft/
10
11आवश्यकताएँ:
12- recipe और matches.json के अनुसार सामग्री मैच करें।
13- वॉयसओवर अवधि को आधार रेखा के रूप में उपयोग करें।
14- सुनिश्चित करें कि Content ID, Metadata ID और Root Index ID सुसंगत और अद्वितीय हैं।
15- सामग्री के लिए निरपेक्ष पथ का उपयोग करें।
xilo - inline image

जाँचें कि ड्राफ़्ट सही ढंग से खुलता है, सामग्री दिखाई देती है, और सबटाइटल/ऑडियो सिंक हैं।

अंतिम शब्द

संदर्भ से ड्राफ़्ट तक की पूरी प्रक्रिया में लगभग 20-30 मिनट लगते हैं। तैयार लाइब्रेरी के साथ, प्रति वीडियो 5 मिनट से भी कम समय लग सकता है।

एक बार वर्कफ़्लो सुचारू हो जाने पर, Codex से कहें: इस वर्कफ़्लो को एक Skill में एनकैप्सुलेट करने में मेरी मदद करें। अगली बार, बस Skill को कॉल करें।

मुझे उम्मीद है कि इससे मदद मिलेगी। शुभकामनाएँ! 🍀

(AGENTS.md टेम्पलेट संक्षिप्तता के लिए इस अनुवाद में छोड़ा गया है लेकिन मूल पाठ में शामिल है।)

YouMind में रीमिक्स करें

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें