वीडियो को बिल्कुल अपनी कल्पना के अनुसार कैसे बनाएं: Seedance 2.5 का उपयोग करने का प्रोफेशनल तरीका

@casthirotaka
जापानी15 अग॰ 2026
159K
165
24
2
600

TL;DR

यह गाइड बताती है कि प्रॉम्प्ट्स को विवरण के बजाय निर्देश के रूप में उपयोग करके Seedance 2.5 में महारत कैसे हासिल करें, और जटिल मोशन तथा कैरेक्टर कंसिस्टेंसी को संभालने के लिए वीडियो रेफरेंस का उपयोग कैसे करें।

जो लोग अभी Seedance 2.5 के साथ खुद को चुनौती दे रहे हैं, वे शायद "परफेक्ट प्रॉम्प्ट" टेम्पलेट खोज रहे हैं और हर उस आइडिया को आज़मा रहे हैं जो उनके दिमाग में आता है।

हालाँकि...

प्रॉम्प्ट की ज़िम्मेदारी का दायरा आपके सोचने से कहीं ज़्यादा संकीर्ण है

Seedance 2.5 एक ही जनरेशन में 30 इमेज, 10 वीडियो और 10 ऑडियो फ़ाइलें रेफरेंस के रूप में स्वीकार करता है (ByteDance आधिकारिक घोषणा, 31 जुलाई 2026)।

इस स्पेसिफिकेशन का अर्थ है कि प्रॉम्प्ट से सब कुछ समझाने की अपेक्षा नहीं की जाती।

吉田洋孝|Cast Japan代表 - inline image

क्या तय करना है

प्रॉम्प्ट की उपयुक्तता

"सही" उत्तर कहाँ रखें

वीडियो का उद्देश्य, विश्वदृष्टि, माहौल

उच्च

प्रॉम्प्ट

स्थान का प्रकार, क्या होता है

उच्च

प्रॉम्प्ट

क्या रखना है, क्या बदलना है

बहुत उच्च

प्रॉम्प्ट

प्राथमिकताएँ

बहुत उच्च

प्रॉम्प्ट

लाइटिंग की दिशा, लेंस का फील

मध्यम

प्रॉम्प्ट / इमेज

व्यक्ति का चेहरा, पहचान

निम्न

इमेज

सटीक प्रोडक्ट आकार

निम्न

इमेज

जटिल शारीरिक हरकतें

निम्न

वीडियो

शारीरिक संपर्क, पोज़िशनिंग, नज़र

निम्न

वीडियो

सटीक कैमरा ट्रैजेक्टरी

निम्न

वीडियो / व्हाइट मॉडल

फ्रेम-दर-फ्रेम टाइमिंग

निम्न

वीडियो / एडिटिंग

निर्णय का केवल एक मानदंड है: सबसे सटीक जानकारी किसके पास है?

हरकत के लिए सबसे सटीक स्रोत उस हरकत का वीडियो है, न कि उसका टेक्स्ट विवरण।

5 चीज़ें जो आपको प्रॉम्प्ट में नहीं लिखनी चाहिए

1. विशेषणों से भरे माहौल का वर्णन

吉田洋孝|Cast Japan代表 - inline image

आधिकारिक गाइड कहता है: "विशेषणों को जमा करने से बचें।" आगे कहता है, "हरकत और लेंस के चुनाव के बारे में स्पष्ट होना आमतौर पर बेहतर काम करता है।"

2. हरकतों के "नाम"

playful cheeky mini-dance जैसे कॉन्सेप्टुअल नामों का आउटपुट उतना ही विस्तृत होता है जितनी उनकी व्याख्या की गुंजाइश होती है।

हकीकत में, इस निर्देश ने किसी दूसरे के सामने नाचते हुए व्यक्ति का वीडियो लौटाया: "पार्टनर के पास जाना -> हाथ आगे बढ़ाना -> पार्टनर को देखना।" लक्ष्य था "अकेले चलते हुए मस्ती करना, थोड़ी अस्त-व्यस्त और तेज़ हरकत," जो डांस है ही नहीं।

3. शरीर के अंगों की हरकतों को टेक्स्ट में तोड़ना

吉田洋孝|Cast Japan代表 - inline image

भले ही आप बाहों के झूलने, कंधों के हिलने और कैमरे के हर अंग के साथ तालमेल में प्रतिक्रिया करने के तरीके को टुकड़ों में बाँटकर दोबारा लिखें, आउटपुट नहीं बदला। आधिकारिक गाइड कहता है कि मोशन रेफरेंस "लंबे अस्पष्ट पैराग्राफ से ज़्यादा उपयोगी" होते हैं।

भले ही आप इसे टुकड़ों में बाँटकर लंबा कर दें, यह एक रेफरेंस के सूचना घनत्व तक नहीं पहुँचेगा।

4. वह जानकारी जो रेफरेंस मटेरियल में पहले से मौजूद है

吉田洋孝|Cast Japan代表 - inline image

आधिकारिक प्रॉम्प्ट उदाहरण बताते हैं कि हर रेफरेंस से कौन सी जानकारी लेनी है।

" @Clay Render 1 से कैमरा मूवमेंट, गति, शॉट साइज़ ट्रांज़िशन, सब्जेक्ट की ट्रैजेक्टरी और पोज़िशनिंग को रेफरेंस के रूप में लें।

@Image 2 से कैरेक्टर डिज़ाइन, दृश्य, मटेरियल, लाइटिंग, रंग और माहौल को रेफरेंस के रूप में लें।"

अगर आप टेक्स्ट में वह जानकारी लिखते हैं जो रेफरेंस में पहले से मौजूद है, तो रेफरेंस और टेक्स्ट अलग-अलग बातें कहने लगेंगे, जिससे ब्रेकडाउन हो जाएगा।

5. आपस में विरोधाभासी निर्देश

घने पैराग्राफ के कारण निर्देश आपस में टकराते हैं। जैसे ही कोई असंभव निर्देश मिल जाता है, AI खुद तय कर लेता है कि किसे छोड़ना है।

5 चीज़ें जो आपको प्रॉम्प्ट में लिखनी चाहिए

1. हर रेफरेंस फ़ाइल की भूमिका

吉田洋孝|Cast Japan代表 - inline image

आधिकारिक गाइड का निर्देश है कि "रेफरेंस की भूमिकाओं का स्पष्ट रूप से उल्लेख करें।" सूचीबद्ध भूमिकाओं में प्रोडक्ट की पहचान, कैरेक्टर की स्थिरता, व्हाइट मॉडल से हरकत, ग्रीन स्क्रीन एक्टिंग, ऑडियो, स्टाइल और आंशिक सुधार शामिल हैं। भूमिकाएँ सिर्फ़ फ़ाइलें अटैच करने से तय नहीं होतीं।

2. उस रेफरेंस से क्या उपयोग नहीं करना है

भूमिकाएँ देते समय, स्पष्ट रूप से बताएँ कि आप कौन सी जानकारी उसे नहीं उठाने देना चाहते। यह वाक्यांश वाकई काम कर गया:

@Video1 से लोकेशन, कपड़े, टेक्स्ट, लोग या कहानी की नकल न करें। सिर्फ़ शरीर की लय, बाजुओं के इशारे, चलने की लय और शरीर से जुड़ी कैमरा मोशन की नकल करें।

इसे अलग करें: "सिर्फ़ हरकत की नकल करें; लोकेशन, कपड़े या लोगों की नकल न करें।"

3. अनिवार्य तत्वों की सूची

吉田洋孝|Cast Japan代表 - inline image

आधिकारिक मोशन रेफरेंस गाइड प्रॉम्प्ट निर्माण के लिए ऐसा निर्देश देता है: "अपलोड किए गए रेफरेंस के नाम से शुरू करें, फिर अनिवार्य विवरण सूचीबद्ध करें।"

  • पहचान
  • आकार
  • स्केल
  • फ़्लोर प्लान
  • प्रोडक्ट डिज़ाइन
  • पोज़
  • टाइमिंग
  • आवाज़
  • शॉट क्रम

4. क्या रखना है और क्या बदलना है

क्या रखना है (एक्टिंग, टाइमिंग, नज़र, पोज़िशनिंग, कैमरा मूवमेंट) और क्या बदलना है (व्यक्ति, वातावरण, पोशाक) — अलग-अलग लिखें। इस अंतर के बिना, AI को सब कुछ दोबारा बनाने की पूरी आज़ादी मिल जाती है।

5. प्राथमिकताएँ

ऐसी स्थितियों में जहाँ सब कुछ एक साथ फॉलो नहीं किया जा सकता, साफ़ तौर पर बताएँ कि सबसे पहले किसे सुरक्षित रखना है। एक वास्तविक प्रॉम्प्ट में इसे ऐसे लिखा गया था:

प्राथमिकता: 1. @Video1 के शरीर की लय और बाजुओं की हरकत से मिलान करें। 2. @Video1 की शरीर से जुड़ी कैमरा मोशन से मिलान करें। 3. @Image1 का POV परिप्रेक्ष्य और वातावरण बनाए रखें। 4. हरकत को कोरियोग्राफ किए बजाय चंचल और सहज रखें।

पहले "सही उत्तर" तय करें

मनचाहे वीडियो को तत्वों में बाँटें और तय करें कि हर तत्व के लिए किस "मटेरियल में सही उत्तर है"।

तत्व

सही उत्तर कहाँ रखें

कारण

चेहरा / व्यक्ति की पहचान

इमेज

टेक्स्ट पहचान बनाए नहीं रख सकता

शरीर की हरकत, पोज़िशनिंग, नज़र, टाइमिंग

वीडियो

आधिकारिक रूप से वीडियो रेफरेंस के नियंत्रण लक्ष्य बताए गए

स्थानिक संरचना, कैमरा ट्रैजेक्टरी

व्हाइट मॉडल (बिना टेक्सचर वाला 3D)

आधिकारिक: "जब अंतिम टेक्सचर से ज़्यादा स्पेस, कैमरा पाथ और सापेक्ष स्थिति महत्वपूर्ण हों तो प्रभावी"

मानवीय क्रियाएँ, प्रोडक्ट डेमो

ग्रीन स्क्रीन मटेरियल

आधिकारिक रूप से उपयोग के मामले के रूप में बताया गया

विश्वदृष्टि, स्थान, अर्थ, प्राथमिकता

प्रॉम्प्ट

वह क्षेत्र जहाँ टेक्स्ट सबसे मज़बूत है

फ़र्नीचर का आकार, छोटी चीज़ें, बैकग्राउंड विवरण

AI पर छोड़ दें

तय करने की ज़रूरत नहीं

吉田洋孝|Cast Japan代表 - inline image
吉田洋孝|Cast Japan代表 - inline image

इसके अलावा, हर तत्व के लिए लागू करने की ताकत को तीन स्तरों में बाँटें:

  • फिक्स्ड: मनमाने ढंग से दोबारा बनाने की अनुमति न दें (व्यक्ति, प्रोडक्ट का आकार, मूल हरकत का मटेरियल)।
  • गाइडेड: दिशा दें लेकिन व्याख्या की गुंजाइश रखें (लग्ज़री अपार्टमेंट, रात, गर्म लाइटिंग, मज़ेदार माहौल)।
  • ऑटो: इसे AI पर छोड़ दें (सोफे का आकार, बुकशेल्फ़ पर रखी चीज़ें, दीवार की डिटेल्स)।

अगर आप सब कुछ फिक्स कर देते हैं, तो वीडियो अप्राकृतिक हो जाता है; अगर सब कुछ ऑटो पर छोड़ देते हैं, तो यह लक्ष्य से भटक जाता है। कहाँ तय करना है और कहाँ ढील देना है — यह डिज़ाइन करना ही प्रॉम्प्ट का काम है।

बनाने के 3 तरीके। पहले मुश्किल हरकतों को शूट करें

तरीका

उपयुक्त स्थितियाँ

AI से सब कुछ बनवाएँ

मौजूद न होने वाली दुनिया, सरल हरकतें, मज़बूत विश्वदृष्टि

सैंपल देकर बनवाएँ

चेहरा/प्रोडक्ट का आकार तय है, कंपोज़िशन जारी रखना चाहते हैं

पहले शूट करें, फिर बदलें

जटिल हरकतें, शारीरिक संपर्क, कई लोगों की परस्पर क्रिया

तीसरे तरीके के महत्वपूर्ण होने का कारण यह है कि ByteDance खुद Seedance 2.5 में "कई सब्जेक्ट्स के परस्पर संपर्क वाले दृश्यों की स्थिरता" को सुधार के क्षेत्र के रूप में सूचीबद्ध करता है। जिस क्षेत्र को डेवलपर स्वयं कठिन मानता है, उसे टेक्स्ट के ज़रिए पार कराने की कोशिश हारी हुई लड़ाई है।

吉田洋孝|Cast Japan代表 - inline image

"पहले शूट करें" तरीका इसलिए काम करता है क्योंकि यह AI के काम को "एक्टिंग का आविष्कार करना" से बदलकर "पहले से तय एक्टिंग का रूप बदलना" कर देता है। पोज़िशनिंग, टाइमिंग, नज़र और संपर्क — ये सब इंसान द्वारा शूट किए गए मटेरियल में होते हैं, जबकि AI सिर्फ़ पहचान और वातावरण संभालता है।

X पर एक मामला साझा किया गया था जिसमें तीन अलग-अलग लोगों वाली एक ही मटेरियल को तीनों के लिए एक ही व्यक्ति में बदल दिया गया। (पोस्ट करने वाले ने बताया कि Seedance 2.0 का उपयोग किया गया और कोई कंपोज़िटिंग या मास्क इस्तेमाल नहीं किया गया। चूँकि यह थर्ड-पार्टी पोस्ट है, निर्माण प्रक्रिया के विवरण सत्यापित नहीं किए गए हैं।)

ऐसे स्पष्ट मामले भी हैं जहाँ यह उपयुक्त नहीं है

बिना सोर्स मटेरियल के सब कुछ जनरेट करना, संपर्क बहुत जटिल होना, चेहरे पूरी तरह छिपे होना, कौन कहाँ है इसका स्पष्ट न होना, या सोर्स मटेरियल स्तर पर ही पोज़िशनिंग टूटी होना।

अगर ये पाँचों बातें लागू होती हैं, तो पहले शूट करने से समस्या हल नहीं होगी।

आधिकारिक रूप से दिखाया गया प्रॉम्प्ट टेम्पलेट

मूल क्रम यह है:

सब्जेक्ट (कौन/क्या) -> एक्शन (क्या करता है) -> कैमरा (कैसे शूट करें) -> स्टाइल (कैसा टेक्सचर)

30-सेकंड के सिंगल शॉट के लिए, आधिकारिक रूप से समय आवंटन भी दिखाया गया है:

  • 00–06s: वाइड शॉट से स्थिति दिखाएँ
  • 06–14s: क्लोज़-अप के साथ मुख्य हरकत में प्रवेश करें
  • 14–24s: कैमरा घुमाकर या इंसर्ट जोड़कर विकसित करें
  • 24–30s: समेटें

रेफरेंस उपयोग करते समय भरने और इस्तेमाल करने वाला टेम्पलेट👇

text
1रेफरेंस:
2@Image1 = [भूमिका]। यहाँ से केवल [उपयोग करने वाली जानकारी] लें। [उपयोग न करने वाली जानकारी] न लें।
3@Video1 = [भूमिका]। यहाँ से केवल [उपयोग करने वाली जानकारी] लें। [उपयोग न करने वाली जानकारी] न लें।
4
5एक्शन:
6[कौन] [कहाँ] [क्या करता है]।
7[हरकत की गुणवत्ता। बताएँ कि यह तेज़ है या धीमी, अस्त-व्यस्त है या सभ्य, और यह किसके लिए है — "X नाम की हरकत" कहने के बजाय]
8
9कैमरा:
10[व्यू का प्रकार / लेंस का एंगल]।
11[कैमरा किसके साथ तालमेल में चलता है]।
12[कैमरा की वे हरकतें जो बिल्कुल नहीं करनी चाहिए]।
13
14परफॉर्मेंस:
15[एक्टिंग की टोन। यह किसी को दिखाने के लिए है या अकेले किया गया है?]
16
17वातावरण:
18[स्थान, समय, रोशनी की प्रकृति। डिटेल्स निर्दिष्ट न करें]
19
20रखें / बदलें:
21रखें = [एक्टिंग / टाइमिंग / नज़र / पोज़िशनिंग / कैमरा मूवमेंट]
22बदलें = [व्यक्ति / वातावरण / पोशाक]
23
24प्राथमिकता:
251. [सबसे अधिक प्राथमिकता वाली चीज़]
262. [अगली प्राथमिकता वाली चीज़]
273. [अगली]

यह टेम्पलेट इसलिए प्रभावी नहीं है क्योंकि यह लिखने की मात्रा कम करता है।

इसका कारण यह है कि टेक्स्ट का काम "वीडियो का वर्णन करना" न रहकर "मटेरियल्स के लिए भूमिकाओं के विभाजन का निर्देशन करना" हो जाता है।

वीडियो में हरकत का सही उत्तर होता है, इमेज में चेहरे का सही उत्तर होता है, और व्हाइट मॉडल में स्पेस का सही उत्तर होता है। प्रॉम्प्ट उनकी व्यवस्था तय करता है।

अंत तक पढ़ने के लिए धन्यवाद।

X ([@casthirotaka](https://x.com/@casthirotaka)) पर, मैं रोज़ ऐसी कहानियाँ साझा करता हूँ जो ऐसे व्यावहारिक काम के लिए प्रभावी होती हैं।

अगर आप मुझे फॉलो करेंगे तो मुझे खुशी होगी।

YouMind में रीमिक्स करें

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें