जो लोग अभी Seedance 2.5 के साथ खुद को चुनौती दे रहे हैं, वे शायद "परफेक्ट प्रॉम्प्ट" टेम्पलेट खोज रहे हैं और हर उस आइडिया को आज़मा रहे हैं जो उनके दिमाग में आता है।
हालाँकि...
प्रॉम्प्ट की ज़िम्मेदारी का दायरा आपके सोचने से कहीं ज़्यादा संकीर्ण है
Seedance 2.5 एक ही जनरेशन में 30 इमेज, 10 वीडियो और 10 ऑडियो फ़ाइलें रेफरेंस के रूप में स्वीकार करता है (ByteDance आधिकारिक घोषणा, 31 जुलाई 2026)।
इस स्पेसिफिकेशन का अर्थ है कि प्रॉम्प्ट से सब कुछ समझाने की अपेक्षा नहीं की जाती।

क्या तय करना है | प्रॉम्प्ट की उपयुक्तता | "सही" उत्तर कहाँ रखें |
|---|---|---|
वीडियो का उद्देश्य, विश्वदृष्टि, माहौल | उच्च | प्रॉम्प्ट |
स्थान का प्रकार, क्या होता है | उच्च | प्रॉम्प्ट |
क्या रखना है, क्या बदलना है | बहुत उच्च | प्रॉम्प्ट |
प्राथमिकताएँ | बहुत उच्च | प्रॉम्प्ट |
लाइटिंग की दिशा, लेंस का फील | मध्यम | प्रॉम्प्ट / इमेज |
व्यक्ति का चेहरा, पहचान | निम्न | इमेज |
सटीक प्रोडक्ट आकार | निम्न | इमेज |
जटिल शारीरिक हरकतें | निम्न | वीडियो |
शारीरिक संपर्क, पोज़िशनिंग, नज़र | निम्न | वीडियो |
सटीक कैमरा ट्रैजेक्टरी | निम्न | वीडियो / व्हाइट मॉडल |
फ्रेम-दर-फ्रेम टाइमिंग | निम्न | वीडियो / एडिटिंग |
निर्णय का केवल एक मानदंड है: सबसे सटीक जानकारी किसके पास है?
हरकत के लिए सबसे सटीक स्रोत उस हरकत का वीडियो है, न कि उसका टेक्स्ट विवरण।
5 चीज़ें जो आपको प्रॉम्प्ट में नहीं लिखनी चाहिए
1. विशेषणों से भरे माहौल का वर्णन

आधिकारिक गाइड कहता है: "विशेषणों को जमा करने से बचें।" आगे कहता है, "हरकत और लेंस के चुनाव के बारे में स्पष्ट होना आमतौर पर बेहतर काम करता है।"
2. हरकतों के "नाम"
playful cheeky mini-dance जैसे कॉन्सेप्टुअल नामों का आउटपुट उतना ही विस्तृत होता है जितनी उनकी व्याख्या की गुंजाइश होती है।
हकीकत में, इस निर्देश ने किसी दूसरे के सामने नाचते हुए व्यक्ति का वीडियो लौटाया: "पार्टनर के पास जाना -> हाथ आगे बढ़ाना -> पार्टनर को देखना।" लक्ष्य था "अकेले चलते हुए मस्ती करना, थोड़ी अस्त-व्यस्त और तेज़ हरकत," जो डांस है ही नहीं।
3. शरीर के अंगों की हरकतों को टेक्स्ट में तोड़ना

भले ही आप बाहों के झूलने, कंधों के हिलने और कैमरे के हर अंग के साथ तालमेल में प्रतिक्रिया करने के तरीके को टुकड़ों में बाँटकर दोबारा लिखें, आउटपुट नहीं बदला। आधिकारिक गाइड कहता है कि मोशन रेफरेंस "लंबे अस्पष्ट पैराग्राफ से ज़्यादा उपयोगी" होते हैं।
भले ही आप इसे टुकड़ों में बाँटकर लंबा कर दें, यह एक रेफरेंस के सूचना घनत्व तक नहीं पहुँचेगा।
4. वह जानकारी जो रेफरेंस मटेरियल में पहले से मौजूद है

आधिकारिक प्रॉम्प्ट उदाहरण बताते हैं कि हर रेफरेंस से कौन सी जानकारी लेनी है।
" @Clay Render 1 से कैमरा मूवमेंट, गति, शॉट साइज़ ट्रांज़िशन, सब्जेक्ट की ट्रैजेक्टरी और पोज़िशनिंग को रेफरेंस के रूप में लें।
@Image 2 से कैरेक्टर डिज़ाइन, दृश्य, मटेरियल, लाइटिंग, रंग और माहौल को रेफरेंस के रूप में लें।"
अगर आप टेक्स्ट में वह जानकारी लिखते हैं जो रेफरेंस में पहले से मौजूद है, तो रेफरेंस और टेक्स्ट अलग-अलग बातें कहने लगेंगे, जिससे ब्रेकडाउन हो जाएगा।
5. आपस में विरोधाभासी निर्देश
घने पैराग्राफ के कारण निर्देश आपस में टकराते हैं। जैसे ही कोई असंभव निर्देश मिल जाता है, AI खुद तय कर लेता है कि किसे छोड़ना है।
5 चीज़ें जो आपको प्रॉम्प्ट में लिखनी चाहिए
1. हर रेफरेंस फ़ाइल की भूमिका

आधिकारिक गाइड का निर्देश है कि "रेफरेंस की भूमिकाओं का स्पष्ट रूप से उल्लेख करें।" सूचीबद्ध भूमिकाओं में प्रोडक्ट की पहचान, कैरेक्टर की स्थिरता, व्हाइट मॉडल से हरकत, ग्रीन स्क्रीन एक्टिंग, ऑडियो, स्टाइल और आंशिक सुधार शामिल हैं। भूमिकाएँ सिर्फ़ फ़ाइलें अटैच करने से तय नहीं होतीं।
2. उस रेफरेंस से क्या उपयोग नहीं करना है
भूमिकाएँ देते समय, स्पष्ट रूप से बताएँ कि आप कौन सी जानकारी उसे नहीं उठाने देना चाहते। यह वाक्यांश वाकई काम कर गया:
@Video1 से लोकेशन, कपड़े, टेक्स्ट, लोग या कहानी की नकल न करें। सिर्फ़ शरीर की लय, बाजुओं के इशारे, चलने की लय और शरीर से जुड़ी कैमरा मोशन की नकल करें।
इसे अलग करें: "सिर्फ़ हरकत की नकल करें; लोकेशन, कपड़े या लोगों की नकल न करें।"
3. अनिवार्य तत्वों की सूची

आधिकारिक मोशन रेफरेंस गाइड प्रॉम्प्ट निर्माण के लिए ऐसा निर्देश देता है: "अपलोड किए गए रेफरेंस के नाम से शुरू करें, फिर अनिवार्य विवरण सूचीबद्ध करें।"
- पहचान
- आकार
- स्केल
- फ़्लोर प्लान
- प्रोडक्ट डिज़ाइन
- पोज़
- टाइमिंग
- आवाज़
- शॉट क्रम
4. क्या रखना है और क्या बदलना है
क्या रखना है (एक्टिंग, टाइमिंग, नज़र, पोज़िशनिंग, कैमरा मूवमेंट) और क्या बदलना है (व्यक्ति, वातावरण, पोशाक) — अलग-अलग लिखें। इस अंतर के बिना, AI को सब कुछ दोबारा बनाने की पूरी आज़ादी मिल जाती है।
5. प्राथमिकताएँ
ऐसी स्थितियों में जहाँ सब कुछ एक साथ फॉलो नहीं किया जा सकता, साफ़ तौर पर बताएँ कि सबसे पहले किसे सुरक्षित रखना है। एक वास्तविक प्रॉम्प्ट में इसे ऐसे लिखा गया था:
प्राथमिकता: 1. @Video1 के शरीर की लय और बाजुओं की हरकत से मिलान करें। 2. @Video1 की शरीर से जुड़ी कैमरा मोशन से मिलान करें। 3. @Image1 का POV परिप्रेक्ष्य और वातावरण बनाए रखें। 4. हरकत को कोरियोग्राफ किए बजाय चंचल और सहज रखें।
पहले "सही उत्तर" तय करें
मनचाहे वीडियो को तत्वों में बाँटें और तय करें कि हर तत्व के लिए किस "मटेरियल में सही उत्तर है"।
तत्व | सही उत्तर कहाँ रखें | कारण |
|---|---|---|
चेहरा / व्यक्ति की पहचान | इमेज | टेक्स्ट पहचान बनाए नहीं रख सकता |
शरीर की हरकत, पोज़िशनिंग, नज़र, टाइमिंग | वीडियो | आधिकारिक रूप से वीडियो रेफरेंस के नियंत्रण लक्ष्य बताए गए |
स्थानिक संरचना, कैमरा ट्रैजेक्टरी | व्हाइट मॉडल (बिना टेक्सचर वाला 3D) | आधिकारिक: "जब अंतिम टेक्सचर से ज़्यादा स्पेस, कैमरा पाथ और सापेक्ष स्थिति महत्वपूर्ण हों तो प्रभावी" |
मानवीय क्रियाएँ, प्रोडक्ट डेमो | ग्रीन स्क्रीन मटेरियल | आधिकारिक रूप से उपयोग के मामले के रूप में बताया गया |
विश्वदृष्टि, स्थान, अर्थ, प्राथमिकता | प्रॉम्प्ट | वह क्षेत्र जहाँ टेक्स्ट सबसे मज़बूत है |
फ़र्नीचर का आकार, छोटी चीज़ें, बैकग्राउंड विवरण | AI पर छोड़ दें | तय करने की ज़रूरत नहीं |


इसके अलावा, हर तत्व के लिए लागू करने की ताकत को तीन स्तरों में बाँटें:
- फिक्स्ड: मनमाने ढंग से दोबारा बनाने की अनुमति न दें (व्यक्ति, प्रोडक्ट का आकार, मूल हरकत का मटेरियल)।
- गाइडेड: दिशा दें लेकिन व्याख्या की गुंजाइश रखें (लग्ज़री अपार्टमेंट, रात, गर्म लाइटिंग, मज़ेदार माहौल)।
- ऑटो: इसे AI पर छोड़ दें (सोफे का आकार, बुकशेल्फ़ पर रखी चीज़ें, दीवार की डिटेल्स)।
अगर आप सब कुछ फिक्स कर देते हैं, तो वीडियो अप्राकृतिक हो जाता है; अगर सब कुछ ऑटो पर छोड़ देते हैं, तो यह लक्ष्य से भटक जाता है। कहाँ तय करना है और कहाँ ढील देना है — यह डिज़ाइन करना ही प्रॉम्प्ट का काम है।
बनाने के 3 तरीके। पहले मुश्किल हरकतों को शूट करें
तरीका | उपयुक्त स्थितियाँ |
|---|---|
AI से सब कुछ बनवाएँ | मौजूद न होने वाली दुनिया, सरल हरकतें, मज़बूत विश्वदृष्टि |
सैंपल देकर बनवाएँ | चेहरा/प्रोडक्ट का आकार तय है, कंपोज़िशन जारी रखना चाहते हैं |
पहले शूट करें, फिर बदलें | जटिल हरकतें, शारीरिक संपर्क, कई लोगों की परस्पर क्रिया |
तीसरे तरीके के महत्वपूर्ण होने का कारण यह है कि ByteDance खुद Seedance 2.5 में "कई सब्जेक्ट्स के परस्पर संपर्क वाले दृश्यों की स्थिरता" को सुधार के क्षेत्र के रूप में सूचीबद्ध करता है। जिस क्षेत्र को डेवलपर स्वयं कठिन मानता है, उसे टेक्स्ट के ज़रिए पार कराने की कोशिश हारी हुई लड़ाई है।

"पहले शूट करें" तरीका इसलिए काम करता है क्योंकि यह AI के काम को "एक्टिंग का आविष्कार करना" से बदलकर "पहले से तय एक्टिंग का रूप बदलना" कर देता है। पोज़िशनिंग, टाइमिंग, नज़र और संपर्क — ये सब इंसान द्वारा शूट किए गए मटेरियल में होते हैं, जबकि AI सिर्फ़ पहचान और वातावरण संभालता है।
X पर एक मामला साझा किया गया था जिसमें तीन अलग-अलग लोगों वाली एक ही मटेरियल को तीनों के लिए एक ही व्यक्ति में बदल दिया गया। (पोस्ट करने वाले ने बताया कि Seedance 2.0 का उपयोग किया गया और कोई कंपोज़िटिंग या मास्क इस्तेमाल नहीं किया गया। चूँकि यह थर्ड-पार्टी पोस्ट है, निर्माण प्रक्रिया के विवरण सत्यापित नहीं किए गए हैं।)
ऐसे स्पष्ट मामले भी हैं जहाँ यह उपयुक्त नहीं है।
बिना सोर्स मटेरियल के सब कुछ जनरेट करना, संपर्क बहुत जटिल होना, चेहरे पूरी तरह छिपे होना, कौन कहाँ है इसका स्पष्ट न होना, या सोर्स मटेरियल स्तर पर ही पोज़िशनिंग टूटी होना।
अगर ये पाँचों बातें लागू होती हैं, तो पहले शूट करने से समस्या हल नहीं होगी।
आधिकारिक रूप से दिखाया गया प्रॉम्प्ट टेम्पलेट
मूल क्रम यह है:
सब्जेक्ट (कौन/क्या) -> एक्शन (क्या करता है) -> कैमरा (कैसे शूट करें) -> स्टाइल (कैसा टेक्सचर)
30-सेकंड के सिंगल शॉट के लिए, आधिकारिक रूप से समय आवंटन भी दिखाया गया है:
- 00–06s: वाइड शॉट से स्थिति दिखाएँ
- 06–14s: क्लोज़-अप के साथ मुख्य हरकत में प्रवेश करें
- 14–24s: कैमरा घुमाकर या इंसर्ट जोड़कर विकसित करें
- 24–30s: समेटें
रेफरेंस उपयोग करते समय भरने और इस्तेमाल करने वाला टेम्पलेट👇
1रेफरेंस:2@Image1 = [भूमिका]। यहाँ से केवल [उपयोग करने वाली जानकारी] लें। [उपयोग न करने वाली जानकारी] न लें।3@Video1 = [भूमिका]। यहाँ से केवल [उपयोग करने वाली जानकारी] लें। [उपयोग न करने वाली जानकारी] न लें।45एक्शन:6[कौन] [कहाँ] [क्या करता है]।7[हरकत की गुणवत्ता। बताएँ कि यह तेज़ है या धीमी, अस्त-व्यस्त है या सभ्य, और यह किसके लिए है — "X नाम की हरकत" कहने के बजाय]89कैमरा:10[व्यू का प्रकार / लेंस का एंगल]।11[कैमरा किसके साथ तालमेल में चलता है]।12[कैमरा की वे हरकतें जो बिल्कुल नहीं करनी चाहिए]।1314परफॉर्मेंस:15[एक्टिंग की टोन। यह किसी को दिखाने के लिए है या अकेले किया गया है?]1617वातावरण:18[स्थान, समय, रोशनी की प्रकृति। डिटेल्स निर्दिष्ट न करें]1920रखें / बदलें:21रखें = [एक्टिंग / टाइमिंग / नज़र / पोज़िशनिंग / कैमरा मूवमेंट]22बदलें = [व्यक्ति / वातावरण / पोशाक]2324प्राथमिकता:251. [सबसे अधिक प्राथमिकता वाली चीज़]262. [अगली प्राथमिकता वाली चीज़]273. [अगली]
यह टेम्पलेट इसलिए प्रभावी नहीं है क्योंकि यह लिखने की मात्रा कम करता है।
इसका कारण यह है कि टेक्स्ट का काम "वीडियो का वर्णन करना" न रहकर "मटेरियल्स के लिए भूमिकाओं के विभाजन का निर्देशन करना" हो जाता है।
वीडियो में हरकत का सही उत्तर होता है, इमेज में चेहरे का सही उत्तर होता है, और व्हाइट मॉडल में स्पेस का सही उत्तर होता है। प्रॉम्प्ट उनकी व्यवस्था तय करता है।
अंत तक पढ़ने के लिए धन्यवाद।
X ([@casthirotaka](https://x.com/@casthirotaka)) पर, मैं रोज़ ऐसी कहानियाँ साझा करता हूँ जो ऐसे व्यावहारिक काम के लिए प्रभावी होती हैं।
अगर आप मुझे फॉलो करेंगे तो मुझे खुशी होगी।





