目前正在挑戰 Seedance 2.5 的人,大概都在尋找「完美提示詞」的模板,並測試各種想得到的點子。
然而...
提示詞的責任範圍,比你想的更窄
Seedance 2.5 在單次生成中可接受 30 張圖片、10 段影片和 10 個音訊檔案 作為參考(ByteDance 官方於 2026 年 7 月 31 日公布)。
這個規格意味著,提示詞本來就不是用來解釋一切的。

要決定的事 | 提示詞適合度 | 「正確答案」該放在哪裡 |
|---|---|---|
影片目的、世界觀、氛圍 | 高 | 提示詞 |
場景類型、發生的事情 | 高 | 提示詞 |
要保留什麼、要更改什麼 | 非常高 | 提示詞 |
優先順序 | 非常高 | 提示詞 |
光線方向、鏡頭質感 | 中 | 提示詞 / 圖片 |
人物的臉、身分 | 低 | 圖片 |
精確的產品外型 | 低 | 圖片 |
複雜的肢體動作 | 低 | 影片 |
人與人的接觸、站位、視線 | 低 | 影片 |
精確的攝影機軌跡 | 低 | 影片 / 白模 |
逐幀時間點 | 低 | 影片 / 剪輯 |
判斷標準只有一個:誰握有最準確的資訊?
動作最準確的來源,是動作本身的影片,而不是對它的文字描述。
5 件不該寫進提示詞的事
1. 堆滿形容詞的氛圍描述

官方指南指出:「盡量不要堆疊形容詞。」並接著說明:「具體寫出動作和鏡頭選擇,通常效果更好。」
2. 動作的「名稱」
像 俏皮搗蛋的小舞蹈 這類概念式名稱,輸出的範圍會和詮釋的範圍一樣廣。
實際上,這個指令回傳的影片是某人在他人面前跳舞:「靠近夥伴 -> 伸出手 -> 看著夥伴。」而目標是「一個人邊走邊玩鬧,動作稍微凌亂且快速」,那甚至不算舞蹈。
3. 把身體部位的動作拆解成文字

即使把手臂如何擺動、肩膀如何抖動、攝影機如何同步反應,逐項拆解後改寫,輸出結果仍然沒有改變。官方指南表示,動作參考「比一大段模糊的文字更有用」。
就算拆解並拉長文字,也無法達到單一參考素材的資訊密度。
4. 參考素材裡已經有的資訊

官方提示詞範例會指定要從每個參考素材中取用哪些資訊。
「從 @Clay 的 Render 1 中,參考鏡頭運動、節奏、景別轉換、主體軌跡與站位。
從 @Image 2 中,參考角色設計、場景、材質、燈光、色彩與氛圍。」
如果你把參考素材已經具備的資訊寫進文字裡,參考素材和文字就會開始各說各話,導致結果崩壞。
5. 互相矛盾的指令
文字過於密集時,指令會在內部互相衝突。一旦混入無法執行的指令,AI 就會自行決定要丟棄哪一個。
5 件該寫進提示詞的事
1. 每個參考檔案的角色

官方指南的指示是「清楚標明參考素材的角色」。列出的角色包括產品身分、角色一致性、透過白模提供的動作、綠幕表演、音訊、風格,以及局部修正。角色不是只要附加檔案就會自動決定的。
2. 不要從參考素材中取用的東西
在賦予角色的同時,明確寫出你不希望它吸收的資訊。以下這個寫法實際上有效:
不要從 @Video1 複製地點、服裝、文字、人物或故事。 只複製身體節奏、手臂動作、行走節奏,以及與身體連動的鏡頭運動。
把它分開來說就是:「只模仿動作;不要模仿地點、服裝或人物。」
3. 列出不可妥協的元素

官方動作參考指南建議這樣建構提示詞:「先指名上傳的參考素材,再列出不可妥協的細節。」
- 身分
- 外型
- 比例
- 平面配置
- 產品設計
- 姿勢
- 時間點
- 聲音
- 鏡頭順序
4. 要保留什麼、要更改什麼
分別寫出要保留的項目(表演、時間點、視線、站位、鏡頭運動)和要更改的項目(人物、環境、服裝)。沒有這個區分,AI 就會自由發揮,把一切重做。
5. 優先順序
在無法同時滿足所有條件的情況下,指定優先保護的項目。在實際的提示詞中,是這樣寫的:
優先順序: 1. 配合 @Video1 的身體節奏與手臂動作。 2. 配合 @Video1 的連動鏡頭運動。 3. 保留 @Image1 的 POV 視角與環境。 4. 讓動作保持俏皮隨興,而非經過編排。
先決定「正確答案」
把目標影片拆解成各種元素,並決定每個元素的「正確答案由哪份素材來承擔」。
元素 | 正確答案該放在哪裡 | 原因 |
|---|---|---|
臉 / 人物身分 | 圖片 | 文字無法維持身分一致性 |
身體動作、站位、視線、時間點 | 影片 | 官方列為影片參考的控制目標 |
空間結構、攝影機軌跡 | 白模(無貼圖的 3D) | 官方:「當空間、攝影機路徑、相對位置比最終貼圖更重要時,效果很好」 |
人物動作、產品展示 | 綠幕素材 | 官方列為使用案例 |
世界觀、地點、意義、優先順序 | 提示詞 | 文字最強的領域 |
家具外型、小物品、背景細節 | 交給 AI | 不需要固定 |


此外,把每個元素的執行強度分成三個等級:
- 固定: 不允許任意重做(人物、產品外型、原始動作素材)。
- 引導: 給予方向但允許詮釋(豪華公寓、夜晚、溫暖燈光、有趣的氛圍)。
- 自動: 交給 AI 決定(沙發形狀、書架上的物品、牆上的細節)。
如果什麼都固定,影片會變得不自然;如果什麼都交給自動,又會偏離目標。 設計哪裡要固定、哪裡要放鬆,正是提示詞的工作。
3 種創作方式。困難的動作,先拍攝就對了
方式 | 適合的情境 |
|---|---|
全部交給 AI 生成 | 不存在於現實的世界、簡單的動作、強烈的世界觀 |
提供樣本再生成 | 臉 / 產品外型已固定,想要延續構圖 |
先拍攝、再修改 | 複雜動作、人與人的接觸、多人互動 |
第三種方式之所以重要,是因為 ByteDance 官方本身就將「多個主體互動的場景穩定性」列為 Seedance 2.5 的改進方向。想在開發者都承認困難的領域,硬靠文字突破,是一場打不贏的仗。

「先拍攝」的方法之所以有效,是因為它把 AI 的工作從「發明表演」轉變成「改變既有表演的外觀」。站位、時間點、視線與接觸,都由真人拍攝的素材來承擔,AI 只負責處理身分與環境。
在 X 上,有人分享了一個案例:將一段包含三個不同人物的素材,轉換成三個人都是同一個人。(貼文者說明是使用 Seedance 2.0,而且沒有使用合成或遮罩。由於是第三方貼文,製作過程的細節尚未經過驗證。)
但也有明確不適合的情況。
完全沒有來源素材就生成、接觸過於複雜、臉部完全被遮住、誰在哪裡含糊不清,或是在素材階段站位就已經壞掉了。
如果符合這五種情況,先拍攝也無法解決問題。
官方公布的提示詞模板
基本順序是:
主體(誰 / 什麼)-> 動作(做了什麼)-> 鏡頭(怎麼拍)-> 風格(什麼質感)
對於 30 秒的單顆鏡頭,官方甚至公布了時間分配:
- 00–06 秒:用遠景交代情境
- 06–14 秒





