如何精準產出心目中的影片:使用 Seedance 2.5 的專業指南

@casthirotaka
日語2026年8月15日
159K
165
24
2
600

TL;DR

本指南將說明如何精通 Seedance 2.5,將提示詞視為導演指令而非單純的描述,並利用影片參考素材來處理複雜的動作與角色一致性。

目前正在挑戰 Seedance 2.5 的人,大概都在尋找「完美提示詞」的模板,並測試各種想得到的點子。

然而...

提示詞的責任範圍,比你想的更窄

Seedance 2.5 在單次生成中可接受 30 張圖片、10 段影片和 10 個音訊檔案 作為參考(ByteDance 官方於 2026 年 7 月 31 日公布)。

這個規格意味著,提示詞本來就不是用來解釋一切的。

吉田洋孝|Cast Japan代表 - inline image

要決定的事

提示詞適合度

「正確答案」該放在哪裡

影片目的、世界觀、氛圍

提示詞

場景類型、發生的事情

提示詞

要保留什麼、要更改什麼

非常高

提示詞

優先順序

非常高

提示詞

光線方向、鏡頭質感

提示詞 / 圖片

人物的臉、身分

圖片

精確的產品外型

圖片

複雜的肢體動作

影片

人與人的接觸、站位、視線

影片

精確的攝影機軌跡

影片 / 白模

逐幀時間點

影片 / 剪輯

判斷標準只有一個:誰握有最準確的資訊?

動作最準確的來源,是動作本身的影片,而不是對它的文字描述。

5 件不該寫進提示詞的事

1. 堆滿形容詞的氛圍描述

吉田洋孝|Cast Japan代表 - inline image

官方指南指出:「盡量不要堆疊形容詞。」並接著說明:「具體寫出動作和鏡頭選擇,通常效果更好。」

2. 動作的「名稱」

俏皮搗蛋的小舞蹈 這類概念式名稱,輸出的範圍會和詮釋的範圍一樣廣。

實際上,這個指令回傳的影片是某人在他人面前跳舞:「靠近夥伴 -> 伸出手 -> 看著夥伴。」而目標是「一個人邊走邊玩鬧,動作稍微凌亂且快速」,那甚至不算舞蹈。

3. 把身體部位的動作拆解成文字

吉田洋孝|Cast Japan代表 - inline image

即使把手臂如何擺動、肩膀如何抖動、攝影機如何同步反應,逐項拆解後改寫,輸出結果仍然沒有改變。官方指南表示,動作參考「比一大段模糊的文字更有用」。

就算拆解並拉長文字,也無法達到單一參考素材的資訊密度。

4. 參考素材裡已經有的資訊

吉田洋孝|Cast Japan代表 - inline image

官方提示詞範例會指定要從每個參考素材中取用哪些資訊。

「從 @Clay 的 Render 1 中,參考鏡頭運動、節奏、景別轉換、主體軌跡與站位。

@Image 2 中,參考角色設計、場景、材質、燈光、色彩與氛圍。」

如果你把參考素材已經具備的資訊寫進文字裡,參考素材和文字就會開始各說各話,導致結果崩壞。

5. 互相矛盾的指令

文字過於密集時,指令會在內部互相衝突。一旦混入無法執行的指令,AI 就會自行決定要丟棄哪一個。

5 件該寫進提示詞的事

1. 每個參考檔案的角色

吉田洋孝|Cast Japan代表 - inline image

官方指南的指示是「清楚標明參考素材的角色」。列出的角色包括產品身分、角色一致性、透過白模提供的動作、綠幕表演、音訊、風格,以及局部修正。角色不是只要附加檔案就會自動決定的。

2. 不要從參考素材中取用的東西

在賦予角色的同時,明確寫出你不希望它吸收的資訊。以下這個寫法實際上有效:

不要從 @Video1 複製地點、服裝、文字、人物或故事。 只複製身體節奏、手臂動作、行走節奏,以及與身體連動的鏡頭運動。

把它分開來說就是:「只模仿動作;不要模仿地點、服裝或人物。」

3. 列出不可妥協的元素

吉田洋孝|Cast Japan代表 - inline image

官方動作參考指南建議這樣建構提示詞:「先指名上傳的參考素材,再列出不可妥協的細節。」

  • 身分
  • 外型
  • 比例
  • 平面配置
  • 產品設計
  • 姿勢
  • 時間點
  • 聲音
  • 鏡頭順序

4. 要保留什麼、要更改什麼

分別寫出要保留的項目(表演、時間點、視線、站位、鏡頭運動)和要更改的項目(人物、環境、服裝)。沒有這個區分,AI 就會自由發揮,把一切重做。

5. 優先順序

在無法同時滿足所有條件的情況下,指定優先保護的項目。在實際的提示詞中,是這樣寫的:

優先順序: 1. 配合 @Video1 的身體節奏與手臂動作。 2. 配合 @Video1 的連動鏡頭運動。 3. 保留 @Image1 的 POV 視角與環境。 4. 讓動作保持俏皮隨興,而非經過編排。

先決定「正確答案」

把目標影片拆解成各種元素,並決定每個元素的「正確答案由哪份素材來承擔」。

元素

正確答案該放在哪裡

原因

臉 / 人物身分

圖片

文字無法維持身分一致性

身體動作、站位、視線、時間點

影片

官方列為影片參考的控制目標

空間結構、攝影機軌跡

白模(無貼圖的 3D)

官方:「當空間、攝影機路徑、相對位置比最終貼圖更重要時,效果很好」

人物動作、產品展示

綠幕素材

官方列為使用案例

世界觀、地點、意義、優先順序

提示詞

文字最強的領域

家具外型、小物品、背景細節

交給 AI

不需要固定

吉田洋孝|Cast Japan代表 - inline image
吉田洋孝|Cast Japan代表 - inline image

此外,把每個元素的執行強度分成三個等級:

  • 固定: 不允許任意重做(人物、產品外型、原始動作素材)。
  • 引導: 給予方向但允許詮釋(豪華公寓、夜晚、溫暖燈光、有趣的氛圍)。
  • 自動: 交給 AI 決定(沙發形狀、書架上的物品、牆上的細節)。

如果什麼都固定,影片會變得不自然;如果什麼都交給自動,又會偏離目標。 設計哪裡要固定、哪裡要放鬆,正是提示詞的工作。

3 種創作方式。困難的動作,先拍攝就對了

方式

適合的情境

全部交給 AI 生成

不存在於現實的世界、簡單的動作、強烈的世界觀

提供樣本再生成

臉 / 產品外型已固定,想要延續構圖

先拍攝、再修改

複雜動作、人與人的接觸、多人互動

第三種方式之所以重要,是因為 ByteDance 官方本身就將「多個主體互動的場景穩定性」列為 Seedance 2.5 的改進方向。想在開發者都承認困難的領域,硬靠文字突破,是一場打不贏的仗。

吉田洋孝|Cast Japan代表 - inline image

「先拍攝」的方法之所以有效,是因為它把 AI 的工作從「發明表演」轉變成「改變既有表演的外觀」。站位、時間點、視線與接觸,都由真人拍攝的素材來承擔,AI 只負責處理身分與環境。

在 X 上,有人分享了一個案例:將一段包含三個不同人物的素材,轉換成三個人都是同一個人。(貼文者說明是使用 Seedance 2.0,而且沒有使用合成或遮罩。由於是第三方貼文,製作過程的細節尚未經過驗證。)

但也有明確不適合的情況

完全沒有來源素材就生成、接觸過於複雜、臉部完全被遮住、誰在哪裡含糊不清,或是在素材階段站位就已經壞掉了。

如果符合這五種情況,先拍攝也無法解決問題。

官方公布的提示詞模板

基本順序是:

主體(誰 / 什麼)-> 動作(做了什麼)-> 鏡頭(怎麼拍)-> 風格(什麼質感)

對於 30 秒的單顆鏡頭,官方甚至公布了時間分配:

  • 00–06 秒:用遠景交代情境
  • 06–14 秒
二次創作

使用 YouMind 創作爆款文章

收集素材、拆解爆點、生成視覺資產、撰寫內容,並在一個 AI 工作空間裡完成分發。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章