正在挑战 Seedance 2.5 的人们,大概都在寻找"完美提示词"的模板,并测试着一切能想到的想法吧。
然而……
提示词的责任范围,比你想的更窄
Seedance 2.5 在单次生成中最多可接受 30 张图片、10 个视频和 10 个音频文件 作为参考(由 ByteDance 官方于 2026 年 7 月 31 日公布)。
这个规格意味着,提示词并不是用来把一切都讲清楚的。

要决定的事项 | 提示词的适合程度 | "正确答案"应该放在哪里 |
|---|---|---|
视频目的、世界观、氛围 | 高 | 提示词 |
场景类型、发生的事 | 高 | 提示词 |
保留什么、改变什么 | 非常高 | 提示词 |
优先级 | 非常高 | 提示词 |
光线方向、镜头质感 | 中 | 提示词 / 图片 |
人物的脸、身份 | 低 | 图片 |
准确的产品形状 | 低 | 图片 |
复杂的身体动作 | 低 | 视频 |
人物间的接触、位置关系、视线 | 低 | 视频 |
准确的运镜轨迹 | 低 | 视频 / 白模 |
逐帧的时间节奏 | 低 | 视频 / 剪辑 |
判断标准只有一个:谁掌握着最准确的信息?
关于动作,最准确的信息来源是动作本身的视频,而不是对它的文字描述。
提示词中不该写的 5 件事
1. 堆砌形容词的氛围描写

官方指南指出:"尽量不要堆砌形容词。"并补充说:"写明动作和镜头选择,通常效果会更好。"
2. 给动作起"名字"
像 playful cheeky mini-dance 这样的概念化名称,输出的范围会像理解的范围一样广。
实际上,这个指令返回的是一个人在别人面前跳舞的视频:"走向舞伴 → 双手前伸 → 看着舞伴"。而目标原本是"一个人边走边闹,动作略显凌乱、速度较快",那根本算不上舞蹈。
3. 把身体各部位的动作拆解成文字

即使把手臂如何摆动、肩膀如何晃动、镜头如何随之同步反应逐项拆解改写,输出结果也没有变化。官方指南表示,动作参考"比一段冗长模糊的文字更有用"。
就算你拆解得再细、写得再长,也不可能达到一份参考素材的信息密度。
4. 参考素材里已有的信息

官方的提示词示例明确规定了要从每份参考素材中提取什么信息。
"从 @Clay Render 1 中,参考运镜、节奏、景别转换、主体轨迹和位置关系。
从 @Image 2 中,参考角色设计、场景、材质、光线、色彩和氛围。"
如果在文字里写出参考素材已有的信息,参考素材和文字就会各说各话,最终导致生成崩坏。
5. 相互矛盾的指令
密集的段落会让指令在内部互相冲突。一旦混入无法执行的指令,AI 就会自行决定丢弃其中某一条。
提示词中该写的 5 件事
1. 每份参考素材的角色

官方指南的指示是"明确写出参考素材的角色"。列出的角色包括:产品身份、角色一致性、通过白模提供的动作、绿幕表演、音频、风格和局部修改。角色并不是光把文件挂上去就会自动确定的。
2. 不希望从参考中使用的信息
在指定角色的同时,明确写出不希望它借鉴的信息。下面这种写法实际效果很好:
不要复制 @Video1 中的场景、服装、文字、人物或故事。 只复制身体节奏、手臂姿势、走路节奏和与身体联动的运镜。
要分开写:"只模仿动作;不要模仿场景、衣服或人物。"
3. 逐条列出不可妥协的元素

官方的动作参考指南建议这样构建提示词:"先写明上传的参考素材,再列出不可妥协的细节。"
- 身份
- 外形
- 比例
- 平面布局
- 产品设计
- 姿态
- 节奏
- 声音
- 镜头顺序
4. 保留什么、改变什么
把要保留的内容(表演、节奏、视线、位置、运镜)和要改变的内容(人物、环境、服装)分开来写。不做区分的话,AI 就有权利把一切都重做。
5. 优先级
在无法同时满足所有要求时,明确写出优先保护什么。在实际的提示词中,可以这样写:
优先级: 1. 匹配 @Video1 的身体节奏和手臂动作。 2. 匹配 @Video1 中与身体联动的运镜。 3. 保留 @Image1 的 POV 视角和环境。 4. 保持动作俏皮随意,而不是像编排好的舞蹈。
先决定"正确答案"放在哪里
把想要的视频拆解成各个元素,并分别决定每个元素由哪份"素材来提供正确答案"。
元素 | 正确答案所在 | 原因 |
|---|---|---|
脸 / 人物身份 | 图片 | 文字无法维持身份的一致性 |
身体动作、位置关系、视线、节奏 | 视频 | 官方明确表示这是视频参考的控制对象 |
空间结构、运镜轨迹 | 白模(无贴图的 3D 模型) | 官方:"当空间、运镜路径和相对位置比最终质感更重要时,白模很有效" |
人物动作、产品展示 | 绿幕素材 | 官方明确列出的用例 |
世界观、场景、含义、优先级 | 提示词 | 文字最擅长发挥的领域 |
家具形状、小物件、背景细节 | 交给 AI | 无需固定 |


此外,把每个元素的约束强度分为三个层级:
- 固定: 不允许随意重做(人物、产品形状、原始动作素材)。
- 引导: 给出方向,但允许一定演绎(豪华公寓、夜晚、温馨灯光、有趣氛围)。
- 自动: 完全交给 AI(沙发形状、书架上的物品、墙面细节)。
如果全部固定,视频会变得不自然;如果全部交给自动,又会偏离目标。 设计哪里该固定、哪里该放松,正是提示词的工作。
3 种创作方式:困难动作先实拍
方式 | 适用场景 |
|---|---|
让 AI 全权生成 | 不存在的世界、简单的动作、强烈的世界观 |
提供样片再生成 | 脸部/产品形状已固定,想延续构图 |
先实拍,再替换 | 复杂动作、人物接触、多人互动 |
第三种方式之所以重要,是因为 ByteDance 官方自己就把"多人互动场景的稳定性"列为 Seedance 2.5 的待改进方向。想在开发者都承认困难的领域里靠文字强行突破,注定是场打不赢的仗。

"先实拍"之所以有效,是因为它把 AI 的任务从"凭空创造表演"变成了"替换既有表演的外形"。位置、节奏、视线和接触都由实拍素材来承担,AI 只需要处理身份和环境。
在 X 上,有人分享过一个案例:一份出现了三个不同人物的素材,被统一替换成了同一个人。(发帖人说明使用的是 Seedance 2.0,且没有使用合成或蒙版。由于是第三方帖子,制作过程的细节未经核实。)
也有一些明确不适合的情况。
没有参考素材就凭空生成、人物接触过于复杂、脸部被完全遮挡、谁在什么位置含糊不清、或者在素材阶段位置关系就已经崩坏。
如果中了这五条,先实拍也无法解决。
官方展示的提示词模板
基本顺序是:
主体(谁/什么)→ 动作(做什么)→ 镜头(怎么拍)→ 风格(什么质感)
对于 30 秒的单镜头,官方甚至展示了时间分配:
- 00–06 秒:用全景交代情境
- 06–14 秒:用特写进入主要动作
- 14–24 秒:通过运镜或插入镜头展开
- 24–30 秒:收束
使用参考素材时,可以直接填写套用的模板👇
1参考文件:2@Image1 = [角色]。只从这里使用 [要使用的信息]。不要使用 [不使用的信息]。3@Video1 = [角色]。只从这里使用 [要使用的信息]。不要使用 [不使用的信息]。45动作:6[谁] [在哪里] [做什么]。7[动作的质量。比起"名为 X 的动作",请写明它是快是慢、是凌乱还是规矩、面向谁而做]89镜头:10[视角类型 / 镜头焦段]。11[镜头与什么同步运动]。12[绝对不要做的运镜行为]。1314表演:15[表演的温度。是做给别人看的,还是独自进行的?]1617环境:18[地点、时间、光线的特质。不要指定细节]1920保留 / 改变:21保留 = [表演 / 节奏 / 视线 / 位置 / 运镜]22改变 = [人物 / 环境 / 服装]2324优先级:251. [最优先保护的内容]262. [其次保护的内容]273. [再接下来]
这个模板有效,并不是因为它减少了写作量。
而是因为文字的角色从"描述视频"变成了"指挥素材的分工"。
动作的正确答案在视频里,脸的正确答案在图片里,空间的正确答案在白模里。提示词则负责决定它们之间的安排。
感谢你读到最后。
在 X([@casthirotaka](https://x.com/@casthirotaka))上,我每天都在分享对这种实战工作有效的经验。
如果你能关注我,我会很开心。





