如何使用 Grok Imagine 从零开始制作短片

@tetsuoai
英语2026年8月06日
1.0M
1.6K
273
135
1.3K

TL;DR

本综合教程详细介绍了使用 Grok Imagine 创作 AI 短片的全流程,重点讲解如何通过参考图和结构化提示词来保持角色与场景的一致性。

Grok Imagine 这周跨过了一条线。Imagine Video 1.5 上个月发布,带来了更好的运动表现、物理效果和音频。7 月 31 日,xAI 加入了让真正电影制作成为可能的那块拼图:图像和语音参考、文本生成视频,以及原生 1080p。现在你可以把命名的参考图像附加到单次生成上,每一张图像锁定一个元素。一张脸、一个地点、一个道具。保留角色,换掉场景。保留场景,换掉角色。两者都保留,只改变动作。

先把可用性说清楚,免得有人白花一晚上找按钮。图像和语音参考已在美国上线,适用于 SuperGrok Heavy 和 SuperGrok Plus,入口在 grok.com/imagine 和 iOS,接下来几天会陆续推送到所有订阅档位。文本生成视频和原生 1080p 已在 Web、iOS 和 Android 全面开放。API 方面,模型名为 grok-imagine-video-1.5,带 reference_image_urls 参数,按秒计费,时长和分辨率决定成本。

这篇文章就是完整的流水线。一个想法进来,一条成片出去。我会展示沿途的每一个提示词、每一个节拍、每一次生成。

tetsuo - inline image

我还会把这套流程中我用到的所有技能都提供给你,用来在 Grok 里创作营销内容和短片。

社区资源

开始之前,这里有一些 Grok Imagine 的资源。

  • Codex 3.0:来自 @_VVSVS(Ivan Flugelman 的 AI 艺术项目)的免费可下载"世界构建手稿":一本 120 页的 PDF,包含视觉框架、世界观理论和 Midjourney 提示词表,覆盖 10 种美学原型,用作其订阅邮件和付费学院的引流钩子。
  • Cinematique:他的免费开源电影提示词库:涵盖摄影、灯光、构图、剪辑和类型的 150 多种电影技法,每种技法都附带可直接复制的 AI 图像和视频生成提示词。
  • grokfilm.app@signerless 的开源索引,收录摄影、灯光和剪辑技法,经过分类、注释,并写成适用于生成式电影创作的提示词语言,附有用 Grok Imagine 渲染的示例样片。
  • @heavypulp 是 X 上最优秀的内容创作者之一。他们发布过多篇关于如何使用 Grok Imagine 制作电影的教程帖。

https://x.com/heavypulp/status/2079629058287997221

开始之前你需要安装的四个技能

本教程中的一切流程都通过四个 Grok 技能来驱动。在触碰步骤 1 之前,请先把它们全部装好。它们不是可选的附加功能,它们就是整条流水线本身。

tetsuo - inline image
  1. Script writer(脚本编剧):把一行前提变成一个完整的短片剧本:角色、地点、道具和编号节拍,每个节拍对应一个镜头。这构建了后续所有内容所读取的圣经和节拍结构。https://grok.com/skill-link/4ea4d5d0f3db64a305201b8ecdd58c19
  1. Char sheet(角色设定表):为每个角色生成一张锁定的三视图参考图——正面、背面、肖像——让他们在每一个镜头中保持一致,而不是随场景切换逐渐漂移。大多数人在制作角色设定表时没有意识到的一点:当参考图像中包含多个面部视角时,视频模型会在面部上漂移。你只需要一张面部特写,技能会替你处理好。如果它返回的提示词生成的角色头部被裁出画框,那是正确的,别怀疑自己。除非你在做 3D 建模,否则不需要面部的侧面轮廓。绿幕对 AI 参考也不起作用,绿色会渗进生成场景。每次都改用浅灰色背景。https://grok.com/skill-link/2fc5926c10669d41d5b59d012b3bf11b
  1. Location/prop reference(地点/道具参考):为每个地点和道具生成干净的参考图——空场景、正确的灯光、产品级的物体——让地点和物体在镜头间像角色一样保持一致。https://grok.com/skill-link/9ea62d13b889ef13d561f2bdf58fb05f
  1. Prompt-creator(提示词生成器):把剧本的每个节拍变成一条完整的、细节拉满的 Grok Imagine 视频提示词,拿过来就能直接生成。https://grok.com/skill-link/0792131c8a1e985998c0973522a41255

https://x.com/tetsuoai/status/2083878550885830769

贯穿一切的唯一规则

视频模型在两次生成之间没有任何记忆。每个片段都是从零开始。如果不借助参考图像和重复文本强制约束,你的角色在第 4 个镜头里和第 1 个镜头不会一样。整个工作流的存在就是为了对抗这一点。把一致性前置到一份书面圣经里,在生成任何视频之前先产出参考图像,并让每个镜头提示词都成为一份密封文档,重申模型需要知道的一切。

参考图像承载身份。文本承载动作并锁定关键细节。两者缺一不可。

第 1 步:把想法变成节拍脚本

我的想法只有一句话:一部关于两个人穿越不同历史时期、边走边聊 Grok Imagine 视频和 AI 的短片。

tetsuo - inline image

在写任何一个节拍之前,先回答四个问题。这些决定会 cascading 影响到下游的一切。

时长。每次生成的镜头时长为 5 到 10 秒,所以每分钟银幕时间预算 6 到 10 个节拍。我想要一个 45 秒的短片,所以用了 5 个节拍。一部 2 分钟的电影需要 15 到 20 个节拍。现在就决定这一点,因为它决定了你故事的上限。

场景(地点)。有多少个不同的地点。每个地点都是一张需要生成和管理的参考图像,所以越少越省钱、越紧凑。我选了两个:一条小巷和一个屋顶。

对白。要么完全无声,要么尽量少说话。长篇演讲在 AI 唇形同步面前必死无疑。Deadline 就是完全无声的。如果你的角色确实要说话,Grok Imagine 现在可以配合面部一起使用语音参考,并在场景之间同时锁定两者,所以有对白的短片是可行的。把台词控制在一两句以内。

结局。圆满、悲剧、循环、悬念。选一个,然后让每个节拍都朝它推进。我选了悬念:她交付了,然后被发现。

然后按照这个精确顺序用四个部分写剧本:角色(CHARACTERS)、地点(LOCATIONS)、道具(PROPS)、剧本(SCRIPT)。前三部分就是你的圣经。圣经不是装饰文字。它是每个提示词复制内容的唯一事实来源。

角色。一部短片用 2 到 5 个。每个角色都有一个名字、一个标签(如 @mara)、一行角色说明,以及一段图像模型能够保持一致的外貌描述:年龄、体型、发型、服装,外加至少一个独特标识。一道伤疤、一副护目镜、一只撕裂的袖子。标识是让角色在多个镜头中保持可辨识度的关键。描述写一次,之后每次出现都复用完全相同的措辞。不要事后改写自己。措辞本身就是一致性工具。

地点。每个场景都有一个标签和一段可拍摄的画面描述:时间段、色调、天气、关键地标。要写成能拍的,而不是文学的。"锈橙色沙漠、黄金时刻、热浪蒸腾、地平线上有一口废弃的卫星天线",胜过"一片荒凉的废土"。

道具。用列表列出剧情需要的每件物品。任何在多个镜头中出现的道具,都要配一段简短的外貌描述和一个标签。

剧本。逐场写,剧本格式。先是场景标题(slugline),然后是一行 ASSETS(资产)列出该场景中出现的所有标签,然后是编号节拍。一个节拍等于一个镜头,等于一个机位设置加上一个视觉变化。如果一个节拍里有两个机位设置,把它拆开。

两个记录习惯在生成时会带来巨大回报:

逐节拍资产列表。如果一个节拍是特写镜头、不包含某个道具,就给这个节拍单独写一行 ASSETS,只列画面中的东西。在物体不该出现的镜头里附加参考图,模型会强行把它塞进画面。

状态(STATE)备注。每当一个节拍改变了某个需要延续到后面的状态,就用一行像 \STATE:从现在起芯片一直在她握紧的拳头里。\ 这样的文字来结尾。模型不会记住这一点。但你会,而且之后的每个提示词都必须把它作为当前事实重申。

把电影和幻灯片区分开的结构技巧:每个场景都通过发现、威胁、险情、灾难、转场层层推进。每个节拍都以一个揭示、一次冲击或一个迫近的威胁收尾。每个剪辑点上的钩子,就是让成片有生命力的东西。让一个道具或母题贯穿所有场景,让整部电影读起来是一个完整的故事。如果你想要反转,至少在揭示之前两个节拍时就把它视觉性地埋进去。

下面是完整的《漫步》,由那一句话构建而来。

markdown
1# 漫步(THE WALK)
2
3一句话梗概:两个朋友漫步穿过四个历史时代,争论 AI 视频到底能不能让人感觉真实,却不知道他们自己就是那段视频。
4
5## 角色(CHARACTERS)
6
7**VERA** `@vera`
8怀疑主义者。女性,35 岁左右,干练的黑色波波头,走路身姿挺拔。无论哪个时代、穿什么服装,都戴着一条红色围巾。这条围巾是她的锁定标识:同样的深红羊毛,喉结下方松松地打了个结,一端磨出流苏。
9
10**OTIS** `@otis`
11相信主义者。男性,接近 50 岁,花白短须,无论哪个时代都戴着一副黄铜圆框眼镜。说话时手势热情生动。眼镜是他的锁定标识:细黄铜镜框,小巧的圆形镜片。
12
13每个时代的服装都会变化;围巾和眼镜永远不变。
14
15## 地点(LOCATIONS)
16
17**罗马广场** `@roman_forum`
18正午阳光,白色大理石柱和雕像,土黄色的地面蒙着灰,天空湛蓝无云,身穿托加的市民在主角身后虚焦处走动。
19
20**中世纪集市** `@medieval_market`
21阴沉的灰色光线,木质货摊,泥泞的街道,挂着的野味和块根蔬菜,飘着细雪,远处有一座石头门楼。
22
23**1920 年代街道** `@jazz_street`
24黄昏,湿漉漉的柏油路面倒映着暖色的钨丝灯光店面,福特 T 型车停在路边,剧院灯牌亮着,行人戴着钟形帽、穿着长大衣。
25
26**霓虹小巷** `@neon_alley`
27夜晚,密集的赛博朋克小巷,下雨,层层叠叠的粉色和青色全息招牌,通风口喷出蒸汽,深色镀铬墙面。
28
29**卧室** `@bedroom`
30昏暗的现代卧室,只有手机屏幕的光线,浅景深,除了手机以外一切都柔和虚化。
31
32## 道具(PROPS)
33
34- **红围巾** `@red_scarf`:深红羊毛,松松的结,一端磨出流苏。一直戴在 Vera 身上;通过每个提示词中的文字锁定。是将四个时代缝合在一起的核心母题。
35- **手机** `@phone`:一部现代智能手机,握在一个看不见的观众手里,正在一个生成应用界面里播放视频,带有"重新生成"按钮。只在最后一场戏出现。
36
37## 剧本(SCRIPT)
38
39外景. 罗马广场 - 日
40资产:角色 @vera @otis — 地点 @roman_forum — 道具 @red_scarf
41
42**节拍 1.**
43广角跟拍镜头。VERA 和 OTIS 身着罗马服饰并肩穿过广场,她的红围巾在白色大理石映衬下格外醒目。市民在身后游走。
44
45 OTIS
46 现在人们敲下一句话,就能得到
47 一整个世界。会动的。会呼吸的。
48
49 VERA
50 一种把戏。不过是画得很快的画。
51
52**节拍 2.**
53他们经过一座皇帝的大理石雕像。当他们走出画面时,雕像的眼睛追随着他们转动——然后眨了一下。谁都没有注意到。他们穿过一道石拱门,光线骤然炸成一片白色。
54状态:穿过拱门后,服装换成中世纪装束;围巾和眼镜不变。
55
56外景. 中世纪集市 - 日
57资产:角色 @vera @otis — 地点 @medieval_market — 道具 @red_scarf
58
59**节拍 3.**
60他们从门楼里走出来,走进飘落的雪中,这时已经换上羊毛斗篷,脚步不停,对话也没停。四周是货摊和泥泞的街道。
61
62 VERA
63 真实需要时间。电影花了一个世纪
64 才学会把谎撒得这么漂亮。
65
66 OTIS
67 而 Grok Imagine 一年就学会了。
68
69**节拍 4.**
70资产:@vera @otis — @medieval_market
71他们经过一个正在数硬币的商贩。急推镜头:他的双手开始模糊,手指成倍增多,先是六根,然后是七根。切回两位主角,他们毫无察觉,从远处的门下走出去,此时雪花变成了飘落的彩纸屑。
72状态:走出门后,服装换成 1920 年代晚装;围巾和眼镜不变。
73
74外景. 1920 年代街道 - 黄昏
75资产:角色 @vera @otis — 地点 @jazz_street — 道具 @red_scarf
76
77**节拍 5.**
78他们穿着 1920 年代的大衣漫步在湿漉漉的人行道上,钨丝灯光照亮路面,门洞里传来若有若无的爵士乐。
79
80 OTIS
81 你爱过的每一帧画面,从前靠的是
82 化学药剂和运气。现在靠数学。
83
84 VERA
85 数学可不会起鸡皮疙瘩。
86
87**节拍 6.**
88他们经过剧院灯牌。灯牌上的字母在他们头顶蠕动、重组成一串乱码符号。Vera 半转过身,差点看见——剧院大门忽然敞开,里面倾泻出霓虹色的雨。
89状态:穿过大门后,服装换成深色科技服;围巾和眼镜不变。
90
91外景. 霓虹小巷 - 夜
92资产:角色 @vera @otis — 地点 @neon_alley — 道具 @red_scarf
93
94**节拍 7.**
95雨。粉色和青色的光在他们脸上滑动,两人沿小巷走着。Vera 停下脚步。围巾磨出流苏的一端滴下深红色的染料,落进积水里,颜色像墨水一样扩散。
96
97 VERA
98 Otis。如果假的东西已经好到这个程度……
99 我们怎么分辨?
100
101**节拍 8.**
102Otis 停下脚步。摘下黄铜眼镜。目光越过她,直直看向镜头。他身后,小巷尽头的画面溶解成飘散的像素。
103
104 OTIS
105 我们无从分辨。
106
107内景. 卧室 - 夜
108资产:地点 @bedroom — 道具 @phone
109
110**节拍 9.**
111硬切。整条小巷其实是一段正在手机上播放的视频,手机在昏暗的卧室里,画面套在生成应用界面中,进度条已满。一根拇指点下"重新生成"。屏幕花白一片。切黑。

第 2 步:生成参考素材

圣经里的一切,现在都变成图像。先做角色,它们漂移得最厉害。

角色设定表

对于每个角色,生成一张包含同一人物三个面板的图像,使用平坦的浅灰色影棚背景:

  1. 正面全身,裁切到脖子根部,头部在画框外。这一格由服装和双手承担,两只手都要可见。
  2. 背面全身,同样的站姿,头部在画框内,让头发从背后也能读出来。
  3. 头肩肖像,面部正对镜头。这一格是身份锚点。

grok.com 执行下面的提示词,得到你为 Vera 所需的 Grok Imagine 提示词。

text
1/imagine-character-sheet-prompt
2
3**VERA** `@vera`
4怀疑主义者。女性,35 岁左右,干练的黑色波波头,走路身姿挺拔。无论哪个时代、穿什么服装,都戴着一条红色围巾。这条围巾是她的锁定标识:同样的深红羊毛,喉结下方松松地打了个结,一端磨出流苏。
tetsuo - inline image

这里的失败模式是可以预见的,下面这段提示词能防御其中每一个。把颈部裁切作为构图来描述——"画框顶部裁到脖子根部"——绝不要说是"头没了",否则你会得到身首分离的躯体。对于肖像,写"面部正对镜头,双眼直视镜头,双耳与相机等距,两侧头发都可见"。这个组合让侧脸在几何上不可能成立,而肖像最爱漂移成侧脸。不对称特征要标明是角色自身的左和右,写两遍,背面面板还要重申从背后看这个不对称是什么样子。深色头发或深色衣服需要一条轮廓光边线,否则剪影会融进灰色背景里。如果你的反转依赖某个隐藏特征,那就完全不要画在设定表上。参考图像会泄密。改用文本在每个镜头中锁定隐藏细节。

这是 Vera 的完整设定表提示词。

markdown
1场景上下文
2一位女性的角色参考设定表,同一人物的三个影棚面板,干净的浅灰色背景,没有其他人。
3
4主体
535 岁左右的女性,齐下巴的黑色波波头,发尾平直,中分干净利落,深棕色眼睛,轮廓清晰的深色弯眉,肤色白皙偏冷调,自然的饱满嘴唇,纤细而运动的体型,姿态挺拔,双肩平齐,脊柱笔直。深红色羊毛围巾是永久的身份锁定标识:同样厚实的深红羊毛,喉结下方松松地打了个结,一端明显磨损出流苏,垂在角色身体左侧。每个镜头中身份 100% 一致。
6
7场景布局
8无缝的浅灰色影棚地面,向后弯曲接入平整的浅灰色背景,光线均匀,人物脚下有柔和的接触阴影,主光来自相机左前方。
9
10第一帧 / 走位
11人物直立,双脚平行、略微分开,重心均匀分布,双臂自然垂在两侧,双手完全可见且放松,下巴水平,目光向前。前两个镜头保持同一站姿。
12
13格式模式
14镜头序列,无时间码。只在指定位置切换镜头,相机不会自行切换。
15镜头 1 —— 正面全身,裁头构图:身体从脖子以下开始,画框顶部裁到脖子根部,头部在画框上方。双手在身体两侧可见。深红色羊毛围巾在喉结下方松松地打结,磨损的一端清晰垂在角色身体左侧。
16镜头 2 —— 背面全身,同样的直立站姿,头部在画框内:后脑勺和利落的黑色波波头从背后清晰可读,围巾结在后颈处可见,磨损的一端仍然垂在角色左侧。
17镜头 3 —— 正面近景肖像,头肩取景,面部正对镜头:鼻子直指相机,双眼直视镜头,双耳与相机等距,黑色波波头两侧都可见,深红色围巾结和左侧磨损的流苏在喉部完全可读。
18
19光学
20全身镜头用 47° 中性视角,近景用 18° 自然人像压缩,保持身份一致,片段中途不漂移。
21
22相机
23固定三脚架,全身镜头在胸口高度、机位后退 4 米;近景在眼睛高度、后退 2 米。位于阴影侧,操作轴线固定。
24
25动作
26近乎静止。一次缓慢的呼吸循环,肩膀沉降约 1 厘米。
27
28表现
29毛孔级皮肤真实感,双眼中都有眼神光,中性闭唇表情,肖像中平静而直视的目光。
30
31灯光
32柔和的白色主光从左侧前方照来,色温 5600K,偏离轴线 45°。右后方打来冷色轮廓光,把深色波波头和深红围巾从背景中分离出来,在背面视角中保持轮廓。均匀的补光让背景保持统一。
33
34服装
35简洁合身的深炭灰色长袖上衣,干净的圆领刚好落在围巾结下方,深色修身长裤,没有其他配饰。深红色羊毛围巾在每一个镜头中都是最醒目的身份元素。
36
37风格
38照片级真实的角色三视图设定表,8K,干净的影棚质感,细腻的胶片颗粒,全程实时速度。
39
40正向锁定
41所有镜头中身份标识一致:利落的黑色波波头、深棕色眼睛、深红色羊毛围巾,喉部松结,磨损的一端始终在角色左侧。镜头 1 从脖子以下取景,脸部只在镜头 3 中出现。背景保持平整的浅灰色,只有接触阴影。相机保持每个取景直到切换。

重要提示:当你拿到角色图时,第一张图不应该有头。视频模型会漂移,每个角色姿势之间都会有细微差异。

tetsuo - inline image

这张图现在就是 Vera 的规范参考图。本片中每一个视频提示词都指向它。

OTIS:

text
1/imagine-character-sheet-prompt
2
3**OTIS** `@otis`
4相信主义者。男性,接近 50 岁,花白短须,无论哪个时代都戴着一副黄铜圆框眼镜。说话时手势热情生动。眼镜是他的锁定标识:细黄铜镜框,小巧的圆形镜片。
markdown
1场景上下文
2一位男性的角色参考设定表,同一人物的三个影棚面板,干净的浅灰色背景,没有其他人。
3
4主体
5接近 50 岁的男性,灰白短发,灰色集中在太阳穴附近,花白短须沿着下颌修剪整齐,镜片后是温暖的棕色眼睛,眼尾有浅浅的鱼尾纹,中等肤色带着自然纹理,额头和嘴角有浅浅的岁月痕迹。身材中等偏壮、平易近人,姿态挺拔而放松。黄铜圆框眼镜是永久的身份锁定标识:细黄铜镜框,小巧的完美圆形镜片,永远架在鼻梁上。每个镜头中身份 100% 一致。
6
7场景布局
8无缝的浅灰色影棚地面,向后弯曲接入平整的浅灰色背景,光线均匀,人物脚下有柔和的接触阴影,主光来自相机左前方。
9
10第一帧 / 走位
11人物直立,肩膀带着一丝自然的松弛,双脚平行、略微分开,重心均匀分布,双手在两侧可见且放松,手指轻轻张开,下巴水平,目光向前。前两个镜头保持同一站姿。
12
13格式模式
14镜头序列,无时间码。只在指定位置切换镜头,相机不会自行切换。
15镜头 1 —— 正面全身,裁头构图:身体从脖子以下开始,画框顶部裁到脖子根部,头部在画框上方。双手完全可见,放松地垂在两侧。眼镜的细黄铜镜框在衬衫领口线处映出一抹柔和的亮光。
16镜头 2 —— 背面全身,同样的站姿,头部在画框内:后脑勺和灰白短发从背后清晰可读,眼镜的细黄铜镜腿沿着头侧可见。
17镜头 3 —— 正面近景肖像,头肩取景,面部正对镜头:鼻子直指相机,双眼透过小巧的圆形黄铜镜片直视镜头,双耳与相机等距,花白短须和头发的两侧都可见,细黄铜镜框和圆形镜片完全清晰、居中于面部。
18
19光学
20全身镜头用 47° 中性视角,近景用 18° 自然人像压缩,保持身份一致,片段中途不漂移。
21
22相机
23固定三脚架,全身镜头在胸口高度、机位后退 4 米;近景在眼睛高度、后退 2 米。位于阴影侧,操作轴线固定。
24
25动作
26近乎静止。一次缓慢的呼吸循环,肩膀和双手沉降约 1 厘米。
27
28表现
29毛孔级皮肤真实感,透过圆形镜片可以看到双眼中的眼神光,中性闭唇表情,眼神中带着安静的温暖,肖像中平静而直视的目光。
30
31灯光
32柔和的白色主光从左侧前方照来,色温 5600K,偏离轴线 45°。右后方打来冷色轮廓光,把深色头发、胡须和黄铜镜框从背景中分离出来,在背面视角中保持轮廓。均匀的补光让背景保持统一。眼镜的细黄铜镜框上有柔和的镜面高光。
33
34服装
35简洁的炭灰色美利奴圆领毛衣,内搭柔软的翻领衬衫,深色长裤,没有其他配饰。圆形黄铜眼镜在每一个镜头中都是最醒目的身份元素。
36
37风格
38照片级真实的角色三视图设定表,8K,干净的影棚质感,细腻的胶片颗粒,全程实时速度。
39
40正向锁定
41所有镜头中身份标识一致:灰白短发、花白短须、细镜框小圆片的黄铜圆框眼镜。镜头 1 从脖子以下取景,脸部只在镜头 3 中出现。背景保持平整的浅灰色,只有接触阴影。相机保持每个取景直到切换。
tetsuo - inline image

为角色添加元素标签

tetsuo - inline image

你会想为每个角色、地点和道具创建元素标签。

地点和道具

这些更简单。每个地点一张干净的定场图,每个道具一张产品风格图。两条规则:生成的地点必须空无一人,这样参考图锁定的只有场景本身;并且生成地点时使用与脚本中一致的光线。一张正午的参考图会与你写的每一个夜晚提示词相冲突。

这些是 Grok 为我们生成的电影脚本中的地点。对于每个地点,我们将使用 grok.com 上的 /imagine-location-prop-prompt 技能。

地点

markdown
1## 地点
2
3**罗马广场** `@roman_forum`
4正午阳光,白色大理石柱与雕像,灰扑扑的赭色地面,万里无云的蓝天,身着托加长袍的市民在主角身后虚焦流动。
5
6**中世纪集市** `@medieval_market`
7阴沉的灰色光线,木质摊位,泥泞街道,悬挂的野味和根茎蔬菜,飘着小雪,远端有一座石头门楼。
8
9**1920 年代街道** `@jazz_street`
10黄昏,湿润的沥青路面反射着暖色钨丝灯店的灯光,T 型车停在路边,亮灯的剧院招牌,戴着钟形帽和穿大衣的行人。
11
12**霓虹小巷** `@neon_alley`
13夜晚,密集的赛博朋克小巷,下雨,层层堆叠的粉色和青色全息招牌,通风口升起的蒸汽,深色镀铬墙壁。
14
15**卧室** `@bedroom`
16昏暗的现代卧室,仅由手机屏幕照亮,浅景深,除手机外一切都是柔和的。

罗马广场:

markdown
1场景背景
2空旷的罗马广场,正午,晴空万里,空无一人。
3
4地点地图
5前景:灰扑扑的赭色压实土地,带有细小的干沙砾和零散的小石头。中景:高大的白色大理石柱成对成排矗立,凹槽柱身和科林斯柱头在硬光下熠熠生辉,白色大理石的皇帝与诸神雕像矗立在柱子之间的低矮基座上。背景:更多柱子井然有序地向远处延伸,上方是万里无云的深蓝色天空。
6
7光线
8正午烈日高悬,略微偏前左,色温 5600K,在赭色地面上投下柱子与雕像的短促锐利阴影。抛光白色大理石表面有明亮的镜面高光。空气清透干燥,无薄雾。
9
10风格
11写实、电影感、细腻的胶片颗粒。
12
13正向锁定
14白色大理石柱和雕像在每次生成中保持干净完好。地面保持灰扑扑的赭色。天空保持万里无云的深蓝色。画面中不出现任何人物。
tetsuo - inline image

roman_forum

中世纪集市:

markdown
1场景背景
2空旷的中世纪集市街道,阴沉的灰色光线,飘着小雪,空无一人。
3
4地点地图
5前景:宽阔的泥泞街道,暗色压实泥土混着湿稻草和浅浅的车辙。中景:木质集市摊位,粗糙的木柱和茅草或木板屋顶,成串的悬挂野味(野兔、禽鸟)和一簇簇根茎蔬菜(芜菁、胡萝卜、洋葱)挂在横梁上。背景:一座厚重的石头门楼,带有拱形通道和风化了的城垛,封住了街道远端。
6
7光线
8柔和的阴天灰白日光,约 6500K,完全漫射,没有硬阴影。小雪在整个画面中持续飘落,在摊位屋顶、悬挂的农产品和泥地上积起薄薄一层白色。冷色环境补光让木材和石头的质感均匀可辨。
9
10风格
11写实、电影感、细腻的胶片颗粒。
12
13正向锁定
14石头门楼保持在街道远端。木质摊位只放置悬挂的野味和根茎蔬菜。小雪持续在画面中飘落。不出现任何人物。
tetsuo - inline image

market

1920 年代街道:

markdown
1场景背景
2空旷的 1920 年代城市街道,黄昏,湿润的沥青路面,空无一人。
3
4地点地图
5前景:湿漉漉的黑色沥青街道,倒映着暖色店面的灯光,拉成长长的断续光带。中景:T 型车沿路边停靠,深色车身和纤细的辐条车轮。背景:一排低矮的临街店铺,暖色钨丝灯窗户,入口上方居中挂着一块亮灯的剧院招牌,字迹在渐暗的天空下发光。
6
7光线
8黄昏环境天空光约 7000K,与 2700K 的暖色钨丝灯店面实景光混合。橱窗和剧院招牌提供柔和的定向补光。湿润的沥青路面拉出长长的金色灯光倒影。不再有硬日光。
9
10风格
11写实、电影感、细腻的胶片颗粒。
12
13正向锁定
14剧院招牌保持亮灯状态,居中位于背景中。T 型车保持沿路边停靠。湿润的沥青路面持续反射暖色钨丝灯光。画面中不出现任何人物。
tetsuo - inline image

jazz_street

霓虹小巷:

markdown
1场景背景
2空旷的密集赛博朋克小巷,夜晚,雨中,空无一人。
3
4地点地图
5前景:湿漉漉的深色路面反射着霓虹色彩,浅浅的积水和雨丝。中景:狭窄的小巷墙壁由深色镀铬和黑色金属构成,垂直的蒸汽通风口缓缓吐出白色气柱,层层堆叠的全息招牌投射出重叠的粉色和青色符号与标志,在墙壁上浮动闪烁。背景:小巷在黑色夜空下延伸,堆叠的招牌更深更密,蒸汽也更浓。
6
7光线
8主要照明来自堆叠的全息招牌本身:高强度的饱和粉色和青色实景光,在湿漉漉的镀铬墙壁和路面上投下彩色倒影。冷色环境夜晚补光约 9000K。雨丝捕捉到霓虹色彩。蒸汽被全息影像背光勾勒,边缘泛着柔和的粉色和青色光芒。
9
10风格
11写实、电影感、细腻的胶片颗粒。
12
13正向锁定
14堆叠的全息招牌只保留粉色和青色。墙壁保持深色镀铬。蒸汽持续从通风口升起。雨水落满整个画面。不出现任何人物。
tetsuo - inline image

neon_alley

卧室:

markdown
1场景背景
2空旷昏暗的现代卧室,夜晚,仅由一个小型冷光源照明,空无一人。
3
4地点地图
5前景:床或床头柜边缘柔和的虚化轮廓。中景:现代低矮床铺,深色床品略显凌乱,一个简单的床头柜,远处的墙壁上有一扇关着的门或窗户。背景:小房间的其余部分迅速落入柔和的黑暗之中,墙壁和家具都化为朦胧的轮廓。
6
7光线
8唯一的光源是一个小型冷色定向光源,约 6500K,位于接近相机高度、略微偏离中心的位置,质感如同近在眼前的手机屏幕。光线以紧凑的光池落在床品和床头柜上,房间其余部分陷入深邃柔和的阴影。没有其他实景光或环境光。
9
10风格
11写实、电影感、细腻的胶片颗粒,浅景深,只有被照亮的中景平面保持锐利细节。
12
13正向锁定
14房间保持空无一人,也不出现任何手机或设备。光线仅限于一个小型冷色光源。景深保持浅淡,只有中央被照亮的平面是清晰的。
tetsuo - inline image

bedroom

道具

markdown
1**红色围巾** @red_scarf:深红色羊毛,松散的结,一端磨损起毛。跟随 Vera 出现;在每条提示词中通过文字锁定。这条贯穿四个时代的核心意象。
2
3**手机** @phone:现代智能手机,握在画面外一位观看者手中,在生成应用界面中播放视频,带有一个重新生成按钮。只在最后一场戏中出现。

红色围巾:

markdown
1场景背景
2一条羊毛围巾的产品照片,居中放在干净的浅灰色影棚背景上,没有人,没有手。
3
4主体
5中等厚度的深红色羊毛围巾,在靠近中心的位置松散地打了一个结,一端刻意留出磨损的参差线头。面料呈现天然的羊毛纹理和轻微厚度。完全展开时尺寸为成人围巾,这里以紧凑的打结形态呈现,清晰展示出结和磨损的末端。
6
7光线
8柔和的均匀顶光,色温 5600K,带轻柔补光,阴影极少,突出羊毛纹理和磨损的线头,没有刺眼的镜面高光。
9
10风格
11写实、微距细节、干净的影棚背景。
12
13正向锁定
14围巾保持纯深红色羊毛。结保持松散。一端保持明显的磨损。画面中不出现其他物体或手。
tetsuo - inline image

red_scarf

手机:

text
1场景背景
2一部现代智能手机的产品照片,由画面外一位观看者的手握着,居中放在深色中性背景上,只露出手指和部分手掌,没有脸,没有其他人。
3
4主体
5线条流畅的现代智能手机,黑色窄边框,屏幕亮起并占据画面大部分。屏幕展示一个简洁的生成应用界面:视频播放区域、一条完整的进度条,以及一个清晰可见的“REGENERATE”按钮。手机以自然的观看角度握持。
6
7光线
8主要光源是手机屏幕本身,约 6500K,在手指和设备边缘投下柔和的冷色光晕。补光极少,让屏幕保持最亮的元素。
9
10风格
11写实、微距细节、干净的深色背景。
12
13正向锁定
14屏幕始终显示带可见重新生成按钮的生成应用界面。手机保持现代黑色智能手机。只露出单手的手指和部分手掌;不出现脸或其他身体部位。
tetsuo - inline image

phone

第 3 步:将参考图载入 Grok Imagine

具体操作。把你的参考图拖入提示词输入框,在提示词中用 @ 标签逐一引用。每次生成最多 3 张,每张锁定一个元素。这就是元素标签系统。

目前你一次最多只能使用 3 张参考图。我们的脚本没有依赖这个假设,所以生成的内容需要调整。我预计 Grok Imagine 未来会扩展参考图的数量限制。

tetsuo - inline image

第 4 步:每个节拍一条自包含的提示词

每个节拍都变成一条独立的提示词。规则浓缩如下:

封存上下文。不要场景编号,不要“接续前文”,不要本镜头之外的任何角色或道具。提示词承载一切:画面中的参考图、动作,以及所有仍然生效的状态说明,都以当前事实的形式重新陈述。

写出可见之物。模型响应的是看得见、可衡量的内容,而不是情绪词汇。要写“她僵住,慢慢攥紧拳头,光线只从侧面来,半张脸隐在阴影中”,而不是“紧张的场景”。

按固定顺序组织。先写场景背景,说明谁在什么位置。然后是参考图,每个标签配一句最简锚定。地点分层写:前景、中景、背景,再加上光线来源。在一切动作发生之前先写第一帧的构图。然后是镜头,再是动作。镜头放在提示词中间。放在最前面会与身份信息冲突,放在最后会被忽略。光线放在接近结尾的位置,最后加一小段正向锁定,重申一次关键连续性。

保持参考图锚定简短。图像负责设定外观,文字负责说明发生什么。大段的外貌描写会与图像冲突并降低其质量。年龄、体型、当前状态、独特特征、“100% 与参考图一致”。标志或屏幕文字等关键小细节仍然要用文字写出来。模型经常会把参考图中的这些细节丢掉。

让一切可衡量。速度用公里/小时。雾气用百分比。视野用固定梯度的角度:84 用于建立性广角,63 用于观察性广角,47 用于中性镜头,29 用于对话近景,18 用于保留身份的特写,12 用于长焦细节。左和右永远指相机的左和右。

只用正向表述。永远不要写“没有向后倒”,而要写“保持直立,双脚站稳”。否定句会把你在否定的事物植入画面。

用肌肉表现情绪,而不是贴标签。写“下颌收紧、双眼眯起、屏住呼吸”,而不是“愤怒”。以物理方式描述与环境的互动。雨水顺着头发流下,风吹动衣料,水花从靴子上溅起。

下面是节拍。注意脚本中的状态说明和资产清单是如何驱动每一个节拍的。

节拍

对于每个节拍,我们将使用 /imagine-prompt-creator 技能。我们需要把脚本写到一个文本或 Markdown 文件中,保存到电脑上,然后连同场景所需的图片一起交回给 Grok。这能帮助模型在编写视频提示词时获得上下文。

tetsuo - inline image

注意:拿回提示词后,当你把它粘贴到 Grok Imagine 时,必须点击每个 @ 元素标签,为该节拍选择正确的元素。

根据你拿到的结果,你可能还需要修改脚本并提出修改要求。这里就靠你的直觉了。生成的脚本只是一个参考。

每个节拍生成 4 条视频通常就足够了。如果需要修改,把 Grok 生成的提示词交回给它,并描述你想要的改动。

在合适的地方,你也应该善用“extend”(延长)功能。你并不总是想生成新的视频。

节拍 1。

Vera 和 Otis 都出现在这个节拍中,所以它们的标签会被添加到地点上。

markdown
1场景背景
2正午的罗马广场。Vera 和 Otis 并肩走在白色大理石柱和雕像之间,脚下是灰扑扑的赭色地面,头顶是万里无云的蓝天。身着托加长袍的市民在他们身后虚焦流动。
3
4激活的参考图
5@vera:35 岁左右女性,利落的深色波波头,身姿笔挺,深红色羊毛围巾打着松散的结,一端磨损起毛。100% 与参考图一致。
6@otis:48 岁左右男性,灰白相间的短须,细黄铜镜框配小圆形镜片。100% 与参考图一致。
7@roman_forum:白色大理石柱与雕像,灰扑扑的赭色地面,万里无云的蓝天。100% 与参考图一致。
8
9地点地图
10前景:灰扑扑的赭色地面,脚下有细沙砾。中景:Vera 和 Otis 沿着柱间一条开阔的小路朝镜头右方走去。背景:高大的白色大理石柱和雕像在正午硬光下向远处延伸,虚焦的托加市民在柱间缓缓移动。
11
12第一帧 / 构图
13广角镜头,两人全身入画且已在行走中。Vera 在画面左侧,Otis 在画面右侧,并肩以轻松的步态前行,身体略微朝向镜头右方。Vera 的深红色围巾在白色大理石映衬下格外鲜亮。两人都沿行进方向目视前方。
14
15格式模式
16一个连续镜头,镜头不会自行切换。
17
18光学
19广角跟拍镜头,63° 视野,直线透视,仅背景元素带有轻微运动模糊。
20
21镜头
22平视跟拍镜头,以与两人相同的步行速度平行移动,保持稳定的中广角构图,让两人全身始终在画面中,身后的柱子和天空清晰可读。摄影师机位保持在主体的阴影一侧。
23
24动作
25Vera 和 Otis 以平静交谈的步态向前走。镜头在他们身侧同步跟拍。虚焦的市民在背景柱间缓缓飘动。红色围巾随着 Vera 的步伐轻轻摆动。
26
27表演
28Otis 说话时手势丰富而热情,小圆镜片捕捉着光线。Vera 以冷淡而笔挺的平静回应,目光向前,围巾磨损的一端清晰可见。毛孔级的皮肤质感,有生命的眼睛,烈日下的眼神光。
29
30物理
31他们脚下的赭色地面微微扬起尘土。罗马式衣袍和羊毛围巾的布料随自然的重量和步伐摆动。大理石表面保留着锐利的镜面高光。
32
33光线
34正午烈日高悬,略微偏前左,色温 5600K,柱子和人物在赭色地面上投下短促锐利的阴影。白色大理石上有明亮的镜面高光。空气清透干燥,无薄雾。
35
36服装
37两人都穿朴素的罗马时代服装:Vera 穿一件轻薄的斯托拉长袍(stola),深红色羊毛围巾松松地系在喉间,磨损的一端垂向她的左侧;Otis 穿一件素色束腰外衣和短斗篷,圆形黄铜眼镜不变。两人都穿凉鞋。
38
39音频
40Otis:“人们现在输入一句话,就能得到一个完整的世界。会动的。会呼吸的。”
41Vera:“障眼法。一幅画得很快的画。”
42
43风格
44写实、电影感、细腻的胶片颗粒、实时速度。
45
46正向锁定
47Vera 的深红色围巾,带松散的结和磨损的末端,保持与大理石映衬下的一致和鲜亮。Otis 的细黄铜圆框眼镜始终戴在脸上。白色大理石柱和灰扑扑的赭色地面与地点参考图一致。市民保持虚焦和次要地位。镜头连续跟拍,不切换。
tetsuo - inline image

节拍 2。

对于节拍 2,我们会在后期处理时把场景剪短。

text
1场景背景
2Vera 和 Otis 走过罗马广场上一座皇帝大理石雕像,随后穿过一道石拱门,光线骤然绽放为纯白。在光芒的另一端,他们出现在一个飘雪的中世纪集市上,已换上羊毛斗篷,仍在行走中。
3
4激活的参考图
5@vera:35 岁左右女性,利落的深色波波头,身姿笔挺,深红色羊毛围巾打着松散的结,一端磨损起毛。100% 与参考图一致。
6@otis:48 岁左右男性,灰白相间的短须,细黄铜镜框配小圆形镜片。100% 与参考图一致。
7@medieval_market:阴沉的天空,木质摊位挂着野味和根茎蔬菜,泥泞街道,小雪,远端有石头门楼。100% 与参考图一致。
8
9地点地图
10前半段——灰扑扑的赭色地面,白色大理石柱,中景处有一座高大的皇帝大理石雕像立于基座之上。后半段——木质摊位之间泥泞带车辙的街道,飘着小雪,远处可见石头门楼。
11
12第一帧 / 构图
13Vera 和 Otis 并肩走过大理石雕像,Vera 在画面左侧,Otis 在画面右侧。雕像占据右侧中景。两人都目视前方,没有人看雕像。
14
15格式模式
16一个连续镜头,包含一次白色光芒绽放转场,镜头不会自行切换。
17
18光学
1963° 视野跟拍,直线透视。光芒绽放期间画面被纯白光线填满;光芒消散后,同一视野继续进入新地点。
20
21镜头
22平视跟拍镜头,以步行速度跟随两人移动。镜头保持在阴影一侧,以稳定的中广角构图框住两人,穿过拱门进入集市。
23
24动作
25Vera 和 Otis 经过大理石雕像。当他们走出画面后,雕像的眼睛转动追随他们的身影,然后眨了一次眼。两个角色都没有察觉。他们穿过一道石拱门,光线绽放为纯白,充满整个画面。在光芒的另一端,两人继续保持行走的步伐,此时已换上羊毛斗篷,走进飘雪的中世纪集市街道。小雪在他们周围飘落。
26
27表演
28两个角色都保持平静交谈的姿态,目光向前,没有注意到雕像。毛孔级的皮肤质感,有生命的眼睛,转场后冷空气中能看到自然的呼吸。
29
30物理
31大理石雕像的眼睛以石头的质感转动和眨眼。白色光芒绽放与消散是一个连续的光学事件。雪花以柔软的垂直形态飘落。羊毛斗篷随自然的重量和步伐摆动。脚下的泥地微微下陷。
32
33光线
34前半段:正午烈日,色温 5600K,大理石投下锐利阴影。转场:纯白光芒绽放,整个画面过曝。后半段:柔和的阴天灰白光线,约 6500K,漫射,小雪捕捉着环境光。
35
36服装
37拱门之前:朴素的罗马时代服装,Vera 的深红色围巾系在喉间,磨损的末端可见,Otis 的圆形黄铜眼镜不变。光芒之后:同样的身体裹上厚重的羊毛斗篷,围巾和眼镜保持完全一致和连贯。
38
39风格
40写实、电影感、细腻的胶片颗粒、实时速度。
41
42正向锁定
43Vera 的深红色围巾,带松散的结和磨损的末端,在转场前后保持完全一致。Otis 的细黄铜圆框眼镜全程戴在脸上。雕像的眼睛只在两人走出画面后才转动和眨眼。服装只在白色光芒的另一端改变。雪花只在中世纪集市那一半落下。
tetsuo - inline image

这里有一点值得注意。服装并不一致。如果你想追求细节,应该为每套服装创建不同的角色设定图,这样才能保持一致。

节拍 3。

markdown
1场景背景
2
3阴天的中世纪集市。维拉和奥蒂斯从石砌门楼走进纷飞的雪中,两人已经迈步前行且交谈正酣,身披羊毛斗篷,走在两侧是木搭建的泥泞街道上。
4
5有效参考
6
7@41335f66-f13d-4e83-a2d2-d4246ea1b96d : 35 岁左右女性,干练的深色波波头,身姿挺拔,深红色羊毛围巾松散打结,一端已磨损起毛。与参考图 100% 匹配。
8
9@963eb91f-df96-43d9-96a5-58d08982350a : 近 50 岁男性,灰白夹杂的短胡须,细黄铜镜框配小圆镜片。与参考图 100% 匹配。
10
11@6ef2b8ff-7cfa-4db6-b377-5b5b35076acd : 木搭建、泥泞街道、悬挂的野味和根茎蔬菜、石砌门楼、小雪。与参考图 100% 匹配。
12
13场景地图
14
15前景:湿漉漉的泥泞街道,有浅浅的车辙和零散的稻草。中景:维拉和奥蒂斯从门楼向前走来,两侧是木搭建,挂着野味和根茎蔬菜。背景:他们刚刚走出的厚重石砌门楼,拱门仍框住他们身后的道路,上方是灰蒙蒙的天空。
16
17首帧 / 走位
18
19中全景。维拉和奥蒂斯已完全走出门楼拱门,正迈步朝镜头走来。维拉在画面左侧,奥蒂斯在画面右侧,身体微微朝向镜头右侧。两人都穿着厚重的羊毛斗篷。深红色围巾在维拉颈间依然醒目。周围飘着小雪。
20
21格式模式
22
23单一连续镜头,摄影机不自行切换。
24
25光学
26
2763° 视场角,直线透镜,飘雪带来轻柔的大气柔化效果。
28
29摄影机
30
31眼平跟拍镜头,随着两人前进缓慢后退,保持稳定的中全景构图,让两人的全身和周围的搭建都清晰可读。操作员保持在阴影侧。
32
33动作
34
35维拉和奥蒂斯以交谈的步速在纷飞的雪中向前走。摄影机随他们后退。雪花轻轻落在他们的斗篷和泥地上。挂着野味和根茎蔬菜的搭建从两侧掠过。
36
37表演
38
39维拉先开口,语气干脆利落,身姿挺拔,目光直视前方。奥蒂斯带着温暖的能量作答,小圆镜片捕捉着灰蒙蒙的光线,一只手轻轻比划。毛孔级皮肤质感,冷空气中可见的呼吸,灵动的眼神。
40
41物理
42
43小雪持续飘落,堆积在斗篷、头发和泥泞的地面上。羊毛织物随自然的重量摆动。泥地随着他们的脚步微微下陷。脚下有柔和的接触阴影。
44
45灯光
46
47柔和的阴天灰白光,约 6500K,完全漫射,没有硬阴影。偏冷的氛围补光。雪花在飘落时映着这平光。
48
49服装
50
51两人都在符合时代的内衬外穿着厚重的中世纪羊毛斗篷。维拉的深红色羊毛围巾松散地系在颈间,磨损的一端可见。奥蒂斯的圆形黄铜眼镜一直戴着。适合泥地行走的实用靴子。
52
53对白
54
55维拉:“真实需要时间。电影花了一个世纪才学会把谎撒得这么漂亮。”
56
57奥蒂斯:“而 Grok Imagine 一年就学会了。”
58
59风格
60
61写实、电影感、细腻的胶片颗粒、实时速度。
62
63正向锁定
64
65维拉的深红色围巾松散打结、一端磨损,保持不变。奥蒂斯的细黄铜圆框眼镜一直戴在脸上。整个镜头中雪持续飘落。木搭建、泥泞街道和石砌门楼与场景参考一致。摄影机连续跟拍,无切换。
tetsuo - inline image

第 4-5 节拍(合并)

markdown
1场景背景
2
3小雪中的中世纪集市过渡到黄昏时分的 1920 年代城市街道。维拉和奥蒂斯经过一个商贩,对他手部出现的短暂扭曲毫无察觉,走出远端大门时雪变成了纸屑,然后穿着 1920 年代的大衣、在白炽灯光下继续走在湿漉漉的人行道上。
4
5有效参考
6
7@41335f66-f13d-4e83-a2d2-d4246ea1b96d : 35 岁左右女性,干练的深色波波头,身姿挺拔,深红色羊毛围巾松散打结,一端已磨损起毛。与参考图 100% 匹配。
8
9@963eb91f-df96-43d9-96a5-58d08982350a : 近 50 岁男性,灰白夹杂的短胡须,细黄铜镜框配小圆镜片。与参考图 100% 匹配。
10
11@medieval_market: 木搭建、泥泞街道、悬挂的野味和根茎蔬菜、石砌门楼、小雪。与参考图 100% 匹配。
12
13@2ea727c5-67bf-494a-a08a-018dd428a468 : 反射着温暖白炽灯橱窗的湿沥青路面、Model T 汽车、亮着灯的剧院招牌。与参考图 100% 匹配。
14
15场景地图
16
17前半段:泥泞的中世纪街道,两侧是木搭建,尽头是石砌门楼。
18
19后半段:黄昏时分湿漉漉的 1920 年代沥青街道,温暖的橱窗灯光映在路面上,剧院招牌在背景中发光。
20
21首帧 / 走位
22
23中全景。维拉和奥蒂斯并排走向远处的中世纪大门,右边一个商贩在摊位上数硬币。小雪飘落。
24
25格式模式
26
27剪辑序列,无时间码。只在指定节点切换,摄影机不自行切换。
28
29切换 1 — 跟拍维拉和奥蒂斯经过商贩。
30
31切换 2 — 快速推近到商贩的双手。
32
33切换 3 — 回到维拉和奥蒂斯走出大门;雪变成纸屑;服装和场景随之转换。
34
35切换 4 — 他们穿着晚装大衣漫步在湿漉漉的 1920 年代人行道上,说出对白。
36
37光学
38
39切换 1:63° 视场角。
40
41切换 2:快速推至双手的 18° 视场角。
42
43切换 3–4:回到 63° 视场角,片段中间无漂移。
44
45摄影机
46
47切换 1:眼平跟拍,从身后以步行速度跟随。
48
49切换 2:硬切推近,锁定双手。
50
51切换 3:在他们穿过拱门时恢复跟拍;摄影机随他们继续向前进入新的街道。
52
53切换 4:在湿漉漉的人行道上与他们并肩平滑跟拍,让两人的全身和发光的橱窗都清晰可读。
54
55动作
56
57切换 1:维拉和奥蒂斯走过正在数硬币的商贩。他们没有看他。
58
59切换 2:商贩的双手模糊;手指从五根变成六根,再变成七根。
60
61切换 3:回到两人走出石砌大门。飘落的雪柔化为飘散的纸屑。他们走出拱门时,环境演变为黄昏时分湿漉漉的 1920 年代街道;他们的斗篷变成 1920 年代的晚装大衣,而深红色围巾和黄铜眼镜保持不变。
62
63切换 4:他们继续漫步在温暖白炽灯光下反射着倒影的湿人行道上。低沉的爵士乐从一扇门里飘出。
64
65表演
66
67维拉和奥蒂斯继续交谈,身姿挺拔、面向前方,对商贩完全无感。在 1920 年代的街道上,奥蒂斯说话时双手温暖而生动;维拉以干脆利落作答。毛孔级皮肤质感,灵动的眼神,冷空气中可见的呼吸随着场景变暖而逐渐消失。
68
69物理
70
71雪飘落并转变为轻盈飘散的纸屑。泥地让位于湿沥青路面。白炽灯光的倒影在路面上延伸。织物在换装过程中随自然的重量摆动。
72
73灯光
74
75前半段:6500K 的柔和阴天灰白光。
76
77后半段:黄昏环境天空光与 2700K 的温暖白炽灯橱窗实用光源混合。湿沥青路面投出长长的金色倒影。剧院招牌稳定发光。
78
79服装
80
81中世纪部分:厚重的米色羊毛斗篷,内搭白色内衬。
82
83大门之外:1920 年代晚装大衣和时代街头服饰。
84
85全程:维拉的深红色羊毛围巾系在颈间,磨损的一端可见;奥蒂斯的圆形黄铜眼镜一直戴着。
86
87对白
88
89奥蒂斯:“你爱过的每一帧,都曾是化学和运气。现在它是数学。”
90
91维拉:“数学可不会起鸡皮疙瘩。”
92
93风格
94
95写实、电影感、细腻的胶片颗粒、实时速度。
96
97正向锁定
98
99维拉的深红色围巾松散打结、一端磨损,在两个时代保持完全一致。奥蒂斯的细黄铜圆框眼镜一直戴在脸上。只有商贩的双手发生扭曲。雪只在门口变成纸屑。走出拱门后服装干净利落地换成 1920 年代大衣,而围巾和眼镜不变。湿沥青路面和温暖白炽灯倒影与 1920 年代场景参考一致。
tetsuo - inline image

第 6-7-8 节拍(合并)

markdown
1场景背景
2雨夜中密集的赛博朋克小巷。维拉和奥蒂斯穿过粉色和青色的全息灯光。维拉停下,围巾上的染料滴入水洼。奥蒂斯也停下,摘下眼镜,越过她直视镜头,小巷远端溶解成像素。
3有效参考
4@vera: 35 岁左右女性,干练的深色波波头,身姿挺拔,深红色羊毛围巾松散打结,一端已磨损起毛。与参考图 100% 匹配。
5@otis: 近 50 岁男性,灰白夹杂的短胡须,细黄铜镜框配小圆镜片。与参考图 100% 匹配。
6@neon_alley: 密集的赛博朋克小巷、雨、粉青两色堆叠的全息招牌、通风口升起的蒸汽、深色铬合金墙壁。与参考图 100% 匹配。
7场景地图
8前景:湿漉漉的深色路面,浅浅的水洼反射着霓虹色彩。中景:维拉和奥蒂斯在狭窄的小巷中,两侧是深色铬合金墙壁。背景:堆叠的全息招牌和蒸汽通风口;小巷远端随后溶解成飘散的像素。
9首帧 / 走位
10中景。维拉和奥蒂斯并肩穿过雨幕朝镜头走来。粉色和青色的光从他们脸上滑过。维拉在画面左侧略微靠前。
11格式模式
12单一连续镜头,摄影机不自行切换。
13光学
1447° 视场角,直线透镜,雨水和蒸汽带来的柔和漫射。
15摄影机
16眼平跟拍镜头,随着两人前进缓慢后退,然后在他们停下时轻轻稳住。操作员保持在霓虹光源的阴影侧。最终构图保持奥蒂斯看向镜头外侧。
17动作
18维拉和奥蒂斯在雨中向前走。粉色和青色的光从他们脸上移动。维拉放慢脚步并停下。她深红色围巾磨损的一端垂在水洼上方;深红色染料从线头滴落,像墨水一样在水面扩散。奥蒂斯慢一步停下。他抬手,用一只手摘下圆框黄铜眼镜,越过维拉直视镜头。在他身后,小巷远端开始溶解成飘散的像素,像数字灰烬一样漂浮散开。
19表演
20维拉说话时带着克制的力度,身姿挺拔,眼神在搜寻。奥蒂斯倾听,然后摘下眼镜,以平静而笃定的目光直面镜头。毛孔级皮肤质感,灵动的眼神,雨水在脸和头发上凝结成珠,凉爽空气中可见的呼吸。当他将视线转向镜头时,霓虹的眼神光随之移动。
21物理
22雨持续落下,在铬合金墙壁上拉出条纹。蒸汽从通风口升起。深红色染料在水洼中向外晕染。小巷远端碎裂成离散的飘散像素,失去凝聚力四散开来,而中景和人物保持实体。
23灯光
24主光源来自堆叠的全息招牌,饱和的粉色和青色在湿铬合金和路面上投下彩色倒影。偏冷的氛围夜景补光。雨丝和蒸汽捕捉霓虹色彩。深色科技服上有柔和的高光,仍戴着的黄铜眼镜上也有。
25服装
26两人都穿着深色科技服——哑光黑和炭灰色层叠,实用且贴身。维拉的深红色羊毛围巾松散地系在颈间,磨损的一端清晰可见并滴着染料。奥蒂斯起初戴着圆框黄铜眼镜,随后摘下并握在身侧。
27对白
28维拉:“奥蒂斯。如果假货能做到这个程度……我们怎么会知道?”
29奥蒂斯:“我们不会。”
30风格
31写实、电影感、细腻的胶片颗粒、实时速度。
32正向锁定
33维拉的深红色围巾松散打结、一端磨损,保持不变;染料只从磨损的一端滴落。奥蒂斯的细黄铜圆框眼镜由他自己摘下并一直握在手中。只有小巷远端溶解成像素;人物和中景保持实体。粉色和青色的全息光持续在表面滑动。整个镜头中雨持续落下。
tetsuo - inline image

第 9 节拍。

markdown
1场景背景
2
3昏暗的现代卧室夜景。一部手机握在画外的观看者手中,屏幕上是一个生成应用的界面,正把那条霓虹小巷作为成片视频播放。拇指轻点重新生成按钮;整个画面白屏闪烁,然后切黑。
4
5有效参考
6
7@e298ab73-7284-4783-8a12-718344c9baba : 昏暗的现代卧室,仅由手机屏幕照亮,浅景深,除手机外一切都虚化。与参考图 100% 匹配。
8
9@b9ae27fe-0f0e-470e-becb-158f18a51042 : 现代智能手机握在画外的观看者手中,生成应用 UI 带重新生成按钮。与参考图 100% 匹配。
10
11@b71ce1c2-29b3-4169-8297-01bf49701181 : 手机屏幕上播放的视频内容——密集的赛博朋克小巷、雨、粉青全息招牌、蒸汽、深色铬合金墙壁。与参考图 100% 匹配。
12
13场景地图
14
15前景:发光的手机屏幕占满画面大部分,以自然的观看角度持握。中景:床或床头柜虚化的柔和边缘。背景:昏暗卧室的其余部分落入深邃柔和的阴影。
16
17首帧 / 走位
18
19手机的特写构图。屏幕明亮锐利,正全进度播放霓虹小巷视频。拇指放在屏幕底部靠近一个清晰可见的“重新生成”按钮旁。手机之外的一切都柔和而昏暗。
20
21格式模式
22
23单一连续镜头,以硬切黑结束,摄影机在最终黑场之前不自行切换。
24
25光学
26
27手机采用 18° 自然人像压缩视角,浅景深让只有屏幕和贴近的手指保持清晰。
28
29摄影机
30
31眼平,固定机位或仅有极轻微的手持微动,贴近手机让屏幕主导画面。操作员轴线保持手机居中。
32
33动作
34
35手机屏幕播放着霓虹小巷视频,进度条已满。一根拇指移过来轻点“重新生成”按钮。整个画面——手机、手和昏暗的卧室——立即出现数字噪点和色彩撕裂的故障,然后泛成纯白。画面切为纯黑。
36
37表演
38
39只有拇指和部分手指可见;没有脸或其他身体部位。手在着意轻点之前保持稳定。
40
41物理
42
43手机在点击前保持稳固静止。点击的瞬间整个画面碎裂成数字伪影并泛白。故障之前昏暗房间里没有其他动作。
44
45灯光
46
47唯一照明来自手机屏幕本身,约 6500K,在手指和最近的表面上投下偏冷的柔和光晕。卧室其余部分保持深暗阴影,直到全画面白屏故障。
48
49风格
50
51写实、电影感、细腻的胶片颗粒、实时速度,直到最终切黑。
52
53正向锁定
54
55手机屏幕在生成应用 UI 中显示霓虹小巷作为视频内容,带有可见的重新生成按钮和满进度条。只出现一只手的手指和部分手掌。点击后整个画面白屏故障,镜头以纯黑结束。卧室中没有其他光源或人物。
tetsuo - inline image

对于有场景或世界变化的较长影片,给每个转场单独一个节拍,并配以明确的视觉机制。比如“在一团像素中消失”“屏幕白屏闪烁”。这些转场干净利落,还能掩盖镜头之间残留的漂移。

后期处理。

这一步需要你做一些研究。你可以用任意视频编辑器把各个节拍粘合在一起,并添加音乐。Capcut 在这里是个不错的选择。Grok Imagine 里也有 Agent 模式。

Agent 模式的用武之地

Grok Imagine 还有 Agent 模式,目前面向付费账户在 Web 应用中处于测试阶段。它用一块无限画布取代了提示词与响应的循环:Agent 在画布上规划、生成、编辑,并把片段拼接成更长的作品。你给它一句简报,它就在你面前拆解整个任务,每一步都是画布上的一个节点,你可以点进去重新提示。

和这套工作流搭配,有两种用法。把那一句话交给它,让它全权运行,能快速得到一部可看的影片,代价是失去逐镜头级别的控制。或者把画布当作你的工作区,把自己的节拍一个一个喂给它,这样既能保留控制权,又能获得条理性。故事圣经和节拍脚本会让你在这两种方式下都更得心应手。给 Agent 一个封闭、可衡量的节拍提示词,比给 Agent 一个模糊的感觉,能产出更紧凑的镜头——这与真人剧组同理。

二次创作

使用 YouMind 创作爆款文章

收集素材、拆解爆点、生成视觉资产、撰写内容,并在一个 AI 工作空间里完成分发。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章