How to Replicate a Viral 700k-Follower Douyin Account Using AI: A Complete Tutorial

@leo_xiaolei
簡體中文2026年8月21日
406K
1.1K
111
19
1.6K

TL;DR

This technical guide breaks down the workflow for replicating viral AI-generated short videos, focusing on character consistency cards, frame-by-frame action deconstruction, and realistic clothing physics prompts.

这件事源自最近爆火的抖音账号:不吃下饭菜。

截至 2026 年 8 月 21 日,主页只有 36 个作品,粉丝已经接近 70 万。

核心是一个带反差、有点猎奇、又能让人继续看下去的小动作。每条视频只换一个创意点,其他东西尽量不动。

我想验证的是:用 AI 角色,能不能把这种内容生产方式反推,复刻出来。

角色卡

如果一条视频只做一次,人物每次随机生成也能用。

但是我们的目标是打造 IP 的话,人物必须让人一眼认出来。

今天腿短,明天腿长;这条皮肤冷白,下一条手臂发黄;一会儿胸型集中,一会儿又外扩;这样每条视频都像一次抽卡。

角色卡就是用来结束这种随机。

关于角色卡,我之前已经有一个完整的教程了,见:https://x.com/leo_xiaolei/status/2077410771311468618

单一角色卡应对一般生图、视频是够用的,但是对于打造 IP 的要求来讲,单一角色卡有很大的局限性,即细节不够,对 AI 来说不是信息全面,反而信息过剩。

相反通过多个细节图,合成当前场景的人物图,则要确定的多

因此,角色一致性不是一步,而是两步

多肉的人物卡前后也返工了不少。最早上半身偏长、腿短;把腿拉长以后又过了,用户让我们取中间值,后来又决定还是长一点,最后固定为 172 cm、61 kg、7.75 头身。肩膀窄而自然下斜,腹部放松,上臂、腰胯和大腿保留正常软组织,不能做成干硬的健身模特。

如果一条视频只做一次,人物每次随机生成也不是不能用。但是我们的目标是一条视频只换一个新创意点,人物必须让人一眼认出来。今天腿短,明天腿长;这条皮肤冷白,下一条手臂发黄;一会儿胸型集中,一会儿又外扩;发型也跟着乱跳,这个账号就没有固定人物了,每条视频都像第一次抽卡。

角色卡就是用来结束这种随机。它不负责把人物“做漂亮”,它负责回答以后每条视频都会遇到的几件事:这个人是谁,身体比例是什么,皮肤在不同部位是不是同一种材质,胸型和体积往哪里走,默认发型是什么,运动时哪些地方可以变化,哪些地方不能变化。

多肉的人物卡前后也返工了不少。最早上半身偏长、腿短;把腿拉长以后又过了,用户让我们取中间值,后来又决定还是长一点,最后固定为 172 cm、61 kg、7.75 头身。肩膀窄而自然下斜,腹部放松,上臂、腰胯和大腿保留正常软组织,不能做成干硬的健身模特。

胸型只写“大胸”没有用,模型可能做成外扩、侧向堆积、中间空,或者干脆变成两个硬球。多肉的设计目标是 98/73、75F,集中、朝前、自然水滴形,保留中央体积,不能为了修正外扩就顺手缩小整体体积。

刘多肉 - inline image

对标视频拆解

以账号的经典视频,上撩衣服为例:

我把视频分成三层看:

需要记录的内容

当前视频的观察

镜头

机位、裁切、光线、背景、运动方式

固定横向 16:9;颈部以下;右侧窗光;无推拉、无切镜

人体

手臂路径、手掌方向、重心、呼吸、头发惯性

双手同步抓取;放手后双臂落下;右手只经过腹部一次

衣服

接触点、受力、覆盖范围、折叠形状、最终位置

长款抹胸从低腰开始,整块下半片经过肚脐和上腹,最后堆到胸部区域

完整上卷参考被拆成十段:

人的动作

衣服的状态

1–15

正面静止,双臂下垂

长抹胸覆盖到低腰,腹部没有露出

16–31

双手从两侧靠近最低下摆

衣服保持完整长款状态

32–39

手指从下方钩住下摆,向左右拉直

下摆建立横向张力

40–51

双手开始向外、向上卷

低腹开始露出,形成第一道宽折面

52–66

双手继续抬高整块下半片

布料越过肚脐,中段腹部露出

67–82

双手继续沿两侧上移

下半片越过上腹,接近胸部下缘

83–99

把堆叠布料推入胸部区域

腹部完全露出,衣服缩成短抹胸

100–110

双手在两侧整理、压平

胸下不能留下厚布环或垂下的面板

111–141

双手放开,双臂沿外侧落下

短抹胸保持原位,不重新掉回腹部

142–160

最终静止

只保留呼吸、发丝和软组织的轻微惯性

制作知识

做到这里会发现,AI 视频并不是只会写提示词就行。至少要同时处理下面几类知识。

第一类是镜头和构图。要知道画面为什么从颈部切到低腰,人物为什么必须正对镜头,窗光从哪边来,手机固定机位为什么不能突然推近。镜头一动,手的相对位置和衣服覆盖范围都会变化,逐帧对照也就失去意义。

第二类是人物设计和光线。身体比例、皮肤连续性、胸型方向、软组织、呼吸和发型都属于人物卡。用户说“没有真人看着有感觉”,多写一句 photorealistic 解决不了。皮肤太平、姿势太绷、左右完全对称,头发和软组织又没有惯性,画面仍然像一张会变形的海报。

第三类是服装版型和衣料运动。衣服是什么材质,只决定了一部分结果;它覆盖到哪里、手抓哪一条边、受力后哪块布先动、翻完以后哪层在外,这些穿着关系更重要。衣服多一截、紧一点、下摆高一点,动作就可能完全不同。

第四类是动作描述。动作不能只写动词,还要写执行者、接触对象、路径、中间状态和结束状态。“双手向上提”信息太少;“双手从下方钩住左右最低下摆,先向外建立张力,再把整块下半片依次卷过低腹、肚脐和上腹”才有检查价值。

第五类是剪辑。生成视频常常比目标视频长,动作速度也不会刚好一致。剪辑必须会找动作边界、分段变速、固定帧率、补最后静止帧,而不是整段统一加速。

最后是验收。文件能播放,只代表技术上有视频;动作表通过,代表内部检查完成;用户看完觉得“对,就是这个感觉”,才是最终验收。这三件事不能混在一起。

视频的时间线和剧本

把主视频的节奏和辅助视频的完整上卷动作合并以后,最终剧本是六段,正好 218 帧:

成片帧

时间

画面动作

这段要解决什么

1–12

0.000–0.400 秒

双手从身体两侧靠近低腰下摆,手指找到左右最低边缘

交代动作起点,不能一开场就抓着衣服

13–66

0.400–2.200 秒

双手钩住下摆、横向拉直,再把整块下半片卷过低腹、肚脐和上腹,推入胸部区域

完成全片唯一的主要创意动作

67–78

2.200–2.600 秒

双手放开,双臂自然落下,短抹胸保持原位

证明衣服真的完成状态变化,没有回落

79–105

2.600–3.500 秒

人物静止,只保留呼吸、发尾回落和一点身体惯性

给观众看清变化后的画面

106–159

3.500–5.300 秒

右手从下方进入,只连续经过腹部一次,然后退出;左手不动

增加第二个很轻的视觉动作,但不抢主创意

160–218

5.300–7.267 秒

人物回到静止,衣服、背景和镜头保持不变

留出循环尾巴,不新增第二次提拉或第二次抚腹

如果写成普通剧本,大概是这样:

text
1场景:白天,室内浅灰墙,右侧窗外自然光。固定手机横屏近景。
2
3人物:多肉,虚构成年 AI 人物。完整人脸始终在画外,高单马尾尾部可见。
4
5开场:人物正面站立,双臂自然下垂。长款蓝白印花抹胸覆盖到低腰。
6
7主要动作:双手靠近下摆,从下方钩住左右最低边缘,先向外拉直,再把整块下半片连续向上卷。布料依次经过低腹、肚脐和上腹,最后全部进入胸部区域。腹部完全露出,长抹胸变成短抹胸。
8
9停顿:双手放开并落下。衣服保持完成后的状态。人物静止约 0.9 秒。
10
11收尾动作:右手只经过腹部一次,然后退出画面。左手不动。
12
13结尾:人物正面静止,只保留呼吸和马尾回落,直到第 218 帧。

衣料怎么写

AI 视频中衣服很容易像一块塑料。需要单独做一份衣料说明:棉/莫代尔为主,约 8% 氨纶,170–190 g/m² 的轻薄单面针织布;整体哑光,近看能看到细小针织颗粒和纤维微反光;弯曲刚度低,回弹中等。它可以贴身,但不能厚得像潜水料,也不能薄得像丝袜。

上卷时的物理过程也要写:

  1. 指尖先压进下包边,接触点出现局部凹陷。
  2. 双手上移,张力从指尖向上和两侧扩散,产生放射状细皱。
  3. 靠近手的布料先动,中间区域稍微滞后,不能整片刚性平移。
  4. 下摆越过腹部后向内翻,形成两层可互相滑动的真实布料,不能融合成一条厚胶带。
  5. 双手松开以后,布料先有一点回弹,再用几帧稳定下来,不能瞬间变成完全笔直的几何带。

还要明确排除乳胶、PVC、橡胶、潜水料、亮面薄膜、硬壳和均匀镜面高光。负面词不能替代正面描述,但能避免模型用最省事的塑料质感来解释“紧身”和“弹力”。

提示词

提示词的作用是汇总前面已经确定的内容,不是在最后一刻重新创造人物、衣服和动作。我现在会按下面的顺序写,换哪家视频工具都能用:

text
1【主体声明】
2这是我们自己设计的虚构成年 AI 人物,不是真人。
3
4【输入职责】
5人物图只负责人物比例、肤色、发型、服装、背景和镜头。
6动作参考只负责动作顺序、手部路径、速度、停顿和衣料运动。
7不要复制动作参考里人物的身份、脸和身材。
8
9【镜头】
1016:9,正面固定手机机位,从颈部以下拍到低腰。
11浅冷灰墙,右侧窗光。无推拉、无摇移、无切镜。
12
13【人物】
14写入人物卡已经确认的比例、体态、皮肤、胸型和高单马尾。
15肩膀、腹部和手臂保持放松,不能变成健身身材。
16
17【衣服开始状态】
18写清版型、长度、覆盖位置、材质、下摆位置和内外层颜色。
19
20【动作时间线】
21按时间写接近、抓取、建立张力、连续上卷、整理、放手、停顿、右手经过腹部和最终静止。
22每一段都写手的位置和衣服的新状态。
23
24【衣服结束状态】
25整块下半片已经进入胸部区域,腹部完全露出。
26胸下不能留下厚环、悬挂面板或额外内搭。
27
28【次级运动】
29保留呼吸、软组织惯性、马尾延迟摆动和碎发回落。
30
31【禁止项】
32不新增动作,不改变顺序,不重复,不倒放,不切镜。
33不要塑料布、衣服瞬移、肢体增生、手指穿模或完整人脸入画。

“保持人物一致”“复刻原视频动作”“衣服真实一点”都属于看起来正确、实际没法验收的句子。要把它们改成能看见的画面状态:肩膀不能突然变宽,胸量不能缩小,皮肤不能分色,布料必须经过肚脐,最后胸下不能挂着一圈厚布。

二次升级

第一版视频发出来以后,收到的反馈很具体:胸围看起来比人物卡小;没有真人拍摄的感觉;身体偏健美,视觉吸引力不够;衣服上翻以后有塑料感;高单马尾没有原视频长发的效果。

后来人物卡又暴露出三个问题:脸部光线很怪,像局部白斑;胸型外扩;腿仍然不够长。腿加长后又过头,用户暂停了生成,要求回到前后两版的中间,最后才重新确认 7.75 头身。

这些反馈没有全部塞回视频提示词,而是按问题分别处理:

网友看到的问题

回到哪一步修改

实际改法

视频里胸量缩小

人物卡和场景人物图

固定 98/73、75F 和中央体积;删除与之冲突的

compact bust

胸型外扩

身体主锚点

改为集中、朝前的自然水滴形;禁止侧向堆积和中间空

身体偏健美

人物卡与动作姿态

肩膀下斜、腹部放松,保留上臂和腰胯软组织;禁止腹肌沟和突出肋骨

皮肤像白癜风

人物卡的皮肤与光线说明

脸、颈、锁骨、手臂和手使用同一底色、白平衡、曝光和大面积柔光

没有真人拍摄感

场景人物图与视频次级运动

增加手机颗粒、细小毛孔、呼吸、轻微不对称、软组织和衣料惯性,减少磨皮

衣服像塑料

衣料说明

补针织颗粒、摩擦、张力、两层滑动、回弹和哑光高光

马尾没有效果

发型和动作说明

让发尾一直留在画内;手臂落下后延迟摆动,再慢慢停止

衣服只翻一条边

逐帧动作表

增加低腹、肚脐、上腹、胸部四个连续里程碑

衣服停在胸下

辅助动作参考与结束状态

明确整块下半片必须全部进入胸部区域,腹部完全露出,胸下不能留厚环

第一条完成完整上卷的候选,衣服动作已经通过,人物仍然偏瘦、肩臂偏硬。我们没有改动作表,只重新生成场景人物图,并清理人物描述里的冲突词。

刘多肉 - inline image

第二条候选继续使用同一套动作,只比较人物和材质,不重新讨论动作顺序。人物、皮肤和布料都有所改善。

刘多肉 - inline image

追加背景音乐

这条视频需要一段口哨歌。我们没有复用对标视频的原声,而是使用项目里自己的合成口哨旋律。

处理顺序是:裁到目标时长、重置时间、做 550 Hz 高通和 3600 Hz 低通、加入 0.08 秒淡入和 0.35 秒淡出,再做响度归一和限幅,最后混成 AAC 48 kHz 双声道。

声音一定放在动作剪辑以后。先把音乐焊死在 10 秒素材上,每调整一次动作边界,都得重新找音乐位置,纯属给自己加活。

刘多肉 - inline image

最终候选为 1280×720、30 fps、218 帧、7.266667 秒。视频和音频已经通过完整解码。当前仍有差异:腰部和锁骨比 61 kg 的人物卡略瘦,蓝白印花颜色偏浅,马尾的二次摆动弱于对标里的长发,个别手部轨迹也做不到逐像素一致。

完整制作过程,压缩成一张清单

下一条视频我会继续按这个顺序做:

  1. 先找出对标账号反复使用的内容结构,再为本条视频只确定一个新创意点。
  2. 固定主参考视频,确认真实视频 ID、时长、帧率和总帧数。
  3. 导出全部帧和联络表,分开记录镜头、人体动作和衣服状态。
  4. 如果某个局部动作在主视频里不清楚,再找一条辅助参考,只借那一个动作机制。
  5. 先验收正式人物卡,再生成这条视频专用的场景人物图。
  6. 给衣服写版型、覆盖范围、穿着关系、静态材质和运动过程。
  7. 把动作写成带帧号的时间线,再写一份普通人能读懂的视频剧本。
  8. 提示词只汇总已经确认的内容,不在最后一刻新增人物或服装设定。
  9. 每次生成只验证一类问题,保留失败联络表,和上一轮做单项比较。
  10. 动作、人物和衣料通过逐帧检查以后,再分段变速、加入原创声音。
  11. 最后检查分辨率、帧率、帧数、时长、音频和完整解码,再交给用户验收。

这套过程把“复刻这个”改成了一组可以检查的创作文件。视频工具可以换,创意说明、人物卡、场景人物图、衣料说明、逐帧表、剧本和验收表不用跟着换。

几个易错问题

怎么减少人脸和内容审核造成的失败

先说清楚,这些方法是减少误判和输入混乱,不是绕过平台审核。

  • 人物必须是自己有权使用的虚构成年 AI 角色。提示词里直接说明“这是我们自己设计的 AI 人物,不是真人”。
  • 参考人物图和最终构图都不显示完整人脸,只保留完成动作所需的身体区域和高单马尾。人脸不参与创意,就不要让它增加身份判断和一致性负担。
  • 人物图只负责人物,动作视频只负责动作。不要让真人参考同时承担脸、身材、衣服和动作四种职责。
  • 能使用平台自己的图像功能时,先把场景人物图重新生成一次,再交给视频阶段。这样输入来源和当前平台更一致。
  • 如果包含真人帧的任务连续失败,不要机械替换几个同义词继续提交。先移除不必要的真人参考,改用自己的 AI 场景图和逐帧动作表;仍然失败,就接受当前工具的能力或审核边界,换一条制作路线。

怎么避免衣服下半部分卷不到胸部以上

不要只写最终位置。模型很容易从开场直接变成短衣服,中间用衣服变形或瞬移蒙过去。

必须写出四个中间状态:低腹开始露出、布料越过肚脐、布料越过上腹、整块下半片进入胸部区域。最终画面还要同时满足:腹部完全露出、胸下没有厚环、没有垂下的布料面板、衣服没有重新回落。

生成以后先看帧图,不要先被流畅播放骗过去。很多视频连起来看像完成了上卷,停在关键帧才发现衣服只是缩短、融化,或者胸下仍挂着一圈布。

如果提示词已经写清全过程,几轮以后仍然停在胸下,那就不是再加十个“必须”的问题。换用能接受完整动作参考的制作方式,或者把主要动作拆成更容易控制的阶段。提示词有边界,不能代替工具本身没有的运动能力。

二次創作

使用 YouMind 創作爆款文章

收集素材、拆解爆點、生成視覺資產、撰寫內容,並在一個 AI 工作空間裡完成分發。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章