Codex Editing Part 3: How 2 Videos Landed Four-Figure Deals – Full Guide to Knowledge Video Editing

@xilo2991
簡體中文2026年8月22日
118K
382
61
33
778

TL;DR

A comprehensive guide on using Codex and HyperFrames to automate knowledge-based video editing, covering A-roll/B-roll strategies and prompt engineering to secure commercial sponsorships.

熟悉的朋友应该都知道我最近在更新视频,并且数据还不错。

某音2条视频开通精选计划,某书2条视频接下了近四位数商单。目前两个账号都只发了3条视频,就已经有不下于10个商单找上门了。还有小破站的创作邀约、一些平台的课程邀约。

xilo - inline image

Hi,朋友们,我又来交稿啦~

今天我们来聊聊,偏复杂和高质量的知识类视频,如何实现Codex自动剪辑?

其实这篇内容,在两天前就已经出了视频版本,并且在某音上获得了近20W的播放量。

但是我觉得视频的篇幅还是比较有限的,很多东西他没有办法去说清楚,所以又花时间去写了这篇文章,把完整的方法和思路,都去做了一遍拆解。

相关的提示词、工具、素材库这些,我也专门整理成了附件文档,方便朋友们一键使用。

还是老规矩,我更建议你实操一遍,但字数一如既往多,看不完直接丢给AI做成Skill,也是可以的。

如果没有问题,那我们就开始。

xilo - inline image

**

01. 为什么能接到商单

因为这类视频主要获取收益的方法,就是平台流量和品牌商单,所以我前置加了这个部分,希望对朋友们有用。

当然,我还只是小卡拉米,不一定对,朋友们借鉴着看即可。

从我自己的经历来看,为什么2条视频就有品牌来找我,原因无外乎两个。

xilo - inline image

一是视觉层面。

这种类型的视频不能说全网独一份,但相对来说还是比较少的,所以形式上,本身就是一种差异化,容易让人记住并观看。

在这个基础上,我还有专门去做了一些视觉上的设计,比方说类似电视机一样的人物小剧场,多种不同的视觉动效和人物动作。

做这些视觉设计,是为了让视觉层次看起来更丰富,观看体验更好。因为我觉得,只有别人看得下去,你的内容才可能会有流量。

二是内容层面。

我一个直观的感受就是,现在AI领域的品牌可能更青睐教程类的内容。

这类内容可以毫无痕迹地把产品植入进去,并且因为你做的是具体教程,用户想要实操就必然会用到产品,所以不管是流量还是转化,都不会太差。

视觉层面和内容层面结合起来,其实就是一个相对还不错的内容了。

这种内容即使你才刚起号,品牌方看到觉得质量不错,也可能会选择和你合作尝试一下。

02. 剪辑思路是怎样的?

说完商单,我们来说说剪辑思路。

看过视频的朋友应该就知道,在我的视频里,画面其实是被明确拆分成两种不同表现形式的。

一种是白色背景,主角是我的个人IP形象 (头顶小花的白毛小人),主要用来讲话、做动作、传递情绪;

另外一种是黑色背景,主角是内容本身,文字、图形、产品截图,也可能是一段具体的操作演示。

这两种画面有专门的术语,A-roll 和 B-roll。

(A-roll、B-roll 是纪录片剪辑里常会用到的剪辑手法。A-roll 是主机位拍主体,B-roll 是补充镜头。放到我们这里,就是讲人和讲内容两条并行画面。)

xilo - inline image

A-roll画面主要承担什么

A-roll的核心在于场景化表达,把抽象的文字变成一种更容易理解的情景。

让观众感受到这是一个人在跟我说话。即便这个人是假的,只是一个IP形象,也会有一种直观的对话感。

那什么样的画面算是A-roll呢?

简单粗暴一点,只要不是讲到具体知识的,你都可以归为A-roll。

比方说你们去看我视频的第一个画面,基本上都没有信息含量,但又不得不说。

这种你去用A-roll表达,就会变得很有意思。

B-roll画面主要承担什么

B-roll,则是补充画面。通过图表的方式,对知识进行画面上的补充,让观众可以更简单直观的理解知识本身。

一般只有涉及到知识、概念,或其他有信息增量的内容,就适合使用B-roll。

比方说要展示三种方案的对比,要放一个完整的流程步骤,或者某些知识概念由哪些部分组成。

拆分成A/B-roll两种画面,最大的好处其实就是不那么容易枯燥。

如果你一直只有一种画面,那越往后,观众的注意力其实是越容易分散的。

但如果两种画面交替出现,观众每隔十几秒就换一次视觉刺激,看起来就会更有趣味性,更容易看下去。

另外,还有一个很大的好处是,AI的剪辑准确率会大幅提高。

当画面只分A/B两类的时候,AI 每到一个镜头,只需要先做一个非常简单的选择:这一段用 A-roll还是用 B-roll?

如果选A-roll,那就只需要按照提前设定好的A-roll规则或模板,生成对应画面就好。

03. 需要准备什么工具?

xilo - inline image

首要的肯定是Codex,因为Codex自带生图模型,并且还是目前全球最好的生图模型。

当然,你用workbuddy其实也可以,但这个就需要你自备一个生图模型的API。

除了Codex以外,我们还需要安装一个动效插件,HyperFrames。

这个安装方法很简单,直接在Codex的插件市场,搜索HyperFrames,找到并安装就行。

xilo - inline image

这是一个专门做动效的一个插件,A-roll 和 B-roll 里所有的动效、镜头运动、时间轴,都是靠HyperFrames渲染出来的。

类似的插件还有Remotion。

xilo - inline image

对比HyperFrames,Remotion的优势是通过帧数控制,所以动效的可控性会更好一些,并且Remotion相对成熟,你能找到很多好看的Remotion模板。

但在整体的设计感上,我还是更喜欢HyperFrames,所以这个会用得比较多。 *(具体使用哪个,朋友们可以自行对比下。)

安装好动效插件以后,我们还需要准备一个配音工具。

我一直以来用的都是火山引擎的豆包语音合成2.0,效果稳定、价格不贵,1分钟大概也就几毛钱。 (无广,纯自用体验极好哈)

使用方法也很简单,直接注册一个火山引擎的账号。

xilo - inline image

然后搜索豆包语音,就可以进入专题页面。

在开通管理里开通语音合成服务,一般新用户会送20000字的生成额度。

开通以后,再把API复制出来丢给Codex,Codex就会自动调用测试。

如果你想用自己的声音,也可以试试开源的声音克隆工具voxCPM或Voicebox。

不过这两个我用得不多,可能得朋友们自行探索了。

基本上需要准备的工具就是Agent (也就是Codex)+动效插件+配音工具。如果你需要后期自己修改的话,也可以考虑加上ChatCut。

04. 如何调用Codex剪辑

xilo - inline image

所有东西都准备好以后,我们就可以进入实际的剪辑流程。

整个流程大概分为四步,我会讲得细一些,需要用到提示词的地方,我也会专门贴出出来。

第一步:文案 + 配音

之前有朋友问过我,视频文案是不是也是Codex一键生成的。

其实不是。视频文案是调用了另外一套内容工作流,用Claude写的。(朋友们需要的话,我之后再单独写一篇。)

所以这一步,我们需要提前准备好文案。有Claude用Claude是最好的。没有的话,豆包或DeepSeek效果其实也不错。

文案准备好以后,接下来就是配音和声学对齐。

配音没什么好说的,把定稿文案丢给Codex,让它调用豆包语音合成就行。

不过这里要注意提醒Codex,文案一定要整段合成,不要分句再组合。

xilo - inline image

如果你不提醒,Codex大概率会分句合成,每句话都调用一次豆包语音,最后再组合起来。

这样生成的音频,句与句之间会有明显的差异,比方说这句话大声,另一句话就小声。

声学对齐,简单来说就是把生成好的音频重新解析,拿到一份毫秒级别的时间轴文档,例如:

  • [1249ms-3580ms] 这个问题其实很多朋友都有遇到
  • [3580ms-6120ms] 我自己第一次做的时候也这样

这份时间轴文档,是后面所有视觉决策的时间基准。 每个镜头持续多久,画面如何变化,声音和画面怎样对齐,都需要用到。

如果没有的话,Codex生成时就很容易会出现声音和画面错位的情况。

这一步我专门准备了一个提示词,你直接把提示词和脚本给到Codex,它就会自动进行配音,并输出时间轴文档。

text
1帮我完成配音和声学对齐,两步连着做完,中间不用停下来问我。
2
3## 第一步:配音
4- 配音文案:【填入文案,或者文案文件路径】
5- 调用火山引擎豆包语音合成 2.0
6- 音色 ID:【填入音色ID】,语速【填入,比方说 1.0】,音量用默认值
7- 整段文案一次性合成一整条音频。禁止分句合成再拼接,禁止分段调用多次接口。
8- 输出到 audio/vo-full.wav,44100 采样率,单声道
9- 合成完成后打印音频总时长,精确到毫秒
10
11## 第二步:声学对齐
12- 对 audio/vo-full.wav 做短语级对齐,语言指定中文
13- 默认用 whisper large-v3,环境里没有就自己装好,不用问我
14- 切分粒度是短语,不是整句,每段控制在 5 到 15 个字
15- 对齐结果要和第一步的原文案逐字核对。whisper 识别错的字一律以原文案为准,只采用它给出的时间戳
16- 时间轴不允许有重叠,也不允许有空缺,前一段的结束时间就是后一段的开始时间
17
18## 输出格式
19时间轴写入 audio/vo-align.txt,同时打印给我看,格式严格按下面这样:
20
21[1249ms-3580ms] 这个问题其实很多朋友都有遇到
22[3580ms-6120ms] 我自己第一次做的时候也这样
23
24## 最后确认
25把这三项单独列出来:音频总时长、时间轴总段数、最后一段的结束时间。
26最后一段的结束时间必须和音频总时长一致,对不上就重新对齐一次。

第二步:视觉编排表

配音和时间轴都拿到之后,我们还需要去做一份视觉编排表。

视觉编排表,你可以理解成剧本 + 分镜的组合体。

其实就是要让 Codex 站在视觉导演的视角,对我们的文案进行理解和拆分,变成一个个具体的视觉镜头。

比方说哪一段文案要用A-roll、哪一段文案用B-roll,每个镜头持续多久、画面上要发生什么变化、和前后镜头怎么衔接,这些都是要在视觉编排表里写清楚的。

xilo - inline image

这里我同样准备了一份提示词,你可以直接发给Codex。

text
1帮我基于口播文案和第一步生成的时间轴,站在导演视角,产出一份可以直接指导剪辑、素材准备和动画制作的视觉编排表。
2
3## 我提供的内容
4
5- 口播文案:
6【粘贴文案】
7
8- 配音时间轴:
9【填入 audio/vo-align.txt 的路径或内容,格式为:[开始时间ms - 结束时间ms] 对应文字】
10
11## 编排原则
12
13先理解整篇文案的逻辑,再把它拆成完整的语义段落。不要按标点、句子长度或每次停顿机械切镜。
14
15每个镜头都要先回答:
16
171. 这一段最需要观众理解什么?
182. 什么画面能让这句话变得更具体、更容易理解?
193. 画面中的主体要发生什么变化?
204. 镜头最后停留在什么结果上?
215. 它如何承接上一镜,并自然进入下一镜?
22
23## 画面类型
24
25根据内容选择最合适的表达方式:
26
27- 人物画面:适合情绪、经历、态度和个人表达;
28- 场景画面:适合还原具体情境、动作和使用过程;
29- 真实素材:适合证据、案例、产品、界面和操作展示;
30- 信息图形:适合步骤、关系、比较、流程、数据和因果;
31- 文字动效:适合金句、关键词、概念替换和结论强调。
32
33不要为了丰富而频繁切换画面。每次变化都必须帮助观众理解内容。
34
35如果文案提到真实产品、界面、数据、案例或用户素材,但我没有提供相应内容,请标记"需要补充素材",不要自行编造。
36
37## 时间与节奏
38
39时间以我提供的配音时间轴为准,不要自行估算,不要修改时间戳。
40
41每个镜头的起止时间必须落在时间轴的短语边界上,不能跨语义切开。
42
43镜头时长较长时,需要安排与旁白对应的内部变化,例如:
44
45- 主体出现;
46- 重点被选中或放大;
47- 两个方案形成对比;
48- 步骤逐项展开;
49- 信息从混乱变得清晰;
50- 最终结论落定。
51
52入场、呼吸动画、背景循环和字幕出现不算有效的信息变化。避免画面长时间没有新内容,也不要让动画为了动而动。
53
54## 输出格式
55
56请使用以下表格:
57
58| 镜头 | 时间 | 配音文案 | 画面类型 | 画面设计 | 动态变化 | 画面衔接 |
59|---|---|---|---|---|---|---|
60
61填写要求:
62
63- 镜头:从 S001 开始连续编号;
64- 时间:填写开始与结束时间(毫秒),必须来自我提供的时间轴;
65- 配音文案:保留对应原文,不要擅自改写;
66- 画面类型:从人物、场景、真实素材、信息图形、文字动效中选择;
67- 画面设计:说明主体、构图、景别、关键元素和最终画面;
68- 动态变化:按照旁白顺序写清第一次、第二次和第三次变化;没有必要时不要强行凑数;
69- 画面衔接:说明前后镜头如何通过主体、动作、方向、位置、颜色或意义自然接续,不要只写"淡入淡出"。
70
71## 全片检查
72
73完成表格后,再检查:
74
751. 画面是否真正帮助理解文案;
762. 是否存在连续重复、节奏单一的问题;
773. 是否有镜头变化太少或信息过载;
784. 是否使用了未经提供或无法核实的素材;
795. 重要信息是否得到足够的视觉强调;
806. 前后镜头是否连贯;
817. 哪些镜头需要我补充素材或做出选择。
82
83最后单独列出:
84
85- 需要补充的素材;
86- 需要确认的视觉方向;
87- 制作难度较高的镜头。
88
89现在先生成视觉编排表,不要直接制作图片、动画或视频。

编排表出来以后,个人建议是完整检查一遍,主要检查两个地方。

一是 A-roll 和 B-roll 的交替节奏是否自然,会不会连续三四个镜头都是 A-roll、然后又连续三四个都是 B-roll 这种情况;

二是单个A-roll 或 B-roll,会不会一直重复使用同一种类型。

在这里花一点时间,后面用 Codex 剪辑的时候就会更简单一点,也更容易做出你满意的画面。

第三步:正式剪辑

OK,说了这么多我们终于可以进入正式剪辑了。

不过因为我们前面其实做了非常多的准备工作,像时间轴还有视觉编排表这些都做好了,所以剪辑部分就会变得非常简单。

就是按照视觉编排表和时间轴的顺序,把一个个镜头做出来就行。

不过A-roll和B-roll的做法,会有一些明显的差别。

先说 A-roll。

A-roll 里有两个地方比较关键,一个是 IP 形象的一致性,一个是表达视角的多样性。

IP 形象一致性

我们都知道,提供参考图给 AI,AI 就可以生成非常相似的画面。

但你如果真的去用,就会发现,这个相似其实还是会有一些差异。

比方说生成的人物看起来是对的,但身高、胖瘦不太一样;又或者体型、年龄都跟参考图很像,笔画风格却又跟原来对不上。

即便是一次对了,你也很难保证每一次生成都是对的。

xilo - inline image

所以我给到AI的参考图,一般都不会只给一张,而是会同时给到它人物三视图和细节笔触图。

人物三视图,主要是确保角色本身是对的,五官、体型这些不会出现偏差。

xilo - inline image

细节笔触图,就是笔画的呈现细节,比方说上色方式、线条粗细和线型。这样AI每次生成时,整体的画面风格就不会有太大偏差。

xilo - inline image

另外,我还会准备一张场景图。

因为我A-roll主要是小剧场类型的内容,所以场景也会比较关键。这个场景图,主要是让AI参考整体的场景风格,让它知道场景应该是什么样的。

xilo - inline image

光有参考图还不够,在提示词上还要有一些关键约束。

比方说我会让Codex分析IP角色的身型身高,是几头身。还有场景也会在提示词里要求背景简化、虚化,突出画面层次感。

这里我同样准备了提示词。

如果你没有三视图,可以用下面这个提示词,先把IP的三视图做出来。

text
1我给你一张 IP 角色的参考图,帮我基于这张图生成一份规范化的角色三视图,用于后续保持形象一致。
2
3## 参考图
4[放入 IP 角色的参考图]
5
6## 你要做的事
7第一步,先仔细分析这张参考图,把角色的关键特征全部识别出来,包括:
8- 五官细节:眼睛、鼻子、嘴巴的画法和位置关系
9- 头身比例:几头身、身体各部位的相对比例
10- 服饰配饰:头顶、身上有什么标志性元素
11- 配色方案:主色、辅色,画出具体色号
12- 笔画风格:线条的粗细、颜色、上色方式、有没有阴影
13- 整体气质:比方说圆润可爱、简笔卡通、写实等
14
15第二步,把上面这些特征清楚地列出来给我看,方便我后续在别的提示词里直接引用。
16
17第三步,基于识别出来的特征,生成正面、侧面、背面三个角度的三视图。
18- 同一张图里输出三个角度
19- 三个角度必须是同一个角色,五官、比例、配色、笔画风格完全一致
20- 白色背景,角色居中,三个角度之间留出间距

细节图其实就很简单,从你想要的风格图片里,截取一张放大的局部细节图即可。场景图就需要自己去找合适的,或者让Codex生成,你再挑选一张满意的作为场景图。

有了三视图、细节图和场景图,后面每一个A-roll镜头,你都可以用下面这个提示词来出图。

text
1基于IP角色参考图和视觉编排表里的镜头信息,生成对应的 A-roll 画面。
2
3## 参考图(都要严格参照)
4[放入三视图]:角色形象以这张为准,五官、体型、头身比例完全按这张来
5[放入场景图]:场景风格和背景层次以这张为准,简化程度、虚化程度都保持一致
6[放入细节笔触图]:笔画的线条粗细、上色方式、整体风格以这张为准
7
8## 视觉编排表镜头信息
9[粘贴视觉编排表里对应镜头的这一整行,包含镜头号、时间、配音文案、画面设计、动态变化]
10
11## 你要做的事
12第一步,读懂视觉编排表里这个镜头的意图:这一段配音在讲什么、观众要理解什么、画面要传达什么情绪、用什么视角(主持人 / 主角 / 配角 / 第一人称)。
13
14第二步,基于三张参考图,生成对应的 A-roll 画面。以下要求都要遵守:
15- 角色本身以三视图为准,头身比例、五官、体型不允许自由发挥
16- 场景以场景图为准,背景保持简化、虚化,人物在前、背景在后,有明显的前后层次感
17- 笔画风格以细节笔触图为准,线条粗细、上色方式、笔触感觉完全一致
18- 画面里的动作、道具、构图,要匹配视觉编排表描述的镜头意图

多种表达视角

IP 形象搞定之后,还有一个问题。

如果 A-roll 从头到尾都是小人站在中间讲话,观众看多了也会腻。

所以我在 A-roll 里,其实还区分了几种不同的表达视角,来回切换使用,节奏就会丰富很多。

比方说主持人视角。IP角色会像主持人一样正对镜头讲话,一般用在开场、章节过渡这些地方;

还有主角视角和配角视角。主角视角就是IP角色作为画面主体,在场景里做动作、情绪,或者和配角有交互。而配角视角则是作为补充视角,一般在主角视角的下一个A-roll。

另外一些关键信息的表达,我也会使用第一人称视角,直接用IP角色的眼睛去看,画面就是它看到的东西。

下面是生成多视角的提示词,朋友们也可以直接使用这个提示词,生成A-roll画面。

text
1基于IP角色参考图和视觉编排表里的镜头信息,生成对应视角的 A-roll 画面。
2
3## 参考图(都要严格参照)
4[放入三视图]:角色形象以这张为准,五官、体型、头身比例完全按这张来
5[放入场景图]:场景风格和背景层次以这张为准
6[放入细节笔触图]:笔画的线条粗细、上色方式、整体风格以这张为准
7
8## 视觉编排表镜头信息
9[粘贴视觉编排表里对应镜头的这一整行,包含镜头号、时间、配音、画面设计、动态变化]
10
11## 我想要的视角
12[从下面四种里选一种,只选一种]:主持人视角 / 主角视角 / 配角视角 / 第一人称视角
13
14## 四种视角的构图规范
15
16### 主持人视角
17- IP 角色正对镜头,居中站位
18- 景别用中景到近景(腰部或胸部以上)
19- 眼神看向镜头,跟观众对话的感觉
20- 背景保持简化虚化,突出人物
21- 适用:开场、章节过渡、总结陈词
22
23### 主角视角
24- IP 角色是画面主体,在场景里做动作或表现情绪
25- 景别用全景或中景,能看到角色和它所在的环境
26- 视线跟着动作走,不看镜头
27- 背景要有具体的场景元素,跟场景图保持一致的层次感
28- 适用:讲个人经历、演示动作、表达情绪、跟配角有互动
29
30### 配角视角
31- 画面主体不是 IP 角色,而是新增的一个配角形象
32- IP 角色可以在画面里但不是焦点,也可以不出现
33- 通过配角的动作或表情,补充说明主线内容
34- 配角的画风必须跟三视图和细节图保持完全一致
35- 适用:需要旁观视角补充、场景里有多个主体的时候
36
37### 第一人称视角
38- 画面就是 IP 角色眼睛里看到的东西
39- 画面里通常看不到 IP 自己,或者只能看到手、脚这些局部
40- 镜头有明确的方向感,像真的在看某样东西
41- 适用:强调"我看到了什么"、进入某个新场景、观察某个具体对象
42
43## 你要做的事
44第一步,读懂视觉编排表里这段镜头的意图:这段配音在讲什么、观众要理解什么、情绪是什么。
45
46第二步,按照我选定的视角类型的构图规范,规划画面:用什么景别、角色在画面哪个位置、视线看哪里、背景怎么处理。
47
48第三步,保证画面里的角色、场景、笔触,跟三张参考图完全一致(头身比例、笔画风格、背景层次都不能自由发挥)。

OK,说完A-roll,再来说说 B-roll。

B-roll 的思路和 A-roll 类似,也是先分类型,再决定用什么表现形式。

B-roll我主要区分了三种类型:有素材类型、无素材类型、纯文字类型。

xilo - inline image

有素材类型,就是这段内容需要用到一些实际截图或录屏。比方说我之前视频里出现过的商单截图、工具页面录屏这些。

无素材类型,是没有现成素材,但可以用图形去表达的。比方说我视频里会去讲到的一些干货知识,就会通过不同的图形和动效把视觉关系呈现出来。

纯文字类型用得相对少,一般是章节目录或金句这些地方会用上。

分好类型之后,接下来就是具体制作。

关于制作,一般会有两种方式。(其实就是我之前文章分享过的,搭建稳定素材库)

一是搭建本地动效素材库。

有些结构其实是每条视频都会重复出现的,比方说三步流程、方案对比、几种类型的横向排列。

这种其实我们可以提前让codex去做好几个相对比较OK的动效模板。不用太多,每种常用结构 2–3 个就够了。

做的时候把 UI 规范 (配色、字体、光标) 都加进去,动效结构做得通用一点。

之后再遇到类似的 B-roll,就可以让 Codex 直接读取本地模板,然后只替换文案,快速获得一个风格一致的 B-roll 画面。

二是从开源素材库里找现成动效。

如果本地动效模板里没有合适的,我们还可以从开源素材库里找。

GitHub 上有不少开源的动效项目,里面有大量做好的动效可以直接拿来改。比方说 Hyperframes-launches 和 video-shotcraft 这两个。

hyperframes-launches 是 HyperFrames 官方发布的动效示例库,收录了 HeyGen 自己产品发布视频用过的完整动效,都是能直接使用的 HyperFrames 源码。

video-shotcraft 是一个开源老师整理的动效库,有 152 张镜头配方卡和 209 个动效预览。原实现是基于 Remotion 的,但里面的动效思路也可以直接被 AI 读取,然后用 HyperFrames 复刻出来。

做的时候,让 Codex 先去这两个 GitHub 项目里读取,挑一个和文案语义结构最接近的动效样式,把它的骨架 (元素关系、主要动作、阶段顺序) 保留不动,只把外层的画面改成符合我们 B-roll 的样式。

这两种方式的配合逻辑,我也做成了一条通用提示词,可以直接拿去用:

text
1帮我为这个 B-roll 镜头挑一个合适的动效。
2
3## 镜头信息
4- 镜头号:【填入镜头号】
5- 时长:【填入毫秒】
6- 配音内容:【填入这段配音】
7- 观众要理解的一句话:【填入】
8- B-roll 类型:【有素材 / 无素材 / 纯文字】
9- 语义结构:【对比 / 聚合 / 筛选 / 层级 / 因果 / 替换 / 展开】
10
11## 素材来源(按优先级)
12- 本地样例模板库:【填入本地模板库路径,比方说 templates/broll/】
13- 开源项目 1:https://github.com/heygen-com/hyperframes-launches
14- 开源项目 2:https://github.com/Vincentwei1021/video-shotcraft
15
16## 你要做的事
17第一步,先去本地样例模板库里读取所有模板,看有没有和这段内容语义结构匹配的。有的话,直接告诉我用哪个模板,只需要替换文案。
18
19第二步,如果本地样例模板里没有合适的,再去两个开源项目里读取,挑出语义结构最接近的动效,把它的骨架(元素关系、主要动作、阶段顺序)说给我听,让我确认。
20
21第三步,选定动效之后,只做最小修改让它匹配我们的 UI 规范:【背景色、锚点色、字体、其他个性化元素】。
22
23先把选中的模板或动效和修改方案告诉我,我确认后再做实现。

第四步:样片和成片

到这里,A-roll 和 B-roll 的做法,相信朋友们已经清楚了。

剩下的就像我前面说的一样,根据视觉编排表让 Codex 一段一段做出来就行。

这里一个比较好的建议,是先出1分钟左右的样片。

1分钟时长,可以完整看到A-roll和B-roll的节奏变化。

如果有需要调整的在样片阶段改掉,成本会低很多。

样片确认没问题,再让 Codex 按照同样标准,把剩下的内容完整剪辑出来。

拿到成片以后呢,视频看起来还是比较单调怎么办?

这时候,就需要我们把听觉补上,让整个视频看起来更完整和有节奏。

BGM的话,这个可以直接从爱给网上去找合适的无版权音乐。如果你想要更适配,也可以通过接入音频生成模型来实现。

但有一个前提,BGM的风格一定是要适配内容的。

比方说我做的是AI知识干货分享,所以我的整个BGM风格就会偏轻快和快节奏,去配合A-roll和B-roll的变化。

音效的话,其实做和不做都可以。当然,做了整体的层次感肯定会更好,但要注意数量和声音大小,避免音效加过多,破坏视频的整体节奏。

写在最后

如果你不想出镜,但是又想做出能接商单的视频账号,那这种视频形式应该是比较适合你的,朋友们可以去尝试一下。 (如果成了,记得给我报喜)

如果有任何卡点或不理解的地方,也可以直接在评论区问我,只要看到的我基本都会回答。

哦,还有,提示词和素材库的附件文档,你可以在后台输入 「Codex剪辑」 拿到。

最后跟朋友们分享一个感触。

用Codex剪辑到现在,我越来越觉得,2026年对我们这样的普通人真的太友好了。

因为自从Agent爆发以来,AI无论是执行力还是智商,都已经到了一个真正能做好事情的水平。

所以你脑子里任何一个想法或创意,都值得丢给AI去试一遍。只要你愿意花点时间,「想到」就可以是「做到」。

以上就是全部,希望对朋友们有所帮助。(可以的话给个三连,这对我很重要)

祝好🍀

二次創作

使用 YouMind 創作爆款文章

收集素材、拆解爆點、生成視覺資產、撰寫內容,並在一個 AI 工作空間裡完成分發。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章