熟悉的朋友应该都知道我最近在更新视频,并且数据还不错。
某音2条视频开通精选计划,某书2条视频接下了近四位数商单。目前两个账号都只发了3条视频,就已经有不下于10个商单找上门了。还有小破站的创作邀约、一些平台的课程邀约。

Hi,朋友们,我又来交稿啦~
今天我们来聊聊,偏复杂和高质量的知识类视频,如何实现Codex自动剪辑?
其实这篇内容,在两天前就已经出了视频版本,并且在某音上获得了近20W的播放量。
但是我觉得视频的篇幅还是比较有限的,很多东西他没有办法去说清楚,所以又花时间去写了这篇文章,把完整的方法和思路,都去做了一遍拆解。
相关的提示词、工具、素材库这些,我也专门整理成了附件文档,方便朋友们一键使用。
还是老规矩,我更建议你实操一遍,但字数一如既往多,看不完直接丢给AI做成Skill,也是可以的。
如果没有问题,那我们就开始。

**
01. 为什么能接到商单
因为这类视频主要获取收益的方法,就是平台流量和品牌商单,所以我前置加了这个部分,希望对朋友们有用。
当然,我还只是小卡拉米,不一定对,朋友们借鉴着看即可。
从我自己的经历来看,为什么2条视频就有品牌来找我,原因无外乎两个。

一是视觉层面。
这种类型的视频不能说全网独一份,但相对来说还是比较少的,所以形式上,本身就是一种差异化,容易让人记住并观看。
在这个基础上,我还有专门去做了一些视觉上的设计,比方说类似电视机一样的人物小剧场,多种不同的视觉动效和人物动作。
做这些视觉设计,是为了让视觉层次看起来更丰富,观看体验更好。因为我觉得,只有别人看得下去,你的内容才可能会有流量。
二是内容层面。
我一个直观的感受就是,现在AI领域的品牌可能更青睐教程类的内容。
这类内容可以毫无痕迹地把产品植入进去,并且因为你做的是具体教程,用户想要实操就必然会用到产品,所以不管是流量还是转化,都不会太差。
视觉层面和内容层面结合起来,其实就是一个相对还不错的内容了。
这种内容即使你才刚起号,品牌方看到觉得质量不错,也可能会选择和你合作尝试一下。
02. 剪辑思路是怎样的?
说完商单,我们来说说剪辑思路。
看过视频的朋友应该就知道,在我的视频里,画面其实是被明确拆分成两种不同表现形式的。
一种是白色背景,主角是我的个人IP形象 (头顶小花的白毛小人),主要用来讲话、做动作、传递情绪;
另外一种是黑色背景,主角是内容本身,文字、图形、产品截图,也可能是一段具体的操作演示。
这两种画面有专门的术语,A-roll 和 B-roll。
(A-roll、B-roll 是纪录片剪辑里常会用到的剪辑手法。A-roll 是主机位拍主体,B-roll 是补充镜头。放到我们这里,就是讲人和讲内容两条并行画面。)

A-roll画面主要承担什么
A-roll的核心在于场景化表达,把抽象的文字变成一种更容易理解的情景。
让观众感受到这是一个人在跟我说话。即便这个人是假的,只是一个IP形象,也会有一种直观的对话感。
那什么样的画面算是A-roll呢?
简单粗暴一点,只要不是讲到具体知识的,你都可以归为A-roll。
比方说你们去看我视频的第一个画面,基本上都没有信息含量,但又不得不说。
这种你去用A-roll表达,就会变得很有意思。
B-roll画面主要承担什么
B-roll,则是补充画面。通过图表的方式,对知识进行画面上的补充,让观众可以更简单直观的理解知识本身。
一般只有涉及到知识、概念,或其他有信息增量的内容,就适合使用B-roll。
比方说要展示三种方案的对比,要放一个完整的流程步骤,或者某些知识概念由哪些部分组成。
拆分成A/B-roll两种画面,最大的好处其实就是不那么容易枯燥。
如果你一直只有一种画面,那越往后,观众的注意力其实是越容易分散的。
但如果两种画面交替出现,观众每隔十几秒就换一次视觉刺激,看起来就会更有趣味性,更容易看下去。
另外,还有一个很大的好处是,AI的剪辑准确率会大幅提高。
当画面只分A/B两类的时候,AI 每到一个镜头,只需要先做一个非常简单的选择:这一段用 A-roll还是用 B-roll?
如果选A-roll,那就只需要按照提前设定好的A-roll规则或模板,生成对应画面就好。
03. 需要准备什么工具?

首要的肯定是Codex,因为Codex自带生图模型,并且还是目前全球最好的生图模型。
当然,你用workbuddy其实也可以,但这个就需要你自备一个生图模型的API。
除了Codex以外,我们还需要安装一个动效插件,HyperFrames。
这个安装方法很简单,直接在Codex的插件市场,搜索HyperFrames,找到并安装就行。

这是一个专门做动效的一个插件,A-roll 和 B-roll 里所有的动效、镜头运动、时间轴,都是靠HyperFrames渲染出来的。
类似的插件还有Remotion。

对比HyperFrames,Remotion的优势是通过帧数控制,所以动效的可控性会更好一些,并且Remotion相对成熟,你能找到很多好看的Remotion模板。
但在整体的设计感上,我还是更喜欢HyperFrames,所以这个会用得比较多。 *(具体使用哪个,朋友们可以自行对比下。)
安装好动效插件以后,我们还需要准备一个配音工具。
我一直以来用的都是火山引擎的豆包语音合成2.0,效果稳定、价格不贵,1分钟大概也就几毛钱。 (无广,纯自用体验极好哈)
使用方法也很简单,直接注册一个火山引擎的账号。

然后搜索豆包语音,就可以进入专题页面。
在开通管理里开通语音合成服务,一般新用户会送20000字的生成额度。
开通以后,再把API复制出来丢给Codex,Codex就会自动调用测试。
如果你想用自己的声音,也可以试试开源的声音克隆工具voxCPM或Voicebox。
不过这两个我用得不多,可能得朋友们自行探索了。
基本上需要准备的工具就是Agent (也就是Codex)+动效插件+配音工具。如果你需要后期自己修改的话,也可以考虑加上ChatCut。
04. 如何调用Codex剪辑

所有东西都准备好以后,我们就可以进入实际的剪辑流程。
整个流程大概分为四步,我会讲得细一些,需要用到提示词的地方,我也会专门贴出出来。
第一步:文案 + 配音
之前有朋友问过我,视频文案是不是也是Codex一键生成的。
其实不是。视频文案是调用了另外一套内容工作流,用Claude写的。(朋友们需要的话,我之后再单独写一篇。)
所以这一步,我们需要提前准备好文案。有Claude用Claude是最好的。没有的话,豆包或DeepSeek效果其实也不错。
文案准备好以后,接下来就是配音和声学对齐。
配音没什么好说的,把定稿文案丢给Codex,让它调用豆包语音合成就行。
不过这里要注意提醒Codex,文案一定要整段合成,不要分句再组合。

如果你不提醒,Codex大概率会分句合成,每句话都调用一次豆包语音,最后再组合起来。
这样生成的音频,句与句之间会有明显的差异,比方说这句话大声,另一句话就小声。
声学对齐,简单来说就是把生成好的音频重新解析,拿到一份毫秒级别的时间轴文档,例如:
- [1249ms-3580ms] 这个问题其实很多朋友都有遇到
- [3580ms-6120ms] 我自己第一次做的时候也这样
这份时间轴文档,是后面所有视觉决策的时间基准。 每个镜头持续多久,画面如何变化,声音和画面怎样对齐,都需要用到。
如果没有的话,Codex生成时就很容易会出现声音和画面错位的情况。
这一步我专门准备了一个提示词,你直接把提示词和脚本给到Codex,它就会自动进行配音,并输出时间轴文档。
1帮我完成配音和声学对齐,两步连着做完,中间不用停下来问我。23## 第一步:配音4- 配音文案:【填入文案,或者文案文件路径】5- 调用火山引擎豆包语音合成 2.06- 音色 ID:【填入音色ID】,语速【填入,比方说 1.0】,音量用默认值7- 整段文案一次性合成一整条音频。禁止分句合成再拼接,禁止分段调用多次接口。8- 输出到 audio/vo-full.wav,44100 采样率,单声道9- 合成完成后打印音频总时长,精确到毫秒1011## 第二步:声学对齐12- 对 audio/vo-full.wav 做短语级对齐,语言指定中文13- 默认用 whisper large-v3,环境里没有就自己装好,不用问我14- 切分粒度是短语,不是整句,每段控制在 5 到 15 个字15- 对齐结果要和第一步的原文案逐字核对。whisper 识别错的字一律以原文案为准,只采用它给出的时间戳16- 时间轴不允许有重叠,也不允许有空缺,前一段的结束时间就是后一段的开始时间1718## 输出格式19时间轴写入 audio/vo-align.txt,同时打印给我看,格式严格按下面这样:2021[1249ms-3580ms] 这个问题其实很多朋友都有遇到22[3580ms-6120ms] 我自己第一次做的时候也这样2324## 最后确认25把这三项单独列出来:音频总时长、时间轴总段数、最后一段的结束时间。26最后一段的结束时间必须和音频总时长一致,对不上就重新对齐一次。
第二步:视觉编排表
配音和时间轴都拿到之后,我们还需要去做一份视觉编排表。
视觉编排表,你可以理解成剧本 + 分镜的组合体。
其实就是要让 Codex 站在视觉导演的视角,对我们的文案进行理解和拆分,变成一个个具体的视觉镜头。
比方说哪一段文案要用A-roll、哪一段文案用B-roll,每个镜头持续多久、画面上要发生什么变化、和前后镜头怎么衔接,这些都是要在视觉编排表里写清楚的。

这里我同样准备了一份提示词,你可以直接发给Codex。
1帮我基于口播文案和第一步生成的时间轴,站在导演视角,产出一份可以直接指导剪辑、素材准备和动画制作的视觉编排表。23## 我提供的内容45- 口播文案:6【粘贴文案】78- 配音时间轴:9【填入 audio/vo-align.txt 的路径或内容,格式为:[开始时间ms - 结束时间ms] 对应文字】1011## 编排原则1213先理解整篇文案的逻辑,再把它拆成完整的语义段落。不要按标点、句子长度或每次停顿机械切镜。1415每个镜头都要先回答:16171. 这一段最需要观众理解什么?182. 什么画面能让这句话变得更具体、更容易理解?193. 画面中的主体要发生什么变化?204. 镜头最后停留在什么结果上?215. 它如何承接上一镜,并自然进入下一镜?2223## 画面类型2425根据内容选择最合适的表达方式:2627- 人物画面:适合情绪、经历、态度和个人表达;28- 场景画面:适合还原具体情境、动作和使用过程;29- 真实素材:适合证据、案例、产品、界面和操作展示;30- 信息图形:适合步骤、关系、比较、流程、数据和因果;31- 文字动效:适合金句、关键词、概念替换和结论强调。3233不要为了丰富而频繁切换画面。每次变化都必须帮助观众理解内容。3435如果文案提到真实产品、界面、数据、案例或用户素材,但我没有提供相应内容,请标记"需要补充素材",不要自行编造。3637## 时间与节奏3839时间以我提供的配音时间轴为准,不要自行估算,不要修改时间戳。4041每个镜头的起止时间必须落在时间轴的短语边界上,不能跨语义切开。4243镜头时长较长时,需要安排与旁白对应的内部变化,例如:4445- 主体出现;46- 重点被选中或放大;47- 两个方案形成对比;48- 步骤逐项展开;49- 信息从混乱变得清晰;50- 最终结论落定。5152入场、呼吸动画、背景循环和字幕出现不算有效的信息变化。避免画面长时间没有新内容,也不要让动画为了动而动。5354## 输出格式5556请使用以下表格:5758| 镜头 | 时间 | 配音文案 | 画面类型 | 画面设计 | 动态变化 | 画面衔接 |59|---|---|---|---|---|---|---|6061填写要求:6263- 镜头:从 S001 开始连续编号;64- 时间:填写开始与结束时间(毫秒),必须来自我提供的时间轴;65- 配音文案:保留对应原文,不要擅自改写;66- 画面类型:从人物、场景、真实素材、信息图形、文字动效中选择;67- 画面设计:说明主体、构图、景别、关键元素和最终画面;68- 动态变化:按照旁白顺序写清第一次、第二次和第三次变化;没有必要时不要强行凑数;69- 画面衔接:说明前后镜头如何通过主体、动作、方向、位置、颜色或意义自然接续,不要只写"淡入淡出"。7071## 全片检查7273完成表格后,再检查:74751. 画面是否真正帮助理解文案;762. 是否存在连续重复、节奏单一的问题;773. 是否有镜头变化太少或信息过载;784. 是否使用了未经提供或无法核实的素材;795. 重要信息是否得到足够的视觉强调;806. 前后镜头是否连贯;817. 哪些镜头需要我补充素材或做出选择。8283最后单独列出:8485- 需要补充的素材;86- 需要确认的视觉方向;87- 制作难度较高的镜头。8889现在先生成视觉编排表,不要直接制作图片、动画或视频。
编排表出来以后,个人建议是完整检查一遍,主要检查两个地方。
一是 A-roll 和 B-roll 的交替节奏是否自然,会不会连续三四个镜头都是 A-roll、然后又连续三四个都是 B-roll 这种情况;
二是单个A-roll 或 B-roll,会不会一直重复使用同一种类型。
在这里花一点时间,后面用 Codex 剪辑的时候就会更简单一点,也更容易做出你满意的画面。
第三步:正式剪辑
OK,说了这么多我们终于可以进入正式剪辑了。
不过因为我们前面其实做了非常多的准备工作,像时间轴还有视觉编排表这些都做好了,所以剪辑部分就会变得非常简单。
就是按照视觉编排表和时间轴的顺序,把一个个镜头做出来就行。
不过A-roll和B-roll的做法,会有一些明显的差别。
先说 A-roll。
A-roll 里有两个地方比较关键,一个是 IP 形象的一致性,一个是表达视角的多样性。
IP 形象一致性
我们都知道,提供参考图给 AI,AI 就可以生成非常相似的画面。
但你如果真的去用,就会发现,这个相似其实还是会有一些差异。
比方说生成的人物看起来是对的,但身高、胖瘦不太一样;又或者体型、年龄都跟参考图很像,笔画风格却又跟原来对不上。
即便是一次对了,你也很难保证每一次生成都是对的。

所以我给到AI的参考图,一般都不会只给一张,而是会同时给到它人物三视图和细节笔触图。
人物三视图,主要是确保角色本身是对的,五官、体型这些不会出现偏差。

细节笔触图,就是笔画的呈现细节,比方说上色方式、线条粗细和线型。这样AI每次生成时,整体的画面风格就不会有太大偏差。

另外,我还会准备一张场景图。
因为我A-roll主要是小剧场类型的内容,所以场景也会比较关键。这个场景图,主要是让AI参考整体的场景风格,让它知道场景应该是什么样的。

光有参考图还不够,在提示词上还要有一些关键约束。
比方说我会让Codex分析IP角色的身型身高,是几头身。还有场景也会在提示词里要求背景简化、虚化,突出画面层次感。
这里我同样准备了提示词。
如果你没有三视图,可以用下面这个提示词,先把IP的三视图做出来。
1我给你一张 IP 角色的参考图,帮我基于这张图生成一份规范化的角色三视图,用于后续保持形象一致。23## 参考图4[放入 IP 角色的参考图]56## 你要做的事7第一步,先仔细分析这张参考图,把角色的关键特征全部识别出来,包括:8- 五官细节:眼睛、鼻子、嘴巴的画法和位置关系9- 头身比例:几头身、身体各部位的相对比例10- 服饰配饰:头顶、身上有什么标志性元素11- 配色方案:主色、辅色,画出具体色号12- 笔画风格:线条的粗细、颜色、上色方式、有没有阴影13- 整体气质:比方说圆润可爱、简笔卡通、写实等1415第二步,把上面这些特征清楚地列出来给我看,方便我后续在别的提示词里直接引用。1617第三步,基于识别出来的特征,生成正面、侧面、背面三个角度的三视图。18- 同一张图里输出三个角度19- 三个角度必须是同一个角色,五官、比例、配色、笔画风格完全一致20- 白色背景,角色居中,三个角度之间留出间距
细节图其实就很简单,从你想要的风格图片里,截取一张放大的局部细节图即可。场景图就需要自己去找合适的,或者让Codex生成,你再挑选一张满意的作为场景图。
有了三视图、细节图和场景图,后面每一个A-roll镜头,你都可以用下面这个提示词来出图。
1基于IP角色参考图和视觉编排表里的镜头信息,生成对应的 A-roll 画面。23## 参考图(都要严格参照)4[放入三视图]:角色形象以这张为准,五官、体型、头身比例完全按这张来5[放入场景图]:场景风格和背景层次以这张为准,简化程度、虚化程度都保持一致6[放入细节笔触图]:笔画的线条粗细、上色方式、整体风格以这张为准78## 视觉编排表镜头信息9[粘贴视觉编排表里对应镜头的这一整行,包含镜头号、时间、配音文案、画面设计、动态变化]1011## 你要做的事12第一步,读懂视觉编排表里这个镜头的意图:这一段配音在讲什么、观众要理解什么、画面要传达什么情绪、用什么视角(主持人 / 主角 / 配角 / 第一人称)。1314第二步,基于三张参考图,生成对应的 A-roll 画面。以下要求都要遵守:15- 角色本身以三视图为准,头身比例、五官、体型不允许自由发挥16- 场景以场景图为准,背景保持简化、虚化,人物在前、背景在后,有明显的前后层次感17- 笔画风格以细节笔触图为准,线条粗细、上色方式、笔触感觉完全一致18- 画面里的动作、道具、构图,要匹配视觉编排表描述的镜头意图
多种表达视角
IP 形象搞定之后,还有一个问题。
如果 A-roll 从头到尾都是小人站在中间讲话,观众看多了也会腻。
所以我在 A-roll 里,其实还区分了几种不同的表达视角,来回切换使用,节奏就会丰富很多。
比方说主持人视角。IP角色会像主持人一样正对镜头讲话,一般用在开场、章节过渡这些地方;
还有主角视角和配角视角。主角视角就是IP角色作为画面主体,在场景里做动作、情绪,或者和配角有交互。而配角视角则是作为补充视角,一般在主角视角的下一个A-roll。
另外一些关键信息的表达,我也会使用第一人称视角,直接用IP角色的眼睛去看,画面就是它看到的东西。
下面是生成多视角的提示词,朋友们也可以直接使用这个提示词,生成A-roll画面。
1基于IP角色参考图和视觉编排表里的镜头信息,生成对应视角的 A-roll 画面。23## 参考图(都要严格参照)4[放入三视图]:角色形象以这张为准,五官、体型、头身比例完全按这张来5[放入场景图]:场景风格和背景层次以这张为准6[放入细节笔触图]:笔画的线条粗细、上色方式、整体风格以这张为准78## 视觉编排表镜头信息9[粘贴视觉编排表里对应镜头的这一整行,包含镜头号、时间、配音、画面设计、动态变化]1011## 我想要的视角12[从下面四种里选一种,只选一种]:主持人视角 / 主角视角 / 配角视角 / 第一人称视角1314## 四种视角的构图规范1516### 主持人视角17- IP 角色正对镜头,居中站位18- 景别用中景到近景(腰部或胸部以上)19- 眼神看向镜头,跟观众对话的感觉20- 背景保持简化虚化,突出人物21- 适用:开场、章节过渡、总结陈词2223### 主角视角24- IP 角色是画面主体,在场景里做动作或表现情绪25- 景别用全景或中景,能看到角色和它所在的环境26- 视线跟着动作走,不看镜头27- 背景要有具体的场景元素,跟场景图保持一致的层次感28- 适用:讲个人经历、演示动作、表达情绪、跟配角有互动2930### 配角视角31- 画面主体不是 IP 角色,而是新增的一个配角形象32- IP 角色可以在画面里但不是焦点,也可以不出现33- 通过配角的动作或表情,补充说明主线内容34- 配角的画风必须跟三视图和细节图保持完全一致35- 适用:需要旁观视角补充、场景里有多个主体的时候3637### 第一人称视角38- 画面就是 IP 角色眼睛里看到的东西39- 画面里通常看不到 IP 自己,或者只能看到手、脚这些局部40- 镜头有明确的方向感,像真的在看某样东西41- 适用:强调"我看到了什么"、进入某个新场景、观察某个具体对象4243## 你要做的事44第一步,读懂视觉编排表里这段镜头的意图:这段配音在讲什么、观众要理解什么、情绪是什么。4546第二步,按照我选定的视角类型的构图规范,规划画面:用什么景别、角色在画面哪个位置、视线看哪里、背景怎么处理。4748第三步,保证画面里的角色、场景、笔触,跟三张参考图完全一致(头身比例、笔画风格、背景层次都不能自由发挥)。
OK,说完A-roll,再来说说 B-roll。
B-roll 的思路和 A-roll 类似,也是先分类型,再决定用什么表现形式。
B-roll我主要区分了三种类型:有素材类型、无素材类型、纯文字类型。

有素材类型,就是这段内容需要用到一些实际截图或录屏。比方说我之前视频里出现过的商单截图、工具页面录屏这些。
无素材类型,是没有现成素材,但可以用图形去表达的。比方说我视频里会去讲到的一些干货知识,就会通过不同的图形和动效把视觉关系呈现出来。
纯文字类型用得相对少,一般是章节目录或金句这些地方会用上。
分好类型之后,接下来就是具体制作。
关于制作,一般会有两种方式。(其实就是我之前文章分享过的,搭建稳定素材库)
一是搭建本地动效素材库。
有些结构其实是每条视频都会重复出现的,比方说三步流程、方案对比、几种类型的横向排列。
这种其实我们可以提前让codex去做好几个相对比较OK的动效模板。不用太多,每种常用结构 2–3 个就够了。
做的时候把 UI 规范 (配色、字体、光标) 都加进去,动效结构做得通用一点。
之后再遇到类似的 B-roll,就可以让 Codex 直接读取本地模板,然后只替换文案,快速获得一个风格一致的 B-roll 画面。
二是从开源素材库里找现成动效。
如果本地动效模板里没有合适的,我们还可以从开源素材库里找。
GitHub 上有不少开源的动效项目,里面有大量做好的动效可以直接拿来改。比方说 Hyperframes-launches 和 video-shotcraft 这两个。
hyperframes-launches 是 HyperFrames 官方发布的动效示例库,收录了 HeyGen 自己产品发布视频用过的完整动效,都是能直接使用的 HyperFrames 源码。
video-shotcraft 是一个开源老师整理的动效库,有 152 张镜头配方卡和 209 个动效预览。原实现是基于 Remotion 的,但里面的动效思路也可以直接被 AI 读取,然后用 HyperFrames 复刻出来。
做的时候,让 Codex 先去这两个 GitHub 项目里读取,挑一个和文案语义结构最接近的动效样式,把它的骨架 (元素关系、主要动作、阶段顺序) 保留不动,只把外层的画面改成符合我们 B-roll 的样式。
这两种方式的配合逻辑,我也做成了一条通用提示词,可以直接拿去用:
1帮我为这个 B-roll 镜头挑一个合适的动效。23## 镜头信息4- 镜头号:【填入镜头号】5- 时长:【填入毫秒】6- 配音内容:【填入这段配音】7- 观众要理解的一句话:【填入】8- B-roll 类型:【有素材 / 无素材 / 纯文字】9- 语义结构:【对比 / 聚合 / 筛选 / 层级 / 因果 / 替换 / 展开】1011## 素材来源(按优先级)12- 本地样例模板库:【填入本地模板库路径,比方说 templates/broll/】13- 开源项目 1:https://github.com/heygen-com/hyperframes-launches14- 开源项目 2:https://github.com/Vincentwei1021/video-shotcraft1516## 你要做的事17第一步,先去本地样例模板库里读取所有模板,看有没有和这段内容语义结构匹配的。有的话,直接告诉我用哪个模板,只需要替换文案。1819第二步,如果本地样例模板里没有合适的,再去两个开源项目里读取,挑出语义结构最接近的动效,把它的骨架(元素关系、主要动作、阶段顺序)说给我听,让我确认。2021第三步,选定动效之后,只做最小修改让它匹配我们的 UI 规范:【背景色、锚点色、字体、其他个性化元素】。2223先把选中的模板或动效和修改方案告诉我,我确认后再做实现。
第四步:样片和成片
到这里,A-roll 和 B-roll 的做法,相信朋友们已经清楚了。
剩下的就像我前面说的一样,根据视觉编排表让 Codex 一段一段做出来就行。
这里一个比较好的建议,是先出1分钟左右的样片。
1分钟时长,可以完整看到A-roll和B-roll的节奏变化。
如果有需要调整的在样片阶段改掉,成本会低很多。
样片确认没问题,再让 Codex 按照同样标准,把剩下的内容完整剪辑出来。
拿到成片以后呢,视频看起来还是比较单调怎么办?
这时候,就需要我们把听觉补上,让整个视频看起来更完整和有节奏。
BGM的话,这个可以直接从爱给网上去找合适的无版权音乐。如果你想要更适配,也可以通过接入音频生成模型来实现。
但有一个前提,BGM的风格一定是要适配内容的。
比方说我做的是AI知识干货分享,所以我的整个BGM风格就会偏轻快和快节奏,去配合A-roll和B-roll的变化。
音效的话,其实做和不做都可以。当然,做了整体的层次感肯定会更好,但要注意数量和声音大小,避免音效加过多,破坏视频的整体节奏。
写在最后
如果你不想出镜,但是又想做出能接商单的视频账号,那这种视频形式应该是比较适合你的,朋友们可以去尝试一下。 (如果成了,记得给我报喜)
如果有任何卡点或不理解的地方,也可以直接在评论区问我,只要看到的我基本都会回答。
哦,还有,提示词和素材库的附件文档,你可以在后台输入 「Codex剪辑」 拿到。
最后跟朋友们分享一个感触。
用Codex剪辑到现在,我越来越觉得,2026年对我们这样的普通人真的太友好了。
因为自从Agent爆发以来,AI无论是执行力还是智商,都已经到了一个真正能做好事情的水平。
所以你脑子里任何一个想法或创意,都值得丢给AI去试一遍。只要你愿意花点时间,「想到」就可以是「做到」。
以上就是全部,希望对朋友们有所帮助。(可以的话给个三连,这对我很重要)
祝好🍀





