Codex 자동 영상 편집: 7,000 달러 이상의 수익을 올린 Douyin 워크플로우 단계별 가이드

@xilo2991
중국어2주 전 · 2026년 7월 05일
1.6M
3.2K
622
83
5.7K

TL;DR

이 상세 가이드는 Codex를 활용한 AI 기반 워크플로우를 설명합니다. 바이럴 영상 레퍼런스를 분석하고 로컬 에셋과 매칭하여 소셜 미디어용 영상 편집을 자동화하는 방법을 다룹니다.

저는 이 편집 워크플로우를 2개월 넘게 사용해왔고, 무려 10개 이상의 버전을 반복했습니다. 이 글에서는 제 친구들을 위해 전체 과정과 세부 사항을 최대한 명확하게 설명해 드리겠습니다.

글의 논리를 따라가시거나, 이 글을 Codex에 직접 보내 AI가 여러분을 위한 Skill을 만들도록 할 수도 있습니다.

안녕하세요, 여러분! 초안을 들고 왔습니다!

지난주에 Codex에 대한 소개 글을 썼는데, 많은 응원에 감사드립니다—조회수 100만을 넘겼습니다.

https://x.com/xilo2991/status/2070051136187621452

그때 많은 분들이 글에서 언급한 자동 편집 기능을 공유해 줄 수 있냐고 물어보셨습니다.

물론이죠. 오늘은 Codex를 사용하여 자동 편집을 구현하고 비디오 제작 효율성을 극대화하는 방법에 대해 이야기해 보려고 합니다.

워크플로우의 기본 로직

콘텐츠를 하든 이커머스를 하든, 빠르게 트래픽을 얻는 가장 쉬운 방법은 인기 콘텐츠를 복제하는 것입니다.

인기 콘텐츠는 이미 시장에서 검증된 콘텐츠이기 때문에, 충분히 빠르게 따라하기만 하면 트래픽이 일반적으로 나쁘지 않습니다. (물론, 복제와 표절의 차이에 주의하세요.)

이 워크플로우의 핵심은 인기 콘텐츠를 복제하는 것입니다.

여러분이 인기 있는 동영상을 보고 그 리듬과 구조를 따라 자신만의 동영상을 만들고 싶다고 가정해 보겠습니다. 전통적인 방식은 CapCut( Jianying )에 수동으로 들어가 참조 동영상을 프레임 단위로 매칭하고, 자료를 찾고, 타이밍을 맞추고, 자막을 정렬하는 것입니다. 하나의 동영상에 2~3시간이 걸릴 수도 있습니다.

하지만 이 워크플로우를 사용하면 참조 동영상과 여러분의 자료 라이브러리만 준비하면 됩니다. Codex가 나머지 작업을 자동으로 완료합니다.

Codex는 참조 동영상의 모든 장면 전환을 자동으로 식별하고, 라이브러리에서 가장 잘 맞는 자료를 찾아 음성 해설과 자막을 자동으로 생성한 다음, 최종적으로 열고 편집할 수 있는 CapCut 초안을 제공합니다.

전체 과정은 단 몇 분밖에 걸리지 않을 수 있습니다.

저는 주로 Douyin 제품 동영상을 만들 때 이 워크플로우를 사용합니다.

Codex 이전에는 하루에 최대 6개의 동영상만 편집할 수 있었습니다. 하지만 Codex를 사용하면 적합한 인기 동영상을 참조 자료로 찾고 제품 자료를 준비하기만 하면 됩니다. 나머지는 자동 생성, 검토 및 미세 조정입니다.

저는 하루에 30개의 동영상을 쉽게 끝낼 수 있으며, 효율성이 최소 5배 향상되었습니다.

xilo - inline image

하지만 분명히 말씀드리자면, 이 워크플로우의 포지셔닝은 자동 제작이지, 맞춤형 제작이 아닙니다.

여러 클립을 이어 붙여야 하는 매시업 스타일의 동영상, 예를 들어 이커머스, 마케팅 또는 매시업 Vlog에 적합합니다.

참조 동영상은 구조와 리듬을 제공하고, 여러분의 자료 라이브러리는 시각 자료를 제공하며, 음성 해설과 자막은 자동으로 생성되고, 최종 동영상은 자동으로 제작됩니다.

매우 정밀한 영화적 언어, 복잡한 전환 효과, 섬세한 감정 표현이 필요한 고품질의 독창적인 콘텐츠를 만들고자 한다면, 이 프로세스는 적합하지 않을 수 있습니다.

현재의 자동 매칭 로직은 아직 그렇게 정밀한 의미 이해와 감정 제어를 달성할 수 없기 때문입니다.

저는 또한 오리지널 동영상을 위해 이 프로세스를 최적화하는 방법을 연구 중이며, 안정화되면 여러분과 공유하겠습니다.

워크플로우 준비

좋습니다. 다시 자동 편집 워크플로우로 돌아가겠습니다. 아래에서는 이 워크플로우를 구축하는 방법을 단계별로 설명하겠습니다. 시작하기 전에 두 가지를 준비해야 합니다.

1. 해당 도구 설치

이 워크플로우는 Codex를 기반으로 하므로, 먼저 Codex가 있어야 합니다. 사용해 본 적이 없다면 지난주에 쓴 제 소개 글을 확인해 보세요.

구체적으로, 이 워크플로우에는 다음과 같은 핵심 도구가 필요합니다.

  • FFmpeg: 동영상 분할, 병합, 형식 변환과 같은 기본 작업에 사용됩니다. 이것은 기초이므로 반드시 설치해야 합니다.
  • Python 환경: 전체 프로세스가 Python으로 작성되었으므로, 최소 Python 3.8이 필요합니다.
  • 음성 해설 도구: 자동 음성 해설을 원한다면 가장 안정적인 것은 ByteDance의 Doubao 음성 모델입니다. 음성을 복제하려면 무료 오픈소스 도구인 VoxCPM을 사용하세요.
  • CapCut ( Jianying ): 최종 생성된 초안은 CapCut 형식이므로 데스크톱 버전을 설치해야 합니다.

이 중 FFmpeg와 Python은 핵심 종속성입니다.

다음 텍스트를 Codex에 복사하여 환경을 확인하고 누락된 도구를 설치하도록 할 수 있습니다.

text
1자동 동영상 편집에 필요한 환경을 확인해 주세요.
2
31. FFmpeg가 설치되어 있는지 확인하고, 없으면 설치를 도와주세요.
42. Python 버전이 3.8 이상인지 확인하고, 그렇지 않으면 설치 또는 업그레이드를 도와주세요.
53. CapCut ( Jianying ) Professional이 설치되어 있는지 확인하고, 없으면 다운로드 링크를 알려주세요.
64. Python 종속성 설치: opencv-python, numpy, pillow
7
8확인 후, 무엇이 준비되었고 무엇을 수동으로 처리해야 하는지 알려주세요.

음성 해설의 경우, 필요에 따라 다릅니다. 이커머스 동영상을 작업하는 경우 Doubao 음성 모델이 가장 안정적입니다. CapCut과 동일한 AI 음성을 사용합니다. 가격이 저렴하여 1분짜리 동영상을 생성하는 데 약 0.4~0.8위안이 듭니다.

자신의 목소리를 사용하거나 다른 사람의 목소리를 복제하려면 VoxCPM을 사용하세요. GitHub에서 링크를 찾아 Codex에 보내 설치하세요.

2. 폴더 생성

이러한 도구를 설치한 후에는 프로젝트 폴더를 생성해야 합니다. 저는 보통 다음과 같이 구성합니다.

text
1프로젝트 폴더/
2 assets/ # 자료 라이브러리
3 work/ # 작업 영역, 편집할 때마다 날짜 폴더 생성
4 final/ # 최종 결과물
5 AGENTS.md # 프로젝트 구성 파일

assets 폴더는 여러분의 라이브러리입니다. 사용할 수 있는 모든 자료를 여기에 넣어두세요. AI가 생성했거나 직접 촬영한 것일 수 있지만, 재사용 가능한 자산으로 미리 준비해야 합니다.

자료는 외관, 기능 또는 장면별로 분류할 수 있습니다.

work 폴더는 진행 중인 프로젝트용입니다. 새 동영상을 만들 때마다 2026-07-05와 같은 날짜 폴더를 만들고 참조 동영상, 중간 파일 및 최종 초안을 그 안에 넣습니다.

AGENTS.md는 구성 파일로, 프로젝트 목표, 출력 사양 및 승인 기준을 포함합니다. Codex가 여러분의 요구 사항을 이해하는 데 사용하므로 매우 중요합니다.

xilo - inline image

참고: 제 AGENTS 파일은 약간 길어서 마지막에 참고용으로 넣어두었습니다.

편집 워크플로우 구축

1. 참조 동영상 분해

여기서 핵심 목표는 참조 동영상을 독립적인 장면으로 분할하고 각 장면의 키프레임을 추출하여 자료 매칭의 기초로 삼는 것입니다.

참조하고 싶은 동영상을 찾으세요. 다운로드하여 work 폴더에 넣고 명확한 이름을 지정하세요.

그런 다음 이 내용을 Codex에 보내세요.

text
1참조 동영상을 분해해야 합니다.
2
3참조 동영상 위치: @(파일 이름 입력)
4
5다음을 도와주세요.
61. FFmpeg를 사용하여 장면 전환 식별 (프레임 간 차이 분석 기반)
72. 각 장면의 키프레임을 추출하여 이미지로 저장
83. 오디오 트랙을 별도로 추출
94. 각 장면의 시작 시간, 종료 시간, 지속 시간 및 키프레임 경로를 기록하는 recipe.json 파일 생성
105. 텍스트가 있는 경우 오디오를 기반으로 장면별로 분할된 음성 해설 스크립트 생성
11
12완료 후 AGENTS.md 요구 사항에 따라 해당 폴더에 저장하고 식별된 장면 수를 알려주세요.

recipe.json 파일은 전체 프로세스의 핵심입니다.

xilo - inline image

분해 후에는 많은 작은 동영상 클립과 스크린샷이 표시됩니다. 분할이 합리적인지 확인하세요. 그렇지 않으면 Codex에 조정을 요청할 수 있습니다.

2. 자료 필터링 및 매칭

이 단계가 가장 중요하며 자동화의 가치를 보여줍니다.

전통적으로는 라이브러리를 장면별로 수동으로 검색해야 합니다. 이 워크플로우에서는 라이브러리 위치를 Codex에 알려주기만 하면 시각적 매칭을 수행합니다.

Codex에 대한 프롬프트:

text
1라이브러리에서 자료를 매칭하고 교체해야 합니다.
2
3프로젝트 정보:
4- recipe.json 경로: (이전 단계의 경로)
5- 자료 라이브러리 경로: assets/
6- 출력 경로: work/(사용자 경로)
7
8매칭 요구 사항:
91. recipe.json에서 키프레임 읽기
102. 라이브러리 탐색 및 각 자산의 키프레임 추출
113. 색상, 밝기 및 구성을 기반으로 가장 잘 맞는 자료 추천 (신뢰도 점수 제공)
124. 규칙 적용: 3개의 연속된 장면에 동일한 자료 사용 금지, 명백한 반복 구성 회피
135. fragment_plan.json 및 matches.json 생성
146. 선택한 자료를 material/fragment01/ 등으로 복사 (이동하지 않음)
15
16원칙: 신뢰도가 0.6 미만이면 "자료 없음"으로 표시

Codex는 시각적 특징을 기반으로 유사성을 계산합니다. 점수가 높은 자료가 우선시됩니다.

xilo - inline image

matches.json은 최종 결과를 기록합니다. 핵심 원칙: 관련 없는 자료를 강제로 넣는 것보다 빈칸으로 두는 것이 낫습니다.

3. 음성 해설 생성

매칭 후 음성 해설을 생성합니다. Codex는 OCR/ASR을 사용하므로 먼저 스크립트에 오류가 있는지 확인하세요.

프롬프트:

text
1음성 해설을 생성해야 합니다. 스크립트는 @(your script.txt)입니다.
2
3요구 사항:
41. Doubao TTS API를 호출하여 각 장면에 대한 독립적인 오디오 생성
52. 각 오디오 파일의 실제 재생 시간 읽기
63. 재생 시간이 참조 장면과 다른 경우 차이 기록
74. final_voice.mp3로 병합
85. 실제 재생 시간으로 recipe.json 업데이트

Codex는 오디오를 기반으로 동영상 리듬을 조정합니다. 3초짜리 참조 장면에 음성 해설이 5초 걸리면 최종 동영상 장면은 5초로 연장됩니다.

xilo - inline image

4. 초안 및 CapCut 프로젝트 생성

CapCut 초안을 생성하는 것은 ID와 경로와 관련하여 형식이 엄격하기 때문에 복잡합니다. 프롬프트에 오류를 방지하기 위한 규칙을 포함시켰습니다.

프롬프트:

text
1최종 동영상과 CapCut 초안을 생성해야 합니다.
2
3입력:
4- recipe.json, matches.json, 자료 경로, 음성 해설 파일, 스크립트.
5
6출력:
71. 미리보기 동영상 렌더링: work/remix.mp4
82. 자막 파일: work/captions.srt
93. CapCut 초안: work/jianying_draft/
10
11요구 사항:
12- recipe 및 matches.json에 따라 자료 매칭
13- 음성 해설 재생 시간을 기준으로 사용
14- Content ID, Metadata ID 및 Root Index ID가 일관되고 고유한지 확인
15- 자료에 절대 경로 사용
xilo - inline image

초안이 올바르게 열리는지, 자료가 표시되는지, 자막/오디오가 동기화되는지 확인하세요.

마무리

참조에서 초안까지의 전체 프로세스는 약 20~30분이 소요됩니다. 라이브러리가 준비되어 있으면 동영상당 5분까지 단축될 수 있습니다.

워크플로우가 원활해지면 Codex에 말하세요: 이 워크플로우를 Skill로 캡슐화해 주세요. 다음에는 Skill만 호출하면 됩니다.

도움이 되길 바랍니다. 행운을 빕니다! 🍀

(AGENTS.md 템플릿은 번역의 간결함을 위해 생략되었지만 원본 텍스트에 포함되어 있습니다.)

YouMind에서 다시 만들기

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기