이전에 저는 Codex와 Hyperframes를 사용하여 책 관련 Douyin 계정의 바이럴 영상을 분해해 보았고, 사운드 효과가 모두에게 일관된 호평을 받았습니다.
오늘은 장문의 글을 통해 바이럴 Douyin 영상을 분해하고 워크플로우를 수정하는 방법을 단계별로 알려드리려고 합니다. 여러분도 AI를 사용하여 영상을 제작할 수 있는 능력을 갖출 수 있도록 말이죠.
https://x.com/369Serena/status/2073012234184282287
1. 준비
먼저, 모두가 도구를 준비해야 합니다:
- Codex와 같은 에이전트가 필요합니다.
- 그런 다음 플러그인 스토어로 이동하여 두 가지 도구를 설치하세요:
(a) Hyperframes: HTML 형식으로 비디오를 생성하며, 기업 프레젠테이션, 데이터 애니메이션 또는 쇼케이스 비디오에 매우 적합합니다.
(b) Remotion: React로 작성되어 비디오를 코드로 구현합니다. 테마 스타일이 고정되면 코딩을 통한 대량 복제에 매우 적합합니다. 많은 블로거들이 "Xiao Lin Shuo" 스타일의 애니메이션을 만들기 위해 Remotion을 사용하는 것을 보았는데, 토크-헤드 비디오와 잘 어울립니다.
또한, 분해를 돕기 위해 몇 가지 스킬을 설치할 수 있습니다. 바이럴 비디오의 구조(예: 처음 몇 초가 시청자를 어떻게 사로잡는지, 사운드 효과는 어떤지, 내레이션과 비주얼 사이의 리듬)를 이해하려면 다음 스킬을 통해 분해하고 복제할 수 있습니다:
- Claude Video: 비디오 프로세스를 분해하여 다음 단계에서 더 쉽게 복제할 수 있도록 합니다.
- Video Use: 편집 초보자에게 강력 추천합니다. 마치 "비디오 편집 감독"처럼 필요에 따라 적절한 도구를 호출할 수 있습니다. 언제 어떤 도구를 사용해야 할지 모르는 초보자에게는 마스터 감독 역할을 합니다.
준비 작업은 여기까지입니다.
2. 비디오 제작 워크플로우
Codex + Hyperframes로 비디오를 만들 때는 다음 순서를 따를 수 있습니다:
1️⃣ 먼저 비디오 사양을 정의하세요
예: 30초, 9:16, 한국어, 지식 기반, 책 소개, X / TikTok / Xiaohongshu 용.
2️⃣ 내레이션 스크립트를 작성하세요
Codex가 먼저 30초 분량의 한국어 내레이션을 작성하게 하세요. 비주얼은 서두르지 마세요.
3️⃣ 비주얼 스타일을 확정하세요
예: 다크 에디토리얼 지식 비디오, 하이엔드 지식 스타일, 어두운 배경, 책 표지를 메인 비주얼로, 약간의 카메라 줌-인.
4️⃣ 타임스탬프 스토리보드를 만드세요
내레이션을 4-6개의 시각적 세그먼트로 나누고, 각각이 핵심 정보와 연결되도록 하세요.
5️⃣ 자료를 준비하세요
책 표지, 제목, 키워드, 로고, 배경 음악, 음성 해설 텍스트.
6️⃣ 음성 해설을 생성하세요
Edge TTS, ElevenLabs 또는 Hyperframes 미디어 관련 워크플로우를 사용할 수 있습니다.
7️⃣ 음성 해설을 텍스트로 변환하세요
최종 오디오를 사용하여 대본을 생성하세요. 자막 타이밍을 수동으로 추측하지 마세요.
8️⃣ Hyperframes 구성을 만드세요
올바른 data-start / data-duration / data-track-index를 사용하여 index.html을 작성하세요.
9️⃣ 자막을 만드세요
대본을 기반으로 자막을 자동으로 동기화하세요.
🔟 미리보기
먼저 미리보기를 확인하세요. 바로 최종 비디오를 렌더링하지 마세요.
1️⃣1️⃣ 검증 / 검사
오류, 글꼴, 레이아웃 오버플로우, 자막 방해 여부를 확인하세요.
1️⃣2️⃣ MP4 렌더링
모든 것이 올바른지 확인한 후에만 렌더링하세요.
이것이 일반적인 단계입니다. 실제로 많은 부분이 수동 개입을 필요로 하지 않으므로, 이 일반적인 단계만 이해해도 충분하며 수동 부분은 실제로 매우 적습니다.
3. 초기 수동 분해 + 스크립트 생성
이제 비디오를 분해해야 합니다.
먼저 Claude Video를 사용하여 비디오 구조를 분해해야 합니다. 제가 분해한 것은 책 계정이었기 때문에 구조가 매우 간단했습니다. 처음 몇 초는 시청자를 붙잡아야 하고, 그 다음은 책 소개 또는 리뷰가 이어집니다.
내레이션 스크립트 생성을 위한 다음 단계는 다음과 같습니다:
- 정보 수집: (a) Codex를 사용하여 책 정보를 수집합니다. (b) WeChat Reading Skills 연결을 호출하여 자주 강조 표시된 부분과 댓글을 확인합니다. (c) Codex가 유명한 서평을 검색하도록 합니다.
- 소개 생성: Codex가 책 사실을 기반으로 소개를 생성하도록 합니다. 이 소개는 셀프 미디어 플랫폼을 위해 "AI 냄새를 제거"해야 합니다. 필요에 따라 미적 감각에 맞게 조정할 수 있으며, 구체적인 요구 사항은 다음과 같습니다: (a) "그것은 ...이 아니라 ...입니다"와 같은 전형적인 AI 표현을 피하십시오. (b) 지나치게 많은 병렬 구조를 가진 문장 구조를 피하십시오. (c) 표현은 부드럽고 자연스러워야 하며, 책의 이야기를 오만한 어조로 소개하기보다는 평범하게 전달해야 합니다.
이 부분은 두 가지 기준에 따라 운영해야 합니다:
- 이전에 분해된 비디오 구조를 기반으로 합니다.
- 우리는 복사본이 실행 가능한지 검토하는 게이트키퍼 역할을 해야 합니다.
생성되면 Codex가 수집하고 정리한 콘텐츠를 스킬로 전환할 수 있습니다. 이렇게 하면 내레이션 스크립트를 향후에 재사용할 수 있습니다.
모든 것은 Codex가 사실에 기반하여 작성해야 합니다. 이 작업 후에 Codex는 내레이션 스크립트를 제공하여 첫 번째 전체 스크립트 제작을 완료합니다.
4. 오디오 TTS 파일 처리: 자연스럽고 매력적인 음성 구현
내레이션이 준비된 후, 또 다른 주요 작업 부분은 음성 조정입니다. 아직 음성 생성 API를 연결하여 자동화하지는 못했습니다.
하지만 가능하다고 생각하므로, 음성을 더 자연스럽고, 매력적이며, 스토리텔링에 적합하게 조정하는 방법을 작성하겠습니다.
이전에 트윗에서 Codex가 추천한 ElevenLabs를 사용했다고 공유했습니다. 그 안의 영어 음성은 정말 완벽하며, 다양한 국가의 음성을 사용할 수 있습니다.
그러나 중국어 음성 생성 시 중국어를 잘 인식하지 못하여 많은 오타가 발생하는 문제가 있습니다. 이 경우 단순한 "AI 냄새" 문제가 아니라 사용할 수 없는 수준입니다. Codex가 제시한 해결책은 먼저 Jianying 또는 BytePlus (Volcengine) API를 사용하는 것이었습니다.
아직 BytePlus API가 없으므로 컴퓨터에서 Jianying 앱을 사용했습니다.
제 방법은 매우 간단합니다:
- 새 프로젝트를 만들고 텍스트 옵션을 찾습니다.
- "텍스트 음성 변환" 기능을 사용하고 마음에 드는 음성을 선택합니다.
- 내레이션 복사본을 직접 붙여넣고 생성 버튼을 클릭합니다.
- 마지막으로 음성을 내보냅니다 (Jianying은 MP4 파일만 내보낼 수 있습니다).
- 이 MP4 파일을 Codex에 제공합니다.
Codex의 이전 음성 분석을 기반으로, 벤치마크 비디오만큼 자연스럽고, 스토리텔링적이며, 매력적인 사운드를 처리하도록 요청합니다.
Codex의 사운드 처리 프로세스는 다음과 같습니다:
- 자동 분석: Codex는 먼저 원본 비디오의 사운드 매개변수를 분석하고 내 MP4 파일을 그에 따라 수정합니다.
- 매개변수 설정: 관련 매개변수의 스크린샷을 여기에 넣겠습니다. 스크린샷을 Codex에 보내면 해당 효과를 처리해 줄 것입니다.
- 간단한 방법: 또는 더 간단한 방법을 사용하세요. 벤치마크 비디오의 일부를 직접 제공하고 "이런 식으로 사운드를 처리해 줘"라고 말하면 Codex가 처리해 줄 것입니다.

이렇게 처리된 사운드는 완벽합니다. 이 사운드 처리 기능을 마스터하면 다른 유형의 비디오 제작에도 재사용할 수 있습니다. 예를 들어:
(a) 영화 해설 또는 스토리 내레이션
(b) 인생 철학 또는 영감을 주는 비디오
(c) 과학 대중화 계정
이러한 시나리오에서 이 사운드 처리 방법은 완전히 적용 가능합니다.
앞서 말씀드린 것처럼, 이 부분은 이상적으로 자동화되어야 합니다. 셀프 미디어 제작에서는 가능한 한 수동 작업을 피해야 합니다. 이러한 "고통 없는" 상태에서 지속하기가 훨씬 쉽습니다. 그래서 나중에 BytePlus API를 사용하여 Codex가 내레이션과 음성 TTS 파일을 자동으로 생성하도록 시도할 것입니다.
5. Hyperframes를 사용한 비주얼, 자막 및 오디오 정렬
다음은 비주얼을 만들고 음성을 자막과 일치시키는 것입니다. 이 단계에서는 Codex가 이미 일반적인 계획을 가지고 있었기 때문에 전혀 간섭하지 않았습니다. 이미 벤치마크 비디오를 제공했고, 이제 내레이션과 음성 해설이 있으므로 Codex가 자체적으로 비디오를 생성합니다.
비디오 생성 후 생성된 버전은 처음에 완벽하지 않을 것입니다. 몇 가지 상황이 발생할 수 있습니다:
- 음성과 자막이 일치하지 않음 Codex와 소통하고 정렬하도록 해야 합니다. Codex는 자동으로 프레임을 추출하여 일치하지 않는 이유를 확인합니다. 이는 약 두 번의 조정이 필요할 수 있습니다.
- 비주얼 문제 비주얼 콘텐츠, 자막 위치 및 결과 형태를 포함합니다. Codex와 반복적으로 소통하고, 복제하려는 비디오에 더 가깝게 이동하도록 지속적으로 상기시킬 수 있습니다.
전체 프로세스가 원활해지면 높은 수준의 복제로 비디오를 생성할 수 있습니다. 전체 워크플로우를 자동화할 수 있다면 계정을 일괄적으로 운영할 수 있습니다. 책 계정이든 다른 유형이든 이 프로세스를 따라 분해하고 복제할 수 있습니다.
6. 요약
마지막으로, 이 글이 모든 사람에게 도움이 되기를 바랍니다.
저도 배우면서 하는 중이며, 더 많은 소통과 교류가 있기를 바랍니다. 종종 우리가 할 수 없는 것이 아니라 아직 행동을 시작하지 않은 것뿐입니다.
Codex 사용도 마찬가지입니다. 행동을 시작하고 Codex와 자연어로 대화하기만 하면 이러한 솔루션을 단계별로 찾을 수 있습니다. 모든 사람이 시작하기만 하면 누구나 AI를 사용하여 셀프 미디어로 생계를 유지할 수 있다고 믿습니다.
모든 분들이 이 AI 시대, 즉 일반인이 고생산성에 무한히 접근할 수 있는 이 시대를 활용하여 셀프 미디어를 하고, 창작하고, 심지어 잠을 자는 동안에도 부를 창출할 수 있는 복제 방법을 찾아 자유에 무한히 가까워지길 바랍니다.
저는 Serena입니다. AI × Web3 × 셀프 미디어를 탐구하며, 일반인이 삶의 주도권을 되찾는 방법을 기록합니다. 이 글이 여러분께 도움이 되길 바랍니다!
👏





