Edición de video automatizada con Codex: Guía paso a paso de mi flujo de trabajo en Douyin de más de $7,000

@xilo2991
CHINOhace 2 semanas · 05 jul 2026
1.6M
3.2K
622
83
5.7K

TL;DR

Esta guía detallada explica un flujo de trabajo impulsado por IA que utiliza Codex para automatizar la edición de video para redes sociales, analizando videos de referencia virales y combinándolos con recursos locales.

He estado usando este flujo de trabajo de edición durante más de dos meses y he iterado a través de no menos de 10 versiones. En este artículo, explicaré el proceso completo y los detalles de la manera más clara posible para mis amigos.

Puedes seguir la lógica del artículo o enviar directamente este artículo a Codex para que la IA cree una Skill para ti.

¡Hola amigos, estoy aquí para entregar el borrador!

La semana pasada, escribí un artículo introductorio sobre Codex, y estoy muy agradecido por el apoyo: alcanzó más de un millón de visitas.

https://x.com/xilo2991/status/2070051136187621452

En ese momento, muchos amigos preguntaron si podía compartir la edición automatizada que mencioné en el artículo.

Por supuesto. Hoy, estoy aquí para charlar con ustedes sobre cómo lograr la edición automatizada con Codex para maximizar la eficiencia en la creación de videos.

La Lógica Subyacente del Flujo de Trabajo

Ya sea que estés haciendo contenido o comercio electrónico, la forma más fácil de obtener tráfico rápidamente es copiar los éxitos virales.

Porque los éxitos virales ya son contenido verificado por el mercado, siempre y cuando los sigas lo suficientemente rápido, el tráfico generalmente no será malo. (Por supuesto, presta atención a la diferencia entre copiar y plagiar).

El núcleo de este flujo de trabajo es copiar los éxitos virales.

Supongamos que ves un video viral y quieres hacer tu propio video siguiendo ese ritmo y estructura. La forma tradicional es entrar manualmente en CapCut (Jianying) y hacer coincidir el video de referencia fotograma por fotograma, buscar materiales, sincronizarlos y alinear los subtítulos. Un video podría llevarte dos o tres horas.

Pero con este flujo de trabajo, solo necesitas preparar el video de referencia y tu propia biblioteca de materiales; Codex puede completar automáticamente el resto.

Codex identificará automáticamente cada transición de toma en el video de referencia, encontrará el mejor material de tu biblioteca, generará automáticamente voces en off y subtítulos, y finalmente te dará un borrador de CapCut que puedes abrir y editar.

Todo el proceso podría tomar solo unos minutos.

Principalmente uso este flujo de trabajo cuando hago videos de productos para Douyin.

Antes de Codex, solo podía editar un máximo de 6 videos al día. Pero con Codex, solo necesito encontrar videos virales adecuados como referencia y preparar los materiales del producto. El resto es generación automática, revisión y ajuste fino.

Puedo terminar fácilmente 30 videos al día, un aumento de eficiencia de al menos cinco veces.

xilo - inline image

Pero seamos claros: el posicionamiento de este flujo de trabajo es producción automática, no creación de alta calidad.

Es adecuado para videos de estilo mashup que requieren unir múltiples segmentos, como comercio electrónico, marketing o Vlogs mashup.

El video de referencia proporciona la estructura y el ritmo, tu biblioteca de materiales proporciona las imágenes, las voces en off y los subtítulos se generan automáticamente, y el video final se produce automáticamente.

Si deseas crear contenido original de alta calidad que requiera un lenguaje cinematográfico muy preciso, transiciones complejas y una expresión emocional delicada, este proceso podría no ser adecuado.

Porque la lógica de coincidencia automática actual aún no puede lograr una comprensión semántica y un control emocional tan precisos.

También estoy investigando cómo optimizar este proceso para videos originales y lo compartiré con los amigos una vez que sea estable.

Preparación del Flujo de Trabajo

OK, volvamos al flujo de trabajo de edición automatizada. A continuación, explicaré paso a paso cómo construir este flujo de trabajo. Antes de comenzar, necesitas preparar dos cosas.

1. Instalar las Herramientas Correspondientes

Este flujo de trabajo se basa en Codex, por lo que primero debes tener Codex. Si no lo has usado, consulta mi artículo introductorio de la semana pasada.

Específicamente, este flujo de trabajo requiere estas herramientas principales:

  • FFmpeg: Se utiliza para operaciones subyacentes como división, fusión y conversión de formato de video. Esta es la base y debe estar instalada.
  • Entorno Python: Dado que todo el proceso está escrito en Python, necesitas al menos Python 3.8.
  • Herramientas de Voz en Off: Si deseas voces en off automáticas, la más estable es el modelo de voz Doubao de ByteDance; si deseas clonar voces, usa VoxCPM, una herramienta de código abierto gratuita.
  • CapCut (Jianying): El borrador final generado está en formato CapCut, por lo que necesitas tener instalada la versión de escritorio.

Entre estos, FFmpeg y Python son dependencias principales.

Puedes copiar el siguiente texto a Codex para que te ayude a verificar el entorno e instalar las herramientas faltantes:

text
1Por favor, ayúdame a verificar el entorno necesario para la edición de video automatizada:
2
31. Verifica si FFmpeg está instalado; si no, ayúdame a instalarlo.
42. Verifica si la versión de Python es >= 3.8; si no, ayúdame a instalar o actualizarla.
53. Verifica si CapCut (Jianying) Professional está instalado; si no, dime el enlace de descarga.
64. Instala las dependencias de Python: opencv-python, numpy, pillow
7
8Después de verificar, dime qué está listo y qué necesito manejar manualmente.

En cuanto a las voces en off, depende de tus necesidades. Si estás haciendo videos de comercio electrónico, el modelo de voz Doubao es el más estable. Utiliza las mismas voces de IA que CapCut. El precio es bajo: generar un video de 1 minuto cuesta alrededor de 0.4-0.8 RMB.

Si deseas usar tu propia voz o clonar la de otra persona, usa VoxCPM. Encuentra el enlace en GitHub y envíalo a Codex para instalarlo.

2. Crear Carpetas

Después de instalar esto, necesitas crear una carpeta de proyecto. Normalmente lo organizo así:

text
1Carpeta del Proyecto/
2 assets/ # Tu biblioteca de materiales
3 work/ # Área de trabajo, crea una carpeta con fecha para cada edición
4 final/ # Productos finales
5 AGENTS.md # Archivo de configuración del proyecto

La carpeta assets es tu biblioteca. Pon allí todos los materiales que puedan ser útiles. Estos pueden ser generados por IA o filmados por ti, pero deben prepararse con anticipación como activos reutilizables.

Los materiales se pueden categorizar por apariencia, función o escena.

La carpeta work es para proyectos activos. Cada vez que hagas un nuevo video, crea una carpeta con fecha como 2026-07-05 y coloca allí el video de referencia, los archivos intermedios y el borrador final.

AGENTS.md es el archivo de configuración que contiene los objetivos del proyecto, las especificaciones de salida y los criterios de aceptación. Esto es crucial porque Codex lo usa para entender tus necesidades.

xilo - inline image

PD: Mi propio archivo AGENTS es un poco largo, así que lo pongo al final como referencia.

Construyendo el Flujo de Trabajo de Edición

1. Deconstruir el Video de Referencia

El objetivo principal aquí es dividir el video de referencia en tomas independientes y extraer fotogramas clave para cada toma como base para la coincidencia de materiales.

Encuentra un video que quieras usar como referencia. Descárgalo, colócalo en la carpeta work y asígnale un nombre claro.

Luego, envía esto a Codex:

text
1Necesito deconstruir un video de referencia.
2
3Ubicación del video de referencia: @(ingresa tu nombre de archivo)
4
5Por favor, ayúdame con:
61. Usar FFmpeg para identificar las transiciones de tomas (mediante análisis de diferencia entre fotogramas).
72. Extraer fotogramas clave para cada toma y guardarlos como imágenes.
83. Extraer la pista de audio por separado.
94. Generar un archivo recipe.json que registre la hora de inicio, hora de finalización, duración y ruta del fotograma clave para cada toma.
105. Si hay texto, generar un guión de voz en off basado en el audio, segmentado por toma.
11
12Después de completarlo, sigue los requisitos de AGENTS.md, guarda en la carpeta correspondiente y dime cuántas tomas se identificaron.

Este archivo recipe.json es el núcleo de todo el proceso.

xilo - inline image

Después de la deconstrucción, verás muchos clips de video pequeños y capturas de pantalla. Verifica si la división es razonable. Si no, puedes pedirle a Codex que la ajuste.

2. Filtrar y Coincidir Materiales

Este paso es el más crítico y demuestra el valor de la automatización.

Tradicionalmente, buscarías en tu biblioteca toma por toma. Con este flujo de trabajo, solo le dices a Codex dónde está tu biblioteca y él realiza la coincidencia visual.

Indicación para Codex:

text
1Necesito coincidir y reemplazar materiales de la biblioteca.
2
3Información del proyecto:
4- Ruta de recipe.json: (ruta del paso anterior)
5- Ruta de la biblioteca de materiales: assets/
6- Ruta de salida: work/(tu ruta)
7
8Requisitos de coincidencia:
91. Leer los fotogramas clave de recipe.json.
102. Recorrer la biblioteca y extraer fotogramas clave para cada activo.
113. Recomendar el mejor material coincidente mediante color, brillo y composición (proporcionar puntuaciones de confianza).
124. Aplicar reglas: evitar usar el mismo material durante 3 tomas consecutivas; evitar composiciones repetitivas obvias.
135. Generar fragment_plan.json y matches.json.
146. Copiar (no mover) los materiales seleccionados a material/fragment01/, etc.
15
16Principio: Si la confianza es inferior a 0.6, marcar como "material faltante".

Codex calcula la similitud basándose en características visuales. Los materiales con puntuaciones altas tienen prioridad.

xilo - inline image

matches.json registra los resultados finales. Un principio clave: Es mejor dejar un material en blanco que forzar uno irrelevante.

3. Generar Voz en Off

Después de la coincidencia, genera la voz en off. Dado que Codex usa OCR/ASR, verifica primero si hay errores en el guión.

Indicación:

text
1Necesito generar voces en off. El guión está en @(tu guión.txt)
2
3Requisitos:
41. Llamar a la API de Doubao TTS para generar audio independiente para cada toma.
52. Leer la duración real de cada archivo de audio.
63. Si la duración difiere de la toma de referencia, registrar la diferencia.
74. Fusionar en final_voice.mp3.
85. Actualizar recipe.json con las duraciones reales.

Codex ajustará el ritmo del video basándose en el audio. Si una voz en off dura 5 segundos para una toma de referencia de 3 segundos, la toma del video final se extenderá a 5 segundos.

xilo - inline image

4. Generar Borrador y Proyecto de CapCut

Generar el borrador de CapCut es complejo porque el formato es estricto con respecto a los ID y las rutas. He incluido reglas en la indicación para evitar errores.

Indicación:

text
1Necesito generar el video final y el borrador de CapCut.
2
3Entrada:
4- recipe.json, matches.json, ruta de materiales, archivo de voz en off, guión.
5
6Salida:
71. Renderizar video de vista previa: work/remix.mp4
82. Archivo de subtítulos: work/captions.srt
93. Borrador de CapCut: work/jianying_draft/
10
11Requisitos:
12- Coincidir materiales según recipe y matches.json.
13- Usar la duración de la voz en off como línea base.
14- Asegurar que Content ID, Metadata ID y Root Index ID sean consistentes y únicos.
15- Usar rutas absolutas para los materiales.
xilo - inline image

Verifica si el borrador se abre correctamente, si los materiales aparecen y si los subtítulos/audio están sincronizados.

Palabras Finales

Todo el proceso, desde la referencia hasta el borrador, toma aproximadamente 20-30 minutos. Con una biblioteca preparada, puede tomar tan solo 5 minutos por video.

Una vez que el flujo de trabajo sea fluido, dile a Codex: Ayúdame a encapsular este flujo de trabajo en una Skill. La próxima vez, solo llama a la Skill.

Espero que esto te ayude. ¡Buena suerte! 🍀

(La plantilla de AGENTS.md se omite por brevedad en esta traducción, pero está incluida en el texto original.)

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales