He estado usando este flujo de trabajo de edición durante más de dos meses y he iterado por no menos de 10 versiones. En este artículo, explicaré el proceso completo y los detalles lo más claramente posible para mis amigos.
Puedes seguir la lógica del artículo o enviar directamente este artículo a Codex para que la IA cree un Skill para ti.
¡Hola amigos, aquí estoy para entregar el borrador!
La semana pasada escribí un artículo introductorio sobre Codex, y estoy muy agradecido por el apoyo: alcanzó más de un millón de visitas.
https://x.com/xilo2991/status/2070051136187621452
En ese momento, muchos amigos me preguntaron si podía compartir la edición automatizada que mencionaba en el artículo.
Por supuesto. Hoy estoy aquí para charlar con ustedes sobre cómo lograr la edición automatizada con Codex para maximizar la eficiencia en la creación de videos.
La lógica subyacente del flujo de trabajo
Ya sea que hagas contenido o comercio electrónico, la forma más fácil de obtener tráfico rápidamente es copiar los éxitos virales.
Porque los éxitos virales son contenido ya verificado por el mercado; siempre que los sigas lo suficientemente rápido, el tráfico generalmente no será malo. (Por supuesto, presta atención a la diferencia entre copiar y plagiar).
El núcleo de este flujo de trabajo es copiar los éxitos virales.
Supón que ves un video viral y quieres hacer tu propio video siguiendo ese ritmo y estructura. La forma tradicional es ir manualmente a CapCut (Jianying) y sincronizar fotograma por fotograma con el video de referencia, buscar materiales, temporizarlos y alinear los subtítulos. Un video puede llevarte dos o tres horas.
Pero con este flujo de trabajo, solo necesitas preparar el video de referencia y tu propia biblioteca de materiales; Codex puede completar automáticamente el resto.
Codex identificará automáticamente cada transición de toma en el video de referencia, encontrará el mejor material coincidente de tu biblioteca, generará automáticamente voces en off y subtítulos, y finalmente te dará un borrador de CapCut que puedes abrir y editar.
Todo el proceso podría tomar solo unos minutos.
Principalmente uso este flujo de trabajo cuando hago videos de productos para Douyin.
Antes de Codex, podía editar como máximo 6 videos al día. Pero con Codex, solo necesito encontrar videos virales adecuados como referencia y preparar los materiales del producto. El resto es generación automática, revisión y ajustes.
Puedo terminar fácilmente 30 videos al día, un aumento de eficiencia de al menos cinco veces.

Pero seamos claros: el posicionamiento de este flujo de trabajo es producción automática, no creación de calidad.
Es adecuado para videos de estilo mashup que requieren unir múltiples segmentos, como comercio electrónico, marketing o Vlogs mashup.
El video de referencia proporciona la estructura y el ritmo, tu biblioteca de materiales proporciona las imágenes, las voces en off y los subtítulos se generan automáticamente, y el video final se produce automáticamente.
Si quieres crear contenido original de alta calidad que requiera un lenguaje cinematográfico muy preciso, transiciones complejas y una expresión emocional delicada, este proceso podría no ser adecuado.
Porque la lógica de coincidencia automática actual aún no puede lograr una comprensión semántica y un control emocional tan precisos.
También estoy investigando cómo optimizar este proceso para videos originales y lo compartiré con los amigos una vez que esté estable.
Preparación del flujo de trabajo
Bien, volvamos al flujo de trabajo de edición automatizada. A continuación, explicaré paso a paso cómo construir este flujo de trabajo. Antes de comenzar, necesitas preparar dos cosas.
1. Instalar las herramientas correspondientes
Este flujo de trabajo se basa en Codex, por lo que primero debes tener Codex. Si no lo has usado, consulta mi artículo introductorio de la semana pasada.
Específicamente, este flujo de trabajo requiere estas herramientas principales:
- FFmpeg: Se utiliza para operaciones subyacentes como dividir, fusionar y convertir formatos de video. Es la base y debe instalarse.
- Entorno Python: Como todo el proceso está escrito en Python, necesitas al menos Python 3.8.
- Herramientas de voz en off: Si quieres voces en off automáticas, la más estable es el modelo de voz Doubao de ByteDance; si quieres clonar voces, usa VoxCPM, una herramienta gratuita de código abierto.
- CapCut (Jianying): El borrador final generado está en formato CapCut, por lo que necesitas tener instalada la versión de escritorio.
Entre estas, FFmpeg y Python son dependencias principales.
Puedes copiar el siguiente texto en Codex para que te ayude a verificar el entorno e instalar las herramientas faltantes:
1Por favor, ayúdame a verificar el entorno necesario para la edición automatizada de video:231. Comprueba si FFmpeg está instalado; si no, ayúdame a instalarlo.42. Comprueba si la versión de Python es >= 3.8; si no, ayúdame a instalar o actualizarla.53. Comprueba si CapCut (Jianying) Professional está instalado; si no, dame el enlace de descarga.64. Instala las dependencias de Python: opencv-python, numpy, pillow78Después de verificar, dime qué está listo y qué necesito manejar manualmente.
En cuanto a las voces en off, depende de tus necesidades. Si haces videos de comercio electrónico, el modelo de voz Doubao es el más estable. Utiliza las mismas voces de IA que CapCut. El precio es bajo: generar un video de 1 minuto cuesta aproximadamente 0.4-0.8 RMB.
Si quieres usar tu propia voz o clonar la de alguien más, usa VoxCPM. Encuentra el enlace en GitHub y envíalo a Codex para que lo instale.
2. Crear carpetas
Después de instalar todo esto, necesitas crear una carpeta de proyecto. Normalmente lo organizo así:
1Carpeta del Proyecto/2 assets/ # Tu biblioteca de materiales3 work/ # Área de trabajo, crea una carpeta con fecha para cada edición4 final/ # Productos finales5 AGENTS.md # Archivo de configuración del proyecto
La carpeta assets es tu biblioteca. Coloca allí todos los materiales potencialmente útiles. Pueden ser generados por IA o filmados por ti, pero deben prepararse con anticipación como activos reutilizables.
Los materiales se pueden categorizar por apariencia, función o escena.
La carpeta work es para proyectos activos. Cada vez que hagas un nuevo video, crea una carpeta con fecha, como 2026-07-05, y coloca allí el video de referencia, los archivos intermedios y el borrador final.
AGENTS.md es el archivo de configuración que contiene los objetivos del proyecto, las especificaciones de salida y los criterios de aceptación. Esto es crucial porque Codex lo utiliza para entender tus necesidades.

PD: Mi propio archivo AGENTS es un poco largo, así que lo pongo al final para referencia.
Construcción del flujo de trabajo de edición
1. Deconstruir el video de referencia
El objetivo principal aquí es dividir el video de referencia en tomas independientes y extraer fotogramas clave para cada toma como base para la coincidencia de materiales.
Encuentra un video que quieras usar como referencia. Descárgalo, colócalo en la carpeta work y asígnale un nombre claro.
Luego envía esto a Codex:
1Necesito deconstruir un video de referencia.23Ubicación del video de referencia: @(ingresa tu nombre de archivo)45Por favor, ayúdame con:61. Usar FFmpeg para identificar las transiciones de toma (mediante análisis de diferencia entre fotogramas).72. Extraer fotogramas clave para cada toma y guardarlos como imágenes.83. Extraer la pista de audio por separado.94. Generar un archivo recipe.json que registre el tiempo de inicio, tiempo de finalización, duración y ruta del fotograma clave para cada toma.105. Si hay texto, generar un guion de voz en off basado en el audio, segmentado por toma.1112Después de completar, sigue los requisitos de AGENTS.md, guarda en la carpeta correspondiente y dime cuántas tomas se identificaron.
Este archivo recipe.json es el núcleo de todo el proceso.

Después de la deconstrucción, verás muchos clips de video pequeños y capturas de pantalla. Verifica si la división es razonable. Si no, puedes pedirle a Codex que la ajuste.
2. Filtrar y emparejar materiales
Este paso es el más crítico y demuestra el valor de la automatización.
Tradicionalmente, buscarías en tu biblioteca toma por toma. Con este flujo de trabajo, solo le dices a Codex dónde está tu biblioteca y él realiza la coincidencia visual.
Indicación para Codex:
1Necesito emparejar y reemplazar materiales de la biblioteca.23Información del proyecto:4- Ruta de recipe.json: (ruta del paso anterior)5- Ruta de la biblioteca de materiales: assets/6- Ruta de salida: work/(tu ruta)78Requisitos de emparejamiento:91. Leer los fotogramas clave de recipe.json.102. Recorrer la biblioteca y extraer fotogramas clave para cada activo.113. Recomendar el mejor material coincidente mediante color, brillo y composición (proporcionar puntuaciones de confianza).124. Aplicar reglas: evitar usar el mismo material en 3 tomas consecutivas; evitar composiciones repetitivas obvias.135. Generar fragment_plan.json y matches.json.146. Copiar (no mover) los materiales seleccionados a material/fragment01/, etc.1516Principio: Si la confianza es inferior a 0.6, marcar como "material faltante".
Codex calcula la similitud basándose en características visuales. Los materiales con alta puntuación tienen prioridad.

matches.json registra los resultados finales. Un principio clave: Es mejor dejar un material en blanco que forzar uno irrelevante.
3. Generar la voz en off
Después del emparejamiento, genera la voz en off. Dado que Codex usa OCR/ASR, verifica primero si el guion tiene errores.
Indicación:
1Necesito generar voces en off. El guion es @(tu guion.txt)23Requisitos:41. Llamar a la API de TTS de Doubao para generar audio independiente para cada toma.52. Leer la duración real de cada archivo de audio.63. Si la duración difiere de la toma de referencia, registrar la diferencia.74. Fusionar en final_voice.mp3.85. Actualizar recipe.json con las duraciones reales.
Codex ajustará el ritmo del video según el audio. Si una voz en off dura 5 segundos para una toma de referencia de 3 segundos, la toma final del video se extenderá a 5 segundos.

4. Generar el borrador y el proyecto de CapCut
Generar el borrador de CapCut es complejo porque el formato es estricto en cuanto a IDs y rutas. He incluido reglas en la indicación para evitar errores.
Indicación:
1Necesito generar el video final y el borrador de CapCut.23Entrada:4- recipe.json, matches.json, ruta de materiales, archivo de voz en off, guion.56Salida:71. Renderizar video de vista previa: work/remix.mp482. Archivo de subtítulos: work/captions.srt93. Borrador de CapCut: work/jianying_draft/1011Requisitos:12- Emparejar materiales según recipe.json y matches.json.13- Usar la duración de la voz en off como línea base.14- Asegurar que Content ID, Metadata ID y Root Index ID sean consistentes y únicos.15- Usar rutas absolutas para los materiales.

Verifica si el borrador se abre correctamente, si los materiales aparecen y si los subtítulos/audio están sincronizados.
Palabras finales
Todo el proceso, desde la referencia hasta el borrador, toma aproximadamente 20-30 minutos. Con una biblioteca preparada, puede tomar tan solo 5 minutos por video.
Una vez que el flujo de trabajo esté afinado, dile a Codex: Ayúdame a encapsular este flujo de trabajo en un Skill. La próxima vez, solo llama al Skill.
Espero que esto te ayude. ¡Buena suerte! 🍀
(La plantilla de AGENTS.md se omite por brevedad en esta traducción, pero está incluida en el texto original.)





