¿Qué es Hypit?
Hypit es un proyecto de código abierto que permite a los Agentes de IA crear vídeos. Proporcionas vídeos de referencia, imágenes de personajes y requisitos a Codex, y el Agente puede usar Hypit para organizar la generación de activos, la edición, los subtítulos y los efectos de imagen en imagen (picture-in-picture), exportando finalmente el vídeo.
También deja detrás un archivo de proyecto editable. Si quieres cambiar los subtítulos o ajustar la imagen en imagen más tarde, puedes reutilizar los activos generados y continuar modificándolos.
Dirección del Código Abierto: hypit-ai/hypit
Primero, echa un vistazo al producto terminado. A la izquierda está el vídeo original de "Chao Ge Shuo Che" (El Hermano Chao Habla de Coches), y a la derecha está mi réplica usando el personaje "Han Li".

Esto se hizo usando mi propia API de Minimax H3. Si usas la API oficial o SeedDance, los resultados serán aún mejores.
A continuación, comenzamos desde la instalación y repasamos toda la operación por completo. La configuración del modelo tiene dos rutas: usa los servicios integrados si tienes créditos de Hypit, o conecta tu propia API si no los tienes. Este ejemplo sigue realmente la ruta de la API propia.
- Aclarar Roles: ¿Qué hacen cada uno Hypit, Codex y los Modelos de Generación?
Necesitamos aclarar primero las responsabilidades específicas de cada herramienta en el flujo de trabajo para evitar confusiones:
- Rol de Codex: Como asistente de ejecución de código e ingeniería, Codex analiza las solicitudes naturales del usuario, verifica y configura el entorno de desarrollo local, lee y desglosa la estructura del guion gráfico (storyboard) de los vídeos de referencia, genera y modifica archivos fuente del proyecto, y organiza las llamadas a los motores subyacentes para completar flujos automatizados.
- Rol de los Modelos de Imagen y Vídeo: Responsables específicamente de generar activos visuales estáticos y escenas dinámicas. En este ejemplo, el modelo de imagen genera el primer fotograma de un hombre con vestimenta antigua en una sala de transmisión moderna, mientras que el modelo de vídeo impulsa ese primer fotograma hacia una animación de streamer hablando y genera tomas de tráfico exterior basadas en prompts.
- Rol del Motor Hypit: Como centro de orquestación principal, Hypit registra todas las dependencias de los activos generados, define secuencias de planos y relojes de transición, controla el tiempo de visualización y la apariencia de los subtítulos, gestiona la posición, el apilamiento y las máscaras de esquinas redondeadas de la imagen en imagen, y llama al renderizador subyacente para componer el vídeo final una vez que los activos están listos.
Para adaptarse a las condiciones reales de diferentes lectores, este tutorial divide explícitamente la configuración del modelo de generación en dos rutas independientes:
- Ruta A: Tienes créditos disponibles en tu cuenta de Hypit y llamas directamente a los modelos alojados integrados a través del servicio oficial HypiHub.
- Ruta B: No tienes créditos de la plataforma Hypit y configuras y conectas explícitamente tus propias interfaces API de terceros.
Solo necesitas elegir una ruta (A o B) que se ajuste a tus condiciones para completar la configuración, y luego fusionarte en el flujo de trabajo común de producción y orquestación.
- Preparación y Especificaciones de Activos
Antes de comenzar, prepara Codex, un vídeo de referencia claro y una imagen de referencia del personaje objetivo que deseas sustituir.
Las imágenes de referencia de personajes deben ser idealmente fotos de una sola persona con rasgos faciales distintivos, iluminación uniforme y detalles claros de ropa/cabello. Dado que las imágenes de referencia no contienen información de movimiento, no asumas que el modelo replicará automáticamente los encogimientos de hombros, gestos con las manos, etc., del presentador original solo a partir de una imagen estática.
Si planeas publicar el resultado públicamente y no quieres usar la voz del presentador original, graba audio de diálogo de reemplazo antes de la producción formal. Cambiar el audio de la voz en off altera las pausas de pronunciación y las duraciones de los segmentos, lo que requiere realinear los cortes y el tiempo de los subtítulos.
- Instalación
Ejecuta el comando de instalación global oficial de Skill:
npx skills add hypit-ai/hypit -g
Consulta el Repositorio de Hypit para los puntos de entrada de instalación, y el Manual Oficial de Inicio Rápido para pasos detallados del proceso.
Ruta A: Con Créditos de Hypit, Usando Servicios Integrados
Si tienes créditos, puedes dejar que Codex use los servicios integrados de Hypit directamente sin configurar tu propia API.
Por favor, usa los servicios integrados de Hypit para ayudarme a iniciar sesión, verificar los modelos disponibles y los créditos. Dime el consumo estimado primero, y luego comienza la generación.
Ruta B: Sin Créditos de Hypit, Usando Tu Propia API
Seguí la ruta de la API propia esta vez: usando Google para la generación de imágenes y MiniMax H3 Max de ZenMux para la generación de vídeo.
Primero hice que Codex configurara las interfaces, confirmé que los modelos podían ser llamados, y luego continué con la producción.
Usa la API de Google para la generación de imágenes y MiniMax H3 Max de ZenMux para el vídeo. Por favor, ayúdame a completar la configuración y verificar la disponibilidad. Explica los costos primero si se requiere prueba pagada.

Dar el Vídeo Original y la Imagen de Han Li a Codex
A continuación, envié el enlace al vídeo de "Chao Ge Shuo Che" y la imagen de Han Li juntos a Codex, especificando replicar solo los primeros 20 segundos.
Por favor, replica los primeros 20 segundos de este vídeo, reemplazando el personaje con la imagen de Han Li que proporcioné. Preserva la composición original, el ritmo de corte, los subtítulos y la imagen en imagen. Mantén el audio original. Completa todas las operaciones dentro del mismo proyecto de Hypit.
Sé claro sobre el alcance de la réplica; de lo contrario, para un vídeo original de más de 10 minutos, Codex podría planificar para la duración completa.

Verificar Primeros Fotogramas Antes de Generar Vídeo
Hice que Codex desglosara los planos y generara cuatro primeros fotogramas: Han Li en la sala de transmisión, tráfico urbano al atardecer, Mercedes blanco en un túnel y tráfico callejero diurno.
Este paso principalmente verifica si el personaje se ve bien, la ropa es correcta y las escenas no han derivado. Si los primeros fotogramas no son satisfactorios, modifícalos primero antes de continuar generando el vídeo dinámico.
Por favor, muestra primero los primeros fotogramas de las cuatro escenas. Preserva la cara, el cabello largo y las túnicas azul-dorado de Han Li. Las tomas de coches no deben incluir al presentador original, subtítulos ni imagen en imagen; estos serán añadidos uniformemente por Hypit más tarde.
[Insertar Aquí el Primer Fotograma de Han Li en la Sala de Transmisión]
Hacer que Codex Genere Segmentos, Luego Componer con Hypit
Después de confirmar los primeros fotogramas, hice que Codex generara cuatro segmentos del presentador y tres segmentos de coches, solicitando 5 segundos cada uno, y luego usé Hypit para componer los 20 segundos finales.
Los modelos generan visuales; Hypit maneja los cortes, subtítulos e imagen en imagen.
Por favor, genera activos dinámicos según los primeros fotogramas confirmados y el presupuesto, luego compone un vídeo de 20 segundos siguiendo el ritmo original. Cuando aparezcan tomas de coches, coloca a Han Li en una imagen en imagen centrada en la parte inferior, con audio y subtítulos originales. Reutiliza directamente los activos ya generados; no los regeneres.

Esta vez, desde el vídeo de referencia hasta el corte final versión Han Li, mis tareas principales fueron dar requisitos a Codex, revisar los resultados y decirle qué necesitaba ajuste.
Hypit deja detrás no solo un vídeo, sino un proyecto editable. La próxima vez que quieras cambiar personajes, editar subtítulos o ajustar la imagen en imagen, puedes continuar desde este proyecto.
Por supuesto, las acciones actuales y la sincronización labial aún no han alcanzado una réplica 1:1; usar mejores modelos como la serie Seedance mejoraría esto significativamente. Si te interesa, intenta encontrar primero un vídeo corto de 10-20 segundos para ver qué pasos te ahorra.
Dirección del Proyecto: hypit-ai/hypit. Si lo encuentras útil, considera darle una estrella al proyecto.





