¿Qué es Hypit?
Hypit es un proyecto de código abierto que permite a los Agentes de IA crear videos. Tú proporcionas videos de referencia, imágenes de personajes y requisitos a Codex, y el Agente puede usar Hypit para organizar la generación de activos, la edición, los subtítulos y los efectos de imagen en imagen (picture-in-picture), exportando finalmente el video.
También deja un archivo de proyecto editable. Si quieres cambiar los subtítulos o ajustar la imagen en imagen más tarde, puedes reutilizar los activos generados y continuar modificándolos.
Dirección del Código Abierto: hypit-ai/hypit
Primero, echa un vistazo al producto terminado. A la izquierda está el video original de "Chao Ge Shuo Che" (El Hermano Chao Habla de Autos), y a la derecha está mi réplica usando el personaje "Han Li".

Esto se hizo usando mi propia API de Minimax H3. Si usas la API oficial o SeedDance, los resultados serán aún mejores.
A continuación, comenzamos desde la instalación y recorremos toda la operación por completo. La configuración del modelo tiene dos rutas: usa servicios integrados si tienes créditos de Hypit, o conecta tu propia API si no los tienes. Este ejemplo sigue realmente la ruta de la API propia.
- Clarificar Roles: ¿Qué manejan respectivamente Hypit, Codex y los Modelos de Generación?
Necesitamos aclarar primero las responsabilidades específicas de cada herramienta en el flujo de trabajo para evitar confusiones:
- Rol de Codex: Como asistente de ejecución de código e ingeniería, Codex analiza solicitudes de usuario en lenguaje natural, verifica y configura el entorno de desarrollo local, lee y desglosa la estructura del guion gráfico (storyboard) de los videos de referencia, genera y modifica archivos fuente del proyecto, y organiza llamadas a motores subyacentes para completar flujos automatizados.
- Rol de los Modelos de Imagen y Video: Responsables específicamente de generar activos visuales estáticos y escenas dinámicas. En este ejemplo, el modelo de imagen genera el primer fotograma de un hombre con vestimenta antigua en una sala de transmisión en vivo moderna, mientras que el modelo de video impulsa ese primer fotograma hacia una animación de streamer hablando y genera tomas de tráfico exterior basadas en prompts.
- Rol del Motor Hypit: Como centro de orquestación principal, Hypit registra todas las dependencias de activos generados, define secuencias de planos y relojes de transición, controla el tiempo de visualización y apariencia de los subtítulos, gestiona la posición, capas y máscaras de esquinas redondeadas de la imagen en imagen, y llama al renderizador subyacente para componer el video final una vez que los activos están listos.
Para adaptarse a las condiciones reales de diferentes lectores, este tutorial divide explícitamente la configuración del modelo de generación en dos rutas independientes:
- Ruta A: Tienes créditos disponibles en tu cuenta de Hypit y llamas directamente a modelos alojados integrados mediante el servicio oficial HypiHub.
- Ruta B: No tienes créditos de la plataforma Hypit y configuras y conectas explícitamente tus propias interfaces de API de terceros.
Solo necesitas elegir una ruta (A o B) que se ajuste a tus condiciones para completar la configuración, luego fusionarte en el flujo de trabajo común de producción y orquestación.
- Preparación y Especificaciones de Activos
Antes de comenzar, prepara Codex, un video de referencia claro y una imagen de referencia del personaje objetivo que deseas sustituir.
Las imágenes de referencia de personajes deben ser idealmente fotos de una sola persona con rasgos faciales distintos, iluminación uniforme y detalles claros de ropa/cabello. Dado que las imágenes de referencia no contienen información de movimiento, no asumas que el modelo replicará automáticamente los encogimientos de hombros, gestos manuales, etc., del presentador original solo a partir de una imagen estática.
Si planeas publicar el resultado públicamente y no quieres usar la voz del presentador original, graba audio de diálogo de reemplazo antes de la producción formal. Cambiar el audio de la voz en off altera las pausas de pronunciación y las duraciones de los segmentos, lo que requiere realinear los cortes y el tiempo de los subtítulos.
- Instalación
Ejecuta el comando global de instalación oficial de Skill:
npx skills add hypit-ai/hypit -g
Consulta el Repositorio de Hypit para puntos de entrada de instalación, y el Manual Oficial de Inicio Rápido para pasos detallados del proceso.
Ruta A: Con Créditos de Hypit, Usando Servicios Integrados
Si tienes créditos, puedes dejar que Codex use los servicios integrados de Hypit directamente sin configurar tu propia API.
Por favor usa los servicios integrados de Hypit para ayudarme a iniciar sesión, verificar modelos disponibles y créditos. Dime el consumo estimado primero, luego comienza la generación.
Ruta B: Sin Créditos de Hypit, Usando Tu Propia API
Seguí la ruta de la API propia esta vez: usando Google para la generación de imágenes y MiniMax H3 Max de ZenMux para la generación de video.
Primero hice que Codex configurara las interfaces, confirmé que los modelos podían ser llamados, y luego continué con la producción.
Usa la API de Google para la generación de imágenes y MiniMax H3 Max de ZenMux para el video. Por favor ayúdame a completar la configuración y verificar la disponibilidad. Explica los costos primero si se requiere prueba pagada.

Dar Video Original e Imagen de Han Li a Codex
Luego, envié el enlace al video de "Chao Ge Shuo Che" y la imagen de Han Li juntos a Codex, especificando replicar solo los primeros 20 segundos.
Por favor replica los primeros 20 segundos de este video, reemplazando el personaje con la imagen de Han Li que proporcioné. Preserva la composición original, ritmo de corte, subtítulos e imagen en imagen. Mantén el audio original. Completa todas las operaciones dentro del mismo proyecto de Hypit.
Sé claro sobre el alcance de la replicación; de lo contrario, para un video original de más de 10 minutos, Codex podría planificar para toda la duración.

Verificar Primeros Fotogramas Antes de Generar Video
Hice que Codex desglosara los planos y generara cuatro primeros fotogramas: Han Li en la sala de transmisión en vivo, tráfico urbano al atardecer, Mercedes blanco en túnel, y tráfico callejero diurno.
Este paso principalmente verifica si el personaje se ve bien, la ropa es correcta y las escenas no han derivado. Si los primeros fotogramas no son satisfactorios, modifícalos primero antes de continuar generando video dinámico.
Por favor muestra los primeros fotogramas de las cuatro escenas primero. Preserva la cara de Han Li, cabello largo y túnicas azul-dorado. Las tomas de autos no deben incluir al presentador original, subtítulos ni imagen en imagen; estos serán añadidos uniformemente por Hypit más tarde.
[Insertar Primer Fotograma de Sala de Transmisión en Vivo de Han Li Aquí]
Hacer que Codex Genere Segmentos, Luego Componer con Hypit
Después de confirmar los primeros fotogramas, hice que Codex generara cuatro segmentos del presentador y tres segmentos de autos, solicitando 5 segundos cada uno, luego usé Hypit para componer los 20 segundos finales.
Los modelos generan visuales; Hypit maneja cortes, subtítulos e imagen en imagen.
Por favor genera activos dinámicos según los primeros fotogramas confirmados y presupuesto, luego compone un video de 20 segundos siguiendo el ritmo original. Cuando aparezcan tomas de autos, coloca a Han Li en una imagen en imagen centrada en la parte inferior, con audio original y subtítulos. Reutiliza directamente los activos ya generados; no regeneres.

Esta vez, desde el video de referencia hasta el corte final versión Han Li, mis tareas principales fueron dar requisitos a Codex, revisar resultados y decirle qué necesitaba ajuste.
Hypit deja atrás no solo un video, sino un proyecto editable. La próxima vez que quieras cambiar personajes, editar subtítulos o ajustar la imagen en imagen, puedes continuar desde este proyecto.
Por supuesto, las acciones actuales y la sincronización labial aún no han alcanzado una replicación 1:1; usar mejores modelos como la serie Seedance mejoraría esto significativamente. Si te interesa, intenta encontrar primero un video corto de 10-20 segundos para ver qué pasos te ahorra.
Dirección del Proyecto: hypit-ai/hypit. Si lo encuentras útil, considera darle estrella al proyecto.





