Qu'est-ce que Hypit ?
Hypit est un projet open source qui permet aux agents IA de créer des vidéos. Vous fournissez à Codex des vidéos de référence, des images de personnages et vos exigences, et l'agent peut utiliser Hypit pour organiser la génération d'assets, le montage, les sous-titres et les effets picture-in-picture, avant d'exporter la vidéo finale.
Il génère également un fichier de projet éditable. Si vous souhaitez modifier les sous-titres ou ajuster le picture-in-picture plus tard, vous pouvez réutiliser les assets générés et continuer à les modifier.
Adresse du code source : hypit-ai/hypit
Commençons par voir le résultat final. À gauche se trouve la vidéo originale de « Chao Ge Shuo Che » (Frère Chao parle voitures), et à droite ma réplique utilisant le personnage « Han Li ».

Cela a été réalisé en utilisant ma propre API Minimax H3. Si vous utilisez l'API officielle ou SeedDance, les résultats seront encore meilleurs.
Ci-dessous, nous partons de l'installation et parcourons l'intégralité du processus étape par étape. La configuration des modèles suit deux chemins : utilisez les services intégrés si vous avez des crédits Hypit, ou connectez votre propre API si ce n'est pas le cas. Cet exemple suit effectivement le chemin de l'API personnelle.
- Clarifier les rôles : Que font respectivement Hypit, Codex et les modèles de génération ?
Nous devons d'abord clarifier les responsabilités spécifiques de chaque outil dans le pipeline pour éviter toute confusion :
- Rôle de Codex : En tant qu'assistant d'exécution de code et d'ingénierie, Codex analyse les demandes naturelles de l'utilisateur, vérifie et configure l'environnement de développement local, lit et décompose la structure du storyboard des vidéos de référence, génère et modifie les fichiers sources du projet, et organise les appels aux moteurs sous-jacents pour compléter les pipelines automatisés.
- Rôle des modèles d'image et de vidéo : Ils sont spécifiquement responsables de la génération d'assets visuels statiques et de scènes dynamiques. Dans cet exemple, le modèle d'image génère la première image d'un homme en costume ancien dans une salle de direct moderne, tandis que le modèle vidéo anime cette première image en une animation de streamer parlant et génère des plans de trafic extérieur basés sur les prompts.
- Rôle du moteur Hypit : En tant que centre d'orchestration central, Hypit enregistre toutes les dépendances des assets générés, définit les séquences de plans et les horloges de transition, contrôle le timing et l'apparition des sous-titres, gère la position, la superposition et les masques arrondis du picture-in-picture, et appelle le renderer sous-jacent pour composer la vidéo finale une fois les assets prêts.
Pour s'adapter aux conditions réelles des différents lecteurs, ce tutoriel divise explicitement la configuration des modèles de génération en deux chemins indépendants :
- Chemin A : Vous disposez de crédits disponibles sur votre compte Hypit et appelez directement les modèles hébergés intégrés via le service officiel HypiHub.
- Chemin B : Vous ne disposez pas de crédits sur la plateforme Hypit et configurez explicitement et connectez vos propres interfaces API tierces.
Vous n'avez besoin de choisir qu'un seul chemin (A ou B) correspondant à votre situation pour compléter la configuration, puis fusionner avec le flux de travail commun de production et d'orchestration.
- Préparation et spécifications des assets
Avant de commencer, préparez Codex, une vidéo de référence claire et une image de référence du personnage cible que vous souhaitez substituer.
Les images de référence de personnages doivent idéalement être des photos de personnes uniques avec des traits faciaux distincts, un éclairage uniforme et des détails clairs sur les vêtements/cheveux. Comme les images de référence ne contiennent aucune information de mouvement, ne supposez pas que le modèle reproduira automatiquement les hausses d'épaules, les gestes de mains, etc., de l'hôte original à partir d'une simple image statique.
Si vous prévoyez de publier le résultat publiquement et ne souhaitez pas utiliser la voix de l'hôte original, enregistrez l'audio des dialogues de remplacement avant la production formelle. Modifier l'audio de la voix off altère les pauses de prononciation et les durées des segments, nécessitant un réalignement des coupes et du timing des sous-titres.
- Installation
Exécutez la commande d'installation globale du Skill officiel :
npx skills add hypit-ai/hypit -g
Consultez le Dépôt Hypit pour les points d'entrée d'installation, et le Manuel de démarrage rapide officiel pour les étapes détaillées du processus.
Chemin A : Avec des crédits Hypit, utilisation des services intégrés
Si vous avez des crédits, vous pouvez laisser Codex utiliser directement les services intégrés d'Hypit sans configurer votre propre API.
Veuillez utiliser les services intégrés d'Hypit pour m'aider à me connecter, vérifier les modèles disponibles et les crédits. Indiquez-moi d'abord la consommation estimée, puis lancez la génération.
Chemin B : Sans crédits Hypit, utilisation de votre propre API
J'ai suivi le chemin de l'API personnelle cette fois-ci : j'ai utilisé Google pour la génération d'images et MiniMax H3 Max de ZenMux pour la génération de vidéos.
J'ai d'abord demandé à Codex de configurer les interfaces, confirmé que les modèles pouvaient être appelés, puis poursuivi la production.
Utilisez l'API Google pour la génération d'images et MiniMax H3 Max de ZenMux pour la vidéo. Aidez-moi à compléter la configuration et à vérifier la disponibilité. Expliquez les coûts d'abord si des tests payants sont requis.

Donner la vidéo originale et l'image de Han Li à Codex
Ensuite, j'ai envoyé ensemble le lien vers la vidéo de « Chao Ge Shuo Che » et l'image de Han Li à Codex, en précisant de ne répliquer que les 20 premières secondes.
Veuillez répliquer les 20 premières secondes de cette vidéo, en remplaçant le personnage par l'image de Han Li que j'ai fournie. Conservez la composition originale, le rythme des coupes, les sous-titres et le picture-in-picture. Gardez l'audio original. Effectuez toutes les opérations au sein du même projet Hypit.
Soyez clair sur la portée de la réplique ; sinon, pour une vidéo originale de plus de 10 minutes, Codex pourrait planifier pour la durée totale.

Vérifier les premières images avant de générer la vidéo
J'ai demandé à Codex de décomposer les plans et de générer quatre premières images : Han Li dans la salle de direct, le trafic urbain au coucher du soleil, une Mercedes blanche dans un tunnel, et le trafic diurne dans la rue.
Cette étape sert principalement à vérifier si le personnage semble correct, si les vêtements sont justes et si les scènes n'ont pas dérivé. Si les premières images ne sont pas satisfaisantes, modifiez-les d'abord avant de continuer à générer la vidéo dynamique.
Veuillez afficher d'abord les premières images des quatre scènes. Conservez le visage de Han Li, ses cheveux longs et ses robes bleu-or. Les plans de voiture ne doivent pas inclure l'hôte original, les sous-titres ou le picture-in-picture ; ceux-ci seront ajoutés uniformément par Hypit plus tard.
[Insérez ici la première image de Han Li dans la salle de direct]
Faire générer les segments par Codex, puis composer avec Hypit
Après avoir confirmé les premières images, j'ai demandé à Codex de générer quatre segments d'hôtes et trois segments de voitures, en demandant 5 secondes chacun, puis j'ai utilisé Hypit pour composer les 20 secondes finales.
Les modèles génèrent les visuels ; Hypit gère les coupes, les sous-titres et le picture-in-picture.
Veuillez générer les assets dynamiques selon les premières images confirmées et le budget, puis composez une vidéo de 20 secondes suivant le rythme original. Lorsque les plans de voiture apparaissent, placez Han Li dans un picture-in-picture centré en bas, avec l'audio original et les sous-titres. Réutilisez directement les assets déjà générés ; ne régénérez pas.

Cette fois, de la vidéo de référence à la version finale de Han Li, mes tâches principales consistaient à donner des exigences à Codex, à examiner les résultats et à lui indiquer ce qui devait être ajusté.
Hypit laisse derrière lui non seulement une vidéo, mais un projet éditable. La prochaine fois que vous voudrez changer les personnages, éditer les sous-titres ou ajuster le picture-in-picture, vous pourrez continuer à partir de ce projet.
Bien sûr, les actions actuelles et la synchronisation labiale n'ont pas encore atteint une réplique 1:1 ; l'utilisation de meilleurs modèles comme la série Seedance améliorerait cela significativement. Si cela vous intéresse, essayez d'abord de trouver une courte vidéo de 10 à 20 secondes pour voir quelles étapes elle vous fait gagner.
Adresse du projet : hypit-ai/hypit. Si vous trouvez cela utile, pensez à mettre une étoile au projet.





