Schritt-für-Schritt-Anleitung zur Replikation viraler Douyin-Videos mit Codex + Hypit

@Pluvio9yte
CHINESISCH16. Sept. 2026
204K
468
92
29
937

TL;DR

Ein umfassender Leitfaden zur Verwendung der Open-Source-Engine Hypit in Kombination mit Codex zur Replikation viraler Kurzvideos. Er beschreibt im Detail die Einrichtung von KI-Agenten für Asset-Generierung, Bearbeitung und Komposition.

Was ist Hypit?

Hypit ist ein Open-Source-Projekt, das es KI-Agenten ermöglicht, Videos zu erstellen. Du stellst Codex Referenzvideos, Charakterbilder und Anforderungen bereit, und der Agent kann Hypit nutzen, um die Generierung von Assets, den Schnitt, Untertitel und Bild-im-Bild-Effekte zu organisieren und schließlich das Video zu exportieren.

Dabei bleibt auch eine bearbeitbare Projektdatei erhalten. Wenn du später Untertitel ändern oder das Bild-im-Bild anpassen möchtest, kannst du die generierten Assets wiederverwenden und weiter daran arbeiten.

Open-Source-Adresse: hypit-ai/hypit

Schauen wir uns zuerst das Endergebnis an. Links ist das Originalvideo von „Chao Ge Shuo Che" (Bruder Chao redet über Autos), rechts meine Nachbildung mit dem Charakter „Han Li".

雪踏乌云 - inline image

Dies wurde mit meinem eigenen Minimax H3 API erstellt. Wenn du das offizielle API oder SeedDance nutzt, werden die Ergebnisse noch besser sein.

Im Folgenden starten wir bei der Installation und gehen den gesamten Ablauf Schritt für Schritt durch. Die Modellkonfiguration bietet zwei Wege: Nutze die integrierten Dienste, wenn du Hypit-Guthaben hast, oder verbinde dein eigenes API, wenn nicht. Dieses Beispiel folgt tatsächlich dem Pfad des eigenen APIs.

  1. Klärung der Rollen: Was machen Hypit, Codex und die Generierungsmodelle jeweils?

Wir müssen zunächst die spezifischen Zuständigkeiten jedes Tools in der Pipeline klären, um Verwirrung zu vermeiden:

  • Die Rolle von Codex: Als Assistent für Code- und Engineering-Ausführung analysiert Codex natürliche Sprachanfragen des Nutzers, prüft und konfiguriert die lokale Entwicklungsumgebung, liest und zerlegt die Storyboard-Struktur der Referenzvideos, generiert und modifiziert Projektquelldateien und orchestriert Aufrufe an die zugrunde liegenden Engines, um automatisierte Pipelines abzuschließen.
  • Die Rolle der Bild- & Videomodelle: Sie sind speziell für die Generierung statischer visueller Assets und dynamischer Szenen zuständig. In diesem Beispiel generiert das Bildmodell den ersten Frame eines Mannes in historischer Kleidung in einem modernen Livestream-Raum, während das Videomodell diesen ersten Frame in eine sprechende Streamer-Animation verwandelt und externe Verkehrsaufnahmen basierend auf Prompts erzeugt.
  • Die Rolle der Hypit Engine: Als zentrales Orchestrierungszentrum protokolliert Hypit alle Abhängigkeiten der generierten Assets, definiert Shot-Sequenzen und Übergangs-Timings, steuert Anzeigezeitpunkt und Aussehen der Untertitel, verwaltet Position, Ebenen und abgerundete Masken des Bild-im-Bild und ruft den zugrunde liegenden Renderer auf, um das finale Video zusammenzusetzen, sobald die Assets bereit sind.

Um den unterschiedlichen Voraussetzungen der Leser gerecht zu werden, teilt dieses Tutorial die Konfiguration der Generierungsmodelle explizit in zwei unabhängige Pfade auf:

  • Pfad A: Du hast verfügbares Guthaben in deinem Hypit-Konto und rufst direkt die integrierten gehosteten Modelle über den offiziellen HypiHub-Dienst auf.
  • Pfad B: Du hast kein Hypit-Plattformguthaben und konfigurierst sowie verbindest explizit deine eigenen Drittanbieter-API-Schnittstellen.

Du musst nur einen Pfad (A oder B) wählen, der zu deinen Bedingungen passt, die Konfiguration abschließen und dann in den gemeinsamen Produktions- und Orchestrierungsworkflow übergehen.

  1. Vorbereitung und Asset-Spezifikationen

Bevor du beginnst, stelle sicher, dass du Codex, ein klares Referenzvideo und ein Zielcharakter-Referenzbild hast, das du ersetzen möchtest.

Charakter-Referenzbilder sollten idealerweise Einzelpersonenfotos mit deutlichen Gesichtszügen, gleichmäßiger Beleuchtung und klaren Details bei Kleidung/Haaren sein. Da Referenzbilder keine Bewegungsinfos enthalten, gehe nicht davon aus, dass das Modell automatisch die Achselzucken, Handgesten etc. des ursprünglichen Moderators allein aus einem statischen Bild repliziert.

Wenn du planst, das Ergebnis öffentlich zu veröffentlichen und die Stimme des ursprünglichen Moderators nicht verwenden möchtest, nehme Ersatzdialog-Audio vor der eigentlichen Produktion auf. Das Ändern der Voiceover-Audios verändert Aussprachepausen und Segmentdauern, was eine Neuausrichtung der Schnitte und Untertitel-Timings erfordert.

  1. Installation

Führe den offiziellen Skill-Global-Installationsbefehl aus:

npx skills add hypit-ai/hypit -g

Siehe im Hypit Repository nach Installationsdetails und im Offiziellen Quickstart-Handbuch für detaillierte Prozessschritte.

Pfad A: Mit Hypit-Guthaben, Nutzung integrierter Dienste

Wenn du Guthaben hast, kannst du Codex erlauben, die integrierten Dienste von Hypit direkt zu nutzen, ohne dein eigenes API zu konfigurieren.

Bitte nutze die integrierten Dienste von Hypit, um mich einzuloggen, verfügbare Modelle und Guthaben zu prüfen. Nenne mir zuerst die geschätzten Kosten, bevor du mit der Generierung beginnst.

Pfad B: Ohne Hypit-Guthaben, Nutzung deines eigenen APIs

Ich bin diesmal den Weg des eigenen APIs gegangen: Google für die Bildgenerierung und ZenMux's MiniMax H3 Max für die Videogenerierung.

Ich habe Codex zuerst die Schnittstellen konfigurieren lassen, bestätigt, dass die Modelle aufrufbar sind, und dann die Produktion fortgesetzt.

Nutze das Google API für die Bildgenerierung und ZenMux's MiniMax H3 Max für das Video. Bitte hilf mir, die Konfiguration abzuschließen und die Verfügbarkeit zu prüfen. Erkläre die Kosten zuerst, falls kostenpflichtige Tests erforderlich sind.

雪踏乌云 - inline image

Originalvideo und Han Li Bild an Codex geben

Als Nächstes habe ich den Link zum Video von „Chao Ge Shuo Che" und das Han Li Bild gemeinsam an Codex gesendet und spezifiziert, dass nur die ersten 20 Sekunden repliziert werden sollen.

Bitte repliziere die ersten 20 Sekunden dieses Videos und ersetze den Charakter durch das Han Li Bild, das ich bereitgestellt habe. Bewahre die ursprüngliche Komposition, Schnitt-Rhythmus, Untertitel und das Bild-im-Bild. Behalte das Originalaudio bei. Führe alle Operationen innerhalb desselben Hypit Projekts durch.

Sei klar bezüglich des Replikationsumfangs; andernfalls könnte Codex bei einem 10+ Minuten langen Originalvideo für die gesamte Länge planen.

雪踏乌云 - inline image

Erste Frames prüfen, bevor das Video generiert wird

Ich habe Codex gebeten, die Shots zu zerlegen und vier erste Frames zu generieren: Han Li im Livestream-Raum, Sonnenuntergang Stadtverkehr, weißer Mercedes im Tunnel und Tageslicht Straßenverkehr.

Dieser Schritt dient hauptsächlich dazu zu prüfen, ob der Charakter richtig aussieht, die Kleidung korrekt ist und die Szenen nicht abweichen. Wenn die ersten Frames nicht zufriedenstellend sind, modifiziere sie zuerst, bevor du mit der Generierung des dynamischen Videos fortfährst.

Bitte zeige zuerst die ersten Frames der vier Szenen. Bewahre Hans Lis Gesicht, lange Haare und blau-goldene Roben. Autoshots sollten nicht den ursprünglichen Moderator, Untertitel oder das Bild-im-Bild enthalten; diese werden später einheitlich von Hypit hinzugefügt.

[Hier Han Li Livestream Raum Erste Frame einfügen]

Codex Segmente generieren lassen, dann mit Hypit zusammensetzen

Nach Bestätigung der ersten Frames habe ich Codex gebeten, vier Host-Segmente und drei Auto-Segmente zu generieren, jeweils 5 Sekunden lang, und dann Hypit genutzt, um die finalen 20 Sekunden zusammenzusetzen.

Modelle generieren die Visuals; Hypit handhabt Schnitte, Untertitel und das Bild-im-Bild.

Bitte generiere dynamische Assets gemäß den bestätigten ersten Frames und dem Budget, setze dann ein 20-sekündiges Video entsprechend dem ursprünglichen Rhythmus zusammen. Wenn Autoshots erscheinen, platziere Han Li als zentriertes unteres Bild-im-Bild, mit Originalaudio und Untertiteln. Wiederverwende bereits generierte Assets direkt; regeneriere nichts neu.

雪踏乌云 - inline image

Diesmal waren meine Hauptaufgaben vom Referenzvideo bis zur finalen Han Li Version, Anforderungen an Codex zu geben, Ergebnisse zu überprüfen und ihm mitzuteilen, was angepasst werden muss.

Hypit hinterlässt nicht nur ein Video, sondern ein bearbeitbares Projekt. Beim nächsten Mal, wenn du Charaktere ändern, Untertitel bearbeiten oder das Bild-im-Bild anpassen möchtest, kannst du bei diesem Projekt weitermachen.

Natürlich haben aktuelle Aktionen und Lip-Syncing noch keine 1:1-Replikation erreicht; die Verwendung besserer Modelle wie der Seedance-Serie würde dies erheblich verbessern. Wenn du interessiert bist, versuche zuerst, ein kurzes 10-20 Sekunden Video zu finden, um zu sehen, welche Schritte es dir erspart.

Projektadresse: hypit-ai/hypit. Wenn du es nützlich findest, erwäge, das Projekt zu starren.

In YouMind remixen

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Für Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mühsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum Entschlüsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken