Codex + Hyperframes: Douyin-Virals dekonstruieren und das Self-Media-Game meistern

@369Serena
CHINESISCHvor 2 Wochen · 04. Juli 2026
508K
2.3K
449
66
4.0K

TL;DR

Ein detaillierter Leitfaden zur Nutzung von KI-Agenten und Video-as-Code-Tools, um virale Douyin-Inhalte zu dekonstruieren und einen wiederverwendbaren, automatisierten Workflow für die Produktion hochwertiger Videos zu erstellen.

Zuvor habe ich versucht, mit Codex und Hyperframes ein virales Video eines buchbezogenen Douyin-Kontos zu dekonstruieren. Die Soundeffekte wurden von allen durchweg gelobt.

Heute schreibe ich einen ausführlichen Artikel, um dir Schritt für Schritt beizubringen, wie du virale Douyin-Videos dekonstruierst und einen Workflow erstellst, damit auch du die Fähigkeit erlangst, Videos mit KI zu erstellen.

https://x.com/369Serena/status/2073012234184282287

1. Vorbereitung

Zuerst muss jeder seine Werkzeuge bereitlegen:

  1. Du benötigst einen Agenten wie Codex.
  1. Gehe dann in den Plugin-Store, um zwei Tools zu installieren:

(a) Hyperframes: Es erstellt Videos im HTML-Format, was sich sehr gut für Unternehmenspräsentationen, Datenanimationen oder Präsentationsvideos eignet.

(b) Remotion: In React geschrieben, ermöglicht es Video-als-Code. Sobald ein Themenstil festgelegt ist, eignet es sich hervorragend für die Massenreplikation durch Codierung. Ich sehe viele Blogger, die Remotion verwenden, um Animationen im Stil von "Xiao Lin Shuo" zu erstellen, was sehr gut mit Sprecherkopf-Videos funktioniert.

Außerdem kannst du einige Skills installieren, die bei der Dekonstruktion helfen. Wenn du die Struktur eines viralen Videos verstehen willst – wie die ersten Sekunden das Publikum fesseln, wie die Soundeffekte sind und der Rhythmus zwischen Erzählung und Bildern – kannst du sie durch die folgenden Skills dekonstruieren und replizieren:

  1. Claude Video: Wird verwendet, um den Videoprozess zu dekonstruieren, um die Replikation im nächsten Schritt zu erleichtern.
  1. Video Use: Ich empfehle dies sehr für Bearbeitungsanfänger. Es fungiert wie ein "Video-Bearbeitungs-Regisseur", der basierend auf deinen Bedürfnissen die geeigneten Tools aufrufen kann. Für Anfänger, die nicht wissen, wann sie welches Tool verwenden sollen, spielt es die Rolle eines Meisterregisseurs.

Damit ist die Vorbereitungsarbeit abgeschlossen.

2. Workflow zur Videoproduktion

Das Erstellen von Videos mit Codex + Hyperframes kann dieser Reihenfolge folgen:

1️⃣ Definiere zuerst die Videospezifikationen

Zum Beispiel: 30 Sekunden, 9:16, Deutsch, wissensbasiert, Buchvorstellung, für X / TikTok / Xiaohongshu.

2️⃣ Schreibe das Erzählskript

Lass Codex zuerst einen 30-sekündigen deutschen Erzähltext schreiben; beeile dich nicht mit den Bildern.

3️⃣ Bestätige den visuellen Stil

Zum Beispiel: dunkler redaktioneller Wissensvideo-Stil, High-End-Wissensstil, dunkler Hintergrund, Buchcover als Hauptbild, leichter Kamerazoomeffekt.

4️⃣ Erstelle Zeitstempel-Storyboards

Teile die Erzählung in 4-6 visuelle Segmente auf, die jeweils einer Kerninformation entsprechen.

5️⃣ Bereite Materialien vor

Buchcover, Titel, Schlüsselwörter, Logo, Hintergrundmusik, Voiceover-Text.

6️⃣ Generiere Voiceover

Du kannst Edge TTS, ElevenLabs oder Hyperframes-medienbezogene Workflows verwenden.

7️⃣ Transkribiere das Voiceover

Verwende das endgültige Audio, um ein Transkript zu erstellen; rate nicht manuell die Untertitel-Zeitpunkte.

8️⃣ Erstelle eine Hyperframes-Komposition

Schreibe index.html mit den korrekten data-start / data-duration / data-track-index.

9️⃣ Erstelle Untertitel

Synchronisiere Untertitel automatisch basierend auf dem Transkript.

🔟 Vorschau

Sieh dir zuerst die Vorschau an; rendere das endgültige Video nicht direkt.

1️⃣1️⃣ Validieren / Inspizieren

Überprüfe auf Fehler, Schriftarten, Layout-Überläufe und Untertitel-Blockaden.

1️⃣2️⃣ MP4 rendern

Rendere erst, nachdem du sichergestellt hast, dass alles korrekt ist.

Dies sind die allgemeinen Schritte. Tatsächlich erfordern viele Teile keinen manuellen Eingriff, daher reicht es, diese allgemeinen Schritte zu verstehen; der manuelle Teil ist tatsächlich recht gering.

3. Anfängliche manuelle Dekonstruktion + Skriptgenerierung

Jetzt müssen wir das Video dekonstruieren.

Zuerst müssen wir Claude Video verwenden, um die Videostruktur zu dekonstruieren. Das von mir dekonstruierte Video war von einem Buchkonto, daher ist seine Struktur sehr einfach: Die ersten Sekunden müssen das Publikum halten, gefolgt von einer Buchvorstellung oder -rezension.

Die nächsten Schritte zur Generierung des Erzählskripts sind wie folgt:

  1. Sammle Informationen: (a) Verwende Codex, um Buchinformationen zu sammeln. (b) Rufe die Verbindung zu den WeChat Reading Skills auf, um häufig markierte Abschnitte und Kommentare zu sehen. (c) Lass Codex nach bekannten Buchrezensionen suchen.
  1. Generiere eine Einleitung: Lass Codex basierend auf den Buchfakten eine Einleitung generieren. Diese Einleitung muss für Selbstmedien-Plattformen den "KI-Geschmack" verlieren. Du kannst sie basierend auf deinen ästhetischen Bedürfnissen anpassen, mit spezifischen Anforderungen, einschließlich: (a) Vermeide typische KI-Ausdrücke wie "Es ist nicht... sondern...". (b) Vermeide Satzstrukturen mit zu viel Parallelismus. (c) Der Ausdruck sollte flüssig und natürlich sein, die Geschichte des Buches schlicht erzählen, anstatt es in einem arroganten Ton vorzustellen.

Dieser Teil erfordert, dass wir basierend auf zwei Punkten operieren:

  1. Basierend auf der zuvor dekonstruierten Videostruktur.
  2. Wir müssen als Gatekeeper fungieren, um zu prüfen, ob der Text machbar ist.

Sobald generiert, kannst du den von Codex gesammelten und organisierten Inhalt in einen Skill umwandeln. Auf diese Weise können die Erzählskripte in Zukunft wiederverwendet werden.

Alles sollte von Codex basierend auf Fakten geschrieben werden. Nach dieser Operation wird es mir ein Erzählskript geben, was die erste gesamte Skripterstellung abschließt.

4. Audio-TTS-Dateiverarbeitung: Erreichen einer natürlichen, magnetischen Stimme

Nachdem die Erzählung fertig ist, ist ein weiterer großer Teil der Arbeit – den ich noch nicht automatisiert habe, indem ich eine Sprachgenerierungs-API angeschlossen habe – die Audioanpassung.

Ich glaube jedoch, dass es machbar ist, daher werde ich aufschreiben, wie man die Stimme anpasst, um sie natürlicher, magnetischer und erzählerischer zu machen.

Ich habe bereits in einem Tweet geteilt, dass ich ElevenLabs verwendet habe, das von Codex empfohlen wurde. Die englischen Stimmen darin sind wirklich perfekt, mit Stimmen aus verschiedenen Ländern.

Aber bei der Verwendung der chinesischen Sprachgenerierung habe ich festgestellt, dass es Chinesisch nicht gut erkennt, was zu vielen Tippfehlern führt. In diesem Fall ist es nicht nur ein Problem des "KI-Geschmacks"; es ist einfach unbrauchbar. Die Lösung, die Codex mir gab, war, zuerst Jianying oder die BytePlus (Volcengine) API zu verwenden.

Da ich die BytePlus-API noch nicht habe, habe ich die Jianying-App auf meinem Computer verwendet.

Meine Methode ist sehr einfach:

  1. Erstelle ein neues Projekt und finde die Textoption.
  2. Verwende die Funktion "Text zu Sprache" und wähle eine Stimme, die mir gefällt.
  3. Füge den Erzähltext direkt ein und klicke auf Generieren.
  4. Exportiere schließlich die Stimme (Jianying kann nur MP4-Dateien exportieren).
  5. Ich füttere diese MP4-Datei an Codex.

Basierend auf Codex' vorheriger Analyse der Stimme bitte ich es, mir zu helfen, den Klang so natürlich, erzählerisch und magnetisch wie das Benchmark-Video zu verarbeiten.

Codex' Prozess zur Klangverarbeitung ist wie folgt:

  1. Automatische Analyse: Codex analysiert zuerst die Klangparameter des Originalvideos und modifiziert meine MP4-Datei entsprechend.
  2. Parametereinstellungen: Ich werde hier einen Screenshot der relevanten Parameter einfügen. Du kannst den Screenshot an Codex senden, und es wird diesen Effekt für dich verarbeiten.
  3. Einfache Methode: Oder verwende eine noch einfachere Methode – gib ihm direkt ein Segment des Benchmark-Videos und sage ihm: "Ich möchte, dass der Klang so verarbeitet wird", und Codex wird es für dich erledigen.
Serena - inline image

Der so verarbeitete Klang ist perfekt. Sobald du diese Fähigkeit zur Klangverarbeitung beherrschst, kannst du sie in anderen Arten der Videoproduktion wiederverwenden, wie zum Beispiel:

(a) Filmerklärungen oder Geschichtenerzählungen

(b) Lebensphilosophie- oder Inspirationsvideos

(c) Wissenschaftskanäle

In diesen Szenarien ist diese Methode der Klangverarbeitung vollständig anwendbar.

Wie ich erwähnte, sollte dieser Teil idealerweise automatisiert werden. In der Selbstmedien-Erstellung vermeide manuelle Arbeit wann immer möglich; in einem solchen "schmerzfreien" Zustand ist es viel einfacher, durchzuhalten. Daher werde ich später versuchen, die BytePlus-API zu verwenden, um Codex automatisch Erzählungen und Sprach-TTS-Dateien generieren zu lassen.

5. Hyperframes für Bilder, Untertitel und Audio-Ausrichtung

Als nächstes kommt die Erstellung der Bilder und die Abstimmung der Stimme mit den Untertiteln. In dieser Phase habe ich überhaupt nicht eingegriffen, weil Codex bereits einen allgemeinen Plan hatte. Ich hatte ihm bereits ein Benchmark-Video gegeben, und jetzt, mit der Erzählung und dem Voiceover, erstellt Codex das Video selbstständig.

Die Version, die nach der Videoerstellung generiert wird, wird beim ersten Mal nicht perfekt sein; es können mehrere Situationen auftreten:

  1. Stimme und Untertitel passen nicht zusammen Du musst mit Codex kommunizieren und es die Ausrichtung vornehmen lassen. Codex extrahiert automatisch Frames, um zu überprüfen, warum sie nicht zusammenpassen; dies erfordert möglicherweise etwa zwei Anpassungen.
  1. Visuelle Probleme Einschließlich visuellem Inhalt, Untertitelpositionierung und den resultierenden Formen. Diese können wiederholt mit Codex kommuniziert werden, wobei es ständig daran erinnert wird, sich näher an das Video zu bewegen, das wir replizieren möchten.

Sobald der gesamte Prozess geglättet ist, können wir Videos mit einem hohen Grad an Replikation generieren. Wenn wir den gesamten Workflow automatisieren können, können wir Konten in Chargen betreiben. Ob es sich um ein Buchkonto oder andere Typen handelt, sie können alle diesem Prozess folgend dekonstruiert und repliziert werden.

6. Zusammenfassung

Abschließend hoffe ich, dass dieser Artikel für alle nützlich ist.

Ich bin auch in einem Zustand des Lernens durch Tun, und ich hoffe, wir können mehr kommunizieren und Ideen austauschen. Oft liegt es nicht daran, dass wir es nicht können, sondern dass wir noch nicht gehandelt haben.

Das Gleiche gilt für die Verwendung von Codex; solange wir anfangen zu handeln und in natürlicher Sprache mit Codex zu chatten, können wir diese Lösungen Schritt für Schritt finden. Ich glaube, dass jeder, sobald er anfängt, es zu tun, KI nutzen kann, um seinen Lebensunterhalt in den Selbstmedien zu verdienen.

Ich hoffe, dass jeder diese KI-Ära nutzen kann – eine Ära, in der gewöhnliche Menschen unendlich nahe an eine hohe Produktivität herankommen können – um Selbstmedien zu betreiben, zu kreieren und Wege zur Replikation zu finden, damit es sogar im Schlaf Wohlstand generieren kann und sich unendlich der Freiheit nähert.

Ich bin Serena, erkunde KI × Web3 × Selbstmedien und zeichne auf, wie gewöhnliche Menschen die Initiative in ihrem Leben zurückgewinnen. Ich hoffe, dieser Artikel hilft dir!

👏

In YouMind remixen

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Für Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mühsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum Entschlüsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken