Schau dir zuerst das Video an. Es ist eine einzige, ungeschnittene Einstellung von 2 Minuten und 8 Sekunden.
Das komplette Video zur Kunstreise ansehen (Original-X-Video)
Und hier ist ein Video, das sich deutlich besser für den echten Arbeitsalltag eignet – ebenfalls mit dieser Technik erstellt und es behandelt die 24-jährige Geschichte von SpaceX.
Das komplette SpaceX-Whiteboard-Video ansehen
Ich finde, diese Art von Whiteboard-Animation eignet sich perfekt für ausführliche Erklärvideos und Tutorials auf Bilibili und YouTube: Figuren, Ereignisse und Zusammenhänge werden Schritt für Schritt passend zum Voiceover gezeichnet, sodass die Zuschauer der visuellen Erzählung mühelos folgen können. Probier diesen Ansatz doch mal für Wissensvermittlung, Produktdemos oder um deine Kurse mit Animationen aufzuwerten.
Im ersten Video startet mein Cartoon-Avatar bei den Höhlenmalereien von Lascaux, durchläuft 23 verschiedene Kunststile und landet schließlich wieder an meinem Schreibtisch im Jahr 2026. Jedes Mal, wenn ich in ein Bild eintauche, wechsle ich in dessen Stil und interagiere mit den Elementen darin: Ich springe über den Mistkäfer, der in altägyptischen Wandmalereien die Sonnenscheibe rollt, ducke mich unter der Riesenwelle in Hokusaids Holzschnitt weg, lasse Steine über Monets japanische Brücke hüpfen, schreie zusammen mit Munchs Figur (wobei mir der Hut vom Kopf fliegt) und lasse sogar eine Münze aus einem 8-Bit-Nachthimmel ploppen.
Die Szenen werden per Code gezeichnet, und auch der Soundtrack wird Note für Note per Code synthetisiert (ohne Samples). Abgesehen von meinem Avatar, der mit Codex' ImageGen erstellt wurde (Codex taugt als Assistent für die Bildgenerierung mittlerweile wirklich gerade so), hat Opus 5.5 in Claude Code alles andere übernommen. Vom Erhalt des Referenzvideos bis zum finalen Schnitt hat es weniger als einen Tag gedauert.
Die Methode hinter diesen Animationen habe ich in einem Skill namens huashu-art-motion gebündelt. Nach der Installation sagst du einfach: „Erstelle mir eine 15-sekündige Animation im Stil von Van Goghs ‚Sternennacht‘“ – oder du gibst ihm einen Referenz-Kurzfilm, den es zerlegen, nachbauen oder als Grundlage für Erklär-Animationen passend zu deinem Voiceover nutzen soll.
Der Start mit Fable 5.5
Wenn du in letzter Zeit auf X in der AI-Szene unterwegs warst, hast du sicher eine Reihe von Animationen gesehen, die angeblich mit Fable 5.5 erstellt wurden. Jemand gab nur einen einzigen Prompt ein und bekam einen 3-minütigen Animationskurzfilm mit eigener Musik zurück – über 6.000 Likes. Ein anderer ließ Superman in einer einzigen Einstellung nahtlos durch verschiedene Kunststile reisen und knackte damit 670.000 Aufrufe. Und dann war da noch eine 15-sekündige Kunstgeschichts-Animation mit einer Katze und einer Person beim Teetrinken, bei der die Hintergründe von Höhlenmalereien zu flachen Illustrationen wechselten – ursprünglich gepostet von Tak (@cherry_mx_reds).

Viele im chinesischsprachigen Raum haben tatsächlich einen Retweet dieses Posts gesehen, der überraschend mehr Lesezeichen erhielt als das Original.

Bis heute hat Anthropic Fable 5.5 nicht offiziell veröffentlicht; die neueste offizielle Version bleibt Fable 5.1 vom 1. September. Diese Werke stammen von Nutzern, die nach eigenen Angaben über ein Gray-Scale-Testing an Fable 5.5 weitergeleitet wurden. (Zur Überprüfung nutzt man einen inoffiziellen Test, den sogenannten Tibo-Test: Man fragt das Modell, ob es Tibo aus dem OpenAI-Codex-Team kennt. Antwortet es richtig, geht man von einem neuen Modell mit aktualisiertem Wissen aus.) Die Modellversion selbst wurde offiziell nicht bestätigt.
Auch ich habe dieses Video in Claude Code eingespeist, um es nachzubauen. Doch nachdem ich ein ähnliches Stück fertig hatte, wollte ich vor allem eines behalten: die Methode. Wie zerlegt man Kunststile? Wie bringt man Elemente in der Szene in Bewegung? Und wie lässt sich dieser Prozess für künftige Themen wiederverwenden?
Beim Nachbau fiel mir ein interessantes Detail auf: Das System generierte automatisch eine Bewegungs-Heatmap, um zu erkennen, welche Bereiche im Originalvideo in Bewegung waren. Obwohl jede Epoche nur etwa eine Sekunde dauerte, rollten Wellen, blinkte Text und herrschte ständig innere Dynamik. Diese Zerlegungsmethoden sind später in den Skill eingeflossen.

Die statischen Frames im Text entsprechen den vollständigen Beispielvideos, die du dir über die obigen Originallinks ansehen kannst.
Das Video, das nicht im Nachbau vorkam
In der Nacht nach dem fertigen Nachbau gab ich dem System also ein Thema, das im Original gar nicht existierte:
Nutze meinen Cartoon-Avatar, um durch mindestens 20 verschiedene Stilszenarien zu reisen. Der Avatar muss sich der jeweiligen Szene anpassen und mit bestimmten Objekten darin interagieren – zum Beispiel Monets japanische Brücke überqueren und Steine im Seerosenteich hüpfen lassen.

In diesem Video werden Szenen und Stile per Code gezeichnet. Die Aktionsframes meines Avatars für jeden Stil werden mit gpt-image neu gezeichnet und anschließend per Code positioniert, skaliert und getimt, wobei Pinselstriche des jeweiligen Kunststils auf die Figur gelegt werden.

Auch der Soundtrack folgt dem Kunststil: Knochenflöten und Handtrommeln für die Höhlenszene, Pipa für Dunhuang, Shamisen und Shakuhachi für Ukiyo-e sowie Rechteckwellen für 8-Bit. Alle Klänge werden per Code synthetisiert, und beim Szenenwechsel ändern sich Instrumente und Tonarten.

Der Praxistest im echten Arbeitsalltag
Doch abgesehen davon, Modellfähigkeiten oder mein Geschick im Umgang damit zu demonstrieren, interessiert mich viel mehr, ob sich das Ganze im echten Arbeitsalltag einsetzen lässt.
Deshalb haben wir acht gängige Erklärstile ergänzt, die man auf YouTube findet: Whiteboard, Vox, Kurzgesagt, 3Blue1Brown, Keynote UI, Financial Charts, Storytelling und Dynamic Text. Nutze Financial Charts für Daten, probiere 3b1b für Mathe- und KI-Konzepte, verwende Keynote UI für Interface-Demos in Software-Tutorials und wähle den Stil passend zum erklärten Inhalt.
Neben dem Whiteboard-Intro am Anfang gibt es hier den Vox-Stil, der ebenfalls die 24-jährige Geschichte von SpaceX beleuchtet:
Das komplette SpaceX-Video im Vox-Stil ansehen
Ein anderes Ausdrucksmittel für dasselbe Thema erzeugt eine völlig andere visuelle Wirkung. Du kannst dein Voiceover-Skript übergeben, passende Animationsabschnitte nach Laufzeit generieren lassen und sie in Videos einfügen, an denen du gerade arbeitest. Oder du machst es wie in diesen beiden Beispielen und verwandelst eine komplette Erklärung direkt in eine Animation.
Für mich persönlich wird dieser Teil am häufigsten zum Einsatz kommen. Wenn ich ein langes Video für Bilibili oder YouTube produziere und an einen Punkt komme, der sich rein verbal schwer erklären lässt, kann ich einfach einen separaten Abschnitt einfügen, in dem Grafiken passend zur Erzählung Schritt für Schritt entstehen.
Was in diesem Skill steckt
Neben den acht oben genannten Erklärstilen enthält er Dutzende Kunststil-Karten – von Höhlenmalerei, dem alten Ägypten, Ukiyo-e und Impressionismus bis hin zu Van Gogh, Munch, Dalí, Hopper, Pop Art, Studio Ghibli, Makoto Shinkai und Vaporwave. Jede Karte umfasst Farbpaletten, Pinseltechniken, Animationsmethoden und aktuelle Einschränkungen, damit man beim nächsten Mal gezielt nachbessern kann.

Enthalten sind außerdem Methoden zum Zerlegen von Referenzvideos, zum Generieren und Zusammensetzen von Charakter-Frames sowie zur Synchronisierung von Soundtrack und Bild. Nach Abschluss prüft ein Programm auf Fehler wie statische Frames oder unnatürliche Sprünge, bevor ein unabhängiger Agent den finalen Schnitt auf Schwachstellen untersucht.
Ich verlange immer, dass festgehalten wird, was in der Praxis gut funktioniert hat – inklusive Methoden, Belegen, Gründen und Anwendungsfällen. Wenn du beim nächsten Mal das Thema, den Stil oder sogar das Modell wechselst, fließen diese Erfahrungen direkt mit ein.
So bekommst du diesen Skill
Der Skill ist auf GitHub open-source verfügbar:
https://github.com/alchaincyf/huashu-art-motion
Installation (funktioniert mit jedem Agenten, der Skills unterstützt, z. B. Claude Code, Codex, Cursor):
npx skills add alchaincyf/huashu-art-motion
Für das Rendern der Videos benötigst du uv und ffmpeg auf deinem lokalen Rechner. Installiere vor dem ersten Rendern den Headless-Browser: uv run --with playwright install chromium.





