सबसे पहले, वीडियो देखिए। यह 2 मिनट 08 सेकंड का एक लगातार शॉट है।
पूरी आर्ट जर्नी वीडियो देखें (मूल X वीडियो)
इसके बाद, यहाँ एक और वीडियो है जो असल काम के लिए ज्यादा उपयुक्त है। इसे भी इसी स्किल से बनाया गया है और इसमें SpaceX के 24 सालों को कवर किया गया है।
SpaceX का पूरा व्हाइटबोर्ड वर्ज़न वीडियो देखें
मुझे लगता है कि इस तरह का व्हाइटबोर्ड एनिमेशन Bilibili और YouTube पर लंबे एक्सप्लेनेशन और ट्यूटोरियल्स के लिए खास तौर पर सही रहता है: वॉइसओवर के साथ-साथ कैरेक्टर्स, घटनाओं और उनके रिश्तों को स्टेप-बाय-स्टेप ड्रॉ करने से दर्शक विजुअल स्टोरी को आसानी से फॉलो कर पाते हैं। आप नॉलेज शेयरिंग, प्रोडक्ट डेमो या अपने कोर्सेस में एनिमेशन जोड़ने के लिए इस तरीके को आजमा सकते हैं।
शुरुआती वीडियो में मेरा कार्टून अवतार Lascaux गुफा चित्रों से शुरू होता है, 23 अलग-अलग आर्ट स्टाइल्स से गुजरता है और आखिर में 2026 में वापस मेरी डेस्क पर आ जाता है। हर बार जब मैं किसी पेंटिंग में दाखिल होता हूँ, तो उसी पेंटिंग के स्टाइल में बदल जाता हूँ और उसके अंदर मौजूद चीजों के साथ इंटरैक्ट करता हूँ: प्राचीन मिस्र की दीवारों पर बनी पेंटिंग्स में सूरज को धकेलते स्कारैब बीटल के ऊपर से छलांग लगाना, Hokusai के प्रिंट में विशाल लहर के नीचे से निकलना, Monet के जापानी पुल पर पत्थर उछालना, Munch के कैरेक्टर के साथ चीखना (मेरी टोपी उड़ जाती है), और यहाँ तक कि 8-bit वाले रात के आसमान में एक सिक्का बाहर निकालना।
ये सीन्स कोड से ड्रॉ किए गए हैं, और साउंडट्रैक भी कोड द्वारा नोट-दर-नोट सिंथेसाइज़ किया गया है (कोई सैंपल इस्तेमाल नहीं हुआ)। मेरे अवतार को छोड़कर, जिसे Codex के ImageGen से जनरेट किया गया था (इमेज जनरेशन के लिए अभी Codex बस एक असिस्टेंट के तौर पर ही काफी अच्छा है), बाकी सब कुछ Claude Code में Opus 5.5 ने किया है। रेफरेंस वीडियो मिलने से लेकर इस फाइनल कट तक, एक दिन से भी कम समय लगा।
मैंने इन एनिमेशन्स को बनाने के तरीके को huashu-art-motion नाम की एक स्किल में समेट दिया है। इसे इंस्टॉल करने के बाद, आप सीधे कह सकते हैं, "Van Gogh के 'Starry Night' स्टाइल में मेरे लिए 15 सेकंड का एनिमेशन बनाओ," या फिर इसे कोई रेफरेंस शॉर्ट फिल्म देकर उसे डिकंस्ट्रक्ट करने, कॉपी करने या अपने वॉइसओवर के आधार पर एक्सप्लेनेटरी एनिमेशन बनाने के लिए कह सकते हैं।
Fable 5.5 से शुरुआत
अगर आप हाल ही में X पर AI कम्युनिटी को स्क्रॉल कर रहे थे, तो आपने Fable 5.5 से बनाए जाने का दावा करने वाले कई एनिमेशन्स जरूर देखे होंगे। एक व्यक्ति ने सिर्फ एक प्रॉम्प्ट दिया और उसे ओरिजिनल म्यूजिक के साथ 3 मिनट की एनिमेटेड शॉर्ट फिल्म मिल गई, जिसने 6,000 से ज्यादा लाइक्स बटोरे; दूसरे ने Superman को एक ही शॉट में लगातार अलग-अलग आर्ट स्टाइल्स से गुजारते हुए दिखाया, जिसे 670,000 व्यूज मिले; और एक 15 सेकंड का आर्ट हिस्ट्री एनिमेशन था जिसमें एक बिल्ली और एक इंसान चाय पी रहे थे, बैकग्राउंड गुफा चित्रों से बदलकर फ्लैट इलस्ट्रेशन्स में तब्दील हो रहा था, जिसे असल में Tak (@cherry_mx_reds) ने पोस्ट किया था।

चीनी भाषी कम्युनिटी में बहुत से लोगों ने असल में इस पोस्ट का रीट्वीट देखा, जिसमें हैरानी की बात यह थी कि इसके बुकमार्क्स ओरिजिनल पोस्ट से भी ज्यादा थे।

आज की तारीख तक, Anthropic ने आधिकारिक तौर पर Fable 5.5 रिलीज़ नहीं किया है; लेटेस्ट ऑफिशियल वर्ज़न अभी भी Fable 5.1 है, जो 1 सितंबर को रिलीज़ हुआ था। ये काम उन यूजर्स के हैं जो दावा करते हैं कि उन्हें ग्रे-स्केल टेस्टिंग के जरिए Fable 5.5 पर राउट किया गया था (इसे पहचानने का तरीका एक लोकप्रिय टेस्ट है जिसे Tibo टेस्ट कहा जाता है: मॉडल से पूछना कि क्या वह OpenAI Codex टीम के Tibo को जानता है; अगर वह सही जवाब देता है, तो मान लिया जाता है कि यह अपडेटेड नॉलेज वाला नया मॉडल है)। मॉडल वर्ज़न की आधिकारिक पुष्टि अभी नहीं हुई है।
मैंने भी उस वीडियो को कॉपी करने के लिए Claude Code में डाला। लेकिन ऐसा ही एक वीडियो बनाने के बाद, मैं जिस चीज को ज्यादा संभाल कर रखना चाहता था वह था उसका तरीका: आर्ट स्टाइल्स को कैसे डिकंस्ट्रक्ट करें, सीन में मौजूद चीजों को कैसे मूव कराएं, और भविष्य के टॉपिक्स के लिए इस प्रोसेस को दोबारा कैसे इस्तेमाल करें।
कॉपी करने के दौरान एक दिलचस्प बात सामने आई: इसने अपने आप एक मोशन हीटमैप जनरेट कर लिया ताकि पहचान सके कि ओरिजिनल वीडियो में कौन से हिस्से हिल रहे थे। हालांकि हर दौर सिर्फ 1 सेकंड के आसपास रहा, लेकिन लहरें चल रही थीं, टेक्स्ट फ्लैश हो रहा था, और अंदर लगातार हलचल थी। बाद में, डिकंस्ट्रक्शन के ये तरीके स्किल में शामिल कर लिए गए।

टेक्स्ट में दिए गए स्थिर फ्रेम्स पूरी सैंपल वीडियोज से मेल खाते हैं, जिन्हें ऊपर दिए गए ओरिजिनल लिंक्स से देखा जा सकता है।
वह वीडियो जो कॉपी में नहीं था
तो, कॉपी खत्म करने वाली रात, मैंने इसे एक ऐसा टॉपिक दिया जो ओरिजिनल में मौजूद ही नहीं था:
मेरे कार्टून अवतार का इस्तेमाल करके कम से कम 20 अलग-अलग स्टाइल वाले सीन्स से गुजरें। अवतार को सीन के साथ बदलना चाहिए और उसके अंदर मौजूद खास चीजों के साथ इंटरैक्ट करना चाहिए, जैसे Monet के जापानी पुल से गुजरना और वॉटर लिली तालाब में पत्थर उछालना।

इस वीडियो में, सीन्स और स्टाइल्स कोड से ड्रॉ किए गए हैं। हर स्टाइल के लिए मेरे अवतार के एक्शन फ्रेम्स gpt-image का इस्तेमाल करके दोबारा ड्रॉ किए गए, फिर कोड के जरिए उनकी पोजीशन, साइज और टाइमिंग सेट की गई, और कैरेक्टर पर हर आर्ट स्टाइल से मेल खाते ब्रशस्ट्रोक्स चढ़ाए गए।

साउंडट्रैक भी आर्ट स्टाइल के हिसाब से है: गुफा वाले हिस्से के लिए हड्डी की बांसुरी और हाथ के ढोल, Dunhuang के लिए पिपा, Ukiyo-e के लिए शामिसेन और शाकुहाची, और 8-bit के लिए स्क्वेयर वेव्स। सभी आवाजें कोड द्वारा सिंथेसाइज़ की गई हैं, और सीन बदलने पर इंस्ट्रूमेंट्स और मोड्स भी बदल जाते हैं।

असल काम में इसे आजमाना
हालांकि, मॉडल की क्षमताओं या उन्हें इस्तेमाल करने की अपनी काबिलियत दिखाने से ज्यादा, मुझे इस बात की फिक्र है कि क्या इसे असल काम में लागू किया जा सकता है।
इसलिए हमने YouTube पर मिलने वाले 8 आम एक्सप्लेनेशन स्टाइल्स जोड़े, जिनमें Whiteboard, Vox, Kurzgesagt, 3Blue1Brown, Keynote UI, Financial Charts, Storytelling और Dynamic Text शामिल हैं। डेटा के लिए Financial Charts इस्तेमाल करें, मैथ और AI कॉन्सेप्ट्स के लिए 3b1b आजमाएं, सॉफ्टवेयर ट्यूटोरियल्स में इंटरफेस ऑपरेशन्स के लिए Keynote UI का इस्तेमाल करें, और जो समझाया जा रहा है उसके आधार पर स्टाइल चुनें।
शुरुआती व्हाइटबोर्ड के अलावा, यहाँ Vox स्टाइल है, जिसमें भी SpaceX के 24 सालों को कवर किया गया है:
SpaceX का पूरा Vox वर्ज़न वीडियो देखें
एक ही टॉपिक के लिए एक्सप्रेशन बदलने से विजुअल फील बिल्कुल अलग हो जाता है। आप अपनी वॉइसओवर स्क्रिप्ट दे सकते हैं, समय के हिसाब से एनिमेशन के हिस्से जनरेट कर सकते हैं, और उन्हें अपने एडिट किए जा रहे वीडियोज में डाल सकते हैं; या फिर इन दोनों उदाहरणों की तरह, किसी पूरे एक्सप्लेनेशन को एनिमेशन में बदल सकते हैं।
मेरे लिए, इस हिस्से का इस्तेमाल ज्यादा होगा। जब मैं Bilibili या YouTube के लिए कोई लंबा वीडियो बना रहा होता हूँ और कोई ऐसी बात आती है जिसे सिर्फ बोलकर समझाना मुश्किल होता है, तो मैं एक अलग हिस्सा जोड़ सकता हूँ जहाँ नरेशन के साथ ग्राफिक्स स्टेप-बाय-स्टेप खुलते जाएं।
इस स्किल के अंदर क्या है
ऊपर बताए गए 8 एक्सप्लेनेशन स्टाइल्स के अलावा, इसमें दर्जनों आर्ट स्टाइल कार्ड्स शामिल हैं, जो गुफा चित्रों, प्राचीन मिस्र, Ukiyo-e, इम्प्रेशनिज्म से लेकर Van Gogh, Munch, Dali, Hopper, Pop Art, Studio Ghibli, Makoto Shinkai और Vaporwave तक फैले हुए हैं। हर कार्ड में कलर पैलेट्स, ब्रशस्ट्रोक तकनीकें, एनिमेशन के तरीके और मौजूदा सीमाएं दी गई हैं, ताकि अगली बार इसमें सुधार किया जा सके।

रेफरेंस वीडियोज को डिकंस्ट्रक्ट करने, कैरेक्टर फ्रेम्स जनरेट और कंपोज़िट करने, और साउंडट्रैक को विजुअल्स के साथ सिंक करने के तरीके भी इसमें शामिल हैं। काम पूरा होने के बाद, एक प्रोग्राम स्थिर फ्रेम्स या अजीब झटकों जैसी समस्याओं की जांच करता है, और फिर एक स्वतंत्र एजेंट फाइनल कट का रिव्यू करके कमियां ढूंढता है।
मैं हमेशा यह मांग करता हूँ कि वह प्रैक्टिस में जो सही हुआ उसे रिकॉर्ड करे, जिसमें तरीके, सबूत, कारण और उन्हें कब लागू करना है, सब शामिल हो। अगली बार जब आप टॉपिक, स्टाइल या यहाँ तक कि मॉडल बदलेंगे, तो ये अनुभव आपके काम आएंगे।
यह स्किल प्राप्त करें
यह स्किल GitHub पर ओपन-सोर्स है:
https://github.com/alchaincyf/huashu-art-motion
इंस्टॉलेशन (स्किल्स सपोर्ट करने वाले किसी भी एजेंट के साथ काम करता है, जैसे Claude Code, Codex, Cursor):
npx skills add alchaincyf/huashu-art-motion
वीडियोज रेंडर करने के लिए आपके लोकल मशीन पर uv और ffmpeg होना जरूरी है। पहली बार रेंडर करने से पहले हेडलेस ब्राउज़र इंस्टॉल करें: uv run --with playwright install chromium





