YouMind
ลงชื่อเข้าใช้

เปิดตัว huashu-art-motion: ทักษะ AI แอนิเมชันที่สวยที่สุด?

376K
1.4K
212
37
3.0K

TL;DR

Huashu เปิดตัว huashu-art-motion ซึ่งเป็นทักษะ AI แบบโอเพนซอร์สที่ช่วยให้ผู้ใช้สามารถสร้างวิดีโออธิบายแบบแอนิเมชันคุณภาพสูงและลำดับภาพศิลปะโดยใช้คำสั่งภาษาธรรมชาติและสื่ออ้างอิง

ก่อนอื่น ลองดูวิดีโอนี้ก่อน เป็นช็อตยาวต่อเนื่องความยาว 2 นาที 08 วินาที

ชมวิดีโอการเดินทางผ่านงานศิลปะฉบับเต็ม (วิดีโอต้นฉบับบน X)

ถัดมา นี่คือวิดีโอที่เหมาะกับงานจริงมากกว่า ซึ่งสร้างด้วยเทคนิคเดียวกัน โดยเล่าเรื่องราว 24 ปีของ SpaceX

ชมวิดีโอเวอร์ชันไวท์บอร์ดของ SpaceX ฉบับเต็ม

ผมคิดว่าแอนิเมชันสไตล์ไวท์บอร์ดแบบนี้เหมาะมากกับการทำคลิปอธิบายเรื่องยาวๆ และคลิปสอนการใช้งานบน Bilibili กับ YouTube เพราะการค่อยๆ วาดตัวละคร เหตุการณ์ และความเชื่อมโยงต่างๆ ไปพร้อมกับเสียงบรรยาย จะช่วยให้คนดูตามเรื่องราวที่ถ่ายทอดผ่านภาพได้ทัน คุณสามารถลองนำแนวทางนี้ไปใช้กับการเผยแพร่ความรู้ สาธิตผลิตภัณฑ์ หรือเพิ่มแอนิเมชันลงในคอร์สเรียนได้เลย

วิดีโอเปิดหัวคืออวาตาร์การ์ตูนของผมที่เริ่มต้นจากภาพเขียนในถ้ำลาสโกซ์ ผ่านสไตล์ศิลปะที่แตกต่างกันถึง 23 แบบ ก่อนจะกลับมาที่โต๊ะทำงานของผมในปี 2026 ทุกครั้งที่ผมเข้าไปในภาพวาด ผมจะเปลี่ยนเป็นสไตล์ของภาพนั้นและโต้ตอบกับองค์ประกอบข้างใน เช่น กระโดดข้ามแมลงสคารับที่กำลังกลิ้งดวงอาทิตย์ในจิตรกรรมฝาผนังอียิปต์โบราณ มุดใต้คลื่นยักษ์ในภาพพิมพ์ของโฮคุไซ เล่นกระโดดหินบนสะพานญี่ปุ่นของโมเนต์ กรีดร้องไปพร้อมกับตัวละครของมุงค์ (จนหมวกปลิวหลุด) หรือแม้แต่ดีดเหรียญออกมาในท้องฟ้ายามค่ำคืนสไตล์ 8-bit

ฉากทั้งหมดถูกวาดด้วยโค้ด และซาวด์แทร็กก็ถูกสังเคราะห์ขึ้นมาทีละโน้ตด้วยโค้ดเช่นกัน (ไม่ได้ใช้ไฟล์เสียงสำเร็จรูปเลย) ยกเว้นอวาตาร์ของผมที่สร้างด้วย ImageGen ของ Codex (ตอนนี้ Codex ทำหน้าที่เป็นผู้ช่วยสร้างภาพได้ดีในระดับที่พอใช้ได้จริงๆ) ส่วนที่เหลือ Opus 5.5 ใน Claude Code จัดการให้หมด ตั้งแต่ได้รับวิดีโออ้างอิงจนถึงขั้นตอนตัดต่อสุดท้าย ใช้เวลาไม่ถึงวัน

ผมได้กลั่นวิธีสร้างแอนิเมชันเหล่านี้ออกมาเป็น skill ที่ชื่อว่า huashu-art-motion เมื่อติดตั้งแล้ว คุณแค่สั่งตรงๆ ว่า "สร้างแอนิเมชันความยาว 15 วินาทีในสไตล์ 'Starry Night' ของแวนโก๊ะให้หน่อย" หรือจะให้วิดีโอสั้นอ้างอิงเพื่อถอดโครงสร้าง ลอกเลียนแบบ หรือสร้างแอนิเมชันอธิบายเนื้อหาตามเสียงบรรยายของคุณก็ได้

เริ่มต้นด้วย Fable 5.5

ถ้าช่วงนี้คุณไถฟีดวงการ AI บน X บ่อยๆ น่าจะเคยเห็นแอนิเมชันชุดหนึ่งที่อ้างว่าสร้างโดย Fable 5.5 บางคนใส่ prompt แค่คำสั่งเดียว ก็ได้แอนิเมชันสั้นความยาว 3 นาทีพร้อมดนตรีประกอบออริจินัลกลับมากวาดไลก์กว่า 6,000 ครั้ง อีกคนทำซูเปอร์แมนเดินทางผ่านสไตล์ศิลปะต่างๆ อย่างต่อเนื่องในช็อตเดียว ยอดวิวพุ่งไปถึง 670,000 ครั้ง และมีแอนิเมชันประวัติศาสตร์ศิลป์ความยาว 15 วินาทีที่มีแมวกับคนกำลังดื่มชา โดยพื้นหลังเปลี่ยนจากภาพเขียนในถ้ำไปเป็นภาพประกอบสไตล์แฟลต ซึ่งโพสต์ต้นฉบับมาจาก Tak (@cherry_mx_reds

花叔 - inline image

หลายคนในคอมมูนิตี้ภาษาจีนจริงๆ แล้วเห็นรีทวีตของโพสต์นี้ ซึ่งน่าแปลกใจที่ยอดบุ๊กมาร์กดันสูงกว่าโพสต์ต้นฉบับเสียอีก

花叔 - inline image

ณ วันนี้ Anthropic ยังไม่ได้ปล่อย Fable 5.5 ออกมาอย่างเป็นทางการ เวอร์ชันล่าสุดที่เป็นทางการยังคงเป็น Fable 5.1 ที่เปิดตัวไปเมื่อวันที่ 1 กันยายน ผลงานเหล่านี้มาจากผู้ใช้ที่อ้างว่าถูกส่งต่อไปยัง Fable 5.5 ผ่านการทดสอบแบบ gray-scale (วิธีเช็กคือการใช้เทสต์ชาวบ้านที่เรียกว่า Tibo test: ถามโมเดลว่ามันรู้จัก Tibo จากทีม OpenAI Codex ไหม ถ้าตอบถูกก็ถือว่ามันเป็นโมเดลใหม่ที่มีความรู้ที่อัปเดตแล้ว) แต่ตัวเวอร์ชันของโมเดลเองยังไม่ได้รับการยืนยันอย่างเป็นทางการ

ผมก็เอาวิดีโอนั้นป้อนเข้า Claude Code เพื่อลอกเลียนแบบมันเหมือนกัน แต่หลังจากทำชิ้นงานที่คล้ายกันออกมาได้แล้ว สิ่งที่ผมอยากเก็บไว้จริงๆ คือ "วิธีการ" มากกว่า: จะถอดโครงสร้างสไตล์ศิลปะอย่างไร ทำให้องค์ประกอบในฉากขยับได้อย่างไร และนำกระบวนการนี้กลับมาใช้ซ้ำกับหัวข้ออื่นๆ ในอนาคตได้อย่างไร

ระหว่างที่ทำ มีรายละเอียดที่น่าสนใจอย่างหนึ่งคือ มันสร้าง motion heatmap ขึ้นมาอัตโนมัติเพื่อระบุว่าบริเวณไหนในวิดีโอต้นฉบับมีการเคลื่อนไหว แม้แต่ละยุคสมัยจะกินเวลาแค่ราวๆ 1 วินาที แต่คลื่นก็ยังซัด ตัวหนังสือยังกะพริบ และมีการเคลื่อนไหวภายในตลอดเวลา ต่อมาวิธีการถอดโครงสร้างเหล่านี้ก็ถูกรวมเข้าไปใน skill ด้วย

花叔 - inline image

ภาพนิ่งในบทความนี้ตรงกับตัวอย่างวิดีโอฉบับเต็ม ซึ่งคุณสามารถรับชมได้จากลิงก์ต้นฉบับด้านบน

วิดีโอที่ไม่ได้อยู่ในการลอกเลียนแบบ

ดังนั้น คืนที่เสร็จจากการลอกเลียนแบบ ผมจึงโยนหัวข้อที่ไม่มีอยู่ในวิดีโอต้นฉบับให้มันทำ:

ใช้อวาตาร์การ์ตูนของผมเดินทางผ่านฉากอย่างน้อย 20 สไตล์ อวาตาร์ต้องเปลี่ยนไปตามฉากและมีปฏิสัมพันธ์กับวัตถุเฉพาะในฉากนั้นๆ เช่น เดินผ่านสะพานญี่ปุ่นของโมเนต์ และเล่นกระโดดหินในสระบัว

花叔 - inline image

ในวิดีโอนี้ ฉากและสไตล์ต่างๆ ถูกวาดด้วยโค้ด เฟรมแอ็กชันของอวาตาร์ในแต่ละสไตล์จะถูกวาดใหม่ด้วย gpt-image จากนั้นโค้ดจะจัดการตำแหน่ง ขนาด และจังหวะเวลา โดยซ้อนรอยแปรงพู่กันที่เข้ากับสไตล์ศิลปะแต่ละแบบลงบนตัวละคร

花叔 - inline image

ซาวด์แทร็กก็ปรับตามสไตล์ศิลปะด้วย: ขลุ่ยกระดูกและกลองมือสำหรับช่วงถ้ำ พิณผีผาสำหรับตุนหวง ชามิเซ็นและขลุ่ยชาคุฮาจิสำหรับอุคิโยะ-เอะ และคลื่นสี่เหลี่ยม (square wave) สำหรับ 8-bit เสียงทั้งหมดถูกสังเคราะห์ด้วยโค้ด โดยเปลี่ยนเครื่องดนตรีและโหมดเพลงเมื่อสลับฉาก

花叔 - inline image

ลองนำไปใช้ในงานจริง

แต่เหนือกว่าการโชว์ศักยภาพของโมเดลหรือความสามารถในการควบคุมมันของผม สิ่งที่ผมสนใจมากกว่าคือมันนำไปใช้กับงานจริงได้หรือเปล่า

เราจึงเพิ่มสไตล์การอธิบายที่พบบ่อยบน YouTube เข้าไปอีก 8 แบบ ได้แก่ Whiteboard, Vox, Kurzgesagt, 3Blue1Brown, Keynote UI, Financial Charts, Storytelling และ Dynamic Text เรื่องข้อมูลให้ใช้ Financial Charts คณิตศาสตร์และคอนเซปต์ AI ให้ลอง 3b1b การสาธิตการใช้งานอินเทอร์เฟซในคลิปสอนซอฟต์แวร์ให้ใช้ Keynote UI และเลือกสไตล์ให้เหมาะกับเนื้อหาที่ต้องการอธิบาย

นอกจากไวท์บอร์ดในวิดีโอเปิดหัวแล้ว นี่คือสไตล์ Vox ที่เล่าเรื่อง 24 ปีของ SpaceX เช่นกัน:

ชมวิดีโอเวอร์ชัน Vox ของ SpaceX ฉบับเต็ม

การเปลี่ยนรูปแบบการนำเสนอในหัวข้อเดิม สร้างความรู้สึกทางสายตาที่ต่างกันอย่างสิ้นเชิง คุณสามารถส่งบทเสียงบรรยายไปให้มันสร้างเซกเมนต์แอนิเมชันตามความยาวเวลา แล้วนำไปแทรกในวิดีโอที่คุณกำลังตัดต่ออยู่ หรือเหมือนสองตัวอย่างนี้ คือเปลี่ยนคำอธิบายทั้งชุดให้เป็นแอนิเมชันไปเลย

สำหรับตัวผมเอง ส่วนนี้จะถูกนำมาใช้บ่อยที่สุด เวลาทำวิดีโอยาวลง Bilibili หรือ YouTube แล้วเจอจุดที่อธิบายด้วยคำพูดอย่างเดียวไม่เคลียร์ ผมก็เพิ่มเซกเมนต์แยกที่กราฟิกค่อยๆ คลี่คลายไปทีละขั้นตามเสียงบรรยายได้เลย

มีอะไรอยู่ใน Skill นี้บ้าง

นอกจากสไตล์การอธิบาย 8 แบบที่กล่าวไปแล้ว ยังมีการ์ดสไตล์ศิลปะอีกหลายสิบใบ ตั้งแต่ภาพเขียนในถ้ำ อียิปต์โบราณ อุคิโยะ-เอะ อิมเพรสชันนิสม์ ไปจนถึงแวนโก๊ะ มุงค์ ดาลี ฮอปเปอร์ ป๊อปอาร์ต Studio Ghibli มาโคโตะ ชินไค และเวเปอร์เวฟ การ์ดแต่ละใบจะมีพาเลตสี เทคนิคการลงรอยแปรง วิธีการทำแอนิเมชัน และข้อจำกัดในปัจจุบัน เพื่อให้ปรับปรุงต่อยอดได้ในครั้งหน้า

花叔 - inline image

วิธีการถอดโครงสร้างวิดีโออ้างอิง การสร้างและประกอบเฟรมตัวละคร และการซิงก์ซาวด์แทร็กให้เข้ากับภาพ ก็รวมอยู่ในนี้ด้วย เมื่อทำเสร็จ จะมีโปรแกรมคอยตรวจหาปัญหาอย่างภาพค้างหรือการกระโดดที่ผิดปกติ จากนั้น agent แยกอีกตัวจะมาตรวจสอบวิดีโอตัดต่อสุดท้ายเพื่อหาจุดบกพร่อง

ผมบังคับให้มันบันทึกเสมอว่าอะไรที่ทำได้ดีในทางปฏิบัติ ทั้งวิธีการ หลักฐาน เหตุผล และควรนำไปใช้ตอนไหน ครั้งหน้าไม่ว่าคุณจะเปลี่ยนหัวข้อ เปลี่ยนสไตล์ หรือแม้แต่เปลี่ยนโมเดล ประสบการณ์เหล่านี้ก็จะถูกส่งต่อไปด้วย

รับ Skill นี้ไปใช้

skill นี้เปิดซอร์สอยู่บน GitHub:

https://github.com/alchaincyf/huashu-art-motion

การติดตั้ง (ใช้ได้กับ agent ทุกรุ่นที่รองรับ skills เช่น Claude Code, Codex, Cursor):

npx skills add alchaincyf/huashu-art-motion

การเรนเดอร์วิดีโอต้องมี uv และ ffmpeg ติดตั้งไว้ในเครื่องของคุณ ติดตั้ง headless browser ก่อนการเรนเดอร์ครั้งแรกด้วยคำสั่ง: uv run --with playwright install chromium

สร้างต่อใน YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
สำหรับครีเอเตอร์

เปลี่ยน Markdown ของคุณให้เป็นบทความ 𝕏 ที่สะอาดตา

เวลาคุณเผยแพร่งานเขียนยาวของตัวเอง การจัดรูปแบบรูปภาพ ตาราง และบล็อกโค้ดให้เข้ากับ 𝕏 นั้นน่าปวดหัว YouMind เปลี่ยนร่าง Markdown ทั้งฉบับให้เป็นบทความ 𝕏 ที่สะอาดตาและพร้อมโพสต์ทันที

ลอง Markdown เป็น 𝕏

แพตเทิร์นให้ถอดรหัสเพิ่มเติม

บทความไวรัลล่าสุด

สำรวจบทความไวรัลเพิ่มเติม