YouMind
Đăng nhập

Ra mắt huashu-art-motion: Kỹ năng hoạt hình thẩm mỹ nhất?

@AlchainHust
TIẾNG TRUNG06 thg 10, 2026
376K
1.4K
212
37
3.0K

TL;DR

Huashu ra mắt huashu-art-motion, một kỹ năng AI mã nguồn mở cho phép người dùng tạo video giải thích bằng hoạt hình và chuỗi hình ảnh nghệ thuật chất lượng cao thông qua các câu lệnh ngôn ngữ tự nhiên và tài liệu tham khảo.

Đầu tiên, hãy xem video này. Đó là một cú máy one-take dài 2 phút 08 giây.

Xem trọn bộ video hành trình nghệ thuật (Video gốc trên X)

Tiếp theo, đây là một video thực tế hơn để áp dụng vào công việc, cũng được làm bằng kỹ thuật này, tóm tắt chặng đường 24 năm của SpaceX.

Xem trọn bộ video phiên bản bảng trắng về SpaceX

Mình thấy kiểu hoạt hình bảng trắng (whiteboard animation) này cực kỳ hợp để làm các video giải thích và hướng dẫn dài trên Bilibili hay YouTube: vẽ từng bước nhân vật, sự kiện và mối liên kết khớp với giọng đọc sẽ giúp người xem dễ dàng bám sát mạch truyện trực quan. Bạn có thể thử hướng đi này cho các nội dung phổ biến kiến thức, demo sản phẩm hoặc thêm hoạt hình vào bài giảng.

Video mở đầu là hành trình nhân vật hoạt hình đại diện của mình bắt đầu từ những bức tranh hang động Lascaux, đi qua 23 phong cách nghệ thuật khác nhau, rồi cuối cùng trở lại bàn làm việc vào năm 2026. Mỗi lần bước vào một bức tranh, mình sẽ chuyển sang đúng phong cách của bức tranh đó và tương tác với các chi tiết bên trong: nhảy qua con bọ hung đang đẩy mặt trời trong tranh tường Ai Cập cổ đại, cúi người né ngọn sóng khổng lồ trong bản khắc gỗ của Hokusai, ném đá lướt trên mặt nước ở cây cầu Nhật Bản của Monet, hét vang cùng nhân vật của Munch (đến mức bay cả mũ), và thậm chí làm bật ra một đồng xu giữa bầu trời đêm phong cách 8-bit.

Các cảnh quay đều do code vẽ ra, còn nhạc nền được tổng hợp từng nốt bằng code (không dùng sample có sẵn). Ngoại trừ avatar của mình được tạo bằng ImageGen của Codex (thực sự thì hiện tại Codex chỉ đủ tốt khi đóng vai trò trợ lý tạo ảnh thôi), mọi thứ còn lại đều do Opus 5.5 xử lý trong Claude Code. Từ lúc nhận video tham khảo đến khi có bản dựng cuối cùng, tất cả mất chưa tới một ngày.

Mình đã đúc kết phương pháp làm những video hoạt hình này thành một skill tên là huashu-art-motion. Sau khi cài đặt, bạn có thể nói thẳng với nó: "Làm cho tôi một đoạn hoạt hình 15 giây theo phong cách 'Đêm đầy sao' của Van Gogh", hoặc đưa cho nó một bộ phim ngắn tham khảo để phân tích, làm lại, hay tạo hoạt hình giải thích dựa trên giọng đọc của bạn.

Bắt đầu với Fable 5.5

Nếu dạo gần đây bạn hay lướt giới AI trên X, chắc hẳn bạn đã thấy một loạt video hoạt hình được cho là do Fable 5.5 tạo ra. Có người chỉ dùng đúng một prompt mà thu về một bộ phim hoạt hình ngắn 3 phút kèm nhạc gốc, gom hơn 6.000 lượt thích; người khác lại cho Superman du hành liên tục qua các phong cách nghệ thuật khác nhau trong một cú máy duy nhất, đạt 670.000 lượt xem; và còn có đoạn hoạt hình lịch sử nghệ thuật dài 15 giây với một chú mèo và một người đang uống trà, phần nền chuyển từ tranh hang động sang minh họa phẳng, ban đầu được đăng bởi Tak (@cherry_mx_reds).

花叔 - inline image

Nhiều người trong cộng đồng nói tiếng Trung thực chất đã xem bản retweet của bài đăng này, điều bất ngờ là bản retweet lại có nhiều lượt lưu (bookmark) hơn cả bài gốc.

花叔 - inline image

Tính đến hôm nay, Anthropic vẫn chưa chính thức phát hành Fable 5.5; phiên bản chính thức mới nhất vẫn là Fable 5.1, ra mắt vào ngày 1 tháng 9. Những tác phẩm này đến từ những người dùng tự nhận là đã được chuyển sang dùng Fable 5.5 thông qua thử nghiệm giới hạn (gray-scale testing). Cách xác định là một bài test truyền miệng gọi là Tibo test: hỏi mô hình xem nó có biết Tibo trong đội ngũ OpenAI Codex không; nếu trả lời đúng thì coi như đó là mô hình mới đã được cập nhật kiến thức. Tuy nhiên, phiên bản mô hình này vẫn chưa được xác nhận chính thức.

Mình cũng đã đưa video đó vào Claude Code để làm lại. Nhưng sau khi hoàn thành một bản tương tự, thứ mình muốn giữ lại hơn cả chính là phương pháp: làm sao để phân tích các phong cách nghệ thuật, khiến các chi tiết trong cảnh chuyển động, và tái sử dụng quy trình này cho các chủ đề sau này.

Trong quá trình làm lại, có một chi tiết khá thú vị: hệ thống tự động tạo ra một bản đồ nhiệt chuyển động (motion heatmap) để xác định những khu vực nào đang di chuyển trong video gốc. Dù mỗi thời đại chỉ kéo dài khoảng 1 giây, nhưng sóng vẫn cuộn, chữ vẫn nhấp nháy, và luôn có chuyển động liên tục bên trong. Về sau, những phương pháp phân tích này đã được đưa vào skill.

花叔 - inline image

Các khung hình tĩnh trong bài viết tương ứng với các video mẫu hoàn chỉnh, bạn có thể xem qua các link gốc ở phía trên.

Video nằm ngoài bản làm lại

Thế nên, ngay tối hôm hoàn thành bản làm lại, mình đã giao cho nó một chủ đề không hề có trong video gốc:

Dùng avatar hoạt hình của tôi để du hành qua ít nhất 20 bối cảnh phong cách khác nhau. Avatar phải thay đổi theo từng cảnh và tương tác với các vật thể cụ thể bên trong, ví dụ như đi qua cây cầu Nhật Bản của Monet và ném đá trên hồ hoa súng.

花叔 - inline image

Trong video này, bối cảnh và phong cách đều do code vẽ ra. Các khung hình hành động của avatar theo từng phong cách được vẽ lại bằng gpt-image, sau đó code sẽ lo phần căn vị trí, chỉnh kích thước và canh thời gian, phủ lên nhân vật những nét cọ đặc trưng của từng phong cách nghệ thuật.

花叔 - inline image

Phần nhạc nền cũng chạy theo phong cách nghệ thuật: sáo xương và trống tay cho đoạn hang động, đàn tỳ bà cho Đôn Hoàng, đàn shamisen và sáo shakuhachi cho Ukiyo-e, và sóng vuông (square wave) cho phong cách 8-bit. Toàn bộ âm thanh đều được tổng hợp bằng code, tự động đổi nhạc cụ và điệu thức khi chuyển cảnh.

花叔 - inline image

Thử áp dụng vào công việc thực tế

Tuy nhiên, ngoài việc phô diễn sức mạnh của mô hình hay khả năng điều khiển chúng của mình, điều mình quan tâm hơn cả là liệu kỹ thuật này có áp dụng được vào công việc thực tế hay không.

Vì vậy, bọn mình đã bổ sung 8 phong cách giải thích phổ biến trên YouTube, bao gồm Whiteboard, Vox, Kurzgesagt, 3Blue1Brown, Keynote UI, Financial Charts, Storytelling và Dynamic Text. Dùng Financial Charts khi cần thể hiện dữ liệu, thử 3b1b cho các khái niệm toán học và AI, dùng Keynote UI cho các thao tác giao diện trong video hướng dẫn phần mềm, và chọn phong cách tùy theo nội dung cần giải thích.

Ngoài video bảng trắng ở đầu bài, đây là phiên bản phong cách Vox, cũng nói về 24 năm của SpaceX:

Xem trọn bộ video phiên bản Vox về SpaceX

Cùng một chủ đề nhưng thay đổi cách thể hiện sẽ mang lại cảm giác thị giác hoàn toàn khác biệt. Bạn có thể đưa kịch bản giọng đọc vào, tạo các đoạn hoạt hình tương ứng theo thời lượng rồi chèn vào video đang dựng; hoặc giống như hai ví dụ này, biến một bài giải thích hoàn chỉnh thành một video hoạt hình.

Với cá nhân mình, phần này sẽ được dùng thường xuyên hơn. Khi làm một video dài cho Bilibili hay YouTube mà gặp chỗ khó diễn đạt bằng lời, mình có thể chèn thêm một đoạn riêng, nơi hình ảnh dần hé mở từng bước khớp với lời bình.

Bên trong skill này có gì?

Ngoài 8 phong cách giải thích kể trên, skill này còn chứa hàng chục thẻ phong cách nghệ thuật, trải dài từ tranh hang động, Ai Cập cổ đại, Ukiyo-e, trường phái Ấn tượng, cho đến Van Gogh, Munch, Dali, Hopper, Pop Art, Studio Ghibli, Makoto Shinkai và Vaporwave. Mỗi thẻ bao gồm bảng màu, kỹ thuật nét cọ, phương pháp làm hoạt hình và những giới hạn hiện tại, giúp việc cải tiến ở lần sau dễ dàng hơn.

花叔 - inline image

Các phương pháp phân tích video tham khảo, tạo và ghép khung hình nhân vật, cũng như đồng bộ nhạc nền với hình ảnh đều được tích hợp sẵn. Sau khi hoàn tất, một chương trình sẽ kiểm tra các lỗi như khung hình bị đứng hay chuyển cảnh giật cục, tiếp đó một agent độc lập sẽ duyệt lại bản dựng cuối để tìm điểm chưa ổn.

Mình luôn yêu cầu nó ghi chép lại những gì đã làm đúng trong thực tế, bao gồm phương pháp, bằng chứng, lý do và thời điểm nên áp dụng. Lần sau dù bạn đổi chủ đề, đổi phong cách hay thậm chí đổi mô hình, những kinh nghiệm này vẫn được kế thừa.

Cách lấy skill này

Skill đã được open-source trên GitHub:

https://github.com/alchaincyf/huashu-art-motion

Cách cài đặt (dùng được với mọi agent hỗ trợ skill, chẳng hạn như Claude Code, Codex, Cursor):

npx skills add alchaincyf/huashu-art-motion

Để render video, máy tính của bạn cần có uv và ffmpeg. Hãy cài headless browser trước lần render đầu tiên: uv run --with playwright install chromium.

Viết lại trong YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral