Cách tạo video đúng như ý tưởng: Phương pháp chuyên nghiệp để sử dụng Seedance 2.5

@casthirotaka
TIẾNG NHẬT15 thg 8, 2026
159K
165
24
2
600

TL;DR

Hướng dẫn này giải thích cách làm chủ Seedance 2.5 bằng cách coi các câu lệnh là chỉ dẫn đạo diễn thay vì chỉ là mô tả, đồng thời sử dụng tài liệu tham khảo video để xử lý các chuyển động phức tạp và tính nhất quán của nhân vật.

Những người hiện đang thử sức với Seedance 2.5 có lẽ đang tìm kiếm template "prompt hoàn hảo" và thử nghiệm mọi ý tưởng mà họ nghĩ ra.

Tuy nhiên...

Phạm vi trách nhiệm của một prompt hẹp hơn bạn nghĩ

Seedance 2.5 chấp nhận 30 hình ảnh, 10 video và 10 tệp âm thanh làm tài liệu tham khảo trong một lần tạo (được ByteDance công bố chính thức vào ngày 31 tháng 7 năm 2026).

Thông số kỹ thuật này ngụ ý rằng prompt không nhằm mục đích giải thích mọi thứ.

吉田洋孝|Cast Japan代表 - inline image

Điều cần quyết định

Mức độ phù hợp với prompt

Nơi nắm giữ "câu trả lời đúng"

Mục đích video, thế giới quan, bầu không khí

Cao

Prompt

Loại địa điểm, điều gì xảy ra

Cao

Prompt

Giữ gì, thay đổi gì

Rất cao

Prompt

Ưu tiên

Rất cao

Prompt

Hướng ánh sáng, cảm giác ống kính

Trung bình

Prompt / Ảnh

Khuôn mặt người, danh tính

Thấp

Ảnh

Hình dạng sản phẩm chính xác

Thấp

Ảnh

Chuyển động cơ thể phức tạp

Thấp

Video

Tiếp xúc của con người, vị trí, ánh mắt

Thấp

Video

Quỹ đạo máy quay chính xác

Thấp

Video / Mô hình trắng

Thời điểm từng khung hình

Thấp

Video / Dựng phim

Chỉ có một tiêu chí để phán đoán: Ai có thông tin chính xác nhất?

Nguồn chính xác nhất cho chuyển động chính là video của chuyển động đó, chứ không phải mô tả bằng văn bản.

5 điều không nên viết trong prompt

1. Mô tả bầu không khí bằng cách chất đống tính từ

吉田洋孝|Cast Japan代表 - inline image

Hướng dẫn chính thức nêu rõ: "Cố gắng đừng chất đống tính từ." Và tiếp tục: "Việc cụ thể hóa chuyển động và lựa chọn ống kính thường hiệu quả hơn."

2. "Tên gọi" của các chuyển động

Những tên gọi mang tính khái niệm như playful cheeky mini-dance tạo ra phạm vi đầu ra rộng ngang với phạm vi diễn giải.

Trên thực tế, chỉ dẫn này đã trả về một video về người đang nhảy trước mặt người khác: "tiến đến bạn nhảy -> đưa tay về phía trước -> nhìn bạn nhảy." Mục tiêu mong muốn là "vừa đi một mình vừa đùa nghịch, chuyển động hơi lộn xộn và nhanh," thậm chí còn chẳng phải là một điệu nhảy.

3. Phân rã chuyển động từng bộ phận cơ thể thành văn bản

吉田洋孝|Cast Japan代表 - inline image

Ngay cả khi viết lại bằng cách phân rã cách cánh tay đung đưa, vai rung lắc và cách máy quay phản ứng đồng bộ với từng bộ phận, kết quả đầu ra vẫn không thay đổi. Hướng dẫn chính thức cho biết tài liệu tham khảo chuyển động "hữu ích hơn một đoạn văn dài mơ hồ."

Ngay cả khi bạn phân rã và kéo dài nó ra, mật độ thông tin vẫn không thể bằng một tài liệu tham khảo duy nhất.

4. Thông tin mà tài liệu tham khảo đã có sẵn

吉田洋孝|Cast Japan代表 - inline image

Các ví dụ prompt chính thức chỉ rõ nên lấy thông tin gì từ mỗi tài liệu tham khảo.

" Từ @Clay Render 1, tham khảo chuyển động máy quay, nhịp độ, chuyển đổi cỡ cảnh, quỹ đạo chủ thể và vị trí.

Từ @Image 2, tham khảo thiết kế nhân vật, bối cảnh, chất liệu, ánh sáng, màu sắc và bầu không khí."

Nếu bạn viết vào prompt những thông tin mà tài liệu tham khảo đã có, tài liệu tham khảo và văn bản sẽ bắt đầu nói những điều khác nhau, dẫn đến kết quả bị hỏng.

5. Các chỉ dẫn mâu thuẫn lẫn nhau

Các đoạn văn dày đặc khiến các chỉ dẫn xung đột với nhau ngay bên trong. Ngay khi một chỉ dẫn bất khả thi được trộn vào, AI sẽ tự quyết định nên loại bỏ cái nào.

5 điều nên viết trong prompt

1. Vai trò của từng tệp tham khảo

吉田洋孝|Cast Japan代表 - inline image

Hướng dẫn chính thức yêu cầu "Nêu rõ vai trò của các tài liệu tham khảo." Các vai trò được liệt kê bao gồm nhận diện sản phẩm, nhất quán nhân vật, chuyển động qua mô hình trắng, diễn xuất phông xanh, âm thanh, phong cách và hiệu chỉnh từng phần. Vai trò không được xác định chỉ bằng việc đính kèm tệp.

2. Điều KHÔNG nên dùng từ tài liệu tham khảo đó

Khi giao vai trò, hãy nêu rõ những thông tin bạn không muốn nó tiếp thu. Cách diễn đạt này thực sự đã hiệu quả:

Không sao chép địa điểm, trang phục, chữ viết, con người hay câu chuyện từ @Video1. Chỉ sao chép nhịp điệu cơ thể, cử chỉ tay, nhịp bước đi và chuyển động máy quay liên kết với cơ thể.

Hãy tách bạch: "Chỉ bắt chước chuyển động; đừng bắt chước địa điểm, quần áo hay con người."

3. Liệt kê các yếu tố bất khả nhượng

吉田洋孝|Cast Japan代表 - inline image

Hướng dẫn chính thức về tài liệu tham khảo chuyển động nêu cách xây dựng prompt như sau: "Bắt đầu bằng cách nêu tên các tài liệu tham khảo đã tải lên, sau đó liệt kê các chi tiết bất khả nhượng."

  • danh tính
  • hình dạng
  • tỷ lệ
  • sơ đồ mặt bằng
  • thiết kế sản phẩm
  • tư thế
  • thời điểm
  • giọng nói
  • thứ tự cảnh quay

4. Giữ gì và thay đổi gì

Hãy viết riêng điều cần giữ (diễn xuất, thời điểm, ánh mắt, vị trí, chuyển động máy quay) và điều cần thay đổi (con người, môi trường, trang phục). Nếu không tách bạch, AI sẽ có toàn quyền làm lại mọi thứ.

5. Ưu tiên

Hãy chỉ rõ điều cần bảo vệ trước tiên trong những tình huống không thể tuân theo mọi thứ cùng lúc. Trong một prompt thực tế, điều này được viết như sau:

ƯU TIÊN: 1. Khớp nhịp điệu cơ thể và chuyển động tay của @Video1. 2. Khớp chuyển động máy quay liên kết với cơ thể của @Video1. 3. Giữ nguyên góc nhìn POV và môi trường từ @Image1. 4. Giữ chuyển động vui tươi và ngẫu hứng thay vì được biên đạo bài bản.

Quyết định "câu trả lời đúng" trước

Chia video mong muốn thành các yếu tố và quyết định "tài liệu nào nắm giữ câu trả lời đúng" cho từng yếu tố.

Yếu tố

Nơi nắm giữ câu trả lời đúng

Lý do

Khuôn mặt / Danh tính người

Ảnh

Văn bản không thể duy trì danh tính

Chuyển động cơ thể, vị trí, ánh mắt, thời điểm

Video

Được công bố chính thức là mục tiêu kiểm soát của tài liệu tham khảo video

Cấu trúc không gian, quỹ đạo máy quay

Mô hình trắng (3D không có texture)

Chính thức: "Hiệu quả khi không gian, đường đi của máy quay và vị trí tương đối quan trọng hơn texture cuối cùng"

Hành động của con người, trình diễn sản phẩm

Tài liệu phông xanh

Được công bố chính thức là một trường hợp sử dụng

Thế giới quan, địa điểm, ý nghĩa, ưu tiên

Prompt

Lĩnh vực mà văn bản mạnh nhất

Hình dạng đồ nội thất, vật dụng nhỏ, chi tiết hậu cảnh

Để AI tự quyết

Không cần cố định

吉田洋孝|Cast Japan代表 - inline image
吉田洋孝|Cast Japan代表 - inline image

Hơn nữa, hãy chia mức độ ràng buộc cho từng yếu tố thành ba cấp độ:

  • Cố định: Không cho phép AI tự ý làm lại (con người, hình dạng sản phẩm, tài liệu chuyển động gốc).
  • Định hướng: Đưa ra định hướng nhưng cho phép diễn giải (căn hộ cao cấp, ban đêm, ánh sáng ấm áp, bầu không khí vui vẻ).
  • Tự động: Để AI tự quyết (hình dạng ghế sofa, đồ vật trên kệ sách, chi tiết trên tường).

Nếu cố định mọi thứ, video sẽ trở nên thiếu tự nhiên; nếu để mọi thứ ở chế độ tự động, nó sẽ lệch khỏi mục tiêu. Thiết kế chỗ nào cần cố định và chỗ nào cần nới lỏng chính là công việc của prompt.

3 cách tạo video. Hãy quay những chuyển động khó trước

Phương pháp

Tình huống phù hợp

Để AI tạo ra mọi thứ

Thế giới không tồn tại, chuyển động đơn giản, thế giới quan mạnh mẽ

Cung cấp mẫu để tạo

Khuôn mặt/hình dạng sản phẩm cố định, muốn tiếp tục bố cục

Quay trước, sau đó thay đổi

Chuyển động phức tạp, tiếp xúc giữa người với người, nhiều người tương tác

Lý do phương pháp thứ ba quan trọng là vì chính ByteDance cũng liệt kê "độ ổn định của các cảnh có nhiều chủ thể tương tác" là một lĩnh vực cần cải thiện trong Seedance 2.5. Việc cố gắng dùng văn bản để giải quyết một lĩnh vực mà chính nhà phát triển thừa nhận là khó chẳng khác nào một trận chiến thua cuộc.

吉田洋孝|Cast Japan代表 - inline image

Phương pháp "quay trước" hiệu quả vì nó chuyển công việc của AI từ "sáng tạo ra diễn xuất" sang "thay đổi diện mạo của một diễn xuất đã có sẵn." Vị trí, thời điểm, ánh mắt và tiếp xúc được nắm giữ bởi tài liệu do con người quay, trong khi AI chỉ xử lý danh tính và môi trường.

Trên X, có một trường hợp được chia sẻ trong đó một tài liệu duy nhất có sự xuất hiện của ba người khác nhau đã được chuyển đổi thành cùng một người cho cả ba. (Sử dụng Seedance 2.0, người đăng giải thích rằng không sử dụng kỹ thuật ghép hay mặt nạ nào. Vì đây là bài đăng của bên thứ ba nên các chi tiết về quy trình sản xuất chưa được xác minh.)

Cũng có những trường hợp rõ ràng không phù hợp.

Tạo ra mọi thứ mà không có tài liệu nguồn, tiếp xúc quá phức tạp, khuôn mặt bị che khuất hoàn toàn, ai ở vị trí nào không rõ ràng, hoặc vị trí đã sai ngay từ giai đoạn tài liệu nguồn.

Nếu rơi vào cả năm trường hợp này, quay trước cũng sẽ không giải quyết được vấn đề.

Template prompt chính thức

Thứ tự cơ bản là:

Chủ thể (Ai/Cái gì) -> Hành động (Làm gì) -> Máy quay (Quay thế nào) -> Phong cách (Texture như thế nào)

Đối với một cảnh quay duy nhất dài 30 giây, phía chính thức còn công bố cách phân bổ thời gian:

  • 00–06s: Giới thiệu bối cảnh bằng cảnh quay rộng
  • 06–14s: Bước vào chuyển động chính bằng cận cảnh
  • 14–24s: Phát triển bằng cách di chuyển máy quay hoặc thêm cảnh chèn
  • 24–30s: Hội tụ

Template để điền và sử dụng khi dùng tài liệu tham khảo👇

text
1TÀI LIỆU THAM KHẢO:
2@Image1 = [Vai trò]. Chỉ sử dụng [Thông tin cần dùng] từ đây. Không sử dụng [Thông tin không nên dùng].
3@Video1 = [Vai trò]. Chỉ sử dụng [Thông tin cần dùng] từ đây. Không sử dụng [Thông tin không nên dùng].
4
5HÀNH ĐỘNG:
6[Ai] [Ở đâu] [Làm gì].
7[Chất lượng chuyển động. Viết rõ là nhanh hay chậm, lộn xộn hay chỉn chu, và hướng đến ai, thay vì "một chuyển động tên là X"]
8
9MÁY QUAY:
10[Loại góc nhìn / Góc nhìn của ống kính].
11[Điều máy quay di chuyển đồng bộ theo].
12[Những hành vi máy quay không được phép thực hiện].
13
14DIỄN XUẤT:
15[Nhiệt độ của diễn xuất. Đang thể hiện cho người khác xem hay tự mình làm một mình?]
16
17MÔI TRƯỜNG:
18[Địa điểm, thời gian, đặc tính ánh sáng. Không chỉ định chi tiết]
19
20GIỮ / THAY ĐỔI:
21Giữ = [Diễn xuất / Thời điểm / Ánh mắt / Vị trí / Chuyển động máy quay]
22Thay đổi = [Con người / Môi trường / Trang phục]
23
24ƯU TIÊN:
251. [Điều cần bảo vệ với ưu tiên cao nhất]
262. [Điều cần bảo vệ tiếp theo]
273. [Tiếp theo]

Template này hiệu quả không phải vì nó giảm bớt số lượng chữ cần viết.

Mà là vì công việc của văn bản đã thay đổi từ "mô tả video" sang "chỉ đạo sự phân chia vai trò cho các tài liệu."

Video nắm giữ câu trả lời đúng cho chuyển động, hình ảnh nắm giữ câu trả lời đúng cho khuôn mặt, và mô hình trắng nắm giữ câu trả lời đúng cho không gian. Prompt quyết định sự sắp xếp của chúng.

Cảm ơn bạn đã đọc đến cuối bài.

Trên X ([@casthirotaka](https://x.com/@casthirotaka)), tôi chia sẻ những câu chuyện hiệu quả cho công việc thực tế như thế này mỗi ngày.

Tôi sẽ rất vui nếu bạn theo dõi tôi.

Viết lại trong YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral