Comment créer des vidéos exactement comme vous les imaginez : la méthode professionnelle pour utiliser Seedance 2.5

@casthirotaka
JAPONAIS15 août 2026
159K
165
24
2
600

TL;DR

Ce guide explique comment maîtriser Seedance 2.5 en traitant les prompts comme des instructions de réalisation plutôt que comme de simples descriptions, tout en utilisant des références vidéo pour gérer les mouvements complexes et la cohérence des personnages.

Ceux qui se frottent actuellement à Seedance 2.5 cherchent probablement le modèle de « prompt parfait » et testent toutes les idées qui leur passent par la tête.

Pourtant...

Le champ de responsabilité d'un prompt est plus restreint que vous ne le pensez

Seedance 2.5 accepte 30 images, 10 vidéos et 10 fichiers audio comme références en une seule génération (annoncé officiellement par ByteDance, le 31 juillet 2026).

Cette spécification implique que les prompts ne sont pas censés tout expliquer.

吉田洋孝|Cast Japan代表 - inline image

Ce qui doit être décidé

Pertinence du prompt

Où se trouve la « bonne » réponse

Objectif de la vidéo, univers, ambiance

Élevée

Prompt

Type de lieu, ce qui se passe

Élevée

Prompt

Ce qu'il faut garder, ce qu'il faut changer

Très élevée

Prompt

Priorités

Très élevée

Prompt

Direction de la lumière, rendu de l'objectif

Moyenne

Prompt / Image

Visage, identité de la personne

Faible

Image

Forme exacte du produit

Faible

Image

Mouvements corporels complexes

Faible

Vidéo

Contact, positionnement, regard

Faible

Vidéo

Trajectoire de caméra précise

Faible

Vidéo / Modèle blanc

Timing image par image

Faible

Vidéo / Montage

Il n'y a qu'un seul critère de jugement : Qui détient l'information la plus précise ?

La source la plus précise pour un mouvement, c'est la vidéo du mouvement lui-même, pas une description textuelle.

5 choses à ne pas écrire dans un prompt

1. Les descriptions d'ambiance qui accumulent les adjectifs

吉田洋孝|Cast Japan代表 - inline image

Le guide officiel précise : « Essayez de ne pas accumuler les adjectifs. » Il ajoute : « Être précis sur le mouvement et le choix de l'objectif fonctionne généralement mieux. »

2. Les « noms » de mouvements

Les noms conceptuels comme playful cheeky mini-dance (« petite danse coquine et malicieuse ») donnent un résultat aussi large que la marge d'interprétation.

En réalité, cette instruction a renvoyé une vidéo de quelqu'un dansant devant d'autres personnes : « s'approcher du partenaire -> tendre les mains -> regarder le partenaire ». L'objectif était « marcher seul·e en s'amusant, mouvement rapide et un peu désordonné », ce qui n'est même pas une danse.

3. Décomposer les mouvements du corps en texte

吉田洋孝|Cast Japan代表 - inline image

Même en réécrivant pour décomposer le balancement des bras, les mouvements d'épaules et la réaction synchrone de la caméra pour chaque partie, le résultat n'a pas changé. Le guide officiel indique que les références de mouvement sont « plus utiles qu'un long paragraphe vague ».

Même en décomposant et en allongeant le texte, on n'atteint pas la densité d'information d'une seule référence.

4. Les informations déjà contenues dans la référence

吉田洋孝|Cast Japan代表 - inline image

Les exemples officiels de prompts précisent quelles informations tirer de chaque référence.

« À partir de @Clay Render 1, utilisez comme référence le mouvement de caméra, le rythme, les transitions de taille de plan, la trajectoire et le positionnement du sujet.

À partir de @Image 2, utilisez comme référence le design du personnage, le décor, les matériaux, l'éclairage, la couleur et l'ambiance. »

Si vous écrivez dans le texte des informations que la référence possède déjà, la référence et le texte finiront par dire des choses différentes, ce qui mènera à un échec.

5. Les instructions contradictoires entre elles

Les paragraphes denses font que les instructions se contredisent entre elles. Dès qu'une instruction impossible s'y glisse, l'IA décide seule laquelle écarter.

5 choses à écrire dans un prompt

1. Le rôle de chaque fichier de référence

吉田洋孝|Cast Japan代表 - inline image

Le guide officiel demande de « mentionner clairement les rôles des références ». Parmi les rôles listés : identité du produit, cohérence du personnage, mouvement via des modèles blancs, jeu sur fond vert, audio, style et corrections partielles. Les rôles ne se définissent pas simplement en attachant des fichiers.

2. Ce qu'il ne faut PAS utiliser dans cette référence

Tout en attribuant les rôles, indiquez clairement les informations que vous ne voulez pas qu'elle récupère. Cette formulation a réellement fonctionné :

Ne copiez pas le lieu, les vêtements, le texte, les personnes ou l'histoire de @Video1. Copiez uniquement le rythme du corps, les gestes des bras, le rythme de la marche et le mouvement de caméra lié au corps.

Séparez bien les choses : « Imitez uniquement le mouvement ; n'imitez pas le lieu, les vêtements ni les personnes. »

3. L'énumération des éléments non négociables

吉田洋孝|Cast Japan代表 - inline image

Le guide officiel sur les références de mouvement recommande de construire le prompt ainsi : « Commencez par nommer les références téléchargées, puis listez les détails non négociables. »

  • identité
  • forme
  • échelle
  • plan au sol
  • design produit
  • pose
  • timing
  • voix
  • ordre des plans

4. Ce qu'il faut garder et ce qu'il faut changer

Écrivez séparément ce qu'il faut garder (jeu, timing, regard, positionnement, mouvement de caméra) et ce qu'il faut changer (personne, environnement, costume). Sans cette distinction, l'IA est libre de tout refaire.

5. Les priorités

Précisez ce qui doit être préservé en premier lorsque tout ne peut pas être respecté simultanément. Dans un prompt réel, cela a été écrit ainsi :

PRIORITÉS : 1. Correspondre au rythme corporel et aux mouvements de bras de @Video1. 2. Correspondre au mouvement de caméra lié au corps de @Video1. 3. Préserver le point de vue (POV) et l'environnement de @Image1. 4. Garder un mouvement ludique et décontracté plutôt que chorégraphié.

Décidez d'abord de la « bonne réponse »

Décomposez la vidéo souhaitée en éléments et décidez quel « support détient la bonne réponse » pour chaque élément.

Élément

Où se trouve la bonne réponse

Raison

Visage / Identité de la personne

Image

Le texte ne peut pas maintenir l'identité

Mouvement du corps, positionnement, regard, timing

Vidéo

Officiellement désignés comme cibles de contrôle de la référence vidéo

Structure spatiale, trajectoire de caméra

Modèle blanc (3D sans texture)

Officiel : « Efficace quand l'espace, le parcours de caméra et la position relative comptent plus que la texture finale »

Actions humaines, démonstration produit

Vidéo sur fond vert

Officiellement indiqué comme cas d'usage

Univers, lieu, sens, priorités

Prompt

Le domaine où le texte est le plus fort

Forme des meubles, petits objets, détails d'arrière-plan

À laisser à l'IA

Pas besoin de les fixer

吉田洋孝|Cast Japan代表 - inline image
吉田洋孝|Cast Japan代表 - inline image

Divisez ensuite la force de contrainte de chaque élément en trois niveaux :

  • Fixe : ne pas autoriser de refonte arbitraire (personne, forme du produit, vidéo de mouvement d'origine).
  • Orienté : donner une direction mais laisser place à l'interprétation (appartement de luxe, nuit, éclairage chaleureux, ambiance ludique).
  • Auto : laisser faire l'IA (forme du canapé, objets sur l'étagère, détails au mur).

Si vous fixez tout, la vidéo devient artificielle ; si vous laissez tout en auto, elle s'éloigne de l'objectif. Déterminer où fixer et où assouplir, c'est le rôle du prompt.

3 façons de créer. Filmez d'abord les mouvements difficiles

Méthode

Situations adaptées

Laisser l'IA tout créer

Mondes inexistants, mouvements simples, univers fort

Fournir des exemples pour créer

Visage / forme du produit fixés, souhait de poursuivre la composition

Filmer d'abord, puis modifier

Mouvements complexes, contact humain, interactions entre plusieurs personnes

Si la troisième méthode est importante, c'est parce que ByteDance liste lui-même la « stabilité des scènes où plusieurs sujets interagissent » comme un axe d'amélioration de Seedance 2.5. C'est un combat perdu d'avance que de vouloir imposer par le texte un domaine que le développeur reconnaît lui-même comme difficile.

吉田洋孝|Cast Japan代表 - inline image

La méthode « filmer d'abord » fonctionne parce qu'elle transforme la tâche de l'IA : elle ne doit plus « inventer le jeu » mais « modifier l'apparence d'un jeu déjà établi ». Le positionnement, le timing, le regard et le contact sont portés par la vidéo filmée, tandis que l'IA ne gère que l'identité et l'environnement.

Sur X, un cas a été partagé où une seule vidéo montrant trois personnes différentes a été convertie pour que les trois deviennent la même personne. (L'auteur a précisé avoir utilisé Seedance 2.0, sans compositing ni masques. Comme il s'agit d'un post tiers, les détails du processus de production n'ont pas été vérifiés.)

Il existe aussi des cas où ce n'est clairement pas adapté.

Tout générer sans vidéo source, contact trop complexe, visages entièrement cachés, ambiguïté sur qui se trouve où, ou positionnement déjà bancal au stade de la vidéo source.

Si ces cinq conditions s'appliquent, filmer d'abord ne résoudra rien.

Le modèle de prompt présenté par l'officiel

L'ordre de base est le suivant :

Sujet (Qui/Quoi) -> Action (Fait quoi) -> Caméra (Comment filmer) -> Style (Quelle texture)

Pour un plan unique de 30 secondes, l'officiel montre même la répartition dans le temps :

  • 00–06 s : montrer la situation en plan large
  • 06–14 s : entrer dans le mouvement principal avec un gros plan
  • 14–24 s : développer en bougeant la caméra ou en ajoutant des inserts
  • 24–30 s : converger

Modèle à remplir et à utiliser avec des références 👇

text
1RÉFÉRENCES :
2@Image1 = [Rôle]. N'utiliser que [Informations à utiliser] de cette référence. Ne pas utiliser [Informations à ne pas utiliser].
3@Video1 = [Rôle]. N'utiliser que [Informations à utiliser] de cette référence. Ne pas utiliser [Informations à ne pas utiliser].
4
5ACTION :
6[Qui] [Où] [Fait quoi].
7[Qualité du mouvement. Précisez s'il est rapide ou lent, désordonné ou soigné, et à qui il s'adresse, plutôt que d'écrire « un mouvement nommé X »]
8
9CAMÉRA :
10[Type de point de vue / Angle de vue de l'objectif].
11[Ce avec quoi la caméra bouge en synchronisation].
12[Comportements de caméra à éviter].
13
14JEU :
15[Température du jeu. S'agit-il d'une performance montrée à quelqu'un ou d'une action faite seul·e ?]
16
17ENVIRONNEMENT :
18[Lieu, moment, caractère de la lumière. Ne pas préciser les détails]
19
20GARDER / CHANGER :
21Garder = [Jeu / Timing / Regard / Positionnement / Mouvement de caméra]
22Changer = [Personne / Environnement / Costume]
23
24PRIORITÉS :
251. [Élément à protéger en priorité absolue]
262. [Élément à protéger en second]
273. [Suivant]

Ce modèle est efficace non pas parce qu'il réduit la quantité d'écriture.

C'est parce que le rôle du texte change : il ne s'agit plus de « décrire la vidéo », mais de « diriger la répartition des rôles entre les différents supports ».

La vidéo détient la bonne réponse pour le mouvement, l'image la détient pour le visage, et le modèle blanc pour l'espace. Le prompt décide de leur agencement.

Merci d'avoir lu jusqu'au bout.

Sur X ([@casthirotaka](https://x.com/@casthirotaka)), je partage chaque jour des histoires qui fonctionnent pour ce type de travail pratique.

Je serais ravi que vous me suiviez.

Remixer dans YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux