Ceux qui se frottent actuellement à Seedance 2.5 cherchent probablement le modèle de « prompt parfait » et testent toutes les idées qui leur passent par la tête.
Pourtant...
Le champ de responsabilité d'un prompt est plus restreint que vous ne le pensez
Seedance 2.5 accepte 30 images, 10 vidéos et 10 fichiers audio comme références en une seule génération (annoncé officiellement par ByteDance, le 31 juillet 2026).
Cette spécification implique que les prompts ne sont pas censés tout expliquer.

Ce qui doit être décidé | Pertinence du prompt | Où se trouve la « bonne » réponse |
|---|---|---|
Objectif de la vidéo, univers, ambiance | Élevée | Prompt |
Type de lieu, ce qui se passe | Élevée | Prompt |
Ce qu'il faut garder, ce qu'il faut changer | Très élevée | Prompt |
Priorités | Très élevée | Prompt |
Direction de la lumière, rendu de l'objectif | Moyenne | Prompt / Image |
Visage, identité de la personne | Faible | Image |
Forme exacte du produit | Faible | Image |
Mouvements corporels complexes | Faible | Vidéo |
Contact, positionnement, regard | Faible | Vidéo |
Trajectoire de caméra précise | Faible | Vidéo / Modèle blanc |
Timing image par image | Faible | Vidéo / Montage |
Il n'y a qu'un seul critère de jugement : Qui détient l'information la plus précise ?
La source la plus précise pour un mouvement, c'est la vidéo du mouvement lui-même, pas une description textuelle.
5 choses à ne pas écrire dans un prompt
1. Les descriptions d'ambiance qui accumulent les adjectifs

Le guide officiel précise : « Essayez de ne pas accumuler les adjectifs. » Il ajoute : « Être précis sur le mouvement et le choix de l'objectif fonctionne généralement mieux. »
2. Les « noms » de mouvements
Les noms conceptuels comme playful cheeky mini-dance (« petite danse coquine et malicieuse ») donnent un résultat aussi large que la marge d'interprétation.
En réalité, cette instruction a renvoyé une vidéo de quelqu'un dansant devant d'autres personnes : « s'approcher du partenaire -> tendre les mains -> regarder le partenaire ». L'objectif était « marcher seul·e en s'amusant, mouvement rapide et un peu désordonné », ce qui n'est même pas une danse.
3. Décomposer les mouvements du corps en texte

Même en réécrivant pour décomposer le balancement des bras, les mouvements d'épaules et la réaction synchrone de la caméra pour chaque partie, le résultat n'a pas changé. Le guide officiel indique que les références de mouvement sont « plus utiles qu'un long paragraphe vague ».
Même en décomposant et en allongeant le texte, on n'atteint pas la densité d'information d'une seule référence.
4. Les informations déjà contenues dans la référence

Les exemples officiels de prompts précisent quelles informations tirer de chaque référence.
« À partir de @Clay Render 1, utilisez comme référence le mouvement de caméra, le rythme, les transitions de taille de plan, la trajectoire et le positionnement du sujet.
À partir de @Image 2, utilisez comme référence le design du personnage, le décor, les matériaux, l'éclairage, la couleur et l'ambiance. »
Si vous écrivez dans le texte des informations que la référence possède déjà, la référence et le texte finiront par dire des choses différentes, ce qui mènera à un échec.
5. Les instructions contradictoires entre elles
Les paragraphes denses font que les instructions se contredisent entre elles. Dès qu'une instruction impossible s'y glisse, l'IA décide seule laquelle écarter.
5 choses à écrire dans un prompt
1. Le rôle de chaque fichier de référence

Le guide officiel demande de « mentionner clairement les rôles des références ». Parmi les rôles listés : identité du produit, cohérence du personnage, mouvement via des modèles blancs, jeu sur fond vert, audio, style et corrections partielles. Les rôles ne se définissent pas simplement en attachant des fichiers.
2. Ce qu'il ne faut PAS utiliser dans cette référence
Tout en attribuant les rôles, indiquez clairement les informations que vous ne voulez pas qu'elle récupère. Cette formulation a réellement fonctionné :
Ne copiez pas le lieu, les vêtements, le texte, les personnes ou l'histoire de @Video1. Copiez uniquement le rythme du corps, les gestes des bras, le rythme de la marche et le mouvement de caméra lié au corps.
Séparez bien les choses : « Imitez uniquement le mouvement ; n'imitez pas le lieu, les vêtements ni les personnes. »
3. L'énumération des éléments non négociables

Le guide officiel sur les références de mouvement recommande de construire le prompt ainsi : « Commencez par nommer les références téléchargées, puis listez les détails non négociables. »
- identité
- forme
- échelle
- plan au sol
- design produit
- pose
- timing
- voix
- ordre des plans
4. Ce qu'il faut garder et ce qu'il faut changer
Écrivez séparément ce qu'il faut garder (jeu, timing, regard, positionnement, mouvement de caméra) et ce qu'il faut changer (personne, environnement, costume). Sans cette distinction, l'IA est libre de tout refaire.
5. Les priorités
Précisez ce qui doit être préservé en premier lorsque tout ne peut pas être respecté simultanément. Dans un prompt réel, cela a été écrit ainsi :
PRIORITÉS : 1. Correspondre au rythme corporel et aux mouvements de bras de @Video1. 2. Correspondre au mouvement de caméra lié au corps de @Video1. 3. Préserver le point de vue (POV) et l'environnement de @Image1. 4. Garder un mouvement ludique et décontracté plutôt que chorégraphié.
Décidez d'abord de la « bonne réponse »
Décomposez la vidéo souhaitée en éléments et décidez quel « support détient la bonne réponse » pour chaque élément.
Élément | Où se trouve la bonne réponse | Raison |
|---|---|---|
Visage / Identité de la personne | Image | Le texte ne peut pas maintenir l'identité |
Mouvement du corps, positionnement, regard, timing | Vidéo | Officiellement désignés comme cibles de contrôle de la référence vidéo |
Structure spatiale, trajectoire de caméra | Modèle blanc (3D sans texture) | Officiel : « Efficace quand l'espace, le parcours de caméra et la position relative comptent plus que la texture finale » |
Actions humaines, démonstration produit | Vidéo sur fond vert | Officiellement indiqué comme cas d'usage |
Univers, lieu, sens, priorités | Prompt | Le domaine où le texte est le plus fort |
Forme des meubles, petits objets, détails d'arrière-plan | À laisser à l'IA | Pas besoin de les fixer |


Divisez ensuite la force de contrainte de chaque élément en trois niveaux :
- Fixe : ne pas autoriser de refonte arbitraire (personne, forme du produit, vidéo de mouvement d'origine).
- Orienté : donner une direction mais laisser place à l'interprétation (appartement de luxe, nuit, éclairage chaleureux, ambiance ludique).
- Auto : laisser faire l'IA (forme du canapé, objets sur l'étagère, détails au mur).
Si vous fixez tout, la vidéo devient artificielle ; si vous laissez tout en auto, elle s'éloigne de l'objectif. Déterminer où fixer et où assouplir, c'est le rôle du prompt.
3 façons de créer. Filmez d'abord les mouvements difficiles
Méthode | Situations adaptées |
|---|---|
Laisser l'IA tout créer | Mondes inexistants, mouvements simples, univers fort |
Fournir des exemples pour créer | Visage / forme du produit fixés, souhait de poursuivre la composition |
Filmer d'abord, puis modifier | Mouvements complexes, contact humain, interactions entre plusieurs personnes |
Si la troisième méthode est importante, c'est parce que ByteDance liste lui-même la « stabilité des scènes où plusieurs sujets interagissent » comme un axe d'amélioration de Seedance 2.5. C'est un combat perdu d'avance que de vouloir imposer par le texte un domaine que le développeur reconnaît lui-même comme difficile.

La méthode « filmer d'abord » fonctionne parce qu'elle transforme la tâche de l'IA : elle ne doit plus « inventer le jeu » mais « modifier l'apparence d'un jeu déjà établi ». Le positionnement, le timing, le regard et le contact sont portés par la vidéo filmée, tandis que l'IA ne gère que l'identité et l'environnement.
Sur X, un cas a été partagé où une seule vidéo montrant trois personnes différentes a été convertie pour que les trois deviennent la même personne. (L'auteur a précisé avoir utilisé Seedance 2.0, sans compositing ni masques. Comme il s'agit d'un post tiers, les détails du processus de production n'ont pas été vérifiés.)
Il existe aussi des cas où ce n'est clairement pas adapté.
Tout générer sans vidéo source, contact trop complexe, visages entièrement cachés, ambiguïté sur qui se trouve où, ou positionnement déjà bancal au stade de la vidéo source.
Si ces cinq conditions s'appliquent, filmer d'abord ne résoudra rien.
Le modèle de prompt présenté par l'officiel
L'ordre de base est le suivant :
Sujet (Qui/Quoi) -> Action (Fait quoi) -> Caméra (Comment filmer) -> Style (Quelle texture)
Pour un plan unique de 30 secondes, l'officiel montre même la répartition dans le temps :
- 00–06 s : montrer la situation en plan large
- 06–14 s : entrer dans le mouvement principal avec un gros plan
- 14–24 s : développer en bougeant la caméra ou en ajoutant des inserts
- 24–30 s : converger
Modèle à remplir et à utiliser avec des références 👇
1RÉFÉRENCES :2@Image1 = [Rôle]. N'utiliser que [Informations à utiliser] de cette référence. Ne pas utiliser [Informations à ne pas utiliser].3@Video1 = [Rôle]. N'utiliser que [Informations à utiliser] de cette référence. Ne pas utiliser [Informations à ne pas utiliser].45ACTION :6[Qui] [Où] [Fait quoi].7[Qualité du mouvement. Précisez s'il est rapide ou lent, désordonné ou soigné, et à qui il s'adresse, plutôt que d'écrire « un mouvement nommé X »]89CAMÉRA :10[Type de point de vue / Angle de vue de l'objectif].11[Ce avec quoi la caméra bouge en synchronisation].12[Comportements de caméra à éviter].1314JEU :15[Température du jeu. S'agit-il d'une performance montrée à quelqu'un ou d'une action faite seul·e ?]1617ENVIRONNEMENT :18[Lieu, moment, caractère de la lumière. Ne pas préciser les détails]1920GARDER / CHANGER :21Garder = [Jeu / Timing / Regard / Positionnement / Mouvement de caméra]22Changer = [Personne / Environnement / Costume]2324PRIORITÉS :251. [Élément à protéger en priorité absolue]262. [Élément à protéger en second]273. [Suivant]
Ce modèle est efficace non pas parce qu'il réduit la quantité d'écriture.
C'est parce que le rôle du texte change : il ne s'agit plus de « décrire la vidéo », mais de « diriger la répartition des rôles entre les différents supports ».
La vidéo détient la bonne réponse pour le mouvement, l'image la détient pour le visage, et le modèle blanc pour l'espace. Le prompt décide de leur agencement.
Merci d'avoir lu jusqu'au bout.
Sur X ([@casthirotaka](https://x.com/@casthirotaka)), je partage chaque jour des histoires qui fonctionnent pour ce type de travail pratique.
Je serais ravi que vous me suiviez.





