Quem está se desafiando com o Seedance 2.5 agora provavelmente está procurando o template do "prompt perfeito" e testando todas as ideias em que consegue pensar.
No entanto...
A responsabilidade de um prompt é mais restrita do que você imagina
O Seedance 2.5 aceita 30 imagens, 10 vídeos e 10 arquivos de áudio como referências em uma única geração (anunciado oficialmente pela ByteDance em 31 de julho de 2026).
Essa especificação indica que os prompts não têm a intenção de explicar tudo.

O que decidir | Adequação ao prompt | Onde guardar a resposta "correta" |
|---|---|---|
Propósito do vídeo, visão de mundo, atmosfera | Alta | Prompt |
Tipo de local, o que acontece | Alta | Prompt |
O que manter, o que mudar | Muito alta | Prompt |
Prioridades | Muito alta | Prompt |
Direção da luz, sensação da lente | Média | Prompt / Imagem |
Rosto da pessoa, identidade | Baixa | Imagem |
Formato exato do produto | Baixa | Imagem |
Movimentos corporais complexos | Baixa | Vídeo |
Contato humano, posicionamento, olhar | Baixa | Vídeo |
Trajetória precisa da câmera | Baixa | Vídeo / Modelo branco |
Timing quadro a quadro | Baixa | Vídeo / Edição |
Há apenas um critério de julgamento: quem tem a informação mais precisa?
A fonte mais precisa para o movimento é o vídeo do próprio movimento, não uma descrição dele em texto.
5 coisas que você não deve escrever em um prompt
1. Descrições de atmosfera empilhadas com adjetivos

O guia oficial afirma: "Evite empilhar adjetivos." E continua: "Ser específico sobre movimento e escolha de lente geralmente funciona melhor."
2. "Nomes" de movimentos
Nomes conceituais como playful cheeky mini-dance geram uma variação de resultado tão ampla quanto a variação de interpretação.
Na prática, essa instrução retornou um vídeo de alguém dançando na frente de outras pessoas: "se aproximando do par -> estendendo as mãos -> olhando para o par." O objetivo era "andar sozinho fazendo graça, com movimento um pouco bagunçado e rápido," que nem chega a ser uma dança.
3. Decompor em texto os movimentos de partes do corpo

Mesmo reescrevendo ao decompor como os braços balançam, como os ombros se movem e como a câmera reage em sincronia em cada parte, o resultado não mudou. O guia oficial diz que referências de movimento são "mais úteis do que um parágrafo longo e vago."
Mesmo que você decomponha e alongue o texto, ele não vai alcançar a densidade de informações de uma única referência.
4. Informações que o material de referência já possui

Os exemplos oficiais de prompt especificam quais informações extrair de cada referência.
" Do @Clay Render 1, use como referência o movimento da câmera, o ritmo, as transições de tamanho de plano, a trajetória do sujeito e o posicionamento.
Do @Image 2, use como referência o design do personagem, a cena, os materiais, a iluminação, as cores e a atmosfera."
Se você escrever no texto informações que a referência já possui, a referência e o texto vão começar a dizer coisas diferentes, levando a uma quebra.
5. Instruções mutuamente contraditórias
Parágrafos densos fazem as instruções se chocarem internamente. No momento em que uma instrução impossível é misturada, a IA decide por conta própria qual delas descartar.
5 coisas que você deve escrever em um prompt
1. O papel de cada arquivo de referência

A instrução do guia oficial é "mencione claramente os papéis das referências." Os papéis listados incluem identidade do produto, consistência do personagem, movimento via modelo branco, atuação em cromaqui, áudio, estilo e correções parciais. Os papéis não são determinados apenas pelo anexo dos arquivos.
2. O que NÃO usar daquela referência
Ao atribuir papéis, diga com clareza quais informações você não quer que ela absorva. Esta formulação funcionou de verdade:
Não copie o local, as roupas, o texto, as pessoas ou a história de @Video1. Copie apenas o ritmo do corpo, os gestos dos braços, o ritmo da caminhada e o movimento de câmera ligado ao corpo.
Separe assim: "Imite apenas o movimento; não imite o local, as roupas ou as pessoas."
3. Enumeração de elementos inegociáveis

O guia oficial de referência de movimento orienta a construção do prompt assim: "Comece nomeando as referências enviadas e depois liste os detalhes inegociáveis."
- identidade
- formato
- escala
- planta baixa
- design do produto
- pose
- timing
- voz
- ordem dos planos
4. O que manter e o que mudar
Escreva separadamente o que manter (atuação, timing, olhar, posicionamento, movimento de câmera) e o que mudar (pessoa, ambiente, figurino). Sem essa distinção, a IA fica livre para refazer tudo.
5. Prioridades
Especifique o que proteger primeiro em situações em que nem tudo pode ser seguido ao mesmo tempo. Em um prompt real, foi escrito assim:
PRIORIDADE: 1. Corresponder ao ritmo do corpo e ao movimento dos braços de @Video1. 2. Corresponder ao movimento de câmera ligado ao corpo de @Video1. 3. Preservar a perspectiva POV e o ambiente de @Image1. 4. Manter o movimento brincalhão e casual, em vez de coreografado.
Decida a "resposta correta" primeiro
Divida o vídeo desejado em elementos e decida qual "material guarda a resposta correta" para cada elemento.
Elemento | Onde guardar a resposta correta | Motivo |
|---|---|---|
Rosto / Identidade da pessoa | Imagem | Texto não consegue manter a identidade |
Movimento corporal, posicionamento, olhar, timing | Vídeo | Declarado oficialmente como alvo de controle da referência de vídeo |
Estrutura espacial, trajetória da câmera | Modelo branco (3D sem textura) | Oficial: "Eficaz quando espaço, caminho da câmera e posição relativa são mais importantes do que a textura final" |
Ações humanas, demonstração de produto | Material em cromaqui | Declarado oficialmente como caso de uso |
Visão de mundo, local, significado, prioridade | Prompt | A área em que o texto é mais forte |
Formato dos móveis, objetos pequenos, detalhes de fundo | Deixar para a IA | Não há necessidade de fixar |


Além disso, divida o grau de controle de cada elemento em três níveis:
- Fixo: Não permitir recriação arbitrária (pessoa, formato do produto, material original de movimento).
- Guiado: Dar direção, mas permitir interpretação (apartamento de luxo, noite, iluminação quente, atmosfera divertida).
- Automático: Deixar para a IA (formato do sofá, objetos na estante, detalhes na parede).
Se você fixar tudo, o vídeo fica artificial; se deixar tudo no automático, ele se desvia do objetivo. Projetar onde fixar e onde soltar é o trabalho do prompt.
3 maneiras de criar. Grave os movimentos difíceis primeiro
Método | Situações adequadas |
|---|---|
Deixar a IA criar tudo | Mundos inexistentes, movimentos simples, visão de mundo forte |
Fornecer amostras para criar | Rosto/formato do produto fixo, deseja continuar a composição |
Gravar primeiro, depois alterar | Movimentos complexos, contato humano, interação entre várias pessoas |
O motivo pelo qual o terceiro método é importante é que a própria ByteDance lista a "estabilidade de cenas em que múltiplos sujeitos interagem" como uma área de melhoria no Seedance 2.5. É uma batalha perdida tentar forçar, por meio do texto, uma área em que o próprio desenvolvedor admite ter dificuldade.

O método "gravar primeiro" funciona porque troca o trabalho da IA de "inventar a atuação" para "alterar a aparência de uma atuação que já está estabelecida." O posicionamento, o timing, o olhar e o contato são definidos pelo material filmado por humanos, enquanto a IA cuida apenas da identidade e do ambiente.
No X, foi compartilhado um caso em que um único material com três pessoas diferentes foi convertido para que as três fossem a mesma pessoa. (Usando o Seedance 2.0, quem postou explicou que não foram usadas composição nem máscaras. Como é uma publicação de terceiros, os detalhes do processo de produção não foram verificados.)
Também há casos claros em que ele não é adequado.
Gerar tudo sem material de origem, contato complexo demais, rostos completamente escondidos, ambiguidade sobre quem está onde ou posicionamento já quebrado na etapa do material de origem.
Se esses cinco casos se aplicarem, gravar primeiro não vai resolver.
O template de prompt apresentado pela ByteDance
A ordem básica é:
Sujeito (Quem/O quê) -> Ação (Faz o quê) -> Câmera (Como filmar) -> Estilo (Qual textura)
Para um plano único de 30 segundos, o guia oficial ainda mostra a divisão de tempo:
- 00–06s: Mostrar a situação com um plano aberto
- 06–14s: Entrar no movimento principal com um close-up
- 14–24s: Desenvolver movendo a câmera ou adicionando inserções
- 24–30s: Convergir
Template para preencher e usar quando for usar referências👇
1REFERÊNCIAS:2@Image1 = [Papel]. Use apenas [Informações a usar] daqui. Não use [Informações a não usar].3@Video1 = [Papel]. Use apenas [Informações a usar] daqui. Não use [Informações a não usar].45AÇÃO:6[Quem] [Onde] [Faz o quê].7[Qualidade do movimento. Escreva se é rápido ou lento, bagunçado ou contido, e para quem é direcionado, em vez de "um movimento chamado X"]89CÂMERA:10[Tipo de ponto de vista / Ângulo de visão da lente].11[Com o que a câmera se move em sincronia].12[Comportamentos de câmera que não devem acontecer].1314ATUAÇÃO:15[Temperatura da atuação. Está sendo mostrada para alguém ou feita sozinha?]1617AMBIENTE:18[Local, horário, caráter da luz. Não especifique detalhes]1920PRESERVAR / ALTERAR:21Manter = [Atuação / Timing / Olhar / Posicionamento / Movimento de câmera]22Mudar = [Pessoa / Ambiente / Figurino]2324PRIORIDADE:251. [Coisa a proteger com maior prioridade]262. [Coisa a proteger em seguida]273. [Em seguida]
Este template é eficaz não porque reduz a quantidade de texto.
É porque o papel do texto muda de "descrever o vídeo" para "definir a divisão de papéis dos materiais."
O vídeo guarda a resposta correta para o movimento, a imagem guarda a resposta correta para o rosto e o modelo branco guarda a resposta correta para o espaço. O prompt decide a disposição deles.
Obrigado por ler até o fim.
No X ([@casthirotaka](https://x.com/@casthirotaka)), compartilho todos os dias histórias que são úteis para esse tipo de trabalho prático.
Ficaria feliz se você me seguisse.





