Como criar vídeos exatamente como imaginado: a maneira profissional de usar o Seedance 2.5

@casthirotaka
JAPONÊS15 de ago. de 2026
159K
165
24
2
600

TL;DR

Este guia explica como dominar o Seedance 2.5 tratando os prompts como instruções de direção em vez de descrições, usando referências de vídeo para lidar com movimentos complexos e consistência de personagens.

Quem está se desafiando com o Seedance 2.5 agora provavelmente está procurando o template do "prompt perfeito" e testando todas as ideias em que consegue pensar.

No entanto...

A responsabilidade de um prompt é mais restrita do que você imagina

O Seedance 2.5 aceita 30 imagens, 10 vídeos e 10 arquivos de áudio como referências em uma única geração (anunciado oficialmente pela ByteDance em 31 de julho de 2026).

Essa especificação indica que os prompts não têm a intenção de explicar tudo.

吉田洋孝|Cast Japan代表 - inline image

O que decidir

Adequação ao prompt

Onde guardar a resposta "correta"

Propósito do vídeo, visão de mundo, atmosfera

Alta

Prompt

Tipo de local, o que acontece

Alta

Prompt

O que manter, o que mudar

Muito alta

Prompt

Prioridades

Muito alta

Prompt

Direção da luz, sensação da lente

Média

Prompt / Imagem

Rosto da pessoa, identidade

Baixa

Imagem

Formato exato do produto

Baixa

Imagem

Movimentos corporais complexos

Baixa

Vídeo

Contato humano, posicionamento, olhar

Baixa

Vídeo

Trajetória precisa da câmera

Baixa

Vídeo / Modelo branco

Timing quadro a quadro

Baixa

Vídeo / Edição

Há apenas um critério de julgamento: quem tem a informação mais precisa?

A fonte mais precisa para o movimento é o vídeo do próprio movimento, não uma descrição dele em texto.

5 coisas que você não deve escrever em um prompt

1. Descrições de atmosfera empilhadas com adjetivos

吉田洋孝|Cast Japan代表 - inline image

O guia oficial afirma: "Evite empilhar adjetivos." E continua: "Ser específico sobre movimento e escolha de lente geralmente funciona melhor."

2. "Nomes" de movimentos

Nomes conceituais como playful cheeky mini-dance geram uma variação de resultado tão ampla quanto a variação de interpretação.

Na prática, essa instrução retornou um vídeo de alguém dançando na frente de outras pessoas: "se aproximando do par -> estendendo as mãos -> olhando para o par." O objetivo era "andar sozinho fazendo graça, com movimento um pouco bagunçado e rápido," que nem chega a ser uma dança.

3. Decompor em texto os movimentos de partes do corpo

吉田洋孝|Cast Japan代表 - inline image

Mesmo reescrevendo ao decompor como os braços balançam, como os ombros se movem e como a câmera reage em sincronia em cada parte, o resultado não mudou. O guia oficial diz que referências de movimento são "mais úteis do que um parágrafo longo e vago."

Mesmo que você decomponha e alongue o texto, ele não vai alcançar a densidade de informações de uma única referência.

4. Informações que o material de referência já possui

吉田洋孝|Cast Japan代表 - inline image

Os exemplos oficiais de prompt especificam quais informações extrair de cada referência.

" Do @Clay Render 1, use como referência o movimento da câmera, o ritmo, as transições de tamanho de plano, a trajetória do sujeito e o posicionamento.

Do @Image 2, use como referência o design do personagem, a cena, os materiais, a iluminação, as cores e a atmosfera."

Se você escrever no texto informações que a referência já possui, a referência e o texto vão começar a dizer coisas diferentes, levando a uma quebra.

5. Instruções mutuamente contraditórias

Parágrafos densos fazem as instruções se chocarem internamente. No momento em que uma instrução impossível é misturada, a IA decide por conta própria qual delas descartar.

5 coisas que você deve escrever em um prompt

1. O papel de cada arquivo de referência

吉田洋孝|Cast Japan代表 - inline image

A instrução do guia oficial é "mencione claramente os papéis das referências." Os papéis listados incluem identidade do produto, consistência do personagem, movimento via modelo branco, atuação em cromaqui, áudio, estilo e correções parciais. Os papéis não são determinados apenas pelo anexo dos arquivos.

2. O que NÃO usar daquela referência

Ao atribuir papéis, diga com clareza quais informações você não quer que ela absorva. Esta formulação funcionou de verdade:

Não copie o local, as roupas, o texto, as pessoas ou a história de @Video1. Copie apenas o ritmo do corpo, os gestos dos braços, o ritmo da caminhada e o movimento de câmera ligado ao corpo.

Separe assim: "Imite apenas o movimento; não imite o local, as roupas ou as pessoas."

3. Enumeração de elementos inegociáveis

吉田洋孝|Cast Japan代表 - inline image

O guia oficial de referência de movimento orienta a construção do prompt assim: "Comece nomeando as referências enviadas e depois liste os detalhes inegociáveis."

  • identidade
  • formato
  • escala
  • planta baixa
  • design do produto
  • pose
  • timing
  • voz
  • ordem dos planos

4. O que manter e o que mudar

Escreva separadamente o que manter (atuação, timing, olhar, posicionamento, movimento de câmera) e o que mudar (pessoa, ambiente, figurino). Sem essa distinção, a IA fica livre para refazer tudo.

5. Prioridades

Especifique o que proteger primeiro em situações em que nem tudo pode ser seguido ao mesmo tempo. Em um prompt real, foi escrito assim:

PRIORIDADE: 1. Corresponder ao ritmo do corpo e ao movimento dos braços de @Video1. 2. Corresponder ao movimento de câmera ligado ao corpo de @Video1. 3. Preservar a perspectiva POV e o ambiente de @Image1. 4. Manter o movimento brincalhão e casual, em vez de coreografado.

Decida a "resposta correta" primeiro

Divida o vídeo desejado em elementos e decida qual "material guarda a resposta correta" para cada elemento.

Elemento

Onde guardar a resposta correta

Motivo

Rosto / Identidade da pessoa

Imagem

Texto não consegue manter a identidade

Movimento corporal, posicionamento, olhar, timing

Vídeo

Declarado oficialmente como alvo de controle da referência de vídeo

Estrutura espacial, trajetória da câmera

Modelo branco (3D sem textura)

Oficial: "Eficaz quando espaço, caminho da câmera e posição relativa são mais importantes do que a textura final"

Ações humanas, demonstração de produto

Material em cromaqui

Declarado oficialmente como caso de uso

Visão de mundo, local, significado, prioridade

Prompt

A área em que o texto é mais forte

Formato dos móveis, objetos pequenos, detalhes de fundo

Deixar para a IA

Não há necessidade de fixar

吉田洋孝|Cast Japan代表 - inline image
吉田洋孝|Cast Japan代表 - inline image

Além disso, divida o grau de controle de cada elemento em três níveis:

  • Fixo: Não permitir recriação arbitrária (pessoa, formato do produto, material original de movimento).
  • Guiado: Dar direção, mas permitir interpretação (apartamento de luxo, noite, iluminação quente, atmosfera divertida).
  • Automático: Deixar para a IA (formato do sofá, objetos na estante, detalhes na parede).

Se você fixar tudo, o vídeo fica artificial; se deixar tudo no automático, ele se desvia do objetivo. Projetar onde fixar e onde soltar é o trabalho do prompt.

3 maneiras de criar. Grave os movimentos difíceis primeiro

Método

Situações adequadas

Deixar a IA criar tudo

Mundos inexistentes, movimentos simples, visão de mundo forte

Fornecer amostras para criar

Rosto/formato do produto fixo, deseja continuar a composição

Gravar primeiro, depois alterar

Movimentos complexos, contato humano, interação entre várias pessoas

O motivo pelo qual o terceiro método é importante é que a própria ByteDance lista a "estabilidade de cenas em que múltiplos sujeitos interagem" como uma área de melhoria no Seedance 2.5. É uma batalha perdida tentar forçar, por meio do texto, uma área em que o próprio desenvolvedor admite ter dificuldade.

吉田洋孝|Cast Japan代表 - inline image

O método "gravar primeiro" funciona porque troca o trabalho da IA de "inventar a atuação" para "alterar a aparência de uma atuação que já está estabelecida." O posicionamento, o timing, o olhar e o contato são definidos pelo material filmado por humanos, enquanto a IA cuida apenas da identidade e do ambiente.

No X, foi compartilhado um caso em que um único material com três pessoas diferentes foi convertido para que as três fossem a mesma pessoa. (Usando o Seedance 2.0, quem postou explicou que não foram usadas composição nem máscaras. Como é uma publicação de terceiros, os detalhes do processo de produção não foram verificados.)

Também há casos claros em que ele não é adequado.

Gerar tudo sem material de origem, contato complexo demais, rostos completamente escondidos, ambiguidade sobre quem está onde ou posicionamento já quebrado na etapa do material de origem.

Se esses cinco casos se aplicarem, gravar primeiro não vai resolver.

O template de prompt apresentado pela ByteDance

A ordem básica é:

Sujeito (Quem/O quê) -> Ação (Faz o quê) -> Câmera (Como filmar) -> Estilo (Qual textura)

Para um plano único de 30 segundos, o guia oficial ainda mostra a divisão de tempo:

  • 00–06s: Mostrar a situação com um plano aberto
  • 06–14s: Entrar no movimento principal com um close-up
  • 14–24s: Desenvolver movendo a câmera ou adicionando inserções
  • 24–30s: Convergir

Template para preencher e usar quando for usar referências👇

text
1REFERÊNCIAS:
2@Image1 = [Papel]. Use apenas [Informações a usar] daqui. Não use [Informações a não usar].
3@Video1 = [Papel]. Use apenas [Informações a usar] daqui. Não use [Informações a não usar].
4
5AÇÃO:
6[Quem] [Onde] [Faz o quê].
7[Qualidade do movimento. Escreva se é rápido ou lento, bagunçado ou contido, e para quem é direcionado, em vez de "um movimento chamado X"]
8
9CÂMERA:
10[Tipo de ponto de vista / Ângulo de visão da lente].
11[Com o que a câmera se move em sincronia].
12[Comportamentos de câmera que não devem acontecer].
13
14ATUAÇÃO:
15[Temperatura da atuação. Está sendo mostrada para alguém ou feita sozinha?]
16
17AMBIENTE:
18[Local, horário, caráter da luz. Não especifique detalhes]
19
20PRESERVAR / ALTERAR:
21Manter = [Atuação / Timing / Olhar / Posicionamento / Movimento de câmera]
22Mudar = [Pessoa / Ambiente / Figurino]
23
24PRIORIDADE:
251. [Coisa a proteger com maior prioridade]
262. [Coisa a proteger em seguida]
273. [Em seguida]

Este template é eficaz não porque reduz a quantidade de texto.

É porque o papel do texto muda de "descrever o vídeo" para "definir a divisão de papéis dos materiais."

O vídeo guarda a resposta correta para o movimento, a imagem guarda a resposta correta para o rosto e o modelo branco guarda a resposta correta para o espaço. O prompt decide a disposição deles.

Obrigado por ler até o fim.

No X ([@casthirotaka](https://x.com/@casthirotaka)), compartilho todos os dias histórias que são úteis para esse tipo de trabalho prático.

Ficaria feliz se você me seguisse.

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais