현재 Seedance 2.5 에 도전하고 있는 분들은 '완벽한 프롬프트' 템플릿을 찾고, 떠오르는 모든 아이디어를 테스트하고 있을 가능성이 높습니다.
하지만...
프롬프트의 책임 범위는 생각보다 좁습니다
Seedance 2.5 는 단일 생성에서 30 개의 이미지, 10 개의 비디오, 10 개의 오디오 파일을 레퍼런스로 받아들입니다(ByteDance 공식 발표, 2026 년 7 월 31 일).
이 사양은 프롬프트가 모든 것을 설명하기 위한 것이 아님을 시사합니다.

결정할 사항 | 프롬프트 적합도 | '정답'을 보유한 곳 |
|---|---|---|
영상의 목적, 세계관, 분위기 | 높음 | 프롬프트 |
장소의 유형, 일어나는 일 | 높음 | 프롬프트 |
유지할 것, 바꿀 것 | 매우 높음 | 프롬프트 |
우선순위 | 매우 높음 | 프롬프트 |
조명 방향, 렌즈 느낌 | 중간 | 프롬프트 / 이미지 |
인물의 얼굴, 정체성 | 낮음 | 이미지 |
정확한 제품 형태 | 낮음 | 이미지 |
복잡한 신체 움직임 | 낮음 | 비디오 |
신체 접촉, 위치, 시선 | 낮음 | 비디오 |
정확한 카메라 궤적 | 낮음 | 비디오 / 화이트 모델 |
프레임별 타이밍 | 낮음 | 비디오 / 편집 |
판단 기준은 단 하나입니다: 누가 가장 정확한 정보를 가지고 있는가?
움직임에 대한 가장 정확한 출처는 그것을 텍스트로 설명한 것이 아니라 움직임 그 자체의 영상입니다.
프롬프트에 쓰지 말아야 할 5가지
1. 형용사를 잔뜩 쌓아 올린 분위기 묘사

공식 가이드는 이렇게 말합니다: "형용사를 잔뜩 쌓아 올리지 마세요." 이어서 "움직임과 렌즈 선택을 구체적으로 지정하는 것이 보통 더 효과적입니다."라고 설명합니다.
2. 움직임의 '이름'
playful cheeky mini-dance 같은 개념적인 이름은 해석의 범위만큼 결과의 범위도 넓게 만듭니다.
실제로 이 지시는 '파트너에게 다가가기 -> 손을 앞으로 내밀기 -> 파트너를 바라보기'라는, 다른 사람들 앞에서 춤을 추는 영상을 반환했습니다. 목표는 '혼자 걸으면서 장난치고, 약간 어수선하고 빠른 움직임'이었는데, 이는 춤이라고 할 수도 없습니다.
3. 신체 부위 움직임을 텍스트로 분해하기

팔이 흔들리는 방식, 어깨가 떨리는 방식, 카메라가 각 부위에 맞춰 반응하는 방식을 분해해서 다시 작성해도 출력은 바뀌지 않았습니다. 공식 가이드는 모션 레퍼런스가 '길고 모호한 문단보다 더 유용하다'고 말합니다.
분해해서 길게 늘린다고 해도 단일 레퍼런스 하나의 정보 밀도에는 미치지 못합니다.
4. 레퍼런스 자료가 이미 갖고 있는 정보

공식 프롬프트 예시는 각 레퍼런스에서 어떤 정보를 가져와야 하는지 구체적으로 지정합니다.
" @Clay Render 1 에서 카메라 움직임, 템포, 숏 크기 전환, 피사체의 궤적과 위치를 참조하세요.
@Image 2 에서 캐릭터 디자인, 장면, 재질, 조명, 색감과 분위기를 참조하세요."
레퍼런스가 이미 갖고 있는 정보를 텍스트에 적으면, 레퍼런스와 텍스트가 서로 다른 이야기를 하기 시작하면서 붕괴됩니다.
5. 서로 모순되는 지시
빽빽한 문단은 지시들이 내부적으로 충돌하게 만듭니다. 불가능한 지시가 섞이는 순간, AI 는 무엇을 버릴지 스스로 결정합니다.
프롬프트에 써야 할 5가지
1. 각 레퍼런스 파일의 역할

공식 가이드의 지시는 '레퍼런스 역할을 명확히 언급하세요'라는 것입니다. 제시된 역할로는 제품 정체성, 캐릭터 일관성, 화이트 모델을 통한 움직임, 그린 스크린 연기, 오디오, 스타일, 부분 수정이 있습니다. 역할은 파일을 첨부한다고 해서 정해지지 않습니다.
2. 그 레퍼런스에서 사용하지 말아야 할 것
역할을 부여하면서 가져오지 않았으면 하는 정보를 명확히 명시하세요. 이런 문구가 실제로 효과가 있었습니다:
@Video1 의 장소, 의상, 텍스트, 인물, 스토리는 복사하지 마세요. 신체 리듬, 팔 제스처, 보행 리듬, 신체 연동 카메라 모션만 복사하세요.
'움직임만 모방하고, 장소나 옷, 인물은 모방하지 마세요'라고 분리해서 지정하는 것입니다.
3. 타협할 수 없는 요소 나열하기

공식 모션 레퍼런스 가이드는 프롬프트 구성을 이렇게 지시합니다: "업로드한 레퍼런스의 이름을 먼저 지정하고, 그다음 타협할 수 없는 세부 사항을 나열하세요."
- 정체성
- 형태
- 스케일
- 평면도
- 제품 디자인
- 포즈
- 타이밍
- 음성
- 숏 순서
4. 유지할 것과 바꿀 것
유지할 것(연기, 타이밍, 시선, 위치, 카메라 움직임)과 바꿀 것(인물, 환경, 의상)을 따로 작성하세요. 이 구분이 없으면 AI 는 모든 것을 다시 만들 자유를 갖게 됩니다.
5. 우선순위
모든 것을 동시에 따를 수 없는 상황에서 무엇을 먼저 보호할지 지정하세요. 실제 프롬프트에서는 이렇게 작성되었습니다:
우선순위: 1. @Video1 의 신체 리듬과 팔 움직임을 일치시킵니다. 2. @Video1 의 신체 연동 카메라 모션을 일치시킵니다. 3. @Image1 의 POV 시점과 환경을 유지합니다. 4. 안무된 움직임보다 장난기 있고 캐주얼한 움직임을 유지합니다.
'정답'을 먼저 정하세요
원하는 영상을 요소로 분해하고, 각 요소에 대해 '어떤 자료가 정답을 보유하는지'를 결정하세요.
요소 | 정답을 보유한 곳 | 이유 |
|---|---|---|
얼굴 / 인물 정체성 | 이미지 | 텍스트는 정체성을 유지할 수 없음 |
신체 움직임, 위치, 시선, 타이밍 | 비디오 | 비디오 레퍼런스의 제어 대상으로 공식 명시됨 |
공간 구조, 카메라 궤적 | 화이트 모델(텍스처 없는 3D) | 공식: "최종 텍스처보다 공간, 카메라 경로, 상대적 위치가 더 중요할 때 효과적" |
인물의 동작, 제품 시연 | 그린 스크린 자료 | 공식에서 사용 사례로 명시됨 |
세계관, 장소, 의미, 우선순위 | 프롬프트 | 텍스트가 가장 강한 영역 |
가구 형태, 소품, 배경 디테일 | AI 에 맡김 | 고정할 필요 없음 |


또한 각 요소의 강제 강도를 세 가지 수준으로 나누세요:
- 고정: 임의로 다시 만드는 것을 허용하지 않음 (인물, 제품 형태, 원본 움직임 자료)
- 가이드: 방향을 제시하되 해석을 허용 (럭셔리 아파트, 밤, 따뜻한 조명, 재미있는 분위기)
- 자동: AI 에 맡김 (소파 모양, 책장의 소품, 벽면의 디테일)
모든 것을 고정하면 영상이 부자연스러워지고, 모든 것을 자동에 맡기면 목표에서 벗어납니다. 어디를 고정하고 어디를 느슨하게 둘지 설계하는 것이 프롬프트의 역할입니다.
제작 방법 3가지. 어려운 움직임은 먼저 촬영하세요
제작 방법 | 적합한 상황 |
|---|---|
AI 가 모든 것을 생성 | 존재하지 않는 세계, 단순한 움직임, 강한 세계관 |
샘플을 제공해 생성 | 얼굴/제품 형태가 고정되어 있고, 구도를 이어가고 싶을 때 |
먼저 촬영한 뒤 변경 | 복잡한 움직임, 신체 접촉, 여러 인물의 상호작용 |
세 번째 방법이 중요한 이유는 ByteDance 자체가 Seedance 2.5 의 개선 영역으로 '여러 피사체가 상호작용하는 장면의 안정성'을 꼽고 있기 때문입니다. 개발자가 어렵다고 인정한 영역을 텍스트로 억지로 관통하려는 것은 질 수밖에 없는 싸움입니다.

'먼저 촬영' 방식이 효과적인 이유는 AI 의 역할을 '연기를 창작하는 것'에서 '이미 확립된 연기의 외형을 변경하는 것'으로 대체하기 때문입니다. 위치, 타이밍, 시선, 접촉은 사람이 촬영한 자료에 담겨 있고, AI 는 정체성과 환경만 처리합니다.
X 에서는 서로 다른 세 명이 등장하는 단일 자료를 세 명 모두 동일 인물로 변환한 사례가 공유되었습니다. (게시자는 Seedance 2.0 을 사용했으며, 합성이나 마스크는 사용하지 않았다고 설명했습니다. 제3자 게시물이므로 제작 과정의 세부 내용은 검증되지 않았습니다.)
또한 명백히 적합하지 않은 경우도 있습니다.
소스 자료 없이 모든 것을 생성하는 경우, 접촉이 너무 복잡한 경우, 얼굴이 완전히 가려진 경우, 누가 어디에 있는지가 모호한 경우, 또는 소스 자료 단계에서 이미 위치가 깨져 있는 경우입니다.
이 다섯 가지에 해당한다면 먼저 촬영해도 해결되지 않습니다.
공식이 보여준 프롬프트 템플릿
기본 순서는 다음과 같습니다:
주체(누가/무엇) -> 행동(무엇을 하는지) -> 카메라(어떻게 촬영하는지) -> 스타일(어떤 질감인지)
30 초 단일 숏의 경우, 공식은 시간 배분까지 보여줍니다:
- 00–06 초: 와이드 숏으로 상황을 보여줍니다
- 06–14 초: 클로즈업으로 주요 움직임에 진입합니다
- 14–24 초: 카메라를 움직이거나 인서트를 추가해 전개합니다
- 24–30 초: 수렴합니다
레퍼런스를 사용할 때 채워서 쓰는 템플릿👇
1레퍼런스(REFERENCES):2@Image1 = [역할]. 여기서는 [사용할 정보]만 사용하세요. [사용하지 않을 정보]는 사용하지 마세요.3@Video1 = [역할]. 여기서는 [사용할 정보]만 사용하세요. [사용하지 않을 정보]는 사용하지 마세요.45행동(ACTION):6[누가] [어디서] [무엇을 하는지].7[움직임의 품질. 'X 라는 이름의 움직임'이 아니라 빠른지 느린지, 어수선한지 점잖은지, 누구를 향한 것인지 작성하세요.]89카메라(CAMERA):10[시점의 종류 / 렌즈 화각].11[카메라가 무엇과 연동해 움직이는지].12[절대 해서는 안 되는 카메라 동작].1314연기(PERFORMANCE):15[연기의 온도. 누군가에게 보여주는 연기인지 혼자 하는 행동인지?]1617환경(ENVIRONMENT):18[장소, 시간, 빛의 성격. 디테일은 지정하지 마세요.]1920유지 / 변경(PRESERVE / CHANGE):21유지 = [연기 / 타이밍 / 시선 / 위치 / 카메라 움직임]22변경 = [인물 / 환경 / 의상]2324우선순위(PRIORITY):251. [가장 높은 우선순위로 보호할 것]262. [다음으로 보호할 것]273. [그다음]
이 템플릿이 효과적인 이유는 작성 분량이 줄어들기 때문이 아닙니다.
텍스트의 역할이 '영상을 묘사하는 것'에서 '자료의 역할 분담을 지시하는 것'으로 바뀌기 때문입니다.
비디오는 움직임의 정답을, 이미지는 얼굴의 정답을, 화이트 모델은 공간의 정답을 보유합니다. 프롬프트는 그것들의 배치를 결정합니다.
끝까지 읽어 주셔서 감사합니다.
X ([@casthirotaka](https://x.com/@casthirotaka)) 에서는 이렇게 실무에 효과적인 이야기를 매일 공유하고 있습니다.
팔로우해 주시면 기쁘겠습니다.





