ByteDance Seed는 2026년 2월 12일 Seedance 2.0을 출시했습니다. Seedance 1.x만 써 봤다면, 익숙했던 프롬프트 작업 방식은 이제 대부분 맞지 않습니다. 공동 오디오-비디오 생성과 자동 멀티샷 카메라 플래닝이라는 두 가지 구조 변화가 무엇을 써야 하는지, 무엇을 업로드해야 하는지를 바꿔 놓았습니다.
Seedance 2.0은 1.x와 무엇이 달라졌나
Seedance 2.0은 ByteDance Seed의 통합 멀티모달 오디오-비디오 모델로, 2026년 2월 12일 공개되었습니다 . 가장 중요한 변화는 하나입니다. 오디오와 비디오가 별도 단계가 아니라 프레임 단위 인식을 바탕으로 한 번의 렌더 패스에서 생성되며, 그 결과 동기화된 듀얼 채널 스테레오가 만들어집니다 . 먼저 알아둘 점도 있습니다. 오디오는 기본값으로 꺼져 있는 경우가 많아 제출 전에 직접 켜야 합니다 .
두 번째로, 이제 모델은 자연어를 바탕으로 카메라 계획을 자동으로 세웁니다. 한 클립 안에서 위치, 움직임, 전환을 이어 붙이기 때문에 단일 테이크 생성기가 아니라 멀티샷 생성기에 가깝습니다 . 사용 범위는 4~15초 클립, 네이티브 480p 및 720p 출력이며, 최대 길이는 1.5의 12초에서 15초로 늘었습니다 .
세 번째 변화는 입력 처리입니다. 텍스트만 쓰는 대신 이미지 최대 9개, 비디오 클립 3개, 오디오 파일 3개를 업로드한 뒤 프롬프트 안에서 @멘션으로 각각 연결합니다. 예를 들어 @Image 1, @Video 1, @Audio 1처럼 쓰며, UI에서는 @ 키를 입력할 때 미디어 선택기가 나타납니다 . 모델 ID는 Volcano Engine, Doubao, Jimeng에서 doubao-seedance-2-0-260128이며, 지연 시간이 낮은 미리보기 반복 작업을 위한 "Seedance 2.0 Fast" 변형도 있습니다 .
프롬프트를 쓰기 전에 준비할 것

프롬프트를 한 줄 쓰기 전에 먼저 호스트를 고르고 레퍼런스 에셋을 준비하세요. Seedance 2.0의 품질은 문장보다 업로드한 자료에 더 크게 좌우됩니다. 해외 이용은 서드파티 플랫폼을 통해 이뤄집니다. Higgsfield는 전체 버전과 "Seedance 2.0 Fast"를 제공하며, Cinema Studio 3.0 디렉터 패널에서 배치 레퍼런스 고정과 시작/끝 프레임 제어를 지원합니다. getimg.ai는 상업적 권리가 포함된 유료 티어가 월 $8/month 정도부터 시작하며, PiAPI and Morphic도 있습니다. @ 미디어 선택기 UI는 호스트마다 다르므로, 사용하는 환경을 먼저 확인하세요.
먼저 정체성을 고정할 기준 이미지를 준비하세요. 별도 이미지 모델에서 피사체의 정면, 측면 프로필, 3/4 각도, 뒷모습 이미지를 생성한 뒤 @Image 레퍼런스로 넣으면 샷이 바뀌어도 캐릭터 일관성을 유지하는 데 도움이 됩니다(video: Dan Kieft). 움직임에는 원하는 카메라 무빙이나 동작 리듬을 보여 주는 2~4초짜리 레퍼런스 클립을 잘라 쓰세요. Seedance는 이를 스토리 내용이 아니라 카메라 동작의 기준으로 읽습니다 .
반복 작업 비용도 잡아 두세요. 크레딧 비용은 길이와 품질 모드에 따라 함께 늘어나므로, 전체 15초 720p 렌더를 돌리기 전에 4–8s and 480p에서 정체성과 카메라를 먼저 검증하는 편이 좋습니다 .
Seedance 2.0 프롬프트는 레이어로 쌓는다

가장 제어하기 쉬운 Seedance 2.0 프롬프트는 다섯 개 레이어를 순서대로 쌓는 방식입니다. ByteDance의 SeedVideoBench 2.0에서 모델은 피사체 충실도, 프롬프트 준수, 오디오-비주얼 싱크를 별도 차원으로 평가하기 때문입니다 . 각 레이어를 명시적으로 쓰면 모델이 즉흥적으로 해석할 여지가 줄어듭니다.
레이어 1 — 피사체. 캐릭터나 사물의 외형이 고정될 만큼 구체적으로 묘사하세요. 이미지-투-비디오에서는 이미지 보존 자체가 별도 축으로 평가되므로 보존 지시를 앞에 둡니다. 예: "preserve the person's face, outfit, composition, and color palette from reference image; animate only the scarf and background crowd; slow dolly-in" .
레이어 2 — @ 레퍼런스 조건 지정. 업로드한 모든 에셋을 호출하기 전에 역할별로 라벨링하고, 무엇이 바뀌어도 되는지 적으세요. 예: "Reference video A = motion rhythm, Image B = character identity, Audio C = ambience." 프롬프트 안에서는 플랫폼 UI가 미디어 선택기로 보여 주는 "@" 멘션 시스템, 즉 "@Image 1," "@Video 1," "@Audio 1"로 각 에셋을 연결합니다 .
레이어 3 — 타임라인 비트. 모델이 샷의 속도를 맞출 수 있도록 대괄호 타임스탬프로 이벤트를 표시하세요.
| 마커 | 비트(10초 클립) | 각 비트 = |
|---|---|---|
| [0s] | 장면 설정 | 타임스탬프 + 샷 유형 + 카메라 무빙 + 장면/조명 메모 |
| [3–4s] | 첫 번째 카메라 무빙 또는 동작 | |
| [6–7s] | 두 번째 비트 또는 감정 변화 | |
| [8–10s] | 유지 또는 퇴장 |
5초 클립이라면 [0s] [2s] [4s]로 압축하세요 .
레이어 4 — 촬영 용어. 모델은 실제 촬영 용어에 반응합니다. 예를 들어 "slow dolly in," "pan left/right," "tracking shot," "rack focus," "shallow depth of field"처럼 쓰세요. 싱크가 유지되도록 오디오에는 물리적 원인과 결과를 분명히 적습니다. "door closes; sound muffles," "light source moves left; shadows shift right"처럼요 .
레이어 5 — 전체 스타일 문장. 이어지는 시퀀스의 모든 샷 끝에는 일관된 스타일 문장을 하나 붙이세요. 예: "Cinematic 4K, film grain, anamorphic aspect ratio, warm shadows and cool highlights" .
AV 물리 실패와 프롬프트 우회법

Seedance 2.0의 가장 큰 약점은 화면 품질이 아니라 물리적 추론입니다. 독립 AV-Phys Bench 연구는 7개의 공동 오디오-비디오 모델을 평가해 Seedance 2.0을 종합 1위로 꼽았지만, 테스트한 모든 모델이 "견고한 물리 이해에는 아직 한참 멀었다"고 결론 내렸습니다 . 이벤트 기반 및 환경 기반 오디오-비주얼 전환은 모든 모델에서 반복적으로 실패합니다. 소리가 물리적 사건을 따라가야 하는 바로 그 순간에 동기화가 깨집니다(video: Dan Kieft).
해결책은 모델이 장면 맥락만으로 원인과 결과를 추론하게 두지 않는 것입니다. 연결 고리를 명시적으로 써야 합니다. "유리가 바닥에 떨어져 산산조각 난다; 날카로운 균열음 뒤에 정적이 온다" 또는 "문이 닫힌다; 주변 소리가 먹먹해진다"처럼요. 모호한 움직임 묘사는 오디오 비동기화를 만들기 쉬우므로, 각 이벤트마다 트리거와 소리상의 결과를 프롬프트 텍스트 안에 직접 지정하세요 .
두 번째로 큰 한계는 장면 컷이 없다는 점입니다. 모델은 한 샷 안에서의 부드러운 진행과 카메라 전환은 렌더링하지만, 서로 무관한 장면 사이를 컷으로 넘기지는 못합니다. 여러 장면으로 된 시퀀스가 필요하다면 각 샷을 따로 생성하고, 이전 클립의 마지막 프레임을 다음 클립의 시작 프레임으로 넣어 이어 붙이세요 .
리더보드 측면에서 ByteDance 논문은 2026년 4월 8일 기준 Arena.AI Elo를 T2V 1450 ±15, I2V 1449 ±11로 보고합니다 . 이는 지속적으로 관리되는 제3자 순위가 아니라 자체 보고된 특정 시점의 스냅샷입니다. 실시간 순위는 매주 바뀌므로 인용하기 전에 Arena.AI에서 확인하세요.
기본을 넘어서: 샷 이어 붙이기와 업스케일링
15초 한계를 넘는 시퀀스를 만들려면 각 샷을 하나의 단위로 다루세요. 정체성, 움직임, 카메라를 고정하기 위해 4~8초 길이로 생성한 뒤, 해당 클립의 마지막 프레임을 다음 프롬프트의 시작 프레임으로 넣습니다 . Higgsfield의 Cinema Studio 3.0은 디렉터 패널에서 시작 프레임과 종료 프레임 고정을 제공하며, 이는 Seedance 2.0에 없는 네이티브 장면 컷 지원을 현실적으로 대체하는 방법입니다 (video: Dan Kieft).
4K 납품이 필요하다면 네이티브 720p로 생성한 뒤, 4K 출력과 프레임레이트 보간을 지원하는 Higgsfield 번들 Topaz Video 업스케일러에 결과물을 통과시키세요. 프롬프트에 "4K"라고 쓰는 것은 네이티브 출력 해상도에 영향을 준다는 문서화된 근거가 없습니다 (video: Creating with Conor).
운영상 주의할 점도 있습니다. Motion Picture Association은 ByteDance에 무단 학습 데이터 사용을 주장하며 2026년 2월 27일 답변 기한의 중지 요구 서한을 보냈습니다 . 프롬프트에는 알아볼 수 있는 IP, 즉 캐릭터 이름, 스튜디오 프랜차이즈, 상표화된 미학을 피하고, 대신 직접 만든 레퍼런스 시트를 사용하세요.
자주 묻는 질문
Seedance 2.0에서 만들 수 있는 클립의 최대 길이는?
직접 오디오-비디오 생성은 4초에서 15초까지 가능합니다 . 15초 한도는 Seedance 1.5의 최대 12초보다 늘어난 것이며, 크레딧 비용은 길이와 품질 모드에 따라 함께 증가합니다 . 더 긴 출력이 필요하다면 하나의 긴 클립을 요청하지 말고, 별도 샷을 생성한 뒤 이전 클립의 마지막 프레임을 다음 클립의 시작 프레임으로 넣어 이어 붙이세요.
Seedance 2.0에서 오디오 생성을 켜는 방법은?
Higgsfield를 포함한 대부분의 호스트에서는 오디오가 기본적으로 꺼져 있으므로, 프롬프트를 제출하기 전에 플랫폼 UI에서 직접 켜야 합니다 . 이 설정은 텍스트-투-비디오, 이미지-투-비디오, 레퍼런스-투-비디오 모드 전반에 적용됩니다. 켜는 것을 잊으면 모델은 오류 메시지 없이 무음 결과물을 반환하므로, 소리가 없을 때는 프롬프트보다 토글 설정을 먼저 확인하세요.
Seedance 2.0은 네거티브 프롬프트를 지원하나요?
아니요. 문서화된 전용 네거티브 프롬프트 필드는 없습니다 . 대신 포지티브 프롬프트 안에 명시적인 제약 문장을 넣으세요. 예를 들어 "배경 하늘만 교체하고, 캐릭터 자세, 입술 움직임, 전경 조명은 그대로 유지"처럼 작성합니다. 제외하고 싶은 것을 나열하는 것보다 고정해야 하는 영역을 이름 붙여 지정하는 편이 더 안정적입니다.
여러 개의 이어진 클립에서 캐릭터를 일관되게 유지하려면?
정면, 측면, 3/4 각도, 뒷모습이 담긴 다각도 레퍼런스 시트를 만든 뒤, 해당 캐릭터가 등장하는 모든 프롬프트에 그 프레임들을 @Image 레퍼런스로 업로드하세요 . Higgsfield의 Cinema Studio 3.0 디렉터 패널은 표준 인터페이스에는 없는 배치 레퍼런스 고정과 시작 프레임/종료 프레임 제어를 추가합니다. 시각적 연속성이 한 샷에서 다음 샷으로 이어지도록 시작 프레임 고정으로 클립을 연결하세요.
Arena.AI 1위 순위는 독립 결과인가요?
정확히는 아닙니다. T2V 1450 ±15, I2V 1449 ±11이라는 Elo 점수는 독립적으로 유지되는 수치가 아니라, 2026년 4월 8일자 스냅샷으로 ByteDance 자체 논문에 실린 값입니다 . 7개의 공동 오디오-비디오 모델을 평가한 독립 AV-Phys Bench 연구도 Seedance 2.0의 종합 선두는 확인했지만, 물리적 추론에서 상당한 결함을 지적했습니다 . 현재 순위는 Arena.AI에서 직접 확인하세요.