생성 비용 77% 깎는다…동영상 AI 업체의 이단 전략
작성일
시댄스 2.5, 초안 모드로 생성비 최대 77% 절감
480P 샘플 확인 후 1080P 완성본 출력하는 방식 도입

바이트댄스(ByteDance)의 영상 생성 AI 시댄스 2.5(Seedance 2.5)가 새로운 “초안(Draft)” 모드를 도입해 생성 비용을 대폭 낮췄다. 시댄스 2.5를 서비스하는 볼케이노 엔진(Volcano Engine)은 9월 22일(현지시각) 이 기능을 공개했다. 480P 저해상도 샘플로 장면을 먼저 점검한 뒤 1080P 완성본을 뽑아내는 2단계 구조로, 반복 생성 횟수가 많을수록 절감 효과가 커진다는 점이 특징이다.
480P로 미리 보고 1080P로 완성하는 2단계 구조
초안 모드는 영상 생성 과정을 샘플 미리보기와 최종 출력 두 단계로 나눈다. 제작자는 먼저 480P 저비용 샘플을 만들어 장면 구성과 인물 동작, 대화·음향 효과, 카메라 움직임의 리듬이 의도에 맞는지 확인할 수 있다. 프롬프트나 참조 자료를 다듬은 뒤에는 해당 샘플의 ID를 기반으로 1080P 최종 출력을 요청하는 방식이다.
이 과정에서 모델은 샘플에 쓰인 프롬프트와 참조 자료, 시드(seed)·화면비·길이 같은 핵심 파라미터를 다시 연동해 2차 추론을 수행한다. 볼케이노 엔진은 이를 통해 최종 출력물이 구조와 구성, 동작, 전반적인 연출 방향에서 샘플과 높은 일관성을 유지한다고 설명했다.
이런 구조는 저해상도로 여러 번 시험해보고 마음에 드는 결과가 나왔을 때만 고해상도로 전환하는 방식이어서, 처음부터 1080P로 여러 번 생성하는 것보다 시행착오 비용을 줄이는 데 초점이 맞춰져 있다. 샘플 ID를 기반으로 삼는다는 점은 같은 시드와 파라미터를 그대로 이어받아 최종본을 만든다는 뜻이다.

카드 20회 뽑으면 절감률 최대 77%
볼케이노 엔진이 공개한 자체 데이터에 따르면 입력 영상 없이 1080P 5초 분량 영상을 4회 생성(카드 드로우)할 경우 초안 모드로 비용 57%를 아끼고 생성 속도도 거의 두 배 빨라진다. 카드 드로우 횟수가 늘수록 절감 폭은 커져 20회 생성 시에는 절감률이 최대 77%까지 올라간다.
기존에 흔히 쓰이던 저해상도 생성 후 업스케일 방식과 비교하면 차이가 뚜렷하다는 설명이다. 초안 모드는 처음부터 1080P 네이티브 품질로 직접 출력해 디테일이 더 풍부하고 빛과 그림자의 층위, 색 채도도 자연스럽다. 다만 세부 질감이나 복잡한 패턴, 작은 글자, 고밀도 군중 장면의 인원 수 등에서는 미세한 변화가 생길 수 있다. 반면 샘플에서 확인된 화면 구조와 동작 표현은 그대로 유지된다는 게 볼케이노 엔진의 설명이다.
즉 5초짜리 짧은 영상을 여러 번 뽑아야 하는 작업일수록 초안 모드의 이득이 커지는 구조다. 4회 생성 기준 57%, 20회 생성 기준 77%라는 수치는 반복 시도가 많은 실험적 제작 환경에서 초안 모드를 우선 검토할 근거로 제시됐다.
런웨이·매그니픽·아트리스트 “업스케일보다 낫다”
초안 모드로 만든 결과물을 테스트한 외부 업체들의 평가도 소개됐다. 런웨이(Runway)는 초안 모드로 만든 1080P 최종 출력이 기존 주류 업스케일 전략과 세부적으로 차이가 있지만 결과물 자체는 더 낫다고 밝혔다. 매그니픽은 생성 속도가 빠르면서도 일관성이 안정적으로 유지된다고 평가했다.
아트리스트는 업스케일 알고리즘에서 흔히 나타나는 “AI 느낌”이 없다고 밝혔다. 480P 미리보기 단계에서 보였던 동작의 어색함도 1080P 렌더링 단계에서는 자연스럽게 보정된다고 덧붙였다.
세 업체의 평가는 공통적으로 저해상도에서 고해상도로 단순 업스케일하는 기존 방식과 초안 모드를 직접 비교하는 데 초점이 맞춰져 있다. 480P 단계에서 확인한 동작이나 구도가 1080P 단계에서 크게 바뀌지 않는다는 점이 세 업체 모두에서 공통적으로 언급됐다.
참조자료 최대 30장…캐릭터 영상 제작에도 특화
시댄스 2.5는 초안 모드 외에 오리지널 캐릭터 영상 제작을 겨냥한 기능도 갖추고 있다. 바이트댄스는 공개 발표에서 더 긴 오디오·비주얼 생성과 확장된 참조 기능을 지원한다고 밝혔다. 정식 모델 기준으로는 이미지 최대 30장, 동영상 클립 최대 10개, 오디오 클립 최대 10개를 참조 자료로 활용할 수 있다.
다만 같은 이름의 미니 버전을 선택하면 작동 한도가 달라질 수 있다는 점도 함께 언급됐다. 바이트댄스는 특정 구간만 골라 고치는 “타깃 편집” 기능도 시댄스 2.5의 특징으로 소개했다. 실제로 어떤 플랫폼에서 어떤 옵션이 제공되는지는 서비스마다 다를 수 있다.
캐릭터 영상 제작 가이드를 다룬 너드봇은 참조 자료를 많이 채우는 것보다 역할이 분명한 소규모 패킷을 쓰는 것이 검토하기 쉽다고 조언했다. 캐릭터 이미지는 의상과 얼굴을, 배경 이미지는 문과 창문의 위치를 정의하는 식으로 파일마다 역할을 나눠 지정하라는 설명이다. 사용하지 않는 의상 실험 이미지 등 서로 충돌하는 디자인은 패킷에서 빼는 것이 좋다고도 덧붙였다.
너드봇은 캐릭터 영상을 만들 때 동작 하나를 명확히 보여주는 장면을 우선하라고도 권했다. 옥상 온실 앞에 선 인물이 손잡이를 만져보고 창문 틈에서 나는 소리에 고개를 돌리는 정도의 단일 행동이, 도시 전체를 가로지르는 추격전보다 캐릭터의 성격을 더 명확히 드러낸다는 설명이다. 이 예시는 실제 생성 결과가 아니라 가이드가 제시한 연출 방향이라는 점도 함께 밝혔다.
너드봇은 또 결과물을 검토할 때 코트 윤곽이나 가방을 메는 어깨 방향, 조심스러운 자세 등 세 가지 정도의 연속성 기준을 미리 정해두라고 권했다. 영상의 시작·중간·끝을 각각 살펴 가방이 어깨를 바꿔 메지 않는지, 문 모양이 카메라 이동 후 달라지지 않는지, 손이 손잡이를 통과해 지나가지는 않는지를 확인하라는 구체적 검토 방법도 제시됐다. 프롬프트를 통째로 다시 쓰기보다 “카메라가 창문을 가린다”처럼 문제를 구체적으로 적어두고 부분만 수정하는 방식이 캐릭터와 장면의 참조 일관성을 유지하는 데 유리하다는 조언도 함께 나왔다.