알리바바 통이완샹 Wan 3.0이 OVOV에 등장했습니다. 프롬프트에서, 첫/끝 프레임에서, 또는 직접 준비한 참조 이미지·참조 영상·참조 오디오를 덧붙인 프롬프트에서 시작하세요 — 480P, 720P 또는 1080P로, 5초부터 30초까지, 네이티브 사운드트랙과 함께.
OVOV 영상 모델(Veo 3.1, Kling, Seedance)로 만든 실제 생성 결과입니다. 클립에 마우스를 올리면 재생되고, 스피커 아이콘을 클릭하면 오디오를 들을 수 있습니다.
마우스 오버로 재생 · 스피커 클릭으로 음소거 해제
OVOV 영상 모델(Veo 3.1, Kling, Seedance)로 만든 실제 생성 결과입니다. 클립에 마우스를 올리면 재생되고, 스피커 아이콘을 클릭하면 오디오를 들을 수 있습니다.
외계 판타지 세계
럭셔리 향수 광고
제품 런칭 티저
몰디브 여행 광고
동양 무협 정상결전
헐리우드 레이싱 영화
우주선이 깊은 별들 속으로
골든 리트리버와 나비
스시 셰프의 손길
절벽 위의 빨간 드레스
심야의 고수 대결
핸드헬드 셀피 Vlog
군침 도는 푸드 클로즈업
어반 스트리트 댄스
럭셔리 립스틱 광고
텍스트도, 키프레임도, 직접 찍은 소재도 받는 하나의 모델. 최대 1080P로 렌더링하고, 최대 30초까지 가며, 화면을 만드는 동안 사운드트랙까지 스스로 씁니다.
텍스트 투 비디오에서는 참조 이미지 최대 10장, 참조 영상 최대 5개(합계 15초), 참조 오디오 최대 5개(합계 15초)를 첨부할 수 있습니다. Wan 3.0은 캐릭터, 스타일, 움직임, 톤을 추측이 아니라 여러분의 소재에서 가져옵니다.
시작 이미지를, 원한다면 끝 이미지까지 주면 Wan 3.0이 그 사이의 움직임을 렌더링합니다. 제품 리빌, 변형, 비포/애프터 전개로 가는 가장 곧은 길입니다.
세 가지 해상도 등급, 진짜 1080P 출력까지 포함합니다. 먼저 480P로 크레딧 몇 개만 써서 아이디어를 다듬고, 실제로 내보낼 버전만 1080P로 렌더링하세요.
5, 10, 15, 20, 25, 30초의 여섯 가지 고정 길이. 5초 테스트는 잔돈 수준이고, 30초 풀 길이 광고도 한 번의 생성 안에 들어갑니다.
Wan 3.0은 화면과 함께 환경음, 효과음, 동작에 맞는 소리를 씁니다. 스위치는 여러분 손에 있고, 오디오를 꺼도 가격은 달라지지 않습니다.
16:9, 9:16, 1:1, 4:3, 3:4. 크레딧은 초 단위로 과금되며 480P는 초당 3, 720P는 6, 1080P는 12입니다. 생성에 실패하면 전액 환불됩니다.
이미 가진 것에 맞는 입력을 고르세요. Wan 3.0은 화면과 소리를 같은 렌더링에서 처리하므로 나중에 조립할 것이 없습니다.
프롬프트만 쓰거나, 첫 프레임을(원하면 끝 프레임까지) 올리거나, 프롬프트와 함께 참조 이미지·참조 영상·참조 오디오를 첨부하세요. 그런 다음 길이, 종횡비, 해상도를 정합니다.
모델이 전체 길이에 걸친 움직임, 조명, 페이스를 설계한 뒤 영상과 그에 맞는 오디오 트랙을 렌더링합니다. 대부분의 작업은 1~5분 안에 끝나고, 긴 클립일수록 더 오래 걸립니다.
오디오가 입혀진 완성 영상을 그대로 가져가세요 — 워터마크 없이, 상업적 사용 권한과 함께. 생성이 실패하면 크레딧은 곧바로 되돌아옵니다.
세 가지 입력 모드와 1080P 등급이면 커버 범위가 넓습니다: 완성된 광고, 세로형 소셜 컷, 직접 가진 소재를 이어 가는 연속성 작업, 그리고 긴 분위기 영상까지.
풀 HD 30초 광고를 한 번의 렌더링으로. 도입, 시연, 혜택, 마무리가 소리까지 포함해 한 번의 생성 안에 들어갑니다.
9:16의 TikTok, Reels, Shorts를 5초 훅부터 30초 스토리까지. 오디오가 함께 나오므로 나중에 사운드 작업을 따로 할 필요가 없습니다.
생성할 때마다 같은 참조 이미지, 참조 영상, 참조 오디오를 붙이면 캐릭터, 제품, 톤이 클립을 넘나들며 어긋나지 않고 이어집니다.
항공 스위핑, 해안 드라이브, 거리 산책처럼 숨 쉴 시간이 필요한 장면 — 그리고 그 장소를 팔아 주는 바람, 물, 도시의 소리까지.
Wan 3.0은 최대 20,000자까지 프롬프트를 받습니다. 대부분의 클립에 필요한 양보다 훨씬 넉넉하죠. 아래 습관들이 그 여유를 모델이 실제로 반응하는 것들에 쓰게 해 줍니다.
소재를 먼저 지목하고, 그다음 완성된 컷을 묘사하세요
세 모드는 서로 다른 프롬프트를 요구합니다. 텍스트 투 비디오는 장면 전체를 말로 떠받쳐야 합니다. 첫/끝 프레임은 구도가 이미 정해져 있으니 프롬프트는 움직임에 관한 것이 됩니다. 참조 모드는 첨부한 소재에서 무엇을 빌려 올지에 관한 것입니다.
예시
"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."
참조 모드에서는 소재를 직접 가리킬 수 있습니다 — 이미지 1, 영상 1, 오디오 1. 그러면 모델이 어떤 소재가 컷의 어느 부분을 맡는지 알게 되고, 모든 것을 뭉뚱그리지 않습니다.
예시
"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."
30초는 꽤 긴 화면 시간입니다. 일어나야 할 순서대로 전개를 쓰지 않으면 모델이 하나의 아이디어를 30초 내내 붙들고 있습니다.
예시
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."
오디오는 기본으로 생성되므로, 말하지 않은 것은 모델이 알아서 만들어 냅니다. 사운드 지시는 한두 줄이면 대개 결이 어긋나지 않습니다.
예시
"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."
stunning, epic, cinematic은 모델에게 아무것도 알려 주지 않습니다. 소재, 색, 빛의 방향, 힘 있는 동사가 알려 줍니다.
예시
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
Wan 3.0은 5, 10, 15, 20, 25, 30초와 5가지 종횡비, 3가지 해상도를 제공합니다. 생성 전에 정해 두면 크레딧을 아끼고 구도도 어긋나지 않습니다.
예시
"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."