알리바바 통이완샹 기반

Wan 3.0 · 하나의 영상 모델, 세 가지 입구

알리바바 통이완샹 Wan 3.0이 OVOV에 등장했습니다. 프롬프트에서, 첫/끝 프레임에서, 또는 직접 준비한 참조 이미지·참조 영상·참조 오디오를 덧붙인 프롬프트에서 시작하세요 — 480P, 720P 또는 1080P로, 5초부터 30초까지, 네이티브 사운드트랙과 함께.

길이
비율
해상도

OVOV의 AI 영상 예시

OVOV 영상 모델(Veo 3.1, Kling, Seedance)로 만든 실제 생성 결과입니다. 클립에 마우스를 올리면 재생되고, 스피커 아이콘을 클릭하면 오디오를 들을 수 있습니다.

마우스 오버로 재생 · 스피커 클릭으로 음소거 해제

OVOV의 AI 영상 예시

OVOV 영상 모델(Veo 3.1, Kling, Seedance)로 만든 실제 생성 결과입니다. 클립에 마우스를 올리면 재생되고, 스피커 아이콘을 클릭하면 오디오를 들을 수 있습니다.

시네마틱

외계 판타지 세계

프래그런스

럭셔리 향수 광고

제품

제품 런칭 티저

여행

몰디브 여행 광고

액션

동양 무협 정상결전

영화

헐리우드 레이싱 영화

SF

우주선이 깊은 별들 속으로

라이프스타일

골든 리트리버와 나비

푸드

스시 셰프의 손길

패션

절벽 위의 빨간 드레스

게임 트레일러

심야의 고수 대결

Vlog

핸드헬드 셀피 Vlog

푸드

군침 도는 푸드 클로즈업

댄스

어반 스트리트 댄스

메이크업

럭셔리 립스틱 광고

Wan 3.0을 살펴봐야 하는 이유

텍스트도, 키프레임도, 직접 찍은 소재도 받는 하나의 모델. 최대 1080P로 렌더링하고, 최대 30초까지 가며, 화면을 만드는 동안 사운드트랙까지 스스로 씁니다.

멀티모달 참조

텍스트 투 비디오에서는 참조 이미지 최대 10장, 참조 영상 최대 5개(합계 15초), 참조 오디오 최대 5개(합계 15초)를 첨부할 수 있습니다. Wan 3.0은 캐릭터, 스타일, 움직임, 톤을 추측이 아니라 여러분의 소재에서 가져옵니다.

첫/끝 프레임 컨트롤

시작 이미지를, 원한다면 끝 이미지까지 주면 Wan 3.0이 그 사이의 움직임을 렌더링합니다. 제품 리빌, 변형, 비포/애프터 전개로 가는 가장 곧은 길입니다.

480P, 720P, 1080P

세 가지 해상도 등급, 진짜 1080P 출력까지 포함합니다. 먼저 480P로 크레딧 몇 개만 써서 아이디어를 다듬고, 실제로 내보낼 버전만 1080P로 렌더링하세요.

5초에서 30초까지

5, 10, 15, 20, 25, 30초의 여섯 가지 고정 길이. 5초 테스트는 잔돈 수준이고, 30초 풀 길이 광고도 한 번의 생성 안에 들어갑니다.

기본으로 켜져 있는 네이티브 오디오

Wan 3.0은 화면과 함께 환경음, 효과음, 동작에 맞는 소리를 씁니다. 스위치는 여러분 손에 있고, 오디오를 꺼도 가격은 달라지지 않습니다.

5가지 종횡비, 초 단위 과금

16:9, 9:16, 1:1, 4:3, 3:4. 크레딧은 초 단위로 과금되며 480P는 초당 3, 720P는 6, 1080P는 12입니다. 생성에 실패하면 전액 환불됩니다.

프롬프트, 키프레임 또는 소재에서 완성 클립까지

이미 가진 것에 맞는 입력을 고르세요. Wan 3.0은 화면과 소리를 같은 렌더링에서 처리하므로 나중에 조립할 것이 없습니다.

1

입구를 고르세요

프롬프트만 쓰거나, 첫 프레임을(원하면 끝 프레임까지) 올리거나, 프롬프트와 함께 참조 이미지·참조 영상·참조 오디오를 첨부하세요. 그런 다음 길이, 종횡비, 해상도를 정합니다.

2

Wan 3.0이 화면과 소리를 렌더링합니다

모델이 전체 길이에 걸친 움직임, 조명, 페이스를 설계한 뒤 영상과 그에 맞는 오디오 트랙을 렌더링합니다. 대부분의 작업은 1~5분 안에 끝나고, 긴 클립일수록 더 오래 걸립니다.

3

다운로드해서 사용하세요

오디오가 입혀진 완성 영상을 그대로 가져가세요 — 워터마크 없이, 상업적 사용 권한과 함께. 생성이 실패하면 크레딧은 곧바로 되돌아옵니다.

Wan 3.0이 잘하는 일

세 가지 입력 모드와 1080P 등급이면 커버 범위가 넓습니다: 완성된 광고, 세로형 소셜 컷, 직접 가진 소재를 이어 가는 연속성 작업, 그리고 긴 분위기 영상까지.

1080P 제품·브랜드 광고

풀 HD 30초 광고를 한 번의 렌더링으로. 도입, 시연, 혜택, 마무리가 소리까지 포함해 한 번의 생성 안에 들어갑니다.

  • 프리롤, 랜딩 페이지, 클라이언트 납품을 위한 1080P 출력
  • 와이드스크린에는 16:9, 전통적인 방송 화면비에는 4:3
  • 제품 사운드와 환경음을 화면과 함께 생성

세로형 소셜 쇼츠

9:16의 TikTok, Reels, Shorts를 5초 훅부터 30초 스토리까지. 오디오가 함께 나오므로 나중에 사운드 작업을 따로 할 필요가 없습니다.

  • 세로형 9:16, 또는 정사각 피드 게시물에는 1:1
  • 초당 3 크레딧인 480P로 초안을 만들고 720P나 1080P로 발행
  • 라이선스 음원 대신 네이티브 오디오

시리즈 전체의 일관성

생성할 때마다 같은 참조 이미지, 참조 영상, 참조 오디오를 붙이면 캐릭터, 제품, 톤이 클립을 넘나들며 어긋나지 않고 이어집니다.

  • 캐릭터와 스타일을 고정할 참조 이미지 최대 10장
  • 움직임과 카메라 워크를 위한 참조 영상 최대 5개
  • 소리의 결을 유지할 참조 오디오 최대 5개

여행과 분위기 영상

항공 스위핑, 해안 드라이브, 거리 산책처럼 숨 쉴 시간이 필요한 장면 — 그리고 그 장소를 팔아 주는 바람, 물, 도시의 소리까지.

  • 30초를 온전히 써야 하는 긴 드리프트 카메라 무빙
  • 환경음을 영상과 나란히 렌더링
  • 페이지 상단 히어로 영상에는 1080P

Wan 3.0 프롬프트 작성 가이드

Wan 3.0은 최대 20,000자까지 프롬프트를 받습니다. 대부분의 클립에 필요한 양보다 훨씬 넉넉하죠. 아래 습관들이 그 여유를 모델이 실제로 반응하는 것들에 쓰게 해 줍니다.

소재를 먼저 지목하고, 그다음 완성된 컷을 묘사하세요

쓰기 전에 입력 모드를 고르세요

세 모드는 서로 다른 프롬프트를 요구합니다. 텍스트 투 비디오는 장면 전체를 말로 떠받쳐야 합니다. 첫/끝 프레임은 구도가 이미 정해져 있으니 프롬프트는 움직임에 관한 것이 됩니다. 참조 모드는 첨부한 소재에서 무엇을 빌려 올지에 관한 것입니다.

  • 텍스트만: 배경, 대상, 카메라, 소리를 처음부터 묘사하세요
  • 첫/끝 프레임: 프레임 자체가 아니라 그 사이의 움직임을 묘사하세요
  • 참조(텍스트 투 비디오에서 첨부): 각 소재가 무엇을 맡는지 쓰세요 — 얼굴, 의상, 카메라 무빙, 톤

예시

"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."

참조 소재를 번호로 지목하세요

참조 모드에서는 소재를 직접 가리킬 수 있습니다 — 이미지 1, 영상 1, 오디오 1. 그러면 모델이 어떤 소재가 컷의 어느 부분을 맡는지 알게 되고, 모든 것을 뭉뚱그리지 않습니다.

  • 참조 이미지 최대 10장, 참조 영상 5개, 참조 오디오 5개
  • 참조 영상은 합계 15초, 참조 오디오도 합계 15초
  • 소재마다 역할을 하나씩 주세요: 인물의 정체성은 한 이미지에서, 카메라 무빙은 한 영상에서

예시

"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."

고른 길이에 맞춰 흐름을 설계하세요

30초는 꽤 긴 화면 시간입니다. 일어나야 할 순서대로 전개를 쓰지 않으면 모델이 하나의 아이디어를 30초 내내 붙들고 있습니다.

  • 배경으로 열고, 대상을 들이고, 그다음 움직임으로
  • 시간에 따라 변하는 것을 지목하세요: 빛, 날씨, 거리, 속도
  • 짧은 길이(5~10초)는 하나의 연속 동작에 어울립니다

예시

"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."

화면만이 아니라 소리도 쓰세요

오디오는 기본으로 생성되므로, 말하지 않은 것은 모델이 알아서 만들어 냅니다. 사운드 지시는 한두 줄이면 대개 결이 어긋나지 않습니다.

  • 환경음을 지목하세요: 유리를 때리는 비, 멀리서 오가는 차, 공간의 잔향
  • 동작에 맞는 소리를 지목하세요: 발소리, 엔진, 바람
  • 조용함을 요청하는 것도 유효한 지시입니다 — 절제된 사운드를 원하면 그렇게 쓰세요
  • 이미 원하는 톤이 있다면 참조 오디오를 첨부하세요

예시

"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."

칭찬하는 말 대신 시각적 사실을 쓰세요

stunning, epic, cinematic은 모델에게 아무것도 알려 주지 않습니다. 소재, 색, 빛의 방향, 힘 있는 동사가 알려 줍니다.

  • 빼세요: stunning, epic, breathtaking, gorgeous, masterpiece
  • 힘 있는 동사를 쓰세요: 내리친다, 흘러간다, 타오른다, 후려친다
  • 광원과 시간대를 지목하세요

예시

"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."

길이, 비율, 해상도를 먼저 정하세요

Wan 3.0은 5, 10, 15, 20, 25, 30초와 5가지 종횡비, 3가지 해상도를 제공합니다. 생성 전에 정해 두면 크레딧을 아끼고 구도도 어긋나지 않습니다.

  • 가로형은 16:9와 4:3, 세로형은 9:16과 3:4, 피드는 1:1
  • 480P로 초안(초당 3 크레딧), 720P(6)나 1080P(12)로 완성
  • 고른 프레임에 맞게 쓰세요 — 세로형은 대상을 가깝고 가운데에
  • 길이는 5, 10, 15, 20, 25, 30초로 고정 — 스토리보드를 그중 하나에 맞추세요

예시

"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."

자주 묻는 질문









지금 바로 AI 크리에이티브 여정을 시작하세요

OVOV에 참여하여 AI로 이미지·영상·음악·음성을 생성하고 무한한 창의력을 발휘하세요.
신규 가입 시 10개의 무료 크레딧 즉시 지급. 기다릴 필요 없이 바로 시작하세요.