01
Wan 3.0이란?
Wan 3.0은 Alibaba의 AI 영상 생성 모델로, 2026년 8월 6일 공개 베타를 시작해 8월 24일 Alibaba Cloud가 정식 발표했습니다. 네이티브 오디오가 포함된 2-30초 클립을 생성하며 텍스트, 프레임, 이미지, 영상, 오디오를 입력으로 받습니다.
Alibaba의 Wan 3.0은 텍스트, 프레임, 레퍼런스를 최대 1080p의 2-30초 클립으로 바꿉니다. 대사, 효과음, 음악까지 한 번의 생성으로 나옵니다. 지금 Wan 3.0을 무료로 온라인에서 체험해 보세요!
한눈에 보기
생성기를 열기 전에, 이 정보로 Wan 3.0이 이번 영상 작업에 맞는지 판단하세요.
| 개발사 | Wan 3.0은 Alibaba의 Wan(통이완샹) 팀이 개발했습니다. SeedVideo AI는 독립 접속 플랫폼이며 Alibaba와 제휴 관계가 없습니다. |
|---|---|
| 정식 출시 | Alibaba Cloud가 2026년 8월 24일 Wan 3.0을 정식 발표했으며, 공개 베타는 8월 6일에 시작됐습니다. |
| 길이 | 한 번의 생성으로 2-30초. 이전 세대 Wan 2.7의 15초 상한의 두 배입니다. |
| 입력 모드 | 텍스트-영상, 시작/끝 프레임이 있는 이미지-영상, 요청당 최대 10장 이미지와 5개 클립의 레퍼런스-영상. API 차원에서는 오디오, 문서(PDF/DOC/XLS/PPT/Markdown), 공개 웹페이지도 받습니다. |
| 출력 설정 | SeedVideo AI는 Wan 3.0에 2-30초 길이 슬라이더, 480p / 720p / 1080p 해상도, 어댑티브 포함 6가지 화면 비율, 사운드 켬/끔 토글을 제공합니다. |
| 오디오 | 음성·효과음·배경음악을 기본 생성하며 대사는 립싱크. 오디오에 추가 요금이 없습니다. |
| 적합한 작업 | 롱테이크 내러티브 쇼트, 대사 장면, 소리가 있는 제품 광고, 15초를 넘는 레퍼런스 주도 시퀀스. |
Wan 공식 소스
개요 영상은 Alibaba 공식 Wan 3.0 쇼케이스입니다. 네 개의 기능 데모는 본 사이트의 Wan 3.0으로 생성했으며, 함께 표시된 프롬프트를 그대로 사용했습니다.
마지막 업데이트:
빠른 답변
Wan 3.0은 프롬프트, 프레임, 레퍼런스를 최대 30초의 오디오 포함 클립으로 만듭니다. 대부분이 가장 먼저 묻는 네 가지 질문에 답합니다.
01
Wan 3.0은 Alibaba의 AI 영상 생성 모델로, 2026년 8월 6일 공개 베타를 시작해 8월 24일 Alibaba Cloud가 정식 발표했습니다. 네이티브 오디오가 포함된 2-30초 클립을 생성하며 텍스트, 프레임, 이미지, 영상, 오디오를 입력으로 받습니다.
02
2초에서 30초 사이 아무 정수 길이나 가능합니다. 이전 세대 Wan 2.7의 15초 상한의 두 배이며, 대부분의 주류 모델이 한 번에 생성하는 길이를 넘어섭니다. SeedVideo AI에서는 생성 전에 슬라이더로 정확한 길이를 설정합니다.
03
기본으로 생성합니다. 한 번의 생성에서 음성, 효과음, 배경음악을 함께 만들고 대사는 립싱크됩니다. 소리 켬/끔의 가격이 같으며, 무음 클립이 필요하면 토글만 끄면 됩니다.
04
텍스트 프롬프트, 시작 프레임(선택적으로 끝 프레임 추가), 최대 10장의 레퍼런스 이미지와 5개의 레퍼런스 클립입니다. Alibaba API 차원에서는 오디오 파일, 문서, 웹페이지도 소재로 받습니다.
모델 개요
Wan 3.0은 Alibaba Cloud가 2026년 8월 24일 발표한 영상 생성 모델로, 이전 세대 Wan 2.7의 15초 상한을 30초로 두 배 늘리고 음성·효과음·음악을 기본으로 생성합니다.
본 사이트에서 생성
네 클립 모두 본 사이트의 Wan 3.0으로 생성했습니다: 멀티숏 일관성, 립싱크 대사, 신체 물리 표현, 비사실적 스타일. 각 클립 아래가 실제 사용한 프롬프트입니다.
A barista in a sunlit specialty coffee shop pours latte art into a white ceramic cup. Start on a close-up of the milk stream forming a rosetta, then cut to a medium shot as she slides the cup across the walnut counter to a customer, then a final close-up of steam curling above the finished pour. Same barista, same cafe, consistent lighting across all three shots. Warm tones, soft window light, gentle cafe ambience.
Two chess players in a dim study, face to face across an antique board. The older man in a grey cardigan moves his knight, taps the clock and says: "Your move." The young woman opposite smiles, slides her queen forward and answers: "Checkmate." Lip-synced dialogue, ticking clock, rain against the window. Moody warm lamplight, 35mm film look.
A parkour athlete sprints across a rooftop at dusk, vaults a ventilation duct, tucks into a roll and springs back to full sprint without breaking stride. Handheld tracking camera follows from the side, motion blur on the skyline, jacket and hair reacting to the wind, hard believable landings with dust kicked up. City lights flickering on below.
Hand-painted watercolor animation: a paper sailboat drifts down a rain-swollen gutter stream past towering blades of grass, a snail watches from a leaf as the boat spins through a tiny whirlpool and rights itself, soft pigment blooms bleeding at the edges of every shape, visible paper grain, gentle piano and rain patter.
언제 쓰나
클립이 10-15초를 넘어야 할 때, 소리가 이야기를 이끌 때, 레퍼런스 이미지와 클립 묶음으로 출력을 제어해야 할 때 Wan 3.0을 선택하세요.
01
대부분의 모델은 10-15초에서 멈춥니다. Wan 3.0은 한 번에 30초까지 가능해, 한 장면이 편집기에서 컷을 잇지 않고도 빌드업·전환·마무리를 완성합니다.
02
대사, 폴리, 음악이 한 생성에서 립싱크로 나오고 추가 크레딧도 들지 않습니다. 인물이 말할 대사는 따옴표로 프롬프트에 그대로 쓰세요.
03
이미지 최대 10장과 짧은 클립 5개를 쌓아 캐릭터, 제품, 움직임, 스타일을 고정하고, 프롬프트에서 각 Image/Video 번호가 무엇을 제어할지 지정하세요.
3단계 워크플로
좋은 결과는 명확한 피사체, 배경, 움직임, 사운드 의도에서 시작합니다. 모델을 고르고 첫 버전을 생성한 뒤, 보고 들은 것을 바탕으로 프롬프트를 다듬으세요.
피사체, 장소, 카메라 움직임, 스타일, 무드를 지정합니다. 대사는 따옴표에 넣고, 원하는 환경음과 음악도 묘사하세요.
모델 메뉴에서 Wan 3.0을 고르고 길이(2-30초), 해상도, 화면 비율을 설정한 뒤, 일관성이 필요하면 프레임이나 레퍼런스를 첨부합니다.
움직임, 일관성, 오디오 타이밍, 프롬프트 재현도를 확인합니다. 잘된 부분은 남기고 모호한 부분은 다시 써서 다음 버전을 생성하세요.
다음 단계
제품 사진이나 캐릭터 스틸이 있으면 이미지에서, 움직임을 기존 영상에서 가져오려면 영상에서 시작하고, 아직 모델을 고르는 중이면 먼저 비교하세요.
01
Wan 3.0이 미리 선택된 텍스트-영상 워크스페이스를 열고 첫 프롬프트를 쓰세요.
텍스트-영상 열기02
제품 사진이나 캐릭터 스틸을 시작 프레임으로 업로드하고, 선택적으로 끝 프레임도 고정하세요.
이미지-영상 열기03
기존 클립의 움직임, 리듬, 스타일을 레퍼런스로 새 Wan 3.0 버전을 생성하세요.
영상-영상 열기04
대량 생성 전에 무료 체험, 크레딧 팩, 구독 옵션을 비교하세요.
요금 보기05
본 사이트의 또 다른 30초 모델. 레퍼런스 상한이 더 크고 멀티숏 편집 모드도 있습니다.
2.5 가이드 읽기06
Wan 2.5는 API 전용이라 본 사이트에 없습니다. Wan 3.0은 탑재됐고 모든 면에서 2.5를 대체합니다.
Wan 2.5 페이지 보기크리에이티브 워크플로
30초 상한과 네이티브 오디오 덕분에, 짧고 무음인 모델이 한 번에 못 만드는 작업까지 Wan 3.0이 커버합니다.
01
30초면 도입-전환-마무리가 있는 장면을 조각 잇기가 아니라 하나의 연속된 영상으로 생성할 수 있습니다.
02
대사를 따옴표로 쓰면 Wan 3.0이 립싱크, 룸톤, 배경 음악까지 갖춰 연기합니다. 스토리 비트, 설명 영상, 캐릭터 테스트에 적합합니다.
03
영상과 사운드 베드를 한 번에: 제품 움직임, 환경음, 마무리 비트까지 소셜 게시에 바로 쓸 수 있습니다.
04
레퍼런스 이미지를 쌓아 캐릭터나 제품의 숏 간 일관성을 고정하고, 프롬프트로 숏마다 동작을 지시하세요.
05
음악과 무드를 묘사하면 모델이 화면 움직임에 맞춰 작곡합니다. 무드 필름, 인트로, 트랜지션에 유용합니다.
06
수채화, 잉크, 셀 등 비사실적 룩이 클립 전체 길이에서 안정적으로 유지되고 사운드 스타일도 맞춰집니다.
모델 비교
세 모델 모두 본 사이트에서 바로 사용할 수 있습니다. 실제 제작을 좌우하는 축——클립 길이, 오디오, 레퍼런스 제어, 반복 비용——으로 비교합니다.
| 항목 | Wan 3.0 | Seedance 2.5 | Veo 3.1 |
|---|---|---|---|
| 1회 최대 길이 | 30초, 2초부터 아무 정수나 | 30초(멀티숏 모드) | 1회 8초 |
| 네이티브 오디오 | 음성·효과음·음악 기본 생성, 대사 립싱크 | 오디오 생성, 켬/끔 가능 | 지원 모드에서 오디오 포함 |
| 레퍼런스 제어 | 요청당 최대 10 이미지 + 5 클립 | 요청당 최대 30 이미지 + 10 클립 | 시작/끝 프레임과 이미지 레퍼런스 |
| 본 사이트 해상도 | 480p / 720p / 1080p | 480p / 720p / 1080p | 720p / 1080p |
| 720p 크레딧 단가 | 초당 2.4 크레딧 | 초당 7.6 크레딧 | 클립 단위 과금, 요금 페이지 참조 |
| 가장 잘 맞는 제작 | 롱테이크, 대사 장면, 음악 있는 클립 | 레퍼런스 중심 편집, 멀티숏 스토리보드 | 고사실감 히어로 숏과 최종 품질 결과물 |
FAQ
모델 성능, 크레딧 비용, 입력 한도, 출력 설정 모두 선택에 영향을 줍니다.
Wan 3.0 · 최대 30초, 오디오 기본 켜짐
프롬프트 한 줄, 시작 프레임 한 장, 레퍼런스 묶음 어디서든 시작해 대사·효과음·음악이 갖춰진 최대 30초 클립을 한 번에 생성하세요.
지금 시작하기