01
Wan 3.0 是什麼?
Wan 3.0 是阿里巴巴的 AI 影片生成模型,2026 年 8 月 6 日開啟公測、8 月 24 日由阿里雲正式發布。它生成 2-30 秒自帶音訊的影片,支援文字、首尾幀、圖片、影片和音訊輸入。
阿里 Wan 3.0 支援文字、首尾幀和參考素材,一次生成 2-30 秒、最高 1080p 的影片,台詞、音效和配樂同步產出。 立即免費線上試用 Wan 3.0!
快速查看
打開生成器前,先用這些資訊判斷 Wan 3.0 是否適合你這次的影片任務。
| 開發方 | Wan 3.0 由阿里巴巴 Wan(通義萬相)團隊開發;SeedVideo AI 是獨立接入平台,與阿里巴巴無隸屬關係。 |
|---|---|
| 正式發布 | 阿里雲於 2026 年 8 月 24 日正式發布 Wan 3.0,此前於 8 月 6 日開啟公測。 |
| 時長 | 單次生成 2-30 秒,是上一代 Wan 2.7 模型 15 秒上限的兩倍。 |
| 輸入模式 | 文生影片、帶首尾幀的圖生影片、以及單次最多 10 張圖加 5 條影片的參考生影片;API 層面還接受音訊、文件(PDF/DOC/XLS/PPT/Markdown)和公開網頁。 |
| 輸出設定 | SeedVideo AI 為 Wan 3.0 提供 2-30 秒時長滑桿、480p / 720p / 1080p 解析度、含自適應在內的六種畫幅比例和聲音開關。 |
| 音訊 | 預設生成人聲、音效和背景音樂,對白對嘴型;音訊不額外計費。 |
| 適合做什麼 | 長鏡頭敘事短片、對白場景、帶聲產品廣告,以及需要超過 15 秒的參考素材驅動的連續鏡頭。 |
快速解答
Wan 3.0 可以把提示詞、首尾幀和參考素材生成最長 30 秒的帶聲影片,這四個問題涵蓋大多數人最想先知道的事。
01
Wan 3.0 是阿里巴巴的 AI 影片生成模型,2026 年 8 月 6 日開啟公測、8 月 24 日由阿里雲正式發布。它生成 2-30 秒自帶音訊的影片,支援文字、首尾幀、圖片、影片和音訊輸入。
02
2 到 30 秒之間任意整數秒——是上一代 Wan 2.7 的兩倍,也超過多數主流模型單次生成的長度。在 SeedVideo AI 上,生成前用滑桿直接設定精確時長。
03
預設就會。Wan 3.0 在同一次生成裡產出人聲、音效和背景音樂,對白對嘴型,且帶聲和無聲價格相同。想要無聲片段時關掉聲音開關即可。
04
文字提示詞、首幀(可選加尾幀),以及最多 10 張參考圖加 5 條參考影片。阿里的 API 層面還接受音訊檔案、文件和網頁作為素材。
模型概覽
Wan 3.0 是阿里雲於 2026 年 8 月 24 日發布的影片生成模型,把上一代 Wan 2.7 的 15 秒上限翻倍到 30 秒,並預設生成人聲、音效和配樂。
本站實測生成
四條片段全部由本站的 Wan 3.0 生成:多鏡頭一致性、對嘴型的對白、運動物理和非寫實風格。每條下方就是生成時的原始提示詞。
A barista in a sunlit specialty coffee shop pours latte art into a white ceramic cup. Start on a close-up of the milk stream forming a rosetta, then cut to a medium shot as she slides the cup across the walnut counter to a customer, then a final close-up of steam curling above the finished pour. Same barista, same cafe, consistent lighting across all three shots. Warm tones, soft window light, gentle cafe ambience.
Two chess players in a dim study, face to face across an antique board. The older man in a grey cardigan moves his knight, taps the clock and says: "Your move." The young woman opposite smiles, slides her queen forward and answers: "Checkmate." Lip-synced dialogue, ticking clock, rain against the window. Moody warm lamplight, 35mm film look.
A parkour athlete sprints across a rooftop at dusk, vaults a ventilation duct, tucks into a roll and springs back to full sprint without breaking stride. Handheld tracking camera follows from the side, motion blur on the skyline, jacket and hair reacting to the wind, hard believable landings with dust kicked up. City lights flickering on below.
Hand-painted watercolor animation: a paper sailboat drifts down a rain-swollen gutter stream past towering blades of grass, a snail watches from a leaf as the boat spins through a tiny whirlpool and rights itself, soft pigment blooms bleeding at the edges of every shape, visible paper grain, gentle piano and rain patter.
何時用它
當片段需要超過 10-15 秒、聲音是敘事主角、或需要一組參考圖和參考影片來控制輸出時,選 Wan 3.0。
01
多數模型止步於 10-15 秒;Wan 3.0 單次可到 30 秒,一個場景可以完整地鋪陳、轉折、收尾,不用在剪輯軟體裡拼接。
02
台詞、擬音和配樂在同一次生成裡產出,對嘴型且不額外計費。想讓角色說的話,用引號直接寫進提示詞。
03
最多疊加 10 張圖和 5 條短影片來鎖定角色、產品、運動或風格,並在提示詞裡說明每個編號素材負責控制什麼。
三步驟工作流
好結果從清晰的主體、場景、運動和聲音預期開始。選好模型,先生成第一版,再根據看到和聽到的持續改提示詞。
寫明主體、場景、鏡頭運動、風格和情緒。要對白就把台詞放進引號;要聲音就描述期望的環境音和配樂。
在模型選單選 Wan 3.0,設定時長(2-30 秒)、解析度和畫幅,需要一致性時再附上首幀或參考素材。
檢查運動、一致性、聲畫同步和提示詞還原度。保留有效的部分,重寫模糊的部分,再生成下一版。
下一步
已有產品圖或角色定裝照就從圖生影片開始;想借用既有片段的運動或節奏就用影片轉影片;還沒定模型就先看對比。
創作場景
30 秒上限加原生音訊,讓 Wan 3.0 能一次完成那些短時長、無聲模型涵蓋不了的工作。
01
30 秒足夠一個場景完成起承轉合,一次生成完整片段,而不是拼接碎片。
02
把台詞寫進引號,Wan 3.0 就會帶嘴型、空間氛圍音和配樂演出來,適合劇情節點、講解和角色測試。
03
畫面和聲底一次產出:產品運動、環境音和收尾節拍,直接可投社群。
04
疊加參考圖鎖定角色或產品的跨鏡頭一致性,再在提示詞裡逐鏡頭指揮動作。
05
描述配樂和情緒,模型會按畫面運動來配樂,適合情緒片、片頭和轉場。
06
水彩、水墨、賽璐璐等非寫實風格能在全片長內保持穩定,聲音風格同步匹配。
模型對比
三個模型都能在本站直接使用。按真正影響生產的維度對比:時長、音訊、參考控制和迭代成本。
| 特性 | Wan 3.0 | Seedance 2.5 | Veo 3.1 |
|---|---|---|---|
| 單次最長時長 | 30 秒,2 秒起任意整數 | 30 秒(多鏡頭模式) | 單次 8 秒 |
| 原生音訊 | 預設生成人聲、音效、配樂,對白對嘴型 | 生成音訊,可開關 | 支援模式下自帶音訊 |
| 參考控制 | 單次最多 10 圖 + 5 條影片 | 單次最多 30 圖 + 10 條影片 | 首尾幀與圖片參考 |
| 本站解析度 | 480p / 720p / 1080p | 480p / 720p / 1080p | 720p / 1080p |
| 720p 點數單價 | 每秒 2.4 點 | 每秒 7.6 點 | 按條計價,見定價頁 |
| 最適合的生產場景 | 長鏡頭、對白場景、帶配樂片段 | 重參考編輯、多鏡頭分鏡 | 高寫實主鏡頭與成片級輸出 |
常見問題
模型能力、點數成本、輸入限制和輸出設定都會影響你的選擇。