SeedVideo AI

Wan 3.0 免费体验:30 秒带声视频一次生成

阿里 Wan 3.0 支持文字、首尾帧和参考素材,一次生成 2-30 秒、最高 1080p 的视频,台词、音效和配乐同步产出。 立即免费在线试用 Wan 3.0!

快速查看

Wan 3.0 核心规格

打开生成器前,先用这些信息判断 Wan 3.0 是否适合你的这次视频任务。

开发方Wan 3.0 由阿里巴巴 Wan(通义万相)团队开发;SeedVideo AI 是独立接入平台,与阿里巴巴无隶属关系。
正式发布阿里云于 2026 年 8 月 24 日正式发布 Wan 3.0,此前于 8 月 6 日开启公测。
时长单次生成 2-30 秒,是上一代 Wan 2.7 模型 15 秒上限的两倍。
输入模式文生视频、带首尾帧的图生视频、以及单次最多 10 张图加 5 条视频的参考生视频;API 层面还接受音频、文档(PDF/DOC/XLS/PPT/Markdown)和公开网页。
输出设置SeedVideo AI 为 Wan 3.0 提供 2-30 秒时长滑杆、480p / 720p / 1080p 分辨率、含自适应在内的六种画幅比例和声音开关。
音频默认生成人声、音效和背景音乐,对白带口型对齐;音频不额外计费。
适合做什么长镜头叙事短片、对白场景、带声产品广告,以及需要超过 15 秒的参考素材驱动的连续镜头。

Wan 官方来源

概览影片为阿里官方 Wan 3.0 演示片;四条能力演示均由本站 Wan 3.0 生成,旁边即为生成时的完整提示词。

最后更新:

快速解答

快速了解 Wan 3.0

Wan 3.0 可以把提示词、首尾帧和参考素材生成最长 30 秒的带声视频,这四个问题覆盖大多数人最先想知道的事。

01

Wan 3.0 是什么?

Wan 3.0 是阿里巴巴的 AI 视频生成模型,2026 年 8 月 6 日开启公测、8 月 24 日由阿里云正式发布。它生成 2-30 秒自带音频的视频,支持文字、首尾帧、图片、视频和音频输入。

02

Wan 3.0 视频能有多长?

2 到 30 秒之间任意整数秒——是上一代 Wan 2.7 的两倍,也超过多数主流模型单次生成的长度。在 SeedVideo AI 上,生成前用滑杆直接设定精确时长。

03

Wan 3.0 会生成声音吗?

默认就会。Wan 3.0 在同一次生成里产出人声、音效和背景音乐,对白带口型对齐,且带声和无声价格相同。想要无声片段时关掉声音开关即可。

04

在本站可以给 Wan 3.0 输入什么?

文字提示词、首帧(可选加尾帧),以及最多 10 张参考图加 5 条参考视频。阿里的 API 层面还接受音频文件、文档和网页作为素材。

模型概览

Wan 3.0 是什么?

Wan 3.0 是阿里云于 2026 年 8 月 24 日发布的视频生成模型,把上一代 Wan 2.7 的 15 秒上限翻倍到 30 秒,并默认生成人声、音效和配乐。

本站实测生成

Wan 3.0 演示(附完整提示词)

四条片段全部由本站的 Wan 3.0 生成:多镜头一致性、口型对齐的对白、运动物理和非写实风格。每条下方就是生成时的原始提示词。

提示词01

三个镜头同一位咖啡师——纯文字提示下的跨镜头一致性。

A barista in a sunlit specialty coffee shop pours latte art into a white ceramic cup. Start on a close-up of the milk stream forming a rosetta, then cut to a medium shot as she slides the cup across the walnut counter to a customer, then a final close-up of steam curling above the finished pour. Same barista, same cafe, consistent lighting across all three shots. Warm tones, soft window light, gentle cafe ambience.

提示词02

原生音频:两个角色的口型对齐对白。

Two chess players in a dim study, face to face across an antique board. The older man in a grey cardigan moves his knight, taps the clock and says: "Your move." The young woman opposite smiles, slides her queen forward and answers: "Checkmate." Lip-synced dialogue, ticking clock, rain against the window. Moody warm lamplight, 35mm film look.

提示词03

手持跟拍镜头下可信的人体运动物理。

A parkour athlete sprints across a rooftop at dusk, vaults a ventilation duct, tucks into a roll and springs back to full sprint without breaking stride. Handheld tracking camera follows from the side, motion blur on the skyline, jacket and hair reacting to the wind, hard believable landings with dust kicked up. City lights flickering on below.

提示词04

超越写实的风格幅度,配乐同步产出。

Hand-painted watercolor animation: a paper sailboat drifts down a rain-swollen gutter stream past towering blades of grass, a snail watches from a leaf as the boat spins through a tiny whirlpool and rights itself, soft pigment blooms bleeding at the edges of every shape, visible paper grain, gentle piano and rain patter.

何时用它

什么时候选 Wan 3.0

当片段需要超过 10-15 秒、声音是叙事主角、或需要一组参考图和参考视频来控制输出时,选 Wan 3.0。

01

片段需要更长时

多数模型止步于 10-15 秒;Wan 3.0 单次可到 30 秒,一个场景可以完整地铺垫、转折、收尾,不用在剪辑软件里拼接。

02

声音是叙事主角时

台词、拟音和配乐在同一次生成里产出,口型对齐且不额外计费。想让角色说的话,用引号直接写进提示词。

03

需要参考素材控制输出时

最多叠加 10 张图和 5 条短视频来锁定角色、产品、运动或风格,并在提示词里说明每个编号素材负责控制什么。

三步工作流

如何在 SeedVideo AI 使用 Wan 3.0

好结果从清晰的主体、场景、运动和声音预期开始。选好模型,先生成第一版,再根据看到和听到的继续改提示词。

  1. 第 1 步

    写清创意方向

    写明主体、场景、镜头运动、风格和情绪。要对白就把台词放进引号;要声音就描述期望的环境音和配乐。

  2. 第 2 步

    打开 SeedVideo AI 并选择 Wan 3.0

    在模型菜单选 Wan 3.0,设置时长(2-30 秒)、分辨率和画幅,需要一致性时再附上首帧或参考素材。

  3. 第 3 步

    生成多版并持续优化提示词

    检查运动、一致性、声画同步和提示词还原度。保留有效的部分,重写模糊的部分,再生成下一版。

下一步

选择你的下一步

已有产品图或角色定妆照就从图生视频开始;想借用已有片段的运动或节奏就用视频转视频;还没定模型就先看对比。

01

从文字开始

打开文生视频工作台,Wan 3.0 已预选,直接写第一条提示词。

打开文生视频

02

从图片开始

上传产品图或角色定妆照作为首帧,可选再钉住尾帧。

打开图生视频

03

从已有视频开始

把现有片段的运动、节奏或风格作为参考,生成新版本。

打开视频转视频

04

查看免费额度与定价

规模化生成前,先比较免费试用、积分包和订阅方案。

查看定价

05

与 Seedance 2.5 对比

本站另一个 30 秒模型,参考素材上限更高,还有多镜头编辑模式。

阅读 2.5 指南

06

从 Wan 2.5 过来的?

Wan 2.5 只有 API、未接入本站——Wan 3.0 已接入,并在所有维度上取代它。

查看 Wan 2.5 页面

创作场景

用 Wan 3.0 能做什么

30 秒上限加原生音频,让 Wan 3.0 能一次完成那些短时长、无声模型覆盖不了的工作。

01

叙事短片

30 秒足够一个场景完成起承转合,一次生成完整片段,而不是拼接碎片。

02

对白场景

把台词写进引号,Wan 3.0 就会带口型、房间氛围音和配乐演出来,适合剧情节点、讲解和角色测试。

03

带声产品广告

画面和声底一次产出:产品运动、环境音和收尾节拍,直接可投社媒。

04

参考驱动的连续镜头

叠加参考图锁定角色或产品的跨镜头一致性,再在提示词里逐镜头指挥动作。

05

配乐驱动的片段

描述配乐和情绪,模型会按画面运动来配乐,适合情绪片、片头和转场。

06

风格化动画

水彩、水墨、赛璐璐等非写实风格能在全片长内保持稳定,声音风格同步匹配。

模型对比

Wan 3.0 vs Seedance 2.5 vs Veo 3.1

三个模型都能在本站直接使用。按真正影响生产的维度对比:时长、音频、参考控制和迭代成本。

特性Wan 3.0Seedance 2.5Veo 3.1
单次最长时长30 秒,2 秒起任意整数30 秒(多镜头模式)单次 8 秒
原生音频默认生成人声、音效、配乐,对白口型对齐生成音频,可开关支持模式下自带音频
参考控制单次最多 10 图 + 5 条视频单次最多 30 图 + 10 条视频首尾帧与图片参考
本站分辨率480p / 720p / 1080p480p / 720p / 1080p720p / 1080p
720p 积分单价每秒 2.4 积分每秒 7.6 积分按条计价,见定价页
最适合的生产场景长镜头、对白场景、带配乐片段重参考编辑、多镜头分镜高写实主镜头与成片级输出

常见问题

Wan 3.0 常见问题

模型能力、积分成本、输入限制和输出设置都会影响你的选择。

Wan 3.0 是阿里巴巴 2026 年 8 月 24 日发布的 AI 视频生成模型,支持文字、首尾帧和多模态参考,生成 2-30 秒自带音频的视频。

可以。打开 SeedVideo AI 生成器选择 Wan 3.0,新账号注册即送免费积分,无需信用卡。

Wan 3.0 按输出秒数计费:480p 每秒 1.2 积分、720p 每秒 2.4 积分、1080p 每秒 4.8 积分。一条 5 秒 720p 视频 12 积分,带声与无声同价。

2 到 30 秒之间任意整数,生成前用时长滑杆设定。时长越长积分成本按比例增加。

支持。上传首帧锁定开场画面,可选再加尾帧钉住结尾。尾帧必须与首帧一起使用。

本站单次最多 10 张参考图和 5 条参考视频(每条 1-15 秒)。阿里 API 层面还接受最多 5 条音频、一份文档或一个公开网页。

不是。SeedVideo AI 是独立平台,与阿里巴巴无隶属关系。提到阿里是在描述 Wan 模型家族,不代表本站归属。

Wan 3.0 把 Wan 2.7 的 15 秒上限翻倍到 30 秒,指令遵循、跨镜头一致性和音频质量都有提升。Wan 2.5 和 2.7 未接入本站,Wan 3.0 已接入。

把提示词写成分镜单:主体、场景、镜头运动、切换、风格和声音。要口型对白就把台词放进引号,并描述期望的环境音和配乐。

Wan 3.0 · 最长 30 秒,自带音频

立即在 SeedVideo AI 试用 Wan 3.0

从一句提示词、一张首帧或一组参考出发,一次生成最长 30 秒、台词音效配乐齐备的视频。

立即开始
Wan 3.0 免费:AI 视频生成器 | 30 秒、原生音频