01
Wan 3.0 是什么?
Wan 3.0 是阿里巴巴的 AI 视频生成模型,2026 年 8 月 6 日开启公测、8 月 24 日由阿里云正式发布。它生成 2-30 秒自带音频的视频,支持文字、首尾帧、图片、视频和音频输入。
阿里 Wan 3.0 支持文字、首尾帧和参考素材,一次生成 2-30 秒、最高 1080p 的视频,台词、音效和配乐同步产出。 立即免费在线试用 Wan 3.0!
快速查看
打开生成器前,先用这些信息判断 Wan 3.0 是否适合你的这次视频任务。
| 开发方 | Wan 3.0 由阿里巴巴 Wan(通义万相)团队开发;SeedVideo AI 是独立接入平台,与阿里巴巴无隶属关系。 |
|---|---|
| 正式发布 | 阿里云于 2026 年 8 月 24 日正式发布 Wan 3.0,此前于 8 月 6 日开启公测。 |
| 时长 | 单次生成 2-30 秒,是上一代 Wan 2.7 模型 15 秒上限的两倍。 |
| 输入模式 | 文生视频、带首尾帧的图生视频、以及单次最多 10 张图加 5 条视频的参考生视频;API 层面还接受音频、文档(PDF/DOC/XLS/PPT/Markdown)和公开网页。 |
| 输出设置 | SeedVideo AI 为 Wan 3.0 提供 2-30 秒时长滑杆、480p / 720p / 1080p 分辨率、含自适应在内的六种画幅比例和声音开关。 |
| 音频 | 默认生成人声、音效和背景音乐,对白带口型对齐;音频不额外计费。 |
| 适合做什么 | 长镜头叙事短片、对白场景、带声产品广告,以及需要超过 15 秒的参考素材驱动的连续镜头。 |
快速解答
Wan 3.0 可以把提示词、首尾帧和参考素材生成最长 30 秒的带声视频,这四个问题覆盖大多数人最先想知道的事。
01
Wan 3.0 是阿里巴巴的 AI 视频生成模型,2026 年 8 月 6 日开启公测、8 月 24 日由阿里云正式发布。它生成 2-30 秒自带音频的视频,支持文字、首尾帧、图片、视频和音频输入。
02
2 到 30 秒之间任意整数秒——是上一代 Wan 2.7 的两倍,也超过多数主流模型单次生成的长度。在 SeedVideo AI 上,生成前用滑杆直接设定精确时长。
03
默认就会。Wan 3.0 在同一次生成里产出人声、音效和背景音乐,对白带口型对齐,且带声和无声价格相同。想要无声片段时关掉声音开关即可。
04
文字提示词、首帧(可选加尾帧),以及最多 10 张参考图加 5 条参考视频。阿里的 API 层面还接受音频文件、文档和网页作为素材。
模型概览
Wan 3.0 是阿里云于 2026 年 8 月 24 日发布的视频生成模型,把上一代 Wan 2.7 的 15 秒上限翻倍到 30 秒,并默认生成人声、音效和配乐。
本站实测生成
四条片段全部由本站的 Wan 3.0 生成:多镜头一致性、口型对齐的对白、运动物理和非写实风格。每条下方就是生成时的原始提示词。
A barista in a sunlit specialty coffee shop pours latte art into a white ceramic cup. Start on a close-up of the milk stream forming a rosetta, then cut to a medium shot as she slides the cup across the walnut counter to a customer, then a final close-up of steam curling above the finished pour. Same barista, same cafe, consistent lighting across all three shots. Warm tones, soft window light, gentle cafe ambience.
Two chess players in a dim study, face to face across an antique board. The older man in a grey cardigan moves his knight, taps the clock and says: "Your move." The young woman opposite smiles, slides her queen forward and answers: "Checkmate." Lip-synced dialogue, ticking clock, rain against the window. Moody warm lamplight, 35mm film look.
A parkour athlete sprints across a rooftop at dusk, vaults a ventilation duct, tucks into a roll and springs back to full sprint without breaking stride. Handheld tracking camera follows from the side, motion blur on the skyline, jacket and hair reacting to the wind, hard believable landings with dust kicked up. City lights flickering on below.
Hand-painted watercolor animation: a paper sailboat drifts down a rain-swollen gutter stream past towering blades of grass, a snail watches from a leaf as the boat spins through a tiny whirlpool and rights itself, soft pigment blooms bleeding at the edges of every shape, visible paper grain, gentle piano and rain patter.
何时用它
当片段需要超过 10-15 秒、声音是叙事主角、或需要一组参考图和参考视频来控制输出时,选 Wan 3.0。
01
多数模型止步于 10-15 秒;Wan 3.0 单次可到 30 秒,一个场景可以完整地铺垫、转折、收尾,不用在剪辑软件里拼接。
02
台词、拟音和配乐在同一次生成里产出,口型对齐且不额外计费。想让角色说的话,用引号直接写进提示词。
03
最多叠加 10 张图和 5 条短视频来锁定角色、产品、运动或风格,并在提示词里说明每个编号素材负责控制什么。
三步工作流
好结果从清晰的主体、场景、运动和声音预期开始。选好模型,先生成第一版,再根据看到和听到的继续改提示词。
写明主体、场景、镜头运动、风格和情绪。要对白就把台词放进引号;要声音就描述期望的环境音和配乐。
在模型菜单选 Wan 3.0,设置时长(2-30 秒)、分辨率和画幅,需要一致性时再附上首帧或参考素材。
检查运动、一致性、声画同步和提示词还原度。保留有效的部分,重写模糊的部分,再生成下一版。
下一步
已有产品图或角色定妆照就从图生视频开始;想借用已有片段的运动或节奏就用视频转视频;还没定模型就先看对比。
创作场景
30 秒上限加原生音频,让 Wan 3.0 能一次完成那些短时长、无声模型覆盖不了的工作。
01
30 秒足够一个场景完成起承转合,一次生成完整片段,而不是拼接碎片。
02
把台词写进引号,Wan 3.0 就会带口型、房间氛围音和配乐演出来,适合剧情节点、讲解和角色测试。
03
画面和声底一次产出:产品运动、环境音和收尾节拍,直接可投社媒。
04
叠加参考图锁定角色或产品的跨镜头一致性,再在提示词里逐镜头指挥动作。
05
描述配乐和情绪,模型会按画面运动来配乐,适合情绪片、片头和转场。
06
水彩、水墨、赛璐璐等非写实风格能在全片长内保持稳定,声音风格同步匹配。
模型对比
三个模型都能在本站直接使用。按真正影响生产的维度对比:时长、音频、参考控制和迭代成本。
| 特性 | Wan 3.0 | Seedance 2.5 | Veo 3.1 |
|---|---|---|---|
| 单次最长时长 | 30 秒,2 秒起任意整数 | 30 秒(多镜头模式) | 单次 8 秒 |
| 原生音频 | 默认生成人声、音效、配乐,对白口型对齐 | 生成音频,可开关 | 支持模式下自带音频 |
| 参考控制 | 单次最多 10 图 + 5 条视频 | 单次最多 30 图 + 10 条视频 | 首尾帧与图片参考 |
| 本站分辨率 | 480p / 720p / 1080p | 480p / 720p / 1080p | 720p / 1080p |
| 720p 积分单价 | 每秒 2.4 积分 | 每秒 7.6 积分 | 按条计价,见定价页 |
| 最适合的生产场景 | 长镜头、对白场景、带配乐片段 | 重参考编辑、多镜头分镜 | 高写实主镜头与成片级输出 |
常见问题
模型能力、积分成本、输入限制和输出设置都会影响你的选择。