01
Wan 3.0 とは?
Wan 3.0 は Alibaba の AI 動画生成モデルです。2026 年 8 月 6 日にパブリックベータ、8 月 24 日に Alibaba Cloud が正式発表しました。ネイティブ音声付きの 2-30 秒クリップを生成し、テキスト、フレーム、画像、動画、音声を入力にできます。
Alibaba の Wan 3.0 は、テキスト・フレーム・参照素材から最長 30 秒、最大 1080p のクリップを生成。セリフ、効果音、音楽まで同じパスで出力します。 今すぐ Wan 3.0 を無料でオンライン体験!
一目でわかる
ジェネレーターを開く前に、Wan 3.0 が次の動画テストに合うかをこの情報で判断してください。
| 開発元 | Wan 3.0 は Alibaba の Wan(通義万相)チームが開発。SeedVideo AI は独立系のアクセスプラットフォームであり、Alibaba とは提携していません。 |
|---|---|
| 正式リリース | Alibaba Cloud は 2026 年 8 月 24 日に Wan 3.0 を正式発表しました。パブリックベータは 8 月 6 日に開始。 |
| 長さ | 1 回の生成で 2-30 秒。前世代 Wan 2.7 の 15 秒上限の 2 倍です。 |
| 入力モード | テキストから動画、最初/最後のフレーム付き画像から動画、1 リクエストあたり最大 10 枚の画像と 5 本のクリップの参照から動画。API では音声、ドキュメント(PDF/DOC/XLS/PPT/Markdown)、公開 Web ページも受け付けます。 |
| 出力設定 | SeedVideo AI は Wan 3.0 向けに 2-30 秒のスライダー、480p / 720p / 1080p の解像度、アダプティブ含む 6 種のアスペクト比、サウンドのオン/オフを提供します。 |
| 音声 | 声・効果音・BGM をデフォルトで生成し、セリフはリップシンク。音声は追加課金なしです。 |
| 得意分野 | 長回しのナラティブショート、対話シーン、音付きの商品広告、15 秒を超える参照主導のシーケンス。 |
Wan 公式ソース
概要ムービーは Alibaba 公式の Wan 3.0 ショーケースです。4 本の機能デモは本サイトの Wan 3.0 で生成し、掲載のプロンプトをそのまま使用しています。
最終更新:
クイック回答
Wan 3.0 はプロンプト、フレーム、参照素材から最長 30 秒の音声付きクリップを生成します。まず知りたい 4 つの質問に答えます。
01
Wan 3.0 は Alibaba の AI 動画生成モデルです。2026 年 8 月 6 日にパブリックベータ、8 月 24 日に Alibaba Cloud が正式発表しました。ネイティブ音声付きの 2-30 秒クリップを生成し、テキスト、フレーム、画像、動画、音声を入力にできます。
02
2 秒から 30 秒までの任意の整数秒です。前世代 Wan 2.7 の 15 秒上限の 2 倍で、主流モデルの多くが 1 回で生成できる長さを超えます。SeedVideo AI では生成前にスライダーで正確な秒数を設定します。
03
デフォルトで生成します。声、効果音、BGM を同じ生成で出力し、セリフはリップシンクされます。音声の有無で料金は変わらず、無音にしたいときはトグルをオフにするだけです。
04
テキストプロンプト、最初のフレーム(オプションで最後のフレームも)、最大 10 枚の参照画像と 5 本の参照クリップです。Alibaba の API では音声ファイル、ドキュメント、Web ページも入力できます。
モデル概要
Wan 3.0 は Alibaba Cloud が 2026 年 8 月 24 日に発表した動画生成モデルです。前世代 Wan 2.7 の 15 秒上限を 30 秒に倍増し、音声・効果音・音楽をデフォルトで生成します。
本サイトで生成
4 本すべて本サイトの Wan 3.0 で生成:マルチショット一貫性、リップシンクの対話、身体の物理表現、非写実スタイル。各クリップの下がそのまま使用したプロンプトです。
A barista in a sunlit specialty coffee shop pours latte art into a white ceramic cup. Start on a close-up of the milk stream forming a rosetta, then cut to a medium shot as she slides the cup across the walnut counter to a customer, then a final close-up of steam curling above the finished pour. Same barista, same cafe, consistent lighting across all three shots. Warm tones, soft window light, gentle cafe ambience.
Two chess players in a dim study, face to face across an antique board. The older man in a grey cardigan moves his knight, taps the clock and says: "Your move." The young woman opposite smiles, slides her queen forward and answers: "Checkmate." Lip-synced dialogue, ticking clock, rain against the window. Moody warm lamplight, 35mm film look.
A parkour athlete sprints across a rooftop at dusk, vaults a ventilation duct, tucks into a roll and springs back to full sprint without breaking stride. Handheld tracking camera follows from the side, motion blur on the skyline, jacket and hair reacting to the wind, hard believable landings with dust kicked up. City lights flickering on below.
Hand-painted watercolor animation: a paper sailboat drifts down a rain-swollen gutter stream past towering blades of grass, a snail watches from a leaf as the boat spins through a tiny whirlpool and rights itself, soft pigment blooms bleeding at the edges of every shape, visible paper grain, gentle piano and rain patter.
使いどころ
クリップが 10-15 秒を超える必要があるとき、音がストーリーを担うとき、参照画像やクリップの束で出力を制御したいときは Wan 3.0 を選んでください。
01
多くのモデルは 10-15 秒で止まります。Wan 3.0 は 1 回の生成で 30 秒まで届くので、シーンの立ち上がり・転換・締めをエディタで繋がずに 1 本で描けます。
02
セリフ、フォーリー、音楽が同じパスで出力され、リップシンク付きで追加クレジットもかかりません。話させたいセリフは引用符でプロンプトに書いてください。
03
最大 10 枚の画像と 5 本の短いクリップを重ねて、キャラクター、商品、動き、スタイルを固定。プロンプトで各 Image / Video 番号の役割を指定します。
3ステップのワークフロー
良い結果は明確な被写体、シーン、動き、サウンドの意図から始まります。モデルを選び、最初のバージョンを生成し、見て聞いた結果からプロンプトを磨きます。
被写体、場所、カメラワーク、スタイル、ムードを指定します。セリフは引用符でそのまま書き、期待する環境音も記述してください。
モデルメニューで Wan 3.0 を選び、長さ(2-30 秒)、解像度、アスペクト比を設定。一貫性が必要ならフレームや参照素材を添付します。
動き、一貫性、音のタイミング、プロンプト再現度を確認。良かった部分を残し、曖昧だった部分を書き直して次のバリエーションを生成します。
次のステップ
商品写真やキャラクターのスチルがあるなら画像から、動きを既存映像から借りたいなら動画から、まだモデルを迷っているなら比較から始めてください。
01
Wan 3.0 が選択済みのテキストから動画ワークスペースを開き、最初のプロンプトを書きます。
テキストから動画を開く02
商品写真やキャラクターのスチルを最初のフレームとしてアップロード。最後のフレームも固定できます。
画像から動画を開く03
既存クリップの動き、リズム、スタイルを参照に、新しい Wan 3.0 バージョンを生成します。
動画から動画を開く04
大量生成の前に、無料トライアル、クレジットパック、サブスクリプションを比較してください。
料金を見る05
本サイトのもう 1 つの 30 秒モデル。参照素材の上限が大きく、マルチショット編集モードもあります。
2.5 ガイドを読む06
Wan 2.5 は API のみで本サイト未搭載。Wan 3.0 は搭載済みで、あらゆる面で 2.5 を上回ります。
Wan 2.5 ページを見るクリエイティブ用途
30 秒の上限とネイティブ音声により、短くて無音のモデルでは 1 回で作れない仕事にも Wan 3.0 は対応します。
01
30 秒あれば、導入・転換・オチのあるシーンを断片の継ぎ接ぎではなく 1 本の連続した映像として生成できます。
02
セリフを引用符で書けば、リップシンク・ルームトーン・スコア付きで演じます。ストーリービート、解説動画、キャラクターテストに。
03
映像と音のベッドを 1 パスで生成:商品の動き、環境音、締めのビートまで SNS 出稿に使える形で。
04
参照画像を重ねてキャラクターや商品のショット間一貫性を固定し、プロンプトでショットごとの動きを指示します。
05
スコアとムードを記述すれば、モデルが映像の動きに合わせて作曲します。ムードフィルム、イントロ、トランジションに。
06
水彩、インク、セルなどの非写実スタイルがクリップ全長で安定し、音のスタイルも揃います。
モデル比較
3 つとも本サイトで使えます。プロダクションを左右する軸——クリップの長さ、音声、参照制御、イテレーションコスト——で比較します。
| 項目 | Wan 3.0 | Seedance 2.5 | Veo 3.1 |
|---|---|---|---|
| 1 回の最長生成 | 30 秒、2 秒から任意の整数 | 30 秒(マルチショットモード) | 1 回 8 秒 |
| ネイティブ音声 | 声・効果音・音楽をデフォルト生成、セリフはリップシンク | 生成音声、オン/オフ可 | 対応モードで音声あり |
| 参照制御 | 1 リクエスト最大 10 画像 + 5 クリップ | 1 リクエスト最大 30 画像 + 10 クリップ | 最初/最後のフレームと画像参照 |
| 本サイトの解像度 | 480p / 720p / 1080p | 480p / 720p / 1080p | 720p / 1080p |
| 720p のクレジット単価 | 毎秒 2.4 クレジット | 毎秒 7.6 クレジット | クリップ単位、料金ページ参照 |
| 最適なプロダクション | 長回し、対話シーン、音楽付きクリップ | 参照多用の編集、マルチショット絵コンテ | 高リアリズムのヒーローショットと最終品質 |
FAQ
モデルの能力、クレジットコスト、入力の上限、出力設定はどれも選択に影響します。
Wan 3.0 · 最長30秒、音声オン
プロンプト、最初のフレーム、参照素材のどれからでも。セリフ・効果音・音楽まで揃った最長 30 秒のクリップを一度に生成します。
今すぐ始める