テキスト・画像・動画・音声を 1 つのモデルで
MiniMax H3 は、プロンプトと参照メディアを 1 つの創作コンテキストとして扱います。被写体やビジュアルの方向性には画像を、動きやカメラの言語には動画を、声・リズム・サウンドの方向づけには音声を使いましょう。
Hailuo 3 · ネイティブ 2K
MiniMax H3 は 5–15 秒のネイティブ 2K 動画をステレオ音声付きで生成し、テキスト、最初と最後のフレーム、画像・動画・音声の参照をまとめて読み取ります。 MiniMax H3 を今すぐ無料で体験!
モデル概要
MiniMax H3 は、MiniMax が2026年7月31日にリリースした汎用マルチモーダル動画モデルです。テキスト・画像・動画・音声をまとめて読み取り、ネイティブステレオ音声付きのショート動画を生成します。
MiniMax H3 は、プロンプトと参照メディアを 1 つの創作コンテキストとして扱います。被写体やビジュアルの方向性には画像を、動きやカメラの言語には動画を、声・リズム・サウンドの方向づけには音声を使いましょう。
映像と音声は、後から組み合わせるのではなく同じプロセスで生成されます。本サイトでは、すべての H3 ワークフローが生成された音声トラック付きの 5〜15 秒・2K MP4 を返し、音声の個別トグルはありません。
コア機能
MiniMax H3 は、ダイレクトなショット制御とミックスメディア参照を組み合わせたモデルです。次の 5 つの機能が、ブリーフ、キーフレーム、既存素材を、より意図の明確なショートクリップへと変えていきます。
ワークフロー例 · マルチモーダル参照
参照モードでは、画像・動画・音声それぞれの上限内で、順序付きのファイルを合計 12 個まで追加できます。Image 1、Video 1、Audio 1 のような番号付きラベルで各素材に言及し、どの参照が被写体・動き・カメラ・スタイル・声・タイミングをガイドするのかを H3 に伝えましょう。
ビジュアル例 · 被写体とスタイルの一貫性
明確な参照画像や参照動画を使うことで、キャラクター、商品、カラーパレット、ビジュアル表現を生成ショットの中で保ちやすくなります。具体的なプロンプトとクリーンな元素材が、モデルにより明確な目標を与えます。
ビジュアル例 · 高速アクションとカメラワーク
参照動画は、動き、ペース、カメラの軌道、編集のリズムをガイドできます。フレームごとに言葉で説明するより、実際に見せたほうが早いアクションに便利です。
ワークフロー例 · 開始・終了フレーム制御
開始フレーム、終了フレーム、またはその両方をアップロードして、構図と到達点を決めます。MiniMax H3 がフレーム間の動きを構築し、プロンプトがアクションとカメラを指示します。
サウンドオン例 · セリフ・環境音・映像を同時に
この統合では、5〜15 秒の整数秒で 2K 動画を出力します。音声は映像と同時に生成されるため、1 つのクリップにセリフ、環境音、効果音、音楽を含められます。
3 ステップ
API コードを書かずに、ブラウザで MiniMax H3 を使えます。必要なコントロールを選び、ショットに役立つ参照だけを追加し、送信前に正確な見積もりを確認しましょう。
プロンプトだけで作るショットにはテキストから動画を、トランジションを制御したいときは開始・終了フレームを、画像・動画・音声で結果をガイドしたいときはマルチモーダル参照を選びます。
被写体、アクション、環境、カメラの軌道、ビジュアルスタイル、サウンドを記述します。参照モードでは、アップロード順にメディアへ言及し、各素材の役割を説明しましょう。
長さを選び、テキストモードと参照モードではアスペクト比も選択します。アップロードの完了を待ち、クレジット見積もりを確認してタスクを送信したら、完成した動画をライブラリから保存しましょう。
人気のユースケース
MiniMax H3 は、動き・参照・サウンドが 1 つの演出方針に従う必要のあるショートフォームの音声付き映像制作向けに設計されています。まずは 1 回の生成につき 1 つの成果物に絞って始めましょう。
商品画像、キャンペーンアート、ブランド参照を、動きとサウンドをコントロールした新商品発表、商品リビール、ビジュアル広告に変換します。
キャラクター、衣装、スタイルの参照を使って、実写、イラスト、アニメ、3D、ミックスメディアの質感でコンパクトなシーンを作り込みます。
デザインそのものを動画の主役にしたいときに、タイトル、インターフェースコンセプト、ゲームメニュー、ポスター、ブランドのグラフィックシステムをアニメーション化します。
本格的な制作パイプラインに時間を割く前に、環境、アビリティ、変身、アクションの見せ場、エフェクト中心のショットをプロトタイプ化します。
SNS 配信やクリエイティブレビューに向けて、縦型・横型のストーリー展開、キャンペーンバリエーション、ムードテスト、スクロールを止めるクリップを作成します。
AI 動画モデル比較
MiniMax H3、Seedance 2.5、Kling 3.0 は、マルチモーダル動画制作へのアプローチがそれぞれ異なります。モデルを選ぶ前に、公開ドキュメントに基づく方向性、入力、長さ、解像度、音声、得意分野を比較しましょう。
各機能は公式の公開ドキュメントに基づきます。提供状況、長さ、出力設定は、製品、地域、API によって異なる場合があります。
モデル選択
手元の素材、必要なコントロール、出力の長さ、制作の目的で選びましょう。各モデルは創作プロセスの異なる部分を重視しています。
MiniMax H3 は、順序付きの画像・動画・音声参照でガイドする短い 2K 動画に適しており、特に開始・終了フレーム制御が重要な場面で力を発揮します。
Seedance 2.5 は、長めのシーン、高解像度のキャンペーン素材、多数の参照を組み合わせたり局所編集が必要なプロダクションワークフローに向いています。
Kling 3.0 は、映画的なマルチショットクリップ、安定したキャラクターや商品、多言語・複数キャラクターのセリフに依存するシーンに強い選択肢です。
料金と制限
MiniMax H3 の生成はクレジット制です。5 秒のテキスト動画またはフレーム動画の基本見積もりは 23 クレジットです。参照動画の秒数と、最初の 5 枚を超える参照画像は基本見積もりを増やす場合があり、ジェネレーターは送信前に最終見積もりを表示します。
クレジットプランを比較生成設定
ジェネレーターはタスク送信前にこれらの制限を検証します。
出力
ネイティブ 2K
MiniMax H3 は現在 2K 画質設定を使用します。
長さ
5〜15 秒
整数秒のみ対応します。
テキスト/参照モードのアスペクト比
21:9、16:9、4:3、1:1、3:4、9:16
画像モードは入力フレームに従います。
参照画像
最大 9 枚
JPG、JPEG、PNG、WEBP。本サイトでは 1 枚あたり最大 30 MB です。
参照動画
最大 3 本
1 本 2〜15 秒、合計 15 秒まで、1 本あたり最大 50 MB です。
参照音声
最大 3 本
MP3 または WAV。1 本 2〜15 秒、合計 15 秒まで、1 本あたり最大 15 MB です。
参照ファイル合計
最大 12 個
1 リクエスト内の画像・動画・音声ファイルは合算してカウントされます。
参照の必須条件
画像または動画が必須
音声だけを参照として送信することはできません。
結果の保存期間
上流で 24 時間
プロバイダーのダウンロード URL は 24 時間で失効します。保存に成功した完成ファイルはライブラリにコピーされます。
SeedVideo AI で生成
1 つのアカウントで、プロンプトのみの生成、開始・終了フレーム、順序付きマルチモーダル参照を行き来できます。各ワークフローは、送信前に実際の制限と正確なクレジット見積もりを表示します。
minimax-h3-text-to-video
被写体、アクション、環境、カメラの動き、ビジュアルスタイルを 1 つのプロンプトで記述します。
minimax-h3-image-to-video
開始フレーム、終了フレーム、またはその両方をアニメーション化します。出力の構図はアップロードしたフレームに従います。
minimax-h3-reference-to-video
順序付きの画像・動画・音声参照で結果をガイドし、各参照の使い方をプロンプトで説明します。
生成ワークフロー
3 つの MiniMax H3 ワークフローを行き来し、送信前に実際の制限とクレジットコストを確認しながら、各プロジェクトを 1 つのワークスペースで管理できます。
プロンプトのみの生成、開始・終了フレームのアニメーション、マルチモーダル参照を、別ツールでプロジェクトを作り直すことなく行き来できます。
ジェネレーターはタスク送信前に、長さと課金対象の参照入力から見積もりを計算するため、確定する前にクレジットコストを確認できます。
MiniMax H3 は Seedance、Kling、Veo などの対応モデルと並行して使えます。ブリーフが変わっても、ワークスペースを離れずにワークフローや出力プロファイルを切り替えられます。
厳選動画サンプル
更新のたびに、10 本のプロジェクトライブラリから 8 本のサンプルを表示します。グラフィックアニメーション、セリフ、キャラクター表現、カメラワーク、映画的なストーリーテリングを網羅しています。
スタイライズされたキャラクターが移り変わる環境を進みながら、スケール、パレット、アニメ映画的な質感がつながりを保ちます。
抑制の効いた会話シーンが、交互のクローズアップ、安定した顔、一貫したライティングでシーンの読みやすさを保ちます。
静かな時代劇のシーンは、大がかりな視覚効果ではなく、繊細な表情、視線、安定したクローズアップの構図に焦点を当てます。
素早いキャラクターの動き、変化するカメラ距離、ネオンの環境で、密度の高いアクションの見せ場が追いやすさを保てるかを検証します。
テンポの速いビジュアル概要が、参照メディア、生成フレーム、動き、サウンドを 1 つのマルチモーダル制作ワークフローへとつなげます。
参照メディアが質感と被写体のディテールを固定し、カメラワークがシンプルな商品アイデアを洗練されたショートシークエンスに変えます。
巨大な環境、遠景の人物、コントロールされたカメラワークが、ファンタジーシークエンス全体に明快なスケール感を生み出します。
明確に定義された開始フレームと終了フレームが短いシーンにはっきりとしたビジュアルの到達点を与えつつ、その間に生成される動きの余地を残します。
生成前の質問
創作を続ける
モデルのリサーチから、手元の素材に合ったワークフローへ進みましょう。生成前にサンプルやクレジットプランを確認することもできます。
ガイドとリサーチ
モデル概要より深い内容が必要なときは、プロンプト構成、画像から動画へのワークフロー、モデル選定の実践ガイドをご覧ください。
モデルの代替候補
ブリーフに別の解像度、長さ、入力ワークフローが必要なときは、同じジェネレーターで関連モデルを開けます。
Hailuo 3 · ネイティブ 2K
ワークフローを選び、正確なクレジット見積もりを確認して、ネイティブ 2K 動画を送信しましょう。