一個模型統一理解文字、圖片、影片和音訊
MiniMax H3 會把提示詞和參考素材放在同一個創作脈絡中理解。圖片可以提供主體或視覺方向,影片可以提供動作和鏡頭語言,音訊可以提供聲音、節奏或氛圍參考。
Hailuo 3 · 原生 2K
MiniMax H3 支援 5–15 秒原生 2K 輸出、原生立體聲、首尾影格控制,以及圖片、影片、音訊多模態參考。 立即免費線上試用 MiniMax H3!
模型概覽
MiniMax H3 是 MiniMax 於 2026 年 7 月 31 日發布的通用多模態影片模型。它可以統一理解文字、圖片、影片和音訊,並在一次生成中輸出帶原生立體聲的短片。
MiniMax H3 會把提示詞和參考素材放在同一個創作脈絡中理解。圖片可以提供主體或視覺方向,影片可以提供動作和鏡頭語言,音訊可以提供聲音、節奏或氛圍參考。
畫面和聲音在同一次生成中完成,不需要事後再拼接。在本站,三個 H3 工作流程都會輸出 5–15 秒的 2K MP4,並保留模型生成的音軌,目前沒有獨立的音訊開關。
核心能力
MiniMax H3 把直接的鏡頭控制和多模態參考放在同一個模型裡。以下五項能力可以把創意需求、關鍵幀或現有素材變成方向更明確的短片。
工作流程範例 · 多模態參考
參考模式可以在圖片、影片和音訊的分類限制內,依序加入合計最多 12 個檔案。在提示詞中寫清楚素材編號,讓 H3 知道每個檔案用來約束主體、動作、鏡頭、風格、聲音還是節奏。
視覺範例 · 主體與風格延續
使用清晰的參考圖片或影片,可以幫助角色、商品、配色或視覺風格在生成鏡頭中保持可辨識。提示詞越具體、參考素材越乾淨,模型的目標就越明確。
視覺範例 · 快速動作與鏡頭運動
參考影片可以引導動作、節奏、鏡頭路徑和剪輯韻律。當一個動作很難逐幀寫清楚時,直接給出參考通常更直覺。
工作流程範例 · 首尾幀控制
上傳首幀、尾幀或同時上傳兩張圖片,先確定構圖起點和畫面終點。MiniMax H3 會生成中間的運動,提示詞負責說明動作和鏡頭方向。
開啟聲音 · 對白、環境音與畫面同步呈現
本站目前的整合會輸出 5–15 秒整數時長的 2K 影片。聲音與畫面聯合生成,因此同一支影片中可以包含對白、環境音、音效或音樂。
三個步驟
不需要撰寫 API 程式碼,直接在瀏覽器中選擇控制方式、加入真正有用的參考素材,並在送出前確認準確報價。
只有提示詞時選文生影片;需要控制轉場起點和終點時選首尾幀;需要圖片、影片或音訊共同引導時選多模態參考。
寫清楚主體、動作、環境、鏡頭路徑、視覺風格和聲音。使用參考模式時,按上傳順序提到素材編號,並說明每個素材的用途。
選擇時長;文生影片和多模態參考模式還要選擇畫面比例。等素材上傳完成並查看積分報價,送出後可以追蹤狀態,再從作品庫儲存結果。
常見情境
MiniMax H3 適合動作、參考素材和聲音需要遵循同一個創作方向的短片。每次生成聚焦一個明確的成品,通常更容易控制結果。
把商品圖、活動視覺和品牌參考素材變成新品發表、商品展示或視覺廣告,並統一控制動作和聲音方向。
用角色、服裝和風格參考製作真人、插畫、動漫、3D 或混合媒材的小場景。
讓標題、介面概念、遊戲選單、海報和品牌圖形系統成為影片主體,快速驗證動態設計方向。
在進入完整製作流程前,快速嘗試環境、技能、變形、動作段落和特效鏡頭。
生成橫式或直式的故事段落、活動變體、氛圍測試和適合社群平台的短影音。
AI 影片模型比較
MiniMax H3、Seedance 2.5 和 Kling 3.0 採用不同的多模態影片創作路線。選擇模型前,可以直接比較官方公開的定位、輸入方式、時長、解析度、音訊和適用情境。
表格依據各模型官方公開資料整理。實際可用功能、時長和輸出設定可能因產品、地區與 API 而異。
模型選擇
根據現有素材、需要的控制方式、輸出時長和製作目標選擇。三款模型分別強調創作流程中的不同環節。
MiniMax H3 適合用有順序的圖片、影片或音訊參考引導 2K 短片,特別是需要首尾幀控制的任務。
Seedance 2.5 更適合長鏡頭、高解析度行銷素材,以及需要大量參考輸入或局部編輯的製作任務。
Kling 3.0 適合電影感多鏡頭、穩定的角色或商品,以及依賴多語言或多角色對白的場景。
價格與限制
MiniMax H3 按積分計費。5 秒文生影片或首尾幀影片的基礎報價是 23 積分。參考影片秒數和超過前 5 張的參考圖片會增加基礎報價,送出前會顯示最終積分。
查看積分方案生成設定
生成器會在送出任務前檢查這些限制。
輸出
原生 2K
MiniMax H3 目前使用 2K 畫質設定。
時長
5–15 秒
僅支援整數秒。
文字/參考模式比例
21:9、16:9、4:3、1:1、3:4、9:16
圖生影片模式跟隨輸入圖片。
參考圖片
最多 9 張
本站支援 JPG、JPEG、PNG、WEBP,每張最大 30 MB。
參考影片
最多 3 個
單個 2–15 秒,累計不超過 15 秒,每個最大 50 MB。
參考音訊
最多 3 段
MP3 或 WAV,單段 2–15 秒,累計不超過 15 秒,每段最大 15 MB。
參考檔案總數
合計最多 12 個
同一次請求中的圖片、影片和音訊需要合併計算。
參考素材要求
必須包含圖片或影片
音訊不能作為唯一的參考素材送出。
結果有效期限
上游保留 24 小時
上游下載連結 24 小時後失效;轉存成功的檔案會保留在作品庫。
在 SeedVideo AI 生成
用一個帳戶在純提示詞、首尾幀和有順序的多模態參考之間切換。每種工作流程都會在送出前顯示實際限制和準確的積分報價。
minimax-h3-text-to-video
在提示詞中描述主體、動作、環境、鏡頭運動和視覺風格。
minimax-h3-image-to-video
上傳首幀、尾幀或同時上傳兩張圖片,輸出畫面比例會跟隨輸入圖片。
minimax-h3-reference-to-video
依序加入圖片、影片和音訊參考素材,並在提示詞中說明每份素材的用途。
生成工作流程
在三種 MiniMax H3 工作流程之間切換,送出前查看參數限制和積分報價,並在同一個工作區完成專案。
可以在純提示詞、首尾幀和多模態參考之間切換,不需要把同一個專案搬到不同工具中重新設定。
生成器會根據輸出時長和需要計費的參考素材計算報價,確認積分消耗後再送出任務。
MiniMax H3 可以和 Seedance、Kling、Veo 等本站支援的模型搭配使用;當需求需要不同的工作流程或輸出規格時,不必離開目前的工作區就能切換。
精選影片素材
每次重新整理會從 10 個專案影片素材中隨機展示 8 個,涵蓋動態圖形、對白、角色動畫、鏡頭運動和電影感敘事。
明確的開場幀和結束幀為短場景設定清晰的終點,同時保留中間運動的生成空間。
快速視覺概覽把參考素材、生成畫面、動態和聲音串聯成一套多模態創作流程。
風格化角色穿過不同環境,尺度、配色和動畫電影質感保持連貫。
高速角色動作、不斷變化的鏡頭距離和霓虹環境,檢驗複雜動作段落是否依然清晰易讀。
安靜的年代場景把重點放在細微表情、視線關係和穩定近景,而不是大幅視覺特效。
高飽和色塊、動態文字和趣味角色設計,把一個簡潔的視覺概念變成節奏鮮明的圖形短片。
參考素材穩定質感和主體細節,再用鏡頭運動把簡單的產品概念變成完整短片。
發光精靈把日常自助洗衣店變成霓虹線框世界,第一人稱鏡頭讓整段空間變化保持連貫。
生成前常見問題
繼續創作
根據現有素材直接進入合適的工作流程,也可以先查看案例和積分方案再開始生成。
指南與研究
需要比模型概覽更深入的內容時,可以查看提示詞結構、圖生影片工作流程和模型選擇指南。
其他模型
當需求涉及不同解析度、時長或輸入方式時,可以直接在同一個生成器中開啟其他模型。