一个模型统一理解文本、图片、视频和音频
MiniMax H3 会把提示词和参考素材放在同一个创作上下文中理解。图片可以提供主体或视觉方向,视频可以提供动作和镜头语言,音频可以提供声音、节奏或氛围参考。
Hailuo 3 · 原生 2K
MiniMax H3 支持 5–15 秒原生 2K 输出、原生立体声、首尾帧控制,以及图片、视频、音频多模态参考。 立即免费在线试用 MiniMax H3!
模型概览
MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日发布的通用多模态视频模型。它可以统一理解文本、图片、视频和音频,并在一次生成中输出带原生立体声的短视频。
MiniMax H3 会把提示词和参考素材放在同一个创作上下文中理解。图片可以提供主体或视觉方向,视频可以提供动作和镜头语言,音频可以提供声音、节奏或氛围参考。
画面和声音在同一次生成中完成,不需要生成后再拼接。在本站,三个 H3 工作流都会输出 5–15 秒 2K MP4,并保留模型生成的音轨,目前没有单独的音频开关。
核心能力
MiniMax H3 把直接镜头控制和多模态参考放在同一个模型里。下面五项能力可以把创意简报、关键帧或现有素材变成方向更明确的短视频。
工作流示例 · 多模态参考
参考模式可以在图片、视频和音频的分类限制内,按顺序添加合计最多 12 个文件。在提示词中写清素材编号,让 H3 知道每个文件用于约束主体、动作、镜头、风格、声音还是节奏。
视觉示例 · 主体与风格延续
使用清晰的参考图片或视频,可以帮助角色、商品、配色或视觉风格在生成镜头中保持可识别。提示词越具体、参考素材越干净,模型目标越明确。
视觉示例 · 快速动作与镜头运动
参考视频可以引导动作、节奏、镜头路径和剪辑韵律。当一个动作很难逐帧写清时,直接给出参考通常更直观。
工作流示例 · 首尾帧控制
上传首帧、尾帧或同时上传两张图片,先确定构图起点和画面终点。MiniMax H3 会补全中间运动,提示词负责说明动作和镜头方向。
开启声音 · 对白、环境声与画面同步呈现
本站当前集成输出 5–15 秒整数时长的 2K 视频。声音与画面联合生成,因此同一条视频中可以包含对白、环境声、音效或音乐。
三个步骤
无需写 API 代码,直接在浏览器中选择控制方式、添加真正有用的参考素材,并在提交前确认准确报价。
只有提示词时选文生视频;需要控制转场起点和终点时选首尾帧;需要图片、视频或音频共同引导时选多模态参考。
写清主体、动作、环境、镜头路径、视觉风格和声音。使用参考模式时,按上传顺序提到素材编号,并说明每个素材的用途。
选择时长;文生视频和多模态参考模式还要选择画幅。等待素材上传完成并查看积分报价,提交后可以跟踪状态,再从作品库保存结果。
常见场景
MiniMax H3 适合动作、参考素材和声音需要服从同一创作方向的短视频。每次生成聚焦一个明确成品,通常更容易控制结果。
把商品图、活动视觉和品牌参考素材变成新品发布、商品展示或视觉广告,并统一控制动作和声音方向。
用角色、服装和风格参考制作真人、插画、动漫、3D 或混合媒介的小场景。
让标题、界面概念、游戏菜单、海报和品牌图形系统成为视频主体,快速验证动态设计方向。
在进入完整制作流程前,快速尝试环境、技能、变形、动作段落和特效镜头。
生成横版或竖版故事段落、活动变体、氛围测试和适合社交平台的短视频。
AI 视频模型对比
MiniMax H3、Seedance 2.5 和 Kling 3.0 采用不同的多模态视频创作路线。选择模型前,可以直接对比官方公开的定位、输入方式、时长、分辨率、音频和适用场景。
表格依据各模型官方公开资料整理。实际可用功能、时长和输出设置可能因产品、地区与 API 而变化。
模型选择
根据现有素材、需要的控制方式、输出时长和制作目标选择。三款模型分别强调创作流程中的不同环节。
MiniMax H3 适合用有顺序的图片、视频或音频参考引导 2K 短片,尤其适合需要首尾帧控制的任务。
Seedance 2.5 更适合长镜头、高分辨率营销素材,以及需要大量参考输入或局部编辑的生产任务。
Kling 3.0 适合电影感多镜头、稳定角色或商品,以及依赖多语言或多角色对白的场景。
价格与限制
MiniMax H3 按积分计费。5 秒文生视频或首尾帧视频的基础报价是 23 积分。参考视频秒数和超过前 5 张的参考图片会增加基础报价,提交前会显示最终积分。
查看积分套餐生成设置
生成器会在提交任务前检查这些限制。
输出
原生 2K
MiniMax H3 当前使用 2K 画质设置。
时长
5–15 秒
仅支持整数秒。
文本/参考模式画幅
21:9、16:9、4:3、1:1、3:4、9:16
图生视频模式跟随输入图片。
参考图片
最多 9 张
本站支持 JPG、JPEG、PNG、WEBP,每张最大 30 MB。
参考视频
最多 3 个
单个 2–15 秒,累计不超过 15 秒,每个最大 50 MB。
参考音频
最多 3 个
MP3 或 WAV,单个 2–15 秒,累计不超过 15 秒,每个最大 15 MB。
参考文件总数
合计最多 12 个
同一次请求中的图片、视频和音频需要合并计算。
参考素材要求
必须包含图片或视频
音频不能作为唯一参考素材提交。
结果有效期
上游保留 24 小时
上游下载链接 24 小时后失效;转存成功的文件会保留在作品库。
在 SeedVideo AI 生成
用一个账户在纯提示词、首尾帧和有顺序的多模态参考之间切换。每种工作流都会在提交前显示实际限制和准确积分报价。
minimax-h3-text-to-video
在提示词中描述主体、动作、环境、镜头运动和视觉风格。
minimax-h3-image-to-video
上传首帧、尾帧或同时上传两张图片,输出画面比例会跟随输入图片。
minimax-h3-reference-to-video
按顺序添加图片、视频和音频参考素材,并在提示词中说明每份素材的用途。
生成工作流
在三种 MiniMax H3 工作流之间切换,提交前查看参数限制和积分报价,并在同一工作区完成项目。
可以在纯提示词、首尾帧和多模态参考之间切换,不需要把同一个项目搬到不同工具中重新配置。
生成器会根据输出时长和需要计费的参考素材计算报价,确认积分消耗后再提交任务。
MiniMax H3 可以和 Seedance、Kling、Veo 等本站支持的模型搭配使用;当需求需要不同工作流或输出规格时,无需离开当前工作区即可切换。
精选视频素材
每次刷新会从 10 条项目视频素材中随机展示 8 条,覆盖动态图形、对白、角色动画、镜头运动和电影感叙事。
风格化角色穿过不同环境,体量、配色和动画电影质感保持连贯。
快速视觉概览把参考素材、生成画面、运动和声音串联成一套多模态创作流程。
发光精灵把日常洗衣房变成霓虹线框世界,第一视角镜头让整段空间变化保持连贯。
宏大环境、远景人物和受控镜头运动,让奇幻段落呈现清晰的空间尺度。
高速角色动作、不断变化的镜头距离和霓虹环境,检验复杂动作段落是否依然清晰易读。
克制的对话场景通过交替近景、稳定面孔和一致光线保持叙事清晰。
参考素材稳定质感和主体细节,再用镜头运动把简单产品概念变成完整短片。
明确的开场帧和结束帧为短场景设定清晰终点,同时保留中间运动的生成空间。
生成前常见问题
继续创作
根据现有素材直接进入合适的工作流,也可以先查看案例和积分套餐再开始生成。
指南与研究
需要比模型概览更深入的内容时,可以查看提示词结构、图生视频工作流和模型选型指南。
其他模型
当需求涉及不同分辨率、时长或输入方式时,可以直接在同一生成器中打开其他模型。