8月3日,MiniMax宣布旗下全模态生成模型H3正式开源,这是该公司成立以来的首款开源多模态生成模型。与之前开源的三代M系列文本模型不同,H3打通了文本、图像、视频和音频四种模态的理解与生成能力,并同步获得华为昇腾、摩尔线程、AMD、Intel等九家芯片厂商的当日适配支持。
一个模型管四种模态
MiniMax H3的核心卖点是”统一”。它能同时理解文本、图像、视频和音频组成的混合输入,输出端最高支持2K分辨率、15秒时长、带有原生立体声音频的视频生成。
这种全模态架构与此前市面上”文本转视频”或”文本转音频”的单通道模型有本质区别。H3允许用户在一个推理流程中组合多种模态指令,例如输入一段文字描述加一张参考图,输出带有匹配音效的短视频片段。MiniMax官方将其定位为”通用型全模态生成系统”而非单一的视频生成工具。

从技术路线看,H3延续了MiniMax文本与多模态并行自研的策略。此前开源的M系列模型在文本领域积累了三个版本的迭代经验,H3则是多模态能力的首次对外输出。开源范围包括模型权重和训练基础设施的关键技术组件。
九家芯片厂商同步适配
开源发布当天,MiniMax H3获得了罕见的生态响应速度。华为昇腾、摩尔线程、沐曦股份、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel九家国内外芯片厂商同步完成适配,Hugging Face、魔搭ModelScope、ComfyUI、RunningHub、fal等开发社区和云推理平台也在同日上架了相关支持。

这种规模的同步适配在开源模型发布中并不常见。通常开源大模型的芯片适配需要数周到数月时间,H3能够实现”开源即适配”,说明MiniMax在正式发布前已与主要芯片厂商完成了深度合作。对于国内使用昇腾、海光等国产芯片的开发者来说,这意味着可以在自有硬件上直接部署H3,无需依赖NVIDIA GPU。
推理框架方面,SGLang也在适配名单中,为H3提供了高性能推理的底层支持。
定价策略搅动市场
价格层面的冲击力同样不小。MiniMax H3的视频生成定价为0.8元/秒(2K分辨率),官方称仅为业内同类旗舰视频模型的三分之一。
这个定价背景是:2026年上半年AI视频生成赛道已经进入白热化竞争。从OpenAI的Sora到国内多家厂商的同类产品,2K级别视频生成的市场价格通常在2-3元/秒区间。MiniMax将价格直接打到0.8元,配合开源策略,意图很明显——用低价API和开放权重双管齐下,快速占领市场份额。

对于开发者和企业用户来说,H3的开源意味着可以选择自建部署(零API费用)或直接调用API(0.8元/秒),两种路径的成本都远低于闭源竞品。特别是对于需要大规模视频内容生成的应用场景,如电商产品展示、短视频批量制作、教育培训素材生成等,成本优势会直接转化为商业竞争力。
开源多模态的下一步
MiniMax H3的开源为多模态生成领域带来了一个重要的参照系。在此之前,全模态生成能力的开源模型几乎空白——大多数开源项目要么聚焦文本,要么聚焦单一视觉模态。H3的出现证明了将文本、图像、视频、音频统一在一个模型框架内并对外开放是可行的。
接下来的关键看点是社区反馈和实际应用表现。开源模型的理论能力与实际部署效果之间往往存在差距,特别是在视频生成的稳定性、音视频同步精度等工程细节上。MiniMax此前在文本模型开源中积累了较好的社区口碑,H3能否延续这一势头,未来几周的开发者实测数据将是重要参考。
可以确定的是,当一家中国AI公司同时拿出全模态能力、开源策略和极致定价,多模态生成的竞争门槛正在被快速拉低。



