音视频同创、价格“打骨折”:MiniMax 全模态模型 H3 登场,即将全面开源!
在文本大模型赛道持续深耕之后,AI 明星企业 MiniMax 再次向多模态深水区发起冲锋。近日,MiniMax 正式推出了全新的全模态生成模型——MiniMax H3。更让开发者社区沸腾的是,官方承诺将在几天内全面开源该模型的权重。这不仅是一次硬核的技术秀,更是对开源生态的一次重磅回馈。
告别“拼凑”,实现真正的音视频同创
以往的多模态模型往往像是个“缝合怪”,而 H3 则做到了真正的融会贯通。作为一款支持多模态上下文输入的生成模型,它能够同时接收文本、图像、视频以及声音的任意组合,并直接输出带有原生双声道音频的高清视频。
在实际创作中,这意味着用户只需提供参考素材(视频、图片或音频)并辅以简单的自然语言指令,就能一气呵成地完成复杂的视听内容创作,彻底告别过去音画分离、后期合成的繁琐流程。
底层重构:化繁为简的 H3 架构
在技术实现上,MiniMax 研发团队做了一件“反直觉”的事:他们彻底抛弃了传统多模态模型按任务拆分多个专家模型的做法,而是将文生图、文生视频、图生视频以及音频处理等任务,全部整合进了一个统一的预训练框架中。
这种被称为 H3-Omni Transformer 的极简架构,让端到端训练的吞吐量飙升了近 30%。此外,通过重写 Tokenizer 打造的 H3-VAE 架构,实现了极高的压缩率。这不仅让模型“吃得少”,还大幅降低了高分辨率场景下的推理成本,真正做到了技术层面的降本增效。
价格“屠夫”与国产生态的拥抱
好技术如果不接地气,终究只是实验室里的玩具。在定价策略上,H3 展现出了极强的市场侵略性:在 2K 分辨率下,其每秒生成价格不到主流同类模型的三分之一。
同时,H3 在设计之初就充分考量了国产化需求,对国产芯片展现出优秀的兼容性。目前,该模型已在电影片头、游戏 UI 动画、动态海报及广告电商等商业场景中初露锋芒。值得一提的是,它在文字渲染和品牌信息呈现的准确度上也有了质的飞跃,这对于要求严苛的商业落地来说无疑是巨大的加分项。
结语
MiniMax H3 的发布,标志着全模态视频生成迈入了一个更高效、更低成本的新阶段。随着模型权重的即将开源,我们有理由相信,一场属于开发者和创作者的 AI 视听生态爆发,才刚刚拉开帷幕。
