时间:2026年7月31日
地点:中国·上海
人物:稀宇科技 MiniMax 团队
事件详情:稀宇科技(MiniMax)于7月31日正式发布全模态生成模型MiniMax H3。该模型支持文本、图像、视频、声音四模态上下文的统一理解,并能输出原生双声道的音视频内容,最高支持15秒2K分辨率。H3基于Contextual Omni Representation、H3-VAE、H3-Omni Transformer等自研架构搭建,在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)三项指标上表现突出。官方披露其2K视频定价为0.8元/秒,相当于主流模型同分辨率价格的三分之一以下,768P分辨率下更不到主流720P价格的二分之一。根据Artificial Analysis榜单,H3在视频编辑能力单项排名全球第一。
背景:当前多模态生成赛道长期由闭源模型主导,迭代节奏缓慢、生态开放度远不及大语言模型领域。同时,国内对AI芯片国产化与模型本地化部署的需求持续攀升,开源且兼容多硬件的多模态模型成为行业稀缺品。稀宇科技此前已推出M3旗舰大模型并于6月开源,本次H3是其从特化任务模型向通用多模态智能演进的关键产品,也是该公司的首款开源多模态生成模型。
影响:
- H3将开放模型权重,企业可结合自身业务做本地化部署与微调,缓解高质量视频生成对闭源API的依赖。
- 2K分辨率下0.8元/秒的定价与开源策略叠加,将显著压低广告、电商、游戏等行业的视频内容生产成本。
- 模型设计之初便考虑了对国产AI芯片的兼容性,开放权重后有望加速国产算力对多模态生成的适配,扩大国内AI生态参与者范围。
总结:MiniMax H3以全模态理解、2K 15秒原生双声道视频生成、以及开源在即三大亮点切入多模态生成市场,在视频编辑榜单取得全球第一,并以不到主流三分之一的价格提供2K输出,为视频生成模型的开源+高性能+低单价路径树立新标杆。随着权重即将开放,企业与国产芯片厂商的协同适配将进一步打开多模态应用的产业空间。
参考来源:
- https://www.minimax.io/blog/minimax-h3
- https://www.ithome.com/0/983/957.htm
- https://m.163.com/tech/article/L35IGC6V00098IEO.html
- https://news.qq.com/rain/a/20260731A05C6C00
- https://www.sohu.com/a/1056991944_114760









