时间:2026年8月1日
地点:中国
人物:MiniMax团队
事件详情:MiniMax于7月31日发布全模态生成模型MiniMax H3。官方介绍称,H3可将文字、图片、视频和音频置于统一上下文中,生成最长15秒、2K分辨率并带原生立体声的视频。模型已通过MiniMax API和海螺AI提供服务,面向广告、品牌、电商、产品设计、游戏等内容生产场景。
背景:过去的视频生成产品通常将文生视频、图生视频、视频编辑、动作迁移和主体参考拆分为不同模型或功能。MiniMax H3试图用统一的多模态建模和自然语言指令整合这些任务。官方还表示,H3在2K分辨率下的单秒价格低于主流模型三分之一,并计划在适用法律允许的范围内开放模型权重。
影响:
- 视频创作者可用一套自然语言指令完成跨模态素材组合和编辑。
- 原生立体声与2K输出扩大了AI视频在广告、电商和游戏预演中的应用空间。
- 低价与后续开放权重计划可能加剧视频生成模型的价格和生态竞争。
总结:MiniMax H3的重点不只是提升视频清晰度,而是把文字、图像、视频和声音作为统一输入来处理,并将生成与编辑放进同一工作流。若其开放权重计划按期推进,开发者将有机会围绕统一多模态接口进行定制和部署。不过,模型权重开放时间、硬件适配范围及实际生成质量仍需以官方后续公告和用户测试为准。
参考来源:
- https://www.minimax.io/blog/minimax-h3
- https://www.marktechpost.com/2026/08/01/minimax-releases-minimax-h3-an-omni-modal-video-model-that-generates-15-second-2k-clips-with-native-stereo-audio/
- https://www.bochaai.com/
- https://m.yicai.com/news/103301318.html
- https://platform.minimax.io/docs/guides/video-generation
- https://hailuoai.video/