新华财经上海7月31日电(记者杜康)31日,MiniMax发布新一代多模态生成模型MiniMax H3,并宣布近期开源。自成立以来,MiniMax已先后开源三代M系列文本模型。H3则是MiniMax推出的首款开源多模态生成模型。
作为MiniMax从“特化任务模型”迈向“通用多模态智能”的重要探索,H3不再以图片、视频、声音的生成、编辑和参考等单一任务为边界,而是在多模态上下文中统一理解创作意图,完成更加自然、连贯的生成与表达。
据悉,MiniMax H3支持文本、图片、音频和视频等多种输入形式,支持2K分辨率直出,可生成最长15秒的音画内容,在提升视听生成能力的同时,进一步降低高质量视频内容的创作和使用门槛。
在商业应用方面,H3重点提升了复杂指令遵循、画面文字和品牌信息呈现、视频到视频动作迁移等能力,可用于广告营销、电商展示、产品设计、UI/UX设计和游戏开发等场景。
MiniMax表示,在 Artificial Analysis视频模型榜单中,H3在视频编辑能力项排名全球第一。
除了生成效果,成本成为此次模型发布的另一项重点。MiniMax H3生成2K视频的价格为每秒0.8元。据MiniMax测算,这一价格约为业内同类旗舰视频模型的三分之一。
MiniMax方面表示,视频模型生成成本与模型处理的Token数量、计算负载和GPU利用效率密切相关。H3采用高压缩分词器(Tokenizer),减少视频生成所需的Token数量;同时针对不同时长、分辨率以及多模态输入带来的负载差异,对异构训练、负载均衡和GPU利用效率进行优化,以降低训练和推理成本。
“通过MiniMax H3,我们希望进一步降低企业、开发者和创作者的内容创作门槛。”MiniMax相关负责人表示,模型开源后,企业可根据自身数据和业务需求进行本地部署和优化,更好满足安全合规要求;芯片厂商和开发者也可参与模型适配和性能优化,进一步降低使用成本。