返回新闻列表
2026-08-01 10:12

全模态视频模型新突破:MiniMax发布H3并承诺开源权重

文章提及的 AI 工具MiniMaxMiniMax Agent
文本核心速览
  1. 发布全模态模型H3MiniMax正式发布全模态生成模型H3,支持文本、图像、视频、声音任意组合输入,输出带原生双声道的高清视频,并承诺数日内开源模型权重。
  2. 价格低至同类三分之一H3在2K分辨率下每秒价格不足主流同类模型的三分之一,设计初期即兼容国产芯片,瞄准国内AI生态与商用落地,吸引中小创作者与企业用户。
  3. 架构创新提升训练效率H3-Omni Transformer将文生图、文生视频、图到视频及音频处理统一到同一预训练框架,训练吞吐量提升近30%;H3-VAE以高压缩率降低推理成本。
  4. 应用覆盖内容创作场景已验证电影片头、游戏UI动画、动态海报、广告电商等应用场景,文字渲染与品牌信息准确度显著提升,大幅降低视频制作门槛。

MiniMax 发布全模态生成模型 H3,承诺开源权重

继文本大模型领域持续发力后,人工智能企业 MiniMax 于近日正式推出全新的全模态生成模型 MiniMax H3,并承诺将在几天内全面开源模型权重。这一动作引发行业高度关注,标志着全模态视频生成赛道迎来新的技术突破。

核心亮点

  • 全模态输入:文本、图像、视频、声音可任意组合作为模型输入。
  • 高清视频输出:生成结果自带原生双声道音频,适配高质量视听内容创作。
  • 低成本高效率:2K 分辨率下每秒价格不到主流同类模型的三分之一。
  • 架构创新:H3-Omni Transformer 与 H3-VAE 协同工作,训练吞吐量提升近 30%。

产品能力:一条指令完成复杂创作

在应用层面,用户只需向模型提供参考视频、图片或音频素材,再配合自然语言指令,即可一气呵成完成复杂的视听内容创作。例如:

  1. 输入一张静态海报图片,附加一段描述品牌调性的文本,模型即可生成动态海报视频,并配有合适的背景音。
  2. 提供一段参考视频片段,要求改变场景风格,H3 会同时理解视频内容与语言指令,输出风格统一的新视频。
  3. 混合音频与图片输入,模型能生成带有对应音效、旁白或音乐的连贯视频段落。

这种能力大幅降低了视频制作门槛,普通创作者无需掌握专业剪辑和动效设计,也能通过自然语言驱动生成高质量内容。

技术架构:打破传统专家模型壁垒

MiniMax H3 在技术架构上彻底打破了传统多模态模型按任务拆分专家模型的做法。研发团队将文生图、文生视频、图到视频以及音频处理等多种任务全部整合进同一个预训练框架中,推出了更简洁的 H3-Omni Transformer 架构。这一设计使得端到端训练吞吐量提升了近 30%,在保持统一建模的同时显著提升训练效率。

同时,通过重写 Tokenizer 带来的 H3-VAE 架构,实现了极高的压缩率,有效降低了高分辨率下的推理成本。这两项架构创新是 H3 实现“全模态、低成本、高画质”三重目标的关键基础。

生态与场景:瞄准国产芯片与商用落地

MiniMax H3 在定价与生态方面同样展现出清晰的商业化思路。官方表示,该模型在 2K 分辨率下的每秒价格不到主流同类模型的三分之一,这一价格优势有望吸引大量中小型创作者和企业用户。

更重要的是,H3 在设计初期便充分考虑了对国产芯片的兼容性,这在国内 AI 生态中具有特殊价值,也是其获得产业关注的重要原因之一。

目前,H3 已被验证在以下场景中展现出广阔的应用潜力:

  • 电影片头:快速生成风格化片头动画。
  • 游戏 UI 动画:为界面元素提供动态演示。
  • 动态海报:将静态视觉素材转化为生动宣传物料。
  • 广告电商:高效产出商品展示视频。

尤其值得关注的是,H3 对文字渲染和品牌信息呈现的准确度得到了显著提升,解决了以往 AI 生成视频中文字模糊、变形等痛点。

总结与展望

MiniMax H3 的发布,不仅是模型参数的又一次迭代,更是对“全模态统一生成”这一技术方向的有力验证。通过架构整合和成本控制,H3 试图让高质量视频生成成为普惠能力。随着模型权重即将开源,开发者和研究人员将能够深入了解其内部机制,并基于 H3 构建更多创新应用。

未来,全模态视频模型将如何改变内容产业的生产方式?MiniMax 的开源策略会带来怎样的生态效应?我们拭目以待。

来源: aibase阅读原文

其他新闻

查看全部