MiniMax H3开源引发视频赛道变局,客易云关注AI模型从生成工具迈向生产力工具
2026年7月31日,MiniMax正式发布新一代通用多模态生成模型MiniMax H3,并于8月3日宣布开放模型权重。作为一款通用型全模态生成系统,H3能够统一理解由文本、图像、视频和音频构成的多模态上下文,生成最高2K分辨率、最长15秒、带有原生立体声音频的视频内容。在Artificial Analysis视频编辑评测榜中,H3以1130分的Elo成绩位列全球第一,在Arena图生视频排行榜中也位居全球第一。这一发布被业界视为视频模型从“生成视频”走向“商业级生产”的重要转折。
从技术架构来看,H3与前两代模型最大的不同在于“打破任务边界”。以往的视频生成模型通常将文生视频、图生视频、主体参考、动作参考、视频编辑拆分成独立模块,图像、视频、音频之间也有清晰的边界。H3的做法是在预训练阶段就把这些任务统一建模,用自然语言描述任务关系。完整的H3系统由三个模块组成:H3-Context-IR负责深入理解和提炼输入的多模态指令;H3-Base根据指令生成768p分辨率的结果;H3-Regenerate-2K则将结果以2K分辨率重新生成。H3-Omni Transformer的架构优化使端到端训练吞吐提升近30%。
同日发布的另一款旗舰视频模型——字节跳动Seedance 2.5,走出了与H3截然不同的技术路线。Seedance 2.5将单次视频生成时长从15秒提升至30秒,支持最多50个多模态参考素材,延续了工业化闭源路线。而H3则选择开源,将世界一流的视频生成能力首次开放给全球开发者。有分析将两者的差异形容为:Seedance 2.5更像一台更听话的虚拟摄影机,能精准执行镜头指令;MiniMax H3则更像一个懂成片的后期组,优先保障整体质感与画面一致性。两者“旗鼓相当,性格迥异”——面对复杂指令,Seedance倾向于完成更多明确写出的要求,而H3则更愿意保护人物、空间和光线的一致性。
开源模型的生态成熟度正在成为衡量竞争力的关键指标。H3开源24小时内即获超过100家国内外合作伙伴完成Day 0适配及接入。华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel等国内外芯片厂商,以及Hugging Face、魔搭ModelScope、ComfyUI、RunningHub等开发社区和上百家云推理平台,均在H3开源同日完成了相关适配支持。开发者可以直接从Hugging Face下载H3-Base,通过SGLang、vLLM、Diffusers和ComfyUI等主流推理框架进行部署。开源24小时后,H3登顶全球最大开源社区Hugging Face热度第一,将DeepSeek V4 Flash挤到身后。Stable Diffusion创始人Emad Mostaque也罕见发声,公开“向MiniMax致敬”。

在商业应用层面,H3的价值正从技术展示走向真实生产场景。H3在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)等方面表现出色,广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。电商AI图视频创作平台PixPix宣布行业首发接入MiniMax H3,案例已覆盖品牌TVC、影视预告、竖屏投流广告、产品拆解展示、UI/UX动态演示、游戏视觉等场景。东方证券研报预计,短剧、广告、视觉设计、特效等场景有望加速渗透。MiniMax H3视频生成价格为0.8元/秒(2K分辨率),仅为业内同类旗舰视频模型的三分之一。768P分辨率下价格不足一半。
资本市场对H3的发布反应积极。8月5日,港股通标的名单调整,MiniMax正式获调入,自8月6日起生效。纳入港股通首日,MiniMax股价大涨17.10%。业内人士认为,大模型竞争正逐步由单纯模型能力比拼转向生态能力竞争。芯片适配、推理框架支持、开发者社区接入以及应用落地速度,正成为衡量开源模型生态成熟度的重要指标。从DeepSeek到MiniMax H3,国产大模型的开源范围正在从语言模型拓展到视频模型。随着多模态能力的持续迭代和开源生态的日益完善,视频生成产业的商业化潜力正在加速释放。
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐

所有评论(0)