MiniMax H3:当 AI 视频开始同时理解画面、声音与参考素材

做一条 AI 视频,今天仍像在搭积木:一个模型生成画面,另一个模型配音,再补音乐、环境声和口型。人物可能换脸,声音未必贴合动作,创作者的不少时间耗在模型之间“对缝”。

MiniMax 新发布的 H3,试图把这些环节收回同一个系统。它能读取文字、图片、视频和音频,并直接输出带立体声的视频。参考素材、镜头运动、对白和环境声由此进入同一段生成上下文。

Part.01 H3 不只是一个视频生成器

MiniMax 将 H3 定义为“通用全模态生成系统”,视频创作需要的几种材料可以一起进入模型:文字负责描述意图,图片提供人物或场景,视频提供动作与镜头参考,音频则可以提供音色、对白或氛围。

H3 可生成 4-15 秒、24 FPS 的视频,默认短边为 768 像素,完整流程可输出 2K;声音规格为 32 kHz 立体声。横屏、竖屏、方形以及 21∶9 等常见画幅都在支持范围内,还包括了中文、英语、日语、韩语等 11 种稳定支持的对白语言。

模型到底有多强,榜单给出了更直接的参照。在 Arena.ai 公布的 Video Arena 榜单中,MiniMax H3 的图生视频得分为 1476,排在总榜第二,只比第一名 Dreamina Seedance 2.0 少 2 分;文生视频得分为 1455,排在总榜第四,与第三名 Muse Video 相差 3 分。

更明显的是代际变化。上一代 Hailuo 2.3 在图生视频榜排第 27,得分 1199;到了 H3,排名升至第二。文生视频也从 Hailuo 2.3 的第 23 名、1260 分,上升到 H3 的第四名、1455 分。H3 同时还是两个榜单中排名最高的开放模型,比下一名开放模型高出约 280 分。两项成绩说明,H3 的优势不只停留在多模态输入和声画一体的设计上,实际生成质量也已进入当前视频模型的第一梯队。

Part.02 参考素材不再只是“垫一张图”

过去的“参考图生视频”,通常是把一张图当作起始帧,再让模型猜测后续运动。H3 也支持只给尾帧或同时指定首尾帧。它的多模态参考模式一次最多可使用 9 张图片、3 段视频和 3 段音频,合计不超过 12 个文件。

这让参考素材的分工更细。你可以用图片锁定角色和服装,用视频借鉴表演或运镜,再用一段音频提供说话人的音色。音频不能单独作为唯一参考,需要与图片或视频配合。 API 还明确区分了“首尾帧生成”和“多模态参考生成”,两种模式不能在同一次请求里混用。

例如制作一条人物短片时,创作者可以给出角色正面照、服装细节图和一段动作视频,再附上声音样本与台词。模型需要保留的是人物身份和音色,借用的是动作与镜头,而不是机械复制某一份素材。这比单张参考图更接近一份分工明确的拍摄指令。

素材多了,难点也从“看懂一张图”变成“理清彼此关系”。Context-IR 会判断图片对应哪个人物、音频提供什么信息、动作何时发生,再整理成 H3-Base 能读取的中间表示。它有点像拍摄前的分镜整理:先确认每份素材在成片里的角色,再开始生成。

Part.03 从声画同步到 2K,工作流发生了什么变化

H3-Base 的核心是一套约 330 亿参数的稠密单流 Transformer。所谓“单流”,可以粗略理解为:图像、视频和声音经过各自的编码器与 VAE(一类压缩和还原声画数据的模型)处理后,被整理进同一条多模态序列;模型随后同时预测视频和音频的潜变量,最后再分别解码成画面与立体声。声音不再是画面生成完毕后的外挂轨道,而是和动作、镜头一起被计算。

脚步落地、物体碰撞、人物开口和环境变化,可以在生成阶段建立时间对应关系。H3 还能参考已有视频的构图和运动,为人物加入新对白,并依据音频样本复现说话风格。它仍可能出现口型或身份漂移,但声画关系已经进入模型的核心任务。

H3 的 2K 流程也不是普通放大。系统先生成 768p 结果,再连同最初的文字和参考素材送回 H3,由 H3-Regenerate-2K 重新生成高分辨率版本。原始上下文有助于找回低清画面中模糊的小字、服装和场景信息,代价是更长的处理链路和更高的计算成本。

Part.04 官方示例:当多模态参考真正进入创作

官方使用手册里的两个案例更容易看出 H3 到底能怎么用。

第一个案例同时输入 6 张图片和一段示例视频。提示词要求 H3 使用图片中的内容,同时“严格参考”示例视频的镜头节奏、转场风格与音乐,最终生成一条 4 秒视频。六张图片负责回答“画面里有什么”,参考视频则回答“这些画面应该怎样流动”。构图素材与剪辑方式来自不同文件,各自分工。

第二个案例只用了两张图,一张是咖啡,一张是沙漠。镜头先推进到咖啡表面的奶泡、可可粉和液体纹理,让颗粒逐渐覆盖全屏;当这些细节与沙丘、风蚀纹理足够相似时,画面自然过渡为沙漠。提示词还明确要求一镜到底,不能开裂、黑屏、硬切或出现拼接感。官方示例时长为 15 秒。难点不是把两张图接起来,而是在相似材质处完成转换,同时保持镜头连续。

从这两个例子看,参考素材可以各司其职。图片可以定义角色和场景,视频可以提供动作、镜头或剪辑节奏,音频可以规定音色和氛围。对创作者来说,写提示词也不再只是堆叠风格词,而是把每份素材的用途和它们之间的关系交代清楚。

Part.05 下载链接

OpenCSG社区:

https://opencsg.com/models/MiniMaxAI/MiniMax-H3

Hugging Face社区:

https://huggingface.co/MiniMaxAI/MiniMax-H3

Part.06 OpenCSG vs 魔搭:如何选择?

模型部署和推理使用在魔搭、OpenCSG 等模型社区中均可实现,但OpenCSG/CSGHub 的核心在于,它不只是让模型“跑起来”,而是进一步支持企业把模型、数据集、代码和应用等 AI 资产放到本地、内网或离线环境中统一管理。它解决的不只是“模型怎么部署、怎么调用”的问题,更是“模型进入企业后如何被安全管理、版本沉淀、权限控制和持续运营”的问题。

对于企业来说,CSGHub 可以帮助构建自己的私有模型资产中心,降低对外部平台的依赖;对于个人开发者来说,也可以用更系统的方式管理模型、实验项目和 AI 应用流程。相比更偏向模型发现、体验和使用入口的魔搭,CSGHub 更适合那些希望把 AI 能力真正沉淀下来,并长期维护、持续迭代的用户。

关于OpenCSG

OpenCSG 是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps是人工智能领域的一种AI原生方法论,由OpenCSG(开放传神)提出。AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品CSGHub提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。

posted @ 2026-08-30 17:37  OpenCSG  阅读(85)  评论(0)    收藏  举报