66G、34G、21G 怎么选|MiniMax H3 权重完整对比
MiniMax H3 本地部署到底选哪个权重?一张表看懂

别再盲目下载了,看完这篇省下几百 GB 硬盘 💾
🤔 同一个模型,为什么有这么多版本?
MiniMax H3 发布后,开源社区放出了多个权重变体。很多朋友兴冲冲去下载,一看文件列表瞬间懵了——bf16、int8、fp8、pruned、ConvRot……这些词到底什么意思?我该下哪一个?
今天这篇就用一张表格讲清楚,帮你选对权重,不浪费带宽和硬盘。
⚡ 先搞懂几个关键词
在看表格之前,花 30 秒了解三个概念,后面的选择就一目了然了:
1️⃣ BF16 vs INT8 vs FP8 —— 精度的区别
| 精度类型 | 每参数占用 | 一句话解释 |
|---|---|---|
| BF16 | 2 字节(16 bit) | 原始精度,质量最好,但体积最大 |
| FP8 | 1 字节(8 bit) | 浮点 8 位量化,大幅压缩,质量损失较小 |
| INT8 | 1 字节(8 bit) | 整数 8 位量化,兼容性好,质量损失可控 |
🧠 类比理解: 就像一张照片,BF16 是无损 RAW 格式,INT8/FP8 是高压缩比的 JPEG——肉眼看差别不大,但文件小了好几倍。
2️⃣ Pruned(剪枝)—— 砍掉"没用"的参数
大模型中有大量参数实际上是冗余的,对最终效果贡献极低。剪枝技术就是把这些"摸鱼"参数裁掉,模型体积显著缩小,质量几乎不变。
3️⃣ ConvRot(卷积旋转量化)—— 更聪明的压缩
ConvRot 是一种针对卷积层的特殊量化策略,在 INT8 精度下进一步优化计算效率,让量化后的模型跑得更快、占得更少,同时尽可能保住画质。

文不如图,图不如表。
📊 一张表看懂:MiniMax H3 四种权重怎么选
| 权重文件名 | 精度 | 额外优化 | 体积 | 推荐场景 |
|---|---|---|---|---|
..._bf16.safetensors |
BF16 | 无 | 66.3 GB | 🏆 追求极致质量,硬件配置极高,多卡服务器 |
..._int8_convrot.safetensors |
INT8 | ConvRot 量化 | 34 GB | ⭐ 质量与资源平衡,RTX 30/40 系主流显卡首选推荐 |
..._pruned_fp8_scaled.safetensors |
FP8 | 剪枝 + 缩放量化 | 21 GB | 💡 显存紧张,低显存显卡的折中选择 |
..._pruned_int8_convrot.safetensors |
INT8 | 剪枝 + ConvRot | 21 GB | 🔧 低显存方案,硬件兼容性更强 |
🎯 你的显卡该选哪个?对号入座
🏆 RTX 4090 / A6000 / 多卡服务器 → 选 BF16(66.3GB)
如果你拥有 24GB 以上显存 的顶级显卡,或者多卡并行的工作站/服务器,直接上 BF16 原始精度版本。没有任何量化损失,画质就是天花板。
⚠️ 注意:66.3GB 仅指 UNet 权重一个文件,加上 Text Encoder(~15GB)和 VAE(~5.5GB),整套模型大约需要 85GB+ 存储空间。
⭐ RTX 3060/3070/3080/4060/4070/4080 → 选 INT8 + ConvRot(34GB)✅ 强烈推荐
这是大多数主流用户的甜点选择:
- 34GB 的体积,一块 1TB 固态能存 20+ 套模型
- INT8 量化 + ConvRot 优化,质量与 BF16 差距极小,肉眼几乎不可分辨
- 在 8GB~16GB 显存的显卡上运行流畅,不会 OOM
- 生成速度比 BF16 版本更快
🎯 一句话: 性价比最高,闭眼选这个就对了。
💡 RTX 2060/3050/笔记本 GPU / 8GB 以下显存 → 选 Pruned 版本(21GB)
显存吃紧?选两个 Pruned 版本就对了。两个版本体量相同(21GB),区别在于:
| 版本 | 适合情况 |
|---|---|
pruned_fp8_scaled |
追求画质略好一点,FP8 量化对视频质量更友好 |
pruned_int8_convrot |
硬件兼容性优先,老显卡或特殊驱动环境下更稳定 |
💡 实际使用中两者差异不大,如果你的显卡是 RTX 2060 / 3050 / 笔记本 GPU,建议先从
pruned_int8_convrot入手,兼容性最好,出问题概率最低。
📈 选型决策流程图
你有多大的显存/硬盘?
│
├─ 💪 24GB+ 显存,硬盘管够
│ └─ 👉 BF16(66.3GB)—— 极致质量
│
├─ 🎯 8GB~16GB 显存,主流配置
│ └─ 👉 INT8 + ConvRot(34GB)—— ⭐ 首选推荐
│
└─ 💡 8GB 以下,硬盘吃紧
└─ 追求兼容性?
├─ 是 👉 Pruned INT8 + ConvRot(21GB)
└─ 否 👉 Pruned FP8 + Scaled(21GB)
🔰 新手避坑指南
- 不要四个都下! 选一个最适合你配置的即可,四个全下要吃掉 140GB+,纯属浪费。
- 先下 INT8 ConvRot(34GB),跑通了再说。 这是社区验证最充分、出问题最少的版本。
- 如果 OOM(显存溢出),加
--lowvram参数启动 ComfyUI,它会智能地将不用的模型层卸载到内存,1GB 显存都能跑大模型。 - SSD 是刚需。 模型文件动辄几十 GB,机械硬盘加载一次可能要几分钟,体验极差。
🎬 下一步
选好了权重文件,接下来就是在 ComfyUI 中加载并跑起来了。具体操作流程可以参考我们的上一篇教程《ComfyUI + MiniMax H3 视频生成完整教程》,手把手带你出片!
🎯 总结
| 你的情况 | 推荐版本 | 体积 |
|---|---|---|
| 专业工作站 / 多卡 | BF16 | 66.3 GB |
| 主流显卡(大多数用户) | INT8 + ConvRot | 34 GB |
| 低显存 / 笔记本 | Pruned INT8 + ConvRot | 21 GB |
🧠 记住一句话: MiniMax H3 各版本之间的质量差距远比你想象的小,但体积差距比你想象的大。选对版本,不仅省硬盘、省下载时间,跑起来也更快更稳。
📢 关注我们,获取更多 AI 大模型本地部署干货!
💬 你的显卡是什么型号?选哪个版本?评论区聊聊

浙公网安备 33010602011771号