MiniMax H3 开源后本地部署:用 ComfyUI 跑自己的视频大模型
MiniMax H3 开源后本地部署:用 ComfyUI 跑自己的视频大模型
上一篇讲了怎么用 ComfyUI 调 MiniMax H3 的云端 API。这篇讲另一种玩法:H3 开源权重后,把模型跑在自己机器上——数据不出本机、不用按条付费、还能离线用。
本地部署和云端接入用的是同一套 ComfyUI 工作流思路,区别在「模型从哪来、Key 还要不要」。下面按能跑通的顺序走。
前提说明:本篇基于「MiniMax 已放出可在本地加载的 H3 权重」这一前提。具体仓库地址、模型文件格式、最低显存等以官方开源发布页为准——开源项目的这些细节变动很快,下文涉及具体名称的地方都用占位,认准官方源再填。
一、为什么要在本地跑 H3
| 诉求 | 本地部署 | 云端 API |
|---|---|---|
| 数据隐私 | ✅ 不出机器 | ❌ 要传到云端 |
| 成本 | 一次买卡,无限次跑 | 按量计费,量大持续花钱 |
| 离线 | ✅ 可离线 | ❌ 需联网 |
| 上手难度 | 较高(环境/显存) | 低(填 Key 即用) |
| 性能上限 | 受你显卡限制 | 官方集群,稳 |
简单说:涉密 / 量大 / 要离线选本地;图省事 / 偶尔用 / 没显卡选云端。
二、先确认官方开源了什么
H3 开源的通常是模型权重(不是完整训练代码),发布形式常见为:
safetensors/gguf/ 官方专用格式- 放在 MiniMax 官方 GitHub 组织 或 HuggingFace 官方账号下
两条安全铁律:
- 只从官方源下载,别下别人改名的「整合包」,避免投毒。
- 「开源权重」≠「可商用」。商用前一定看官方 license。
三、硬件与软件准备
视频生成模型很吃显存,先估一档:
| 显存档位 | 预期体验 |
|---|---|
| < 16GB | 基本跑不动完整版,考虑量化版或退回云端 |
| 16–24GB | 量化版(如 Q4–Q8)可跑,分辨率/时长要降 |
| 24–48GB | 接近完整权重,1080p 较稳 |
| 48GB+ | 可冲 2K、较长时长 |
其它准备:
- 一张能用的 N 卡(驱动 + CUDA 正常),ComfyUI 已能启动
- 足够的磁盘(模型文件通常几十 GB 起)
- Python 环境与 ComfyUI-Manager 正常
四、拿到权重并放到 ComfyUI
下载(把占位换成官方真实地址):
# 方式 A:HuggingFace 官方组织
huggingface-cli download <官方组织>/<H3仓库> --local-dir ./H3
# 方式 B:官方 Git 仓库
git clone <官方仓库地址>
放哪?别把它当 SD 的 checkpoint 丢进 models/checkpoints——H3 是另一套架构,ComfyUI 的 SD 加载器读不懂。一般由专用节点约定目录(常见如 models/minimax 或节点 README 指定的路径),以你装的那个节点说明为准。
下完顺手校验一下文件完整性(官方通常会给 hash / sha):
sha256sum H3-xxx.safetensors # 和官方公布的值比对
五、装本地推理节点
ComfyUI-Manager 里搜 MiniMax,找标注 local / 本地 / 权重的节点包——它和「只调云端 API」的包是两回事,别装错。
- 装完重启 ComfyUI
- 进画布右键
Add Node,能搜到本地 H3 相关节点,说明通了 - 若启动日志有 import 报错,按提示
pip install补依赖
六、让节点指向本地模型
云端版要在节点填 API Key;本地版不需要 Key,而是告诉节点「模型在哪、用什么精度」:
| 配置项(名字以节点为准) | 作用 |
|---|---|
| model_path / model_name | 选本地权重路径或模型名 |
| device | cuda / auto,指定用显卡 |
| dtype | fp16 / bf16 / 量化类型 |
| endpoint(若走「本地服务 + 前端」架构) | 填 http://127.0.0.1:xxxx 指向本机推理服务 |
如果你用的是「本地起一个推理服务、ComfyUI 只当前端」的架构,那就把节点的 endpoint 从云端域名改成 127.0.0.1 上的本机地址,工作流本身不用改。
七、跑第一条本地视频
工作流和云端版基本一致:
[文本 / 图片] ──▶ [MiniMax H3 本地节点] ──▶ [预览 / 保存视频]
参数照旧:prompt(画面/音频/规格分段写)、duration、resolution、seed。
本地特有现象:第一次跑会把权重加载进显存,明显比后面慢;加载完后留在显存里,后续出片就快了。所以本地适合「一次加载、连跑很多条」。
八、显存不够怎么办
按性价比从高到低试:
- 换量化版权重(Q8 → Q4 依次更省显存,画质略降)
- 降分辨率:1080p 代替 2K
- 缩短时长:更短的视频显存占用更低
- CPU offload:把部分层放内存,能跑但更慢
九、常见坑
坑 1:把权重丢进 models/checkpoints
架构不对,加载直接失败。按专用节点约定的目录放。
坑 2:OOM 显存爆炸
先量化、再降分辨率/时长,最后才考虑 offload。别一上来就跑 2K 完整权重。
坑 3:下了非官方包
安全风险。只认官方源 + 校验 hash。
坑 4:节点装了搜不到
没重启,或依赖没装全。看启动日志。
坑 5:license 误用
本地跑着方便,但商用前务必确认 license 允许。
十、小结
H3 开源后,本地部署成了「隐私 + 成本 + 离线」三类需求的主解:官方源下权重 → 放到专用节点目录 → 装本地推理节点 → 节点指向本机模型 → 跑和云端一样的工作流。
它和云端 API 不是替代关系,而是分工:本地扛涉密和量大,云端扛省事和偶尔。手里有显卡就两条都备着,按场景切。
仓库地址、模型格式、最低显存随官方开源发布变动,以 MiniMax 官方文档为准。
相关阅读
- ComfyUI 接入 MiniMax H3(云端 API):填 Key 即用,上手最快
- MiniMax H3 全模态上手:模型能力、提示词技巧与选型
- Ollama 本地部署大模型:本地跑文生文模型的通用思路参考