Skip to main content
MiniMax H3 受 MiniMax H3 Community License Agreement 约束。截至 2026 年 8 月 26 日审阅的 License 版本,美国、欧盟、英国和韩国属于 Excluded Territories,需要另行获得许可。下载、部署或提供托管服务前,请阅读最新协议。
MiniMax H3-Base 联合生成 768p 视频与同步立体声音频。本页提供两条不同路径:使用 ComfyUI 的本地可视化工作流,以及在 NVIDIA 数据中心 GPU 上使用 SGLang 部署自托管 API 服务。

状态与范围

固定 commit 可以提高命令的可复现性,但 H3 diffusion 服务尚不是稳定的 SGLang 发布契约。修改任一 revision 前应重新验证本页。
开放发布包含 H3-Base FL2VA 与 Ref2VA,不包含 H3-Context-IR 和 H3-Regenerate-2K。因此,自托管 H3-Base 不能复现 MiniMax 平台完整的 Context-IR 与 2K 工作流。

选择部署路径

需要在本地工作站通过可视化方式创建和调整工作流时,选择 ComfyUI;需要 HTTP 服务、可复现服务器配置或应用集成时,选择 SGLang。

使用 ComfyUI 本地运行 H3

ComfyUI 原生提供 MiniMax H3 节点和示例模板,无需先搭建推理 API,适合快速体验 T2V、I2V 和参考素材驱动工作流。
ComfyUI 模板使用 Comfy-Org/MiniMax-H3 发布的裁剪和量化文件,其中包含 INT8/NVFP4 组件。这些文件不同于 SGLang 基线使用的官方混合 BF16/FP32 H3 checkpoint,输出质量、显存占用和可复现性可能不同;不要混用两条路径的性能结论。

ComfyUI 基线

以上版本和 revision 记录 2026 年 8 月 26 日核验的文档基线。此后 Template Library 可能继续更新。

通过 Template Library 快速开始

  1. 将 ComfyUI 更新到 0.30.0 或更高版本,并正常启动。
  2. 打开 Template Library > Video
  3. 选择 MiniMax H3 T2VMiniMax H3 I2VMiniMax H3 R2V
  4. 按模型扫描弹窗下载所需文件。如果模型列表没有刷新,请重启 ComfyUI。
  5. 设置提示词,以及需要的输入图片、视频或音频参考素材。
  6. Resolution Selector 中使用 0.98 Megapixels 和 32 的倍数,或者为 16:9 原生画布直接设置 1344 × 768。不要选择 1.0 Megapixels:它会得到 1376 × 768,超过 H3-Base 的 768 × 1344 像素面积上限。
  7. 将工作流加入队列。正确结果应为包含 24 FPS 视频流和同步立体声音频的 MP4。

选择工作流

T2V 和 I2V 使用 FL2VA diffusion model;R2V 需要独立的 Ref2VA diffusion model,两者不能互换。在 R2V 提示词中,按连接顺序使用 <Picture 1><Video 1><Audio 1> 等标签引用输入,并说明每个参考素材负责身份、风格、动作、运镜还是声音。

手动放置模型文件

推荐使用 Template Library 的自动下载流程。离线部署或手动管理模型时,请从 Comfy-Org 模型仓库 下载所选模板列出的文件,并按下表放置: 团队需要可复现工作流时,请导出 Workflow JSON,并记录 ComfyUI 版本和每个模型文件的 revision。不要在未记录的情况下将 FL2VA 替换为 Ref2VA,或启用会改变质量的 Turbo LoRA。

分辨率、时长与 Turbo 模式

  • H3-Base 使用 768 像素短边,宽高需要对齐到 32 的倍数;1344 × 768 是原生 16:9 画布。
  • 时长会按模型的 17k + 5 帧网格和 24 FPS 对齐,因此请求时长可能被调整到有效帧数。
  • FL2VA 示例工作流默认使用 20 steps;可选 8-step Turbo LoRA 更快,但可能降低动作和音频质量。
  • R2V 使用独立的可选 4-step Turbo LoRA。比较结果时,应记录 LoRA 名称、强度、steps、seed 和全部参考素材。
ComfyUI 还提供 MiniMaxH3AddGuide 任意帧锚点、提示词 embedding,以及使用 latent noise mask 进行局部重绘或扩展等高级工作流。这些能力和可选的 Sage Attention 加速会随 ComfyUI 更新;将其用于固定生产流程前,请查看 MiniMax H3 ComfyUI 官方指南

SGLang 硬件与环境

下方 8 × B200 拓扑是参考配置,不代表最低硬件要求。当前 MiniMax 模型卡提供了四 GPU 的 SGLang 命令,但未注明 GPU 型号,也未公布该命令的峰值显存、主机内存、磁盘、互联、驱动、CUDA 或延迟数据。 继续前请安装 gitcurljqffmpeg、兼容的 NVIDIA 驱动与 CUDA runtime。信息未公布不代表没有要求。

SGLang Quickstart

以下流程仅下载 FL2VA 分区,启动只监听本机的服务,等待就绪,提交并轮询任务,下载 MP4,然后检查媒体流。

1. 安装固定的 SGLang 源码

固定 commit 避免使用 H3 早期支持阶段常见的可变 maindev 或无版本预发布安装。

2. 下载固定的 FL2VA checkpoint

--model-path 应指向仓库根目录,不要指向 FL2VA/ 子目录。SGLang 通过 --model-variant fl2va 选择分区。

3. 启动 FL2VA 服务

在 SGLang 仓库目录中激活虚拟环境后运行:
保持进程运行。首次启动需要加载模型并 warmup,可能需要数分钟才会就绪。

4. 检查就绪状态

在第二个终端运行:
服务就绪后返回:
/liveness 只表示 HTTP 进程能接收请求。应使用 /health;模型 warmup 完成前该接口返回 HTTP 503。

5. 生成、轮询并下载 MP4

预期结果是一个非空 MP4,其中包含一条 24 FPS 的 H.264 视频流,以及一条 32 kHz 的 AAC 立体声音频流。16:9、短边 768 像素配置对应 1344 × 768,时长约 5 秒。

能力与 checkpoint 矩阵

H3-Base 输出时长为 4–15 秒,短边 768 像素,视频 24 FPS,音频为 32 kHz 立体声。Ref2VA 最多接受 9 张图片、3 个视频片段和 3 个音频片段;单文件及组合限制请查看模型卡。 如需提供 Ref2VA,请在同一模型 revision 下载 "Ref2VA/*",并用 --model-variant ref2va 在另一个端口启动第二个服务。不要向 FL2VA 服务发送 ref2va 请求。

SGLang 硬件与性能数据

只有 checkpoint、请求形状、推理步数、flow shift 和 quality level 相同时,性能数据才可以直接比较。 以下表格转录 SGLang 上游 benchmark。这些数据在上游构建上测得,而非本页固定的 commit,应作为拓扑和容量参考,不构成对固定基线的保证。除特别说明外,负载均为 Quickstart 配置:1344 × 768、124 帧、24 FPS、50 推理步、5 秒 T2VA、单请求。

8 × B300 精度与 encoder 放置 sweep

单节点 8 × B300、Ulysses degree 8、组件常驻的 12 配置 sweep,每格在 1 次 warmup 请求后实测 1 次请求。FP8 为在线量化的近似路径;只有 BF16 行属于 lossless 参考路径。 batch size 为 1 时,auto 解析为相同的 fold 放置;replicate 多占用约 40 GB 峰值显存且没有延迟收益。在该拓扑上,FP8 主要换取显存余量,而非速度。

4 × H200 拓扑对比

同一台四卡 H200 主机上两种 lossless 常驻放置的连续对比,固定 prompt 和 seed。第二组增加 --warmup-resolutions 1344x768,使 warmup 覆盖实际服务分辨率。 Ulysses 4 是 H200 的延迟默认拓扑;TP 2 + Ulysses 2 的单卡峰值显存低约 30 GB,这也是它作为 80 GB H100 配方的原因。

4 × H100 拓扑对比

同一台四卡 H100 主机上的三种 lossless 放置。上游表格未公布这些行的请求形状,因此只应在表内互相比较。
2026 年 8 月 26 日审阅的上游 issue(sgl-project/sglang#34227)报告:使用 --use-fsdp-inference true 部署 H3 可能静默产生损坏的视频和音频,且服务端无任何报错。在该问题解决前,优先使用上表的 TP 和 Ulysses 放置;依赖 FSDP 前请先验证输出。

2 × 8 × H200 跨节点扩展

单节点 8 × H200(Ulysses 8)与双节点 16 卡(Ulysses 8 × Ring 2,节点间 InfiniBand)的受控 denoise 阶段对比,固定 prompt、seed 和步数。跨节点 H3 必须使用 --encoder-parallel replicateauto 的 fold 决策不感知节点边界。 序列越长收益越大。跨节点输出在重复运行间是确定的,但不应期望与相同 prompt 和 seed 的单节点运行逐位一致。

消费级 GPU 与 Ascend NPU

消费级 GPU、卸载、量化、AMD 和多节点配方会独立演进。在 MiniMax 发布测试矩阵前,应将其视为 SGLang 上游配置,而不是 MiniMax 已验证硬件。

SGLang 权重、缓存与离线部署

  • 官方 Hugging Face 仓库为 MiniMaxAI/MiniMax-H3。默认缓存根目录是 ~/.cache/huggingface;本页通过 HF_HOME 覆盖它。
  • 中国大陆镜像为 MiniMax/MiniMax-H3。其 revision 与固定 Hugging Face commit 的一致性尚无公开说明,因此不用于本页可复现基线。
  • 内网部署时,先在联网机器上执行固定的 hf download 命令,传输完整模型目录,并确认 model_index.json 及所选 FL2VA/Ref2VA/ 目录均存在。启动时设置 HF_HUB_OFFLINE=1
  • Hugging Face 下载中断后可以使用相同 revision 重新运行命令。如怀疑缓存损坏,使用 hf download --force-download 重新下载固定 revision,不要静默切换版本。
  • 除非部署会同时提供两类能力,否则不要下载两个 checkpoint 分区;每个分区需要独立服务。

SGLang 生产部署与安全

Quickstart 仅监听 127.0.0.1,不提供公网入口。如需对外暴露服务:
  • 放在带鉴权的反向代理或 API gateway 后,并要求 API Key 或等价身份校验。
  • 在入口终止 TLS,并通过防火墙、安全组或私有网络限制后端端口。
  • 设置请求配额、并发任务限制、输出保留策略、审计日志,以及 H3 License 要求的滥用防护。
  • 以只读方式挂载服务端参考素材,并仅允许专用目录,不要开放任意文件系统路径。
  • 如入口会下载远程图片、视频或音频 URL,应先执行域名白名单、重定向次数、连接/读取超时、最大字节数、解码图片尺寸和媒体时长限制,再将本地文件交给 SGLang。
只有这些控制就绪后,才应将服务改为 --host 0.0.0.0。SGLang 的模型支持本身不提供 License 要求的安全措施。

SGLang 故障排查

使用 vLLM-Omni 自托管

vLLM-Omni 也通过 OpenAI 兼容的 /v1/videos API 提供 H3 服务,配方见其社区维护的 MiniMax-H3 recipe。它是上游备选路径,不是本页的可复现基线;上文的 SGLang Quickstart 仍是固定参考路径。 以下是转录自该 recipe 的上游实测数据。除非负载一致,不要与上文 SGLang 表格直接比较;其中多行使用 209 帧而非 Quickstart 的 124 帧配置。 来自该 recipe 的运维要点:H3 为 CFG 蒸馏模型,--cfg-parallel-size 必须保持 1;H3 VAE 只支持原生 tile 并行模式;纯 Ulysses 会在每个 rank 上复制完整 DiT,不能作为小显存 GPU 的容量路径;上游实测显示请求合批(--step-execution --max-num-seqs 4)不会提升 H3 同时到达的大请求吞吐。ffmpegffprobe 必须在 PATH 中。

使用 miles-diffusion 对 H3 进行 LoRA 微调

miles-diffusion 发布了 H3-Base FL2VA 的端到端 LoRA SFT 配方,覆盖数据预处理约束、单命令训练脚本、学习率消融,以及导出回 SGLang 服务的路径。这是上游训练配方,不是 MiniMax 已验证基线;用于生产前请重新验证。 训练数据必须精确落在 H3 的服务网格上;encoder 会拒绝任何不合网格的输入: 启动训练:

训练性能参考

在 8 × H200 上使用 254 窗口参考数据集实测: Checkpoint 在每个 epoch 边界和最后一个 rollout 保存;iter_N 计数已完成的 rollout,不是 optimizer step。应观察分桶 loss(--log-loss-sigma-bucket)而非聚合曲线:DiT 的 loss 量级随抽到的噪声水平大幅波动。

学习率消融

上游消融固定数据与配置(rank 64 / alpha 128、254 窗口 × 10 epochs),学习率是最敏感的参数:

导出并部署 LoRA

训练只产出 DCP checkpoint。导出为单个 safetensors 文件及其 adapter_config.json sidecar:
SGLang 通过 --lora-path 直接加载导出的 adapter。sidecar 必须与 safetensors 文件放在同一目录:加载时在该目录查找 sidecar,缺失时 alpha 会回退为 rank,即强度减半。对比未修改基线前,请记录 adapter 文件、rank、alpha 和基座 revision。

License 与系统边界

MiniMax H3 Community License Agreement 包含地域、商业使用、分发、署名、托管服务安全措施和 Acceptable Use Policy 等条款。License 可能变化,应以链接中的文本为准。 模型卡、可复现示例、prompt 指南和 License Q&A 请参阅 MiniMaxAI/MiniMax-H3 仓库。高级硬件、精度、放置和性能配置请参阅 SGLang MiniMax-H3 Cookbook