状态与范围
固定 commit 可以提高命令的可复现性,但 H3 diffusion 服务尚不是稳定的 SGLang 发布契约。修改任一 revision 前应重新验证本页。
开放发布包含 H3-Base FL2VA 与 Ref2VA,不包含 H3-Context-IR 和 H3-Regenerate-2K。因此,自托管 H3-Base 不能复现 MiniMax 平台完整的 Context-IR 与 2K 工作流。
选择部署路径
需要在本地工作站通过可视化方式创建和调整工作流时,选择 ComfyUI;需要 HTTP 服务、可复现服务器配置或应用集成时,选择 SGLang。
使用 ComfyUI 本地运行 H3
ComfyUI 原生提供 MiniMax H3 节点和示例模板,无需先搭建推理 API,适合快速体验 T2V、I2V 和参考素材驱动工作流。ComfyUI 基线
以上版本和 revision 记录 2026 年 8 月 26 日核验的文档基线。此后 Template Library 可能继续更新。
通过 Template Library 快速开始
- 将 ComfyUI 更新到
0.30.0或更高版本,并正常启动。 - 打开 Template Library > Video。
- 选择 MiniMax H3 T2V、MiniMax H3 I2V 或 MiniMax H3 R2V。
- 按模型扫描弹窗下载所需文件。如果模型列表没有刷新,请重启 ComfyUI。
- 设置提示词,以及需要的输入图片、视频或音频参考素材。
- 在 Resolution Selector 中使用
0.98Megapixels 和32的倍数,或者为 16:9 原生画布直接设置1344 × 768。不要选择1.0Megapixels:它会得到1376 × 768,超过 H3-Base 的 768 × 1344 像素面积上限。 - 将工作流加入队列。正确结果应为包含 24 FPS 视频流和同步立体声音频的 MP4。
选择工作流
T2V 和 I2V 使用 FL2VA diffusion model;R2V 需要独立的 Ref2VA diffusion model,两者不能互换。在 R2V 提示词中,按连接顺序使用
<Picture 1>、<Video 1>、<Audio 1> 等标签引用输入,并说明每个参考素材负责身份、风格、动作、运镜还是声音。
手动放置模型文件
推荐使用 Template Library 的自动下载流程。离线部署或手动管理模型时,请从 Comfy-Org 模型仓库 下载所选模板列出的文件,并按下表放置:
团队需要可复现工作流时,请导出 Workflow JSON,并记录 ComfyUI 版本和每个模型文件的 revision。不要在未记录的情况下将 FL2VA 替换为 Ref2VA,或启用会改变质量的 Turbo LoRA。
分辨率、时长与 Turbo 模式
- H3-Base 使用 768 像素短边,宽高需要对齐到
32的倍数;1344 × 768是原生 16:9 画布。 - 时长会按模型的
17k + 5帧网格和 24 FPS 对齐,因此请求时长可能被调整到有效帧数。 - FL2VA 示例工作流默认使用 20 steps;可选 8-step Turbo LoRA 更快,但可能降低动作和音频质量。
- R2V 使用独立的可选 4-step Turbo LoRA。比较结果时,应记录 LoRA 名称、强度、steps、seed 和全部参考素材。
MiniMaxH3AddGuide 任意帧锚点、提示词 embedding,以及使用 latent noise mask 进行局部重绘或扩展等高级工作流。这些能力和可选的 Sage Attention 加速会随 ComfyUI 更新;将其用于固定生产流程前,请查看 MiniMax H3 ComfyUI 官方指南。
SGLang 硬件与环境
下方 8 × B200 拓扑是参考配置,不代表最低硬件要求。当前 MiniMax 模型卡提供了四 GPU 的 SGLang 命令,但未注明 GPU 型号,也未公布该命令的峰值显存、主机内存、磁盘、互联、驱动、CUDA 或延迟数据。
继续前请安装
git、curl、jq、ffmpeg、兼容的 NVIDIA 驱动与 CUDA runtime。信息未公布不代表没有要求。
SGLang Quickstart
以下流程仅下载 FL2VA 分区,启动只监听本机的服务,等待就绪,提交并轮询任务,下载 MP4,然后检查媒体流。1. 安装固定的 SGLang 源码
main、dev 或无版本预发布安装。
2. 下载固定的 FL2VA checkpoint
--model-path 应指向仓库根目录,不要指向 FL2VA/ 子目录。SGLang 通过 --model-variant fl2va 选择分区。
3. 启动 FL2VA 服务
在 SGLang 仓库目录中激活虚拟环境后运行:4. 检查就绪状态
在第二个终端运行:/liveness 只表示 HTTP 进程能接收请求。应使用 /health;模型 warmup 完成前该接口返回 HTTP 503。
5. 生成、轮询并下载 MP4
能力与 checkpoint 矩阵
H3-Base 输出时长为 4–15 秒,短边 768 像素,视频 24 FPS,音频为 32 kHz 立体声。Ref2VA 最多接受 9 张图片、3 个视频片段和 3 个音频片段;单文件及组合限制请查看模型卡。
如需提供 Ref2VA,请在同一模型 revision 下载
"Ref2VA/*",并用 --model-variant ref2va 在另一个端口启动第二个服务。不要向 FL2VA 服务发送 ref2va 请求。
SGLang 硬件与性能数据
只有 checkpoint、请求形状、推理步数、flow shift 和 quality level 相同时,性能数据才可以直接比较。
以下表格转录 SGLang 上游 benchmark。这些数据在上游构建上测得,而非本页固定的 commit,应作为拓扑和容量参考,不构成对固定基线的保证。除特别说明外,负载均为 Quickstart 配置:1344 × 768、124 帧、24 FPS、50 推理步、5 秒 T2VA、单请求。
8 × B300 精度与 encoder 放置 sweep
单节点 8 × B300、Ulysses degree 8、组件常驻的 12 配置 sweep,每格在 1 次 warmup 请求后实测 1 次请求。FP8 为在线量化的近似路径;只有 BF16 行属于 lossless 参考路径。
batch size 为 1 时,
auto 解析为相同的 fold 放置;replicate 多占用约 40 GB 峰值显存且没有延迟收益。在该拓扑上,FP8 主要换取显存余量,而非速度。
4 × H200 拓扑对比
同一台四卡 H200 主机上两种 lossless 常驻放置的连续对比,固定 prompt 和 seed。第二组增加--warmup-resolutions 1344x768,使 warmup 覆盖实际服务分辨率。
Ulysses 4 是 H200 的延迟默认拓扑;TP 2 + Ulysses 2 的单卡峰值显存低约 30 GB,这也是它作为 80 GB H100 配方的原因。
4 × H100 拓扑对比
同一台四卡 H100 主机上的三种 lossless 放置。上游表格未公布这些行的请求形状,因此只应在表内互相比较。2 × 8 × H200 跨节点扩展
单节点 8 × H200(Ulysses 8)与双节点 16 卡(Ulysses 8 × Ring 2,节点间 InfiniBand)的受控 denoise 阶段对比,固定 prompt、seed 和步数。跨节点 H3 必须使用--encoder-parallel replicate;auto 的 fold 决策不感知节点边界。
序列越长收益越大。跨节点输出在重复运行间是确定的,但不应期望与相同 prompt 和 seed 的单节点运行逐位一致。
消费级 GPU 与 Ascend NPU
消费级 GPU、卸载、量化、AMD 和多节点配方会独立演进。在 MiniMax 发布测试矩阵前,应将其视为 SGLang 上游配置,而不是 MiniMax 已验证硬件。
SGLang 权重、缓存与离线部署
- 官方 Hugging Face 仓库为
MiniMaxAI/MiniMax-H3。默认缓存根目录是~/.cache/huggingface;本页通过HF_HOME覆盖它。 - 中国大陆镜像为
MiniMax/MiniMax-H3。其 revision 与固定 Hugging Face commit 的一致性尚无公开说明,因此不用于本页可复现基线。 - 内网部署时,先在联网机器上执行固定的
hf download命令,传输完整模型目录,并确认model_index.json及所选FL2VA/或Ref2VA/目录均存在。启动时设置HF_HUB_OFFLINE=1。 - Hugging Face 下载中断后可以使用相同 revision 重新运行命令。如怀疑缓存损坏,使用
hf download --force-download重新下载固定 revision,不要静默切换版本。 - 除非部署会同时提供两类能力,否则不要下载两个 checkpoint 分区;每个分区需要独立服务。
SGLang 生产部署与安全
Quickstart 仅监听127.0.0.1,不提供公网入口。如需对外暴露服务:
- 放在带鉴权的反向代理或 API gateway 后,并要求 API Key 或等价身份校验。
- 在入口终止 TLS,并通过防火墙、安全组或私有网络限制后端端口。
- 设置请求配额、并发任务限制、输出保留策略、审计日志,以及 H3 License 要求的滥用防护。
- 以只读方式挂载服务端参考素材,并仅允许专用目录,不要开放任意文件系统路径。
- 如入口会下载远程图片、视频或音频 URL,应先执行域名白名单、重定向次数、连接/读取超时、最大字节数、解码图片尺寸和媒体时长限制,再将本地文件交给 SGLang。
--host 0.0.0.0。SGLang 的模型支持本身不提供 License 要求的安全措施。
SGLang 故障排查
使用 vLLM-Omni 自托管
vLLM-Omni 也通过 OpenAI 兼容的/v1/videos API 提供 H3 服务,配方见其社区维护的 MiniMax-H3 recipe。它是上游备选路径,不是本页的可复现基线;上文的 SGLang Quickstart 仍是固定参考路径。
以下是转录自该 recipe 的上游实测数据。除非负载一致,不要与上文 SGLang 表格直接比较;其中多行使用 209 帧而非 Quickstart 的 124 帧配置。
来自该 recipe 的运维要点:H3 为 CFG 蒸馏模型,
--cfg-parallel-size 必须保持 1;H3 VAE 只支持原生 tile 并行模式;纯 Ulysses 会在每个 rank 上复制完整 DiT,不能作为小显存 GPU 的容量路径;上游实测显示请求合批(--step-execution --max-num-seqs 4)不会提升 H3 同时到达的大请求吞吐。ffmpeg 和 ffprobe 必须在 PATH 中。
使用 miles-diffusion 对 H3 进行 LoRA 微调
miles-diffusion 发布了 H3-Base FL2VA 的端到端 LoRA SFT 配方,覆盖数据预处理约束、单命令训练脚本、学习率消融,以及导出回 SGLang 服务的路径。这是上游训练配方,不是 MiniMax 已验证基线;用于生产前请重新验证。
训练数据必须精确落在 H3 的服务网格上;encoder 会拒绝任何不合网格的输入:
启动训练:
训练性能参考
在 8 × H200 上使用 254 窗口参考数据集实测:
Checkpoint 在每个 epoch 边界和最后一个 rollout 保存;
iter_N 计数已完成的 rollout,不是 optimizer step。应观察分桶 loss(--log-loss-sigma-bucket)而非聚合曲线:DiT 的 loss 量级随抽到的噪声水平大幅波动。
学习率消融
上游消融固定数据与配置(rank 64 / alpha 128、254 窗口 × 10 epochs),学习率是最敏感的参数:导出并部署 LoRA
训练只产出 DCP checkpoint。导出为单个 safetensors 文件及其adapter_config.json sidecar:
--lora-path 直接加载导出的 adapter。sidecar 必须与 safetensors 文件放在同一目录:加载时在该目录查找 sidecar,缺失时 alpha 会回退为 rank,即强度减半。对比未修改基线前,请记录 adapter 文件、rank、alpha 和基座 revision。
License 与系统边界
MiniMax H3 Community License Agreement 包含地域、商业使用、分发、署名、托管服务安全措施和 Acceptable Use Policy 等条款。License 可能变化,应以链接中的文本为准。
模型卡、可复现示例、prompt 指南和 License Q&A 请参阅
MiniMaxAI/MiniMax-H3 仓库。高级硬件、精度、放置和性能配置请参阅 SGLang MiniMax-H3 Cookbook。