状态与参考基线
官方来源没有公布本配方的最低主机内存、峰值显存、最低 NVIDIA 驱动版本或完整生产磁盘余量。部署前,请确认宿主机驱动与固定镜像内的 CUDA Runtime 兼容,并准备大于权重仓库大小的可用磁盘。
硬件配置
下表报告 SGLang 当前支持矩阵。“已验证”表示经过 SGLang Cookbook 验证,不代表本文档完成了 MiniMax 独立复测。
如需 B300、GB 系列、H200 或 AMD 的准确命令,请使用 SGLang 配置生成器。未经重新验证,不要直接把这些命令参数替换到本页 B200 基线中。
Quickstart:8 × B200
开始前,请确认宿主机有足够空间存放约 444 GB 权重、容器镜像和缓存。1. 拉取固定运行时
2. 验证 GPU 访问
输出必须列出全部 8 张 B200 GPU:3. 启动服务
-p 127.0.0.1:30000:30000 只将端口发布到宿主机回环地址。首次启动需要下载约 444 GB 权重,所需时间取决于存储和网络吞吐。
4. 检查就绪状态
服务日志显示已经就绪后,在另一个终端运行:0 退出。如果失败,请保持服务进程运行并检查日志,再发送推理请求。
5. 验证文本生成
choices[0].message.content。模型产生推理轨迹时,SGLang 会将其单独放在 choices[0].message.reasoning_content。
6. 验证图片输入
能力边界
在 AMD 平台上,SGLang 已验证文本对话、推理内容分离和工具调用;ROCm 路径尚未验证视觉输入。
已发布性能数据
SGLang 报告了以下服务测量结果。这些数据是上游参考结果,不构成 MiniMax 性能保证。
两项测试都使用 SGLang PR
#27944、CUDA Graph、清空缓存和预热后的稳态运行。来源未公布峰值显存、主机内存、冷启动时间和生产并发建议。容量规划前,请使用自身的提示词长度、输出长度、多模态请求比例和并发进行压测。
权重、缓存与离线部署
运行时默认将 Hugging Face 文件下载到容器内的/root/.cache/huggingface;Quickstart 命令将其映射到宿主机 ~/.cache/huggingface。
如需准备离线副本,请在联网机器上安装 Hugging Face CLI,并下载固定 revision:
MiniMax/MiniMax-M3-MXFP8 和 MiniMax/MiniMax-M3。ModelScope 页面没有使用本基线所采用的 Hugging Face commit 标识快照,因此,在固定 revision 的部署中替换镜像前,请重新验证文件。
下载中断时,使用相同 revision 和目录重新运行 hf download,客户端会从缓存继续。如果加载时报权重分片缺失或损坏,请先确认可用磁盘空间并重新下载对应 revision,再调整运行参数。
生产部署与安全
开发环境请保留回环地址绑定。将服务暴露给其他主机前:- 设置不可预测的 SGLang
--api-key,并通过Authorization: Bearer <key>发送。 - 在反向代理或可信入口终止 TLS,使用防火墙或安全组限制来源网络,并增加请求速率和并发限制。
- 除非数据策略明确允许,否则不要记录 API Key、完整提示词、Base64 媒体或模型输出。
- 在网关拒绝任意远程媒体 URL。应用域名白名单,阻止私有地址和链路本地地址,限制重定向次数、下载时间、字节大小、图片像素和视频时长,并在转发请求前校验媒体类型。
- 监控 GPU 内存、队列深度、请求延迟、错误率、进程健康和磁盘使用量。仅得到成功的
/health响应不能代表已达到生产就绪状态。
--api-key,但当前 MiniMax-M3 Cookbook 未提供完整的远程媒体安全策略。请在网关和网络层实施这些控制。
故障排查
License 与使用限制
BF16 和 MXFP8 权重均按 MiniMax Community License 发布,其中包含署名要求、商业使用通知或授权要求以及禁止用途。生产或商用前,请阅读完整 License 并完成适用流程;本页不构成法律建议。相关链接
SGLang MiniMax-M3 Cookbook
查看上游硬件矩阵、配置生成器、性能测试条件和高级调优。
MiniMax-M3 模型卡
查看官方权重、模型能力、推理参数和 License。
MiniMax-M3 MXFP8 权重
打开参考部署使用的 MXFP8 Checkpoint。
MiniMax Sparse Attention
查看 MSA Kernel 源码和 Blackwell 要求。