Skip to main content
MiniMax-M2.7 是面向 Agent、软件工程和复杂生产力任务的语言模型。新项目需要原生多模态输入或 1M 上下文时,建议选择 MiniMax-M3;已有 M2.7 工作流可以按本页继续部署。

开放内容与 License

MiniMax-M2.7 License 允许其中列出的个人、研究和教育等用途;商业使用包含署名和事先授权要求。生产或商用前,请阅读 License 原文。

硬件与镜像

SGLang Cookbook 当前列出的参考组合包括: NVIDIA 常见参考拓扑为 4 张高显存 GPU(TP 4)或 8 张 GPU(TP 8、EP 8)。不同硬件还支持 2、4 或 8 GPU 组合;请使用 SGLang 配置生成器 获取对应命令。

参考部署:4 张 NVIDIA 高显存 GPU

启动服务

首次启动时,SGLang 会从 Hugging Face 下载模型。需要认证时,在 docker run 中增加:

验证部署

也可以使用 OpenAI SDK:

关键启动参数

并行参数、KV Cache 容量和可用上下文长度彼此相关。不要只修改 GPU 数量;硬件发生变化时,应重新从 SGLang 配置生成器选择完整组合。

思考内容与工具调用

MiniMax-M2.7 会输出思考内容。启用 minimax-append-think 后,客户端应按照所用 SGLang 版本的响应格式读取或解析思考内容。启用 minimax-m2 后,可以通过 OpenAI 兼容的 tools 参数调用函数。 生产接入前,应分别验证:
  • 非流式和流式文本生成
  • 思考内容的展示或隐藏策略
  • 单工具、并行工具和嵌套参数
  • 长上下文下的显存余量

关于社区量化与 Mac 部署

Hugging Face 上存在 MLX、GGUF 等社区转换版本,但这些版本由各自发布者维护,不属于本页的 MiniMax + SGLang 官方参考部署范围。使用社区版本时,请单独核对模型转换方式、量化误差、License 和运行框架兼容性。

相关链接

SGLang MiniMax-M2.7 Cookbook

查看完整硬件组合、配置参数和基准测试。

MiniMax-M2.7 模型仓库

查看模型卡、权重和 License。