Skip to main content
本指南介绍如何使用三种推理框架本地部署 MiniMax-M2.7:vLLMSGLang 适用于 Linux GPU 服务器,MLX 适用于 Apple Silicon Mac Studio。如需使用 MiniMax API 服务,请参阅语言模型

GPU 服务器部署(vLLM / SGLang)

环境要求

  • 操作系统:Linux
  • Python:3.10 – 3.12
  • GPU:Compute capability 7.0 或更高

推荐配置

以上数值为硬件支持的最大并发缓存总量。模型单序列(Single Sequence)长度上限仍为 196K token。

使用 vLLM 部署

vLLM 是一个高性能的 LLM 推理与服务库,通过 PagedAttention 高效管理注意力键值缓存,结合连续批处理(Continuous Batching)和前缀缓存等技术实现卓越的服务吞吐量。

安装

启动服务

vLLM 会自动从 Hugging Face 下载并缓存模型。

使用 SGLang 部署

SGLang 是一个高性能的大模型推理服务框架,利用 RadixAttention 实现高效的前缀缓存和调度,具备低延迟、高吞吐的特点。

安装

启动服务

SGLang 会自动从 Hugging Face 下载并缓存模型。

验证部署

vLLM 和 SGLang 均提供 OpenAI 兼容接口。启动后,可以通过 curl 或 OpenAI SDK 调用:

Mac Studio 部署(MLX)

得益于 Apple Silicon 的统一内存架构,Mac Studio 可以将模型完整加载到内存中并在设备端完成推理 — 无需 GPU 集群,数据完全私有。

环境要求

  • Mac Studio,搭载 Apple Silicon(M4 Max 或 M3 Ultra)
  • macOS 15.0(Sequoia)或更高版本
  • Python 3.10+
  • 足够的统一内存 — 参见下方模型选择指南

模型选择指南

所有 MLX 模型变体均可从 Hugging Face 上的 mlx-community 获取。更高位数的量化保留更多模型质量,但需要更多内存。

可用模型变体

“最低内存” = 模型大小 + 约 10–15 GB 余量(用于 KV 缓存、激活值和系统开销)。实际内存使用量随上下文长度增长。

推荐配置

MLX 框架下最小变体(3-bit)需要约 112 GB 内存。统一内存低于 128 GB 的 Mac Studio 配置(M4 Max 36/48/64 GB、M3 Ultra 96 GB)无法通过 MLX 运行 MiniMax-M2.7,但仍可尝试使用 llama.cpp 等支持更激进量化策略的推理框架。

快速开始

安装

使用方式

使用 mlx_lm 在终端直接生成文本,或通过 Python 脚本调用:

API 服务部署

如需将 MiniMax-M2.7 作为本地 API 服务(兼容 OpenAI SDK),可以使用 mlx_lm.server 或第三方工具如 LM Studio

mlx_lm.server

启动 OpenAI 兼容的 API 服务:
mlx_lm.server 会自动将模型的思考过程(<think> 标签内容)分离到 reasoning 字段,content 仅包含最终回复:
启动服务后,可通过 curl 或 OpenAI SDK 调用:

LM Studio

LM Studio 提供了带有内置 MLX 支持的 Mac 桌面应用:
  1. 下载并安装 LM Studio
  2. 在模型浏览器中搜索 MiniMax-M2.7
  3. 选择适合您内存的量化变体
  4. 点击 Load 即可开始对话
LM Studio 同样提供 OpenAI 兼容的本地服务,便于与其他工具集成。

微调(LoRA)

mlx-lm 支持使用 LoRA / QLoRA 对模型进行参数高效微调(PEFT)。对于 MiniMax-M2.7 这种 MoE 模型,建议使用量化模型 + QLoRA 以降低内存需求。
在 Mac Studio 上微调 MiniMax-M2.7 对内存要求极高。即使使用 QLoRA,也需要至少 192 GB 统一内存(M3 Ultra),并采用非常保守的训练参数。128 GB 及以下配置不建议尝试微调。

安装训练依赖

准备训练数据

训练数据使用 JSONL 格式。在数据目录中创建 train.jsonlvalid.jsonl 和(可选的)test.jsonl 文件。 对话格式(推荐):
补全格式:

启动微调

使用量化模型进行 QLoRA 微调,并启用内存优化选项:
关键参数说明:

使用微调后的模型

加载适配器生成文本:
将适配器合并到模型(可选):
合并后可直接加载融合模型,无需额外指定适配器路径。

推荐参数

以下为 MiniMax-M2.7 的推荐参数,适用于所有推理框架:

相关链接

MiniMax-M2.7 Hugging Face

官方模型权重、文档和基准测试

MiniMax-M2.7 MLX 模型

MLX Community 上的全部量化变体

vLLM 官方文档

vLLM 官方文档和部署指南

SGLang 官方文档

SGLang 官方文档和部署指南