Skip to main content
D
Devin
2026年1月26日
Download from GitHub

项目简介

机器人 Agent 基于 MiniMax M2.1 语言模型和 Pi05 VLA(Vision-Language-Action)模型,在 LIBERO 仿真环境中实现自然语言驱动的机械臂操作。 Demo
理解用户的自然语言指令,将复杂任务分解为可执行的操作步骤,并协调多步骤任务的执行流程。
通过 MCP 调用视觉理解能力,分析场景图像,验证任务执行结果,实现闭环反馈控制。
基于 PaliGemma 的视觉-语言-动作模型,根据场景图像和任务指令,生成精确的机械臂控制动作。
在 MuJoCo 物理引擎驱动的仿真环境中,执行多种机器人操作任务。

系统架构


快速上手

1

克隆仓库

2

配置 API Keys

3

下载 Pi05 模型

模型默认路径:./models/pi05_libero_finetuned,如需修改请编辑 agent_mode.py 中的 MODEL_PATH 变量。
4

安装依赖

依赖项说明:
5

运行 Agent

启动后选择任务场景:
  • libero_object - 不同物体泛化
  • libero_spatial - 空间关系理解
  • libero_goal - 不同动作目标(推荐)

支持的任务

在 LIBERO Goal 场景中,Agent 支持以下 10 个操作任务:

核心代码解析

Agent 工具定义

Agent 通过两个核心工具与环境交互:

MiniMax M2.1 任务规划

使用 Anthropic 兼容接口调用 MiniMax M2.1:

MCP 视觉理解

通过 MCP 调用 MiniMax 视觉理解能力验证任务结果:

技术细节

Pi05 模型参数

Agent 工作流程

  1. 用户输入:接收自然语言指令(中文或英文)
  2. 任务规划:MiniMax M2.1 理解意图,映射到支持的任务
  3. 动作执行:Pi05 VLA 生成机械臂控制序列
  4. 结果验证:MCP 视觉理解分析场景,确认任务完成
  5. 反馈循环:如验证失败,自动重试任务

常见问题

检查 ANTHROPIC_API_KEY 是否正确设置为 MiniMax 的 API Key。
  1. 检查 HF_TOKEN 是否配置
  2. 检查 MODEL_PATH 路径是否正确
确保已安装:pip install mcp 并且 uvx 命令可用。
设置 export DISPLAY=:2(VNC)或确保有 X11 环境。

应用拓展

基于当前架构,开发者可以考虑以下拓展方向:
  • 多任务串联:实现复杂任务的自动分解和顺序执行
  • 失败恢复:增强 Agent 的错误检测和自动恢复能力
  • 实物部署:将仿真中的策略迁移到真实机械臂
  • 多模态交互:结合语音识别实现语音控制机器人

总结

在本教程中,我们展示了如何使用 MiniMax M2.1MCP 视觉理解构建一个智能机器人 Agent:
  • MiniMax M2.1 负责理解用户意图,将自然语言指令转化为具体的操作任务
  • MiniMax MCP 提供视觉理解能力,验证任务执行结果,实现闭环控制
  • Pi05 VLA 作为底层执行器,根据视觉输入生成精确的机械臂动作
  • LIBERO/MuJoCo 提供逼真的物理仿真环境
这套 LLM + VLM + VLA 的协同架构,展示了大模型在机器人控制领域的应用潜力。

相关资源

Anthropic API

MiniMax M2.1 接入指南

MCP 指南

MCP 工具配置说明

LeRobot

HuggingFace 机器人学习库