Skip to main content
  1. 支持 100+系统音色、复刻音色自主选择
  2. 支持语调、语速、音量、比特率、采样率、输出格式调整
  3. 支持音频时长、音频大小等返回参数
  4. 支持时间戳(字幕)返回,精确到句
  5. 支持直接传入字符串与上传文本文件两种方式进行待合成文本的输入
  6. 支持非法字符检测:非法字符不超过 10%(包含 10%),音频会正常生成并返回非法字符占比;非法字符超过 10%,接口不返回结果(返回报错码),请检测后再次进行请求【非法字符定义:ascii 码中的控制符(不含制表符 \t 和换行符 \n)】

支持模型

以下为 MiniMax 已提供的语音模型及其特性说明。

支持语言

MiniMax 的语音合成模型具备卓越的跨语言能力,全面支持 40 种全球广泛使用的语言。我们致力于打破语言壁垒,构建真正意义上的全球通用人工智能模型。 目前支持的语言包含:

使用流程

  1. 若使用文件输入,需先调用 文件上传 API 上传文本并获取 file_id。若使用文本作为输入,则跳过此步骤
  2. 调用创建语音生成任务 API,获取 task_id
  3. 调用查询语音生成任务状态 API,基于 task_id 获取语音合成任务进度
  4. 当任务完成时,上述调用查询语音生成任务状态 API 返回的 file_id 可用于调用 文件下载 API 下载音频结果
注意:返回的下载 URL 自生成起 9 小时(32400 秒)内有效,过期后文件将失效,生成的信息便会丢失,请注意下载信息的时间,及时下载

过程示例

1. 获取 file_id

2. 创建语音合成任务

3. 查询语音合成进度

4. 下载语音合成文件

推荐阅读

异步语音合成

使用 API 接口,创建异步语音合成任务。

同步语音合成 HTTP

使用 API 接口,在HTTP网络通信协议下进行同步语音合成。

产品定价

各模型的定价说明、计费方式及使用限制。

速率限制

为保证资源的高效使用,引入速率限制,以确保服务的可用性、稳定性。