Skip to main content
POST
同步接口:请求返回的就是音频文件本身,没有 task_id,不需要轮询。本端点只服务 gpt-4o-mini-tts;需要歌曲或人声演唱时用 Suno 音乐生成。

请求参数

string
必填
模型 ID:gpt-4o-mini-tts。
string
必填
要转换的文本,最多 4,096 个字符。
string
必填
音色,六种可选:
  • alloy:中性、平衡
  • echo:男声、沉稳
  • fable:英式、叙述感
  • onyx:男声、深沉
  • nova:女声、有活力
  • shimmer:女声、温柔
string
默认值:"wav"
音频格式:wav(未压缩)、opus(流媒体)、aac、flac(无损压缩)、pcm(原始音频数据)。
number
默认值:"1.0"
语速,取值 1.0。
以上之外的参数会返回 400,不计费。

限制

计费

按输入文本的字符数计费,不收输出费用:音频时长、voice 和 response_format 都不影响价格,字符数是唯一的计费维度,提交前即可确定单次费用。 单价见 GET /v1/models 返回的 price_config,或控制台「模型市场」。计费单位是 quota,500,000 quota = 1 USD,不是美元。 请求失败不计费。

响应

返回音频文件的二进制流,格式由 response_format 决定,默认 wav,直接保存为文件即可。出错时返回 JSON 错误对象,不返回音频。

可用模型

当前不支持

  • instructions:用自然语言指定语气、语速与情绪
  • 流式返回音频
  • mp3 输出格式
以上请求返回 400,不计费。

相关文档