Skip to main content
POST
生成语音

语音映射

voice 会根据供应商通过内部别名映射进行规范化:
  • openai: 常用语音(例如 alloy, ash, ballad, coral, echo, fable, onyx, nova, sage, shimmer, verse, cedar, marin).
  • google (AI Studio / Gemini TTS): 规范的预置语音: Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callirrhoe, Autonoe, Enceladus, Iapetus, Umbriel, Algieba, Despina, Erinome, Algenib, Rasalgethi, Laomedeia, Achernar, Alnilam, Schedar, Gacrux, Pulcherrima, Achird, Zubenelgenubi, Vindemiatrix, Sadachbia, Sadaltager, Sulafat.
  • elevenlabs: 常见的公开入门语音会进行映射(例如 rachel, domi, bella, antoni, elli, josh, arnold, adam, sam).
对于 eleven-labs/eleven-v4 和 eleven-labs/eleven-v4-turbo,可传入任意 20 字符的 ElevenLabs 音色库 ID,包括自定义克隆音色。按需设置 config.elevenlabs.voice_settings.stability 和 similarity_boost。Eleven v4 不支持 speed 或 voice_settings.style。 如果提供的 voice 对路由对应的供应商/模型无效,请求会返回 400 invalid_request_error,并附带 param: "voice"。

供应商覆盖项

你仍可以传入供应商原生语音设置:
  • ElevenLabs: config.elevenlabs.voice_id / config.elevenlabs.voice / config.elevenlabs.voiceName
  • Google: config.google.voice_name / config.google.voiceName
为便于移植,建议将顶层 voice 作为默认值。

语音示例

授权

Authorization
string
header
必填

Bearer 令牌身份验证

请求体

application/json
model
string
必填
input
string
必填
voice
string
speed
number
必填范围: 0.25 <= x <= 4
format
enum<string>
可用选项:
mp3,
wav,
ogg,
aac
provider
object

用于网关选择的提供商路由偏好设置。

config
object

响应

200 - audio/mpeg

音频文件

The response is of type file.

最后修改于 2026年10月2日