jumdata

  博客园  :: 首页  :: 新随笔  :: 联系 :: 订阅 订阅  :: 管理

文本转人声音频‑文字播报合成‑TTS 语音生成处理 API 接口介绍

前言

语音播报、有声读物、短视频配音、智能设备提示音等产品,都需要把文本内容转化为流畅自然的人声音频。如果选择人工录音,不仅周期长、成本高昂,内容修改后还需要重新录制,迭代效率很低。自行搭建 TTS 语音合成模型,又需要投入算力、语料与模型调优工作,技术门槛高。文本合成语音接口可以直接输入文字,快速生成接近真人质感的语音音频,帮助各类业务快速补齐语音输出能力。请添加图片描述

核心能力

  • 支持将普通文本转换为高还原度合成语音;
  • 提供多款不同风格的人声音色,涵盖男声、女声,适配播报、朗读、客服、资讯等不同业务风格;
  • 可灵活调节语速、音量参数,适配快读播报、慢速朗读等差异化需求;
  • 支持常见音频输出格式,音频发音连贯流畅,多音字、标点停顿处理自然,可适配中英文混合文本内容。

戳这里查看详情

API介绍

请求说明

名称 类型 必须 说明
text String 待合成的文本 总字数不超过10万个字符,1个中文字、英文字母、数字或符号均算作1个字符
speed String 语速 取值0-15,默认为5中语速
pitch String 音调 取值0-15,默认为5中语调
volume String 音量,取值0-15,默认为5中音量(取值为0时为音量最小值,并非为无声)
per String 语音库
aue String 3为mp3格式(默认); 4为pcm-16k;5为pcm-8k;6为wav(内容同pcm-16k); 注意aue=4或者6是语音识别要求的格式,但是音频内容不是语音识别要求的自然人发音,所以识别效果会受影响。

返回样例

{
  "code": 200, // 返回码,详见返回码说明
  "msg": "成功",  // 返回码对应描述
  "taskNo": "65605503936940344488", // 本次请求号
  "data": {
   "result":""// 合成结果地址,有效期1天
  }
}
posted on 2026-09-18 17:31  Jumdata  阅读(4)  评论(0)    收藏  举报