百度语音合成api/sdk及demo

1.流程

　　1）换取token

　　　　用Api Key 和 SecretKey。访问https://openapi.baidu.com/oauth/2.0/token 换取 token　　　

// appKey = Va5yQRHl********LT0vuXV4

// appSecret = 0rDSjzQ20XUj5i********PQSzr5pVw2

https://openapi.baidu.com/oauth/2.0/token?grant_type=client_credentials&client_id=Va5yQRHl********LT0vuXV4&client_secret=0rDSjzQ20XUj5i********PQSzr5pVw2

{

    "access_token": "1.a6b7dbd428f731035f771b8d********.86400.1292922000-2346678-124328",

    "expires_in": 2592000,

    "refresh_token": "2.385d55f8615fdfd9edb7c4b********.604800.1293440400-2346678-124328",

    "scope": "public audio_tts_post ...",

    "session_key": "ANXxSNjwQDugf8615Onqeik********CdlLxn",

    "session_secret": "248APxvxjCZ0VEC********aK4oZExMB",

}
scope中含有audio_tts_post 表示有语音合成能力，没有该audio_tts_post 的token调用接口会返回502错误。 在结果中可以看见 token = 1.a6b7dbd428f731035f771b8d********.86400.1292922000-2346678-124328，在2592000秒（30天）后过期

　　2）访问合成接口

#从上文中我们获取的token是 1.a6b7dbd428f731035f771b8d********.86400.1292922000-2346678-124328

http://tsn.baidu.com/text2audio?lan=zh&ctp=1&cuid=abcdxxx&tok=1.a6b7dbd428f731035f771b8d****.86400.1292922000-2346678-124328&tex=%e7%99%be%e5%ba%a6%e4%bd%a0%e5%a5%bd&vol=9&per=0&spd=5&pit=5&aue=3

// 这是一个正常MP3的下载url

// tex在实际开发过程中请urlencode2次
"""

tex	必填	合成的文本，使用UTF-8编码。小于2048个中文字或者英文数字。（文本在百度服务器内转换为GBK后，长度必须小于4096字节）
tok	必填	开放平台获取到的开发者access_token（见上面的“鉴权认证机制”段落）
cuid	必填	用户唯一标识，用来计算UV值。建议填写能区分用户的机器 MAC 地址或 IMEI 码，长度为60字符以内
ctp	必填	客户端类型选择，web端填写固定值1
lan	必填	固定值zh。语言选择,目前只有中英文混合模式，填写固定值zh
spd	选填	语速，取值0-15，默认为5中语速
pit	选填	音调，取值0-15，默认为5中语调
vol	选填	音量，取值0-15，默认为5中音量
per	选填	发音人选择, 0为普通女声，1为普通男生，3为情感合成-度逍遥，4为情感合成-度丫丫，默认为普通女声
aue	选填	3为mp3格式(默认)； 4为pcm-16k；5为pcm-8k；6为wav（内容同pcm-16k）; 注意aue=4或者6是语音识别要求的格式，但是音频内容不是语音识别要求的自然人发音，所以识别效果会受影

aue =3 ，返回为二进制mp3文件，具体header信息 Content-Type: audio/mp3；
aue =4 ，返回为二进制pcm文件，具体header信息 Content-Type:audio/basic;codec=pcm;rate=16000;channel=1
aue =5 ，返回为二进制pcm文件，具体header信息 Content-Type:audio/basic;codec=pcm;rate=8000;channel=1
aue =6 ，返回为二进制wav文件，具体header信息 Content-Type: audio/wav；

"""

2.api 代码demo

# coding=utf-8

import sys

import json

IS_PY3 = sys.version_info.major == 3

if IS_PY3:

    from urllib.request import urlopen

    from urllib.request import Request

    from urllib.error import URLError

    from urllib.parse import urlencode

    from urllib.parse import quote_plus

else:

    import urllib2

    from urllib import quote_plus

    from urllib2 import urlopen

    from urllib2 import Request

    from urllib2 import URLError

    from urllib import urlencode

API_KEY = '4E1BG9lTnlSeIf1NQFlrSq6h'

SECRET_KEY = '544ca4657ba8002e3dea3ac2f5fdd241'

TEXT = "欢迎使用百度语音合成。"

# 发音人选择, 0为普通女声，1为普通男生，3为情感合成-度逍遥，4为情感合成-度丫丫，默认为普通女声

PER = 4

# 语速，取值0-15，默认为5中语速

SPD = 5

# 音调，取值0-15，默认为5中语调

PIT = 5

# 音量，取值0-9，默认为5中音量

VOL = 5

# 下载的文件格式, 3：mp3(default) 4： pcm-16k 5： pcm-8k 6. wav

AUE = 3

FORMATS = {3: "mp3", 4: "pcm", 5: "pcm", 6: "wav"}

FORMAT = FORMATS[AUE]

CUID = "123456PYTHON"

TTS_URL = 'http://tsn.baidu.com/text2audio'

class DemoError(Exception):

    pass

"""  TOKEN start """

TOKEN_URL = 'http://openapi.baidu.com/oauth/2.0/token'

SCOPE = 'audio_tts_post'  # 有此scope表示有tts能力，没有请在网页里勾选

def fetch_token():

    print("fetch token begin")

    params = {'grant_type': 'client_credentials',

              'client_id': API_KEY,

              'client_secret': SECRET_KEY}

    post_data = urlencode(params)

    if (IS_PY3):

        post_data = post_data.encode('utf-8')

    req = Request(TOKEN_URL, post_data)

    try:

        f = urlopen(req, timeout=5)

        result_str = f.read()

    except URLError as err:

        print('token http response http code : ' + str(err.code))

        result_str = err.read()

    if (IS_PY3):

        result_str = result_str.decode()

    print(result_str)

    result = json.loads(result_str)

    print(result)

    if ('access_token' in result.keys() and 'scope' in result.keys()):

        if not SCOPE in result['scope'].split(' '):

            raise DemoError('scope is not correct')

        print('SUCCESS WITH TOKEN: %s ; EXPIRES IN SECONDS: %s' % (result['access_token'], result['expires_in']))

        return result['access_token']

    else:

        raise DemoError('MAYBE API_KEY or SECRET_KEY not correct: access_token or scope not found in token response')

"""  TOKEN end """

if __name__ == '__main__':

    token = fetch_token()

    tex = quote_plus(TEXT)  # 此处TEXT需要两次urlencode

    print(tex)

    params = {'tok': token, 'tex': tex, 'per': PER, 'spd': SPD, 'pit': PIT, 'vol': VOL, 'aue': AUE, 'cuid': CUID,

              'lan': 'zh', 'ctp': 1}  # lan ctp 固定参数

    data = urlencode(params)

    print('test on Web Browser' + TTS_URL + '?' + data)

    req = Request(TTS_URL, data.encode('utf-8'))

    has_error = False

    try:

        f = urlopen(req)

        result_str = f.read()

        headers = dict((name.lower(), value) for name, value in f.headers.items())

        has_error = ('content-type' not in headers.keys() or headers['content-type'].find('audio/') < 0)

    except  URLError as err:

        print('asr http response http code : ' + str(err.code))

        result_str = err.read()

        has_error = True

    save_file = "error.txt" if has_error else 'result.' + FORMAT

    with open(save_file, 'wb') as of:

        of.write(result_str)

    if has_error:

        if (IS_PY3):

            result_str = str(result_str, 'utf-8')

        print("tts api  error:" + result_str)

    print("result saved as :" + save_file)

3.sdk下载

pip install baidu-aip

4.sdk demo代码

# coding=utf-8

from aip import AipSpeech

API_KEY = 'DHEl3FqU9oxxx' # 替换成你的api_key 在创建的应用中查找

SECRET_KEY = 'ZWGxEZjxxxxIMx7BeGnoW83u' # 替换成你的secret_key 在创建的应用中查找

APP_ID = '1xx3x3' # 替换成你的app_id

client = AipSpeech(APP_ID, API_KEY, SECRET_KEY)

result = client.synthesis(u'baidu是一家科技公司', 'zh', 1, {

    'vol': 5, 'per': 5, 'spd': 4

})

# vol 控制音量 per 控制男女声 spd 控制速度

if not isinstance(result, dict):

    with open('auido.mp3', 'wb') as f:

        f.write(result)

百度语音合成api/sdk及demo的更多相关文章

文本转音频（百度语音合成api）（python）（原创）
应之前的一家小学教育培训机构的要求设计的一款将文字转音频的程序.(注:后面应该是生成音频才对,没有改过来) 技术难点: ①语音合成,如果没有现在这么多的云服务-百度云语音合成,我估计这个程序会费很大 ...
百度地图API 基本用法
百度地图百度地图JavaScript API是一套由JavaScript语言编写的应用程序接口,可帮助您在网站中构建功能丰富.交互性强的地图应用,支持PC端和移动端基于浏览器的地图应用开发,且支持H ...
HTML5结合百度地图API创建地图应用
具体的百度地图API的使用方法查看百度地图API里的DEMO <style> #div1{ width:400px; height:400px; border:1px #000 solid ...
C# 百度语音合成
语音合成及TTS,我们尝试使用百度的语音合成技术不过我发现有一种缺点在于没有离线包让我有些很不舒服,可能是在线版的原因微软语音识别技术在Windows 2000是默认集成在系统组件中或许我们不 ...
Android 百度地图API(01)_开发环境 HelloBaiduMap
转载于:http://blog.csdn.net/lmj623565791/article/details/37729091 转载于:http://blog.csdn.net/crazy1235/ar ...
【百度地图API】批量地址解析与批量反地址解析（带商圈数据）
原文:[百度地图API]批量地址解析与批量反地址解析(带商圈数据) 摘要:因为地址解析的webserives方式还没有开通,所以先用JS版本的地址解析接口来批量获取地址解析数据吧,同时还能得到商圈的数 ...
PHP:基于百度大脑api实现OCR文字识别
有个项目要用到文字识别,网上找了很多资料,效果不是很好,偶然的机会,接触到百度大脑.百度大脑提供了很多解决方案,其中一个就是文字识别,百度提供了三种文字识别,分别是银行卡识别.身份证识别和通用文字识别 ...
百度语音合成AI
注意:不要使用Dw编辑PHP代码,会因为编码问题出错!!<?php require_once 'AipSpeech.php'; // 你的 APPID AK SK const APP_ID = ...
Android 开发框架系列百度语音合成
官方文档:http://ai.baidu.com/docs#/TTS-Android-SDK/6d5d6899 官方百度语音合成控制台:https://cloud.baidu.com/product/ ...

随机推荐

PMP 第12~13章错题总结
1.合同解释应该遵循几个主要原则: 1)主导语言原则 2)适用法律原则 3)整体解释原则 4)公平诚信原则2.合同收尾包括的工作: 1)产品核实 2)可交付成果验收 3)财务结算 4)退还保证金或担保 ...
修改TestStand Testsocket 从非0开始
Issue Details I am running the parallel process model or batch model and want my test sockets to be ...
Vmware解决虚拟机不能联网的问题
1. 设置为NAT模式 2. 启动win7的服务,命令窗口输入services.msc 回车 3. 修改Vmware的设置
xmlrpc与jsonrpc
RPC是Remote Procedure Call的缩写,翻译成中文就是远程过程调用,是一种在本地的机器上调用远端机器上的一个过程(方法)的技术,这个过程也被大家称为“分布式计算”,是为了提高各个分立 ...
不同版本的ArcMap在Oracle中创建镶嵌数据集的不同行为
如果不同版本的ArcMap连接到同一个Oracle数据库上,分别执行"创建镶嵌数据集",它们的行为是一样的吗? 答案是:不一样,会有细微的差别在本例中,ArcMap的版本分别是1 ...
HTML系列：js和css多种方式实现隔行变色
<!DOCTYPE html> <html lang="en"> <head> <meta charset="UTF-8&quo ...
Linux下将.Asp Core 部署到 Docker容器中
我们来部署一个简单的例子: 将一个简单的.Aps Core项目部署到Docker容器中并被外网访问说明: 下面的步骤都是建立在宿主服务器系统已经安装配置过Docker容器,安装Docker相对比较简 ...
218. The Skyline Problem (LeetCode)
天际线问题,参考自: 百草园天际线为当前线段的最高高度,所以用最大堆处理,当遍历到线段右端点时需要删除该线段的高度,priority_queue不提供删除的操作,要用unordered_map来标记 ...
docker查看日志记录
命令格式: $ docker logs [OPTIONS] CONTAINER Options: --details 显示更多的信息 -f, --follow 跟踪实时日志 --since strin ...
[CF30E]Tricky and Clever Password(KMP+manacher)
首先枚举回文中心,然后显然中心两边要尽量扩展作为middle,这个用manacher实现. 然后注意到suffix的结尾位置是固定的(串尾),那么预处理出以每个位置结尾的串与原串后缀至多能匹配多长,然 ...

百度语音合成api/sdk及demo

百度语音合成api/sdk及demo的更多相关文章

随机推荐

热门专题