【发布时间】:2016-11-01 10:08:49
【问题描述】:
在微软说话人识别 api 中,我们必须将哪些数据用于身体参数。 那里写成“二进制数据”。这是否意味着我们必须将音频文件转换为二进制数据然后粘贴到那里。
【问题讨论】:
在微软说话人识别 api 中,我们必须将哪些数据用于身体参数。 那里写成“二进制数据”。这是否意味着我们必须将音频文件转换为二进制数据然后粘贴到那里。
【问题讨论】:
二进制数据需要是特定格式的WAV文件:
您可以在此处查看一个工作示例网页 - 我使用了 recorderjs 的更改副本(通过对说话人识别 API 示例页面进行逆向工程更改)来获得正确的比特率和采样率 WAV:
https://rposbo.github.io/speaker-recognition-api/
您可能会使用测试控制台,因为您可以发送 base64 编码的音频数据(正如官方演示页面所做的那样):
https://azure.microsoft.com/en-gb/services/cognitive-services/speaker-recognition/
【讨论】: