【问题标题】:Microsoft speaker recognition api微软说话人识别 api
【发布时间】:2016-11-01 10:08:49
【问题描述】:

在微软说话人识别 api 中,我们必须将哪些数据用于身体参数。 那里写成“二进制数据”。这是否意味着我们必须将音频文件转换为二进制数据然后粘贴到那里。

【问题讨论】:

    标签: api speaker


    【解决方案1】:

    目前,无法使用此 API 测试控制台发布 application/octet-stream 或 application/form-data。我相信这方面有一些工作,应该很快就会推出。

    您也可以使用PostManFiddler。 PostMan 可能更易于使用。试一试,如果您有问题,请告诉我。

    【讨论】:

    • 我们可以使用 MS Rec API 来识别现场说话者吗?
    【解决方案2】:

    二进制数据需要是特定格式的WAV文件:

    • 容器:WAV
    • 编码:PCM
    • 速率:16K
    • 示例格式:16 位
    • 频道:单声道

    您可以在此处查看一个工作示例网页 - 我使用了 recorderjs 的更改副本(通过对说话人识别 API 示例页面进行逆向工程更改)来获得正确的比特率和采样率 WAV:

    https://rposbo.github.io/speaker-recognition-api/

    您可能会使用测试控制台,因为您可以发送 base64 编码的音频数据(正如官方演示页面所做的那样):

    https://azure.microsoft.com/en-gb/services/cognitive-services/speaker-recognition/

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-06-16
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-01-29
      相关资源
      最近更新 更多