【问题标题】:Google Speech API streaming audio exceeding 1 minuteGoogle Speech API 流式传输音频超过 1 分钟
【发布时间】:2018-09-04 23:30:35
【问题描述】:

我希望能够从电话音频流中提取一个人的话语。电话音频被路由到我的服务器,然后创建一个流式识别请求。我如何判断一个单词是作为完整话语的一部分存在还是当前正在转录的话语的一部分?我应该比较单词之间的时间戳吗?即使流式电话音频在一定时间内没有语音,API 是否会继续返回中间结果?如何超过 1 分钟的流式音频限制?

【问题讨论】:

    标签: audio google-cloud-platform speech-to-text google-speech-api


    【解决方案1】:

    关于您的前 3 个问题:

    您不需要比较单词之间的时间戳,您可以通过查看Streaming Recognition Result 中的is_final flag 来判断一个单词是否是完整话语的一部分(最终结果)。如果该标志设置为 true,则响应对应于已完成的转录,否则,它是临时结果。更多关于这个here

    获得最终结果后,在流式传输新话语之前不应生成任何中间结果。

    关于你的最后一个问题,你不能超过1分钟的限制,你需要发送multiple requests代替。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-03-11
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多