【发布时间】:2018-09-04 23:30:35
【问题描述】:
我希望能够从电话音频流中提取一个人的话语。电话音频被路由到我的服务器,然后创建一个流式识别请求。我如何判断一个单词是作为完整话语的一部分存在还是当前正在转录的话语的一部分?我应该比较单词之间的时间戳吗?即使流式电话音频在一定时间内没有语音,API 是否会继续返回中间结果?如何超过 1 分钟的流式音频限制?
【问题讨论】:
标签: audio google-cloud-platform speech-to-text google-speech-api