【发布时间】:2019-04-25 11:38:11
【问题描述】:
我们想知道音频文件中的话语何时开始。话语可以是一个完整的句子,也可以很短,例如一个字。可能会有一些背景噪音(呼吸声、吱吱声、风扇声等)。目前我们正在使用一种简单的阈值方法(如果有相当大的音量,用户开始说话),但如果噪音足够大,有时会失败。
我们一直在尝试使用 webrtc-vad (hs, js),但它似乎给出了 1/True(“是声音”)的答案,就像声音一样频繁。
在使用 webrtc-vad 的示例代码中,我看到他们经常在一个时间跨度内/连续查找 1 答案的序列,如 mozilla's webrtcvad_js example code,但这样做似乎对我们没有多大帮助。在测试很有启发性时不断写出答案,例如第一个系列的 1 来自我说“我”,第二个来自我小心地将咖啡杯放在桌子上:
000000000000000000001111111000000000000000000001111111100000000000000
序列长度大致相同 :( 玩激进似乎只会让它变得更糟。
webrtc-vad 根本不适合这个任务吗?或者它仍然可以用作第一个过滤器吗?也许第二个过滤器应该检查大部分声音是否在50–300 Hz 范围内? (我知道我可以通过一个完整的文本到语音的管道发送它,看看它是否能够将它变成清晰的东西,但这对于仅仅找出某人开始说话的何时来说似乎有点过分...... )
【问题讨论】:
标签: webrtc text-to-speech voice-recognition