【发布时间】:2018-04-18 08:50:13
【问题描述】:
我需要每 5 秒采集一次简短的声音样本,然后将这些样本上传到我们的云服务器。
然后我需要找到一种方法来比较/检查该样本是否是完整长音频文件的一部分。
样本将从手机麦克风录制,因此它们确实不准确。
我知道这个主题可能会变得相当技术性和复杂性,但我确信一定有一些库或在线服务可以帮助进行这种复杂的音频匹配/配对。
一个想法是使用音频到文本的转换服务,然后根据实际对话进行匹配。然而,这对我来说并不有效。而根据实际声音频率或模式进行匹配会更有效。
我知道有一些服务,比如 Shazam,可以进行这种类型的音频匹配。但是我想他们的服务都是适当的。
一些可能影响它的因素:
- 两个音频样本都带有时间戳。所以我们不必搜索整个声音片段。
【问题讨论】:
标签: audio audio-fingerprinting