【发布时间】:2017-03-02 14:45:38
【问题描述】:
我正在研究一个卷积神经网络,它使用 audio spectrogram 来区分音乐和语音,使用 GTZAN dataset
如果单个样本较短,则总体上会提供更多样本。但是如果样本太短,那么它们可能缺乏重要的特征?
识别一段音频是音乐还是语音需要多少数据?
理想的音频样本应该多长?
【问题讨论】:
标签: machine-learning classification convolution spectrogram
我正在研究一个卷积神经网络,它使用 audio spectrogram 来区分音乐和语音,使用 GTZAN dataset
如果单个样本较短,则总体上会提供更多样本。但是如果样本太短,那么它们可能缺乏重要的特征?
识别一段音频是音乐还是语音需要多少数据?
理想的音频样本应该多长?
【问题讨论】:
标签: machine-learning classification convolution spectrogram
音频的长度因多种因素而异。
基本理念是获得足够的样本。
由于音频不断变化,因此最好处理较短的数据。但是,非常小的帧会导致更少/没有要捕获的特征。
另一方面,非常大的样本会捕获太多的特征,从而导致复杂性。
因此,在大多数用例中,虽然理想的音频长度是 25 秒,但这不是书面规定,您可以相应地进行操作。只要确保帧大小不是非常小或非常大即可。
数据集更新 查看this链接获取30s的数据集
【讨论】:
识别一段音频是音乐还是语音需要多少数据?
如果有人确切知道这个问题的答案,那么问题就已经解决了 :) 但说真的,这取决于您的下游应用程序将是什么。想象一下,试图区分带有背景音乐的语音与无伴奏合唱(困难)或区分管弦乐与有声读物(简单)。
理想的音频样本应该多长?
就像机器学习中的一切一样,它取决于应用程序。对你来说,我会说测试至少 10、20 和 30 秒,或者类似的时间。您是正确的,因为光谱值会根据长度发生相当大的变化!
【讨论】: