【问题标题】:How long should audio samples be for music/speech discrimination?音频样本应该多长时间用于音乐/语音识别?
【发布时间】:2017-03-02 14:45:38
【问题描述】:

我正在研究一个卷积神经网络,它使用 audio spectrogram 来区分音乐和语音,使用 GTZAN dataset

如果单个样本较短,则总体上会提供更多样本。但是如果样本太短,那么它们可能缺乏重要的特征?

识别一段音频是音乐还是语音需要多少数据?

理想的音频样本应该多长?

【问题讨论】:

    标签: machine-learning classification convolution spectrogram


    【解决方案1】:

    音频的长度因多种因素而异。

    基本理念是获得足够的样本。
    由于音频不断变化,因此最好处理较短的数据。但是,非常小的帧会导致更少/没有要捕获的特征。

    另一方面,非常大的样本会捕获太多的特征,从而导致复杂性。 因此,在大多数用例中,虽然理想的音频长度是 25 秒,但这不是书面规定,您可以相应地进行操作。只要确保帧大小不是非常小或非常大即可。

    数据集更新 查看this链接获取30s的数据集

    【讨论】:

    • 25 秒用于音乐/语音识别?
    • 大多数数据集并没有提供那么多数据
    • @Androbin,你的意思是分类?
    • 在这种情况下有什么区别?
    • 我从事过实时项目,通常我不得不削减和修剪音频文件,因为它们通常超过 4 分钟。
    【解决方案2】:

    识别一段音频是音乐还是语音需要多少数据?

    如果有人确切知道这个问题的答案,那么问题就已经解决了 :) 但说真的,这取决于您的下游应用程序将是什么。想象一下,试图区分带有背景音乐的语音与无伴奏合唱(困难)或区分管弦乐与有声读物(简单)。

    理想的音频样本应该多长?

    就像机器学习中的一切一样,它取决于应用程序。对你来说,我会说测试至少 10、20 和 30 秒,或者类似的时间。您是正确的,因为光谱值会根据长度发生相当大的变化!

    【讨论】:

    • 参考上一节:关于光谱值对每个时间段进行归一化时是否有明显的信息丢失?
    • 当然,实验很重要。我只是对用于此类任务的常用值感到好奇。比如,是否有一些经验上的领先价值?
    • @Androbin 取决于您如何规范它。这也是信号和噪声之间的权衡;即,您正在规范化的内容中是否有更多的信号或噪声。我不知道您的任务的细节,但请记住,长窗口 = 更好的频率分辨率。所以我的目标是更大的窗户,以便在你的情况下获得更好的歧视。请记住,CNN 的设计是为了获取丑陋的混乱数据并找出如何处理它,所以不必担心过多的预处理......在计算机视觉中,我们现在经常提供原始数据图片直接...
    • @Androbin 顺便问一下,你知道有一个 DSP 堆栈交换吗?例如见herehere。您可能会在那里获得更多有用的信息。 :)
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2017-10-13
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多