【问题标题】:Convolutional Neural Network (CNN) for Audio [closed]用于音频的卷积神经网络(CNN)[关闭]
【发布时间】:2014-04-23 15:27:55
【问题描述】:

我一直在关注 DeepLearning.net 上的教程,学习如何实现从图像中提取特征的卷积神经网络。该教程解释清楚,易于理解和遵循。

我想扩展同一个 CNN 以同时从视频(图像+音频)中提取多模态特征。

我了解视频输入只不过是在一段时间内(例如 30 FPS)显示的与音频相关的一系列图像(像素强度)。但是,我并不真正了解音频是什么,它是如何工作的,或者它是如何被分解以馈送到网络中的。

我已经阅读了几篇关于该主题(多模态特征提取/表示)的论文,但没有人解释音频是如何输入到网络的。

此外,我从我的研究中了解到,多模态表示是我们大脑真正工作的方式,因为我们不会故意过滤掉我们的感官来实现理解。这一切都是同时发生的,我们通过(联合表示)不知道它。一个简单的例子是,如果我们听到狮子吼叫,我们会立即在脑海中形成狮子的形象,感到危险,反之亦然。我们的大脑中会触发多种神经模式,以全面了解狮子的样子、声音、感觉、气味等。

上述是我的最终目标,但为了简单起见,我暂时将我的问题分解。

如果有人能阐明如何剖析音频,然后在卷积神经网络中表示,我将不胜感激。我也会感谢您对多模态同步、联合表示以及使用多模态数据训练 CNN 的正确方法的想法。

编辑: 我发现音频可以表示为频谱图。它是音频的常见格式,并表示为具有两个几何维度的图形,其中水平线代表时间,垂直线代表频率。

是否可以对这些频谱图上的图像使用相同的技术?换句话说,我可以简单地将这些频谱图用作卷积神经网络的输入图像吗?

【问题讨论】:

    标签: neural-network convolution feature-extraction supervised-learning deep-learning


    【解决方案1】:

    为了训练分类器,有许多技术可以从音频数据中提取特征向量。最常用的称为 MFCC(梅尔频率倒谱),您可以将其视为“改进的”频谱图,保留更多相关信息以区分类别。其他常用的技术是 PLP(感知线性预测),它也给出了很好的结果。这些还有很多其他鲜为人知的。

    最近,深度网络已被用于自行提取特征向量,因此与我们在图像识别中的做法更相似。这是一个活跃的研究领域。不久前,我们还使用特征提取器来训练图像分类器(SIFT、HOG 等),但这些被深度学习技术所取代,深度学习技术将原始图像作为输入并自行提取特征向量(实际上这就是深度学习真的很重要)。

    注意音频数据是连续的也很重要。训练分类器后,您需要将序列模型训练为 HMM 或 CRF,它会选择最可能的语音单元序列,并使用分类器给出的概率作为输入。

    学习语音识别的一个很好的起点是 Jursky 和 ​​Martins:Speech and Language Processing。它很好地解释了所有这些概念。

    [编辑:添加一些可能有用的信息]

    有许多带有模块的语音识别工具包可以从音频文件中提取 MFCC 特征向量,但使用 than 来实现这一目的并不总是那么简单。我目前正在使用CMU Sphinx4。它有一个名为 FeatureFileDumper 的类,可以单独使用它从音频文件中生成 MFCC 向量。

    【讨论】:

    • 频谱图包含波(声音的最直接表示)所具有的所有信息
    • Laie 是正确的,我目前使用的是频谱图方法,我编写的第一个函数是将 wav 转换为频谱图,然后再转换回 wav。除了前几个和最后几个样本外,它以 100% 的准确率再现
    【解决方案2】:

    我们在声谱图上使用深度卷积网络进行口语识别任务。在this TopCoder contest 中提供的数据集上,我们的准确率约为 95%。详情是here

    普通卷积网络不捕捉时间特征,因此例如in this work 卷积网络的输出被馈送到时延神经网络。但我们的实验表明,即使没有额外的元素,当输入大小相似时,卷积网络至少可以在某些任务上表现良好。

    【讨论】:

    • “in this work”微软链接没有指向任何文章或pdf,你能提到标题吗?
    • 抱歉回复晚了。这里是scholar.google.com/…
    猜你喜欢
    • 1970-01-01
    • 2020-10-19
    • 2019-08-03
    • 2017-06-08
    • 2015-04-09
    • 2020-05-26
    • 2017-01-01
    • 1970-01-01
    相关资源
    最近更新 更多