【问题标题】:How to train CNN on common voice dataset如何在普通语音数据集上训练 CNN
【发布时间】:2019-08-01 05:16:36
【问题描述】:

我正在尝试使用 common voice 数据集训练一个 cnn。我是语音识别的新手,无法找到有关如何将数据集与 keras 一起使用的任何链接。我跟着这个article 构建了一个简单的词分类网络。但我想用通用语音数据集来扩展它。任何帮助表示赞赏。

谢谢

【问题讨论】:

  • 您想要达到的最终目标是什么?语音识别?或者你的标签是什么?
  • 我的最终目标是语音到文本的转换。
  • 您链接到的博客文章的服务器似乎已关闭。这使得无法以有意义的方式发表评论。我想提出关于具体问题的“较小”、可回答的问题,而不是“我该怎么做”。
  • 对链接感到抱歉。由于某种原因,该链接通过 android 中的媒体应用程序正确打开,但无法通过浏览器打开。

标签: python keras conv-neural-network speech-recognition librosa


【解决方案1】:

您可以查看MFCCs。简而言之,这些是通过使用信号处理技术从音频波形中提取的特征,以转录人类感知声音的方式。在python中,你可以使用python-speech-features来计算MFCC。

准备好数据后,您可以构建 CNN;例如this one:

您也可以使用 RNN(例如 LSTM 或 GRU),但这有点高级。

编辑:如果您愿意,可以从一个非常好的数据集开始:

Speech Commands Dataset

【讨论】:

  • 感谢您的回复。我一定会这样做的。我的疑问是,常见的语音数据集是各种人所说的句子的汇编。对于语音识别,我应该将句子转换为单词吗?
  • 使用带标签的单词比使用句子要容易得多;例如,您可以使用 RNN + CTC-loss 处理句子,但它非常先进。以前可以用文字练习!如果您想要一个包含已经准备好的单词的数据集,您可以查看谷歌语音命令数据集(我会将链接放在我的答案中)。这是一个非常好的数据集。
猜你喜欢
  • 2020-04-27
  • 2019-04-15
  • 2023-01-07
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2018-03-07
  • 2021-01-17
相关资源
最近更新 更多