【问题标题】:How to train HMM with audio senteces dataset for speech recognition?如何使用音频句子数据集训练 HMM 进行语音识别?
【发布时间】:2018-07-04 15:15:07
【问题描述】:

我已经阅读了 HMM 和 MFCC 的一些期刊和论文,但我仍然对它如何逐步使用我的数据集(句子数据集的音频)感到困惑。

我的数据集示例(音频形式):

  • 你好,早上好
  • 祝你考试顺利
  • 等 大约 343 个音频数据和 20 个扬声器(6800 个音频数据)

我所知道的:

  1. 我的句子数据集用于获取转换概率
  2. 嗯状态是音素
  3. 39 个 MFCC 特征用于训练 HMM 模型

我的问题:

  1. 我需要把我的句子切成单词还是只用句子来训练 HMM 模型?
  2. 我需要用于 train 的音素数据集吗?如果是,我是否也需要使用 HMM 来训练它?如果不是我的程序如何识别 HMM 预测输入的音素?
  3. 我必须先执行哪些步骤?

注意:我正在使用 python,我使用 hmmlearn 和 python_speech_features 作为我的库。

【问题讨论】:

  • 你有音素的时间分割吗?

标签: python tensorflow speech-recognition mfcc hmmlearn


【解决方案1】:
  1. 我需要将句子分割成单词还是只使用句子来训练 HMM 模型?

理论上你只需要句子和音素。但是使用孤立的单词可能对您的模型有用(它会增加您的训练数据的大小)

  1. 我需要用于 train 的音素数据集吗?如果是,我是否也需要使用 HMM 来训练它?如果不是我的程序如何识别 HMM 预测输入的音素?

您需要音素,否则如果没有任何孤立音素示例,您的模型将很难找到正确的音素分割。您应该首先在孤立的音素上训练您的 HMM 状态,然后添加其余数据。如果您有足够的数据,您的模型可能能够在没有孤立音素示例的情况下学习,但我不会在这一点上胜过。

  1. 我必须先执行哪些步骤?

构建您的音素示例并使用它们来训练一个简单的 HMM 模型,您不会对音素之间的转换进行建模。一旦你的隐藏状态有了一些关于音素的信息,你就可以继续孤立单词和句子的训练。

【讨论】:

  • 如果我继续用我的句子进行训练,我的程序可以预测单词还是只预测句子?
  • 算法的运作机制并不真正知道单词和句子的区别,除非你为单词转换引入隐藏状态。 HMM 对“序列”建模,因此如果它适用于句子,它也应该适用于单词。
猜你喜欢
  • 1970-01-01
  • 2016-08-20
  • 2011-02-17
  • 1970-01-01
  • 2017-04-10
  • 1970-01-01
  • 2013-02-16
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多