【发布时间】:2020-01-11 18:22:47
【问题描述】:
我正在尝试构建一个语音识别系统,它是一个序列到序列的模型。但是我对如何将提取的特征(维度为 40 的 fbank)提供给 LSTM 感到困惑。据我发现,有不同的方法可以将数据作为输入提供给 LSTM。但是,我怀疑要完全理解它们。如果有人告诉我在以下情况下我是否正确,我将不胜感激。
案例 1: 在方便的格式 [Batch_Size, Time_Step, Feature_Dim],如果我选择 [1, None, 40] ,每个序列(话语)的长度可以变化吗?如果是这样,在这种情况下,我不需要填充每个序列,对吗?
案例 2: 如果所有输入序列都填充到相同的长度,Batch_Size 可以是任何值,如 64、128 等?
最后再问一个问题,我注意到每个Batch中的Time_Step应该是一样的吗?
如果有人能帮助我摆脱疑惑或给我一些建议,我将非常感激。
【问题讨论】:
标签: python speech-recognition lstm recurrent-neural-network speech-to-text