【问题标题】:Spectrograms generated using Librosa don't look consistent with Kaldi?使用 Librosa 生成的频谱图看起来与 Kaldi 不一致?
【发布时间】:2017-08-31 16:23:49
【问题描述】:

我使用来自 Kaldi 的“egs/tidigits”代码,使用 23 个 bin、20kHz 采样率、25ms 窗口和 10ms 移位生成了“七”话语的频谱图。频谱图通过 MATLAB imagesc 函数显示如下:

我正在尝试使用 Librosa 作为 Kaldi 的替代品。我使用与上面相同数量的箱、采样率和窗口长度/移位设置我的代码如下。

time_series, sample_rate = librosa.core.load("7a.wav",sr=20000)
spectrogram = librosa.feature.melspectrogram(time_series, sr=20000, n_mels=23, n_fft=500, hop_length=200)
log_S = librosa.core.logamplitude(spectrogram)
np.savetxt("7a.txt", log_S.T)

但是,当我将生成的同一 WAV 文件的 Librosa 频谱图可视化时,它看起来不同:

有人可以帮我理解为什么这些看起来如此不同吗?在我尝试过的其他 WAV 文件中,我注意到在上面的 Librosa 脚本中,我的擦音(如上例中“七”中的 /s/)正在被截断,这极大地影响了我的数字分类准确性。谢谢!

【问题讨论】:

标签: speech-recognition spectrogram mfcc librosa kaldi


【解决方案1】:

Kaldi 默认在 dct 输出上应用升降器,这就是上系数被衰减的原因。详情见here

【讨论】:

  • 我明白了,是的,我熟悉举重的概念。你知道是否有办法在 Librosa 中对我的脚本应用提升?我还遇到了这个库 (python-speech-features.readthedocs.io/en/latest),它似乎有更常见的 ASR 选项
  • 它应该是向量上的标准乘法。您可以在提取特征之前预先计算向量。
猜你喜欢
  • 1970-01-01
  • 2020-07-22
  • 2020-06-23
  • 2020-03-22
  • 1970-01-01
  • 2021-07-30
  • 2020-01-17
  • 2020-03-03
  • 1970-01-01
相关资源
最近更新 更多