【问题标题】:Librosa Mel-Spectrogram log ShapeLibrosa Mel-频谱图对数形状
【发布时间】:2020-03-03 15:24:57
【问题描述】:

我正在使用 Python 中的 Librosa 从 GTZAN 数据集中提取对数 Mel 频谱图。我的代码 -

data, sampling_rate = librosa.load(os.path.join(dir, folder, file), )
mel = librosa.feature.melspectrogram(y=data, hop_length = 512//2, n_fft = 512, n_mels = 64)
mel = librosa.power_to_db(mel**2)

嗯,它工作得很好。但是,每个梅尔谱图的大小是不同的。大多数 log Mel-spectrogram 的大小为 2586,少数为 2590 到 2620。

我在 Mel-spectrogram 上记录日志时检查了大小不同。在记录所有音频长度相同的情况下,它们的大小有何不同...

任何建议,谢谢

【问题讨论】:

    标签: python audio neural-network voice-recognition librosa


    【解决方案1】:

    音频文件的长度可能略有不同。这通常发生在数据集中。您可能应该将所有频谱图截断为最短的公共长度 (2586)。

    mel = mel[:,0:2586]
    

    【讨论】:

    • 是的,可以。但是,我确实将总长度设为 2700,并复制 mel-spectorgram 中的最后一个值,直到索引达到 2700。它运行良好。谢谢你的另一个答案...
    猜你喜欢
    • 2020-06-23
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2010-12-09
    • 2020-01-17
    • 2021-07-30
    • 2023-02-14
    • 1970-01-01
    相关资源
    最近更新 更多