【发布时间】:2020-03-03 15:24:57
【问题描述】:
我正在使用 Python 中的 Librosa 从 GTZAN 数据集中提取对数 Mel 频谱图。我的代码 -
data, sampling_rate = librosa.load(os.path.join(dir, folder, file), )
mel = librosa.feature.melspectrogram(y=data, hop_length = 512//2, n_fft = 512, n_mels = 64)
mel = librosa.power_to_db(mel**2)
嗯,它工作得很好。但是,每个梅尔谱图的大小是不同的。大多数 log Mel-spectrogram 的大小为 2586,少数为 2590 到 2620。
我在 Mel-spectrogram 上记录日志时检查了大小不同。在记录所有音频长度相同的情况下,它们的大小有何不同...
任何建议,谢谢
【问题讨论】:
标签: python audio neural-network voice-recognition librosa