【发布时间】:2020-05-09 01:57:49
【问题描述】:
我正在对语音数据集进行一些数据增强,我想在时域中拉伸/压缩每个音频文件。
我找到了以下三种方法来做到这一点,但我不确定哪一种是最好的或更优化的方法:
dimension = int(len(signal) * speed)
res = librosa.effects.time_stretch(signal, speed)
res = cv2.resize(signal, (1, dimension)).squeeze()
res = skimage.transform.resize(signal, (dimension, 1)).squeeze()
但是,我发现librosa.effects.time_stretch 会在信号中添加不需要的回声(或类似的东西)。
所以,我的问题是:这三种方式的主要区别是什么?有没有更好的方法来做到这一点?
【问题讨论】:
标签: opencv machine-learning scikit-image librosa data-augmentation