【发布时间】:2021-09-01 14:25:45
【问题描述】:
我正在尝试制作一个能够从录音中提取人类语音的模型。为此,我加载了 1500 个嘈杂文件(其中一些文件完全相同,但具有不同的语音噪声比(-1、1、3、5、7)。我希望我的模型将 wav 文件作为沿水平轴的一维数组/张量,然后输出一个我可以播放的一维数组/张量。 目前这就是我的数据的设置方式。
我遇到的一个错误是我无法做出预测,当我得到一个只有一个元素的数组/张量,而不是一个带有 220500 的元素时。22050 背后的原因是它是背景噪音与干净的语音重叠,因此每个文件都是这个长度。 我一直在搞乱layers.Input,因为虽然我希望我的模型将每一行都作为一个“对象”/音频剪辑。我不知道这是不是发生了什么,因为唯一的“成功”预测是错误
【问题讨论】:
标签: tensorflow neural-network speech-recognition tensorflow2.0 audio-processing