【问题标题】:TF model wrong output dimensionsTF模型错误的输出尺寸
【发布时间】:2021-09-01 14:25:45
【问题描述】:

我正在尝试制作一个能够从录音中提取人类语音的模型。为此,我加载了 1500 个嘈杂文件(其中一些文件完全相同,但具有不同的语音噪声比(-1、1、3、5、7)。我希望我的模型将 wav 文件作为沿水平轴的一维数组/张量,然后输出一个我可以播放的一维数组/张量。 目前这就是我的数据的设置方式。

这就是我的模型的设置方式

我遇到的一个错误是我无法做出预测,当我得到一个只有一个元素的数组/张量,而不是一个带有 220500 的元素时。22050 背后的原因是它是背景噪音与干净的语音重叠,因此每个文件都是这个长度。 我一直在搞乱layers.Input,因为虽然我希望我的模型将每一行都作为一个“对象”/音频剪辑。我不知道这是不是发生了什么,因为唯一的“成功”预测是错误

【问题讨论】:

    标签: tensorflow neural-network speech-recognition tensorflow2.0 audio-processing


    【解决方案1】:

    您构建的模型需要格式为 (batch_size, 1, 220500) 的数据,如在您声明 input_shape 为 (1, 220500) 的输入层中。

    对于您正在使用的数据,您应该只使用 (220500,) 的 input_shape。

    您可能会遇到的另一个问题是,您在最后一层使用了一个单元。这样模型的输出将是 (batch_size, 1),但你需要 (batch_size, 220500) 作为输出。

    对于最后一个问题,我建议您使用生成循环神经网络。

    【讨论】:

    • 欣赏小费。另一个论坛上的某个人向我指出了我的图层问题(我认为我的输出将与我的标签结构相匹配)。可悲的是,在这样做之后 colab 崩溃了(我假设由于太多层)所以我会使用你的建议来寻找另一个解决方案。祝你好运
    猜你喜欢
    • 2018-03-06
    • 1970-01-01
    • 2021-09-13
    • 1970-01-01
    • 2018-02-10
    • 2017-08-30
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多