【问题标题】:huge memory load in keras lstm (timesteps x features)keras lstm 中的巨大内存负载(时间步长 x 功能)
【发布时间】:2018-06-04 15:44:44
【问题描述】:

有 10000 个文件,由 200000 个单词(每个单词)组成。我已将所有文件中的所有单词放在 python 列表中。 np.reshape 是 (10000, 200000, 256)。 256 是因为 单热编码。这种方法的主要问题是内存,因为 input_shape = (200000, 256)。我不知道是否可以反转,例如 np.reshape (10000, 256, 200000) 和 input_shape = (256, 200000),因为一切都在同一个列表,我不确定 keras 是否正确拆分每个样本,或者每个文件的单词是否与其他文件中的单词混在一起,最终返回错误的分类。

【问题讨论】:

  • 我可以仔细检查一下:每个文件有 200,000 个单词吗?但你的总词汇量只有 256 个不同的单词? (这就是“256 是因为一个热编码”所暗示的……还是您的意思是您使用的是维度为 256 的词嵌入?)

标签: python deep-learning keras lstm sentiment-analysis


【解决方案1】:

词干,

找到独特的词,

删除停用词,

阅读本教程;

https://machinelearningmastery.com/clean-text-machine-learning-python/

【讨论】:

    猜你喜欢
    • 2019-05-29
    • 2018-03-09
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-12-15
    • 2021-09-27
    • 1970-01-01
    相关资源
    最近更新 更多