【发布时间】:2018-06-04 15:44:44
【问题描述】:
有 10000 个文件,由 200000 个单词(每个单词)组成。我已将所有文件中的所有单词放在 python 列表中。 np.reshape 是 (10000, 200000, 256)。 256 是因为 单热编码。这种方法的主要问题是内存,因为 input_shape = (200000, 256)。我不知道是否可以反转,例如 np.reshape (10000, 256, 200000) 和 input_shape = (256, 200000),因为一切都在同一个列表,我不确定 keras 是否正确拆分每个样本,或者每个文件的单词是否与其他文件中的单词混在一起,最终返回错误的分类。
【问题讨论】:
-
我可以仔细检查一下:每个文件有 200,000 个单词吗?但你的总词汇量只有 256 个不同的单词? (这就是“256 是因为一个热编码”所暗示的……还是您的意思是您使用的是维度为 256 的词嵌入?)
标签: python deep-learning keras lstm sentiment-analysis