【发布时间】:2020-12-24 02:13:05
【问题描述】:
我有一个包含 60k 句子的样本数据集,并试图创建一个序列模型。 清理后,预处理我的“y”长度为 573,806 行。唯一令牌的长度为 16207。
为了在嵌入层中使用它,我正在尝试将这个“y”转换为二进制类。我尝试过单热编码、to_categorical 和散列。所有这些方法都需要大量内存分配 (37Gb),我的 google Colab Pro 崩溃了。
似乎没有办法避免内存分配过多导致的崩溃。 Here is my related SO thread
鉴于此,我正在寻找有关此问题的一些指导。是否有任何其他可用于解决此问题的替代内存有效方法可用于顺序模型?
提前致谢。
【问题讨论】:
标签: tensorflow keras google-colaboratory