【发布时间】:2019-01-15 16:47:49
【问题描述】:
我会解释我的问题:
- 我有大约 50.000 个样本,每个样本都由代表“事件”的代码列表描述
- 唯一代码的数量约为 800 个。
- 一个样本最多可以有 600 个代码。
我想使用 one-hot 编码来表示每个样本。如果我们考虑对那些代码较少的样本进行填充操作,则表示应该是一个 800x600 的矩阵。
将此新表示形式作为网络的输入,意味着将每个矩阵展平为大小为 800x600(460.000 个值)的向量。
最后,数据集应包含 50.000 个大小为 460.000 的向量。
现在,我有两个考虑:
- 如何处理这种大小的数据集?(我尝试使用数据生成器即时获取表示,但它们真的很慢)。
- 将大小为 460.000 的向量作为每个样本的输入,这意味着我的模型的复杂性(要学习的参数数量)非常高(在我的情况下约为 15.000.000),因此,我需要一个庞大的数据集正确训练模型。不是吗?
【问题讨论】:
-
您已使用 Python 标记发布此内容,因此您必须有一些您尝试运行的代码。请在您的问题中包含这一点,并具体说明您的要求,以便我们更好地帮助您。
标签: deep-learning one-hot-encoding