【发布时间】:2018-04-09 09:28:46
【问题描述】:
我有一个大数据集,其中包含以下形式的条目:
user_id、measurement_date、value1、value2、..
出现的挑战是如何处理数据中的空白。 测量是随机进行的,因此总会有更小和非常大的差距。
这里处理缺失数据的最佳方法是什么。
我正在考虑以下方法:
- 对于所有不存在的测量值,请使用特殊向量。 (这会导致不实用的训练数据,因为非测量条目会接管)
- 与上述类似,但将多个非测量值组合到一个向量中,例如。引入一个表示未进行测量的天数的向量。
我现在的问题是最好的编码方式是什么。
目前 LSTM 网络以未编码输入向量的形式获取输入:
vector1, vector2,..
向量包含值。
但现在当我引入新符号时:
s1 := <=3 days no measurement taken
s2 := <=7 ..
我会对它们进行热编码。
最好引入一个前缀来区分这两种词类型吗?
例如
1 vector -> 1, value1, value2
0 vecotr -> 0, 0, 1 (s1)
-> 0, 1, 0 (s2)
【问题讨论】:
标签: machine-learning encoding lstm recurrent-neural-network training-data