【发布时间】:2016-09-20 04:10:56
【问题描述】:
我有一组具有我测量的属性的对象。对于每个对象,我获得一个描述该对象的实数向量。向量总是不完整的:通常在完整向量的开头或结尾缺少数字,有时中间缺少信息。因此,每个对象都会产生一个不同长度的向量。例如,我还测量了每个物体的质量,现在我想将我测量的物体的矢量与质量联系起来。
从这个实数向量中提取特征在我的领域(天体物理学)中很常见,例如取值的平均值或一些线性组合;然后使用这些提取的特征来推断质量(或其他),例如使用神经网络。然而,最近的研究表明,矢量元素的非常复杂的组合会产生更好的质量模型。
但是,即使在处理模拟数据时,此模型中仍然存在残差。大概然后有更好的方法来操纵这些可变长度向量以获得更好的模型。
我想知道是否可以使用所有不同长度的实值输入向量进行机器学习。我知道对于文本挖掘,有诸如词袋方法之类的东西,但尚不清楚这种方法如何在实值向量上起作用。我知道循环神经网络适用于可变长度的句子,但我不确定它们适用于实值向量。我还考虑过估算缺失的数据;但是,有时由于物理原因它会丢失,即某处的值不存在,因此将其归入会违反情况的物理性。
有这方面的研究吗?
【问题讨论】:
-
我是否正确地认为您不知道 哪个 特征在您的特征向量中的位置 X 处?如果您知道,您不是在处理经典意义上的不同长度的特征向量,而是在您的特征向量中可能有很多未知(“NA”)信息。如果您不知道:您的特征是有序的(类似于时间序列测量)还是您可以例如“洗牌”他们?
-
@geekoverdose 有趣的问题!我正在测量一个物理的东西,有时信息只是完全丢失(“NA”),但有时信息是非物理的——它不存在,就像站着的人没有膝盖一样——所以我不确定这是否是“NA”材料。信息可以被认为是有序的,即可以按顺序标记它们,但并不完全需要这样做,并且有时很难进行标记。我很高兴听到有关此问题的顺序或非顺序解决方案。
-
那么我可能会认为“缺失的属性”是信息本身(例如二进制/虚拟变量)。您可以在预测任务中直接使用某些模型类型的此信息,但您也可以将其用于例如可以使用它的树状模型会自动形成更同质的组,例如其他模型可以对目标变量进行预测。
标签: machine-learning deep-learning feature-extraction