【问题标题】:Machine learning with a variable-sized real vector of inputs?具有可变大小的实际输入向量的机器学习?
【发布时间】:2016-09-20 04:10:56
【问题描述】:

我有一组具有我测量的属性的对象。对于每个对象,我获得一个描述该对象的实数向量。向量总是不完整的:通常在完整向量的开头或结尾缺少数字,有时中间缺少信息。因此,每个对象都会产生一个不同长度的向量。例如,我还测量了每个物体的质量,现在我想将我测量的物体的矢量与质量联系起来。

从这个实数向量中提取特征在我的领域(天体物理学)中很常见,例如取值的平均值或一些线性组合;然后使用这些提取的特征来推断质量(或其他),例如使用神经网络。然而,最近的研究表明,矢量元素的非常复杂的组合会产生更好的质量模型。

但是,即使在处理模拟数据时,此模型中仍然存在残差。大概然后有更好的方法来操纵这些可变长度向量以获得更好的模型。

我想知道是否可以使用所有不同长度的实值输入向量进行机器学习。我知道对于文本挖掘,有诸如词袋方法之类的东西,但尚不清楚这种方法如何在实值向量上起作用。我知道循环神经网络适用于可变长度的句子,但我不确定它们适用于实值向量。我还考虑过估算缺失的数据;但是,有时由于物理原因它会丢失,即某处的值不存在,因此将其归入会违反情况的物理性。

有这方面的研究吗?

【问题讨论】:

  • 我是否正确地认为您不知道 哪个 特征在您的特征向量中的位置 X 处?如果您知道,您不是在处理经典意义上的不同长度的特征向量,而是在您的特征向量中可能有很多未知(“NA”)信息。如果您不知道:您的特征是有序的(类似于时间序列测量)还是您可以例如“洗牌”他们?
  • @geekoverdose 有趣的问题!我正在测量一个物理的东西,有时信息只是完全丢失(“NA”),但有时信息是非物理的——它不存在,就像站着的人没有膝盖一样——所以我不确定这是否是“NA”材料。信息可以被认为是有序的,即可以按顺序标记它们,但并不完全需要这样做,并且有时很难进行标记。我很高兴听到有关此问题的顺序或非顺序解决方案。
  • 那么我可能会认为“缺失的属性”是信息本身(例如二进制/虚拟变量)。您可以在预测任务中直接使用某些模型类型的此信息,但您也可以将其用于例如可以使用它的树状模型会自动形成更同质的组,例如其他模型可以对目标变量进行预测。

标签: machine-learning deep-learning feature-extraction


【解决方案1】:

循环神经网络 (RNN) 能够获取长度为 n 的可变大小输入向量并生成长度为 m 的可变大小输出向量。

有很多方法可以让 RNN 发挥作用。最常见的细胞类型称为长短期记忆 (LSTM) 和门控循环单元 (GRU)。

您可能想阅读:

但是,训练 RNN 需要大量训练数据。从中计算固定大小的特征向量可能会更好。但你永远不知道什么时候不尝试;-)

【讨论】:

  • 我可以生成任意数量的训练数据(我正在模拟工作!)所以我一定会尝试一下。谢谢!
  • 我仍然有点困惑。我已经阅读了您链接的前两个站点,它们似乎主要用于从他们所学的模型中生成样本。这些架构是否也可以用于训练常规神经网络的传统回归/分类类型任务?
  • 是的,RNN 可用于序列标记。通常当您在一个序列中有多个类并且您不知道在哪里拆分时使用它,但我很确定应该可以只为一个序列设置一个类。但是,我现在不知道有什么好的论文。
  • 我还有一个问题。如果我知道我将测试 RNN 的真实数据有缺失值,我是否应该模拟这种情况并在训练数据中添加空白?我的训练数据将是长度约为 150 的向量(所有相同的单位),但我想要使用它的真实数据只有 25 个左右的值。
  • @rhombidodedecahedron 我从来不用处理缺失值。但是,我认为让训练数据与测试数据尽可能相似通常是个好主意。
猜你喜欢
  • 2018-10-24
  • 2017-04-14
  • 2016-08-08
  • 2016-05-19
  • 1970-01-01
  • 2018-12-18
  • 2015-01-20
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多