【问题标题】:How to extract feature from lists?如何从列表中提取特征?
【发布时间】:2020-03-20 10:49:49
【问题描述】:

如何通过python从数据集中提取特征:

我找到了两种方法来解决这个问题。 1) 一个是:

但是 所以这不是一个好方法。

2) 另一个是:

搜索C和D列找到topK项,只保留topK。 但会导致信息丢失。

有没有更好的方法来解决这个问题?

【问题讨论】:

  • C\D(m, n)的索引是什么意思?
  • 如果你想访问 values(for.ex list/dict) 中的值,那么使用子索引,如果是列表,使用 columnname[list_index][element_index],如果是字典,使用 columnnmae [dict_key] 或类似的东西

标签: python pandas scikit-learn feature-extraction sklearn-pandas


【解决方案1】:

我想我明白你的问题。我列出了一种您可以遵循的方法,而不会出现任何稀疏性或信息丢失。

  1. 假设您的 C 列从 c1 到 c4 变化,并且您创建了一个从 c1 到 c4 的二进制向量,就像您已经做的那样。
  2. 然后将二进制向量转换为十进制并将其用作特征。 (例如 1,1,0,0, --> 0*2^0 + 0*2^1 + 1*2^2 + 1*2^3)。
  3. 对 D 采用相同的方法,但我建议您创建两个功能。一个类似于第 2 步,不使用 D 的值,另一个使用 D 的值进行十进制转换,然后根据两个特征之间的相关性决定保留它们。

【讨论】:

  • 谢谢。如果结果大于 max(decimal) 或 max(hex),则将二进制向量转换为十进制会有一些问题。
  • 将 D 转移到 D-key、D-value 、D-cor 要求 value 是 uniq。但是列表D的子值可能会重复,例如[{'d1':'d1_value'},{'d2':'d1_value'}]。
猜你喜欢
  • 2020-10-06
  • 2016-05-15
  • 1970-01-01
  • 1970-01-01
  • 2021-06-23
  • 2016-12-13
  • 1970-01-01
  • 2017-08-11
  • 2016-09-12
相关资源
最近更新 更多