【发布时间】:2021-06-16 13:18:43
【问题描述】:
我有一个 800 行和 16k 列的数据集。 它采用 OneHotEcoding 格式(二进制:0,1)。这样如果列值存在于一行中,则 row[col] = 1,否则 = 0。 这些是我数据集中的 16k 个特征。如何使用 tfidf 从中选择 5k 和 10k 特征?
例如我的数据:
ID col1 col2 col3 col4
a 0 0 1 0
b 1 0 0 0
c 0 1 1 1
d 0 0 0 1
但是,对于 ~800 行和 16k 列。 我尝试了主题建模并从数据集中选择了前 300 个特征(使用 LDA),但这还不够。 我被要求使用 tf-idf 并从数据框中选择 5k 个特征。 (最初我被要求尝试 5k 到 16k 左右的功能,中间有 500 到 1k 步 )。 我不明白最初问的是什么,但想弄清楚使用 tf-idf 来选择功能。那么也许可以为 6k、7k、8k...16k 功能运行相同的功能? 任何有关使用什么库以及如何对其进行编码的帮助都会有所帮助!
【问题讨论】:
标签: python pandas scikit-learn deep-learning