【发布时间】:2016-09-06 01:16:48
【问题描述】:
我正在尝试使用 scikit-learn 的 TfidfVectorizer 和最近邻算法进行一些文本分类。
我需要找到两个数据集之间的相似性指标,每个数据集包含 18000 个条目。我不确定哪种数据结构最适合用于计算我认为应该是 18000*18000 的相似度指标。
到目前为止,我只考虑过 DataFrame。
【问题讨论】:
-
在您的数据子集上尝试一些,看看哪一个最适合您。如果容器的语义使您的代码易于阅读,那就太好了。 scikit-learn 示例使用什么?
-
scikit-learn 使用了很多稀疏矩阵和 DataFrame。我认为列表或 DataFrame 都可以为我工作。
标签: python numpy scikit-learn text-processing