【问题标题】:What data structure should I use to process large amounts of text data?我应该使用什么数据结构来处理大量文本数据?
【发布时间】:2016-09-06 01:16:48
【问题描述】:

我正在尝试使用 scikit-learn 的 TfidfVectorizer 和最近邻算法进行一些文本分类。

我需要找到两个数据集之间的相似性指标,每个数据集包含 18000 个条目。我不确定哪种数据结构最适合用于计算我认为应该是 18000*18000 的相似度指标。

到目前为止,我只考虑过 DataFrame。

【问题讨论】:

  • 在您的数据子集上尝试一些,看看哪一个最适合您。如果容器的语义使您的代码易于阅读,那就太好了。 scikit-learn 示例使用什么?
  • scikit-learn 使用了很多稀疏矩阵和 DataFrame。我认为列表或 DataFrame 都可以为我工作。

标签: python numpy scikit-learn text-processing


【解决方案1】:

如果您不需要任何中间数据进行进一步分析,您可以使用生成器来保存数据点,然后通过生成器调用运行算法。否则你可能需要一个列表。

【讨论】:

    猜你喜欢
    • 2011-12-12
    • 1970-01-01
    • 2019-10-12
    • 2011-10-24
    • 1970-01-01
    • 2011-07-24
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多