【问题标题】:How to get tf-idf matrix of a large size corpus, where features are pre-specified?如何获取大型语料库的 tf-idf 矩阵,其中预先指定了特征?
【发布时间】:2017-06-16 15:10:41
【问题描述】:

我有一个包含 3,500,000 个文本文档的语料库。我想构造一个 (3,500,000 * 5,000) 大小的 tf-idf 矩阵。在这里,我有 5,000 个不同的特征(单词)。

我在 python 中使用scikit sklearn。我在哪里使用TfidfVectorizer 来做到这一点。我已经构建了一个 5000 大小的字典(每个功能一个)。在初始化TfidfVectorizer 时,我正在使用特征字典设置参数vocabulary。但是在调用fit_transform 时,它会显示一些内存映射,然后显示“CORE DUMP”。

  1. TfidfVectorizer 对于固定词汇和大型语料库是否表现良好?
  2. 如果不是,那么还有哪些其他选择?

【问题讨论】:

  • 对 (1) 的答案是“是的,在我的盒子上确实如此”。考虑为此打开issue

标签: python scikit-learn


【解决方案1】:

其他选项可以是gensim 它在内存方面非常有效并且非常快。 这是您的语料库的 tf-idf 教程的 link

【讨论】:

    猜你喜欢
    • 2020-01-06
    • 2014-04-21
    • 1970-01-01
    • 2017-12-04
    • 2015-12-12
    • 2020-09-27
    • 2018-03-23
    • 1970-01-01
    • 2017-05-30
    相关资源
    最近更新 更多