【发布时间】:2017-06-16 15:10:41
【问题描述】:
我有一个包含 3,500,000 个文本文档的语料库。我想构造一个 (3,500,000 * 5,000) 大小的 tf-idf 矩阵。在这里,我有 5,000 个不同的特征(单词)。
我在 python 中使用scikit sklearn。我在哪里使用TfidfVectorizer 来做到这一点。我已经构建了一个 5000 大小的字典(每个功能一个)。在初始化TfidfVectorizer 时,我正在使用特征字典设置参数vocabulary。但是在调用fit_transform 时,它会显示一些内存映射,然后显示“CORE DUMP”。
-
TfidfVectorizer对于固定词汇和大型语料库是否表现良好? - 如果不是,那么还有哪些其他选择?
【问题讨论】:
-
对 (1) 的答案是“是的,在我的盒子上确实如此”。考虑为此打开issue。
标签: python scikit-learn