【发布时间】:2013-05-03 11:04:28
【问题描述】:
我想基于无法放入内存的语料库构建 tf-idf 模型。我阅读了教程,但似乎立即加载了语料库:
from sklearn.feature_extraction.text import TfidfVectorizer
corpus = ["doc1", "doc2", "doc3"]
vectorizer = TfidfVectorizer(min_df=1)
vectorizer.fit(corpus)
我想知道我是否可以将文档一个一个地加载到内存中,而不是全部加载。
【问题讨论】:
-
处理大型语料库时,使用最新的开发版本而不是稳定版本可能是个好主意,因为
TfidfVectorizer已经过大修以减少内存使用并提高速度。
标签: scikit-learn