【发布时间】:2019-09-28 18:02:26
【问题描述】:
我正在尝试训练一个包含 700000 行的大型数据集,其中包含 210+ 百万个单词。我有 8 GB 内存。当我尝试通过 tfidf 训练它时,它给了我记忆错误。有人可以指导我到底做错了什么 这是我的示例训练代码
self.vectorizer = TfidfVectorizer(min_df=0.001, max_df=0.2, norm='l2', analyzer='word')
self.dim = None def learn(self, all_clean_text): print('Train feature extractor') x = self.vectorizer.fit_transform(all_clean_text).toarray() print (x.shape) self.dim = x.shape[1] print (self.dim)
【问题讨论】: