【发布时间】:2019-03-27 02:02:39
【问题描述】:
有一个包含项目描述的大型数据集。它包含项目 ID 和它的文本描述。可以为描述中的术语的 tf_idf 值构建一个余弦相似度矩阵。
我的数据集包含 300336 个项目的描述。尝试执行我的 python 代码时出现 MemmoryError:
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.metrics.pairwise import *
tf = TfidfVectorizer(analyzer='word',
ngram_range=(1, 1),
min_df=0)
tfidf_mx = tf.fit_transform(df.text)
cosine_similarities = linear_kernel(tfidf_mx)
我也尝试过另一种方法
sim_mx = cosine_similarity(tfidf_mx, dense_output=False)
但它也给了我一个 MemoryError。
对于余弦相似度计算,稀疏矩阵是否也有上限?
你知道为什么会出现 MemoryError 以及如何处理吗?
【问题讨论】:
标签: python out-of-memory sparse-matrix cosine-similarity