【发布时间】:2019-01-23 19:51:03
【问题描述】:
我正在使用 CountVectorizer 创建共现矩阵的稀疏矩阵表示。
我有一个句子列表,还有另一个“权重”列表(向量)——我希望计算每个句子标记的次数。
可以创建一个列表,每个句子根据其相关权重重复多次,但这非常低效且不符合 Python 标准。我的一些体重数百万甚至更高。
如何有效地告诉 CountVectorizer 使用我拥有的权重向量?
【问题讨论】:
-
将每个句子向量(计数向量)乘以所需的权重不能解决问题吗?
-
在某种程度上,这就是我最终所做的。如果有人需要做类似的事情,我会发布我的解决方案。
标签: python scikit-learn nlp countvectorizer