【发布时间】:2016-06-03 13:11:03
【问题描述】:
我有大约 100000 个不同字长的文档。我还在整个语料库上训练了一个 word2vec 模型。现在我如何从拥有这个词向量为每个单独的文档创建相同维度的特征?
我知道如何做到这一点的几种技术,一种是对文档中所有单词的向量进行简单平均,另一种是进行 k-means 聚类。
您能否建议一些其他方式来执行此任务?
【问题讨论】:
标签: machine-learning nlp feature-extraction word2vec