【发布时间】:2017-03-20 01:58:21
【问题描述】:
我有一个单词和文本的数据集,我想制作集群(通过 K-means)或任何其他无监督/监督学习方法来区分单词,例如,单词“John”将被归类为名称(和将与其他人名聚集在一起),“巴西”作为一个地方等等......
有没有我可以用来解决问题的模型。
我听说过 N-gram,但我不知道如何在 x、y 图或类似的图上绘制 Ngram 概率
P.S 如果你有任何精彩的例子
【问题讨论】:
-
如果您只关心“名称”和“地点”,您应该寻找命名实体解决方案。否则,您可能希望找到/开发良好的标记数据来源(带有您关心的标签)并基于此学习分类器。
-
您正在描述一个监督任务,分类。
-
我想对数据进行聚类,然后做出决策边界,这样我就可以近似单词类型(聚类最终会被标记为类)
标签: machine-learning nlp cluster-analysis text-mining named-entity-recognition