【问题标题】:Text mining and Machine learning [closed]文本挖掘和机器学习 [关闭]
【发布时间】:2017-03-20 01:58:21
【问题描述】:

我有一个单词和文本的数据集,我想制作集群(通过 K-means)或任何其他无监督/监督学习方法来区分单词,例如,单词“John”将被归类为名称(和将与其他人名聚集在一起),“巴西”作为一个地方等等...... 有没有我可以用来解决问题的模型。 我听说过 N-gram,但我不知道如何在 x、y 图或类似的图上绘制 Ngram 概率
P.S 如果你有任何精彩的例子

【问题讨论】:

  • 如果您只关心“名称”和“地点”,您应该寻找命名实体解决方案。否则,您可能希望找到/开发良好的标记数据来源(带有您关心的标签)并基于此学习分类器。
  • 您正在描述一个监督任务,分类。
  • 我想对数据进行聚类,然后做出决策边界,这样我就可以近似单词类型(聚类最终会被标记为类)

标签: machine-learning nlp cluster-analysis text-mining named-entity-recognition


【解决方案1】:

word2vec 和嵌入怎么样?
https://deeplearning4j.org/word2vec

【讨论】:

  • 如果您没有预定义的类 word2vec 是一个很好的解决方案。这是 tensorflow 中的解决方案tensorflow.org/versions/r0.11/tutorials/word2vec/index.html 您可以以向量的形式表示单词,然后使用例如余弦距离进行聚类。如果你有预定义的类,那么你必须使用监督学习。
猜你喜欢
  • 2011-10-29
  • 2011-11-22
  • 1970-01-01
  • 2010-12-22
  • 2014-10-24
  • 2011-03-25
  • 2011-06-16
  • 2013-04-01
  • 2013-08-28
相关资源
最近更新 更多