【问题标题】:How to cluster similar documents based on their keywords?如何根据关键字对相似文档进行聚类?
【发布时间】:2015-12-29 09:50:51
【问题描述】:

我正在 R 中进行文档聚类项目。我有 100 页,并且为每个页面提取了关键字。现在,我想以相同的页面,具有相同的概念,落入同一个集群的方式对页面进行聚类。

我发现了很多文档聚类代码,它们只关注关键字聚类而不是页面聚类。对我的问题有什么建议或想法吗?

提前非常感谢:)

【问题讨论】:

  • 应该很直截了当。 R 中丢失了聚类库。具体如何操作取决于数据的形状。如果你能给我们举个例子,那会有所帮助
  • 付出一些努力来实现这一点。不要指望我们做你的工作,只是为了帮助你在你的程序中遇到的特定问题。

标签: r nlp cluster-analysis document k-means


【解决方案1】:

Getting Started with Latent Dirichlet Allocation using RTextTools + topicmodels

如果您从页面中提取关键字以根据关键字对您喜欢的页面进行聚类。您对页面集群有何期望?

【讨论】:

  • 感谢您的回答。我是文本检索社区的新手。我有 100 页,每页 3 行,是一本书的摘要。我想对那些彼此相似的页面进行聚类(分组)(这样类似的书就会被聚类)。这个主题建模非常好,但我认为它不能被视为我的解决策略。
  • 听起来很有趣,如果你找到了,请告诉我。
猜你喜欢
  • 2015-04-15
  • 1970-01-01
  • 2014-11-03
  • 2010-12-02
  • 2019-12-20
  • 2019-03-07
  • 1970-01-01
  • 1970-01-01
  • 2021-01-10
相关资源
最近更新 更多