【发布时间】:2016-11-25 07:23:35
【问题描述】:
例如,我有一个由行组成的文本。每行都有自己的长度、缩进和其他特征。我的目标是在本文中找到诗歌,但我所知道的所有聚类方法都会重新排列行并独立于文本中的位置构建聚类。我尝试将位置用作功能之一,但我不喜欢结果。如果你提示我一些类似 DBSCAN 的东西会很酷。你能帮帮我吗?
【问题讨论】:
标签: machine-learning cluster-analysis text-analysis dbscan
例如,我有一个由行组成的文本。每行都有自己的长度、缩进和其他特征。我的目标是在本文中找到诗歌,但我所知道的所有聚类方法都会重新排列行并独立于文本中的位置构建聚类。我尝试将位置用作功能之一,但我不喜欢结果。如果你提示我一些类似 DBSCAN 的东西会很酷。你能帮帮我吗?
【问题讨论】:
标签: machine-learning cluster-analysis text-analysis dbscan
据说集群不是解决您的问题的正确工具。可能有一些 segmentation 算法可以用于您的问题。
但最好将其视为一个优化问题,并直接解决它,而不是希望某些聚类算法碰巧起作用。
【讨论】:
我认为这个问题归结为使用哪些功能。你有一个自然语言处理任务,所以我建议Word2Vec,例如
这种方法能够在向量空间中嵌入单词、句子甚至文档。
另请参阅:Document classification with distributions of word vectors
【讨论】: