【发布时间】:2009-12-09 11:18:48
【问题描述】:
我收集某些主题的新闻,然后对它们运行贝叶斯分类器以将它们标记为有趣或不有趣。 我看到有些新闻是不同的文章本质上是相同的新闻。例如 - 本金斯利和妻子参观泰姬陵 - 金斯利在泰姬陵的草坪上与妻子浪漫
我如何教系统将所有这些标记为重复?
谢谢 桑杰
【问题讨论】:
标签: duplicates bayesian
我收集某些主题的新闻,然后对它们运行贝叶斯分类器以将它们标记为有趣或不有趣。 我看到有些新闻是不同的文章本质上是相同的新闻。例如 - 本金斯利和妻子参观泰姬陵 - 金斯利在泰姬陵的草坪上与妻子浪漫
我如何教系统将所有这些标记为重复?
谢谢 桑杰
【问题讨论】:
标签: duplicates bayesian
有趣的想法。我想这已经被研究过,在一些 comp-sci 期刊上看一下应该会找到一些好的指针。这就是说我有一些想法:
您可以找到最独特的关键短语,并查看它们与其他文章的关键短语的匹配程度。我想google 发布的关于网络上短语频率的数据将为您提供基线。
您需要了解一个事实,即“在”是一个非常常见的短语,但“Kingsley 访问”很重要。一旦您将所有文本过滤为仅关键短语,您就可以看到其中有多少匹配。
关键词:
如果你自己写这个并不容易,但我会说这是一个非常有趣的问题领域。
如果我们只是使用标题并手动遵循方法。
Ben Kingsley 和妻子参观泰姬陵 将创建以下关键字:
但是这些应该被删除,因为它们太常见了(因此无助于唯一地识别内容)
一旦对另一个标题 Kingsley 在泰姬陵的草坪上谈恋爱 进行相同操作,您就可以比较并发现相当多的关键短语彼此匹配。因此,他们是在同一个主题上。
尽管这已经是一项艰巨的任务,但您可以做很多事情来进一步匹配。
这些都是在创建关键字集后修剪关键字集的所有方法。
WordNet 将是寻找“更长”和“扩展”之间匹配的一个很好的开始。这将很有用,因为文章不会使用相同的词典进行写作。
您可以针对关键短语运行贝叶斯分类器。可以通过拥有所有匹配/不匹配文章及其关键短语的集合来训练它。您必须小心处理看不见的短语,因为这些可能是您遇到的最重要的事情。在不是关键短语上运行它可能会更好。
如果没有其他匹配项,甚至可以计算一些关键短语之间的Levenshtein distance。我猜很可能总会找到一些匹配项。
我觉得这是一个很好的答案会让你获得博士学位的事情之一。再说一遍,我想它已经完成了before(谷歌必须有一些自动的方法来抓取所有这些新闻网站并将它们归入类别和类似文章中)
祝你好运。
【讨论】:
这是一个分类问题,但考虑到您将拥有的不同类别的数量,难度会更大。一种选择可能是使用Feature Selection (more info) 减小每个文档的大小。特征选择涉及选择前 n 个术语(不包括 stop words,并且可能将stemming 应用于每个单词)。为此,为每个文档计算每个术语的mutual information (more info),按该数字对术语进行排序并为每个文档选择前 n 个术语。每个文档的前 n 个术语的简化特征集现在可以构成执行重复选择的基础(例如,如果任何文档之间有超过 x% 个共同术语,则再次通过回测计算 x ),
大部分内容都包含在information retrieval 上的这本免费书籍中。
【讨论】: