【问题标题】:algorithm to identify book titles in tweets [closed]识别推文中书名的算法[关闭]
【发布时间】:2015-08-01 21:45:53
【问题描述】:

我正在尝试制作一个程序,该程序将分析大量推文并生成有关人们在推文中发布的前 10 部最受欢迎的书籍的报告。问题是我不知道如何识别推文中的书名。如果有人可以为这种类型的工作命名算法或至少引导我朝着正确的方向前进,那就太好了。

【问题讨论】:

  • 对于您要实现的目标,没有一种特定“算法”的名称。它需要混合不同的方法。

标签: algorithm twitter nlp nltk text-mining


【解决方案1】:

您需要一个要搜索的字词列表。然后浏览推文并检查列表中的书名实例。

没有办法自动提取“书名”。例如,您如何区分昨晚在自家后院看到的“火星人”和安迪·威尔的书?

【讨论】:

    【解决方案2】:

    如果您没有书名列表,请Wikipedia provides some lists。但如果你的目标是比较新书(夏季畅销书),我猜它们不会出现在这些列表中。您可以在 Internet 上找到其他列表...无论如何(为了可靠性)您需要一个列表。

    然后,正如@Adam_G 之前所说:

    没有办法自动提取“书名”。例如,您如何区分昨晚在自家后院看到的谈论“火星人”的人和安迪·威尔的书?

    让我们想象两本书“猫”和“绿鲨的恐惧”。 有许多包含“猫”序列的推文,但在大多数情况下,这些推文与这本书无关。相反,所有包含“对绿鲨的恐惧”的推文显然都是关于这本书的。

    因此,您应该为每个标记序列分配一个“概率”P 作为书名。在前面的示例中,“猫”的P 非常低,而“绿鲨的恐惧”P 非常高。您可以根据标题中的单词数和这些单词(以及 2-gram、3-gram、...)在整个语言中的频率(可以使用大语料库计算)来计算 P 的值)

    现在考虑这条推文:

    我读了《猫》,很喜欢!!

    作为人类,我们知道“猫”是一本书,因为推文包含“阅读”。 因此,对于P 较低的标题(例如“猫”),您可以尝试使用机器学习算法来了解推文是否真的与这本书有关。这个想法是计算一条包含标题的推文在给定推文中的单词的情况下真正与这本书有关的概率。详细了解机器学习算法,例如朴素贝叶斯分类器。

    【讨论】:

      猜你喜欢
      • 2013-02-17
      • 2010-12-21
      • 2020-03-17
      • 1970-01-01
      • 1970-01-01
      • 2013-11-29
      • 1970-01-01
      • 2012-02-13
      • 1970-01-01
      相关资源
      最近更新 更多