【问题标题】:Stanford CoreNLP Sentiment Analysis with Text Classification带有文本分类的斯坦福 CoreNLP 情感分析
【发布时间】:2016-04-17 12:51:49
【问题描述】:

我正在完成我的个人学士学位期末项目,该项目将在大约 50 天后到期。我希望创建的网站是用户可以分享他们觉得有趣的文章的链接(让他们开心的东西)。这是一种类似于 reddit 的格式,用户可以在全球范围内发帖,其他人可以根据他们的快乐程度对文章进行投票赞成或反对。热门帖子将显示在列表顶部,最不受欢迎的帖子将显示在底部。

该项目更令人兴奋的部分是实施 NLP 机器学习服务,该服务可在网络上抓取与热门文章相似的文章,并自动将文章发布到网站(除了投票之外无需用户输入)。为了做到这一点,我正在考虑在服务器上运行一个斯坦福 CoreNLP 服务,它可以挑选出最热门的文章,根据它们的主题对它们进行分类(例如,关于唐纳德特朗普的文章应该自动生成标签,例如'Donald Trump'、'Republican'、'politics' 等)然后通过对文章进行情感分析,使用 Stanford CoreNLP 情感注释器,我可以看到公众对文章主题的看法(即标签)。然后通过网络爬虫,从网络中提取文章,对提取的文章进行相似的情感分析,找到合适的文章发布到网站上。

但是,我在斯坦福 CoreNLP 中找不到任何用于文本分类的注释器。有什么办法可以实现我的想法。更好的是,有没有更好的方法来实现我想要实现的目标。

提前致谢。

【问题讨论】:

    标签: web-crawler nlp stanford-nlp sentiment-analysis text-classification


    【解决方案1】:

    我认为这个答案不会帮助发帖的人,但希望其他一些人可能会受益。我觉得问题中的很多事情都被错误地表达了,但缺少清晰性,但这就是我认为您需要的-

    • 一款可让用户通过“喜欢”功能分享链接的应用
    • 从趋势 posts 中确定趋势 主题(您可以使用喜欢计数找到):您需要应用一些算法(可能是主题建模)才能找到它.
    • 一种网络爬虫/抓取工具,可让您获取有关您的算法识别的主题的文章
    • 你还想用极性分数来标记你的文章(你实际上不需要 coreNLP 只是为了这个,因为还有其他可用的包,我发现 coreNLP 很重 - 我从 R 运行它并且曾经遇到过一些 Java与内存相关的错误经常发生。不过对于其他与 NLP 相关的任务来说还是不错的。)

    关于你的最后一个问题,如果你使用的是 R - 这是代码:

     t<- "This tea is great" # the input text
    
    annotatedStr <- annotateString(t) #annotator
    
    sentiment <- getSentiment(annotation) #call to get your sentiment score
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2014-12-21
      • 2015-03-16
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-07-06
      • 1970-01-01
      相关资源
      最近更新 更多