【发布时间】:2014-09-08 16:49:41
【问题描述】:
我正在尝试使用斯坦福的 CoreNLP 库从 Twitter 中获取情绪,例如 https://www.openshift.com/blogs/day-20-stanford-corenlp-performing-sentiment-analysis-of-twitter-using-java - 请参阅此处了解我正在实施的代码。
我得到了结果,但我注意到在我的目标数据集和我使用的另一个数据集(Sanders Analytics Twitter Sentiment Corpus http://www.sananalytics.com/lab/twitter-sentiment/)中似乎存在对“负面”结果的偏见即使地面实况数据没有这种偏差。
我发布这个问题是因为其他人遇到过这种情况和/或可能知道这是我所做的事情或 CoreNLP 代码中的一些错误的结果。
(编辑 - 抱歉,我花了这么长时间才回复) 我正在发布指向图表的链接,以显示我的意思。我没有足够的声誉来发布图片,并且只能在这篇文章中包含两个链接,所以我将在 cmets 中添加链接。
【问题讨论】:
-
你能证明有多少偏差吗?例如。你能展示一下你得到的结果,以及你期望得到的结果吗?
-
这是来自 Sanders 语料库的基本事实情绪的histogram。请注意,大多数推文都有中性情绪。我从其他工具获得了类似的分布:AlchemyAPI、LIWC 和 Wilson。但我得到的分布与Stanford CoreNLP 不同 - 负面情绪更多。
标签: java twitter nlp stanford-nlp sentiment-analysis