【问题标题】:Pre-processing before running sentiment analysis运行情绪分析前的预处理
【发布时间】:2015-09-12 22:35:05
【问题描述】:

情绪分析帮助我们衡量推文的情绪,但是我们从 api 获得的许多推文可能真的无法“分类”为某些情绪。

有谁知道任何关于在对推文运行任何类型的分类器之前对推文进行预处理的 API/文献(例如,删除 #、删除 @name 等)。

另外,如果我想确定在推文上运行情绪分析(比如电影评论)是否有意义,我可以查找哪些主题/api/文献,然后再开始对其运行情绪分析器?

【问题讨论】:

    标签: twitter sentiment-analysis


    【解决方案1】:

    也许你应该阅读:

    (然后在 Python 中,tweet = re.sub(old_pattern, new_pattern, tweet) 用于执行每个修改。)

    【讨论】:

    • @N.M.抱歉,第一个链接指向了错误的论文。我刚刚更正了它,但访问不是免费的。
    【解决方案2】:

    我正在使用 TextBlob 库对我的数据集进行分类。

    TextBlob 是一个用于处理文本数据的 Python(2 和 3)库。它提供了一个简单的 API,用于深入研究常见的自然语言处理 (NLP) 任务,例如词性标注、名词短语提取、情感分析、分类、翻译等。

    特征: -noun短语提取 -Part-致辞标记 - 心灵分析 - 分类(天真贝叶斯,决策树) - 由谷歌翻译提供支持的语言翻译和检测 - 标记化(将文本拆分为单词和句子) -word和短语频率 - 重售 -n-grams. -单词变形(复数和单数化)和词形还原 - 强制修正 - 通过扩展添加新模型或语言 -wordnet集成

    现在得到它:

    $ pip安装-u textblob

    $ python -m textblob.download_corpora

    参考:https://textblob.readthedocs.org/en/dev/

    ***我不能告诉你结果,因为这是我论文的一部分,我仍在努力。

    【讨论】:

      【解决方案3】:

      其实你最好自己做脏活。正则表达式很容易删除 #、@ 或 url。标点符号和表情符号对于情绪分析非常重要。我推荐使用由 CMU NLP 组(http://www.cs.cmu.edu/~ark/TweetNLP/)训练的语音标签来表达这些字符。

      对于词袋和 tf-idf 分数等基本功能,我想使用 Scikit-learn(http://scikit-learn.org/stable/)。 对于单字情感,可以使用斯坦福 Nlp 情感分析。(http://nlp.stanford.edu/sentiment/)

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2013-02-02
        • 2014-12-11
        • 1970-01-01
        • 2021-09-03
        • 2017-11-06
        • 2015-09-23
        • 2012-05-01
        相关资源
        最近更新 更多