【问题标题】:The use of N-Gram analysis in Sentiment Analysis在情绪分析中使用 N-Gram 分析
【发布时间】:2016-03-03 04:52:35
【问题描述】:

如何使用 N-Gram 分析进行情绪分析? 一旦我将一个句子分成 Uni-Grams、Bi-Grams、Tri-Grams 等。 我该如何从那里继续前进?

【问题讨论】:

    标签: text analytics sentiment-analysis n-gram


    【解决方案1】:

    情感分析通常是指机器学习,因此一种可能的方法是执行机器学习算法,其中属性是克。

    不过,您绝对可以收集一些感性的短语/单词作为快乐/悲伤的标记(取决于您使用的是 uni-gram 还是 bi-gram...),然后简单地计算句子出现标记的次数。

    【讨论】:

    • 我可以使用所有三个,unigram,bigram 和 trigram 分析。它会提高我的准确性吗?
    • 视情况而定。您可以单独使用它们并比较输出,但不建议将它们完全用作单个实例的属性,因为它可能会引发过度拟合问题...
    • 如果我只吃二克和三克?
    • 说,在n-gram中,随着n变大,系统会变得更加“保守”。因此,作为一个例子,当一个句子使用三元组被分类为“快乐”时,在大多数情况下,它也会被分类为“快乐”。所以实际上没有必要完全使用它们,但您可能希望单独使用它们来比较输出并查看假阳性和假阴性之间的权衡。
    • 谢谢。这很有帮助。
    【解决方案2】:

    使用词袋或任何其他技术对 X-Gram 进行矢量化,然后应用分类算法:MaxEnt/SVM/RandomForest。 N-Gram 通常不会改善结果,实际上使用超过 2 克甚至可能会降低您的 PR。

    【讨论】:

    • 向量化 X-gram 是什么意思?你能详细说明一下吗?
    • 您可以使用 sklearn.feature_extraction.text.CountVectorizer 生成 ngram: X = CountVectorizer(ngram_range=(1, 2),token_pattern=r'\b\w+\b').fit_transform( corpus).toarray()
    猜你喜欢
    • 2013-02-02
    • 2019-05-06
    • 1970-01-01
    • 2014-12-11
    • 1970-01-01
    • 2020-03-26
    • 1970-01-01
    • 1970-01-01
    • 2011-05-10
    相关资源
    最近更新 更多