【问题标题】:Use the polarity distribution of word to detect the sentiment of new words利用词的极性分布检测新词的情感
【发布时间】:2022-06-26 08:42:07
【问题描述】:

我刚刚开始了一个 NLP 项目。假设我对每个单词都有一个图表,该图表显示了该单词在不同句子中的情绪极性分布。我想知道我可以用什么来识别新词的感受?您想到的任何其他用途我都会很乐意分享。 对于我的写作中可能出现的任何错误,我深表歉意。非常感谢

【问题讨论】:

  • “每个单词的图表显示不同句子中该单词的情绪极性分布”是什么意思? (您能否通过数据/插图指出某个想法更加充实的地方?)另外,如果您有一些特定的理论,即已知单词的此类信息可能有助于未知单词 - 也许通过接收混合了以下内容的新文本已知和未知,& 将未知词归结为与它们经常出现在附近的已知词相似? – 真正的考验是用你的数据和目标尝试这种方法。没有比尝试更好的先验假设/分析了。
  • @gojomo 我的意思是为这个词构建一个分布函数。例如,对于单词 sell,我创建了一个分布函数,其点是包含单词 sell 的句子的极性。
  • @gojomo 我并不是要使用 word2vec 和类似的情况来查找新单词与之前单词的相似度。我想我也许可以从它的分布函数中提取有用的信息。
  • 什么是“包含sell这个词的句子的极性”?一些人对句子的正面/负面情绪的手工标记?如果您没有考虑使用 word2vec,那么用word2vec 标记这个问题是什么意思?如果您以某种方式推断出“销售”可能是(非常轻微的)负面情绪,因为您有一堆带有'sell' 的标记句子,那么相同的技术不会对未知单词起作用吗?目前还不清楚你在问什么。
  • @gojomo 确实写不好我的意思。一些人对句子的正面/负面情绪的手工标记?是的。值介于 -1 到 +1 之间。例如,单词情绪的分布是正常的。这如何帮助我识别新词的感受? (假设我以另一种方式找到了相似的词,现在我想从正态分布中得出结论)

标签: nlp sentiment-analysis


【解决方案1】:

假设您有一些被手工标记为正面/负面情绪的单词,但随后您遇到了一些未标记的新单词:

  • 如果您在上下文之外完全独自遇到新词,那么您无能为力。 (也许,您可以尝试查找包含这些新词的额外文本,例如 vis 词典或网络,然后在下一个方法中使用这些较大的文本。)

  • 如果您在文本中遇到包含您的一些手工标记的单词的新单词,您可以尝试猜测这些新单词最像您已经知道的最接近的单词,或在相同的地方使用。这将利用所谓的“分布假设”——具有相似分布的词具有相似的含义——这是许多计算机自然语言分析的基础,包括 word2vec。

按照这些思路尝试一个简单的事情:在所有文本中,对于每个未知单词 U,计算 N 个位置内所有相邻单词的计数。 (N 可以是 1 或更大。)从中选择最常出现在未知词附近的前 5 个词,并查找您之前的标签,然后将它们平均在一起(可能按出现次数加权。)

然后你会有一个新词的编号。

或者,您可以为所有文本训练 word2vec 词向量集,包括未知和已知词。然后,向该模型询问与您的未知单词最相似的 N 个邻居。 (同样,N 可以小也可以大。)然后,从那些具有已知标签的邻居中,将它们平均在一起(同样可能通过相似度加权),以获得先前未知单词的数字。

我并不特别期望这些技术中的任何一种都能很好地工作。考虑到在实际语言中,它们的含义会被周围的语法/上下文严重修改甚至颠倒,单个单词可以具有特定情感的想法有些弱。但在每种情况下,这些简单的邻居计算技术可能都比随机猜测要好。

如果您的真正目标是计算较长文本的整体情绪,例如句子、段落、评论等,那么您应该丢弃单个单词的标签,为全文获取/创建标签,并应用真正的文本分类那些较大的文本的技术。与其他技术相比,简单的逐词方法不会做得很好——只要这些技术有大量标记的训练数据。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2019-02-03
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-09-18
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多