【发布时间】:2022-06-26 08:42:07
【问题描述】:
我刚刚开始了一个 NLP 项目。假设我对每个单词都有一个图表,该图表显示了该单词在不同句子中的情绪极性分布。我想知道我可以用什么来识别新词的感受?您想到的任何其他用途我都会很乐意分享。 对于我的写作中可能出现的任何错误,我深表歉意。非常感谢
【问题讨论】:
-
“每个单词的图表显示不同句子中该单词的情绪极性分布”是什么意思? (您能否通过数据/插图指出某个想法更加充实的地方?)另外,如果您有一些特定的理论,即已知单词的此类信息可能有助于未知单词 - 也许通过接收混合了以下内容的新文本已知和未知,& 将未知词归结为与它们经常出现在附近的已知词相似? – 真正的考验是用你的数据和目标尝试这种方法。没有比尝试更好的先验假设/分析了。
-
@gojomo 我的意思是为这个词构建一个分布函数。例如,对于单词 sell,我创建了一个分布函数,其点是包含单词 sell 的句子的极性。
-
@gojomo 我并不是要使用 word2vec 和类似的情况来查找新单词与之前单词的相似度。我想我也许可以从它的分布函数中提取有用的信息。
-
什么是“包含sell这个词的句子的极性”?一些人对句子的正面/负面情绪的手工标记?如果您没有考虑使用 word2vec,那么用
word2vec标记这个问题是什么意思?如果您以某种方式推断出“销售”可能是(非常轻微的)负面情绪,因为您有一堆带有'sell'的标记句子,那么相同的技术不会对未知单词起作用吗?目前还不清楚你在问什么。 -
@gojomo 确实写不好我的意思。一些人对句子的正面/负面情绪的手工标记?是的。值介于 -1 到 +1 之间。例如,单词情绪的分布是正常的。这如何帮助我识别新词的感受? (假设我以另一种方式找到了相似的词,现在我想从正态分布中得出结论)