【发布时间】:2011-06-08 05:28:31
【问题描述】:
我正在寻找某种模块(最好是用于 python),它可以让我为该模块提供一个大约 200 个字符长的字符串。然后,模块应该返回该字符串有多少肯定或否定词。 (例如,爱、喜欢、喜欢与讨厌、不喜欢、不好)
我真的很想避免在自然语言处理中重新发明轮子,所以如果你们知道什么能让我做我上面描述的事情,如果你可以分享。
感谢您的帮助!
【问题讨论】:
标签: nlp
我正在寻找某种模块(最好是用于 python),它可以让我为该模块提供一个大约 200 个字符长的字符串。然后,模块应该返回该字符串有多少肯定或否定词。 (例如,爱、喜欢、喜欢与讨厌、不喜欢、不好)
我真的很想避免在自然语言处理中重新发明轮子,所以如果你们知道什么能让我做我上面描述的事情,如果你可以分享。
感谢您的帮助!
【问题讨论】:
标签: nlp
【讨论】:
在分析文本片段之前,您需要对给定的文本进行分条标点、修复语言、拆分空格、降低整个文本并将单词存储在可迭代数据结构中的预处理。
对于一些基本的情绪分析,可以使用以下技术:
在词袋技术中,我们基本上通过一个词袋(文件)并检查我们制作的迭代是否包含这些。如果确实如此,那么我们为每个单词的存在分配一些值,以衡量文本的总体情绪。 这个链接应该可以帮助你更多地了解这个 https://en.wikipedia.org/wiki/Bag-of-words_model
通过标记元素然后删除不需要的数据,可以从输入文本中提取关键字和重要信息。 例如: 我的名字是约翰。 在这里,约翰,名字是信息,实际上并不需要“是”。 类似地,可以删除动词和其他不重要的东西,以便只保留主要信息。 Chunking 和 Chinking 有帮助。 这个链接一定有帮助。 http://nltk.org/book/ch07.html
【讨论】:
您可以使用现有的情绪分析工具对文本进行标记并获取情绪。我所知道的最全面的情绪分析工具是SentiBench。这基本上是对所有情绪分析工具的调查研究。以及如何使用代码的代码和示例。
【讨论】: