【问题标题】:best practice to start a sentiment analysis project?开始情绪分析项目的最佳实践?
【发布时间】:2020-03-19 06:35:31
【问题描述】:

在我对 AI 和情感分析进行了大量研究后,我发现了两种进行文本分析的方法。

文本的预处理完成后,我们必须创建一个分类以获得正面和负面,所以我的问题是最好有例子:

第一种方式:

  • 要训练的 100 条文本记录,包括 2 个字段 textstatus filed表明它是正1还是负0。

第二种方式: 100 条文本记录用于训练并为 bag of word 制作词汇表,以便基于此 bag of word 训练和比较测试记录。

如果我的问题有误,请给我打电话并更正我的问题。

【问题讨论】:

  • 包包在得分方面为您提供了什么?
  • @cricket_007 我的意思是在词袋中它就像一个包含大量单词的文本文件,系统将使用它进行验证,以检查这个经过训练或测试的记录是正面还是负面

标签: python nltk sentiment-analysis


【解决方案1】:

我认为您可能会在这里遗漏一些东西,因此要训练情绪分析模型,您将拥有一个训练数据,其中每一行都有标签(正面或负面)和一个原始文本。为了让计算机能够理解或“看到”文本是通过将文本表示为数字(因为计算机无法理解文本),因此将文本表示为数字的一种方法是使用词袋(还有其他方法可以表示 TF/IDFWORD2VEC 等文本)。因此,当您使用数据训练训练模型时,程序应该预处理原始文本,然后它应该(在这种情况下)制作一个词袋映射,其中每个元素位置代表一个词汇表,如果这个词将变为 1 或更多存在于文本中,不存在则为 0。

现在假设训练结束,那么程序生成一个模型,这个模型就是你保存的,所以当你想测试一个数据时,你不需要重新训练再次编程。现在当你想测试时,是的,你会使用 train data 的词袋映射,假设测试数据集中有一个词从未出现在 train 数据集中,那么只需将其映射为0.

简而言之:

当你想测试时,你必须使用从数据训练中映射出来的词袋

【讨论】:

    猜你喜欢
    • 2011-10-27
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2010-09-13
    • 1970-01-01
    • 2012-05-22
    • 2019-05-06
    相关资源
    最近更新 更多