【问题标题】:Enhancements for text classification using word vectors使用词向量增强文本分类
【发布时间】:2017-02-26 17:34:06
【问题描述】:

我正在使用词向量进行文本分类解决方案。我主要使用词向量来解决训练集中不存在但会出现在实际用例中的同义词的情况。通过简单地使用词向量,我无法获得足够好的预测准确性。谁能建议我可以对词向量进行一些改进以提高准确性?

【问题讨论】:

  • 欢迎来到 StackOverflow。请阅读并遵循帮助文档中的发布指南。 on topichow to ask 在这里申请。我们可以处理特定的请求,但不能处理模糊的描述。展示您的设计和使用情况;展示您获得的准确性、您的期望,以及您为什么认为您的方法可以实现这种准确性。

标签: machine-learning scikit-learn text-classification gensim word2vec


【解决方案1】:
  • 调试您的错误预测案例。高质量的同义词嵌入(训练数据集中的同义词)有帮助吗?

  • 使用使用更大词汇量训练的不同嵌入,与您的应用程序具有相似的内容等。

  • 获取更多训练数据(标记数据集)。这应该有很大帮助。文本分类通常具有非常大的特征空间。

  • 在训练文本分类器时允许嵌入层“可训练”。不要与 word2vec 训练混淆,它是为您的嵌入层获取预学习嵌入,它可能会使用大量未标记的数据。在这里,您使用的是一个相对较小的数据集,仅包含标记数据。允许嵌入层是“可训练的”意味着梯度可以从输出层反向传播到嵌入层以微调嵌入向量。

【讨论】:

    猜你喜欢
    • 2018-10-17
    • 2019-07-14
    • 2021-02-20
    • 2018-05-21
    • 2018-02-09
    • 2019-08-01
    • 2020-07-10
    • 2019-06-23
    • 2016-11-17
    相关资源
    最近更新 更多