【问题标题】:Text classification using Word2Vec使用 Word2Vec 进行文本分类
【发布时间】:2020-10-08 22:38:39
【问题描述】:

我很难理解 Word2Vec。我需要根据用户在帮助台系统中的抱怨进行帮助台文本分类。每个句子都有自己的类。

我在互联网上看到了一些预先训练好的 word2vec 文件,但我不知道这是否是最好的工作方式,因为我的问题非常具体。我的数据集是葡萄牙语的。

我正在考虑我将不得不创建自己的模型,但我不知道如何做到这一点。我必须使用与我的句子和类的数据集相同的词吗?

在第一行,列标题。在第一行下面,我有句子和类。有人可以帮我吗?我看到 Gensin 创建矢量模型,听起来不错。但我完全迷失了。

: chamado,classe 'Prezados não estou conseguindo gerar uma nota finance do módulo de estoque e custos.','ERP GESTÃO', 'Não consigo acessar o ERP com meu usuário e senha.','ERP GESTÃO','Médico não consegue gerar receituário no módulo de Medicina e segurança do trabalho.','ERP GESTÃO', 'O produto 4589658 tinta holográfica não está disponível no EIC e não consigo gerar a PO.','ERP GESTÃO',

【问题讨论】:

    标签: python word2vec


    【解决方案1】:

    您的询问非常笼统,通常 StackOverflow 会在您尝试特定事情并遇到特定问题时提供更多帮助 - 这样您就可以提供准确的代码、错误或不足之处进行询问。

    但总的来说:

    • 您可能根本不需要 word2vec:有许多文本分类方法,只要有足够的训练数据,就可以在不使用词向量的情况下将您的文本分配到有用的类中。您可能想先尝试这些,然后考虑词向量作为以后的改进。

    • 要使词向量有用,它们需要基于您的实际语言,并且最好基于您的特定关注领域。来自新闻文章甚至 Wikipedia 的通用词向量可能不包括重要的术语和问题的词义。但是训练你自己的词向量并不难——你只需要大量不同的、相关的文本,这些文本在现实、相关的上下文中使用这些词。所以是的,理想情况下,你会在最终想要分类的相同文本上训练你的词向量。

    但大多数情况下,如果您“完全迷失”,请从更简单的文本分类示例开始。当您使用 Python 时,基于 scikit-learn 的示例可能最相关。使这些适应您的数据和目标,以熟悉所有步骤和评估您的更改是否改善最终结果的方法。然后研究诸如词向量之类的技术。

    【讨论】:

    • 帮了我很多。谢谢。由于我不确定是使用预训练的 wordvec 文件还是构建自己的文件(即使我有怀疑),所以我没有开始这样做。所以现在我将开始使用 w2v 实现 somehting 并且会有更具体的疑问,关于实现。其实我已经实现了其他方法,你是对的,效果很好。
    猜你喜欢
    • 2023-03-21
    • 2018-09-13
    • 2019-01-06
    • 2017-07-21
    • 2020-05-16
    • 1970-01-01
    • 2015-09-03
    • 2018-05-19
    • 2019-01-06
    相关资源
    最近更新 更多