【问题标题】:Should I train embeddings using data from both training,validating and testing corpus?我应该使用来自训练、验证和测试语料库的数据来训练嵌入吗?
【发布时间】:2019-12-26 10:04:25
【问题描述】:

我没有为我的域嵌入任何预先训练好的词(越南食品评论)。所以我从通用语料库和特定语料库中获得了嵌入的想法。

这里的重点是我可以使用训练、测试和验证(进行预处理)的数据集作为创建自己的词嵌入的来源。如果没有,希望你能提供你的经验。

根据我的直觉和一些实验,广泛的语料库似乎更好,但我想知道是否有相关研究或其他相关结果。

【问题讨论】:

    标签: nlp word-embedding


    【解决方案1】:

    我可以使用训练、测试和验证的数据集吗? preprocess) 作为创建我自己的词嵌入的来源

    当然,嵌入不是您的机器学习模型的功能。它们是您数据的“计算表示”。简而言之,它们由向量空间中表示的单词组成。使用嵌入,您的数据不那么稀疏。使用词嵌入可以被视为NLP 预处理步骤的一部分。

    通常(我的意思是,使用最常用的技术 word2vec),向量空间中单词的表示是由其周围环境(通常伴随的单词)定义的。

    因此,要创建嵌入,语料库越大越好,因为它可以更好地将词向量放置在向量空间中(从而将其与其他相似词进行比较)。

    【讨论】:

    • 我真的很喜欢你的解释。但是,我对模型准确性的'正确'感到很困惑(使用这种方法我们可以以某种方式解决OOV问题)。
    • 对不起,我不明白你所说的“我很困惑模型准确性的'正确'”
    • 我的意思是如果我在数据集上训练模型(用于创建词嵌入),在这种情况下它会提高模型的准确性(所以我们不能准确地评估我们的模型如果它处于磨损状态)
    • 您必须将数据集分开。您只会加入它来进行嵌入训练。所以你有机器学习的训练和测试集和嵌入集=训练+测试集。否则你可能会以过度拟合告终。
    猜你喜欢
    • 2021-10-03
    • 1970-01-01
    • 1970-01-01
    • 2012-06-04
    • 2017-08-31
    • 2019-05-01
    • 2020-09-14
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多