【发布时间】:2019-12-26 10:04:25
【问题描述】:
我没有为我的域嵌入任何预先训练好的词(越南食品评论)。所以我从通用语料库和特定语料库中获得了嵌入的想法。
这里的重点是我可以使用训练、测试和验证(进行预处理)的数据集作为创建自己的词嵌入的来源。如果没有,希望你能提供你的经验。
根据我的直觉和一些实验,广泛的语料库似乎更好,但我想知道是否有相关研究或其他相关结果。
【问题讨论】:
标签: nlp word-embedding
我没有为我的域嵌入任何预先训练好的词(越南食品评论)。所以我从通用语料库和特定语料库中获得了嵌入的想法。
这里的重点是我可以使用训练、测试和验证(进行预处理)的数据集作为创建自己的词嵌入的来源。如果没有,希望你能提供你的经验。
根据我的直觉和一些实验,广泛的语料库似乎更好,但我想知道是否有相关研究或其他相关结果。
【问题讨论】:
标签: nlp word-embedding
我可以使用训练、测试和验证的数据集吗? preprocess) 作为创建我自己的词嵌入的来源
当然,嵌入不是您的机器学习模型的功能。它们是您数据的“计算表示”。简而言之,它们由向量空间中表示的单词组成。使用嵌入,您的数据不那么稀疏。使用词嵌入可以被视为NLP 预处理步骤的一部分。
通常(我的意思是,使用最常用的技术 word2vec),向量空间中单词的表示是由其周围环境(通常伴随的单词)定义的。
因此,要创建嵌入,语料库越大越好,因为它可以更好地将词向量放置在向量空间中(从而将其与其他相似词进行比较)。
【讨论】: