【发布时间】:2021-05-15 14:37:25
【问题描述】:
我正在使用 Word2Vec 模型从我的数据中制作矢量化器。 我的数据有自定义/业务定义的同义词列表,我希望我的 NLP 模型应该考虑。 例如,如果“A”是“B”的同义词,那么如果我尝试使用 Word2Vec 找到“A”的同义词,那么它应该给出 100% 匹配的“B”。
如果我能够达到上述要求,我也可以尝试不同的 NLP 模型。
【问题讨论】:
-
我很困惑 - 是什么阻止您在向量化之前替换所有同义词或在训练后手动为同义词分配相同的词向量?
-
@CecilCox 感谢您的回复。手动操作是可能的,但数据量很大,我正在寻找一种解决方案,其中 NLP 模型可以将自定义同义词列表作为输入。关于不手动执行的任何想法?
-
我可以了解一下规模吗?您的数据和同义词列表有多大?
-
文档总数 - 200 万,每个文档平均有 800 个单词,因此总共 16 亿个单词。同义词列表大约有 21k 个单词
标签: machine-learning deep-learning nlp artificial-intelligence nltk