【发布时间】:2021-06-10 23:07:32
【问题描述】:
所以,我有一个任务需要测量两个文本之间的相似度。这些文本是杂货店产品的简短描述。它们总是包含产品的名称(例如牛奶),并且可能包含生产商和/或尺寸,还可能包含产品的其他一些特征。
我有一整套这样的文本,然后,当新的文本到来时,我需要确定我的数据库中是否有类似的产品,并衡量它们的相似程度(从 0 到 100%)。
问题是:文本可能有两种不同的语言:乌克兰语和俄语。另外,如果有外国品牌(如Coca Cola),也会用英文写。
我解决此任务的最初想法是获取多语言词嵌入(不同语言的相似词位于附近)并找到这些文本之间的距离。但是,我不确定这会有多有效,如果可以,从什么开始。
因为我拥有的每个文本只是一组产品特征,一些基于上下文的词嵌入可能不起作用(我不确定这个陈述,这只是我的假设)。
到目前为止,我一直在尝试熟悉MUSE 框架,但我遇到了issue 和faiss 安装。
因此,我的问题是:
- 我的词嵌入想法值得一试吗?
- 有没有更好的方法?
- 如果词嵌入的想法没问题,我应该使用哪些?
注意:我有 Windows 10(以防某些库无法在 Windows 上运行),我需要该库支持乌克兰语和俄语。
提前感谢您的帮助!任何建议将不胜感激!
【问题讨论】:
标签: python nlp multilingual similarity word-embedding