【发布时间】:2018-01-21 09:28:55
【问题描述】:
我正在尝试使用名称相似性对大量公司(40M+)进行重复数据删除。我有 500K 的公司名称对标记为相同/不同(例如 I.B.M.=International Business Machines)。通过对名称对向量差异的逻辑回归建立的模型具有很高的 f 值 (0.98),但推理(找到最相似的名称)太慢(每个名称几乎 2 秒)。
是否可以使用名称相似度对(正负)来训练 doc2vec 模型,从而使相似的名称具有相似的向量,以便我可以使用像 Annoy 这样的快速向量相似度算法?
【问题讨论】:
标签: word2vec doc2vec sentence-similarity