【问题标题】:Visualize the cosine similarity scores calculated using pretrained word embeddding in SpaCy可视化在 SpaCy 中使用预训练词嵌入计算的余弦相似度分数
【发布时间】:2019-10-17 18:34:21
【问题描述】:

我使用 SpaCy 的预训练模型“en_core_web_lg”来查找一组值和属性之间的余弦距离。我想可视化一个词与另一个词的接近程度,非常类似于聚类。

Here is the link to the table which contains similarity scores for each value vs attribute

这里的列是我试图找到相似度分数的属性,而行是我试图找到最有可能被分类的属性的值

This is the output i am trying to achieve. Please take a look at it

【问题讨论】:

标签: python-3.x nlp spacy word-embedding


【解决方案1】:

如果你想要一个类似这样的情节: 您需要将词向量的维度减少到二维。

因此,您必须对所需的词向量应用降维算法,例如t-SNE(这也在 scikit-learn 中实现)。

相似度分数不足以做到这一点; 你需要整个向量。

Here,有一个关于 t-SNE 可视化词向量的不错的 Kaggle 教程。您可以自定义它,只选择您感兴趣的单词。

【讨论】:

  • 非常感谢您的回答!!我也尝试过 PCA,但我不知道为什么,但使用 PCA 降低维度比应用 t-SNE 降维效果更好。你知道为什么会这样吗??
  • 您可以阅读:stats.stackexchange.com/questions/238538/… 如果我的回答有用,请将其标记为已接受或评分。
猜你喜欢
  • 1970-01-01
  • 2015-05-24
  • 2017-03-19
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2021-05-19
  • 2011-05-21
相关资源
最近更新 更多