【问题标题】:word mapping for 2D word embedding二维词嵌入的词映射
【发布时间】:2019-05-12 14:23:34
【问题描述】:

对于我的硕士论文,我创建了一个 Word2Vec 模型。我想展示这张图片来澄清结果。但是映射是如何在这个 2D 空间中显示单词的呢?

所有单词都由一个 300 暗淡的向量表示。它们是如何映射到这个 2D 图像上的?什么是 x 和 y 轴?

代码:

w2v_model.build_vocab(documents)

words = w2v_model.wv.vocab.keys()
vocab_size = len(words)
print("Vocab size", vocab_size)

w2v_model.train(documents, total_examples=len(documents), 

epochs=W2V_EPOCH)
tokenizer = Tokenizer()
tokenizer.fit_on_texts(df_train.text)

vocab_size = len(tokenizer.word_index) + 1
print("Total words", vocab_size)

x_train = pad_sequences(tokenizer.texts_to_sequences(df_train.text), maxlen=SEQUENCE_LENGTH)
x_test = pad_sequences(tokenizer.texts_to_sequences(df_test.text), maxlen=SEQUENCE_LENGTH)

labels = df_train.target.unique().tolist()
labels.append(NEUTRAL)

encoder = LabelEncoder()
encoder.fit(df_train.target.tolist())

y_train = encoder.transform(df_train.target.tolist())
y_test = encoder.transform(df_test.target.tolist())

y_train = y_train.reshape(-1,1)
y_test = y_test.reshape(-1,1)

embedding_matrix = np.zeros((vocab_size, W2V_SIZE))
for word, i in tokenizer.word_index.items():
  if word in w2v_model.wv:
    embedding_matrix[i] = w2v_model.wv[word]
print(embedding_matrix.shape)
embedding_layer = Embedding(vocab_size, W2V_SIZE, weights=[embedding_matrix], input_length=SEQUENCE_LENGTH, trainable=False)

【问题讨论】:

    标签: vector sentiment-analysis word natural-language-processing


    【解决方案1】:

    有几种方法。

    第一种是使用 PCA(主成分分析),将第一个分量绘制在 x 轴上,将第二个分量绘制在 y 轴上(并丢弃其他分量)。

    你没有说你使用哪个库来生成你的词向量,它可能带有自己的 PCA 函数。但是sklearn有一个:https://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.htmlhttps://machinelearningmastery.com/develop-word-embeddings-python-gensim/ 有一些现成的代码显示使用 gensim 制作向量,然后使用该函数绘制它们。)

    您可以尝试的另一种方法是绘制词向量的前两个维度。这是合理的,因为词向量中的所有维度都应该具有相同的权重。 IE。取 300 个维度中的任何两个维度,您可以获得与任何其他两个维度相同的信息量。

    但使用 PCA 是更正常的可视化方法。

    【讨论】:

      猜你喜欢
      • 2018-08-22
      • 1970-01-01
      • 2018-06-09
      • 2018-11-12
      • 2020-12-14
      • 2018-01-05
      • 2016-11-22
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多