【问题标题】:BERT embeddings for entire sentences vs. verbs整个句子与动词的 BERT 嵌入
【发布时间】:2021-02-20 17:46:14
【问题描述】:

首先,我假设句子的大部分语义是由连接所述动词的主语和宾语的动词介导的。我知道我在这里简化了一点,因为可以有多个动词等。但从中抽象出来,我很好奇它是否适用于 BERT 为整个句子生成的嵌入向量,比如 “两半构成一个整体” 会明显更类似于单数的嵌入向量像 "make" 这样的动词与说动词 "eat" 的向量相比。

【问题讨论】:

    标签: nlp word-embedding bert-language-model


    【解决方案1】:

    要回答您的“问题”,如果我是您,我会尝试进行实际测试。有关将 bert 用于句子嵌入的简单方法,请查看repo:它使用起来非常简单。

    获得嵌入向量后,您可以使用任何similarity function 来验证您的假设。

    但是,就我的(有限)经验而言,我认为“make”的向量比“eat”的向量更相似,这也只是因为“make”出现在另一个句子中,因此有助于嵌入句子。

    【讨论】:

    • 感谢您的建议,在写完这个问题之后,我已经完全按照您的建议做了,而且似乎我的假设不正确,或者我使用的度量(欧几里得距离)不正确。因此,将我在问题中指出的句子与不同的动词进行比较确实会产生误差范围内的结果。
    • 太棒了!我直观地会使用两个嵌入向量之间的 cosene 相似性(一个动词然后与另一个动词的句子。最后比较两个结果)
    • 余弦相似度也不表示句子与其中包含的动词比与完全不相关的词更相似。我已经计算了 Bert 编码器的两个 [CLS] 输出的欧几里得距离和余弦相似度,据我了解,这应该在一定程度上捕捉整个句子的含义,以及每个标记的其余输出的平均值,大部分只是检查,再次与统计上微不足道的差异。
    猜你喜欢
    • 2020-01-29
    • 1970-01-01
    • 1970-01-01
    • 2021-11-29
    • 1970-01-01
    • 2020-04-07
    • 2021-01-16
    • 2020-12-07
    • 2021-05-31
    相关资源
    最近更新 更多