【问题标题】:Could I use BERT to Cluster phrases with pre-trained model我可以使用 BERT 对带有预训练模型的短语进行聚类吗
【发布时间】:2019-12-19 21:37:22
【问题描述】:

我发现我使用 Gensim 和 GoogleNews 预训练模型来聚类以下短语是一个失败:

  • 针织
  • 针织机
  • 织机针织
  • 织布机
  • 彩虹织机
  • 家居装饰品
  • 织机/针织织机
  • ...

我被告知GoogleNews model does't have the phrases in it。我的短语有点特定于 GoogleNews 模型,而我没有语料库来训练新模型。我只有短语。现在我正在考虑转向 BERT。但是 BERT 可以像我预期的那样做吗?谢谢。

【问题讨论】:

  • 嗨,欢迎来到 SO!为了让人们帮助您,如果您能提供更多细节,那就太好了。你想达到什么目的?你知道你想要聚集的短语吗?为什么你没有语料库 - 即短语来自哪里?拥有集群后,您想如何处理它们?代码示例(输入、输出、预期输出)也非常有用。 BERT 非常先进和强大,可能被证明是矫枉过正。 (另外,如果您的其他问题已被@gojomo 回答,请不要忘记接受答案)

标签: tensorflow nlp pytorch gensim word2vec


【解决方案1】:

您可以将短语输入预训练的 BERT 模型并获得嵌入,即固定维度向量。所以 BERT 可以将你的短语嵌入到空间中。然后,您可以使用聚类算法(例如 k-means)对短语进行聚类。这些短语不需要出现在 BERT 的训练语料库中,只要它们组成的单词在词汇表中即可。您将不得不尝试查看嵌入是否为您提供相关结果。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2021-05-13
    • 1970-01-01
    • 2021-10-02
    • 2020-05-06
    • 2019-11-10
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多