【发布时间】:2019-12-19 21:37:22
【问题描述】:
我发现我使用 Gensim 和 GoogleNews 预训练模型来聚类以下短语是一个失败:
- 针织
- 针织机
- 织机针织
- 织布机
- 彩虹织机
- 家居装饰品
- 织机/针织织机
- ...
我被告知GoogleNews model does't have the phrases in it。我的短语有点特定于 GoogleNews 模型,而我没有语料库来训练新模型。我只有短语。现在我正在考虑转向 BERT。但是 BERT 可以像我预期的那样做吗?谢谢。
【问题讨论】:
-
嗨,欢迎来到 SO!为了让人们帮助您,如果您能提供更多细节,那就太好了。你想达到什么目的?你知道你想要聚集的短语吗?为什么你没有语料库 - 即短语来自哪里?拥有集群后,您想如何处理它们?代码示例(输入、输出、预期输出)也非常有用。 BERT 非常先进和强大,可能被证明是矫枉过正。 (另外,如果您的其他问题已被@gojomo 回答,请不要忘记接受答案)
标签: tensorflow nlp pytorch gensim word2vec