【发布时间】:2020-12-27 00:15:24
【问题描述】:
我正在尝试对数百个文本文档进行聚类,以便每个聚类代表一个不同的主题。我不想使用主题建模(我知道我也可以这样做),而是采用两步方法:
- 使用 Sentence-BERT 创建文档嵌入(使用 SentenceTransformer)
- 将嵌入输入到集群算法中
我知道我可以,例如第 2 步使用 k-means,但我更喜欢软聚类算法,因为我的文档有时属于多个主题。所以我想得到每个响应属于每个集群的概率。 我的嵌入有 768 维,在实现软聚类算法(高斯混合模型)时,我意识到高维会导致问题。所以我在考虑使用降维技术(例如 PCA)并将因子输入到聚类算法中。
但是,我对这种高维空间中的降维不是很熟悉,尤其是在 NLP 的上下文中。任何人都可以在这里提供一个好的方法/方法的建议吗?
谢谢!
【问题讨论】:
标签: nlp cluster-analysis bert-language-model dimensionality-reduction