【发布时间】:2020-05-22 13:22:15
【问题描述】:
我们正在处理大量文档列表(类似于产品说明),并希望确定它们是否涉及给定主题(例如赌博)。我们目前的方法是手动定义一组关键字,然后使用 Spacy 的短语匹配器来查找任何匹配项。我们使用所有预训练的属性,例如 lower 和 lemma。然而,该过程不是很有效。还有其他可用的库吗?还是根本不同的方法?
由于我们没有自己训练模型的数据,我们正在寻找预训练模型。
包括使用 NLTK 的词干分析器(Lancaster 和 Snowball)的其他方法。
另一个要求是语言(文本为英语、德语、意大利语和法语)。
【问题讨论】:
标签: python nlp nltk spacy lemmatization