【发布时间】:2017-01-30 16:51:16
【问题描述】:
使用 NLTK,我创建了一个包含大约 10 万个句子的分类语料库,分为 36 个类别。
我可以像这样访问特定类别的句子:
romantic_comedies_sents = (my_corpus.sents(categories='romantic_comedies'))
但是,给定一个标记化 list 形式的句子,例如 ["You", "had", "me", "at", "hello"],我想有效地识别它出现的类别。有没有快速的方法?
我尝试创建和使用以句子为键、类别为值的字典,但在我的计算机上创建此字典需要很长时间(尤其是与 NLTK 的内置方法相比),我想知道是否有更好的这样做的方式,最好使用 NLTK。
最终我试图为每个句子都采用这种结构:
(["You", "had", "me", "at", "hello"], set("romantic_comedies"))
提前感谢您的帮助。
【问题讨论】: