【发布时间】:2017-09-16 10:20:03
【问题描述】:
我有大约 100,000 个形式的字符串列表:['the: 652', 'of: 216', 'in: 168', 'to: 159', 'is: 145'] 等。
这基本上构成了我的语料库。每个列表都包含文档中的单词及其字数。
我怎样才能把这个语料库变成我可以输入到 CountVectorizer 的形式?
有没有比将每个列表转换为包含 'the' 652 次、'of' 216 次等的字符串更快的方法?
【问题讨论】:
标签: python python-2.7 nlp nltk countvectorizer