【发布时间】:2014-06-10 16:45:52
【问题描述】:
我有 2 个文档 doc1.txt 和 doc2.txt。这两个文件的内容是:
#doc1.txt
very good, very bad, you are great
#doc2.txt
very bad, good restaurent, nice place to visit
我想让我的语料库与, 分开,这样我的最终DocumentTermMatrix 就变成了:
terms
docs very good very bad you are great good restaurent nice place to visit
doc1 tf-idf tf-idf tf-idf 0 0
doc2 0 tf-idf 0 tf-idf tf-idf
我知道如何计算单个单词的DocumentTermMatrix(使用http://scikit-learn.org/stable/modules/feature_extraction.html),但不知道如何在Python 中计算strings 的DocumentTermMatrix。
【问题讨论】:
标签: python scikit-learn tf-idf