【发布时间】:2018-03-18 00:16:10
【问题描述】:
我混淆了 CountVectorizer 和 CharNGramAnalyzer。据我了解,
- CountVectorizer 构建一个计数矩阵,其中的行是考虑到高维稀疏性的不同单词的出现计数。
- CharNGramAnalyzer 构建一个计数矩阵,其中行是不同字符的出现计数。由于它不考虑单词,因此它不需要知道单词之间的分隔,并且适用于英语以外的语言。
我的理解是否正确?如果没有,我想要一个详细的解释或任何解释它的来源。
【问题讨论】:
标签: python machine-learning scikit-learn text-classification