【发布时间】:2016-06-22 09:42:56
【问题描述】:
我有一个文本分类问题,我有两种类型的特征:
- n-gram 特征(由 CountVectorizer 提取)
- 其他文本特征(例如,存在来自给定词典的单词)。这些特征与 n-gram 不同,因为它们应该是从文本中提取的任何 n-gram 的一部分。
这两种类型的特征都是从文本的标记中提取的。我只想运行一次标记化,然后将这些标记传递给 CountVectorizer 和其他存在特征提取器。所以,我想将一个标记列表传递给 CountVectorizer,但它只接受一个字符串作为某个样本的表示形式。有没有办法传递一个令牌数组?
【问题讨论】:
标签: scikit-learn tokenize