【发布时间】:2017-09-15 09:09:17
【问题描述】:
我正在使用来自sklearn 的CountVectorizer 进行文本标记化(2-gram)并创建一个术语文档矩阵。如何将文本标记为以标点符号为边界的 2-gram?例如,输入句子是“this is example, with punctuation”。
我希望标记是“this is”、“is example”、“with punctuation”。
我不想用逗号隔开的“example with”。
以下是我当前的代码:
from sklearn.feature_extraction.text import CountVectorizer
df = pd.DataFrame({'title':['this is example, with punctuation'], 'page':[1]})
countvec = CountVectorizer(ngram_range=(2, 2), analyzer="word")
test_tdm = pd.DataFrame(countvec.fit_transform(df.title).toarray(), columns=countvec.get_feature_names())
print(test_tdm)
谢谢!
【问题讨论】:
标签: python tokenize term-document-matrix