【发布时间】:2019-04-13 14:39:49
【问题描述】:
以下是我的数据集的子集。我正在尝试使用 nltk 包中提供的 Porter stemmer 清理我的数据集。我想删除它们的词干中相似的列,例如“abandon”、“abondoned”、“abondening”应该只是在我的数据集中被放弃了。下面是我正在尝试的代码,我可以在其中看到词/列被阻止. 但是我不确定如何删除这些列?我已经从语料库中标记并删除了标点符号。
注意:我是 Python 和 Textmining 的新手。
数据集子集
{
'aaaahhhs':{
0:0,
1:0,
2:0,
3:0,
4:0,
5:0
},
'aahs':{
0:0,
1:0,
2:0,
3:0,
4:0,
5:0
},
'aamir':{
0:0,
1:0,
2:0,
3:0,
4:0,
5:0
},
'aardman':{
0:0,
1:0,
2:0,
3:0,
4:0,
5:0
},
'aaron':{
0:0,
1:0,
2:0,
3:0,
4:0,
5:0
},
'abandon':{
0:0,
1:0,
2:0,
3:0,
4:0,
5:0
},
'abandoned':{
0:0,
1:0,
2:0,
3:0,
4:0,
5:0
},
'abandoning':{
0:0,
1:0,
2:0,
3:0,
4:0,
5:0
},
'abandonment':{
0:0,
1:0,
2:0,
3:0,
4:0,
5:0
},
'abandons':{
0:0,
1:0,
2:0,
3:0,
4:0,
5:0
}
}
到目前为止的代码..
from nltk.stem import PorterStemmer
from nltk.tokenize import word_tokenize
ps = PorterStemmer()
for w in clean_df.columns:
print(ps.stem(w))
【问题讨论】:
标签: python pandas text-mining stemming porter-stemmer