【发布时间】:2019-09-18 11:50:07
【问题描述】:
我有一个数据集,我需要使用其中的单位对数据进行分类,例如
UNITS PRICE
pieces 100
piece 70
peice 50
1 pc 50
pics 60
single piece 50
假设:片和片可以被认为是相同的
这里所有的单元必须指向同一个词根(piece)。我确实从 python 中的nltk 库中应用了stemming 和lemmatization,但它没有给出预期的结果。
将词干应用于一些示例,
from nltk.stem import PorterStemmer
from nltk.tokenize import word_tokenize
stemmer= PorterStemmer()
input_str=['pieces', 'piece', 'peice', '1 pc', 'pics', 'single Peice']
for word in input_str:
print(stemmer.stem(word), end=' ')
它给出的输出是,
piec piec peic 1 pc pic singl peic
有什么方法可以将看起来近似相似的单词视为相同?
我不知道我应该如何处理这个问题。谁能给点建议?
【问题讨论】:
标签: python-3.x machine-learning scikit-learn nltk