【问题标题】:Categorizing data using text processing使用文本处理对数据进行分类
【发布时间】:2019-09-18 11:50:07
【问题描述】:

我有一个数据集,我需要使用其中的单位对数据进行分类,例如

UNITS        PRICE
pieces       100
piece        70
peice        50
1 pc         50
pics         60
single piece 50

假设:片和片可以被认为是相同的

这里所有的单元必须指向同一个词根(piece)。我确实从 python 中的nltk 库中应用了stemminglemmatization,但它没有给出预期的结果。

将词干应用于一些示例,

from nltk.stem import PorterStemmer
from nltk.tokenize import word_tokenize
stemmer= PorterStemmer()
input_str=['pieces', 'piece', 'peice', '1 pc', 'pics', 'single Peice']
for word in input_str:
    print(stemmer.stem(word), end=' ')

它给出的输出是,

piec piec peic 1 pc pic singl peic 

有什么方法可以将看起来近似相似的单词视为相同?

我不知道我应该如何处理这个问题。谁能给点建议?

【问题讨论】:

    标签: python-3.x machine-learning scikit-learn nltk


    【解决方案1】:

    正如您提到的那样,词干或词形还原并不能纠正拼写。

    自动更正拼写的选项很少,但请注意,在某些情况下这些选项可能会失败。如果您需要防傻瓜校正,可能需要手动干预。

    1. pySpellChecker
    2. autocorrect

    有时,您可能需要更正错位的空格,在这种情况下您可以使用word segment

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-08-20
      • 2017-05-17
      • 1970-01-01
      • 2018-10-02
      • 2019-01-06
      • 1970-01-01
      • 1970-01-01
      • 2015-03-16
      相关资源
      最近更新 更多