【发布时间】:2017-05-08 01:45:48
【问题描述】:
我有一个关于使用词袋或类似方法进行分类的一般性问题。
我有要分类的文本。我知道这些类,并且我知道文本的每个句子都属于一种类型的句子。例如句子 1 应该是命令,句子 2 应该是新闻,等等
所以我的想法是使用 n-gram 生成进行特征提取,我的想法是 n-gram 的单词可以帮助机器找到正确的类别。但是使用 Python 实现这个想法并不容易me.I 无法将概念与实施联系起来。例如,我不确定是否必须提供可能属于每个类别的所有可能的 POS 标签块,或者机器可以找到它们。此外,我觉得 n-gram 在这种分析中可能会有所帮助。但我不不知道怎么做。
如果能给我一些想法或告诉我应该采取哪些步骤来进行这种分类,那就太好了。
最好的
【问题讨论】:
-
查看 NLTK 库。一般来说,在自己尝试之前总是搜索库。
-
如果文本有某种结构(即标点符号、空格、制表符),那么使用它来解析文本比任何文本挖掘/NLP 方法要好得多,这很可能最好给出一个近似的答案。
-
@JohnD 文本基本上是一个包含多个句子的段落。所以没有制表符或空格。只有句点标记了句子。但这怎么可能呢?
-
scikit-learn 有很多很棒的机器学习算法,它们真的很容易使用,可能是另一个值得一试的东西。
标签: python machine-learning nlp text-classification