【发布时间】:2016-07-27 22:21:28
【问题描述】:
我使用 scikit learn 进行分类。主要与朴素贝叶斯、SVM、神经网络一起工作。它们中的每一个都有变体。
我看到训练算法创建向量。这个向量包含什么?
对于所有算法,它是否将词频视为一个特征?如果是,那么它们有何不同?
【问题讨论】:
标签: machine-learning scikit-learn neural-network classification svm
我使用 scikit learn 进行分类。主要与朴素贝叶斯、SVM、神经网络一起工作。它们中的每一个都有变体。
我看到训练算法创建向量。这个向量包含什么?
对于所有算法,它是否将词频视为一个特征?如果是,那么它们有何不同?
【问题讨论】:
标签: machine-learning scikit-learn neural-network classification svm
对于文本分类,您通常会创建一个words frequency, or tf-idf 的向量,以便能够计算两个文档之间的距离。您可以使用各种方法在 word 上创建这些权重。
单词(特征)可以通过在分隔符上拆分文档来提取,但您可以使用更复杂的方法,例如stemming(只保留单词的根)。
您会在 sklearn 文档中找到大量示例。例如:
http://scikit-learn.org/stable/auto_examples/text/document_classification_20newsgroups.html
这个iPython Notebook 也可能是一个好的开始。
【讨论】: