【问题标题】:Do all machine learning algorithm usage Word frequency as a feature?所有机器学习算法都使用词频作为特征吗?
【发布时间】:2016-07-27 22:21:28
【问题描述】:

我使用 scikit learn 进行分类。主要与朴素贝叶斯、SVM、神经网络一起工作。它们中的每一个都有变体。

我看到训练算法创建向量。这个向量包含什么?

对于所有算法,它是否将词频视为一个特征?如果是,那么它们有何不同?

【问题讨论】:

    标签: machine-learning scikit-learn neural-network classification svm


    【解决方案1】:

    对于文本分类,您通常会创建一个words frequency, or tf-idf 的向量,以便能够计算两个文档之间的距离。您可以使用各种方法在 word 上创建这些权重。

    单词(特征)可以通过在分隔符上拆分文档来提取,但您可以使用更复杂的方法,例如stemming(只保留单词的根)。

    您会在 sklearn 文档中找到大量示例。例如:

    http://scikit-learn.org/stable/auto_examples/text/document_classification_20newsgroups.html

    这个iPython Notebook 也可能是一个好的开始。

    【讨论】:

    • 感谢您的回答。但我的问题不同。是否所有机器学习算法都考虑使用 tf-idf 进行特征选择?
    • 您决定要使用哪种功能。在 sklearn 链接中,您会看到所有类型的分类器都使用相同的功能。但是您可以选择使用其他类型的功能:文档的长度,元音的数量。您还可以使用所有类型的矢量化器(CountVectorizer、TfIdf、Hashing...)。
    猜你喜欢
    • 2013-12-01
    • 2019-05-30
    • 2017-10-27
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-02-06
    • 2018-03-05
    • 2012-03-28
    相关资源
    最近更新 更多