【问题标题】:preprocessing data before GaussianNB for categorical for numerical features在 GaussianNB 之前对数据进行预处理以对数值特征进行分类
【发布时间】:2020-08-06 18:33:16
【问题描述】:
  • 我正在使用 GaussianNB 来解决分类问题
  • 所有特征都是数字,它们代表某事的分数(每个分数都在 1 到 8 之间,它们是考试的结果)

在我的情况下,该算法似乎运行良好:我的准确度得分为 0.85。 但我读到高斯应该有均值 0 和方差 1,但它们没有。 我之前应该使用诸如 Standard Scaler 之类的定标器吗? 在我的情况下是强制性的吗? 我试过了,但性能没有上升

【问题讨论】:

  • 我读到高斯应该有均值 0 和方差 1,但它们没有”,按原样,这里绝对没有任何意义。你在哪里读到它,它与你的具体背景有什么关系?高斯是一个非常笼统的术语,它本身没有任何意义。
  • 非常感谢您的回答。大概,我糊涂了。但是,文章说特征应该是连续的而不是离散的,因为对于离散的,多项式 NB 方法更好,对吗?
  • 请注意,脱离上下文的 cmets 中的单行问题无法实现 SO;也不是教程服务。请花时间发布一个精心设计的问题,引用您迄今为止的研究和您的具体问题。对于非编码 ML 问题,Cross ValidatedData Science SE 更合适
  • 好的,对不起,我是新来的,我会学习如何写出更好的帖子。谢谢你的建议
  • 不客气;请务必通过帮助系统,尤其是How to askWhat topics can I ask about here?

标签: python machine-learning scikit-learn naivebayes


【解决方案1】:

“标准高斯”——基本/假设的高斯分布——其均值为 0,方差为 1。例如,世界各地人们的身高均值为 175 厘米,方差为 10 厘米,但它仍然是高斯分布(钟形)。

【讨论】:

    猜你喜欢
    • 2015-08-07
    • 2013-04-20
    • 1970-01-01
    • 2012-11-09
    • 2016-10-04
    • 2017-09-19
    • 2020-08-03
    • 1970-01-01
    • 2019-09-18
    相关资源
    最近更新 更多