【问题标题】:Scaling data with large range in Machine learning preprocessing机器学习预处理中的大范围数据缩放
【发布时间】:2018-07-16 16:11:21
【问题描述】:

我对机器学习非常陌生。 我正在尝试将 ML 应用于包含近 50 个特征的数据。有些特征的范围从 0 到 1000000,有些则从 0 到 100 甚至更小。现在,当我使用 MinMaxScaler 为范围 (0,1) 使用特征缩放时,我认为具有大范围的特征缩小到非常小的值,并且这可能会影响我做出好的预测。

我想知道是否有一些有效的方法来进行缩放,以便适当地缩放所有功能。

我也尝试了标准定标器,但准确度没有提高。 我也可以对某些功能使用不同的缩放功能,而对其余功能使用另一个缩放功能吗?

提前致谢!

【问题讨论】:

    标签: machine-learning


    【解决方案1】:

    特征缩放或数据规范化是训练机器学习模型的重要部分。通常建议对所有特征使用相同的缩放方法。如果不同特征的尺度差异很大,这会对你的学习能力产生连锁反应(取决于你使用什么方法)。通过确保标准化的特征值,所有特征在其表示中都被隐式加权。

    两种常用的归一化方法是:

    • 重新缩放(也称为 min-max 归一化):

      其中x 是原始值,x' 是标准化值。例如,假设我们有学生的体重数据,学生的体重跨度为 [160 磅,200 磅]。为了重新调整这些数据,我们首先从每个学生的体重中减去 160,然后将结果除以 40(最大和最小权重之间的差)。

    • 均值归一化

      其中x是原始值,x'是归一化值。

    【讨论】:

    • 感谢您的解释,我应该使用哪种方法来处理我的数据。此外,我的数据的性质就像对于一个特定的特征,许多值在 1-10 之间,近 10% 直接为 1000 或更大。
    • 我会尝试两种方法,看看哪一种效果更好。
    猜你喜欢
    • 2018-08-18
    • 1970-01-01
    • 2020-06-15
    • 2015-08-18
    • 2020-09-07
    • 1970-01-01
    • 2017-12-15
    • 2014-02-17
    • 2018-03-07
    相关资源
    最近更新 更多