【问题标题】:what is the bootstrapped data in data mining?什么是数据挖掘中的自举数据?
【发布时间】:2011-04-13 02:55:31
【问题描述】:

最近遇到了这个词,但真的不知道它指的是什么。我在网上搜索过,但收效甚微。 谢谢。

【问题讨论】:

    标签: machine-learning data-mining


    【解决方案1】:

    以您在星期六醒来的时间为例。有些周五晚上你喝了太多酒,所以你起得很早(但要回去睡觉)。其他日子你会在正常时间醒来。其他日子你睡。

    结果如下:

    [3.1、4.8、6.3、6.4、6.6、7.3、7.5、7.7、7.9、10.1]

    你起床的平均时间是多少?

    现在是 6.8(点,或 6:48)。对我来说早一点。

    这个预测你下周六醒来的时间有多好?你能量化你可能犯的错误有多大吗?

    这是一个非常小的样本,我们不确定底层过程的分布,因此使用标准参数统计技术可能不是一个好主意†。

    我们为什么不随机抽取样本,计算平均值并重复此过程?这将使我们估计我们的估计有多糟糕。

    我这样做了几次,平均值在 5.98 到 7.8 之间

    这被称为 bootstrap,由 Bradley Efron 在 1979 年首次提及。

    一种变体称为 jackknife,您可以在其中对除一个数据集以外的所有数据集进行采样,取平均值,然后重复。折刀平均值为 6.8(与算术平均值相同),范围为 6.4 到 7.2。

    另一种变体称为 k 折交叉验证,您(随机)将数据集分成 k 个大小相等的部分,计算除一个部分之外的所有部分的平均值,然后重复 k次。 5 折交叉验证均值为 6.8,范围为 4 到 9。

    † 这种分布恰好是正态分布。平均值的 95% 置信区间为 5.43 到 8.11,相当接近但大于引导平均值。

    【讨论】:

    【解决方案2】:

    如果您没有足够的数据来训练您的算法,您可以通过(统一)随机选择项目并复制它们(替换)来增加训练集的大小。

    【讨论】:

      【解决方案3】:

      在机器学习中,引导是对已知集合的迭代训练。 http://en.wikipedia.org/wiki/Bootstrapping_(machine_learning)

      【讨论】:

      • 只提供维基百科的链接并不是很有帮助。自己很容易找到:)
      猜你喜欢
      • 2010-11-12
      • 1970-01-01
      • 2016-07-21
      • 2021-07-23
      • 2011-01-24
      • 2011-02-07
      • 1970-01-01
      • 2013-06-11
      • 1970-01-01
      相关资源
      最近更新 更多