【发布时间】:2011-04-13 02:55:31
【问题描述】:
最近遇到了这个词,但真的不知道它指的是什么。我在网上搜索过,但收效甚微。 谢谢。
【问题讨论】:
标签: machine-learning data-mining
最近遇到了这个词,但真的不知道它指的是什么。我在网上搜索过,但收效甚微。 谢谢。
【问题讨论】:
标签: machine-learning data-mining
以您在星期六醒来的时间为例。有些周五晚上你喝了太多酒,所以你起得很早(但要回去睡觉)。其他日子你会在正常时间醒来。其他日子你睡。
结果如下:
[3.1、4.8、6.3、6.4、6.6、7.3、7.5、7.7、7.9、10.1]
你起床的平均时间是多少?
现在是 6.8(点,或 6:48)。对我来说早一点。
这个预测你下周六醒来的时间有多好?你能量化你可能犯的错误有多大吗?
这是一个非常小的样本,我们不确定底层过程的分布,因此使用标准参数统计技术可能不是一个好主意†。
我们为什么不随机抽取样本,计算平均值并重复此过程?这将使我们估计我们的估计有多糟糕。
我这样做了几次,平均值在 5.98 到 7.8 之间
这被称为 bootstrap,由 Bradley Efron 在 1979 年首次提及。
一种变体称为 jackknife,您可以在其中对除一个数据集以外的所有数据集进行采样,取平均值,然后重复。折刀平均值为 6.8(与算术平均值相同),范围为 6.4 到 7.2。
另一种变体称为 k 折交叉验证,您(随机)将数据集分成 k 个大小相等的部分,计算除一个部分之外的所有部分的平均值,然后重复 k次。 5 折交叉验证均值为 6.8,范围为 4 到 9。
† 这种分布恰好是正态分布。平均值的 95% 置信区间为 5.43 到 8.11,相当接近但大于引导平均值。
【讨论】:
如果您没有足够的数据来训练您的算法,您可以通过(统一)随机选择项目并复制它们(替换)来增加训练集的大小。
【讨论】:
在机器学习中,引导是对已知集合的迭代训练。 http://en.wikipedia.org/wiki/Bootstrapping_(machine_learning)
【讨论】: