【问题标题】:Statistical Analysis of Server Logs - Correctness of Extrapolation服务器日志统计分析——外推的正确性
【发布时间】:2010-09-24 11:02:11
【问题描述】:

一天我们遇到了大约 10 分钟的 ISP 故障,不幸的是,这发生在一个由多个地点编写的托管考试期间。

很遗憾,这导致候选人当前页面的回发数据丢失。

我可以从服务器日志中重建事件流。然而,在 317 名候选人中,有 175 人使用本地代理,这意味着他们似乎都来自同一个 IP。我分析了其余 142 个(45%)的数据,并得出了一些很好的数字来说明它们发生了什么。

问题:将我所有的数字乘以 317/142 以获得整个集合的可能结果有多正确?我的(不确定)区域是什么?

请不要猜测。我需要在统计课上没睡着的人来回答。

编辑:按数字,我指的是受影响个人的数量。例如,5/142 显示了会话期间浏览器崩溃的证据。 11/317 浏览器崩溃的推断有多正确?

【问题讨论】:

    标签: math statistics


    【解决方案1】:

    我不确定我们到底在谈论什么衡量标准,但现在让我们假设您想要平均分之类的东西。估计总体(317 名候选人)的平均分数不需要调整。只需使用样本的平均值(您分析的 142 个数据)。

    要找到您的不确定区域,您可以使用NIST statistics handbook 中给出的公式。你必须首先决定你愿意有多不确定。假设您希望真实总体均值位于区间内的置信度为 95%。那么,真实总体均值的置信区间将为:

    (样本均值)+/- 1.960*(样本标准差)/sqrt(样本大小)

    您可以进行进一步的更正,以将相对于总体的样本量大而功劳。他们会将置信区间收紧约 1/4,但有很多假设认为上述计算已经使它不那么保守了。一种假设是分数大致呈正态分布。另一个假设是样本代表了总体。您提到缺失的数据都来自使用相同代理的候选人。使用该代理的人口子集可能与其他人口有很大不同。

    编辑:因为我们正在讨论具有属性的样本比例,例如“浏览器崩溃”,情况有些不同。我们需要使用一个比例的置信区间,并通过乘以人口规模将其转换回成功次数。这意味着我们对崩溃浏览器数量的最佳估计是 5*317/142 ~= 11,正如您所建议的那样。

    如果我们再次忽略我们的样本几乎占人口一半的事实,我们可以使用Wilson confidence interval of a proportioncalculator is available online 为您处理公式。计算器和公式的输出是总体分数的上限和下限。要获得崩溃次数的范围,只需将上限和下限乘以(总体大小 - 样本大小),然后再加回样本中的崩溃次数。虽然我们可以简单地乘以总体规模来获得区间,但这会忽略我们已经知道的样本。

    使用上述程序可得到 95% C.I.根据 142 个样本点中的 5 次崩溃,在 317 个总体中浏览器崩溃的总数为 7.6 到 19.0。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2016-01-12
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-01-22
      相关资源
      最近更新 更多