【问题标题】:Python/SQL/Excel I have 12 datasets and I want to combine them to one representative setPython/SQL/Excel 我有 12 个数据集,我想将它们组合成一个代表集
【发布时间】:2019-02-19 09:58:27
【问题描述】:

我正在尝试使用 12 个不同的经验数据集创建预测曲线。本质上,我想编写一个传递 2 个变量(应用程序数,天数)并根据我拥有的 12 个数据集生成预测曲线的函数。数据集都有 60 天,应用程序数量从 500 到 100,000。

我不太确定最好的方法是什么,我在想也许可以计算每天申请总数的平均百分比(例如:在第 1 天,平均发出的申请总数为 3%,第 10 天平均有 10% 等)会是一个很好的起点,但我不确定这是否是最好的方法。

我可以使用 python、SQL 和 excel,但我不一定要寻找特定的解决方案,而只是寻找有关方法的一般建议。任何帮助将不胜感激!

【问题讨论】:

  • 取决于您要预测的内容和假设。在一个极端,你试图分别预测每一个,每一个都是由不同且独立的过程生成的,在这种情况下,做 12 个不同的模型。在另一个极端,您将它们都视为同一事物的嘈杂度量,您正在尝试预测,在这种情况下,是的,时间点内的平均值是有意义的(理想情况下,每个系列都按其明显的可靠性加权)。最复杂的地方是这些极端之间的中间地带,在那里它们是不同的,但甚至可能是相互作用的过程。
  • @DHW 12 个中的每一个都是不同的,它们只是因位置而异,但在这个阶段,我们只是在寻找一些非常基本的东西,所以我想我会继续使用平均值。您认为中位数或平均值更具代表性吗?重要吗?
  • 这不是我的主要操舵室,但是一旦您将其堆叠到 12x60 数据集中,这听起来就像时间序列横截面 (TSCS) 数据。

标签: python sql excel statistics


【解决方案1】:

听起来您想将其全部拆分为 (60*12) 行,包含 3 列:一个记录应用程序编号,另一个记录时间,另一个记录位置。然后,一个模型可以将每个位置作为预测变量进行虚拟化,您可以生成 12 个具有不确定性的模拟预测。然后,为了得到你的一个整体预测,取而代之的是平均这些预测 - 如果你喜欢的话,引导然后汇集预测。随心所欲地建模时间 - 自回归、卡尔曼滤波器、最近邻(尽管可能没有足够的数据)。只是不要单独模拟每个时间点,否则您将拥有一个完美拟合的模型。

但请注意您可以在此处建模的位置之间可能存在的交互作用。完全模拟它们假设它们之间没有交互,或者至少有一个你关心的,或者与你关心的任何事情有关的交互。它仅考虑了固定效应,即您假设每个位置内的时间动态是相同的,只是某些位置总体上倾向于具有比其他位置更高的申请数量。您可以根据其他位置的申请编号(当前编号、过去编号等)推导出与任何给定位置相关的大量预测变量。所有这些都取决于您认为可能的和需要考虑的信息。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2015-02-08
    • 1970-01-01
    • 2012-12-20
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-06-05
    • 1970-01-01
    相关资源
    最近更新 更多