【发布时间】:2019-02-19 09:58:27
【问题描述】:
我正在尝试使用 12 个不同的经验数据集创建预测曲线。本质上,我想编写一个传递 2 个变量(应用程序数,天数)并根据我拥有的 12 个数据集生成预测曲线的函数。数据集都有 60 天,应用程序数量从 500 到 100,000。
我不太确定最好的方法是什么,我在想也许可以计算每天申请总数的平均百分比(例如:在第 1 天,平均发出的申请总数为 3%,第 10 天平均有 10% 等)会是一个很好的起点,但我不确定这是否是最好的方法。
我可以使用 python、SQL 和 excel,但我不一定要寻找特定的解决方案,而只是寻找有关方法的一般建议。任何帮助将不胜感激!
【问题讨论】:
-
取决于您要预测的内容和假设。在一个极端,你试图分别预测每一个,每一个都是由不同且独立的过程生成的,在这种情况下,做 12 个不同的模型。在另一个极端,您将它们都视为同一事物的嘈杂度量,您正在尝试预测,在这种情况下,是的,时间点内的平均值是有意义的(理想情况下,每个系列都按其明显的可靠性加权)。最复杂的地方是这些极端之间的中间地带,在那里它们是不同的,但甚至可能是相互作用的过程。
-
@DHW 12 个中的每一个都是不同的,它们只是因位置而异,但在这个阶段,我们只是在寻找一些非常基本的东西,所以我想我会继续使用平均值。您认为中位数或平均值更具代表性吗?重要吗?
-
这不是我的主要操舵室,但是一旦您将其堆叠到 12x60 数据集中,这听起来就像时间序列横截面 (TSCS) 数据。
标签: python sql excel statistics