【发布时间】:2019-12-30 10:06:14
【问题描述】:
我对此并不陌生,甚至可能会问一个幼稚的问题。我想生成一个带有一些约束的随机数据集:
date_1 - already generated in csv (Dated from 1 august 2018- 1 august 2019)
date_2 - 60% of the data lies within the 30 days from the date_1 and 40% of the data lies within 90 days of the date_2.
capacity_1 - 3500 kgs is the threshold for a day. Cannot exceed the same for date_2
capacity_2 - leftout weight for the day. its 3500-capacity_1 for a particular day.
我拥有的 date_1 格式是 d/m/y
谁能告诉我如何实现其他列。我打算用 100,000 行构建虚拟数据。
编辑:附加数据here的csv文件
EDIT2:输入看起来像:
date_1
01/08/2018
01/08/2018
01/08/2018
01/08/2018
01/08/2018
01/08/2018
01/08/2018
01/08/2018
01/08/2018
01/08/2018
01/08/2018
01/08/2018
预期输出:
对于特定的 date_2,这里的 capacity_2 将是 3500-capacity_1。 capacity_2 基本上会给出特定日期已使用 3500 中的多少的想法。
谢谢
【问题讨论】:
-
@AndiDomi 你能帮我提供一个较小条目的伪代码吗?我没有得到解释的部分。
-
然后根据上面的数据集,对于每一列,我将使用randrange(30) 或
randrange(90)生成带有timedelta 的一天 -
@AndiDomi 我做了数据集的拆分:
df1 = df[:60000] df2 = df[60000:100000]我们如何用 timedelta 生成一天,我无法得到。你能帮忙吗? -
这将有助于我们从您的 csv 文件中获取一些行(至少一些可以使用的虚拟数据),因为我们并不真正知道您的数据是什么样子以及最终结果应该是什么样子。跨度>