【发布时间】:2020-09-24 17:26:10
【问题描述】:
我想生成具有特定分布的随机/模拟数据集。
例如,分布具有以下属性。
- 人口1000人
- 性别组合为:男性 49%,女性 50%,其他 1%
- 年龄分布如下:0-30(30%)、31-60(40%)、61-100(30%)
生成的数据框将有 1000 行,两列称为性别和年龄(具有上述值分布)
有没有办法在 Pandas 或其他库中执行此操作?
【问题讨论】:
-
numpy.random.choice -
您想要这些 % 混合吗?或者你想创建一个具有这些概率的样本?对于年龄,61+ 是什么意思(上限是多少?100?120?)。年龄是否在年龄范围内均匀分布?或者年龄只是一个类别的指标,而不是一个实际的数字?
-
我编辑了年龄的上限
标签: python pandas dataframe distribution