【发布时间】:2017-02-03 22:41:53
【问题描述】:
首先,我不完全确定这是否是发布此内容的正确位置,因为它可能应该放在更注重统计数据的论坛中。但是,由于我打算用 R 来实现它,所以我认为最好把它贴在这里。如果我错了,请道歉。
所以,我想做的是以下内容。我想模拟总共 250.000 个观察值的数据,根据从经验数据(离散)得出的核密度估计值分配一个连续(非整数)值,原始值范围为 -5 到 +5。这是我要使用的分布图。
对我来说非常重要的是,我不是基于离散概率来模拟新数据,而是基于连续概率,因为一个值可以说是 2.89 而不是 3 或 2 非常重要。所以新值将是根据图中描述的概率分配。模拟数据中最常见的值将在 +2 附近,而在 -4 和 +5 附近的值将相当罕见。
我已经阅读了很多关于在 R 中模拟数据以及内核密度估计如何工作的内容,但我真的一点也没有前进。所以我的问题基本上需要两个步骤 - 我什至如何模拟数据(1),此外,我如何使用这个特定的概率分布(2)模拟数据?
先谢谢了,我希望你们能帮助我解决这个问题。
【问题讨论】:
-
如果我理解您的问题,您可能会使用蒙特卡洛模拟。由于您的分布是已知的,因此您可以使用该分布的随机抽样来创建模拟数据。这听起来像你想要做的吗?
-
嗨@LloydChristmas,感谢您的回复。问题是,分布是已知的,但我不想使用实际的离散分布来模拟数据,而是使用内核中描述的连续分布来模拟数据。如果这就是你所指的,那就太棒了。我该怎么做?
-
这里有一些有趣的讨论:stats.stackexchange.com/questions/30303/…
-
我打算推荐一种“拒绝方法”,但这在上面的链接中有介绍。此外,@gung 提供了一个可能也适合您的解决方案。
-
嗨。我已经阅读了@gung 的方法,但我不太了解其中的大部分内容,但认为它可能会起作用。我将通读他/她推荐的论文,看看我是否可以使用这种方法产生一些有意义的东西。非常感谢!
标签: r simulation kernel-density