【发布时间】:2021-10-19 03:07:23
【问题描述】:
我有两个数据集,其中包含存储在数据框中的人的身高(以及其他详细信息):
dataset1$height
dataset2$height
我需要知道从 dataset1 中随机选择的高度大于从 dataset2 中随机选择的高度的概率。
我知道我正在尝试在这里计算 P(X-Y)>0,但我不确定如何将其放入 R 中,以及如何获得 P 的答案(即 dataset1$height - dataset2$height > 0 的概率是多少) .
我已经计算了每个数据集中高度的均值、方差和标准差,但我只是不确定如何将这些计算结果拟合到得出概率的公式中。
为了重现性,以下样本可以代表我所拥有的:
dataset1 = rnorm(100, mean = 11, sd = 2)
dataset2 = rnorm(100, mean = 10, sd = 2)
mean1 = mean(dataset1)
mean2 = mean(dataset2)
var1 = var(dataset1)
var2 = var(dataset2)
sdev1 = sd(dataset1)
sdev2 = sd(dataset2)
Probability = mean(dataset2)/mean(dataset1)
Probability
【问题讨论】:
-
您在寻找
t.test和alternative = "greater"的功能吗? -
如果您不需要精确值,请尝试蒙特卡罗模拟:
{N <- 20000000; sum(sample(dataset1, N, TRUE) > sample(dataset2, N, TRUE))/N}如需精确公式,请查看:stats.stackexchange.com/questions/50501/… -
这是一个准确的答案,但可能不是您想要的:
{M <- outer(dataset1, dataset2, ">"); sum(M) / length(M)}
标签: r probability