【发布时间】:2020-06-12 08:52:34
【问题描述】:
给出的数据是 样本 胆固醇水平样本 来自 24 医院 员工 他们 美国 标准饮食 和 同意 采用 素食 饮食 1 个月。血清胆固醇 测量 在 采用 饮食 和 1 个月 后进行。
Subject Before After Difference
1 1 195 146 49
2 2 145 155 -10
3 3 205 178 27
4 4 159 146 13
5 5 244 208 36
6 6 166 147 19
7 7 250 202 48
8 8 236 215 21
9 9 192 184 8
10 10 224 208 16
11 11 238 206 32
12 12 197 169 28
13 13 169 182 -13
14 14 158 127 31
15 15 151 149 2
16 16 197 178 19
17 17 180 161 19
18 18 222 187 35
19 19 168 176 -8
20 20 168 145 23
21 21 167 154 13
22 22 161 153 8
23 23 178 137 41
24 24 137 125 12
现在这是我要回答的问题。一些 研究人员 相信 饮食的 影响
胆固醇 在 高 而不是 低 胆固醇 水平的人 更 明显 。如果 您 根据 基线 胆固醇 是 高于 还是低于 中位数 对 数据 拆分 数据 您可以 对 这个问题进行描述 评论吗?
现在,我正在考虑在这里基于两个类别创建箱线图。我希望在这里使用dplyr 进行数据操作。因此,我将根据Before 是否小于或大于Before 的中值来创建一个新列。因此,我将有一个新的特征向量,其中“高”表示高胆固醇之前,低表示低之前胆固醇。然后,我将根据分类新列绘制Difference 的箱线图。所以,这是我的代码。我称原始数据集为df2。
df2 %>%
mutate(new_col = if_else(Before < median(Before), "low", "high")) %>%
group_by(new_col) %>%
ggplot(aes(x= new_col, y=Difference)) +
geom_boxplot()
因此,基于此,我得出结论,调查人员是正确的, 饮食对 胆固醇 的影响 在 高 而不是 低 胆固醇 水平的人群中 更为明显。我想知道这是否可以更有效地完成。
【问题讨论】:
-
这个问题可能会产生基于意见的答案。鉴于 OP 中的 R 脚本生成了一个箱线图,可以回答以下问题:在预测试中高胆固醇的患者是否比在预测试中的低胆固醇患者更能从素食中受益,脚本是“有效”。
-
@LenGreski 不应该迁移到 stats.stackexchange 而不是关闭吗?
-
@DanChaltiel - 这取决于人们如何解释这个问题。如果问题是“是否有更有效的方法来创建 2 组箱线图”,我会说它不需要迁移。如果问题是“2 组比较是分析这些数据的最佳方式吗?”它值得迁移。也许 user9026 可以提供更多上下文,但这看起来像是一个家庭作业问题,其中关于将区间比率变量更改为序数变量以进行分析的优点的辩论可能超出了课堂上目前所教授的内容。