【问题标题】:Correlation between continuous y variable and 3 categoriy x variable, R连续 y 变量与 3 类 x 变量 R 之间的相关性
【发布时间】:2021-12-30 07:39:57
【问题描述】:

我在 x 轴上有公司评级(1=sussessful,2=不确定,3=不成功),在 y 轴上有一个多样性指数,介于 0 和 1 之间。我想知道如果公司评级与多样性指数相关,则回答“更高的多样性指数是否与公司更高的成功有关”的问题。我不确定如何做到这一点,因为评级是一个分类变量并且多样性指数是连续的。请帮忙。谢谢!

data1 <- structure(list(x = structure(c(2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 
2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 3L, 3L, 3L, 2L, 2L, 2L, 2L, 3L, 
3L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 
2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 
2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 2L, 3L, 3L, 3L, 3L, 
3L, 3L, 3L, 3L, 3L, 3L, 3L, 3L, 3L, 3L, 2L, 2L, 2L, 2L, 2L, 2L, 
2L, 2L, 4L, 4L, 4L, 4L, 4L, 3L, 3L, 3L, 3L, 3L, 3L, 4L, 4L, 4L, 
4L, 4L, 4L, 3L, 3L, 3L, 2L, 2L, 2L, 3L, 3L, 3L, 3L, 3L, 3L, 3L, 
3L, 3L, 4L, 4L, 4L, 4L, 2L, 2L, 2L, 2L, 3L, 3L, 2L, 2L, 2L, 3L, 
3L, 2L, 2L, 2L, 2L, 2L, 2L, 3L, 3L, 3L, 3L, 3L, 3L, 3L, 3L), .Label = c("1", 
"2", "3", "4"), class = "factor"), y = c(0.66625, 0.66625, 0.66625, 
0.833125, 0.833125, 0.833125, 0.833125, 0.833125, 0.833125, 0.833125, 
0.833125, 0.833125, 0.833125, 0.833125, 0.833125, 0, 0.83375, 
0.83375, 0.83375, 0.166666666666667, 0.166666666666667, 0.166666666666667, 
0.166666666666667, 0.333333333333333, 0.333333333333333, 0, 0, 
0.25, 0.25, 0.25, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 
1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 
1, 1, 0.25, 0.25, 0.25, 0.25, 0.25, 0.25, 0.25, 0.25, 0.25, 0.20859375, 
0.20859375, 0.20859375, 0.20859375, 0.20859375, 0.333333333333333, 
0.333333333333333, 0.125, 0.125, 0.125, 0.5, 0.5, 0.5, 0.125, 
0.125, 0.125, 0.5, 0.5, 0.340831629175187, 0.340831629175187, 
0.340831629175187, 0.340831629175187, 0.340831629175187, 0.340831629175187, 
0.125, 0.125, 0.125, 0.33375, 0.33375, 0.33375, 0.125, 0.125, 
0.125, 0.125, 0.125, 0.125, 0.166666666666667, 0.166666666666667, 
0.65, 0.65, 0.65, 0.65, 0.5, 0.5, 0.5, 0.1, 0.1, 0.1, 0.1, 0.3, 
0.3, 0.3, 0.3, 0.166666666666667, 0.166666666666667, 0.66625, 
0.66625, 0.66625, 0, 0, 0.65, 0.65, 0.65, 0.65, 0.166666666666667, 
0.166666666666667, 0.7, 0.7, 0.7, 0.7, 0.7, 0.7, 0.7, 0.7)), class = "data.frame", row.names = c(NA, -151L))

【问题讨论】:

  • 我建议使用方差分析,这也将给出分组平均分,并根据分数测试组间差异的显着性
  • 如果您选择 anova,请使用 data1 %&gt;% group_by(x) %&gt;% summarise(count = n(), mean = mean(y, na.rm = TRUE), sd = sd(y, na.rm = TRUE)),然后使用 m &lt;- aov(y~x, data = data1); summary(m)

标签: r variables correlation continuous


【解决方案1】:

正如其他人所建议的那样,您可以选择首先运行 ANOVA 测试以查看三个组(基于 X 变量)在 Y 变量上是否具有不同的平均值。如果 ANOVA 显着,那么您运行三个“事后”检验来成对比较三个组,可能使用 t 检验。如果您想要一个包快速运行并可视化您的数据的组比较,我推荐ggstatsplot 包。这个简单的代码将实现并可视化比较:

library(ggstatsplot)
ggbetweenstats(data1, x = x, y = y)

您也可以使用类似ordinal regression 的模型,但您的数据需要满足某些条件才能成为有效的方法!

【讨论】:

    猜你喜欢
    • 2021-11-25
    • 2017-11-25
    • 2018-01-17
    • 2020-10-24
    • 1970-01-01
    • 2015-06-12
    • 2018-04-15
    • 2015-05-07
    • 1970-01-01
    相关资源
    最近更新 更多