【问题标题】:Correlation coefficient between nominal and cardinal scale variables名义尺度变量和基数尺度变量之间的相关系数
【发布时间】:2020-01-14 21:46:54
【问题描述】:

我必须描述变量“每场比赛完成的平均传球次数”(基数量表)和变量“位置”(名义量表)之间的相关性,并衡量相关性的强度。为此,我必须考虑尺度正确选择相关系数。有谁知道最好的方法是什么?我不确定要使用什么,因为它是两个不同的比例。完整的数据集由以下变量组成:

  • PLAYER:玩家姓名
  • 国家:原籍国
  • BIRTHDATE:生日日期
  • HEIGHT_IN_CM:玩家身高
  • 位置:玩家的位置
  • PASSES_COMPLETED:玩家完成的传球
  • DISTANCE_COVERED:玩家走过的距离,以公里为单位
  • MINUTES_PLAYED:播放分钟数
  • AVG_PASSES_COMPLETED:球员完成的平均传球次数

如果有人能给我一些建议,我将不胜感激。

谢谢!

【问题讨论】:

标签: r statistics statistical-test


【解决方案1】:

好的,所以您需要重新定义您的问题。没有两个连续变量,我猜你在问,相关性不能用来“描述”一种关系。但是,您可以查看不同职位之间的通过率是否存在统计学上的显着差异。至于关于统计的问题,我同意莫蒂斯的观点……简历是最好的地方。至于做测试的代码,试试这个:

首先,您需要确保安装了正确的软件包。您肯定需要 ggplot 和 ggfortify,如果您必须操作数据或其他东西,可能还需要其他工具。并加载库:

library(ggplot2)
library(ggfortify)

接下来,确保您的数据整洁:即列中的变量。

然后将数据导入 R:

#find file
data.location = file.choose()
#Import data
curr.data <- read.csv(data.location)
#Check data import
glimpse(curr.data)

然后使用 ggplot 绘图:

ggplot(curr.data, aes(x = POSITION, y = AVG_PASSES_COMPLETED)) +
  geom_boxplot() +
  theme_bw()

然后使用线性模型函数 (lm()) 进行建模,看看在位置方面的通过率是否存在显着差异。

passrate_model <- lm(AVG_PASSES_COMPLETED ~ POSITION, data = curr.data)

在检验假设之前,您需要检查模型的适当性

autoplot(passrate_model, smooth.colour = NA)

如果残差图看起来不错,那么我们就可以进行测试了。如果不是,那么您将不得不使用另一种类型的模型(我现在不在这里讨论......)。

对此(我认为)合适的测试是 Tukey 测试,它需要 ANOVA。这将给出一个摘要,并应向您显示是否因位置而存在差异:

passrate_av <- aov(passrate_model)
summary(passrate_av)

这将执行 Tukey 检验并进行成对比较,包括均值差异、95% 置信区间和调整后的 p 值:

tukey.test <- TukeyHSD(passrate_av)
tukey.test

它甚至可以为你做一个漂亮的情节:

plot(tukey.test)

【讨论】:

  • 您可能应该阅读一下如何在 R 中编程。标准分析非常容易,这确实是。这是一本好书:oxfordscholarship.com/view/10.1093/acprof:oso/…
  • 感谢您的回复!我实际上是在 R 中执行此操作,但我们被告知不要为此使用某些方法。例如,我发现了函数 eta() rdocumentation.org/packages/ryouready/versions/0.4/topics/eta 但我被告知在这种情况下不要使用它...
  • 此代码适用于 R。您真的应该阅读我在上面评论中链接的教科书。
  • 如果此答案对您有所帮助,请将其标记为已回答关闭,并点赞?。谢谢
猜你喜欢
  • 1970-01-01
  • 2021-12-05
  • 2019-02-12
  • 2018-08-03
  • 1970-01-01
  • 2016-11-17
  • 1970-01-01
  • 2012-08-28
  • 2019-11-02
相关资源
最近更新 更多