【发布时间】:2012-04-01 22:11:44
【问题描述】:
我想知道解决反复出现的问题的最有效技术。
我有许多电子表格/csv 格式的数据库,它们具有这种形式(T/F 变量为 0,1):
id_code, age, heart_disease, weight, gender, operated, survived, ct_scan, days_hospitalized,
1332, 43.2, 1, 213, m, 0, 1, 1, 12
22322, 76.4, 0, 125, f, 1, 0, 0, 45
995, 55, 1, 199, m, 0, 1, 0, 34
为了对幸存者与非幸存者中的连续变量进行 t 检验:
myfx1 <- function(x) {t.test((x), mydat$survived)}
myfx1(mydat$age)
myfx1(mydat$weight)
然后我用另一个变量替换“幸存”并重复。
为了在幸存者与非幸存者中进行应急交叉表,
myfx2 <- function(x) {xtabs(~mydat$survived+x, data=mydat)}
myfx2(mydat$gender)
myfx2(mydat$operated)
我尝试过 plyr 和 doBy;许多示例总是使用均值/方差或其他简单函数来演示用法。处理大量变量的最简单最有效的方法是什么?
【问题讨论】:
标签: r