【发布时间】:2020-02-10 12:25:41
【问题描述】:
我在 Excel 中获得了一些格式非常笨拙的数据,我需要对其进行整形,以便在 R 中运行生存分析。
我将数据摘录上传到 Google 云端硬盘:https://drive.google.com/open?id=1ret3bCDCYPDALQ16YBloaeopfl2-qVbp
原始数据框有大约 2100 个观测值和 950 个变量
这是基本的数据框:
my.data<-data.frame(
ID=c( "", "","C8477","C5273","C5566"),
LR=c("2012Y","State:FL",5,6,8),
LR=c("2012Y","State:AZ",5,8,10),
LR=c("2011Y","State:FL",7,2,1)
)
my.data
# ID LR LR.1 LR.2
# 1 2012Y 2012Y 2011Y
# 2 State:FL State:AZ State:FL
# 3 C8477 5 5 7
# 4 C5273 6 8 2
# 5 C5566 8 10 1
所有列都具有相同的名称“LR”。不知道以后会不会有问题……
第 1 行给出年份,第 2 行给出观察发生的相应状态。
作为输出,我需要一些面板数据,以便在以后的生存分析中使用。
my.data<-data.frame(
ID=c("C8477","C5273","C5566"),
Year=c("2012","2012","2011"),
State=c("FL","AZ","FL"),LR=c(5,8,1)
)
my.data
# ID Year State LR
# 1 C8477 2012 FL 5
# 2 C5273 2012 AZ 8
# 3 C5566 2011 FL 1
我玩弄了 reshape 函数和 seq 函数,但这些都不能帮助我朝着正确的方向前进,因为数据框的排列很奇怪。
【问题讨论】:
-
我已从您的示例中删除了
120046值。