【问题标题】:Iterating an operation on columns in a dataframe using a loop使用循环对数据框中的列进行迭代操作
【发布时间】:2019-04-17 22:02:46
【问题描述】:

我有一个数据框,其列名包括“W1_2019”格式的周和年指示符以及其他文本。完整的数据框包含 52 周,每列 5 列。我的目标是采用以下代码,它完全符合我希望它在第 1 周和第 2 周执行的操作,并将其放入 x=1 到 52 的循环中,因此我不必使用 52 次相同的一半十几行。

eidsr <- dget(file="test1.txt")

mode_xmt <- data.frame(District=eidsr$district) #Initializes dataframe mode_xmt with only 1 column containing District names

wtmp <- select(eidsr, contains("W1_2019"))
wtmp$mode <- "NoRep"
wtmp$mode[wtmp$W1_2019_EIDSR_Total_Malaria_cases>0] <- "Report"
wtmp$mode[wtmp$`W1_2019_EIDSR-Mobile_SMS`==1] <- "Mobile_SMS"
wtmp$mode[wtmp$`W1_2019_EIDSR-Mobile_Internet`==1] <- "Mobile_Internet"

#At this point the dataframe wtmp looks like the example below.

mode_xmt$`2019_W1` <- wtmp$mode #Appends ONLY the W1_2019 column to mode_xmt
rm(wtmp)

wtmp <- select(eidsr, contains("W2_2019"))
wtmp$mode <- "NoRep"
wtmp$mode[wtmp$W2_2019_EIDSR_Total_Malaria_cases>0] <- "Report"
wtmp$mode[wtmp$`W2_2019_EIDSR-Mobile_SMS`==1] <- "Mobile_SMS"
wtmp$mode[wtmp$`W2_2019_EIDSR-Mobile_Internet`==1] <- "Mobile_Internet"

mode_xmt$`2019_W2` <- wtmp$mode
rm(wtmp)

每次操作结束时,我的工作数据如下。数据框 wtmp 如下所示:

   `W1_2019_EIDSR-Timely_~ W1_2019_EIDSR_Total_Mala~ W1_2019_EIDSR_Date_R~ `W1_2019_EIDSR-Mobile_~ `W1_2019_EIDSR-Mobi~ mode 
                     <dbl>                     <dbl> <chr>                                   <dbl>                <dbl> <chr>
 1                      NA                         0 NA                                         NA                   NA NoRep
 2                      NA                        NA NA                                         NA                   NA NoRep
 3                      NA                        51 NA                                         NA                   NA Repo~
 4                      NA                        NA NA                                         NA                   NA NoRep
 5                      NA                        64 NA                                         NA                   NA Repo~
 6                      NA                        86 NA                                         NA                   NA Repo~
 7                      NA                        92 NA                                         NA                   NA Repo~
 8                      NA                        47 NA                                         NA                   NA Repo~
 9                      NA                        46 NA                                         NA                   NA Repo~
10                      NA                        35 NA                                         NA                   NA Repo~

mode_xmt,附加了新列,如下所示:

   District 2019_W01
1        Bo    NoRep
2        Bo    NoRep
3        Bo   Report
4        Bo    NoRep
5        Bo   Report
6        Bo   Report
7        Bo   Report
8        Bo   Report
9        Bo   Report
10       Bo   Report

一旦我完成了 W2 的第二次迭代,mode_xmt 看起来像这样:

   District 2019_W01 2019_W02
1        Bo    NoRep   Report
2        Bo    NoRep    NoRep
3        Bo   Report   Report
4        Bo    NoRep    NoRep
5        Bo   Report   Report
6        Bo   Report   Report
7        Bo   Report   Report
8        Bo   Report   Report
9        Bo   Report   Report
10       Bo   Report   Report

起泡、冲洗、重复。 Times 52. 正如@DS_UNI 所观察到的那样,虽然将周和年分开列会很好,但它们会破坏最终目的,即一个超过一年的时间序列……但要防止自己完全走如果我可以迭代一年中的 52 周,我会很高兴的。

正如我所说,上面的代码有效。我只是在寻找一种循环它的方法,而不是重复它令人作呕。

这是截断数据的 dput 文本(在您的工作目录中另存为 test1.txt):

structure(list(`W1_2019_EIDSR-Timely_Report` = c(NA_real_, NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_), W1_2019_EIDSR_Total_Malaria_cases = c(0,  NA, 51, NA, 64, 86, 92, 47, 46, 35, 33, NA, NA, 77, 35, 7, 24,  27, 14, 72), W1_2019_EIDSR_Date_Received = c(NA_character_, NA_character_,  NA_character_, NA_character_, NA_character_, NA_character_, NA_character_,  NA_character_, NA_character_, NA_character_, NA_character_, NA_character_,  NA_character_, NA_character_, NA_character_, NA_character_, NA_character_,  NA_character_, NA_character_, NA_character_), `W1_2019_EIDSR-Mobile_Internet` = c(NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_), `W1_2019_EIDSR-Mobile_SMS` = c(NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_), `W2_2019_EIDSR-Timely_Report`
= c(NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_), W2_2019_EIDSR_Total_Malaria_cases = c(55,  NA, 44, NA, 38, 26, 29, 40, 59, 18, 48, NA, NA, 37, 34, 51, 34,  38, 13, 56), W2_2019_EIDSR_Date_Received = c(NA_character_, NA_character_,  NA_character_, NA_character_, NA_character_, NA_character_, NA_character_,  NA_character_, NA_character_, NA_character_, NA_character_, NA_character_,  NA_character_, NA_character_, NA_character_, NA_character_, NA_character_,  NA_character_, NA_character_, NA_character_), `W2_2019_EIDSR-Mobile_Internet` = c(NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_), `W2_2019_EIDSR-Mobile_SMS` = c(NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_, NA_real_,  NA_real_, NA_real_, NA_real_, NA_real_, NA_real_), district = c("Bo",  "Bo", "Bo", "Bo", "Bo", "Bo", "Bo", "Bo", "Bo", "Bo", "Bo", "Bo",  "Bo", "Bo", "Bo", "Bo", "Bo", "Bo", "Bo", "Bo")), .Names = c("W1_2019_EIDSR-Timely_Report",  "W1_2019_EIDSR_Total_Malaria_cases", "W1_2019_EIDSR_Date_Received",  "W1_2019_EIDSR-Mobile_Internet", "W1_2019_EIDSR-Mobile_SMS",  "W2_2019_EIDSR-Timely_Report", "W2_2019_EIDSR_Total_Malaria_cases",  "W2_2019_EIDSR_Date_Received", "W2_2019_EIDSR-Mobile_Internet",  "W2_2019_EIDSR-Mobile_SMS", "district"), row.names = c(NA, -20L ), class = c("tbl_df", "tbl", "data.frame"))

【问题讨论】:

  • 我建议您看看 tidy data 是什么以及如何重塑数据以优化分析,this question 处理类似的数据,tbh 我不建议使用循环为了解决这个问题,
  • 话虽如此,如果没有可重现的示例,要提供帮助是非常具有挑战性的,这个post 可能会给您一些关于如何提供样本数据、可重现的示例和预期输出的想法
  • 我担心你会说......这个数据太混乱了,我需要很长时间才能创建虚拟数据来重现。我会尝试... :(
  • 对不起!但你也可以看看我在第一条评论中添加的问题,看看那里的答案可能会有所帮助
  • 我知道这是大量新手的东西,但我经常在这样的问题上崩溃和燃烧,因为我不知道如何创建看起来像 imported 我正在使用的数据。你有任何“为假人创建虚拟数据”链接可以指向我吗?

标签: r


【解决方案1】:

您的数据应该看起来像这样(我也希望有一个星期的列和一年的列)。而且很可能有一种方法可以操纵以获得您想要的东西。

library(dplyr)
library(reshape2)

eidsr %>% 
  # values should be in a column (not in headers) 
  melt(id.var = 'district') %>% 
  # extract the new variables
  mutate(week_year = substr(variable, 1, 7),
         variable = sub(".*EIDSR[- _]", "", variable)) %>% 
  # assuming missing values don't have a specific meaning you can just remove them
  na.omit()

#     district            variable value week_year
# 21        Bo Total_Malaria_cases     0   W1_2019
# 23        Bo Total_Malaria_cases    51   W1_2019
# 25        Bo Total_Malaria_cases    64   W1_2019
# 26        Bo Total_Malaria_cases    86   W1_2019
# 27        Bo Total_Malaria_cases    92   W1_2019
# 28        Bo Total_Malaria_cases    47   W1_2019
# 29        Bo Total_Malaria_cases    46   W1_2019
# 30        Bo Total_Malaria_cases    35   W1_2019

我可以看出你正在失去耐心,所以如果你必须使用循环,你应该使用其中一个 apply 函数,对于那些你需要一个函数来重复应用于向量或列表的函数:

wacky_fun <- function(x_chr){
  malaria_col <- paste0(x_chr, '_EIDSR_Total_Malaria_cases')
  sms_col <- paste0(x_chr, '_EIDSR-Mobile_SMS')
  internet_col <- paste0(x_chr, '_EIDSR-Mobile_Internet')

  mode_col <- rep("NoRep", nrow(eidsr))
  mode_col[eidsr[malaria_col]>0] <- "Report"
  mode_col[eidsr[sms_col]==1] <- "Mobile_SMS"
  mode_col[eidsr[internet_col]==1] <- "Mobile_Internet"

  return(mode_col)
}

我们将对数据中的所有周应用该函数

# get the unique weeks in the headers 
weeks <- names(eidsr)[grepl('W[[:digit:]]_[[:digit:]]{4}', names(eidsr))] %>% 
  substr(1, 7) %>% 
  unique()
# apply the function on all the weeks, bind them with the district, and convert to data.frame
cbind('district' = eidsr$district, sapply(weeks, wacky_fun)) %>% 
  as.data.frame()

【讨论】:

  • 不,这不是我的目标。看起来我无法格式化 cmets,所以将在上面的问题中重新编辑。感谢您的耐心等待。
  • 只是添加我迟到的感谢@DS_UNI。你的“古怪乐趣”用比我的 kluge 少得多的代码行完美地工作。我有很多分析要做,所以对代码的进一步学习将不得不退居二线,但我感谢你的帮助,并完全打算回来分析你的代码,直到我理解它!
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2020-01-24
  • 2021-02-24
  • 2018-11-17
  • 1970-01-01
相关资源
最近更新 更多