【问题标题】:Select multiple date columns and convert factor variables to date选择多个日期列并将因子变量转换为日期
【发布时间】:2021-02-10 17:28:24
【问题描述】:

我有一个 data.frame,其中包含多个包含日期的列。目前它们被认为是“因子”类。 我想选择所有应该是日期的列(其中有 10 个,它们的名称中都有“日期”,例如 Date_Construc、Date_use、Comp_date...)并将它们从因子转换为日期强>。

这是我尝试过的: 首先,我想选择向量中的相关列

library(tidyselect)
date_vars <- vars_select(names(df1), contains("Date", ignore.case = TRUE))

然后

library(lubridate)
date_vars <- dmy(date_vars)

也试过了

date_vars <- vars_select(names(df1), contains("Date", ignore.case = TRUE))
df1[date_vars] <- lapply(df1[date_vars], as.Date)

我明白了

 Error in as.Date.numeric(X[[i]], ...) : 'origin' must be supplied

还有

date_vars <- vars_select(names(df1), contains("Date", ignore.case = TRUE))
df1[date_vars] <- dmy(as.character(df1[date_vars])

结果,

 Warning message:
All formats failed to parse. No formats found.

这是当前格式的示例数据:

Date_Construct= c("10/03/2018 00:00", "21/03/2015 00:00", "20/02/2012 00:00")
Date_use = c("02/08/2007 00:00", "31/10/2007 00:00", "13/08/2008 00:00")
ID = c("0001", "34560", "100041531")
Comp = c("Revis", "Succ", "Revis")

dfq= data.frame(`ID`, `Date_Construct`, `Date_use`, `Comp`)



    ID      Date_Construct     Date_use            Comp
1   0001    10/03/2018 00:00    02/08/2007 00:00    Revis
2   34560   21/03/2015 00:00    31/10/2007 00:00    Succ
3   100041531   20/02/2012 00:00    13/08/2008 00:00    Revis

【问题讨论】:

    标签: r date select multiple-columns tidyselect


    【解决方案1】:

    根据提供的新数据更新答案。

    试试下面的。无需去除日期时间字符串的时间部分。您可以使用与数据匹配的lubridate 函数(在本例中为dmy_hm())对其进行解析,然后忽略它。

    dfq_parsed <- dfq %>%
      mutate(across(contains("date", ignore.case = TRUE), dmy_hm))
    

    这会产生:

             ID Date_Construct   Date_use  Comp
    1      0001     2018-03-10 2007-08-02 Revis
    2     34560     2015-03-21 2007-10-31  Succ
    3 100041531     2012-02-20 2008-08-13 Revis
    

    日期与 POSIXct 相同,但这很容易使用:

    'data.frame':   3 obs. of  4 variables:
     $ ID            : chr  "0001" "34560" "100041531"
     $ Date_Construct: POSIXct, format: "2018-03-10" "2015-03-21" "2012-02-20"
     $ Date_use      : POSIXct, format: "2007-08-02" "2007-10-31" "2008-08-13"
     $ Comp          : chr  "Revis" "Succ" "Revis"
    

    【讨论】:

    • 我添加了一些示例数据,但不确定它是否有助于回答问题。本质上,我想将所有日期列从因子更改为日期。我可以单独为所有 10 个库做这件事,但想知道是否有办法同时为所有 10 个库做这件事。我不确定您的代码中的 across 是什么。
    • acrossdplyr 的最新成员,它将满足您的需求:它将 dmy() 应用于所有包含“日期”的变量(忽略大小写)。
    • 谢谢。但不幸的是,该代码不起作用。日期列的类别仍然是因素。我收到 20 条警告,格式为 1: Problem with `mutate()` input `..1`. i All formats failed to parse. No formats found. i Input `..1` is `across(contains("Date", ignore.case = TRUE), dmy)`. 2: All formats failed to parse. No formats found.
    • 您需要提供一些可重现的数据。该错误表明 lubridate 无法将字符串解析为日期:让我们更仔细地查看数据的结构。
    • 很高兴它成功了。在mutate 中使用across 时,您将参数作为另一个参数而不是括号传递给函数,如下所示:dfq %&gt;% mutate(across(contains("Date", ignore.case = TRUE), str_remove_all, " 00:00")))
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-11-23
    • 2015-12-13
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多