【问题标题】:calculating time difference in R计算 R 中的时间差
【发布时间】:2012-09-29 03:15:13
【问题描述】:

我的数据包含超过 300 万条记录,其中 start.time 和 end.time 作为两个变量。前10个obs如下:

   start.date start.time   end.date end.time
1  2012-07-13   15:01:32 2012-07-13 15:02:42
2  2012-07-05   18:26:31 2012-07-05 18:27:19
3  2012-07-14   20:23:21 2012-07-14 20:24:11
4  2012-07-29   16:09:54 2012-07-29 16:10:48
5  2012-07-21   14:58:32 2012-07-21 15:00:17
6  2012-07-04   15:36:31 2012-07-04 15:37:11
7  2012-07-22   18:28:31 2012-07-22 18:28:50
8  2012-07-09   21:08:42 2012-07-09 21:09:02
9  2012-07-05   09:44:52 2012-07-05 09:45:05
10 2012-07-02   18:50:47 2012-07-02 18:51:38

我需要计算 start.time 和 end.time 之间的差异。

我使用了以下代码:

mbehave11$diff.time <- difftime(mbehave11$end.time, mbehave11$start.time, units="secs")

但我收到此错误:

Error in as.POSIXlt.character(x, tz, ...) : 
  character string is not in a standard unambiguous format
In addition: Warning messages:
1: In is.na.POSIXlt(strptime(xx, f <- "%Y-%m-%d %H:%M:%OS", tz = tz)) :
  Reached total allocation of 1535Mb: see help(memory.size)

【问题讨论】:

标签: r datetime


【解决方案1】:

您必须将字符串转换为日期对象,然后才能进行日期/时间运算。试试这个:

a) 读取您的数据:

R> dat <- read.table(textConnection("start.date start.time end.date end.time
2012-07-13   15:01:32 2012-07-13 15:02:42
2012-07-05   18:26:31 2012-07-05 18:27:19 
2012-07-14   20:23:21 2012-07-14 20:24:11"), header=TRUE) 

b) 研究一项观察结果:

 R>  strptime( paste(dat[,1], dat[,2]), "%Y-%m-%d %H:%M:%S")
 [1] "2012-07-13 15:01:32" "2012-07-05 18:26:31" "2012-07-14 20:23:21" 

c) 在集合上工作,转换为数字:

 R> as.numeric(difftime(strptime(paste(dat[,1],dat[,2]),"%Y-%m-%d %H:%M:%S"),
                        strptime(paste(dat[,3],dat[,4]),"%Y-%m-%d %H:%M:%S"))) 
 [1] -70 -48 -50
 R> 

编辑大约七年后由下面的其他人编辑。

d) 只是为了解释上面的结果-70 -48 -50,请逐行查看示例:

[2012-07-13 15:01:32] - [2012-07-13 15:02:42] = -70 seconds,  
[2012-07-05 18:26:31] - [2012-07-05 18:27:19] = -48 seconds,  
[2012-07-14 20:23:21] - [2012-07-14 20:24:11] = -50 seconds

【讨论】:

  • 但是结果意味着什么?我的意思是结果 -70 -48 -50.. 我怎么能将它们解释为以分钟为单位的差异?
  • 见help(difftime)——有一个默认为秒的单位参数,你可以覆盖它。但只是为了检查,看看第一行的-70,想想你设置的第一行的时间差是多少:七十秒。如果你想要分钟,请使用units="min")。就这么简单。
  • 更新了答案以显示结果的含义,因为我也花了一段时间才弄明白
  • 我一般不喜欢其他人编辑我的答案而不明确是他们。您随时可以在您的名下发布新答案。在我的书中,这更清楚一点。
【解决方案2】:

我认为你可以使用 lubridate 包
它有一个名为 ymd_hms
的方法 您可以使用它从字符串中获取时间: 大数据集速度更快

library(lubridate)
dat <- read.table(textConnection("start.date start.time end.date end.time
2012-07-13   15:01:32 2012-07-13 15:02:42
2012-07-05   18:26:31 2012-07-05 18:27:19 
2012-07-14   20:23:21 2012-07-14 20:24:11"), header=TRUE)
starttime = ymd_hms(paste(dat[,1], dat[,2]))
endtime = ymd_hms(paste(dat[,3], dat[,4]))
interval = difftime(endtime,starttime,units = "secs")

或者你可以一行完成,但是对于大数据集需要更长的时间:

difftime(paste(dat[,3], dat[,4]),paste(dat[,1], dat[,2]),units = "secs")

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2019-06-17
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-05-21
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多