【发布时间】:2020-10-24 23:05:51
【问题描述】:
我的数据集有一个相当复杂的问题。它包括 600,000 个观测值。主要问题与数据收集过程有关。作为示例,我提供了以下数据集,该数据集与我手头的真实数据具有相似的结构:
df <- data.frame(row_number = c(1,2,3,4,5,6,7,8,9),
date = c("2020-01-01", "2020-01-01","2020-01-01","2020-01-02","2020-01-02","2020-01-02","2020-01-03","2020-01-03","2020-01-03"),
time = c("01:00:00","09:00:00","17:00:00", "09:00:00","01:00:00","17:00:00", "01:00:00","NA","09:00:00"),
order = c(1,2,3,1,2,3,1,2,3),
value = c(10,20,30,40,10,20,30,NA,50)
我知道每天记录 3 次数据(顺序变量)。即在每一天,第一次记录数据是 1:00:00,第二次记录数据是 09:00:00,最后一次记录数据是 17: 00:00。
但是,收集数据的人犯了错误。例如,在 row_num 4 中,时间应该是 01:00:00,但数据采集器记录的是 09:00:00。 另外,在第 8 行中,我预计时间应该是 9:00:00,但是,由于没有信息记录在 value 中,因此该人没有填写该行,而是将时间记录为 09:00:00 3号订单,而预计3号订单的时间是17:00:00。
鉴于我们知道数据收集的顺序,我想知道您是否有任何解决方案来处理数据集中的此类问题。
提前感谢您的宝贵时间。
【问题讨论】: