【发布时间】:2020-05-03 12:45:28
【问题描述】:
我有一个大文件,以一种非常不方便的方式组织,所有值在一列中,每个单元格有七个值,最后两行除外,如下所示:
df <- c('(98440=9) (98450=9) (98500=9) (98520=9) (98530=9) (98540=9) (98550=9)',
'(98555=9) (98560=9) (98570=9) (98590=9) (98600=9) (98620=9) (98630=9)',
'(98690=9) (98920=3) (98930=5) (98940=5) (98950=9) (98990=11) (99900=-1)',
'(99910=11) (99920=-1) (99930=11)',
'(-1=-1) (-2=-1) (99999=-1)')
我只想保留数值,同时将第一个和第二个数值分成两列,其中'='是分隔符,如:
x y
<dbl> <dbl>
1 98440 9
2 98450 9
3 98500 9
我管理两个使用单独的 dplyr、子字符串和其他一些代码来实现这一点。但是,我最终丢失了很多数据。关于如何解决这个问题并保留所有数据的任何想法?我知道这是一个经常被问到的问题,但这个数据集比我见过的任何其他数据集都要混乱。
【问题讨论】: