【发布时间】:2018-11-10 23:32:24
【问题描述】:
我希望解析 R 中的文本文件以作为 data.frame 加载。我有一个带有固定宽度数据的长文本文件,由部分(ID)和小节(SUB)分隔。每个部分的长度是可变的。我正在寻找创建两个数据框,一个用于 ID 部分,一个用于 SUB 部分。示例数据如下:
Header 1
METRIC 0.30 10.00
ID K0107050 Aa
0.06 15.24 14.40 14.40 7.13 0.13 0.19 1
0.17 14.35 13.57 13.57 6.40 0.12 0.18 1
SUB
1.000 1.000 0.093 0.11 0.11 301
1.000 1.000 0.093 0.11 0.11 61
ID K0129050 Aa
0.06 26.35 24.90 24.90 10.88 0.62 0.88 1
0.15 25.35 23.96 23.96 10.93 0.55 0.74 1
SUB
3.000 3.000 0.506 0.53 0.53 102
4.000 4.000 0.514 0.55 0.55 118
我想要的数据框是:
DF1
Header 1 K0107050 Aa 0.06 15.24 14.40 14.40 7.13 0.13 0.19 1
Header 1 K0107050 Aa 0.17 14.35 13.57 13.57 6.40 0.12 0.18 1
Header 1 K0129050 Aa 0.06 26.35 24.90 24.90 10.88 0.62 0.88 1
Header 1 K0129050 Aa 0.15 25.35 23.96 23.96 10.93 0.55 0.74 1
DF2
Header 1 K0107050 Aa 1.000 1.000 0.093 0.11 0.11 301
Header 1 K0107050 Aa 1.000 1.000 0.093 0.11 0.11 61
Header 1 K0129050 Aa 3.000 3.000 0.506 0.53 0.53 102
Header 1 K0129050 Aa 4.000 4.000 0.514 0.55 0.55 118
鉴于文本文件中的不同部分,我已经使用 readLines() 了,但在那之后就卡住了。 谢谢
【问题讨论】:
-
在 ID 和 SUB 之后总是 2 行吗?
-
ID 和 SUB 后面还有很多行,行数不一致。我只是提供了上面的例子。
-
您想对
SUB部分末尾的空白列做什么?只需填写NA? -
空白列只是换行符,所以什么都没有