【发布时间】:2015-06-30 06:08:45
【问题描述】:
我有一个包含 485k 字符串 (1.1 GB) 的数据集。
每个字符串包含大约 700 个字符,包含大约 250 个变量(每个变量 1-16 个字符),但它没有任何拆分标记。每个变量的长度是已知的。用符号,修改和标记数据的最佳方法是什么?
例如: 我有这样的字符串:
0123456789012...
1234567890123...
和长度数组:
5,3,1,4,...
那么我应该是这样的:
01234,567,8,9012,...
12345,678,9,0123,...
谁能帮我解决这个问题?我最喜欢 Python 或 R 工具...
【问题讨论】:
-
R中的类似选项是read.fwf
标签: python r string split dataset