【发布时间】:2018-02-24 12:40:29
【问题描述】:
我有一个文本文件,其以下数据没有特定格式
abc*123 *180109*1005*^*001*0000001*0*T*:~
efg*05*1*X*005010X2A1~
k7*IT 1234*P*234df~
hig*0109*10052200*Rq~
abc*234*9698*709870*99999*N:~
tng****MI*917937861~
k7*IT 8876*e*278df~
dtp*D8*20171015~
我希望输出如下两个文件:
基于字符串abc,我想拆分文件。
文件 1:
abc*123 *180109*1005*^*001*0000001*0*T*:~
efg*05*1*X*005010X2A1~
k7*IT 1234*P*234df~
hig*0109*10052200*Rq~
文件 2:
abc*234*9698*709870*99999*N:~
tng****MI*917937861~
k7*IT 8876*e*278df~
dtp*D8*20171015~
并且文件名应该是 IT 名称(行以 k7 开头)所以 file1 名称应该是 IT_1234 第二个文件名应该是 IT_8876。
【问题讨论】:
-
每个新文件会有多少数据?
-
为什么要用 Spark 做这个?为什么不说,bash?文件在 HDFS 上吗?
-
是的,您能告诉我们这样做的最终目标吗?将帮助我们找到合适的解决方案。
-
是的,我们每小时获得 2.5 GB 的数据,文件位于 HDFS 中。
标签: scala apache-spark