【发布时间】:2018-09-27 20:05:44
【问题描述】:
我在 aws s3 (s3://bucket1/rawFile.csv) 中有大小约为 15GB 的巨大 csv 文件。假设架构看起来像这样:
cust_id, account_num, paid_date, cust_f_name
1001, 1234567890, 01/01/2001, Jonathan
我正在尝试屏蔽帐号列和客户名称,并创建一个新的 maskedFile.csv 并将其存储在另一个 aws s3 存储桶 (s3://bucket2/maskedFile.csv) 中,如下所示:
cust_id, account_num, paid_date, cust_f_name
1001, 123*******, 01/01/2001, Jon*******
只需使用支付数据的一个快照完成一次。
我该怎么做?我应该使用什么工具来实现这一目标?请告诉我。
【问题讨论】:
标签: csv unix amazon-s3 bigdata masking