【发布时间】:2015-02-26 01:45:58
【问题描述】:
我正在尝试使用S3DistCp 来解决 Hadoop 中的小文件问题。它正在工作,但输出有点烦人。我正在处理的文件路径如下:
s3://test-bucket/test/0000eb6e-4460-4b99-b93a-469d20543bf3/201402.csv
并且该文件夹中可以有多个文件。我想按文件夹名称分组,所以我在 s3distcp 中使用以下分组参数:
--groupBy '.*(........-.........-....-............).*'
它确实对文件进行了分组,但它仍然会导致多个输出文件夹,每个文件夹中有一个文件。有没有办法将分组的文件输出到一个文件夹中,而不是多个?
谢谢!
【问题讨论】:
-
你发现了吗?我也有同样的问题。
-
@Binal Patel:如果您发布您的 s3distCp 生成的日志,我将能够更好地帮助您。
标签: hadoop amazon-web-services amazon-s3 emr