【问题标题】:S3DistCp Grouping by FolderS3DistCp 按文件夹分组
【发布时间】:2015-02-26 01:45:58
【问题描述】:

我正在尝试使用S3DistCp 来解决 Hadoop 中的小文件问题。它正在工作,但输出有点烦人。我正在处理的文件路径如下:

s3://test-bucket/test/0000eb6e-4460-4b99-b93a-469d20543bf3/201402.csv

并且该文件夹中可以有多个文件。我想按文件夹名称分组,所以我在 s3distcp 中使用以下分组参数:

--groupBy '.*(........-.........-....-............).*'

它确实对文件进行了分组,但它仍然会导致多个输出文件夹,每个文件夹中有一个文件。有没有办法将分组的文件输出到一个文件夹中,而不是多个?

谢谢!

【问题讨论】:

  • 你发现了吗?我也有同样的问题。
  • @Binal Patel:如果您发布您的 s3distCp 生成的日志,我将能够更好地帮助您。

标签: hadoop amazon-web-services amazon-s3 emr


【解决方案1】:

截至 2015 年 11 月 20 日,这是 S3DistCp 的行为。它将基于源目录创建多个目录。它不会跨目录组合。

【讨论】:

    【解决方案2】:

    我想你可以试试这个: --groupBy ".*/(........-.........-....-............)/.*"

    在您的示例中,您应该使用类似:--src "s3://test-bucket/test/"

    这样您将拥有多个文件夹,这些文件夹中的所有文件都合并在一起。

    【讨论】:

    • 我正在尝试找出类似的东西,但无法实现。
    猜你喜欢
    • 1970-01-01
    • 2019-10-17
    • 1970-01-01
    • 2018-01-19
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-11-03
    • 1970-01-01
    相关资源
    最近更新 更多