【问题标题】:Record larger than the Split size in AWS GLUE?记录大于 AWS GLUE 中的拆分大小?
【发布时间】:2022-07-22 16:25:49
【问题描述】:

我是 AWS Glue 和 Spark 的新手。 我在此构建我的 ETL。 当我的 s3 与大约 200mb 的文件连接时,不会阅读此内容。 错误在于

An error was encountered:
An error occurred while calling o99.toDF.
: org.apache.spark.SparkException: Job aborted due to stage failure: Task 1 in stage 10.0 failed 1 times, most recent failure: Lost task 1.0 in stage 10.0 (TID 16) (91ec547edca7 executor driver): com.amazonaws.services.glue.util.NonFatalException: Record larger than the Split size: 67108864

更新 1: 当使用jq 拆分我的 json 文件(200mb)时,AWS GLUE 分为两部分,通常两部分一起读取

我的解决方案是一个 lambda 拆分文件,但我想知道 aws 胶水拆分是如何工作的 感谢和问候

【问题讨论】:

  • 这里有点猜测。但我认为它抱怨您的 record 超出了 file 拆分大小。这些是什么类型的文件?也许您在 csv 上指定了错误的分隔符?
  • 是JSON文件,我以为AWS会自动拆分大文件。
  • Glue/Spark 会拆分文件,但不会拆分记录。我认为这是问题所在。也许有一种方法可以增加容纳这些大记录的最大拆分大小。或者您的 JSON 可能存在格式问题
  • 嗯,例如我的 JSON 有 40K 记录,所以问题是 JSON 格式。但是对于小文件(50mb)都很好:/

标签: apache-spark pyspark aws-glue aws-glue-data-catalog aws-glue-spark


【解决方案1】:

@Vitualizz Uzumaki 你能在哪里解决这个问题?

【讨论】:

猜你喜欢
  • 1970-01-01
  • 2019-01-15
  • 2020-06-01
  • 2015-08-13
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多