【问题标题】:Size issue while processing very larger size documents in SPARK using python使用 python 在 SPARK 中处理非常大的文档时出现大小问题
【发布时间】:2016-04-15 09:47:47
【问题描述】:

我使用 python 脚本来处理使用 SPARK 存储在 hdfs 中的 xml 文档。

files = sc.wholeTextFiles("hdfs://xxx/data").collect()

这里的 /data 目录有超过 10,000 个 xml 文档。我必须使用 SPARK 处理所有文件。但是当我尝试运行时,我收到了以下错误消息:

WARN TaskSetManager: Stage 0 contains a task of very large size (451 KB). The maximum recommended task size is 100 KB

如何纠正这个错误。谁能帮我解决这个问题?

提前致谢。

【问题讨论】:

  • 这里只使用单机处理(使用SPARK)。我可以为此使用并行机制吗?
  • 我现在得到了答案。我使用以下代码最大化了分区: files = sc.wholeTextFiles("hdfs://xxx/data",10).collect()

标签: python hadoop apache-spark warnings pyspark


【解决方案1】:

我现在得到了答案。我使用以下代码最大化了分区:files = sc.wholeTextFiles("hdfs://xxx/data",10).collect()

【讨论】:

    猜你喜欢
    • 2012-08-17
    • 1970-01-01
    • 1970-01-01
    • 2010-10-07
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多