【发布时间】:2016-04-15 09:47:47
【问题描述】:
我使用 python 脚本来处理使用 SPARK 存储在 hdfs 中的 xml 文档。
files = sc.wholeTextFiles("hdfs://xxx/data").collect()
这里的 /data 目录有超过 10,000 个 xml 文档。我必须使用 SPARK 处理所有文件。但是当我尝试运行时,我收到了以下错误消息:
WARN TaskSetManager: Stage 0 contains a task of very large size (451 KB). The maximum recommended task size is 100 KB
如何纠正这个错误。谁能帮我解决这个问题?
提前致谢。
【问题讨论】:
-
这里只使用单机处理(使用SPARK)。我可以为此使用并行机制吗?
-
我现在得到了答案。我使用以下代码最大化了分区: files = sc.wholeTextFiles("hdfs://xxx/data",10).collect()
标签: python hadoop apache-spark warnings pyspark