【问题标题】:pyspark: read.parquet while skip missing filespyspark:read.parquet 同时跳过丢失的文件
【发布时间】:2019-05-11 06:53:48
【问题描述】:

我认为这个问题与Spark : Read file only if the path exists 有关,但另一个是针对 Scala 的。

我正在读取来自hdfs的文件:

df_list = sqlContext.read.option('basePath','/data/').parquet(*search_path)

问题是如果缺少文件,read 命令会抛出异常并停止。

有没有办法让read.parquet跳过search_path列表中丢失的文件?

非常感谢

【问题讨论】:

    标签: pyspark


    【解决方案1】:

    你可以使用同样的方法:使用python hdfs客户端测试目录是否为空。

    更多用法请参考this link

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2011-12-29
      • 2019-02-14
      • 2012-07-21
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多