【发布时间】:2016-10-03 16:34:09
【问题描述】:
我使用DataFrame.saveAsParquet() 命令在 Spark 上保存了 parquet 文件。
如何通过 python 代码删除/移除这个文件?
【问题讨论】:
标签: python apache-spark parquet
我使用DataFrame.saveAsParquet() 命令在 Spark 上保存了 parquet 文件。
如何通过 python 代码删除/移除这个文件?
【问题讨论】:
标签: python apache-spark parquet
这个镶木地板“文件”实际上是一个目录。 This answer 展示了如何删除包含文件的目录
import shutil
shutil.rmtree('/folder_name')
【讨论】:
由于@bsplosion 提到了HDFS,以下是您可以在 pySpark-script 中执行此操作的方法:
import subprocess
print("Deletion code:", subprocess.call(["hadoop", "fs", "-rm", "-r", "-skipTrash", "hdfs:/your/data/path"]))
# hadoop - calls hadoop
# fs - calls hadoops file system implementation
# -rm - calls the remove command
# -r - recursive removal in order to remove the entire directory
# -skipTrash - As it states: Skip the trash and directly remove everything
如果执行成功,则返回选择代码:0,否则返回选择代码:-1。
您可以在文档中阅读有关 hadoops -rm here 的更多信息。
【讨论】: