【问题标题】:How to read file in pyspark from HDFS如何从 HDFS 读取 pyspark 中的文件
【发布时间】:2021-09-07 20:42:28
【问题描述】:

我已经使用 sqoop 将数据从 mysql 摄取到 hdfs。

我想在 pyspark 中读取此文件。如何读取 part_m_0000 以及如何在 hdfs 中找到文件路径。

【问题讨论】:

  • 如果您可以edit 您的问题以文本形式包含命令,并显示您的 Sqoop 命令,并显示您已经在 Spark 中尝试过的内容,将会很有用

标签: hadoop pyspark hdfs


【解决方案1】:

如果可能,Spark 可以(并且应该)读取整个目录

如何在 hdfs 中找到文件的路径。

路径是/user/root/etl_project,正如您所展示的,我敢肯定也在您的 Sqoop 命令中

我如何阅读 part_m_0000

这最终取决于您告诉 Sqoop 写入的输出格式。您应该更喜欢写入 Parquet 文件,Spark 有一个本机阅读器。

spark.read.parquet("/user/root/etl_project")

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2016-06-20
    • 1970-01-01
    • 2013-06-13
    • 1970-01-01
    • 1970-01-01
    • 2022-10-26
    • 1970-01-01
    相关资源
    最近更新 更多