【问题标题】:Spark SQL table partition File Not FoundSpark SQL 表分区文件未找到
【发布时间】:2018-03-02 05:52:32
【问题描述】:

我有一个 spark 集群,用于运行 Spark SQL 应用程序。我正在尝试表分区的 Spark SQL 功能。当我摄取数据时,我收到一个文件未找到异常,指出文件 X 不存在,该文件与我正在摄取的数据相关。这种行为只发生在表的某些特定字段上,对于其他字段,我能够成功插入数据并稍后查询。另一个观察结果是,如果我关闭远程工作人员,摄取对于任何领域都可以正常工作。我正在使用 Spark 2.2,独立模式。我没有分布式文件系统,我在摄取完成后手动同步文件。任何人都知道为什么会发生这种行为?

【问题讨论】:

    标签: apache-spark apache-spark-sql


    【解决方案1】:

    这似乎是因为您没有 HDFS。如果在工作节点接受任务时您有 HDFS,则这些文件可供他们使用。因为您没有 HDFS,所以当任务传递给 Worker 节点时,他们看不到他们应该从中读取数据的位置。

    我会说您应该使用 HDFS 或安装 NFS,以便所有节点都可以访问相同的文件,而不管工作节点在哪里。

    我希望这会有所帮助。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-04-08
      • 1970-01-01
      • 2018-10-04
      • 1970-01-01
      • 1970-01-01
      • 2016-03-06
      • 1970-01-01
      • 2020-10-11
      相关资源
      最近更新 更多