【发布时间】:2021-08-15 08:46:57
【问题描述】:
我存储了一个大文件。我想在 Databricks (pyspark) 中加载和处理这个文件。但是由于文件很大,一次加载整个文件然后处理它会效率低下。所以我想分部分加载这个文件,然后在下一部分加载时同时处理它。那么我怎样才能部分地阅读这个文件呢? 我想到的一个想法是使用结构化流。但在这方面,整个文件也被单批加载。那么如何分批加载呢?
【问题讨论】:
标签: apache-spark pyspark databricks spark-structured-streaming