【发布时间】:2021-12-17 22:54:19
【问题描述】:
我正在尝试从数据块中的 dbfs 读取多个 json 文件。
raw_df = spark.read.json('/mnt/testdatabricks/metrics-raw/',recursiveFileLookup=True)
这仅返回 35 个文件的数据,而大约有 1600 个文件。
我尝试使用 pandas 读取一些文件(除了 35 个文件)并返回数据。
但是,当我尝试使用 pandas 读取所有 1600 个文件时,驱动程序失败。
import pandas as pd
from glob import glob
jsonFiles = glob('/dbfs/mnt/testdatabricks/metrics-raw/***/*.json')
dfList = []
for jsonFile in jsonFiles:
df = pd.read_json(jsonFile)
dfList.append(df)
print("written :", jsonFile )
dfTrainingDF = pd.concat(dfList, axis=0)
不确定为什么 spark 无法读取所有文件。
【问题讨论】:
标签: json pandas pyspark databricks