【发布时间】:2021-05-19 10:00:41
【问题描述】:
我尝试读取包含嵌套列的 csv 文件。
例子:
name,age,addresses_values
person_1,30,["France","street name",75000]
阅读时我厌倦了分配如下模式:
csv_schema = StructType([
StructField('name', StringType(), True),
StructField('age', LongType(), True),
StructField('addresses_values', StructType([
StructField('country', StringType(), True),
StructField('street', StringType(), True),
StructField('ZipCode', StringType(), True),
]), True),
])
path = "file:///path_to_my_file"
dataset_df = spark.read.csv(path=path, header=True,schema=csv_schema)
引发此异常:
pyspark.sql.utils.AnalysisException:CSV 数据源不支持 structcountry:string,street:string,ZipCode:string 数据类型。;
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql