【发布时间】:2020-10-01 09:33:17
【问题描述】:
我正在使用预定义架构的 pyspark 读取 csv 文件。
schema = StructType([
StructField("col1", IntegerType(), True),
StructField("col2", StringType(), True)
StructField("col3", FloatType(), True)
])
df = spark.sqlContext.read
.schema(schema)
.option("header",true)
.option("delimiter", ",")
.csv(path)
现在在 csv 文件中,col1 中有浮点值,col3 中有字符串值。我需要引发异常并获取这些列的名称(col1,col3),因为这些列包含的数据类型与架构中定义的数据类型不同。
我如何做到这一点?
【问题讨论】:
标签: scala csv apache-spark pyspark apache-spark-sql