【发布时间】:2018-11-16 16:30:09
【问题描述】:
我想使用 pyspark 读取 n 个 csv 文件。 csv 具有相同的架构,但列名不同。
在阅读这些文件时,我想创建一个额外的列“管道”,其中包含第一列名称的子字符串。
我该如何实现?
df = spark.read.format("csv") \
.option("header", True) \
.load(path + "*.csv")
.withColumn("pipeline",
【问题讨论】:
标签: apache-spark pyspark databricks