【发布时间】:2021-02-10 11:54:35
【问题描述】:
我正在尝试从 Azure 数据块读取 csv 文件作为数据帧。 标题列(当我在 excel 中打开时)如下。 CSV 文件中的所有标题名称均采用以下格式。
例如
"City_Name"ZYD_CABC2_EN:0TXTMD
基本上我只想将引号内的字符串作为我的标题 (City_Name) 并忽略字符串的第二部分 (ZYD_CABC2_EN:0TXTMD)
sales_df = spark.read.format("csv").load(input_path + '/sales_2020.csv', inferSchema = True, header=True)
【问题讨论】:
标签: dataframe csv apache-spark pyspark