【问题标题】:PySpark reading multiple files while creating new column containing existing column namePySpark 在创建包含现有列名的新列时读取多个文件
【发布时间】:2018-11-16 16:30:09
【问题描述】:

我想使用 pyspark 读取 n 个 csv 文件。 csv 具有相同的架构,但列名不同。

在阅读这些文件时,我想创建一个额外的列“管道”,其中包含第一列名称的子字符串。

我该如何实现?

 df = spark.read.format("csv") \
                .option("header", True) \
                .load(path + "*.csv")
                .withColumn("pipeline", 

【问题讨论】:

    标签: apache-spark pyspark databricks


    【解决方案1】:
    df = spark.read.format("csv") \
                    .option("header", "false") \
                    .load(path + "*.csv")
                    .toDF('header_1')
                    .withColumn("pipeline", lit(path))
    

    【讨论】:

    • 请在您的回答中添加描述或评论
    • 列标题未知,如何检索'header_1'?
    猜你喜欢
    • 2017-06-15
    • 1970-01-01
    • 1970-01-01
    • 2019-08-12
    • 2019-12-27
    • 2020-08-10
    • 2023-02-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多