【发布时间】:2023-04-02 21:34:01
【问题描述】:
我正在尝试在 Databricks (pyspark) 中导入 parquet 文件并不断收到错误
df = spark.read.parquet(inputFilePath)
AnalysisException: Column name "('my data (beta)', "Meas'd Qty")" contains invalid character(s). Please use alias to rename it.
我尝试了this post 中的建议,使用.withColumnRenamed 就像this post 一样,也使用alias 就像
(spark.read.parquet(inputFilePath)).select(col("('my data (beta)', "Meas'd Qty")").alias("col")).show()
但总是得到同样的错误。如何遍历每一列以用下划线 _ 替换任何无效字符,甚至删除所有无效字符?
【问题讨论】:
-
谢谢,我都试过了,但得到了同样的错误 - 错误发生在
spark.read.parquet(inputFilePath)行,我所做的似乎没有给我不同的结果 -
你可以试试 df = df.withColumnRenamed("Foo Bar", "foobar") 。删除列中的额外空间
-
就像我说的,我在这样做时遇到了同样的错误
-
您能否提供示例输入文件以更清楚地了解列名?