【发布时间】:2023-03-31 05:33:01
【问题描述】:
所以我试图 2 加入 2 个数据帧,这样做我得到以下错误。
TypeError: 'Column' 对象不可调用
我将数据加载为简单的 csv 文件,以下是从 CSV 加载的架构。
根 |-- movie_id,title: string (nullable = true)
根 |-- user_id,movie_id,tag,timestamp: string (nullable = true)
以下是我的加载实现
df1 = spark.read.format("csv").option("header", "true").load("collaborative/titles.csv", header=True, sep="|")
df2 = spark.read.format("csv").option("header", "true").load("collaborative/tags.csv", header=True, sep="|")
df1.printSchema()
df2.printSchema()
df1.alias("df1").join(df2.alias("df2"), col("df1.movie_id").equalTo(col("df2.movie_id"))).select(col("df2.*"))
【问题讨论】:
标签: python pyspark pyspark-sql pyspark-dataframes