【发布时间】:2017-05-24 21:00:38
【问题描述】:
使用pyspark 或sparkr(最好同时使用),我怎样才能得到两个DataFrame 列的交集?例如,在sparkr 我有以下DataFrames:
newHires <- data.frame(name = c("Thomas", "George", "George", "John"),
surname = c("Smith", "Williams", "Brown", "Taylor"))
salesTeam <- data.frame(name = c("Lucas", "Bill", "George"),
surname = c("Martin", "Clark", "Williams"))
newHiresDF <- createDataFrame(newHires)
salesTeamDF <- createDataFrame(salesTeam)
#Intersect works for the entire DataFrames
newSalesHire <- intersect(newHiresDF, salesTeamDF)
head(newSalesHire)
name surname
1 George Williams
#Intersect does not work for single columns
newSalesHire <- intersect(newHiresDF$name, salesTeamDF$name)
head(newSalesHire)
as.vector(y) 中的错误:没有将这个 S4 类强制为 向量
如何让intersect 用于单列?
【问题讨论】:
-
在 pyspark
spark.createDataFrame(["a","b","x"],StringType()).intersect(spark.createDataFrame(["z","y","x"],StringType()))中运行良好
标签: apache-spark pyspark sparkr