【发布时间】:2019-06-24 22:09:20
【问题描述】:
我正在尝试将我的数据框中的一列的值映射到一个新值并使用 UDF 将其放入一个新列中,但我无法让 UDF 接受一个不是列的参数.例如我有一个这样的数据框dfOriginial:
+-----------+-----+
|high_scores|count|
+-----------+-----+
| 9| 1|
| 21| 2|
| 23| 3|
| 7| 6|
+-----------+-----+
我正在尝试了解数值所在的 bin,因此我可以构建一个 bin 列表,如下所示:
case class Bin(binMax:BigDecimal, binWidth:BigDecimal) {
val binMin = binMax - binWidth
// only one of the two evaluations can include an "or=", otherwise a value could fit in 2 bins
def fitsInBin(value: BigDecimal): Boolean = value > binMin && value <= binMax
def rangeAsString(): String = {
val sb = new StringBuilder()
sb.append(trimDecimal(binMin)).append(" - ").append(trimDecimal(binMax))
sb.toString()
}
}
然后我想像这样转换我的旧数据框以制作dfBin:
+-----------+-----+---------+
|high_scores|count|bin_range|
+-----------+-----+---------+
| 9| 1| 0 - 10 |
| 21| 2| 20 - 30 |
| 23| 3| 20 - 30 |
| 7| 6| 0 - 10 |
+-----------+-----+---------+
这样我就可以通过调用.groupBy("bin_range").count() 来最终获得垃圾箱实例的计数。
我正在尝试通过使用带有 UDF 的 withColumn 函数来生成 dfBin。
这是我尝试使用的 UDF 代码:
val convertValueToBinRangeUDF = udf((value:String, binList:List[Bin]) => {
val number = BigDecimal(value)
val bin = binList.find( bin => bin.fitsInBin(number)).getOrElse(Bin(BigDecimal(0), BigDecimal(0)))
bin.rangeAsString()
})
val binList = List(Bin(10, 10), Bin(20, 10), Bin(30, 10), Bin(40, 10), Bin(50, 10))
val dfBin = dfOriginal.withColumn("bin_range", convertValueToBinRangeUDF(col("high_scores"), binList))
但它给了我一个类型不匹配:
Error:type mismatch;
found : List[Bin]
required: org.apache.spark.sql.Column
val valueCountsWithBin = valuesCounts.withColumn(binRangeCol, convertValueToBinRangeUDF(col(columnName), binList))
看到 UDF 的定义让我觉得它应该可以很好地处理转换,但显然不是,有什么想法吗?
【问题讨论】:
标签: scala apache-spark apache-spark-sql user-defined-functions