【发布时间】:2020-02-11 21:22:42
【问题描述】:
我正在尝试为 sparklyr 数据框创建最小值、最大值和平均值列。我只想在计算中按行使用该大数据框中的 5 列。列中有许多 NaN 值,这可能是计算的东西。在标准 R 中,使用的代码是:
df_train$MinEncoding <- spark_apply(df_train,f=min ,columns=[,EncodingFeatures], 1, FUN=min,na.rm=TRUE)
df_train$MaxEncoding <- spark_apply(df_train[,EncodingFeatures], 1, FUN=max,na.rm=TRUE)
df_train$MeanEncoding <- spark_apply(df_train[,EncodingFeatures], 1, FUN=mean,na.rm=TRUE)
我试过了
df_train %>% spark_apply(function(df) {dplyr::mutate(df, MeanLicenceEncoding = mean(LicenceEncodingFeatures))})
但是 spark 中止了这项工作。有人可以帮忙吗?
【问题讨论】:
标签: r dplyr databricks sparklyr azure-databricks