【发布时间】:2018-04-14 18:29:17
【问题描述】:
我正在检查我的 DF 中 6 列中的 2 列的 NULL 值。但是当我应用内置函数并使用 select 时,结果 DF 没有剩余的列。有没有更好的方法不使用 UDF。
handle_null_cols = [ 'col1', 'col3' ]
# df_null = df.select([ myFunc(col_name).alias(col_name) for col_name in df.columns ])
df_null = df.select( [ myFunc(col_name).alias(col_name) for col_name in handle_null_cols ])
df_null.printSchema() # Resultant DF has only 2 columns selected
col1:int
col3:int
需要重用相同的 DF df_null 以对最初在 df 中的所有列进行更多下游转换。
【问题讨论】:
标签: python apache-spark pyspark apache-spark-sql user-defined-functions