【发布时间】:2020-06-13 13:39:08
【问题描述】:
我正在尝试解析 pyspark 数据框的单列并获取具有多列的数据框。我的数据框如下:
a b dic
0 1 2 {'d': 1, 'e': 2}
1 3 4 {'d': 7, 'e': 0}
2 5 6 {'d': 5, 'e': 4}
我想解析 dic 列并获取数据框,如下所示。如果可能,我期待使用 pandas UDF。我的预期输出如下:
a b c d
0 1 2 1 2
1 3 4 7 0
2 5 6 5 4
这是我的解决方案:
schema = StructType([
StructField("c", IntegerType()),
StructField("d", IntegerType())])
@pandas_udf(schema,PandasUDFType.GROUPED_MAP)
def do_someting(dic_col):
return (pd.DataFrame(dic_col))
df.apply(add_json).show(10)
但这给出了错误'DataFrame' object has no attribute 'apply'
【问题讨论】:
标签: python pandas apache-spark pyspark apache-spark-sql