【问题标题】:PySpark: How to create a nested JSON from spark data frame?PySpark:如何从 spark 数据框创建嵌套的 JSON?
【发布时间】:2019-04-27 21:33:20
【问题描述】:

我正在尝试从我的 spark 数据帧中创建一个嵌套的 json,该数据帧具有以下结构的数据。下面的代码正在创建一个带有键和值的简单 json。你能帮忙吗

df.coalesce(1).write.format('json').save(data_output_file+"createjson.json", overwrite=True)

更新1: 根据@MaxU 的回答,我将 spark 数据框转换为 pandas 并使用 group by。它将最后两个字段放入嵌套数组中。我如何首先将类别和计数放入嵌套数组中,然后在该数组中放入子类别和计数。

示例文本数据:

Vendor_Name,count,Categories,Category_Count,Subcategory,Subcategory_Count
Vendor1,10,Category 1,4,Sub Category 1,1
Vendor1,10,Category 1,4,Sub Category 2,2
Vendor1,10,Category 1,4,Sub Category 3,3
Vendor1,10,Category 1,4,Sub Category 4,4

j = (data_pd.groupby(['vendor_name','vendor_Cnt','Category','Category_cnt'], as_index=False)
             .apply(lambda x: x[['Subcategory','subcategory_cnt']].to_dict('r'))
             .reset_index()
             .rename(columns={0:'subcategories'})
             .to_json(orient='records'))

[{
        "vendor_name": "Vendor 1",
        "count": 10,
        "categories": [{
            "name": "Category 1",
            "count": 4,
            "subCategories": [{
                    "name": "Sub Category 1",
                    "count": 1
                },
                {
                    "name": "Sub Category 2",
                    "count": 1
                },
                {
                    "name": "Sub Category 3",
                    "count": 1
                },
                {
                    "name": "Sub Category 4",
                    "count": 1
                }
            ]
        }]

【问题讨论】:

  • @MaxU 我已经更新了

标签: python-3.x apache-spark pyspark pyspark-sql


【解决方案1】:

您需要为此重新构建整个数据框。

"subCategories" 是一个结构体类型。

from pyspark.sql import functions as F
df.withColumn(
  "subCategories",
  F.struct(
    F.col("subCategories").alias("name"),
    F.col("subcategory_count").alias("count")
  )
)

然后,groupBy 并使用 F.collect_list 创建数组。

最后,您只需在数据框中包含 1 条记录即可获得您期望的结果。

【讨论】:

  • 嗨@Steven,我怎样才能将此答案扩展到更嵌套的 json?
【解决方案2】:

在 python/pandas 中执行此操作的最简单方法是使用一系列嵌套生成器,使用 groupby 我认为:

def split_df(df):
    for (vendor, count), df_vendor in df.groupby(["Vendor_Name", "count"]):
        yield {
            "vendor_name": vendor,
            "count": count,
            "categories": list(split_category(df_vendor))
        }

def split_category(df_vendor):
    for (category, count), df_category in df_vendor.groupby(
        ["Categories", "Category_Count"]
    ):
        yield {
            "name": category,
            "count": count,
            "subCategories": list(split_subcategory(df_category)),
        }

def split_subcategory(df_category):
    for row in df.itertuples():
        yield {"name": row.Subcategory, "count": row.Subcategory_Count}

list(split_df(df))
[
    {
        "vendor_name": "Vendor1",
        "count": 10,
        "categories": [
            {
                "name": "Category 1",
                "count": 4,
                "subCategories": [
                    {"name": "Sub Category 1", "count": 1},
                    {"name": "Sub Category 2", "count": 2},
                    {"name": "Sub Category 3", "count": 3},
                    {"name": "Sub Category 4", "count": 4},
                ],
            }
        ],
    }
]

要将其导出到json,您需要一种方法来导出np.int64

【讨论】:

  • 哇。非常感谢
  • @ShankarPanda 你怎么能接受这个答案,它甚至不在火花......
猜你喜欢
  • 2020-01-21
  • 1970-01-01
  • 2019-11-27
  • 2020-12-22
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2021-10-13
  • 2019-11-24
相关资源
最近更新 更多