【问题标题】:Finding cardinality of multiple categorical columns in pyspark dataframe在 pyspark 数据框中查找多个分类列的基数
【发布时间】:2017-05-02 16:17:04
【问题描述】:

我有一个数据框中的分类列列表,我想找到每个列的基数。请指导我。 我正在尝试这个

data.select(cat_columns).distinct().count()

但不知何故,这不起作用。 谢谢

【问题讨论】:

标签: python dataframe pyspark


【解决方案1】:

approx_count_distinct() 如果你想迭代一个大的数据框,应该在这里做这个技巧。

不过,考虑到它允许 rsd – 最大估计误差(默认 = 0.05)。对于 rsd

cols_cardinality = df_dataset.select(*[approx_count_distinct(c).alias(c) for c in df_dataset.columns])

【讨论】:

    猜你喜欢
    • 2018-12-07
    • 1970-01-01
    • 1970-01-01
    • 2021-12-13
    • 2021-12-29
    • 1970-01-01
    • 2019-12-05
    • 2021-01-26
    • 2018-04-19
    相关资源
    最近更新 更多