【发布时间】:2022-07-06 17:49:22
【问题描述】:
我有一个文本文件的问题:
1 -0.087 0.019 -0.01 -0.046 -0.091 0.045
2 0.049 0.069 0.043 0.072 -0.021 -0.064
3 0.077 -0.079 -0.06 -0.021 -0.019 -0.096
4 0.026 0.07 -0.07 -0.035 0.072 0.088
5 0.038 0.046 -0.037 -0.008 0.03 0.091
6 0.005 0.032 -0.086 -0.038 0.091 0.023
7 0.038 0.046 -0.037 -0.008 0.03 0.091
8 0.005 0.032 -0.086 -0.038 0.091 0.023
9 0.052 0.022 -0.017 -0.006 -0.022 -0.059
10 -0.095 0.061 -0.042 0.057 0.012 0.023
里面有好几列。 通常,该方案看起来像第一列是标识符 (ID),随后的每一列都是数字。我想一起计算所有列的中位数、平均值和百分位数,而不是单独使用 pySpark。不幸的是,我不知道该怎么做。我可以单独计算每一列,但不能一起计算。
谁能给我一些建议?
【问题讨论】:
-
你试过
df.summary()吗?
标签: apache-spark pyspark apache-spark-sql