【发布时间】:2021-09-19 08:38:41
【问题描述】:
我想在不使用“explode”或“UDF”的情况下检查数组列的值是否等于“A”,因为它使我的 DataFrame 非常大并且过程非常缓慢。
所以我有这个
+-----+----+--------------------+---------+
| Name| Age| Subjects| Grades|
+-----+----+--------------------+---------+
|[Bob]|[16]|[Maths, Physics, ...|[A, B, C]|
+-----+----+--------------------+---------+
我想要这个
+-----+----+--------------------+---------+--------------------+
| Name| Age| Subjects| Grades| test |
+-----+----+--------------------+---------+--------------------+
|[Bob]|[16]|[Maths, Physics, ...|[A, B, C]|[true, false, false]|
+-----+----+--------------------+---------+--------------------+
任何解决方案?
提前致谢。
【问题讨论】:
标签: python apache-spark pyspark user-defined-functions explode