【发布时间】:2019-10-15 01:08:13
【问题描述】:
我的问题是必须在“Mapped_Project_ID”中搜索“Employee_ID”的第一次出现,需要从第一次匹配的出现中选择数组中的值直到最后一个值
我有一个如下数据框:
Employee_Name|Employee_ID|Mapped_Project_ID
Name1|E101|[E101, E102, E103]
Name2|E102|[E101, E102, E103]
Name3|E103|[E101, E102, E103, E104, E105]
我想要输出 df,如下所示:
Employee_Name|Employee_ID|Mapped_Project_ID
Name1|E101|[E101, E102, E103]
Name2|E102|[E102, E103]
Name3|E103|[E103, E104, E105]
不确定,如何实现。
有人可以在不需要任何 UDF 的情况下提供有关此问题或逻辑以在 spark 中处理此问题的帮助吗?
【问题讨论】:
-
Edit 你的问题包括你的 DataFrame (
df.printSchema()) 的架构。
标签: apache-spark pyspark