【发布时间】:2021-04-12 02:36:18
【问题描述】:
我正在使用 pyspark 数据框。我有一个专栏words(array<string>)如下图:
+---+--------------------------------------------------------------------------------+
| id| words|
----+--------------------------------------------------------------------------------+
|012|[content, type, multipart, alternative, boundaries, nextpart, nextpart, drama,..|
|013|[received, from, am5eur02ht120, eop, eur02, prod, protection, outlook by, pro...|
|014|[data, care, much, important, information, summer, care, send, faraway, forget..|
我还有一个单词列表:
list = ["protection", "content", "received"]
我想过滤列表中具有任何值的行。
预期输出:
+---+--------------------------------------------------------------------------------+
| id| words|
----+--------------------------------------------------------------------------------+
|012|[content, type, multipart, alternative, boundaries, nextpart, nextpart, drama,..|
|013|[received, from, am5eur02ht120, eop, eur02, prod, protection, outlook by, pro...|
【问题讨论】:
标签: python apache-spark pyspark