【发布时间】:2020-01-28 00:16:48
【问题描述】:
我初始化了一个 pyspark sc。
instance = (data
.filter(lambda x: len(x) != 0 )
.filter(lambda x: ('%auth%login%' not in url)
.map(lambda x: function(x))
.reduceByKey(lambda x, y: x + y)
我的目标是过滤掉任何同时包含 auth 和 login 关键字的网址,但它们可能位于字符串的任何位置。
在 sql 中我可以使用 %auth%login%,% 表示任意长度的字符串。
如何在 pyspark 语法中轻松做到这一点?
忘了说,有'auth'页面我不想过滤掉,我只想在login也在字符串中的时候过滤掉auth
我不知道为什么这被标记为 dups,这是 RDD 而不是数据帧
【问题讨论】:
标签: regex apache-spark pyspark rdd