【发布时间】:2021-08-08 18:24:53
【问题描述】:
我的代码如下:
@pandas_udf(BooleanType())
def is_one(iterator: Iterator[pd.Series]) -> Iterator[pd.Series]:
for s in iterator:
res = re.search("1", s)
yield res != None
df = spark.createDataFrame(pd.DataFrame(["1", "2", "3"], columns=["v"]))
df.select(is_one(df.v)).show()
我收到错误:
TypeError:预期的字符串或类似字节的对象
看起来我的函数没有遍历字符串。这是为什么?我如何在 pandas_udf 中使用正则表达式函数?
我尝试了系列到系列的方法,但得到了同样的错误。
【问题讨论】:
标签: python pandas apache-spark pyspark user-defined-functions