【发布时间】:2018-10-24 07:52:15
【问题描述】:
我已经在 Pandas 中尝试过以下方法,它可以工作。我想知道如何在 PySpark 中做到这一点?
输入是
news.bbc.co.uk
它应该在'.'处拆分它因此索引应该等于:
[['news', 'bbc', 'co', 'uk'], ['next', 'domain', 'name']]
index = df2.domain.str.split('.').tolist()
有谁知道我会如何在 spark 而不是 pandas 中做到这一点?
谢谢
【问题讨论】:
标签: python-3.x apache-spark pyspark