【发布时间】:2019-04-01 12:51:39
【问题描述】:
我对 spark(和编程)非常陌生,因此,如果您能帮助我了解这两个输出之间的区别,那就太好了。
map()
>>> data = ['1', '2', '3', '4', '5', 'one', 'two']
>>> distData = sc.parallelize(data)
>>> maping = distData.map(lambda x: x.split())
>>> maping.collect()
[['1'], ['2'], ['3'], ['4'], ['5'], ['one'], ['two']]
>>> for i in maping.take(100): print(i)
...
['1']
['2']
['3']
['4']
['5']
['one']
['two']
FlatMap()
>>> maping = distData.flatMap(lambda x: x.split())
>>> maping.collect()
['1', '2', '3', '4', '5', 'one', 'two']
>>> for i in maping.take(100): print(i)
...
1
2
3
4
5
one
two
【问题讨论】:
-
副本在 Scsala,而不是 pyspark。
标签: apache-spark pyspark