【发布时间】:2015-12-02 14:35:39
【问题描述】:
我尝试在 pyspark 会话中执行以下命令:
>>> a = [1,2,3,4,5,6,7,8,9,10]
>>> da = sc.parallelize(a)
>>> da.reduce(lambda a, b: a + b)
效果很好。我得到了预期的答案(55)。现在我尝试做同样的事情,但使用 numpy 数组而不是 Python 列表:
>>> import numpy
>>> a = numpy.array([1,2,3,4,5,6,7,8,9,10])
>>> da = sc.parallelize(a)
>>> da.reduce(lambda a, b: a + b)
结果我得到了很多错误。更具体地说,我在错误消息中多次看到以下错误:
ImportError: No module named numpy.core.multiarray
是不是我的集群没有安装某些东西,或者 pyspark 无法在基本层面上使用 numpy 数组?
【问题讨论】:
-
看起来像是配置(版本不匹配?)问题,否则应该可以正常工作。
-
这里说支持 numpy:link 它在 Python 选项卡下提供了一些信息。
标签: python numpy apache-spark pyspark