【发布时间】:2015-07-05 23:37:19
【问题描述】:
我目前正在 Python 中使用 Spark 开发应用程序。我有一个酒店数据集如下: ID、酒店名称、地址、....、经度、纬度
我想为每家酒店计算附近的前 5 家酒店。
在 Spark 中可以这样做吗?我不知道我是否可以将我的 RDD 与我的数据集并行化,然后用整个数据集计算每一行。
所以这是我尝试过的: test = booking_data.cartesian(booking_data).map(lambda ((x1, y1),(x2,y2)): distanceBetweenTwoPoints)
distanceBetweenTwoPoints 是我的函数,它计算两个点并采用四个参数。
显示的错误是:ValueError: too many values to unpack
【问题讨论】:
-
完全有可能。试一试。
-
不确定我是否理解这个问题。您可以按距离 .filter 数据集,然后执行 .top
-
抱歉评论不完整:“试一试……如果不起作用,请向我们展示一些代码以提供帮助”
-
我会尽快做的。感谢您的帮助
-
这不是 Spark 问题,而是 Python 问题。您需要向我们提供更多代码,并告诉我们错误发生的确切位置。
标签: python apache-spark