【发布时间】:2019-10-23 11:04:59
【问题描述】:
我正在处理这个 PySpark 项目,当我尝试计算某些东西时,我收到以下错误:
TypeError: int() 参数必须是字符串或数字,而不是“列”
我尝试按照another post 的解决方案解决这个问题,但对我来说没有效果。无论如何,请在下面找到我的代码。我对 PySpark 还很陌生,因此我很想向社区寻求帮助。
import datetime
from dateutil.relativedelta import relativedelta
start_month =(
df
.select('client_id')
.withColumn("acquisition_month",
(datetime.datetime.today() - relativedelta(months = (df['months_since_act']).cast("integer")))
)
)
【问题讨论】:
-
你确定这是你的全部代码吗?因为这里没有
int的电话! -
这不是整个代码,它只是 Jupyter 中的一个单元格。调用 int 是什么意思?
-
嗯...如果不是整个代码,甚至不是整个相关代码,甚至不是发生错误的行,我们应该如何帮助您?
-
这是相关代码,错误出现在最后一行
-
具体发生在哪里?
标签: apache-spark pyspark apache-spark-sql jupyter-notebook data-analysis