【发布时间】:2018-10-13 07:42:36
【问题描述】:
我正在使用 spark 流 (scala) 并在每 20 分钟后通过 kafka 接收客户呼叫呼叫中心的记录。这些记录在 rdd 和更高版本的数据帧中转换以利用 spark sql。我有一个业务用例,我想识别在过去两个小时内打电话超过 3 次的所有客户。
最好的方法是什么?我是否应该继续在配置单元表中插入每批收到的所有记录并运行单独的脚本来继续查询谁在过去两个小时内进行了 3 次调用,或者还有另一个更好地使用 spark 的内存功能?
谢谢。
【问题讨论】:
标签: scala apache-spark apache-spark-sql spark-dataframe spark-streaming