【发布时间】:2016-11-22 20:32:05
【问题描述】:
给定一个带有列的简单表格
id(partition), timestamp(clustering column) and value(a long)
,获取每个 id 的值总和的最佳方法是什么?我会尝试在查询中选择所有不同的 id,然后使用这个 id 列表为每个 id 运行查询
SELECT sum(value) FROM mytable WHERE id = ?
不幸的是,我不知道如何编写 spark 作业,我也不确定这是最好的方法。这是我走了多远:
sc.cassandraTable("mykeyspace", "mytable")
.select("select distinct id")
.select("select sum(value)")
.where("id=?", ???)
任何关于我应该如何进行的提示将不胜感激。
编辑:这也是我目前如何进行聚合的一个工作示例:https://gist.github.com/Phil-Ba/72a7e762c8ab1ff1f3c9e8cff92cb223#file-cassandrasum-scala
虽然表现平平:/
【问题讨论】:
标签: apache-spark cassandra cql