【发布时间】:2019-06-14 02:12:17
【问题描述】:
如果数据规模庞大且不断增长,如何使用 Spark 将 Cassandra 表中的数据写入 CSV 文件?这个问题是规模问题,因为我自己的代码,没有遇到任何与基础设施相关的问题;因此,需要经过良好测试的工具和方法。同样,就速度而言,spark 是最佳选择吗?
Cassandra 中的表架构为:
c_sql = "CREATE TABLE IF NOT EXISTS {} (id varchar, version int, row varchar, row_hash varchar, PRIMARY KEY((version), id))".format(
self.table_name
)
【问题讨论】:
标签: python python-3.x csv apache-spark cassandra