【发布时间】:2015-12-13 00:39:11
【问题描述】:
我们有一个应用程序服务器和 3 个节点 Cassandra 集群的工作应用程序。最近我们有了将大型 CSV 文件导入现有数据库的新要求。 CSV 中的行需要在保存到 Cassandra 之前进行转换。我们的基础设施部署在 Amazon AWS 中。
有几个问题:
- 在我们看来,Spark 是适合这项工作的工具,因为它有 Spark Cassandra Connector 和 Spark CSV plugin。我们是对的吗?
- 也许是一个新手 Spark 问题,但在我们的部署场景中,应该在哪里部署导入程序应用程序?我们的想法是在其中一个数据库节点上拥有 Spark Master,Spark 工作人员分布在 3 个数据库节点上,而 importer 应用程序则在 master 所在的同一节点上。最好有一些命令行界面来导入 CSV,以后可以演变为 API/Web 界面。
- 我们可以将导入器应用程序放在应用程序服务器上吗?网络损失会是多少?
- 在这种情况下,我们能否将 Spark 用于 Cassandra JOINS?如果需要,我们如何集成到已经使用常规 Datastax Java 驱动程序以及应用程序连接的现有应用程序中
【问题讨论】:
标签: csv cassandra apache-spark datastax