【发布时间】:2013-12-12 21:49:46
【问题描述】:
我有一个驻留在 Apache Cassandra 中的数据,我想使用 hadoop 生态系统工具执行 map/reduce 作业。
如何将数据从 Cassandra 加载到 HDFS?
除了Cassandra storage handler/brisk之外还有其他的storage handler吗?
【问题讨论】:
标签: hadoop cassandra hive apache-pig hdfs
我有一个驻留在 Apache Cassandra 中的数据,我想使用 hadoop 生态系统工具执行 map/reduce 作业。
如何将数据从 Cassandra 加载到 HDFS?
除了Cassandra storage handler/brisk之外还有其他的storage handler吗?
【问题讨论】:
标签: hadoop cassandra hive apache-pig hdfs
Netflix 有一个名为 Aegisthus 的新工具试图解决这个问题。
Cassandra 外的批量数据管道。 Aegisthus 实现了一个阅读器 对于 SSTable 格式,并提供了一个 map/reduce 程序来创建一个 列族中包含的数据的压缩快照。
【讨论】:
考虑查看这个项目pygmalion。这将允许您将数据从 Cassandra 导出到 HDFS,然后使用 Pig latin 进行查询。
【讨论】:
您可以通过多种方式做到这一点。编写一个 MapReduce 作业以从 Cassandra 读取数据并将其写入 HDFS 或编写一个 PigLatin 脚本来执行此操作。请参阅 this 了解更多信息。
【讨论】: