【发布时间】:2015-08-16 00:06:07
【问题描述】:
我对集成 Cassandra 和 Hadoop 感兴趣,更准确地说,是使用 Cassandra 作为 Hadoop 作业的输入。每个 Cassandra 节点也是一个 Hadoop 节点。
我发现这些教程 1 和 2 在某种程度上解释了集成。我是 Cassandra 的新手,所以我还在搞清楚一些事情。
我的问题是 - 我是否总是需要使用整个 ColumnFamily(表)作为 MapReduce 作业的输入,或者有没有办法指定你想要的行(至少通过键)?
如果使用整个 ColumnFamily,正确的方法是仅从 Mapper 中发出满足某些条件的行吗?还是有更好的办法?
【问题讨论】: