【发布时间】:2014-03-29 09:31:23
【问题描述】:
我每周要登录数百万个小型日志文档:
- 数据挖掘的即席查询
- 连接、比较、过滤和计算值
- 使用 python 进行许多全文搜索
- 每天对数以百万计的文档运行此操作
我的第一个想法是将所有文档放入 HBase/HDFS 并运行 Hadoop 作业以生成统计结果。
问题是:某些结果必须接近实时。
所以,经过一些研究,我发现了 ElasticSearch,现在我正在考虑传输所有数百万个文档并使用 DSL 查询来生成统计结果。
这是个好主意吗? ElasticSearch 似乎很容易处理数百万/数十亿的文档。
【问题讨论】:
标签: hadoop elasticsearch hbase hdfs bigdata