【发布时间】:2015-10-06 00:21:57
【问题描述】:
所以我正在开发一个预计会处理大量数据的应用程序,因此我决定使用 Hadoop 来处理它。
我的服务节点和数据节点与 webapp 是分开的,所以我使用 HttpFS 将应用程序与 Hadoop 进行通信。
那么,每当在我的应用程序中生成新的 行 数据时,我是否应该已经调用相应的 HttpFS URL 来将数据附加到 HDFS 文件中?我是否应该将这些数据写入网络服务器中的文件并使用 cronjob 将其上传到 HDFS,例如每小时? 我应该更新 Hive 表,还是应该在需要查询时只在其中加载数据?
我对 Hadoop 还很陌生,所以任何可以提供帮助的链接也会很有用。
【问题讨论】: