【发布时间】:2016-11-30 18:13:03
【问题描述】:
我们每天都从应用程序获取新文件,以 csv 的形式存储在 Windows 服务器中,例如 c:/program files(x86)/webapps/apachetomcat/.csv 每个文件中都有不同的数据,所以有任何 hadoop将文件从 Windows 服务器传输到 hadoop hdfs 的组件,我遇到了水槽,kafka 但没有得到正确的例子,任何人都可以在这里遮光。
所以每个文件都有单独的名称,大小可达 10-20mb,每日文件数超过 200 个文件,一旦文件添加到 windows 服务器,flume/kafka 应该能够将这些文件放入 hadoop,以后的文件是从spark处理的HDFS导入并移动到处理后的文件到HDFS中的另一个文件夹
【问题讨论】:
-
请提供更多详细信息,文件大小?您希望如何处理这些数据?
标签: ubuntu hadoop apache-kafka flume