【发布时间】:2014-06-12 02:58:30
【问题描述】:
这是一个菜鸟问题
我有一个 hadoop 设置并考虑使用 Giraph 或 Hama 进行基于图形的计算。我的表单中有一个大文件
3 4 3 7 3 8 5 6
其中每一列表示顶点,每一行表示边。对于普通程序,我将整个文件读入类似
的形式3: [4,7,8] 5:[6]
这意味着顶点 3 的边数为 4、7、8,而 5 的边数为 6。
如何处理 Hadoop 中大文件的这种情况?像这样阅读意味着将全部内容加载到 RAM 中?在 Hadoop 中最好的方法是什么?
【问题讨论】: