【发布时间】:2014-08-07 09:51:25
【问题描述】:
我必须在一个项目中处理一些非常大的数据文件,这些文件非常大,每个大小> 50G。这些文件的格式各不相同:
type1 vaue1:123
type2 vaue1:234
type2 vaue1:234
type1 vaue1:234
type3 vaue1:234
.......
我想找出一个特定类型的数量并计算该类型的平均值和中值。 我用python一个一个的读取数据文件,最后计算,但是这样很慢。我想使用 R 来帮助我,但我想知道 R 是否可以处理这些大尺寸数据。我怀疑 R 是否可以将这些数据读入数据框。
如果有人知道使用 R 或其他工具处理大型数据的技巧。我现在真的需要一些建议!
【问题讨论】:
-
“我真的需要一些建议” 对 SO 来说不是一个合适的问题(或者,就此而言,根本不是一个问题)。互联网上其他地方有很多资源可以使用 R 处理“大数据”,我建议你做一些研究。
-
建议:python应该没问题,你不需要搬到R。
标签: python r statistics bigdata