【发布时间】:2017-04-22 19:05:21
【问题描述】:
我试图使用 R 对大型 (2.7 GB) JSON 数据集进行一些探索性分析,但是,该文件甚至没有首先加载。在寻找解决方案时,我发现我可以以较小的块处理数据,即通过迭代较大的文件或对其进行下采样。但我不太确定如何使用 JSON 数据集来做到这一点。我也想过将原始 JSON 数据转换为 .csv,但在环顾四周后,该选项看起来并没有那么有用。
这里有什么想法吗?
【问题讨论】:
-
您是否尝试将整个文件加载到内存中?然后然后探索它?
-
@cricket_007 是的,我就是这么做的
-
我真的不知道 R,但我可能建议您研究一下 Apache Spark。 databricks.com/blog/2015/02/02/…
-
Pandas 应该能够读取 JSON 文件。不过没试过大文件
-
@cricket_007 谢谢!我对 SQL 的经验为零,但它看起来很有帮助。