【发布时间】:2018-06-22 16:50:28
【问题描述】:
我基本上有一个大型(多 TB)文本数据集(它是 JSON 格式,但我可以将其更改为 dict 或数据帧)。它有多个键,例如“组”和“用户”。
现在我通过阅读这些键的整个文本来过滤数据。拥有一个我过滤和只读密钥的结构会更有效率。
如果它适合内存,那么执行上述操作将是微不足道的,我可以使用标准的 dict/pandas 方法和哈希表。但它不适合内存。
为此必须有一个现成的系统。谁能推荐一个?
有关于这个的讨论,但一些更好的已经过时了。我正在寻找最简单的现成解决方案。
【问题讨论】:
-
找到了这个看起来不错的线程,但它已经有 5 年历史了,我不确定哪种解决方案最适合我的情况。 stackoverflow.com/questions/14262433/…
-
也许创建一个 HDF5 文件(h5py 或 pytables)会有所帮助?