【问题标题】:Best structure for on-disk retrieval of large data using Python?使用 Python 在磁盘上检索大数据的最佳结构?
【发布时间】:2018-06-22 16:50:28
【问题描述】:

我基本上有一个大型(多 TB)文本数据集(它是 JSON 格式,但我可以将其更改为 dict 或数据帧)。它有多个键,例如“组”和“用户”。

现在我通过阅读这些键的整个文本来过滤数据。拥有一个我过滤和只读密钥的结构会更有效率。

如果它适合内存,那么执行上述操作将是微不足道的,我可以使用标准的 dict/pandas 方法和哈希表。但它不适合内存。

为此必须有一个现成的系统。谁能推荐一个?

有关于这个的讨论,但一些更好的已经过时了。我正在寻找最简单的现成解决方案。

【问题讨论】:

  • 找到了这个看起来不错的线程,但它已经有 5 年历史了,我不确定哪种解决方案最适合我的情况。 stackoverflow.com/questions/14262433/…
  • 也许创建一个 HDF5 文件(h5py 或 pytables)会有所帮助?

标签: python database hashtable


【解决方案1】:

我建议你用readlines(CHUNK)方法将你的大文件分割成多个小文件,然后你可以一个一个处理。 我与大型 Json 一起工作,一开始,该过程是 45 秒的文件,我的程序运行了 2 天,但是当我分裂它时,程序只完成了 4 小时

【讨论】:

    猜你喜欢
    • 2011-07-02
    • 2017-03-30
    • 1970-01-01
    • 2012-09-19
    • 2014-06-10
    • 2013-12-03
    • 2011-04-12
    • 2019-06-02
    • 1970-01-01
    相关资源
    最近更新 更多