【问题标题】:Caching Pandas Dataframe by Serialization or In-memory KV Store通过序列化或内存 KV 存储缓存 Pandas 数据帧
【发布时间】:2016-01-14 00:54:56
【问题描述】:

哪种缓存 pandas DataFrame 对象的方法将提供最高性能?通过使用pickle 将其存储到磁盘上的平面文件中,还是将其存储在 Redis 之类的键值存储中?

【问题讨论】:

    标签: python caching pandas redis


    【解决方案1】:

    我有大约 1 GB 纯文本数据的 DF。假设转储到磁盘总是比读取慢,我将 HDF5 写入性能与 pickle 进行了比较。 HDF5 耗时 35 秒,而 pickle 耗时 190 秒。所以,你可以考虑用 HDF5 代替 pickle

    【讨论】:

    • Wes McKinney 在最近的一次演讲中报告说 HDF5 最适合大熊猫。
    • HDF5 仍然是首选格式吗?或者现在首选Feather。链接的博客文章也是 Wes 的。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2016-07-12
    • 2017-01-18
    • 1970-01-01
    • 1970-01-01
    • 2020-05-29
    • 1970-01-01
    • 2017-07-05
    相关资源
    最近更新 更多