【发布时间】:2022-04-26 02:58:43
【问题描述】:
我正在学习如何处理大型数据集,所以我使用 modin.pandas。
我正在做一些聚合,之后 50GB 数据集的大小有望接近 5GB - 现在我需要检查:如果 df 小到足以放入 RAM,我想将其转换为 pandas 和享受无错误的可靠库。
所以,自然而然,问题是:如何检查它? .memory_usage(deep=True).sum() 告诉我整个 df 使用了多少,但我不可能从那个数字中知道它有多少在 RAM 中,有多少在交换中 - 换句话说,我需要多少空间来投射 df给熊猫。还有其他方法吗?我是否可以假设某些分区位于 RAM 中而其他分区位于交换中?当我调用._to_pandas() 时,如何计算有多少数据会涌入 RAM?是否有某种隐藏的.__memory_usage_in_swap_that_needs_to_fit_in_ram()?