【发布时间】:2017-03-30 04:52:18
【问题描述】:
我正在将 Spark 数据帧加载到 H2O(使用 Python)中以构建机器学习模型。有人建议我分配一个具有 2-4 倍 RAM 的 H2O 集群,该 RAM 与我将要训练的框架一样大,这样分析就可以轻松地适应内存。但我不知道如何精确估计 H2O 框架的大小。
所以假设我已经将一个 H2O 框架加载到 Python 中,我如何实际确定它的字节大小? 10-20% 以内的近似值即可。
【问题讨论】:
我正在将 Spark 数据帧加载到 H2O(使用 Python)中以构建机器学习模型。有人建议我分配一个具有 2-4 倍 RAM 的 H2O 集群,该 RAM 与我将要训练的框架一样大,这样分析就可以轻松地适应内存。但我不知道如何精确估计 H2O 框架的大小。
所以假设我已经将一个 H2O 框架加载到 Python 中,我如何实际确定它的字节大小? 10-20% 以内的近似值即可。
【问题讨论】:
这将显示 H2O 的键值存储中的底层表示的摘要,包括完整的字节大小:
frame.describe(chunk_summary=True)
【讨论】:
这是指磁盘上文件大小的 2-4 倍,所以与其在 Python 中查看内存,不如查看原始文件大小。此外,2-4 倍的推荐因算法而异(GLM 和 DL 将比基于树的模型需要更少的内存)。
【讨论】: