【发布时间】:2016-10-24 16:13:05
【问题描述】:
我正在使用带有 H2O Python API 的网格搜索来构建随机森林模型。我在训练和验证中拆分数据,并使用 k-fold 交叉验证来选择网格搜索中的最佳模型。
我能够检索到训练集上MSE 最好的模型,但我想检索验证集上AUC 最高的模型。
我可以用 Python 编写所有代码,但我想知道是否有 H2O 方法来解决这个问题。关于如何做到这一点的任何建议?
【问题讨论】:
我正在使用带有 H2O Python API 的网格搜索来构建随机森林模型。我在训练和验证中拆分数据,并使用 k-fold 交叉验证来选择网格搜索中的最佳模型。
我能够检索到训练集上MSE 最好的模型,但我想检索验证集上AUC 最高的模型。
我可以用 Python 编写所有代码,但我想知道是否有 H2O 方法来解决这个问题。关于如何做到这一点的任何建议?
【问题讨论】:
如果g 是您的网格对象,那么:
g.sort_by('auc', False);
将为您提供 AUC 订购的型号。 False 的第二个参数意味着最高的 AUC 将是第一个。它返回一个H2OTwoDimTable 对象,因此您可以通过这种方式选择第一个模型(最佳模型,根据 AUC)。
我认为应该根据验证集的分数进行排序,而不是训练集。但是,您可以使用以下命令明确指定它:
g.sort_by('auc(valid=True)', False);
【讨论】: