【问题标题】:Tree-Based dimensionality reduction in DNN algorithmsDNN 算法中基于树的降维
【发布时间】:2020-11-07 12:01:13
【问题描述】:

我的问题很简单:在使用 DNN 算法训练数据集之前,是否可以使用基于树的降维,例如嵌入在随机森林中的特征重要性?

换句话说,使用基于树的特征重要性是否会阻止使用不同于树/随机森林的训练算法?

【问题讨论】:

    标签: neural-network random-forest feature-selection


    【解决方案1】:

    我认为你应该阅读DNN 文章。

    为什么?为什么要在 DNN 训练之前使用随机森林?

    是的,您可以使用显示random-forest的特征重要性

    random_forest = RandomForestClassifier(random_state=42).fit(x_train, y_train)
    
    feature_importances = DataFrame(random_forest.feature_importances_,
                                    index = x_train.columns,
                                    columns=['importance']).sort_values('importance', 
                                                                     ascending=False)
        
    print(feature_importances)
    

    但这是一个feature-extraction 方法。 DNN 是一个neural-network 方法。

    DNN 比random-forest 更复杂,而random-forest 处理feature-extraction,DNN 处理

    • feature-extraction,
    • back-propagation,
    • feed-forward 方法。

    如果您为 DNN 提供足够的训练样本,您将获得更高的准确度。

    • 使用基于树的特征重要性会阻止使用训练算法吗?

    不,根据问题,足够的特征大小和样本会有所不同。通常,您不会使用random-forest 来提取 1M 图像的特征重要性。

    此外,您不会将 DNN 用于小型数据集。

    【讨论】:

      猜你喜欢
      • 2016-03-16
      • 1970-01-01
      • 2018-05-26
      • 2015-05-18
      • 1970-01-01
      • 2012-03-27
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多