【发布时间】:2020-09-20 05:34:15
【问题描述】:
我有点急于完成这个明天向项目所有者的演示。我们是德国的一小群经济系学生,他们试图用 Python 搞清楚机器学习。我们设置了一个随机森林分类器,并迫切希望在一个整洁的图中向估计器显示重要特征。通过应用谷歌搜索,我们提出了以下解决方案,这种解决方案可以解决问题,但由于 y 轴上的标签重叠,我们并不满意。我们使用的代码如下所示:
feature_importances = clf.best_estimator_.feature_importances_
feature_importances = 100 * (feature_importances / feature_importances.max())
sorted_idx = np.argsort(feature_importances)
pos = np.arange(sorted_idx.shape[0])
plt.barh(pos, feature_importances[sorted_idx], align='center', height=0.8)
plt.yticks(pos, df_year_four.columns[sorted_idx])
plt.show()
由于隐私,让我这样说:y 轴上的特征名称是重叠的(大约有 30 个)。我正在查看 matplotlib 的文档以了解如何自己执行此操作,不幸的是我找不到任何有用的东西。似乎训练和测试模型比理解 matplotlib 和创建绘图更容易:D
非常感谢您的帮助和抽出时间,我很感激。
【问题讨论】:
标签: python-3.x matplotlib machine-learning random-forest scrum