【发布时间】:2017-03-16 06:48:00
【问题描述】:
我有一个纯分类数据集,类别权重非常不平衡 (1:99)。
我想训练一个模型,该模型将为每个特征和所述特征的值计算它对预测的重要性。所以本质上是生成一个类似字典的对象:
vocabulary = {
'user=12345': 0,
'user=67890': 1,
'age=30': 2,
'age=40': 3,
'geo=UK': 4,
'geo=DE': 5,
'geo=US': 6,
'geo=BR': 7}
然后给它一个重要性权重:
weights = [.1, .2, .15, .25, .1, .1, .2, .2]
我应该使用什么基于 python 的机器学习库,以及库中允许我提取上述输出的算法的哪些建议。
我试过了; tensorflow 线性回归器,scikit 学习线性回归器和 graphlab 增强树。增强树似乎最有希望,但如果可能的话,我想使用开源库。
提前非常感谢大家!
更新:
GradientBoostingClassifier 产生 0.999137901985 分数,因为不平衡类。
【问题讨论】:
标签: python machine-learning scikit-learn gradient-descent