【发布时间】:2017-07-13 03:08:47
【问题描述】:
这被问到其他地方的不同包,但是在 Scikit Learn 中是否有一种方法可以包括所有变量或所有变量减去某个指定的数字,就像在 R 中一样?
举个例子来说明我的意思,假设我有一个回归 y = x1 + x2 + x3 + x4。在 R 中,我可以通过运行来评估这个回归:
result = lm(y ~ ., data=DF)
summary(result)
我不得不想象在 Python 中有一种类似的方法来压缩公式,因为为更大的数据集写出所有变量会有点愚蠢。
【问题讨论】:
-
我不相信,这里有一个sklearn的例子here
-
@lmo 我将其标记为两者,因为我认为 R 用户和 Scikit 用户之间可能存在重叠。
-
@114 你到底在做什么?你能举个玩具的例子吗?
-
@juanpa.arrivillaga 我现在实际上没有遇到上述问题的数据集,但我可以很容易地想象一个具有 20000 行和 200 个特征的 csv,其中输入每个变量名称会非常乏味。我想在 Python 中做到这一点的方法是使用 pandas 来获取一个使用类似
list(my_dataframe.columns.values)的列表并以某种方式将其输入到模型中? -
没有。你使用
my_dataframe.valuesSklearn 通常期望某种numpy矩阵。再一次,给我一个你在做什么的例子,因为我用过 R 和sklearn,而且我从来没有真正错过 R 的“公式”。我认为statsmodels. If you like formulas, for regression, you can use [statsmodels`](statsmodels.sourceforge.net/0.6.0/examples/notebooks/generated/…)
标签: python r machine-learning scikit-learn