【发布时间】:2019-03-28 03:09:18
【问题描述】:
因此,我希望将解释变量空气质量和吸烟状况以及吸烟状况平方作为线性回归的一部分。所以我可以通过在我正在读取的 .csv 文件中添加值来轻松解决这个问题,但我想使用 python 来操作它。有没有办法通过平方和利用多线回归的一部分来操纵吸烟状态?我的 csv 文件只有 3 列,包括空气质量、吸烟状况和哮喘。
x = df[['Air_quality', 'Smoking_Status']]
y = df['Asthma_Death_Rate']
x = sm.add_constant(x)
est = sm.OLS(y,x).fit()
【问题讨论】:
-
类似
for col in df: df[col+"_squared"] = df[col]*df[col]? -
smoking_status是什么类型的数据,代表什么?我假设它是分类的,即有人吸烟或不吸烟。在这种情况下,平方并没有真正的意义...... -
顺便说一句,但
sm.add_constant对于大数据来说速度非常慢。使用x['const'] = 1更容易自己添加
标签: python pandas numpy regression