【发布时间】:2022-01-21 15:54:45
【问题描述】:
这里的幼稚问题:假设我有一个数据框,分为df1 和df2。
现在,df1 由以下变量组成:
| categ_var_1 | categ_var_2 | binary_target |
|---|---|---|
| A | 1 | 1 |
| B | 1 | 1 |
| C | 4 | 0 |
| B | 5 | 0 |
| B | 5 | 1 |
| ... | ... | ... |
目标:我想用df1来填补df2中缺失的那一列,它具有相同的分类变量(不同的数据),但是binary_target完全失踪:
| categ_var_1 | categ_var_2 |
|---|---|
| F | 3 |
| B | 2 |
| A | 5 |
| A | 5 |
| B | 1 |
| ... | ... |
以简单的方式解决此问题的最佳方法是什么?
我的第一个猜测是使用机器学习模型(使用分类变量作为预测变量),但我无法对比结果,因为df2 没有目标变量。
我的第二个猜测是合并两个集合并进行列插补,尽管最终结果并不准确。
你怎么看?任何帮助将不胜感激! (唯一的限制是使用 Python!)
【问题讨论】:
-
你能显示一个简单的df2吗?
-
df2 = pd.DataFrame({ 'city':['Lehi', 'Boston', 'Denver', 'San Francisco', 'Atlanta'], 'population_thousands':[50-100 , 1-50, 100-300, 1-50]})
标签: python pandas dataframe data-science analytics