【发布时间】:2018-04-17 06:18:35
【问题描述】:
我找到了 2 种方法来替换 python 中的 nan 值, 一个使用 sklearn 的 imputer 类,另一个使用 df.fillnan() 后者似乎很容易用更少的代码。 但效率方面哪个更好。 任何人都可以解释每个的用例吗?
【问题讨论】:
-
这里要考虑的是你想如何填充未知值。你想用一些随机的固定数字填充它,然后使用
fillna()。否则你想用平均值和中位数填充它,那么你需要考虑你想要填充、训练数据、测试或完整数据的平均值或中位数。根据您的选择,您可能会得到不同的结果。
标签: python pandas dataframe scikit-learn