【问题标题】:Linear regression to impute missing values pandas python用于估算缺失值的线性回归 pandas python
【发布时间】:2021-05-19 08:32:38
【问题描述】:

我正在尝试对分类变量使用线性回归方法。 因此,我认为最好使用基于虚拟的方法。 我知道我的数据集的delivery_cost 列中存在一些缺失值。通过is.null()发现有17个值缺失。

我知道送货成本呈线性关系(每个分店的方式不同,例如 Sunshine、Footscray 等)

  • 已经通过 store_id 列,离散变量对分支进行了虚拟化处理
  • dist_to_nearest_storehouse 是一个连续变量
  • seasons 是一个离散变量(因此季节 Summer、Spring、Winter、Autumn 将被视为虚拟变量)

我还需要小心,因为 isLoyaltyProgram(0 - 不属于忠诚度,1 - 属于忠诚度)delivery_cost 折扣 10%

我首先想知道使用线性回归是否是找到缺失值的正确方法。

我目前正在使用 pandas 读取可以在文本文件中找到的 csv 文件 https://paste.pythondiscord.com/raw/uvadaroyoj

如果有人能给我一些关于背后代码的指导,我很乐意阅读它。

谢谢。

【问题讨论】:

  • 欢迎任何帮助!
  • 请随时发表评论,以便我可以编辑问题以更清晰

标签: python pandas dataframe linear-regression categorical-data


【解决方案1】:

据我了解,您正在尝试根据其他变量(dist_to_nearest_storehouse、season、isLoyaltyProgram)来预测缺失值。所以你使用什么模型取决于你的数据和你的假设:如果你认为所有变量都与 y 具有线性关系,那么你可以使用线性回归,如果不是,你可以使用可以拟合非线性数据的模型(SVM ,决策树,神经网络)。但就我个人而言,对于 17 个缺失值,如果它们不是我样本量的很大一部分,我会丢弃它们。

【讨论】:

  • 是的,这是正确的,我想知道我是否可以使用这个heartbeat.fritz.ai/…
  • 是的,我相信你能做到。
  • 既然我知道 isLoyaltyProgram 决定是否应用折扣,我是否应该不将其包含在我的功能中?
  • 抱歉我的问题重新表述了,如果客户有忠诚度,他们会获得 10% 的运费折扣 ^ 我知道这是真的,我是否应该不将其包含在功能中
  • 我相信您应该这样做,因为“忠诚度计划”功能会影响运费。如果您认为他们有关系,则应将其包含在您的功能中。
猜你喜欢
  • 2019-03-26
  • 2017-10-21
  • 1970-01-01
  • 2022-11-11
  • 2019-05-19
  • 2019-02-01
  • 2020-08-28
  • 2019-08-31
  • 1970-01-01
相关资源
最近更新 更多