【问题标题】:sklearn pipeline transform ValueError that Expected Value is not equal to Trained Valuesklearn管道转换ValueError,期望值不等于训练值
【发布时间】:2020-07-15 12:20:12
【问题描述】:

您能否帮我解决以下出现 ValueError 错误的函数:使用剩余关键字时,列顺序必须相等,以便拟合和变换

(该函数在我保存在 GCP 存储中的腌制 sklearn 管道上调用。)

错误:

---------------------------------------------------------------------------
ValueError                                Traceback (most recent call last)
<ipython-input-192-c6a8bc0ab221> in <module>
----> 1 safety_project_lite(request)

<ipython-input-190-24c565131f14> in safety_project_lite(request)
     31 
     32     df_resp = pd.DataFrame(data=request_data)
---> 33     response = loaded_model.predict(df_resp)
     34 
     35     output = {"Safety Rating": response[0]}

~/.local/lib/python3.5/site-packages/sklearn/utils/metaestimators.py in <lambda>(*args, **kwargs)
    114 
    115         # lambda, but not partial, allows help() to work with update_wrapper
--> 116         out = lambda *args, **kwargs: self.fn(obj, *args, **kwargs)
    117         # update the docstring of the returned function
    118         update_wrapper(out, self.fn)

~/.local/lib/python3.5/site-packages/sklearn/pipeline.py in predict(self, X, **predict_params)
    417         Xt = X
    418         for _, name, transform in self._iter(with_final=False):
--> 419             Xt = transform.transform(Xt)
    420         return self.steps[-1][-1].predict(Xt, **predict_params)
    421 

~/.local/lib/python3.5/site-packages/sklearn/compose/_column_transformer.py in transform(self, X)
    581             if (n_cols_transform >= n_cols_fit and
    582                     any(X.columns[:n_cols_fit] != self._df_columns)):
--> 583                 raise ValueError('Column ordering must be equal for fit '
    584                                  'and for transform when using the '
    585                                  'remainder keyword')

ValueError: Column ordering must be equal for fit and for transform when using the remainder keyword

代码:

def safety_project_lite_beta(request):
   client = storage.Client(request.GCP_Project)
   bucket = client.get_bucket(request.GCP_Bucket)
   blob = bucket.blob(request.GCP_Path)
   model_file = BytesIO()
   blob.download_to_file(model_file)
   loaded_model = pickle.loads(model_file.getvalue())

   request_data = {'A': [request.A],
   'B': [request.B],
   'C': [request.C],
   'D': [request.D],
   'E': [request.E],
   'F': [request.F]}

   df_resp = pd.DataFrame(data=request_data)
   response = loaded_model.predict(df_resp)

   output = {"Rating": response[0]}

   return output

【问题讨论】:

  • 你用什么来训练模型?它也是一个数据框吗?可以X_train.describe()吗?
  • 嗨,感谢您的回复,我可以摆脱 df_resp = pd.DataFrame(data=request_data, columns = 'A','B','C'...),只是想知道是否有更好的方法来缓解这个问题。 X_train.describe() 给了我数据框。就我用来训练模型的内容而言,与之前的链接 stackoverflow.com/questions/61001934/… 相同,但我没有在函数中进行所有训练,而是从 GCP 调用 .pkl,这是我从训练模型中保存的。
  • 请让你的标题没有“Python 函数”那么宽泛。本例中具体包为sklearn,对象为Pipeline,具体方法为transform()。而且该错误与 GCP 的酸洗无关。

标签: python scikit-learn data-science


【解决方案1】:

该模型只能预测您提供给它的数据是否与已训练过的数据具有相同的结构。

要强制df_respX_train 具有相同的列,请在构建数据框时传递其列的列表:

df_resp = pd.DataFrame(request_data, columns=X_train.columns)

如果该变量由于某种原因不可用,您可以腌制其列列表 (X_train.columns) 并稍后使用:

loaded_cols = pickle.loads([...])
df_resp = pd.DataFrame(data=request_data, columns=loaded_cols)

这确保了更动态的工作流程,例如,您可以更轻松地添加列。

【讨论】:

  • 感谢以上解释!
猜你喜欢
  • 1970-01-01
  • 2017-11-10
  • 2021-08-01
  • 2022-06-28
  • 1970-01-01
  • 2021-06-16
  • 1970-01-01
  • 2020-12-20
  • 2018-03-24
相关资源
最近更新 更多