【问题标题】:Python Dataframe: Calculating R^2 and RMSE Using Groupby on One ColumnPython Dataframe:在一列上使用 Groupby 计算 R^2 和 RMSE
【发布时间】:2018-06-03 12:13:11
【问题描述】:

我有以下 Python 数据框:

Type    Actual  Predicted
A       4       3
A       10      18
A       13      11
B       3       10
B       4       2
B       8       33
C       20      17
C       40      33
C       87      80
C       32      30

我有计算 R^2 和 RMSE 的代码,但我不知道如何通过不同的“类型”来计算它。

目前,我的方法是将较大的表格分成三个较小的表格,其中仅包含 A、B、C 值,然后从每个较小的表格中计算 R^2 和 RMSE……然后将它们重新附加在一起。

但上述方法效率低下,我相信应该有更简单的方法?

以下是我希望在分组时产生的结果格式:

Type    R^2     RMSE    
A       value   value   
B       value   value   
C       value   value   

【问题讨论】:

  • 进行分组并将公式作为函数应用到列中
  • 您是否介意将您拥有的 r^2 和 RMSE 公式提供给我们,以便我们进行测试?我(也许还有其他人)的统计课已经有一段时间了

标签: python dataframe pandas-groupby


【解决方案1】:

这是一个groupby 方法:

import numpy as np
import pandas as pd
from sklearn.metrics import r2_score, mean_squared_error

def r2_rmse( g ):
    r2 = r2_score( g['Actual'], g['Predicted'] )
    rmse = np.sqrt( mean_squared_error( g['Actual'], g['Predicted'] ) )
    return pd.Series( dict(  r2 = r2, rmse = rmse ) )

your_df.groupby( 'Type' ).apply( r2_rmse ).reset_index()

【讨论】:

  • 这太棒了!谢谢....有关如何为置信区间执行此操作的任何提示?
  • return 语句可以修改为return pd.Series({'r2':r2, 'rmse':rmse})
猜你喜欢
  • 2018-06-03
  • 2021-12-30
  • 1970-01-01
  • 2019-09-08
  • 2015-10-26
  • 1970-01-01
  • 2016-06-25
  • 1970-01-01
  • 2021-05-24
相关资源
最近更新 更多